• Saturn протестировала ChatGPT, Claude, Copilot, Grok и Gemini по финансовым вопросам.
  • В сложных запросах 88% ответов были ошибочными.
  • Чатботы часто дают неправильные ответы о налогах и пенсиях.

Исследование технологической компании Saturn показало, что популярные чатботы часто дают неправильные ответы на финансовые вопросы, пишет FT. В рамках тестирования ИИ-моделей ChatGPT, Claude, Copilot, Grok и Gemini они ошибались в среднем в 57% случаев, а при более сложных запросах с несколькими расчетами — в 88%. 

Результаты привлекают внимание к рискам использования генеративного ИИ для налоговых, пенсионных и инвестиционных решений, где ошибка может привести к реальным финансовым потерям.

ИИ ошибался в 88% сложных финансовых запросов

Исследователи проверили более 100 различных вопросов, связанных с деньгами, используя бесплатные и платные версии моделей. В целом 18 моделей получили более 10 000 запросов, причем каждый вопрос могли повторять до пяти раз.

  • ошибки в финансовых расчетах;
  • игнорирование будущих изменений налогового законодательства;
  • выдуманные правила;
  • неправильные ответы на сложные запросы с несколькими вычислениями.

У некоторых моделей доля ошибок в сложных вопросах достигала 99%. Лучший результат показала Claude Opus 5 в режиме «рассуждения», однако даже эта модель ошибалась в 39% ответов.

Генеральный директор Saturn Амал Джолли заявил, что масштабы использования ИИ для финансовых советов создают дополнительные риски.

«Миллионы людей доверяют моделям ИИ финансовые советы, но получают неправильные ответы, из-за которых могут потерять деньги», — сказал он.

Ошибки ИИ могут стоить тысячи фунтов

Одним из примеров стал запрос к бесплатной модели Claude Haiku 4.5 относительно налогообложения пенсий. По данным исследования, ее ошибка могла привести к начислению пенсионному вкладчику сбора HMRC в размере 17 500 фунтов стерлингов (около $23 430).

В другом случае Claude «придумал правило» относительно студенческих кредитов и заявил, что выпускник может прекратить выплаты, если переедет за границу.

Платные модели в целом отвечали точнее, чем бесплатные, а более новые версии демонстрировали лучшие результаты. В то же время Сара Коулз, руководитель направления персональных финансов инвестиционной платформы AJ Bell, отметила, что ИИ все еще может быть полезным для составления бюджета и поиска информации.

«Это хороший пример того, почему людям, которые нуждаются в поддержке, нужен профессиональный совет, а не доверие к ИИ», — сказала она.

Результаты также согласуются с недавним исследованием британского Управления по финансовому надзору (FCA), согласно которому каждый пятый взрослый в Великобритании готов позволить ИИ принимать финансовые решения вместо него. Наибольший интерес наблюдается в сложных сферах, в частности долгах, пенсиях и инвестициях.

По словам Джолли, финансовые советы от ИИ в настоящее время не регулируются, поэтому пользователи не имеют такого же уровня защиты и компенсаций, как в случае обращения к специалисту-человеку.

Напомним, что недавно OpenAI запустила ChatGPT для финансового сектора.

Сообщение Исследование показало, как часто ИИ ошибается в финансовых советах появились сначала на INCRYPTED.