- Saturn протестировала ChatGPT, Claude, Copilot, Grok и Gemini по финансовым вопросам.
- В сложных запросах 88% ответов были ошибочными.
- Чатботы часто дают неправильные ответы о налогах и пенсиях.
Исследование технологической компании Saturn показало, что популярные чатботы часто дают неправильные ответы на финансовые вопросы, пишет FT. В рамках тестирования ИИ-моделей ChatGPT, Claude, Copilot, Grok и Gemini они ошибались в среднем в 57% случаев, а при более сложных запросах с несколькими расчетами — в 88%.
Результаты привлекают внимание к рискам использования генеративного ИИ для налоговых, пенсионных и инвестиционных решений, где ошибка может привести к реальным финансовым потерям.
ИИ ошибался в 88% сложных финансовых запросов
Исследователи проверили более 100 различных вопросов, связанных с деньгами, используя бесплатные и платные версии моделей. В целом 18 моделей получили более 10 000 запросов, причем каждый вопрос могли повторять до пяти раз.
- ошибки в финансовых расчетах;
- игнорирование будущих изменений налогового законодательства;
- выдуманные правила;
- неправильные ответы на сложные запросы с несколькими вычислениями.
У некоторых моделей доля ошибок в сложных вопросах достигала 99%. Лучший результат показала Claude Opus 5 в режиме «рассуждения», однако даже эта модель ошибалась в 39% ответов.
Генеральный директор Saturn Амал Джолли заявил, что масштабы использования ИИ для финансовых советов создают дополнительные риски.
«Миллионы людей доверяют моделям ИИ финансовые советы, но получают неправильные ответы, из-за которых могут потерять деньги», — сказал он.
Ошибки ИИ могут стоить тысячи фунтов
Одним из примеров стал запрос к бесплатной модели Claude Haiku 4.5 относительно налогообложения пенсий. По данным исследования, ее ошибка могла привести к начислению пенсионному вкладчику сбора HMRC в размере 17 500 фунтов стерлингов (около $23 430).
В другом случае Claude «придумал правило» относительно студенческих кредитов и заявил, что выпускник может прекратить выплаты, если переедет за границу.
Платные модели в целом отвечали точнее, чем бесплатные, а более новые версии демонстрировали лучшие результаты. В то же время Сара Коулз, руководитель направления персональных финансов инвестиционной платформы AJ Bell, отметила, что ИИ все еще может быть полезным для составления бюджета и поиска информации.
«Это хороший пример того, почему людям, которые нуждаются в поддержке, нужен профессиональный совет, а не доверие к ИИ», — сказала она.
Результаты также согласуются с недавним исследованием британского Управления по финансовому надзору (FCA), согласно которому каждый пятый взрослый в Великобритании готов позволить ИИ принимать финансовые решения вместо него. Наибольший интерес наблюдается в сложных сферах, в частности долгах, пенсиях и инвестициях.
По словам Джолли, финансовые советы от ИИ в настоящее время не регулируются, поэтому пользователи не имеют такого же уровня защиты и компенсаций, как в случае обращения к специалисту-человеку.
Напомним, что недавно OpenAI запустила ChatGPT для финансового сектора.
Сообщение Исследование показало, как часто ИИ ошибается в финансовых советах появились сначала на INCRYPTED.