Популярные чат-боты ChatGPT, Claude, Copilot, Grok и Gemini в среднем дали неверные ответы на 57% финансовых запросов, выяснила технологическая компания Saturn. Исследователи проверили 18 моделей на 121 вопросе, получив более 10 000 ответов.

На сложных задачах с несколькими расчетами доля ошибок выросла до 88%, а у отдельных моделей достигла 99%. Лучше всех выступила Claude Opus 5 в режиме рассуждений, но и она ошиблась в 39% случаев. В одном из тестов совет Claude Haiku 4.5 мог привести к налоговому штрафу в £17 500 (около $23 400).