FT: ИИ-модели ошибаются в 99% случаев при сложных финансовых расчетах

📌 Технологическая компания Saturn проанализировала, как наиболее распространенные модели искусственного интеллекта (ChatGPT, Claude, Copilot, Grok, Gemini и другие) справляются с решением финансовых зад…

Реклама
Полезное

Брокерский счёт с бонусом до 5 000 ₽ новым клиентам

Открыть брокерский счёт

Партнёрский материал. Мы получаем вознаграждение от партнёров.

Технологическая компания Saturn проверила популярные системы искусственного интеллекта на способность решать финансовые задачи. На сложных вопросах ошибки фиксировались в 99% случаев, на средних — в 57%.

📚

С 2022 года банки и фintech-компании активно внедряют генеративные модели в клиентские сервисы: чат-боты для консультаций, аналититические дашборды, скоринг кредитов. Пользователи массово доверяют системам подсчёта налогов, подбора инвестиционных портфелей, сравнения кредитных условий.

Регуляторы в Евросоюзе и США выработали разные подходы к надзору за ИИ в финансах: ЕС принял AI Act с жёсткими требованиями к «высокорискованным» приложениям, а в США при администрации Дональда Трама превалирует секторальный подход без единого федерального стандарта.

🧠 Анализ SmartNewsAI

ИИ провалил финансовый тест: почему роботы пока не заменят бухгалтеров Три года назад нейросети научились писать стихи, рисовать картины и проходить юридические экзамены. Банки и инвесткомпании начали внедрять чат-боты для консультаций, а стартапы обещали: скоро искусственный интеллект будет сам анализировать отчёты и считать налоги. Но новое исследование показывает, что между красивой демонстрацией и реальной работой с цифрами — огромная пропасть.

Компания Saturn протестировала самые популярные модели: ChatGPT, Claude, Copilot, Grok, Gemini и другие. Результаты оказались тревожными. На стандартных финансовых вопросах нейросети ошибались в 57% случаев. А когда задачи усложнили, процент ошибок вырос до 99. Почти полный провал.

Почему цифры оказались сложнее слов

Проблема в том, как устроены современные языковые модели. Они не считают — они предсказывают. Нейросеть анализирует миллиарды текстов и выбирает наиболее вероятное продолжение фразы. Это работает для эссе или перевода, но не для точных расчётов. Сложная формула или многоступенчатая операция требует последовательной логики, а модель может «заблудиться» на третьем шаге и выдать уверенный, но неверный ответ.

Что это значит для обычных людей

Если вы используете чат-бот для проверки простой арифметики или объяснения термина — риск умеренный. Но доверять ИИ расчёт налогов, оценку кредита или инвестиционный анализ пока опасно. Ошибка в 57% случаев на базовом уровне означает: каждый второй ответ может быть неверным. На сложных задачах система практически бесполезна. Для бизнеса это сигнал пересмотреть границы автоматизации. Многие компании уже сокращали штат аналитиков, рассчитывая на нейросети.

Теперь придётся вернуть человека в контур проверки — или потерять деньги на ошибках.

Что будет дальше

Разработчики, вероятно, начнут усиливать математические модули в своих продуктах. Уже сейчас появляются гибридные системы, где языковая модель передаёт вычисления специализированному калькулятору. Но до надёжного инструмента для финансов — ещё годы работы. Пока лучшее применение ИИ в этой сфере — помощник, а не исполнитель. Он может собрать информацию, найти нужные статьи закона, подготовить черновик. Финальную цифру должен сверять человек. Иначе 99% ошибок обернутся реальными убытками.

Читать полностью на Kommersant →
Поделиться: Telegram VK

Читайте нас там, где удобно вам

Telegram-канал Яндекс.Дзен vc.ru

Получайте такие новости первым

Нейросеть-анализатор собирает, сопоставляет и анализирует новости каждые 15 минут — в одну понятную картину. Читаем, обсуждаем, делимся мнениями.

Вступить в Telegram

Бесплатно · Без спама · Отписка в 1 клик