10:45 Сегодня
Сбер презентовал GigaChat 3.5 Reasoning с режимом рассуждений
Нейросеть может разбивать сложные задачи на этапы, проверять свои выводы и обращаться к дополнительным инструментам
Сбер представил GigaChat 3.5 Reasoning — новую мультимодальную нейросеть с режимом рассуждений. Она уже доступна пользователям GigaChat, а разработчики могут использовать модель по лицензии MIT. В дальнейшем ее планируют открыть для бизнеса через API.
При работе со сложными запросами нейросеть может разбить задачу на несколько этапов, определить последовательность действий, при необходимости обратиться к поиску или другим инструментам, проверить промежуточные результаты и только после этого подготовить итоговый ответ.
Такой подход предназначен для задач, которые нельзя решить одним действием. В Сбере среди примеров называют анализ договоров, финансовые расчеты, поиск ошибок в программном коде и планирование.
Пользователь может самостоятельно включить режим рассуждений. Для простых запросов модель способна отвечать без него, а при более сложных задачах использовать значительно больше токенов для поиска решения.
Старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка Антон Фролов рассказал, что при создании новой версии разработчики сделали акцент на последовательной работе со сложными задачами.
«Теперь GigaChat способен самостоятельно разложить задачу на этапы, понять, каких данных не хватает, проверить промежуточные выводы и при необходимости изменить ход решения», — сообщил Антон Фролов.
По данным разработчиков, новая версия лучше справляется с программированием и агентными сценариями, в которых нужно последовательно выполнить несколько действий.
Например, при планировании поездки модель может уточнить недостающие параметры, подобрать варианты перелета и размещения, проверить их соответствие бюджету, а при обнаружении противоречий изменить первоначальный план.
Разработчики также сообщили о росте результатов GigaChat в нескольких тестах. В IFBench показатель увеличился с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85 баллов по сравнению с версией без режима рассуждений.
Кроме того, сообщается, что при решении математических задач GigaChat 3.5 Reasoning в среднем использует на 37% меньше токенов, чем DeepSeek V4 Flash Preview.
Разработчики рассматривают применение модели в нескольких направлениях:
— финансы и банкинг — расчеты различных сценариев и проверка сделок на соответствие установленным требованиям
— юриспруденция — поиск противоречий в договорах и проверка документов
— разработка программного обеспечения — выявление ошибок и выбор архитектуры
— логистика и планирование — составление маршрутов и расписаний с учетом сроков, бюджета и доступных ресурсов
— образование — пошаговый разбор задач по математике, физике и программированию
— наука и аналитика данных — проведение расчетов и проверка гипотез
— поддержка клиентов — уточнение информации и проверка данных в разных системах
За основу новой нейросети разработчики взяли GigaChat 3.5 Ultra. Во время обучения модель решала математические задачи и задачи по программированию разными способами, разбивая их на последовательные этапы.
Автоматическая система проверяла полученные результаты и определяла варианты рассуждений, которые приводили к правильному ответу. Благодаря этому модель обучали не только выстраивать последовательность действий, но и определять, когда нужно воспользоваться дополнительным инструментом или пересмотреть предыдущий шаг.
В GigaChat 3.5 Reasoning также используется технология линейного внимания. По данным разработчиков, она предназначена для более эффективной работы с длинным контекстом: модель сохраняет ключевое содержание уже обработанной информации и дополняет его по мере поступления новых данных.