Новость

Сбер открыл доступ к библиотеке SIRIN для поиска ошибок в ответах нейросетей

По данным «Независимой газеты», Сбер выложил в открытый доступ библиотеку SIRIN — инструмент, который ловит галлюцинации в ответах языковых моделей и ИИ-агентов.

Сбер открыл доступ к библиотеке SIRIN для поиска ошибок в ответах нейросетей

Для рынка прикладного ИИ это редкий случай: крупный игрок не просто публикует исследование, а отдаёт готовый production-grade модуль, который можно встроить в своего ассистента за несколько минут.

Что внутри SIRIN

Расшифровка аббревиатуры — Semantic Inconsistency Recognition and Inspection Nexus — сразу подсказывает логику работы. Библиотека не пытается заменить LLM и не переписывает архитектуру модели. Она работает «сверху»: анализирует уже сгенерированный ответ и сверяет его с исходными данными, помечая фрагменты, которые не подтверждаются контекстом.

Ключевая фича — гранулярность проверки. SIRIN умеет сканировать как ответ целиком, так и отдельные предложения, и показывает, где именно модель могла уйти в вымысел. Это принципиально для RAG-систем: когда ассистент вытаскивает факты из базы знаний, нужно понимать, какой именно абзац «отвалился» от источника.

Есть и превентивный слой. Перед тем как генерировать финальный ответ, агент может через SIRIN оценить, достаточно ли у него информации для ответа. Если данных не хватает — система попросит уточнение или откажется отвечать, вместо того чтобы додумать. Для бизнеса, где критична юридическая или финансовая точность, это прямое снижение репутационных рисков.

Под капотом: метамодели и 250 примеров

Под интересным углом здесь работает сам подход к обучению. По данным издания, команда исполнительного директора по исследованию данных Центра практического ИИ Максима Макаренко построила метамодели, которые повышают точность обнаружения ошибок почти на 30%, и для этого хватило всего 250 обучающих примеров. Это сильный сигнал для тех, кому файн-тюнинг детекторов галлюцинаций казался дорогой затеей: похоже, точка приложения усилий — архитектура метаоценки, а не объём датасета.

Старший управляющий директор, директор по AI-трансформации Сбербанка Сергей Рябов подчеркнул, что инструмент уже обкатан внутри компании на клиентских сервисах и теперь открыт для внешнего рынка.

Как это использовать в стеке

SIRIN опубликован на российской платформе GitVerse и на GitHub, веб-демо развёрнуто на Hugging Face. Для интеграции в своего ИИ-ассистента, RAG-пайплайн или агентскую систему достаточно подключить библиотеку и настроить вызов проверки после генерации. По словам разработчиков, это занимает считанные минуты.

Практический сценарий для маркетинга и поддержки: оборачиваете свою LLM-связку (GigaChat, YandexGPT, локальная модель — неважно) слоем SIRIN, и в логах появляется разметка, какие ответы ассистента стоит отправить оператору на перепроверку, а какие можно релизить автоматически. Следующий шаг — подключить ту же логику к A/B-тестам промптов: метрика «уровень семантической согласованности» становится таким же измеримым параметром, как latency или стоимость токена. Стоит последить, какие именно интерфейсы и конфиги помимо Python-обёртки появятся у SIRIN в ближайшие итерации — от этого зависит, насколько быстро библиотека станет стандартом де-факто для российских AI-стеков.