T-Bank AI Research создал метод SAE Match для прямого управления ошибками нейросетей без переобучения
Исследователи T-Bank AI Research Laboratory разработали метод SAE Match — способ интерпретировать и управлять языковыми моделями без их переобучения. Метод позволяет напрямую корректировать ошибки и галлюцинации в конкретных местах генерации. Технология не требует дополнительных вычислительных ресурсов и открыта для использования любой компанией. Публикация вызвала интерес мирового AI-сообщества.
T-Bank AI Research Laboratory (AI-исследовательское подразделение Т-Банка) опубликовала работу, описывающую метод SAE Match — новый подход к интерпретируемости и управлению крупными языковыми моделями.
Проблема, которую решает SAE Match: Современные LLM — «чёрные ящики»: сложно понять, почему модель дала неправильный ответ и как точечно исправить конкретную ошибку без переобучения всей модели. Традиционные подходы:
- Переобучение (fine-tuning) — дорогостоящее, нарушает другие знания
- RLHF — исправляет поведение в целом, но не конкретные ошибки
- Prompt engineering — обходит проблему, но не устраняет
Что такое SAE Match: Метод основан на Sparse Autoencoders (SAE) — технике из области интерпретируемости нейронных сетей, которая позволяет:
- 1.Найти в активациях модели конкретные «направления», отвечающие за конкретные концепции или ошибки
- 2.Целенаправленно изменить эти направления во время генерации
- 3.Управлять тем, какие токены и концепции активируются при генерации
Практические возможности SAE Match:
- Снижение галлюцинаций: выявить и подавить активации, связанные с «придумыванием» фактов
- Коррекция предвзятостей: найти и скорректировать направления, создающие bias
- Тонкая настройка поведения: без переобучения изменить ответы на конкретные типы запросов
- Локальное исправление ошибок: устранить ошибку в конкретной области знаний без нарушения других
Ключевые преимущества:
| Параметр | Традиционный fine-tuning | SAE Match |
|---|---|---|
| Вычислительные ресурсы | Высокие (GPU-кластеры, дни) | Нулевые дополнительные |
| Риск нарушить другие знания | Высокий (catastrophic forgetting) | Минимальный |
| Точность воздействия | Глобальная (вся модель) | Локальная (конкретный паттерн) |
| Интерпретируемость | Нет | Полная (видно, что именно меняется) |
Открытость технологии: T-Bank AI Research публикует метод как открытое исследование — «доступен любой компании». Это часть стратегии T-Bank по позиционированию как AI-research центра мирового уровня.
Практическое значение для российских компаний:
- Банки и финтех: снижение галлюцинаций в LLM-ассистентах для кредитного скоринга и KYC — критично для 115-ФЗ compliance
- DPO: интерпретируемость модели помогает доказать, что AI-решения не дискриминационны
- CTO: SAE Match потенциально позволяет адаптировать GigaChat или open-source модели для корпоративных нужд без дорогостоящего fine-tuning
Это краткое изложение. Полный текст — на сайте источника:
Читать оригинал: Plus WorldРешения AXIOMA AI по теме статьи
Как это касается вашего бизнеса
Новые ИИ-технологии приносят пользу, когда работают с данными компании и не выносят их наружу. Внедряем ИИ-решения в контуре заказчика: данные остаются внутри периметра.
