Перейти к основному содержимому
AXIOMA AI
Все новости ИИ в России
Технологии

T-Bank AI Research создал метод SAE Match для прямого управления ошибками нейросетей без переобучения

T-Bank AI Research создал метод SAE Match для прямого управления ошибками нейросетей без переобучения
Технологии
0
дополнительных вычислительных ресурсов требует метод SAE Match для прямого управления ошибками нейросети — исправление без переобучения

Исследователи T-Bank AI Research Laboratory разработали метод SAE Match — способ интерпретировать и управлять языковыми моделями без их переобучения. Метод позволяет напрямую корректировать ошибки и галлюцинации в конкретных местах генерации. Технология не требует дополнительных вычислительных ресурсов и открыта для использования любой компанией. Публикация вызвала интерес мирового AI-сообщества.

T-Bank AI Research Laboratory (AI-исследовательское подразделение Т-Банка) опубликовала работу, описывающую метод SAE Match — новый подход к интерпретируемости и управлению крупными языковыми моделями.

Проблема, которую решает SAE Match: Современные LLM — «чёрные ящики»: сложно понять, почему модель дала неправильный ответ и как точечно исправить конкретную ошибку без переобучения всей модели. Традиционные подходы:

  • Переобучение (fine-tuning) — дорогостоящее, нарушает другие знания
  • RLHF — исправляет поведение в целом, но не конкретные ошибки
  • Prompt engineering — обходит проблему, но не устраняет

Что такое SAE Match: Метод основан на Sparse Autoencoders (SAE) — технике из области интерпретируемости нейронных сетей, которая позволяет:

  1. 1.Найти в активациях модели конкретные «направления», отвечающие за конкретные концепции или ошибки
  2. 2.Целенаправленно изменить эти направления во время генерации
  3. 3.Управлять тем, какие токены и концепции активируются при генерации

Практические возможности SAE Match:

  • Снижение галлюцинаций: выявить и подавить активации, связанные с «придумыванием» фактов
  • Коррекция предвзятостей: найти и скорректировать направления, создающие bias
  • Тонкая настройка поведения: без переобучения изменить ответы на конкретные типы запросов
  • Локальное исправление ошибок: устранить ошибку в конкретной области знаний без нарушения других

Ключевые преимущества:

ПараметрТрадиционный fine-tuningSAE Match
Вычислительные ресурсыВысокие (GPU-кластеры, дни)Нулевые дополнительные
Риск нарушить другие знанияВысокий (catastrophic forgetting)Минимальный
Точность воздействияГлобальная (вся модель)Локальная (конкретный паттерн)
ИнтерпретируемостьНетПолная (видно, что именно меняется)

Открытость технологии: T-Bank AI Research публикует метод как открытое исследование — «доступен любой компании». Это часть стратегии T-Bank по позиционированию как AI-research центра мирового уровня.

Практическое значение для российских компаний:

  • Банки и финтех: снижение галлюцинаций в LLM-ассистентах для кредитного скоринга и KYC — критично для 115-ФЗ compliance
  • DPO: интерпретируемость модели помогает доказать, что AI-решения не дискриминационны
  • CTO: SAE Match потенциально позволяет адаптировать GigaChat или open-source модели для корпоративных нужд без дорогостоящего fine-tuning

Это краткое изложение. Полный текст — на сайте источника:

Читать оригинал: Plus World

Как это касается вашего бизнеса

Новые ИИ-технологии приносят пользу, когда работают с данными компании и не выносят их наружу. Внедряем ИИ-решения в контуре заказчика: данные остаются внутри периметра.