Перейти к основному содержимому
AXIOMA AI
Все новости ИИ в России
Наука

GigaChat и YandexGPT заняли весь топ-6 российского бенчмарка SLAVA для LLM

GigaChat и YandexGPT заняли весь топ-6 российского бенчмарка SLAVA для LLM
Наука
Иван Ямщиков
Руководитель лаборатории NLP Яндекс

Российские ИИ-модели от Яндекса и Сбера заняли все позиции в топ-6 нового бенчмарка SLAVA, оценивающего качество LLM на русском языке. Лидируют Alice AI LLM (Яндекс), YandexGPT 5.1 Pro и GigaChat 2 Max (Сбер). Лучшая международная модель заняла лишь 7-е место.

Российские языковые модели продемонстрировали полное доминирование в новом бенчмарке SLAVA (Standardized Language Assessment for Verification and Analysis): все шесть верхних строчек заняли модели от Яндекса и Сбера.

Результаты бенчмарка SLAVA

МестоМодельРазработчикИнтегральный балл
1Alice AI LLMЯндекс94,7
2YandexGPT 5.1 ProЯндекс93,2
3GigaChat 2 MaxСбер91,8
4YandexGPT 5.1Яндекс89,4
5GigaChat 2Сбер87,9
6GigaChat 2 LiteСбер84,1

*Лучшая международная модель — 7-е место с результатом 81,3*

Что измеряет SLAVA

Бенчмарк создан для оценки реального качества LLM в русскоязычных задачах:

  • Понимание языка — сложный синтаксис, диалекты, идиомы
  • Работа с документами — юридические тексты, нормативные акты, ГОСТы
  • Культурный контекст — российские реалии, исторические отсылки
  • Безопасность и ценности — соответствие российским культурным нормам

Значение результатов

Победа российских моделей подтверждает закономерность: модели, специально обученные на региональных данных, значительно превосходят универсальные в локальных задачах.

Для российского бизнеса это означает:

  • При работе с российскими юридическими и нормативными документами предпочтительнее GigaChat или YandexGPT
  • Международные модели сохраняют преимущество в задачах на английском языке и в коде
  • Для мультиязычных задач оптимально сочетание российской и международной модели

Планы развития

  • YandexGPT 6 — фокус на агентных возможностях и мультимодальности
  • GigaChat 3 — расширение контекстного окна и улучшение RAG-сценариев

Оба разработчика анонсировали выпуск следующих версий до конца 2026 года.

Это краткое изложение. Полный текст — на сайте источника:

Читать оригинал: SEO News

Как это касается вашего бизнеса

Новая модель или сервис дают эффект, только если данные и процессы компании к ним готовы. Аудит ИИ-готовности покажет, где ИИ даст максимальную отдачу, а где внедрять его преждевременно.