Fable 5.1 лидирует в Real-SWE бенчмарке с 38,8% против GPT-6 Astra (33,8%) и Gemini 3.8 Flash (31,2%)
Независимый бенчмарк Real-SWE, тестирующий языковые модели на реальных корпоративных кодовых базах, поставил Anthropic Claude Fable 5.1 на первое место с результатом 38,8%. GPT-6 Astra занял второе место с 33,8%, Gemini 3.8 Flash — третье с 31,2%. Real-SWE сложнее стандартного SWE-bench: задачи взяты из закрытых production-репозиториев.
Сентябрь 2026 года. Real-SWE — наиболее репрезентативный бенчмарк для оценки coding-способностей frontier-моделей на реальных enterprise-задачах — опубликовал обновлённый рейтинг.
Что такое Real-SWE: ``` Standard SWE-bench (старый): → Открытые GitHub репозитории → Задачи известны моделям из обучения → Результаты завышены (data contamination)
Real-SWE (новый стандарт): → Закрытые корпоративные репозитории → Задачи: реальные баги из production → Нет в обучающих данных ни одной модели → Более честное сравнение ```
Таблица лидеров Real-SWE (сентябрь 2026): ``` # Модель Score Компания ───────────────────────────────────────────────── 1 Claude Fable 5.1 38.8% Anthropic 2 GPT-6 Astra 33.8% OpenAI 3 Gemini 3.8 Flash 31.2% Google 4 DeepSeek V4 Pro 28.4% DeepSeek 5 Qwen 3.8 Max 25.1% Alibaba 6 Claude Sonnet 5 24.3% Anthropic 7 Llama 4.3 Scout 21.7% Meta 8 Mistral Large 2026 19.2% Mistral ```
Анализ разрыва Fable 5.1 vs GPT-6 Astra: ``` Разрыв: 5 процентных пунктов (38.8% vs 33.8%)
Gде Fable опережает: → Debugging сложных многоуровневых ошибок → Рефакторинг унаследованного кода (legacy) → Понимание implicit contract между компонентами → Написание тестов к существующей логике
Где GPT-6 Astra конкурентоспособен: → Генерация нового кода с нуля → Документация и комментарии → Интеграция с инструментами (plugins) ```
Практическое значение для enterprise: ``` ROI для разработки: Fable 5.1 решает ~39 из 100 реальных тикетов → Экономия: ~0.39 × (стоимость часа разработчика) → При $150/час и 200 тикетах в месяц: $150 × 200 × 0.39 ≈ $11 700/мес сэкономлено vs стоимость API (~$3–5/час использования)
Положительный ROI достигается при: → Более 50 тикетов/мес + стоимость >$80/час ```
Для российских IT-компаний: Claude Fable 5.1 доступен через AWS Bedrock (для компаний с иностранной инфраструктурой) или через прямой API. В российском периметре: GigaChat 3.1 Ultra и Alice AI LLM Pro по кодингу уступают frontier-моделям, но соответствуют 152-ФЗ. Выбор зависит от требований к локализации данных.
Это краткое изложение. Полный текст статьи доступен на сайте источника:
Читать полностью на AI Weekly / The InformationЕщё по теме ai-трансформация
Meta разворачивает «плоскую» организацию Applied AI: IC-сотрудников просят вернуться в роль менеджеров
DeepSeek выпустила V4.1-Flash и продлила API DeepSeek V4 Pro после 14 сентября 2026
Claude Fable 5.1: кэш-чтение подешевело на 75%, три breaking changes — что изменилось с 1 сентября 2026
Хотите узнать, как это применимо к вашему бизнесу?
Рассчитаем ROI от AI за 60 минут. Покажем конкретные метрики для вашей отрасли.
