30 августа 2026 г.
Новый бенчмарк ARC-AGI-3, увеличение контекста в LLM и GLM-5 бьет рекорды — 30 августа 2026
Представлен новый бенчмарк ARC-AGI-3, увеличили глубину контекста в LLM, GLM-5 стала первой открытой моделью-лидером по бенчмаркам. Главные новости AI утром.
Фонд ARC Prize Foundation представил бенчмарк ARC-AGI-3 для проверки способности ИИ-агентов к обучению и решению комплексных задач. Ряд проектов заявили о стопроцентных результатах, однако разработчики подчеркнули, что это не означает достижение уровня AGI . Разработчики нашли способ увеличить длину обрабатываемого контекста в крупных языковых моделях (LLM) без ухудшения производительности. Методы RoPE, NTK-aware, YaRN позволяют эффективно масштабировать обработку длинного текста вплоть до миллиона токенов . GLM-5, созданная командой Zhipu AI и Tsinghua University, стала первой открытой языковой моделью, занявшей первые места на множестве бенчмарков, включая Artificial Analysis и LMArena. Модель демонстрирует высокие результаты в генерации текста и программирования, приближаясь к показателям закрытых решений вроде Claude и GPT . DeepSeek выпустила версию V4 Flash своей большой языковой модели, улучшив показатели агентных задач и приблизившись по результатам к бюджетному варианту GPT-5.6 Luna от OpenAI. Несмотря на отсутствие изменений архитектуры, переобучение позволило значительно повысить эффективность решения сложных задач . Эти новости показывают прогресс в развитии технологий искусственного интеллекта, расширении возможностей обработки естественного языка и создании открытых альтернатив крупным проприетарным моделям.
Источники
- Бенчмарк на AGI. Если ARC‑AGI-3 решён, есть ли у нас AGI? — habr.com
- Увеличение контекста без регистрации и СМС — habr.com
- GLM-5: топ-1 открытая модель для генерации кода и текста, конкурирующая с Claude и GPT на агентных задачах — neurohive.io
- DeepSeek V4 Flash вышел из превью — ответ на демпинг OpenAI — ai-stat.ru