нейроинструменты

30 августа 2026 г.

Новый бенчмарк ARC-AGI-3, увеличение контекста в LLM и GLM-5 бьет рекорды — 30 августа 2026

Представлен новый бенчмарк ARC-AGI-3, увеличили глубину контекста в LLM, GLM-5 стала первой открытой моделью-лидером по бенчмаркам. Главные новости AI утром.

Фонд ARC Prize Foundation представил бенчмарк ARC-AGI-3 для проверки способности ИИ-агентов к обучению и решению комплексных задач. Ряд проектов заявили о стопроцентных результатах, однако разработчики подчеркнули, что это не означает достижение уровня AGI . Разработчики нашли способ увеличить длину обрабатываемого контекста в крупных языковых моделях (LLM) без ухудшения производительности. Методы RoPE, NTK-aware, YaRN позволяют эффективно масштабировать обработку длинного текста вплоть до миллиона токенов . GLM-5, созданная командой Zhipu AI и Tsinghua University, стала первой открытой языковой моделью, занявшей первые места на множестве бенчмарков, включая Artificial Analysis и LMArena. Модель демонстрирует высокие результаты в генерации текста и программирования, приближаясь к показателям закрытых решений вроде Claude и GPT . DeepSeek выпустила версию V4 Flash своей большой языковой модели, улучшив показатели агентных задач и приблизившись по результатам к бюджетному варианту GPT-5.6 Luna от OpenAI. Несмотря на отсутствие изменений архитектуры, переобучение позволило значительно повысить эффективность решения сложных задач . Эти новости показывают прогресс в развитии технологий искусственного интеллекта, расширении возможностей обработки естественного языка и создании открытых альтернатив крупным проприетарным моделям.

Источники