нейроинструменты

28 июня 2026 г.

Новый benchmark ClawBench показал провал агентов в бытовых задачах — 28 июня 2026

ИИ-агенты решили только треть настоящих повседневных задач. Обзор свежих исследований и инструментов для разработчиков и практиков AI.

Новый benchmark ClawBench выявил серьёзное отставание современных ИИ-агентов от ожиданий: даже лучшие модели смогли решить лишь 33% реальных повседневных заданий вроде бронирования рейса или отклика на вакансию . Исследователи из Центра безопасности AI представили Remote Labor Index (RLI) — проверку способности ИИ решать реальные задачи фрилансеров. Из 240 проектов с Upwork успешными оказались лишь 2.5% решений . На фоне слабых результатов крупных игроков китайские стартапы выпустили аналоги Mythos без ограничений экспорта, угрожая захватить огромный азиатский рынок . Для разработчиков появился новый инструмент graphlens-mcp — установочный пакет, позволяющий анализировать влияние изменений в коде и экономить ресурсы на поиске багов . Отдельно стоит отметить исследование роли желаний в поведении ИИ-агентов: разработчики предложили концепцию цифрового существа с собственными потребностями и инициативностью, приближенную к человеческому поведению .

Источники