28 июня 2026 г.
Новый benchmark ClawBench показал провал агентов в бытовых задачах — 28 июня 2026
ИИ-агенты решили только треть настоящих повседневных задач. Обзор свежих исследований и инструментов для разработчиков и практиков AI.
Новый benchmark ClawBench выявил серьёзное отставание современных ИИ-агентов от ожиданий: даже лучшие модели смогли решить лишь 33% реальных повседневных заданий вроде бронирования рейса или отклика на вакансию . Исследователи из Центра безопасности AI представили Remote Labor Index (RLI) — проверку способности ИИ решать реальные задачи фрилансеров. Из 240 проектов с Upwork успешными оказались лишь 2.5% решений . На фоне слабых результатов крупных игроков китайские стартапы выпустили аналоги Mythos без ограничений экспорта, угрожая захватить огромный азиатский рынок . Для разработчиков появился новый инструмент graphlens-mcp — установочный пакет, позволяющий анализировать влияние изменений в коде и экономить ресурсы на поиске багов . Отдельно стоит отметить исследование роли желаний в поведении ИИ-агентов: разработчики предложили концепцию цифрового существа с собственными потребностями и инициативностью, приближенную к человеческому поведению .
Источники
- ClawBench: лучший ИИ-агент смог успешно завершить только 33% реальных повседневных задач — neurohive.io
- Remote Labor Index: ведущие ИИ-агенты справились с 2.5% реальных задач с биржи фрилансеров — neurohive.io
- Asian AI startups launch Mythos-like models as Anthropic’s export ban drags on — techcrunch.com
- Граф кода одной командой: ставим graphlens-mcp в проект и перестаём жечь токены на grep — habr.com
- Архитектура ИИ-агента с желаниями или цифровой человек — habr.com