Claude ведёт 26% AI-R&D в Anthropic — лаборатория показала внутренние метрики

Claude уже «ведёт» четверть AI-R&D в Anthropic — на август 2026 это 26%, тогда как в феврале было меньше 1%. Лаборатория показала три линейки внутренних измерений: насколько ИИ строит следующую версию себя, как контролируют агентов и куда уходит compute. Полной автономии ни на одном участке нет.
Индекс автоматизации R&D
Anthropic R&D Automation Index собирает все виды AI-исследований в компании и оценивает уровень автоматизации по шкале Epoch AI — от AL0 без участия модели до AL5 с полной автономией.
- в AL3 модель делает крупные куски под присмотром человека
- в AL4 ведёт задачу от промпта до конца, человек только надзирает
- более 90% работы — на AL3 и выше, AL5 нигде не достигнут
Надзор за агентами
На основной внутренней платформе одновременно работают около 30 000 агентов в research и engineering. Их действия проходят через онлайн-мониторы до выполнения и офлайн-мониторы после — за август система разобрала более миллиарда решений.
- 100% действий покрыты обоими типами мониторов
- 0,002% решений заблокированы онлайн-монитором — примерно 1 из 47 000
- около 100 000 транскриптов в неделю помечаются для проверки, ~50 доходят до человека
Офлайн-мониторинг ранее независимо проверял METR. Anthropic планирует встроить сторонних оценщиков с доступом к внутренним процессам наравне с командами риска.
Распределение compute
За неделю с 13 по 20 июля 2026 около 6% вычислительной мощности на AI-R&D ушло на safety-работу. Для AI-driven AI-R&D эта доля выше — 12%.
Оценки намеренно консервативны: если один токен одинаково продвигает capabilities и safety, он не попадает в метрику. Лаборатория предлагает публиковать такие срезы регулярно — с верификацией третьими сторонами в рамках Advanced AI Framework.
Источник: Measurements for understanding the pace of AI development inside frontier labs.