Ora гоняет агентов по живым сайтам — 99% веба не выдерживают

Ora запускает агентов на живые сайты — зарегистрироваться, подключить продукт, оплатить — и показывает, на каком шаге всё ломается. Сооснователь Assaf Elovic считает, что к такому сценарию готов лишь 1% веба: 99% сайтов его прогону не выдерживают.
Тесты идут с journey.ora.ai: платформа фиксирует стоимость, задержку и число шагов до цели. Фронт, бэкенд и среда агентов живут на Vercel в одном деплое — общие логи и аутентификация, без отдельной инфраструктуры под runtime.
Сравнение обвязок
Агент распадается на модель и harness — софт с инструментами, который ведёт шаг за шагом. Ora гоняет бок о бок то, что реально ставят клиенты: Claude Code, ChatGPT, Gemini, Hermes, OpenClaw и eve от Vercel.
У каждой обвязки своё окружение и свой формат шагов — Ora поднимает отдельный runtime на каждую и трассирует всё. Застрял в signup — виден шаг и список попыток, а не итоговый score без деталей.
eve в том же бенчмарке
Когда Vercel выпустил eve, Ora прогнал его через те же сотни journey на нескольких доменах — модели Claude Fable 5 и Haiku 4.5, задача интеграции с продуктом. Три опубликованных числа:
- на 7% меньше шагов до цели
- в 2 раза выше native success — задача чаще закрывается на сайте клиента, а не через web search
- на 9% больше valid endpoints — найденные эндпоинты чаще реально вызываются
Один прогон выявил проблему с prompt caching; после фикса команды eve суммарная стоимость прогонов упала примерно на 15%. После этого Ora строит своих агентов на eve — в том числе из-за sandbox override: фреймворк по умолчанию крутит агента в своей песочнице, где нет трассировки. Override подменяет окружение на инструментированное, и шаги пишутся в trace как у остальных harness.
На journey.ora.ai eve уже с обеих сторон: его бенчмаркят и на нём крутят внутренних агентов. Команда из 16 инженеров делает сотни коммитов в день — Ido Finder оценивает экономию на инфраструктуре в несколько часов в неделю.
Источник: How Ora benchmarks every major AI agent on Vercel.