Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 23 июля 2026 г.

Новости

Семь моделей и 48 промптов: пеликан на велосипеде не взломал бенчмарк

Сетка сгенерированных картинок с животными на разном транспорте из бенчмарка Dylan Castillo.

Мем «пеликан на велосипеде» превратили в нормальный бенчмарк: Dylan Castillo прогнал сетку 8 животных на 6 видах транспорта — 48 промптов, семь моделей, по три раза каждый. Для проверенных генераторов признаков, что лабы целенаправленно натаскивали модели под эту сцену, не нашлось.

Simon Willison давно в шутку гонял этот тест и раньше вручную пробовал других животных на другом транспорте — но без такой дисциплины. В прогоне участвовали GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 и DeepSeek V4 Pro; оценку помогали GPT-5.6 Luna и Gemini 3.1 Flash-Lite. Результаты можно смотреть в интерактивной таблице с фильтрами.

Что не подтвердилось

  • пеликаны на велосипедах не выглядят лучше остальных комбинаций;
  • лабы не рисуют пеликанов точнее других животных;
  • велосипеды не получаются лучше другого транспорта;
  • сцена «пеликан + велосипед» не выделяется даже с поправкой на сложность;
  • картинки не похожи на заученный шаблон из обучающей выборки.

Исключение на грани шума — GLM-5.2: у него самый большой буст на ячейке «пеликан + велосипед», и первый сэмпл бросился в глаза Willison. Эффект слабый и статистически незначимый — на него опираться не стоит. Масштаб Castillo — сетка 8×6 и тройной прогон — как раз тот уровень дисциплины, которого не хватало мемному тесту Willison.

Источник: Are AI labs pelicanmaxxing?.