Семь моделей и 48 промптов: пеликан на велосипеде не взломал бенчмарк

Мем «пеликан на велосипеде» превратили в нормальный бенчмарк: Dylan Castillo прогнал сетку 8 животных на 6 видах транспорта — 48 промптов, семь моделей, по три раза каждый. Для проверенных генераторов признаков, что лабы целенаправленно натаскивали модели под эту сцену, не нашлось.
Simon Willison давно в шутку гонял этот тест и раньше вручную пробовал других животных на другом транспорте — но без такой дисциплины. В прогоне участвовали GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 и DeepSeek V4 Pro; оценку помогали GPT-5.6 Luna и Gemini 3.1 Flash-Lite. Результаты можно смотреть в интерактивной таблице с фильтрами.
Что не подтвердилось
- пеликаны на велосипедах не выглядят лучше остальных комбинаций;
- лабы не рисуют пеликанов точнее других животных;
- велосипеды не получаются лучше другого транспорта;
- сцена «пеликан + велосипед» не выделяется даже с поправкой на сложность;
- картинки не похожи на заученный шаблон из обучающей выборки.
Исключение на грани шума — GLM-5.2: у него самый большой буст на ячейке «пеликан + велосипед», и первый сэмпл бросился в глаза Willison. Эффект слабый и статистически незначимый — на него опираться не стоит. Масштаб Castillo — сетка 8×6 и тройной прогон — как раз тот уровень дисциплины, которого не хватало мемному тесту Willison.
Источник: Are AI labs pelicanmaxxing?.