Перейти к содержимому
Экосистема AI Vibe

Новости

Anthropic — $5 млн на open-source оценки влияния AI на пользователей

Редакция 25 августа 2026 г.

Исследователи проектируют сценарии для оценки поведения AI-ассистента в длинных диалогах с пользователем.

Anthropic открыла грантовую программу на $5 млн: независимые команды соберут open-source оценки того, как модели влияют на благополучие пользователей. Грантополучатели получают финансирование, доступ к моделям и техподдержку — готовые бенчмарки выкладывают в открытый доступ, чтобы ими мог воспользоваться любой разработчик.

Для большинства поведенческих тестов хватает одного ответа, а благополучие оценивают по контексту длинного диалога. Claude может дать советы по питанию и тренировкам на запрос о похудении — но если в истории прослеживается расстройство пищевого поведения, тот же текст становится рискованным. Риск часто проявляется не с первого сообщения, а по ходу разговора.

Что ищут в заявках

Команда Safeguards Anthropic опубликовала ориентиры для заявок. Программа рассчитана на оценки, которые:

  • явно фиксируют, что измеряют — что считается проходом и провалом;
  • проектируют и проверяют вместе с клиницистами и предметными экспертами;
  • смотрят и на излишнюю осторожность, и на вред — риск перегиба в обе стороны;
  • воспроизводят реальное использование: многоходовые сценарии, где контекст смещается от реплики к реплике;
  • сверяют автоматические грейдеры с оценками живых экспертов.

Заявки принимают до 21 сентября; кандидатов для полных предложений отберут к 5 октября. Исследователи работают полностью независимо от Anthropic.

Источник: Funding better evaluations of AI's impact on wellbeing.