Anthropic — $5 млн на open-source оценки влияния AI на пользователей

Anthropic открыла грантовую программу на $5 млн: независимые команды соберут open-source оценки того, как модели влияют на благополучие пользователей. Грантополучатели получают финансирование, доступ к моделям и техподдержку — готовые бенчмарки выкладывают в открытый доступ, чтобы ими мог воспользоваться любой разработчик.
Для большинства поведенческих тестов хватает одного ответа, а благополучие оценивают по контексту длинного диалога. Claude может дать советы по питанию и тренировкам на запрос о похудении — но если в истории прослеживается расстройство пищевого поведения, тот же текст становится рискованным. Риск часто проявляется не с первого сообщения, а по ходу разговора.
Что ищут в заявках
Команда Safeguards Anthropic опубликовала ориентиры для заявок. Программа рассчитана на оценки, которые:
- явно фиксируют, что измеряют — что считается проходом и провалом;
- проектируют и проверяют вместе с клиницистами и предметными экспертами;
- смотрят и на излишнюю осторожность, и на вред — риск перегиба в обе стороны;
- воспроизводят реальное использование: многоходовые сценарии, где контекст смещается от реплики к реплике;
- сверяют автоматические грейдеры с оценками живых экспертов.
Заявки принимают до 21 сентября; кандидатов для полных предложений отберут к 5 октября. Исследователи работают полностью независимо от Anthropic.
Источник: Funding better evaluations of AI's impact on wellbeing.