Плагин LLM поднимает локальный эндпоинт OpenAI Chat Completions

В Chat Completions клиент сам тащит историю — с каждым запросом массив messages длиннее. Simon Willison собрал плагин llm-chat-completions-server 0.1a0, чтобы прогнать этот сценарий локально: на порту 9001 поднимается эндпоинт, совместимый с OpenAI, со всеми моделями из плагинов LLM.
Как запустить
uv tool install llm --prellm install llm-chat-completions-serverllm chat-completions-server -p 9001
Запросы — тем же curl, что к облачному API: в примере Willison модель qwen3.5-4b, роли user и assistant, каждое новое сообщение дополняет предыдущий контекст.
Задумка связана с content-addressable логами в LLM 0.32rc1 — схема дедуплицирует повторяющиеся части сообщений по хешам, когда клиент раз за разом присылает одну и ту же начальную историю.
Весь код плагина написал GPT-5.6 Sol; автор пишет, что модель хорошо знает форму OpenAI Chat Completions API.
Источник: llm-chat-completions-server 0.1a0.