Сообщения (форма Anthropic)
/v1/messagesТот же чат, но в форме Anthropic: другое тело запроса и ответа.
Запрос
modelstringbodyобязательноmessagesarraybodyобязательноmax_tokensintegerbodysystemstring|arraybodytoolsarraybodytool_choiceobjectbodystreambooleanbodyОтветы
Response
{
"id": "chatcmpl-…",
"type": "message",
"role": "assistant",
"model": "gpt-5.6-sol",
"content": [{ "type": "text", "text": "Hello!" }],
"stop_reason": "end_turn",
"stop_sequence": null,
"usage": { "input_tokens": 11, "output_tokens": 2, "cost_usd": "0.0000465" }
}Подробности
Нужен ключ в заголовке Authorization: Bearer или x-api-key.
Шлюз принимает Anthropic-форму, но НЕ проксирует её как есть: тело переписывается в chat/completions, а ответ апстрима собирается обратно в Anthropic-сообщение (id — от апстрима, model — та логическая модель, которую ты запросил). Так работает любая модель каталога, а не только Claude.
Из тела переносятся: model, system, messages, max_tokens, temperature, top_p, stream, metadata, stop_sequences (в stop), tools (name/description/input_schema → function) и tool_choice (auto → auto, any → required, tool → конкретная функция). Это единственная текстовая ручка, где остальные поля НЕ доезжают до апстрима: конвертер собирает новое тело по этому списку. tool_use-блоки ассистента и tool_result пользователя конвертируются в обе стороны, finish_reason превращается в stop_reason (stop → end_turn, length → max_tokens, tool_calls → tool_use, content_filter → stop_sequence). Шлюз не требует max_tokens: без него в тело апстриму поле не попадает вовсе, а худшую цену запроса шлюз считает по потолку вывода из каталога модели. Служебный блок телеметрии Anthropic в system (x-anthropic-billing-header: …) отбрасывается: его нонс стоит в начале промпта и рвёт префиксный кэш апстрима на каждом запросе.
Стоимость этого запроса приходит в самом ответе: заголовок x-teamtoken-cost-usd и поле usage.cost_usd в теле. Значение — строка с десятичной записью («0.0000465»), а не число: число после парсинга показывалось бы по правилам языка клиента (Python выдал бы 4.65e-05), строка доходит до кода ровно такой, как записана. Стоимость может и не прийти — тогда её нет ни в заголовке, ни в поле: в нестриминговом ответе так бывает, когда апстрим её не сообщил, в стриме — когда у модели нет тарифа в каталоге. Стрим здесь синтетический: апстрим отвечает целиком, а SSE собирается из готового сообщения — поэтому стоимость известна до первого байта, заголовок приходит и в стриме, а cost_usd лежит в message_start внутри message.usage (в message_delta шлюз кладёт только output_tokens). Идемпотентности на этой ручке нет: Anthropic-ответ шлюз не кэширует, поэтому байт-в-байт такой же повтор уезжает в модель ещё раз и оплачивается ещё раз. Рядом живёт POST /v1/messages/count_tokens — он отвечает {"input_tokens": N} и это ОЦЕНКА (символы/4 плюс накладные на сообщение и инструмент), а не работа токенайзера. Любая ошибка приходит одним конвертом (поле code — не у каждого статуса): { "error": { "message": "...", "type": "...", "code": "PROVIDER_CODE" } }.
Модерация, когда она включена, читает текст запроса и блокирует его только по реальному вердикту: недоступный или отвечающий ошибкой модератор запрос пропускает. Ответ всегда несёт то логическое имя модели, которое ты запросил. Если ответ не уложился в таймаут ожидания шлюза (по умолчанию чтение 300 с, в стриме 60 с без байтов), приходит 504; нестриминговую попытку шлюз при этом помечает, и если апстрим всё же досчитал и списал, реконсайлер возвращает сумму на баланс компенсирующим грантом. Из тел ошибок вычищены имена хостов апстрима, поэтому текст ошибки может отличаться от того, что прислал апстрим.
Своего маршрута у этого пути нет: все POST /v1/* принимает один обработчик шлюза, и список принимаемых путей у него закрытый — на любой другой /v1/* приходит 404.