DeepSeek V4.1 Flash и GLM-5.3 Prime уже на Kodagent

Сегодня в каталоге две открытые модели: DeepSeek V4.1 Flash — первая модель DeepSeek на новой архитектуре и первая модель DeepSeek у нас, которая видит изображения, — и GLM-5.3 Prime, высокоскоростная версия GLM-5.3 от Z.ai.

DeepSeek V4.1 Flash

V4.1 Flash — это новое поколение, а не очередной чекпоинт V4 Flash. Это первая модель на архитектуре Causal Encoder-Decoder (CED) от DeepSeek: разреженная mixture-of-experts, которая разделяет чтение и письмо — 8B активных параметров обрабатывают вход и 16B генерируют ответ. DeepSeek сообщает о примерно четырёхкратном сокращении KV-кэша во время работы, поэтому длинные промпты модель «проглатывает» дёшево и быстро — а огромный промпт при сравнительно коротком ответе как раз и есть типичный запрос кодинг-агента.

  • Контекст 1M токенов.
  • Ввод изображений — впервые среди моделей DeepSeek в нашем каталоге: скриншоты и схемы работают и в API, и в чате консоли.
  • Встроенные рассуждения с настраиваемой глубиной (reasoning_effort).
  • Вызов инструментов и структурированный вывод для агентных циклов.

Цены за 1M токенов, списываются с баланса кредитов (1 кредит = $0.01; при курсе по умолчанию 1 кредит = 1 ₽):

USD / 1MКредитов / 1M
Вход$0.3030
Выход$1.20120
Чтение кэша$0.0061

У провайдера чтение кэша в пятьдесят раз дешевле обычного входа; в кредитах цена округляется вверх до целой единицы — 1 кредит за 1M. Запись кэша без наценки: тарифицируется по обычной цене входа.

V4.1 Flash стоит дороже, чем V4 Flash 0731, и для массовой работы с чистым текстом бюджетным вариантом остаётся 0731. Обе модели остаются в каталоге, а слаги deepseek-v4-flash / deepseek-v4-flash-0731 по-прежнему указывают ровно на те модели, что и раньше.

GLM-5.3 Prime

GLM-5.3 Prime — это тот же GLM-5.3: те же веса, те же возможности, тот же контекст 1M токенов, — но с ускоренным инференсом и в 1.5–2 раза более высокой скоростью генерации. Когда мы добавляли GLM-5.3, более быстрого эндпоинта просто не было; теперь его выпустила сама Z.ai. Скорость стоит вдвое дороже:

ВходВыходЧтение кэша
glm-5.3-prime$2.80$8.80$0.56
glm-5.3 (для сравнения)$1.40$4.40$0.26

Текст на входе и на выходе, с вызовом инструментов. Запись кэша тарифицируется по обычной цене входа.

Как использовать

Слаги моделей: deepseek-v4.1-flash и glm-5.3-prime. Обе работают на любой полосе шлюза — OpenAI-совместимый Chat Completions API, Responses API (Codex) и Anthropic Messages API (Claude Code):

export ANTHROPIC_BASE_URL="https://kodagent.ru/api/llm"
export ANTHROPIC_AUTH_TOKEN="<ваш-api-ключ>"
export ANTHROPIC_MODEL="deepseek-v4.1-flash"
claude

Готовые конфиги для каждого агента — с уже подставленным ключом — лежат на странице «API-ключи» в консоли; полное руководство — в статье о подключении агентов.

В список моделей облачных агентов модель попадает после того, как мы прогоним на ней настоящие сессии; пока из моделей Z.ai там GLM-5.3 и GLM-5.3 Flash.

Удачной разработки!

DeepSeek V4.1 Flash и GLM-5.3 Prime уже на Kodagent — Kodagent