DeepSeek V4.1 Flash и GLM-5.3 Prime уже на Kodagent
Сегодня в каталоге две открытые модели: DeepSeek V4.1 Flash — первая модель DeepSeek на новой архитектуре и первая модель DeepSeek у нас, которая видит изображения, — и GLM-5.3 Prime, высокоскоростная версия GLM-5.3 от Z.ai.
DeepSeek V4.1 Flash
V4.1 Flash — это новое поколение, а не очередной чекпоинт V4 Flash. Это первая модель на архитектуре Causal Encoder-Decoder (CED) от DeepSeek: разреженная mixture-of-experts, которая разделяет чтение и письмо — 8B активных параметров обрабатывают вход и 16B генерируют ответ. DeepSeek сообщает о примерно четырёхкратном сокращении KV-кэша во время работы, поэтому длинные промпты модель «проглатывает» дёшево и быстро — а огромный промпт при сравнительно коротком ответе как раз и есть типичный запрос кодинг-агента.
- Контекст 1M токенов.
- Ввод изображений — впервые среди моделей DeepSeek в нашем каталоге: скриншоты и схемы работают и в API, и в чате консоли.
- Встроенные рассуждения с настраиваемой глубиной (
reasoning_effort). - Вызов инструментов и структурированный вывод для агентных циклов.
Цены за 1M токенов, списываются с баланса кредитов (1 кредит = $0.01; при курсе по умолчанию 1 кредит = 1 ₽):
| USD / 1M | Кредитов / 1M | |
|---|---|---|
| Вход | $0.30 | 30 |
| Выход | $1.20 | 120 |
| Чтение кэша | $0.006 | 1 |
У провайдера чтение кэша в пятьдесят раз дешевле обычного входа; в кредитах цена округляется вверх до целой единицы — 1 кредит за 1M. Запись кэша без наценки: тарифицируется по обычной цене входа.
V4.1 Flash стоит дороже, чем V4 Flash 0731, и для массовой работы
с чистым текстом бюджетным вариантом остаётся 0731. Обе модели остаются в каталоге, а слаги
deepseek-v4-flash / deepseek-v4-flash-0731 по-прежнему указывают ровно на те модели, что и
раньше.
GLM-5.3 Prime
GLM-5.3 Prime — это тот же GLM-5.3: те же веса, те же возможности, тот же контекст 1M токенов, — но с ускоренным инференсом и в 1.5–2 раза более высокой скоростью генерации. Когда мы добавляли GLM-5.3, более быстрого эндпоинта просто не было; теперь его выпустила сама Z.ai. Скорость стоит вдвое дороже:
| Вход | Выход | Чтение кэша | |
|---|---|---|---|
glm-5.3-prime | $2.80 | $8.80 | $0.56 |
glm-5.3 (для сравнения) | $1.40 | $4.40 | $0.26 |
Текст на входе и на выходе, с вызовом инструментов. Запись кэша тарифицируется по обычной цене входа.
Как использовать
Слаги моделей: deepseek-v4.1-flash и glm-5.3-prime. Обе работают на любой полосе
шлюза — OpenAI-совместимый Chat Completions API, Responses API (Codex) и Anthropic Messages API
(Claude Code):
export ANTHROPIC_BASE_URL="https://kodagent.ru/api/llm"
export ANTHROPIC_AUTH_TOKEN="<ваш-api-ключ>"
export ANTHROPIC_MODEL="deepseek-v4.1-flash"
claude
Готовые конфиги для каждого агента — с уже подставленным ключом — лежат на странице «API-ключи» в консоли; полное руководство — в статье о подключении агентов.
В список моделей облачных агентов модель попадает после того, как мы прогоним на ней настоящие сессии; пока из моделей Z.ai там GLM-5.3 и GLM-5.3 Flash.
Удачной разработки!