DeepSeek-V4.1-Flash дебютирует на платформе Qwen AI: API и план по токенам уже доступны
DeepSeek-V4.1-Flash теперь доступен на платформе Qwen AI, предлагая как доступ через API, так и гибкий тарифный план Token Plan. Разработчики могут легко интегрировать модель в свои рабочие процессы с помощью стандартных API или использовать план токенов непосредственно в таких инструментах, как Qoder, приложение Qwen и Codex, для кодирования, документирования, визуального анализа и выполнения задач с участием агентов.

Эта модель, которую называют новым «легким флагманом» DeepSeek, использует архитектуру MoE с общим количеством параметров 552 млрд. В ней реализована асимметричная структура «причинно-следственный кодер-декодер», при которой активируются лишь около 8 млрд параметров для ввода и около 16 млрд — для вывода. Благодаря встроенной поддержке понимания текста и изображений модель обрабатывает контекстные окна объемом до 1 миллиона токенов и генерирует выходные данные объемом примерно 393K. Официальные тесты показывают значительное улучшение производительности агентов и кода, обеспечивая высокую пропускную способность и низкую задержку, несмотря на снижение затрат на активацию.
Одним из ключевых преимуществ является экономическая эффективность. Усовершенствованное сжатие кэша сокращает потребности в KV-кэше HBM до 25 %, а в SSD-накопителях — до 12,5 % по сравнению с предыдущими поколениями, что позволяет оптимизировать ресурсы для работы с длинными контекстами и многоходовыми взаимодействиями. Ценообразование на платформе Qwen имеет многоуровневую структуру: стоимость ввода составляет 1 юань за миллион токенов в непиковые часы (2 юаня в пиковые), а стоимость вывода — 4 юаня за миллион токенов (8 юаней в пиковые). Ограничения по скорости составляют 15K RPM и 1M TPM, что обеспечивает поддержку автодополнения префиксов, вызова функций, кэширования, структурированного вывода, пакетной обработки и онлайн-поиска.
Alibaba Cloud BaiLian установила партнерские отношения с сообществом открытого исходного кода vLLM, чтобы обеспечить широкое развертывание в Китае и других регионах мира, включая Пекин, Сингапур, США, Германию, Японию и Гонконг. Модель поддерживает многоходовые диалоги, вызов функций, онлайн-поиск, кэширование контекста и структурированный вывод с ограничением max_tokens ~393 216. Это делает её идеальным решением для предприятий, переносящих анализ длинных документов, базы знаний по обслуживанию клиентов, вопросы и ответы в репозиториях кода, а также мультимодальные обзоры заказов в единый интерфейс.
Отраслевые аналитики полагают, что интеграция «больших параметров, небольшой активации и надёжного кэширования» в экосистему Qwen снижает затраты на метод проб и ошибок при работе с агентами, обрабатывающими длинные контексты. Для небольших команд сочетание низких цен в часы низкой нагрузки и гибких подписок по тарифному плану Token Plan обеспечивает более гибкое пакетное вычисление и быструю валидацию прототипов.
Связанная статья
GitHub Copilot интегрирует GPT-5.4 за несколько часов
GitHub Copilot вновь продемонстрировал свою способность быстро реагировать. Спустя несколько часов после запуска OpenAI своей новейшей флагманской модели GPT-5.4 GitHub объявил о полной интеграции, предоставив разработчикам по всему миру интеллектуал
Anthropic лидирует в IPO, отрасль искусственного интеллекма вступает в новую эру триллионных доходов
Глобальный сектор искусственного интеллекта достиг еще одной важной вехи. Недавние рыночные данные показывают, что стартап в области ИИ Anthropic подал конфиденциальное заявление на проведение первичного публичного размещения акций (IPO) 1 июня. В сл
Как оптимизировать SEO для Google Japan и Yahoo Japan?
Подключённый город уже здесь, но он выглядит обыденноНаиболее полезная инфраструктура Интернета вещей (IoT) редко выглядит футуристично. Она выглядит как мусорное ведро, которое знает, когда оно полно, как фургон, сообщающий о неисправностях двигате
Рекомендации по связанным специальным темам
Комментарии (0)
DeepSeek-V4.1-Flash теперь доступен на платформе Qwen AI, предлагая как доступ через API, так и гибкий тарифный план Token Plan. Разработчики могут легко интегрировать модель в свои рабочие процессы с помощью стандартных API или использовать план токенов непосредственно в таких инструментах, как Qoder, приложение Qwen и Codex, для кодирования, документирования, визуального анализа и выполнения задач с участием агентов.

Эта модель, которую называют новым «легким флагманом» DeepSeek, использует архитектуру MoE с общим количеством параметров 552 млрд. В ней реализована асимметричная структура «причинно-следственный кодер-декодер», при которой активируются лишь около 8 млрд параметров для ввода и около 16 млрд — для вывода. Благодаря встроенной поддержке понимания текста и изображений модель обрабатывает контекстные окна объемом до 1 миллиона токенов и генерирует выходные данные объемом примерно 393K. Официальные тесты показывают значительное улучшение производительности агентов и кода, обеспечивая высокую пропускную способность и низкую задержку, несмотря на снижение затрат на активацию.
Одним из ключевых преимуществ является экономическая эффективность. Усовершенствованное сжатие кэша сокращает потребности в KV-кэше HBM до 25 %, а в SSD-накопителях — до 12,5 % по сравнению с предыдущими поколениями, что позволяет оптимизировать ресурсы для работы с длинными контекстами и многоходовыми взаимодействиями. Ценообразование на платформе Qwen имеет многоуровневую структуру: стоимость ввода составляет 1 юань за миллион токенов в непиковые часы (2 юаня в пиковые), а стоимость вывода — 4 юаня за миллион токенов (8 юаней в пиковые). Ограничения по скорости составляют 15K RPM и 1M TPM, что обеспечивает поддержку автодополнения префиксов, вызова функций, кэширования, структурированного вывода, пакетной обработки и онлайн-поиска.
Alibaba Cloud BaiLian установила партнерские отношения с сообществом открытого исходного кода vLLM, чтобы обеспечить широкое развертывание в Китае и других регионах мира, включая Пекин, Сингапур, США, Германию, Японию и Гонконг. Модель поддерживает многоходовые диалоги, вызов функций, онлайн-поиск, кэширование контекста и структурированный вывод с ограничением max_tokens ~393 216. Это делает её идеальным решением для предприятий, переносящих анализ длинных документов, базы знаний по обслуживанию клиентов, вопросы и ответы в репозиториях кода, а также мультимодальные обзоры заказов в единый интерфейс.
Отраслевые аналитики полагают, что интеграция «больших параметров, небольшой активации и надёжного кэширования» в экосистему Qwen снижает затраты на метод проб и ошибок при работе с агентами, обрабатывающими длинные контексты. Для небольших команд сочетание низких цен в часы низкой нагрузки и гибких подписок по тарифному плану Token Plan обеспечивает более гибкое пакетное вычисление и быструю валидацию прототипов.
GitHub Copilot интегрирует GPT-5.4 за несколько часов
GitHub Copilot вновь продемонстрировал свою способность быстро реагировать. Спустя несколько часов после запуска OpenAI своей новейшей флагманской модели GPT-5.4 GitHub объявил о полной интеграции, предоставив разработчикам по всему миру интеллектуал
Anthropic лидирует в IPO, отрасль искусственного интеллекма вступает в новую эру триллионных доходов
Глобальный сектор искусственного интеллекта достиг еще одной важной вехи. Недавние рыночные данные показывают, что стартап в области ИИ Anthropic подал конфиденциальное заявление на проведение первичного публичного размещения акций (IPO) 1 июня. В сл





Дом






