Дом
Google Gemma4 увеличивает скорость в три раза, что знаменует настоящее появление крупных офлайн-моделей.

Всего через несколько недель после того, как модель Gemma4 вызвала большой резонанс в области открытого исходного кода, Google снова значительно улучшила свою самую мощную модель с открытым исходным кодом. 5 мая по местному времени Google официально выпустила генератор предварительных версий модели Gemma4 с функцией многотокенного прогнозирования (MTP). Это технологическое достижение использует архитектуру спекулятивной декодировки, которая позволяет увеличить скорость обработки моделью втри раза без ущерба для качества результатов и логических возможностей.
Как одна из наиболее популярных моделей с открытым исходным кодом в мире, Gemma4 уже была скачана более 60 миллионов раз с момента своего выхода. Основная цель этого обновления – решить проблему затруднений в обработке больших языковых моделей и дальше повышать эффективность их работы.
Технические детали: достижение «предвидения» при ускорении обработки
Традиционные языковые модели часто ограничены объемом оперативной памяти. Проще говоря, когда процессор генерирует текст, перемещение сотен миллиардов параметров из памяти в вычислительный блок занимает много времени. Скорость передачи данных значительно ниже скорости обработки, что приводит к тому, что аппаратные ресурсы большую часть времени остаются неиспользуемыми и вызывает задержки в ответах системы.
Чтобы решить эту проблему, Google ввела технологию спекулятивной декодировки. Ее принцип можно описать как «мастер-рабочий» подход: система объединяет мощные модели, такие как Gemma 4 31B, с более легкими генераторами предварительных версий MTP. Генератор использует неиспользуемые вычислительные ресурсы для зараннего прогнозирования следующих символов, в то время как более мощная основная модель выполняет параллельную проверку. Когда прогнозы совпадают, модель может одновременно подтвердить всю последовательность символов, значительно сокращая время, необходимое для генерации текста.
Результаты тестирования: Apple Silicon и потребительские видеокарты демонстрируют значительные улучшения
Согласно официальным данным тестирования, эффект ускорения особенно заметен на локальных устройствах. В средах, работающих на процессорах Apple Silicon, при объеме партий от 4 до 8 единиц скорость обработки модели Gemma 4 26B увеличилась примерно в 2,2 раза.
Это означает, что разработчики теперь могут более эффективно использовать сложные программы для автоматизированной помощи в программировании или интеллектуальных агентов на персональных компьютерах и стандартных потребительских видеокартах. Кроме того, улучшенная эффективность обработки также значительно снижает расход энергии на мобильных устройствах, что способствует более широкому применению искусственного интеллекта в повседневной жизни.
Границы применения искусственного интеллекта продолжают расширяться
Это техническое обновление в первую очередь направлено на решение задач, требующих низкой задержки в обработке данных, таких как реальные времена чат-боты, автоматизированные инструменты программирования и различные автономные агенты. Благодаря генератору предварительных версий MTP Google доказала, что даже в условиях ограниченных ресурсов разработчики могут использовать самые современные языковые модели без ущерба для скорости обработки и точности результатов.
По мере снижения затрат на разработку и препятствий на пути к внедрению технологий искусственного интеллекта, модель Gemma4 и связанные с ней технологии способствуют распространению искусственного интеллекта не только в области облачных сервисов, но и на широком спектре персональных компьютеров.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)

Всего через несколько недель после того, как модель Gemma4 вызвала большой резонанс в области открытого исходного кода, Google снова значительно улучшила свою самую мощную модель с открытым исходным кодом. 5 мая по местному времени Google официально выпустила генератор предварительных версий модели Gemma4 с функцией многотокенного прогнозирования (MTP). Это технологическое достижение использует архитектуру спекулятивной декодировки, которая позволяет увеличить скорость обработки моделью втри раза без ущерба для качества результатов и логических возможностей.
Как одна из наиболее популярных моделей с открытым исходным кодом в мире, Gemma4 уже была скачана более 60 миллионов раз с момента своего выхода. Основная цель этого обновления – решить проблему затруднений в обработке больших языковых моделей и дальше повышать эффективность их работы.
Технические детали: достижение «предвидения» при ускорении обработки
Традиционные языковые модели часто ограничены объемом оперативной памяти. Проще говоря, когда процессор генерирует текст, перемещение сотен миллиардов параметров из памяти в вычислительный блок занимает много времени. Скорость передачи данных значительно ниже скорости обработки, что приводит к тому, что аппаратные ресурсы большую часть времени остаются неиспользуемыми и вызывает задержки в ответах системы.
Чтобы решить эту проблему, Google ввела технологию спекулятивной декодировки. Ее принцип можно описать как «мастер-рабочий» подход: система объединяет мощные модели, такие как Gemma 4 31B, с более легкими генераторами предварительных версий MTP. Генератор использует неиспользуемые вычислительные ресурсы для зараннего прогнозирования следующих символов, в то время как более мощная основная модель выполняет параллельную проверку. Когда прогнозы совпадают, модель может одновременно подтвердить всю последовательность символов, значительно сокращая время, необходимое для генерации текста.
Результаты тестирования: Apple Silicon и потребительские видеокарты демонстрируют значительные улучшения
Согласно официальным данным тестирования, эффект ускорения особенно заметен на локальных устройствах. В средах, работающих на процессорах Apple Silicon, при объеме партий от 4 до 8 единиц скорость обработки модели Gemma 4 26B увеличилась примерно в 2,2 раза.
Это означает, что разработчики теперь могут более эффективно использовать сложные программы для автоматизированной помощи в программировании или интеллектуальных агентов на персональных компьютерах и стандартных потребительских видеокартах. Кроме того, улучшенная эффективность обработки также значительно снижает расход энергии на мобильных устройствах, что способствует более широкому применению искусственного интеллекта в повседневной жизни.
Границы применения искусственного интеллекта продолжают расширяться
Это техническое обновление в первую очередь направлено на решение задач, требующих низкой задержки в обработке данных, таких как реальные времена чат-боты, автоматизированные инструменты программирования и различные автономные агенты. Благодаря генератору предварительных версий MTP Google доказала, что даже в условиях ограниченных ресурсов разработчики могут использовать самые современные языковые модели без ущерба для скорости обработки и точности результатов.
По мере снижения затрат на разработку и препятствий на пути к внедрению технологий искусственного интеллекта, модель Gemma4 и связанные с ней технологии способствуют распространению искусственного интеллекта не только в области облачных сервисов, но и на широком спектре персональных компьютеров.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











