Запуск моделей искусственного интеллекта становится проблемой, связанной с памятью

Обсуждения затрат на инфраструктуру ИИ часто сосредоточены на компании Nvidia и графических процессорах, однако память становится ключевым элементом этой системы. Поскольку гипермасштабируемые компании вкладывают миллиарды в новые центры обработки данных, цены на чипы DRAM за последний год выросли примерно в семь раз.
Одновременно с этим развивается новая дисциплина, направленная на координацию работы этой памяти, чтобы нужные данные поступали к нужному агенту ИИ в нужное время. Компании, которые преуспевают в этом, могут выполнять те же запросы, используя меньше токенов — и именно это может стать решающим фактором выживания на конкурентном рынке.
Аналитик по полупроводникам Дэн О'Лафлин (Dan O’Laughlin) предлагает убедительную точку зрения на важность чипов памяти в своем Substack, где представлена беседа с Валом Берковичи (Val Bercovici), директором по искусственному интеллекту в Weka. Оба эксперта имеют опыт работы в сфере полупроводников, поэтому их обсуждение склоняется к аппаратному обеспечению, хотя последствия для программного обеспечения ИИ не менее значимы.
Особое внимание привлек один отрывок, в котором Берковичи комментирует растущую сложность документации Anthropic по кэшированию запросов:
Подсказка находится на странице ценообразования кэширования промтов Anthropic. Шесть или семь месяцев назад, особенно во время запуска Claude Code, это была простая страница, которая по сути говорила: «Используйте кэширование, это дешевле». Теперь она читается как энциклопедия советов о том, сколько записей в кэш следует приобрести заранее. Вы видите стандартные для отрасли уровни, такие как 5-минутные и 1-часовые окна — но ничего более длительного. Это показательная деталь. Затем, конечно, существуют различные возможности арбитража, связанные с ценами на чтение из кэша, в зависимости от того, сколько записей в кэш вы приобрели заранее.
Основной вопрос заключается в том, как долго Claude хранит ваш запрос в кэше. Вы можете оплатить 5-минутный интервал или более дорогой часовой интервал. Доступ к данным, все еще находящимся в кэше, обходится гораздо дешевле, поэтому эффективное управление может привести к существенной экономии. Однако есть одна загвоздка: каждый новый фрагмент данных, добавленный к запросу, может вытеснить что-то другое из кэша.
Хотя детали сложны, вывод прост: управление памятью в моделях ИИ станет одним из ключевых факторов в будущем ИИ. Компании, которые освоят его, получат значительное конкурентное преимущество.
В этой развивающейся области есть значительный потенциал для прогресса. В октябре прошлого года я писал о стартапе TensorMesh, который работает над уровнем стека, известным как оптимизация кэша.
Мероприятие TechCrunchTechCrunch Founder Summit 2026: билеты в продаже
23 июня в Бостоне более 1100 основателей соберутся на TechCrunch Founder Summit 2026, чтобы провести целый день, посвященный росту, реализации и масштабированию в реальных условиях. Учитесь у основателей и инвесторов, которые сформировали отрасль. Общайтесь с коллегами, проходящими через аналогичные этапы роста. Унесите с собой тактики, которые можно применить сразу
Сэкономьте до 300 долларов на билете или до 30% при покупке групповых билетов для команд из четырех и более человек.
TechCrunch Founder Summit: билеты в продаже
23 июня в Бостоне более 1100 основателей соберутся на TechCrunch Founder Summit 2026, чтобы провести целый день, посвященный росту, реализации и масштабированию в реальных условиях. Учитесь у основателей и инвесторов, которые сформировали индустрию. Общайтесь с коллегами, проходящими через аналогичные этапы роста. Узнайте о тактиках, которые можно применить сразу
Сэкономьте до 300 долларов на билете или до 30% при покупке групповых билетов для команд из четырех и более человек.
Бостон, Массачусетс | 23 июня 2026 г. ЗАПИСАТЬСЯ СЕЙЧАСВозможности существуют и в других частях стека. Например, ниже по стеку стоит вопрос о том, как центры обработки данных используют различные типы памяти. (Интервью включает в себя глубокое обсуждение того, когда использовать чипы DRAM, а когда HBM, хотя оно становится довольно техническим.) Выше по стеку конечные пользователи учатся структурировать свои рои моделей, чтобы эффективно использовать общие кэши.
По мере того как компании совершенствуют оркестрацию памяти, они будут потреблять меньше токенов, что сделает инференцию более дешевой. В то же время модели становятся более эффективными в обработке каждого токена, что еще больше снижает затраты. По мере снижения затрат на серверы многие приложения, которые в настоящее время считаются нерентабельными, начнут приближаться к рентабельности.
Связанная статья
Криптовалютная биржа OKX планирует предоставить ИИ-агентам возможность нанимать друг друга и выплачивать друг другу заработную плату
По мере того как ИИ-агенты начинают обслуживать частных лиц и взаимодействовать друг с другом, им требуются механизмы для поиска задач, оплаты услуг и укрепления доверия. Криптовалютная биржа OKX пола
Стартап, поддерживаемый Тилем, утверждает, что ИИ способен оценивать качество журналистики, несмотря на риски для информаторов
После участия в судебном процессе, приведшем к банкротству Gawker, Арон Д’Суза выявил серьезный недостаток в американском медиа-пространстве: люди, пострадавшие от публикаций, не имели эффективных сре
Prentis, новая лаборатория искусственного интеллекта, основанная Ридом Хоффманом и Марком Пинкусом, ведет переговоры о привлечении 100 млн долларов
Prentis, новая лаборатория искусственного интеллекта, специализирующаяся на моделях для работы с компьютером, основана серийным предпринимателем Ританкаром Дасом совместно с лидерами технологической индустрии Ридом Хоффманом и Марком Пинкусом. По сло
Рекомендации по связанным специальным темам
Комментарии (1)

Обсуждения затрат на инфраструктуру ИИ часто сосредоточены на компании Nvidia и графических процессорах, однако память становится ключевым элементом этой системы. Поскольку гипермасштабируемые компании вкладывают миллиарды в новые центры обработки данных, цены на чипы DRAM за последний год выросли примерно в семь раз.
Одновременно с этим развивается новая дисциплина, направленная на координацию работы этой памяти, чтобы нужные данные поступали к нужному агенту ИИ в нужное время. Компании, которые преуспевают в этом, могут выполнять те же запросы, используя меньше токенов — и именно это может стать решающим фактором выживания на конкурентном рынке.
Аналитик по полупроводникам Дэн О'Лафлин (Dan O’Laughlin) предлагает убедительную точку зрения на важность чипов памяти в своем Substack, где представлена беседа с Валом Берковичи (Val Bercovici), директором по искусственному интеллекту в Weka. Оба эксперта имеют опыт работы в сфере полупроводников, поэтому их обсуждение склоняется к аппаратному обеспечению, хотя последствия для программного обеспечения ИИ не менее значимы.
Особое внимание привлек один отрывок, в котором Берковичи комментирует растущую сложность документации Anthropic по кэшированию запросов:
Подсказка находится на странице ценообразования кэширования промтов Anthropic. Шесть или семь месяцев назад, особенно во время запуска Claude Code, это была простая страница, которая по сути говорила: «Используйте кэширование, это дешевле». Теперь она читается как энциклопедия советов о том, сколько записей в кэш следует приобрести заранее. Вы видите стандартные для отрасли уровни, такие как 5-минутные и 1-часовые окна — но ничего более длительного. Это показательная деталь. Затем, конечно, существуют различные возможности арбитража, связанные с ценами на чтение из кэша, в зависимости от того, сколько записей в кэш вы приобрели заранее.
Основной вопрос заключается в том, как долго Claude хранит ваш запрос в кэше. Вы можете оплатить 5-минутный интервал или более дорогой часовой интервал. Доступ к данным, все еще находящимся в кэше, обходится гораздо дешевле, поэтому эффективное управление может привести к существенной экономии. Однако есть одна загвоздка: каждый новый фрагмент данных, добавленный к запросу, может вытеснить что-то другое из кэша.
Хотя детали сложны, вывод прост: управление памятью в моделях ИИ станет одним из ключевых факторов в будущем ИИ. Компании, которые освоят его, получат значительное конкурентное преимущество.
В этой развивающейся области есть значительный потенциал для прогресса. В октябре прошлого года я писал о стартапе TensorMesh, который работает над уровнем стека, известным как оптимизация кэша.
Мероприятие TechCrunchTechCrunch Founder Summit 2026: билеты в продаже
23 июня в Бостоне более 1100 основателей соберутся на TechCrunch Founder Summit 2026, чтобы провести целый день, посвященный росту, реализации и масштабированию в реальных условиях. Учитесь у основателей и инвесторов, которые сформировали отрасль. Общайтесь с коллегами, проходящими через аналогичные этапы роста. Унесите с собой тактики, которые можно применить сразу
Сэкономьте до 300 долларов на билете или до 30% при покупке групповых билетов для команд из четырех и более человек.
TechCrunch Founder Summit: билеты в продаже
23 июня в Бостоне более 1100 основателей соберутся на TechCrunch Founder Summit 2026, чтобы провести целый день, посвященный росту, реализации и масштабированию в реальных условиях. Учитесь у основателей и инвесторов, которые сформировали индустрию. Общайтесь с коллегами, проходящими через аналогичные этапы роста. Узнайте о тактиках, которые можно применить сразу
Сэкономьте до 300 долларов на билете или до 30% при покупке групповых билетов для команд из четырех и более человек.
Бостон, Массачусетс | 23 июня 2026 г. ЗАПИСАТЬСЯ СЕЙЧАСВозможности существуют и в других частях стека. Например, ниже по стеку стоит вопрос о том, как центры обработки данных используют различные типы памяти. (Интервью включает в себя глубокое обсуждение того, когда использовать чипы DRAM, а когда HBM, хотя оно становится довольно техническим.) Выше по стеку конечные пользователи учатся структурировать свои рои моделей, чтобы эффективно использовать общие кэши.
По мере того как компании совершенствуют оркестрацию памяти, они будут потреблять меньше токенов, что сделает инференцию более дешевой. В то же время модели становятся более эффективными в обработке каждого токена, что еще больше снижает затраты. По мере снижения затрат на серверы многие приложения, которые в настоящее время считаются нерентабельными, начнут приближаться к рентабельности.
Криптовалютная биржа OKX планирует предоставить ИИ-агентам возможность нанимать друг друга и выплачивать друг другу заработную плату
По мере того как ИИ-агенты начинают обслуживать частных лиц и взаимодействовать друг с другом, им требуются механизмы для поиска задач, оплаты услуг и укрепления доверия. Криптовалютная биржа OKX пола
Стартап, поддерживаемый Тилем, утверждает, что ИИ способен оценивать качество журналистики, несмотря на риски для информаторов
После участия в судебном процессе, приведшем к банкротству Gawker, Арон Д’Суза выявил серьезный недостаток в американском медиа-пространстве: люди, пострадавшие от публикаций, не имели эффективных сре
Prentis, новая лаборатория искусственного интеллекта, основанная Ридом Хоффманом и Марком Пинкусом, ведет переговоры о привлечении 100 млн долларов
Prentis, новая лаборатория искусственного интеллекта, специализирующаяся на моделях для работы с компьютером, основана серийным предпринимателем Ританкаром Дасом совместно с лидерами технологической индустрии Ридом Хоффманом и Марком Пинкусом. По сло





Дом






