Инструменты кодирования ИИ ориентируются на разработку в терминале

На протяжении многих лет редакторы кода с искусственным интеллектом, такие как Cursor, Windsurf и GitHub Copilot, устанавливали стандарты в области разработки программного обеспечения. Однако по мере того, как искусственный интеллект становится все более способным, а интуитивный подход «vibe-coding» набирает популярность, тихая эволюция меняет принципы работы этих систем. Вместо того, чтобы просто манипулировать кодом, они все чаще взаимодействуют напрямую с командной строкой системы. Это знаменует собой фундаментальный сдвиг в разработке с помощью искусственного интеллекта — тонкий, но потенциально трансформационный шаг для будущего направления развития отрасли.
Терминал, часто напоминающий строгие черно-белые экраны из фильмов о хакерах 90-х годов, является классическим интерфейсом для выполнения программ и управления данными. Хотя он менее визуально отполирован, чем современные редакторы кода, в умелых руках он остается чрезвычайно мощным инструментом. Хотя агенты, ориентированные на код, могут писать и отлаживать программы, утилиты на основе терминала часто необходимы для превращения написанного кода в функциональное, готовое к развертыванию приложение.
Движение в сторону терминала наиболее очевидно в ведущих лабораториях ИИ. С февраля Anthropic, DeepMind и OpenAI запустили инструменты кодирования из командной строки (Claude Code, Gemini CLI и CLI Codex соответственно), которые быстро стали одними из их самых популярных продуктов. Этот переход легко упустить из виду, поскольку эти инструменты часто имеют тот же брендинг, что и их предшественники. Однако, по сути, изменилось то, как агенты ИИ взаимодействуют с компьютерами — как онлайн, так и офлайн. Многие считают, что это только начало.
«Наша основная гипотеза заключается в том, что в будущем примерно 95 % взаимодействия LLM с компьютером будет происходить через интерфейс, похожий на терминал», — говорит Алекс Шоу, соавтор известного теста TerminalBench, ориентированного на терминалы.
Терминальные инструменты набирают популярность в то время, как некоторые устоявшиеся платформы, ориентированные на код, сталкиваются с нестабильностью. Например, редактор кода ИИ Windsurf был фрагментирован в результате конкурирующих поглощений: старшие руководители были наняты Google, а оставшаяся часть компании была куплена Cognition, что ставит под сомнение долгосрочную жизнеспособность потребительского продукта.
В то же время новые исследования показывают, что разработчики могут переоценивать преимущества традиционных инструментов в плане производительности. Исследование METR, в котором оценивался Cursor Pro, основной конкурент Windsurf, показало, что, хотя разработчики прогнозировали увеличение скорости на 20–30 %, наблюдаемый процесс был почти на 20 % медленнее. По сути, в некоторых случаях помощник по кодированию отнимал у программистов время.
Это создало возможности для таких компаний, как Warp, которая в настоящее время лидирует в рейтинге TerminalBench. Warp описывает себя как «агентную среду разработки», которая заполняет пробел между полнофункциональными IDE и инструментами командной строки, такими как Claude Code. Основатель Зак Ллойд по-прежнему оптимистично оценивает потенциал терминала, рассматривая его как способ решения проблем, выходящих за рамки традиционного редактора кода, такого как Cursor.
Мероприятие Techcrunch ПРЯМОЙ ЭФИР! TechCrunch All Stage
Создавайте умнее. Масштабируйтесь быстрее. Устанавливайте более глубокие связи. Присоединяйтесь к визионерам из Precursor Ventures, NEA, Index Ventures, Underscore VC и других компаний, чтобы провести день, наполненный стратегиями, семинарами и значимыми знакомствами.
Сэкономьте 450 долларов на пропуске TechCrunch All Stage
Стройте умнее. Расширяйтесь быстрее. Устанавливайте более тесные связи. Присоединяйтесь к визионерам из Precursor Ventures, NEA, Index Ventures, Underscore VC и других компаний, чтобы провести день, наполненный стратегиями, семинарами и значимыми знакомствами.
Бостон, Массачусетс | 15 июля ЗАРЕГИСТРИРУЙТЕСЬ СЕЙЧАС «Терминал находится на самом фундаментальном уровне в стеке разработчика, что делает его наиболее универсальным местом для запуска агентов искусственного интеллекта», — объясняет Ллойд.
Чтобы понять, чем отличается этот новый подход, рассмотрим тесты, используемые для их оценки. Предыдущее поколение инструментов на основе кода оценивалось по решению проблем GitHub, что является основой теста SWE-Bench. Каждая проблема SWE-Bench — это открытая проблема GitHub, то есть фрагмент неработающего кода. Модели итеративно дорабатывают код, пока он не заработает. Хотя интегрированные продукты, такие как Cursor, разработали более сложные методы, основная модель GitHub/SWE-Bench остается прежней: начать с неработающего кода и исправить его.
Терминальные инструменты используют более широкий подход, учитывая всю среду, в которой работает программа, а не только код. Это включает в себя кодирование, а также задачи, ориентированные на DevOps, такие как настройка сервера Git или диагностика причин сбоя скрипта. Одно из заданий TerminalBench предоставляет программу декомпрессии и целевой текстовый файл, поручая агенту провести обратную разработку соответствующего алгоритма сжатия. Другое задание требует от агента скомпилировать ядро Linux из исходного кода, не упоминая, что сначала необходимо получить исходный код. Решение этих задач требует настойчивости и творческого подхода к решению проблем, присущего программированию.
«Трудность TerminalBench заключается не только в вопросах, которые мы задаем агентам, — говорит Шоу, — но и в сложных средах, в которых мы их размещаем».
Важно, что этот новый метод предполагает решение проблем посредством последовательных, обоснованных шагов — той же способности, которая делает агентский ИИ таким мощным. Однако даже передовые агентские модели испытывают трудности в некоторых из этих сред. Warp достиг максимального результата в TerminalBench, решив чуть более половины задач, что подчеркивает как сложность теста, так и работу, которую еще предстоит проделать, чтобы полностью реализовать потенциал терминала.
Тем не менее, Ллойд утверждает, что мы достигли точки, когда терминальные инструменты могут надежно управлять значительной частью некодируемой рабочей нагрузки разработчика — предложение, от которого трудно отказаться.
«Подумайте о повседневной работе по настройке нового проекта, выявлению зависимостей и обеспечению его работоспособности — Warp в значительной степени может справиться с этим самостоятельно», — говорит Ллойд. «А если не сможет, то точно объяснит, почему».
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (3)
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.

На протяжении многих лет редакторы кода с искусственным интеллектом, такие как Cursor, Windsurf и GitHub Copilot, устанавливали стандарты в области разработки программного обеспечения. Однако по мере того, как искусственный интеллект становится все более способным, а интуитивный подход «vibe-coding» набирает популярность, тихая эволюция меняет принципы работы этих систем. Вместо того, чтобы просто манипулировать кодом, они все чаще взаимодействуют напрямую с командной строкой системы. Это знаменует собой фундаментальный сдвиг в разработке с помощью искусственного интеллекта — тонкий, но потенциально трансформационный шаг для будущего направления развития отрасли.
Терминал, часто напоминающий строгие черно-белые экраны из фильмов о хакерах 90-х годов, является классическим интерфейсом для выполнения программ и управления данными. Хотя он менее визуально отполирован, чем современные редакторы кода, в умелых руках он остается чрезвычайно мощным инструментом. Хотя агенты, ориентированные на код, могут писать и отлаживать программы, утилиты на основе терминала часто необходимы для превращения написанного кода в функциональное, готовое к развертыванию приложение.
Движение в сторону терминала наиболее очевидно в ведущих лабораториях ИИ. С февраля Anthropic, DeepMind и OpenAI запустили инструменты кодирования из командной строки (Claude Code, Gemini CLI и CLI Codex соответственно), которые быстро стали одними из их самых популярных продуктов. Этот переход легко упустить из виду, поскольку эти инструменты часто имеют тот же брендинг, что и их предшественники. Однако, по сути, изменилось то, как агенты ИИ взаимодействуют с компьютерами — как онлайн, так и офлайн. Многие считают, что это только начало.
«Наша основная гипотеза заключается в том, что в будущем примерно 95 % взаимодействия LLM с компьютером будет происходить через интерфейс, похожий на терминал», — говорит Алекс Шоу, соавтор известного теста TerminalBench, ориентированного на терминалы.
Терминальные инструменты набирают популярность в то время, как некоторые устоявшиеся платформы, ориентированные на код, сталкиваются с нестабильностью. Например, редактор кода ИИ Windsurf был фрагментирован в результате конкурирующих поглощений: старшие руководители были наняты Google, а оставшаяся часть компании была куплена Cognition, что ставит под сомнение долгосрочную жизнеспособность потребительского продукта.
В то же время новые исследования показывают, что разработчики могут переоценивать преимущества традиционных инструментов в плане производительности. Исследование METR, в котором оценивался Cursor Pro, основной конкурент Windsurf, показало, что, хотя разработчики прогнозировали увеличение скорости на 20–30 %, наблюдаемый процесс был почти на 20 % медленнее. По сути, в некоторых случаях помощник по кодированию отнимал у программистов время.
Это создало возможности для таких компаний, как Warp, которая в настоящее время лидирует в рейтинге TerminalBench. Warp описывает себя как «агентную среду разработки», которая заполняет пробел между полнофункциональными IDE и инструментами командной строки, такими как Claude Code. Основатель Зак Ллойд по-прежнему оптимистично оценивает потенциал терминала, рассматривая его как способ решения проблем, выходящих за рамки традиционного редактора кода, такого как Cursor.
Мероприятие TechcrunchПРЯМОЙ ЭФИР! TechCrunch All Stage
Создавайте умнее. Масштабируйтесь быстрее. Устанавливайте более глубокие связи. Присоединяйтесь к визионерам из Precursor Ventures, NEA, Index Ventures, Underscore VC и других компаний, чтобы провести день, наполненный стратегиями, семинарами и значимыми знакомствами.
Сэкономьте 450 долларов на пропуске TechCrunch All Stage
Стройте умнее. Расширяйтесь быстрее. Устанавливайте более тесные связи. Присоединяйтесь к визионерам из Precursor Ventures, NEA, Index Ventures, Underscore VC и других компаний, чтобы провести день, наполненный стратегиями, семинарами и значимыми знакомствами.
Бостон, Массачусетс | 15 июля ЗАРЕГИСТРИРУЙТЕСЬ СЕЙЧАС«Терминал находится на самом фундаментальном уровне в стеке разработчика, что делает его наиболее универсальным местом для запуска агентов искусственного интеллекта», — объясняет Ллойд.
Чтобы понять, чем отличается этот новый подход, рассмотрим тесты, используемые для их оценки. Предыдущее поколение инструментов на основе кода оценивалось по решению проблем GitHub, что является основой теста SWE-Bench. Каждая проблема SWE-Bench — это открытая проблема GitHub, то есть фрагмент неработающего кода. Модели итеративно дорабатывают код, пока он не заработает. Хотя интегрированные продукты, такие как Cursor, разработали более сложные методы, основная модель GitHub/SWE-Bench остается прежней: начать с неработающего кода и исправить его.
Терминальные инструменты используют более широкий подход, учитывая всю среду, в которой работает программа, а не только код. Это включает в себя кодирование, а также задачи, ориентированные на DevOps, такие как настройка сервера Git или диагностика причин сбоя скрипта. Одно из заданий TerminalBench предоставляет программу декомпрессии и целевой текстовый файл, поручая агенту провести обратную разработку соответствующего алгоритма сжатия. Другое задание требует от агента скомпилировать ядро Linux из исходного кода, не упоминая, что сначала необходимо получить исходный код. Решение этих задач требует настойчивости и творческого подхода к решению проблем, присущего программированию.
«Трудность TerminalBench заключается не только в вопросах, которые мы задаем агентам, — говорит Шоу, — но и в сложных средах, в которых мы их размещаем».
Важно, что этот новый метод предполагает решение проблем посредством последовательных, обоснованных шагов — той же способности, которая делает агентский ИИ таким мощным. Однако даже передовые агентские модели испытывают трудности в некоторых из этих сред. Warp достиг максимального результата в TerminalBench, решив чуть более половины задач, что подчеркивает как сложность теста, так и работу, которую еще предстоит проделать, чтобы полностью реализовать потенциал терминала.
Тем не менее, Ллойд утверждает, что мы достигли точки, когда терминальные инструменты могут надежно управлять значительной частью некодируемой рабочей нагрузки разработчика — предложение, от которого трудно отказаться.
«Подумайте о повседневной работе по настройке нового проекта, выявлению зависимостей и обеспечению его работоспособности — Warp в значительной степени может справиться с этим самостоятельно», — говорит Ллойд. «А если не сможет, то точно объяснит, почему».
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.





Дом






