Эксперты по кибербезопасности критикуют ограничения в истории Anthropic

Anthropic представила свою новейшую модель Fable во вторник, позиционируя её как публичную ограниченную версию своей долгожданной модели для кибербезопасности Mythos.
Однако эти ограничения вызвали недовольство среди нескольких исследователей и специалистов в области кибербезопасности, которые выразили свои опасения в сети.
«[Fable] блокирует любой запрос, который может быть как-то связан с кибербезопасностью, включая безобидные задачи, такие как чтение поста в блоге», — заявила Валентина «Chompie» Пальмьотти, известный исследователь безопасности в IBM X-Force.
Когда запрос пользователя активирует эти фильтры безопасности, Fable останавливает разговор, отображая сообщение о том, что её «протоколы безопасности пометили этот ввод как относящийся к кибербезопасности или биологическим темам».
Эти ограничения направлены на снижение риска использования Fable для создания вредоносного программного обеспечения или эксплуатации уязвимостей в программном обеспечении — проблемы, которая постоянно беспокоит Anthropic. Биологические ограничения обусловлены аналогичными опасениями относительно разработки биологического оружия.
При выпуске Mythos в апреле Anthropic ограничила доступ к модели для избранных компаний и организаций в рамках проекта Glasswing, инициативы, предназначенной для развертывания модели для защиты критического программного обеспечения и инфраструктуры. На прошлой неделе Anthropic расширила доступ к Mythos для сотен организаций в 15 странах.
Несмотря на эти благие намерения, многие эксперты в области кибербезопасности остаются разочарованными кажущейся произвольностью ограничений. Мэтт Суич, опытный специалист по кибербезопасности, сказал TechCrunch, что «если вы попросите его написать безопасный код, он интерпретирует это как работу, связанную с кибербезопасностью, а не как лучшие практики в области разработки программного обеспечения, что приводит к снижению качества». Fable настроен на возврат к Claude Opus 4.8 при срабатывании защитных механизмов. «Похоже, что он полагается на ключевые слова, поэтому любой термин из лексикона «кибербезопасности» активирует фильтры», — отметил он.
Свяжитесь с нами
У вас есть дополнительные идеи о том, как хакеры используют ИИ или как компании по кибербезопасности интегрируют ИИ? Мы приветствуем ваш отзыв. С личного устройства и сети вы можете безопасно связаться с Лоренцо Франчески-Биккьери через Signal по номеру +1 917 257 1382, через Telegram и Keybase @lorenzofb или по электронной почте.
«Однако это понятно, учитывая, что мы всё ещё находимся на ранних этапах, и они совершенствуют свои защитные механизмы. Я уверен, что они будут развиваться по мере того, как Anthropic и другие разработчики передовых моделей будут теснее сотрудничать с новым поколением компаний по кибербезопасности», — сказал Суич, технический специалист в Tolmo, стартапе по кибербезопасности на базе ИИ. «Предпочтительно изначально чрезмерно ограничивать и со временем ослаблять защитные механизмы».
Другой исследователь пожаловался в X, что «даже запрос на проверку кода» активирует фильтры безопасности Fable.
Anthropic пока не ответила на запрос комментария.
Помимо защитных механизмов на уровне модели, Anthropic требует, чтобы специалисты по кибербезопасности подавали заявку в её программу Cyber Verification Program. Утверждённые заявители сталкиваются с меньшим количеством ограничений при использовании Claude для задач кибербезопасности. OpenAI предлагает аналогичную программу под названием Trusted Access for Cyber.
Связанная статья
Белый дом отказывается от маркировки «сверхинтеллекта»
Загрузка плеера…На этой неделе Белый дом собрал почти всех ведущих технологических CEOs в одной комнате — включая Цукерберга, Безоса, Маска и Дарио Амодеи из Anthropic — для подписания обязательства по безопасности ИИ, которое президент Дональд Трам
Anthropic представляет Sonnet 5.5 как более быстрый и доступный рабочий партнер
На фоне продолжающейся конкуренции среди моделей искусственного интеллекта компания Anthropic представила новейшую версию Sonnet, свою модель среднего класса, обещая существенно более высокую скорость и более низкие затраты по сравнению с предыдущей
Последний конфликт Anthropic с администрацией Трампа может на самом деле помочь ей, свидетельствуют данные о продажах
Anthropic переживает удивительный месяц.Согласно данным Ramp, компания в сфере искусственного интеллекта впервые обогнала OpenAI по доле рынка расходов бизнеса, завершив май с раундом финансирования в 65 миллиардов долларов при оценке в 965 миллиард
Рекомендации по связанным специальным темам
Комментарии (0)

Anthropic представила свою новейшую модель Fable во вторник, позиционируя её как публичную ограниченную версию своей долгожданной модели для кибербезопасности Mythos.
Однако эти ограничения вызвали недовольство среди нескольких исследователей и специалистов в области кибербезопасности, которые выразили свои опасения в сети.
«[Fable] блокирует любой запрос, который может быть как-то связан с кибербезопасностью, включая безобидные задачи, такие как чтение поста в блоге», — заявила Валентина «Chompie» Пальмьотти, известный исследователь безопасности в IBM X-Force.
Когда запрос пользователя активирует эти фильтры безопасности, Fable останавливает разговор, отображая сообщение о том, что её «протоколы безопасности пометили этот ввод как относящийся к кибербезопасности или биологическим темам».
Эти ограничения направлены на снижение риска использования Fable для создания вредоносного программного обеспечения или эксплуатации уязвимостей в программном обеспечении — проблемы, которая постоянно беспокоит Anthropic. Биологические ограничения обусловлены аналогичными опасениями относительно разработки биологического оружия.
При выпуске Mythos в апреле Anthropic ограничила доступ к модели для избранных компаний и организаций в рамках проекта Glasswing, инициативы, предназначенной для развертывания модели для защиты критического программного обеспечения и инфраструктуры. На прошлой неделе Anthropic расширила доступ к Mythos для сотен организаций в 15 странах.
Несмотря на эти благие намерения, многие эксперты в области кибербезопасности остаются разочарованными кажущейся произвольностью ограничений. Мэтт Суич, опытный специалист по кибербезопасности, сказал TechCrunch, что «если вы попросите его написать безопасный код, он интерпретирует это как работу, связанную с кибербезопасностью, а не как лучшие практики в области разработки программного обеспечения, что приводит к снижению качества». Fable настроен на возврат к Claude Opus 4.8 при срабатывании защитных механизмов. «Похоже, что он полагается на ключевые слова, поэтому любой термин из лексикона «кибербезопасности» активирует фильтры», — отметил он.
Свяжитесь с нами
У вас есть дополнительные идеи о том, как хакеры используют ИИ или как компании по кибербезопасности интегрируют ИИ? Мы приветствуем ваш отзыв. С личного устройства и сети вы можете безопасно связаться с Лоренцо Франчески-Биккьери через Signal по номеру +1 917 257 1382, через Telegram и Keybase @lorenzofb или по электронной почте.
«Однако это понятно, учитывая, что мы всё ещё находимся на ранних этапах, и они совершенствуют свои защитные механизмы. Я уверен, что они будут развиваться по мере того, как Anthropic и другие разработчики передовых моделей будут теснее сотрудничать с новым поколением компаний по кибербезопасности», — сказал Суич, технический специалист в Tolmo, стартапе по кибербезопасности на базе ИИ. «Предпочтительно изначально чрезмерно ограничивать и со временем ослаблять защитные механизмы».
Другой исследователь пожаловался в X, что «даже запрос на проверку кода» активирует фильтры безопасности Fable.
Anthropic пока не ответила на запрос комментария.
Помимо защитных механизмов на уровне модели, Anthropic требует, чтобы специалисты по кибербезопасности подавали заявку в её программу Cyber Verification Program. Утверждённые заявители сталкиваются с меньшим количеством ограничений при использовании Claude для задач кибербезопасности. OpenAI предлагает аналогичную программу под названием Trusted Access for Cyber.
Белый дом отказывается от маркировки «сверхинтеллекта»
Загрузка плеера…На этой неделе Белый дом собрал почти всех ведущих технологических CEOs в одной комнате — включая Цукерберга, Безоса, Маска и Дарио Амодеи из Anthropic — для подписания обязательства по безопасности ИИ, которое президент Дональд Трам
Anthropic представляет Sonnet 5.5 как более быстрый и доступный рабочий партнер
На фоне продолжающейся конкуренции среди моделей искусственного интеллекта компания Anthropic представила новейшую версию Sonnet, свою модель среднего класса, обещая существенно более высокую скорость и более низкие затраты по сравнению с предыдущей
Последний конфликт Anthropic с администрацией Трампа может на самом деле помочь ей, свидетельствуют данные о продажах
Anthropic переживает удивительный месяц.Согласно данным Ramp, компания в сфере искусственного интеллекта впервые обогнала OpenAI по доле рынка расходов бизнеса, завершив май с раундом финансирования в 65 миллиардов долларов при оценке в 965 миллиард





Дом






