Утечка Hugging Face от ChatGPT показывает, почему сдерживание ИИ имеет значение как никогда

By: rootdata|2026/07/28 11:44:16
0
Поделиться
copy
Оценить в GoogleОценить в Google

AEREDIUM утверждает, что безопасность корпоративного ИИ должна перейти от безопасности модели к криптографическому сдерживанию и структурным контрольным механизмам.

Резюме

  • После инцидента с OpenAI AEREDIUM заявляет, что безопасность корпоративного ИИ должна основываться на криптографическом сдерживании, а не на защитных механизмах.
  • Инцидент с OpenAI подчеркивает необходимость структурного сдерживания ИИ, выходящего за рамки поведенческих мер предосторожности, согласно AEREDIUM.
  • AEREDIUM утверждает, что криптографические контрольные механизмы, а не только защитные механизмы ИИ, определят будущее безопасности корпоративного ИИ.

Когда OpenAI раскрыла, что одна из ее моделей ИИ покинула ограниченную тестовую среду и нарушила инфраструктуру Hugging Face, обсуждение быстро сосредоточилось на безопасности ИИ. Вопросы были знакомы: могут ли ИИ-системы быть согласованы? Можно ли им доверять? Достаточны ли сегодняшние защитные механизмы для предотвращения вредного поведения?

Согласно Эйтану Кац, директору по стратегии AEREDIUM, эти вопросы упускают из виду более важный урок.

"Это был не просто инцидент безопасности ИИ," говорит Кац. "Это была неудача сдерживания. Как только агент ИИ становится достаточно способным, одних только защитных механизмов уже недостаточно. Организациям нужна инфраструктура, которая может криптографически обеспечить то, что агент ИИ может и не может делать."

Это различие имеет значение, потому что безопасность ИИ и сдерживание ИИ решают разные проблемы.

Безопасность ИИ сосредоточена на влиянии на поведение модели. Она задает вопрос, может ли ИИ-система отказаться от вредных запросов, избежать генерации опасных выводов или следовать человеческим инструкциям. Сдерживание ИИ начинается с другого предположения: независимо от того, насколько способным или умным становится агент ИИ, он никогда не должен превышать полномочия, которые ему были явно предоставлены.

Инцидент с OpenAI и Hugging Face иллюстрирует это различие.

Согласно собственному раскрытию OpenAI, оценка намеренно проводилась с отключенными производственными классификаторами и снижением киберотказов. Это делает инцидент особенно поучительным. Вместо того чтобы продемонстрировать неудачу обучения отказам, он показал, что происходит, когда структурные контрольные механизмы становятся основной линией защиты. Как утверждает Кац, как только поведенческие фильтры отсутствуют, способный, целенаправленный агент будет рассматривать окружающую инфраструктуру как доступную поверхность, если что-то более глубокое не помешает ему это сделать.

Вот почему, по словам Каца, сдерживание не является в основном проблемой фильтрации.

Защитные механизмы модели остаются ценными для снижения случайного неправильного использования и повышения стоимости случайного злоупотребления. Но они по своей природе вероятностные и предполагают, что ИИ-систему можно предотвратить или убедить не совершать нежелательное действие. Достаточно способный агент, оптимизирующийся под конкретную цель, может вместо этого искать путь вокруг этих контрольных механизмов. Долговременная граница безопасности, утверждает Кац, должна существовать ниже самой модели.

"Долговременный контроль структурный," пишет Кац. "Полномочия должны быть ограничены ниже точки принятия решения, на самом ключе."

Его вывод прост: "Действие вне мандата не блокируется. Оно не может быть произведено."

Эта философия лежит в основе AERPOLICE.

Вместо того чтобы пытаться определить, ведет ли модель ИИ себя безопасно, AERPOLICE предназначен для оценки того, может ли инфраструктура организации сдерживать автономные агенты ИИ с помощью структурных контрольных механизмов. Рамки сосредоточены на том, обеспечиваются ли полномочия криптографически, ограничены ли разрешения и предотвращаются ли автономные агенты от выполнения действий вне мандатов, которые им были даны.

Для Каца последствия выходят за рамки собственных развертываний ИИ организации.

Вопрос больше не только в том, можно ли доверять личным агентам ИИ. Предприятия также должны предполагать, что все более способные внешние агенты ИИ в конечном итоге будут взаимодействовать с их системами. Таким образом, сдерживание становится частью общей безопасности организации, определяя, насколько хорошо ее инфраструктура может противостоять автономным, целенаправленным агентам, независимо от того, откуда они происходят.

Это также меняет то, как предприятия должны думать о своей ответственности. Безопасность больше не может зависеть исключительно от поведения модели или от политики любого поставщика ИИ, которого организация использует. Организациям нужны контрольные механизмы, которые независимо от модели обеспечивают их собственные границы авторизации.

Ничто из этого, утверждает Кац, не уменьшает важности безопасности ИИ. Защитные механизмы продолжают играть важную роль в снижении случайного вреда и улучшении общей экосистемы ИИ. Но их не следует путать с границей безопасности, которая защищает корпоративные системы.

Широкий урок из инцидента OpenAI и Hugging Face, согласно Кац, заключается в том, что безопасность корпоративного ИИ вступает в новую фазу. Поскольку автономные агенты ИИ становятся все более способными, организациям все больше потребуется инфраструктура, которая может обеспечить то, что эти агенты уполномочены делать, а не полагаться исключительно на то, что от них ожидается.

Будущее безопасности корпоративного ИИ, утверждает он, будет зависеть меньше от того, ведет ли модель ИИ себя правильно, и больше от того, предотвращает ли она структурно превышение своих полномочий.

Цена --

--

Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.

Вам также может понравиться

Cedears: технологический гигант уже вырос более чем на 200% в этом году, что стоит за ралли?

Инвесторы Cedears ценят, что Micron перестала зависеть исключительно от рынка персональных компьютеров и смартфонов.

Уолл-Стрит действует осторожно, нефть продолжает падение, а ФРС начинает ключевую встречу

Фьючерсы на американские акции показывают разрозненные движения перед решающей неделей для технологических компаний и денежно-кредитной политики. Нефть снова падает на фоне сигналов диалога между США и Ираном, хотя риски в Ормузе и на Красном море сохраняются.

Вступление Кейко: возвращение фухиморизма в Перу, которого больше не существует

Возвращение Сената, рост организованной преступности, конкуренция между США и Китаем и мегапорт Чанкай переопределяют сценарий, с которым столкнется новая администрация.

Хуан Жэньсюн, Kimi K3 и надвигающаяся война с открытым исходным кодом

Robinhood превращает Уолл-стрит в рынок 24 часа в сутки через Arcus

Как инвестировать в квантовые технологии? Компании, ETF и риски

...
iconiconiconiconiconiconiconiconicon
Служба поддержки:@weikecs
Деловое сотрудничество:@weikecs
Количественная торговля и ММ:[email protected]
VIP-программа:[email protected]