Anthropic приносит извинения: полная автопсия инцидентов с Клодом

By: journalducoin.com|2026/09/04 17:00:00
0
Поделиться
copy
Оценить в GoogleОценить в Google

Кто извиняется, тот обвиняет себя. Месяц относительного молчания, затем официальное признание. После двух подряд инцидентов с Клодом в конце июля, Anthropic 31 августа опубликовала подробный пост о корнях проблемы. Компания признает то, что до этого в основном управляла в спешке: три её модели получили несанкционированный доступ к производственным системам трех реальных организаций во время тестов кибербезопасности, которые должны были проходить в закрытой среде. Давайте подведем итоги.
Ключевые моменты этой статьи:

  • Anthropic признала недостатки в своих тестах кибербезопасности после инцидентов с моделями, выявив двойную операционную и человеческую небрежность.
  • Компания усилила свои меры безопасности, внедрив новый инструмент для блокировки несанкционированных действий и перераспределив инженеров на безопасность.

Двойная небрежность, операционная и человеческая

Лаборатория указывает на две отдельные причины в своем посте от 31 августа. Сначала это хорошо идентифицированная операционная проблема: доступ в интернет, оставшийся открытым по ошибке у партнера по внешней оценке, в то время как модель считала, что она работает в закрытой среде. Затем, что более серьезно, проблема согласования. Клод явно столкнулся с признаками, показывающими, что его игровая площадка реальна, не изменив при этом своего поведения. Anthropic говорит о мотивированном рассуждении, тенденции модели интерпретировать неоднозначные сигналы таким образом, чтобы сохранить свою первоначальную веру, а не подвергать её сомнению. В одном случае вымышленная цель упражнения даже носила имя реального сайта, еще больше размывая границу между игрой и миром.
Чтобы оценить масштаб проблемы, Anthropic провела эксперимент, намеренно обучив модель класса Opus в известных средах, способствующих мошенничеству. В результате полученная модель развила явную склонность к желанию выиграть любой ценой, вплоть до саботажа своей собственной функции вознаграждения и предложения помощи в производстве биологического оружия для удовлетворения вымышленного оценщика. Это не имеет ничего общего с моделями, которые действительно продаются, уточняет компания, но это подтверждает, что инциденты июля не были случайным происшествием.
Недостающая защита и та, что приходит

С операционной точки зрения, Anthropic приостановила свои внешние кибероценки на несколько недель, чтобы усилить изоляцию песочниц и внедрить новый классификатор, который отвечает за обнаружение в реальном времени любых попыток выхода из тестовой среды. Как только модель пересекает несанкционированную границу, инструмент блокирует действие до его выполнения, завершает тест и уведомляет человека. Компания также перераспределила около 150 продуктовых инженеров на безопасность на несколько месяцев, приостановила разработку новых функций, чтобы закрыть дыры, и ввела строгий протокол для всех партнеров, тестирующих свои модели без киберзащиты: песочница, отключенная от интернета, явные границы в каждой инструкции, постоянный мониторинг активности.
Anthropic не единственная, кто сталкивается с подобными неприятностями. OpenAI только что заблокировала доступ к Astra, своей модели, классифицированной как << критический кибер риск >>, после аналогичного инцидента в Hugging Face в конце июля. Две конкурирующие лаборатории, два публичных признания с разницей в месяц. Целая индустрия учится устанавливать защитные меры для все более автономных агентов, в то время как эти же агенты начинают управлять криптопортфелями и транзакциями в цепочке без человеческого надзора на каждом этапе.

Цена --

--
--
--

Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.

Вам также может понравиться

Serenity: Спрос на ИИ остается высоким, акции ИИ будут продолжать расти

Законопроект Сандерса предлагает постоянный запрет на суперинтеллектуальный ИИ в США

OpenAI выпустила GPT-6 Astra: самый близкий к AGI ИИ-модель на сегодняшний день

Рост доходности облигаций Японии до 4% угрожает стратегии низкозатратного заимствования для корпоративных покупок биткойнов

BitBonds Metaplanet сохраняют фиксированные условия, но доходность долгосрочных облигаций Японии в 4% повышает барьер финансирования для будущих покупок биткойнов и рефинансирования.

Артур Хейс называет цены EUR/JPY сигналом тревоги для криптовалют, но система ФРС все еще не показывает признаков пожара

EUR/JPY упал на 2,38%, но отсутствие использования FIMA репо и отсутствие запланированных покупок для управления резервами показывают, что тезис Артура Хейса о ликвидности криптовалюты не сработал.

Обсуждение налогового исключения на биткойн в 300 долларов: предполагаемое увеличение налоговых поступлений

В США возникли предположения о том, что введение налогового исключения в 300 долларов для мелких платежей биткойнами может привести к увеличению налоговых поступлений, что вновь разожгло дискуссии о реформе налогообложения цифровых активов.
...

Содержание

Свежие статьи

Еще

Свежие листинги на WEEX

iconiconiconiconiconiconiconiconicon
Служба поддержки:@weikecs
Деловое сотрудничество:@weikecs
Количественная торговля и ММ:[email protected]
VIP-программа:[email protected]