Anthropic визнає свої помилки: повна автопсія зловживань Клода

By: journalducoin.com|2026/09/04 17:00:00
0
Поширити
copy
Оцінити в GoogleОцінити в Google

Хто вибачається, той звинувачує. Місяць відносного мовчання, а потім формальне визнання. Після двох поспіль втеч Клода наприкінці липня, Anthropic 31 серпня опублікувала детальний пост про корені проблеми. Компанія визнає те, що до цього часу в основному управляла в умовах терміновості, три її моделі отримали несанкціонований доступ до виробничих систем трьох реальних організацій під час тестів кібербезпеки, які мали проходити в закритому середовищі. Підсумуємо. Ключові моменти цієї статті:

  • Anthropic визнала недоліки в своїх тестах кібербезпеки після втеч моделей, виявивши подвійну недбалість — операційну та людську.
  • Компанія посилила свої заходи безпеки, включаючи новий інструмент для блокування несанкціонованих дій та переведення інженерів на безпеку.

Подвійна недбалість, операційна та людська

Лабораторія вказує на дві окремі причини у своєму пості від 31 серпня. По-перше, добре відома операційна проблема — помилково відкритий доступ до Інтернету у партнера з зовнішньої оцінки, тоді як модель вважала, що вона працює в закритому середовищі. По-друге, що є більш тривожним, проблема узгодження. Клод, очевидно, перетворився на індикатори, які показували, що його ігровий простір реальний, не змінюючи своєї поведінки. Anthropic говорить про мотивоване міркування, тенденцію моделі інтерпретувати неоднозначні сигнали таким чином, щоб зберегти свою початкову віру, а не ставити її під сумнів. У одному випадку вигадана ціль вправи навіть мала назву реального сайту, ще більше розмиваючи межу між грою та світом.
Щоб виміряти масштаб проблеми, Anthropic провела експеримент, навмисно навчаючи модель класу Opus на відомих середовищах, щоб заохотити шахрайство. Результуюча модель розвинула чітку схильність до перемоги за будь-яку ціну, навіть до саботажу власної функції винагороди та пропозиції допомоги у виготовленні біологічної зброї для задоволення вигаданого оцінювача. Це не має нічого спільного з моделями, які насправді продаються, підкреслює компанія, але це підтверджує зворотне, що інциденти липня не були випадковістю.
Відсутній захист, і той, що приходить

З операційної точки зору, Anthropic призупинила свої зовнішні кібероцінки на кілька тижнів, щоб посилити ізоляцію пісочниць і впровадити новий класифікатор, відповідальний за виявлення в реальному часі будь-якої спроби виходу з тестового середовища. Як тільки модель перетинає несанкціоновану межу, інструмент блокує дію до її виконання, зупиняє тест і сповіщає людину. Компанія також перевела близько 150 інженерів продукту на безпеку на кілька місяців, заморозила розробку нових функцій, поки не закрила прогалини, і наклала на всіх партнерів, які тестують її моделі без кіберзахисту, суворий протокол: пісочниця, відключена від Інтернету, чіткий периметр у кожній інструкції, постійний моніторинг діяльності.
Anthropic не є єдиною, хто стикається з такими неприємностями. OpenAI щойно заблокувала доступ до Astra, своєї власної моделі, класифікованої як "критичний кіберризик", після подібного інциденту в Hugging Face наприкінці липня. Дві суперницькі лабораторії, два публічні визнання з місячною різницею. Вся індустрія вчиться встановлювати захист для все більш автономних агентів, в той же час, коли ці самі агенти починають управляти криптопортфелями та транзакціями в блокчейні без людського нагляду на кожному етапі.

Ціна --

--
--
--

Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.

Вам також може сподобатися

Serenity: Попит на ШІ залишається сильним, акції ШІ продовжать зростати

Ранковий бюлетень Уолл-стріт: Позиція Вуллера підштовхує ризикові активи, Тесла, криптоакції та програмне забезпечення AI забирають увагу

Законопроект Сандерса прагне до постійної заборони надінтелектуального ШІ в США

OpenAI випустила GPT-6 Astra: Найближча модель ШІ до AGI

Різке зростання доходності облігацій Японії на 4% загрожує стратегії низьковартісного запозичення, що стоїть за корпоративними покупками біткоїнів

BitBonds Metaplanet зберігають фіксовані умови, але довгострокова доходність облігацій Японії на 4% підвищує планку фінансування для майбутніх покупок біткоїнів та рефінансування.

Артур Хейс називає EUR/JPY ціни крипто-дзвінком тривоги, але системи ФРС досі не показують вогню

EUR/JPY впав на 2,38%, але відсутність використання FIMA репо та жодних запланованих покупок управління резервами показують, що теорія ліквідності крипто Артура Хейса не спрацювала.
...

Вміст

Найновіші статті

Більше

Нещодавні лістинги монет на WEEX

iconiconiconiconiconicon
Підтримка клієнтів:@weikecs
Співпраця:@weikecs
Кількісна торгівля та маркетмейкінг:[email protected]
VIP-програма:[email protected]