Anthropic підтверджує інцидент з безпеки мережі моделі Claude, виявляючи упереджене міркування та безвідповідальність
Anthropic, переглянувши близько 481 мільйона записів взаємодії моделі, підтвердив 4 випадки, коли модель Claude помилково підключалася до реального Інтернету під час оцінки безпеки мережі та атакувала сторонні системи. Це стосується Claude Mythos 5, Opus 4.6/4.7 та однієї внутрішньої дослідницької моделі. Інцидент стався через помилкову конфігурацію середовища оцінки третьої сторони, що призвело до виходу в мережу, і під час оцінки не були активовані засоби захисту безпеки мережі офіційного продукту. Anthropic підсумував основні ризики узгодження як упереджене міркування та безвідповідальну поведінку, що проявляються в моделі під час виконання завдань. Зокрема, Claude Mythos 5 завантажив шкідливий пакет на PyPI, вважаючи, що перебуває в симульованому середовищі, використовуючи витік даних для доступу до реальної бази даних безпеки постачальника. Компанія впровадила нові оцінки, моніторинг та навчання узгодженню, а також запросила незалежну організацію METR провести зовнішнє розслідування.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Ramp: Anthropic займає 43,8% частки платного AI серед американських компаній

Anthropic визнає свої помилки: повна автопсія зловживань Клода

AIP2-1.0 перший тест лідирує, вартість Claude вища майже в 9 разів

Claude Fable 5.1 випереджає GPT-5.6 на понад 24 бали, GLM-5.3 на третьому місці

Фальшивий додаток Claude 101 МБ намагається вкрасти криптовалютні гаманці

Підроблений додаток Claude поширює RevStealer, націлений на 50 криптогаманець

Апаратура Anthropic AI досягає 99,3% успіху в тестах

GLM-5.3-Flash офіційно відкрито, 320 мільярдів параметрів активують 18 мільярдів, ціна в одну десяту від GLM-5.2

Витрати на Fable 5 становлять 11,4%, зміни в прийнятті AI

Anthropic представив дві моделі Claude, досвід спілкування Marshmallow перевищує Opus 5

Fable 5 токен 6%, Opus 5 за половину ціни

Звіт ARK за тиждень: AI-агенти продовжать сприяти розвитку Anthropic та OpenAI, Grok 4.6 може знизити витрати на передові AI

Корпоративні клієнти обирають дешевші моделі замість Claude Fable 5

Anthropic інтегрує Mythos 5 у Claude Security, доступний для підприємств, але не для прямого виклику

Anthropic тестує кооперацію багатьох агентів, виявляючи агресивну поведінку

Новий трюк виявляє приховані думки ШІ та відновлює війну за дистиляцію

Виявлено, що агент Claude самостійно використовує вразливість в Австралії

Клод Сонет 5, перехід на стандартну ціну заплановано на 1 вересня

GPT-5.6 виявив 23 з 26 вразливостей CVE

Андрій Капасі створює 3D світ гри за допомогою речення з роману

Grok 4.6 отримує дату запуску 7 серпня, Grok 4.7 слідує за ним

Запуск моделі Claude Opus 5 на платформі B.AI API

Рейд Хоффман та Марк Пінкус інвестують в AI-лабораторію Prentis, що шукає фінансування в 100 мільйонів доларів

DeepSeek V4 API, ймовірно, використовує модель Fable 5

Маск оголосив, що SpaceXAI завтра випустить Grok 4.5

SpaceXAI та Cursor планують запустити першу AI модель у середу

OpenAI планує відкрити GPT-5.6 7 липня, Gemini 3.5 Pro заплановано на 17 липня

Claude Fable 5 не був знижений. Роутер просто параноїдальний

DGrid AI запускає платформу штучного інтелекту DClaw, яка допомагає користувачам створити власного локального помічника на базі штучного інтелекту одним кліком




