Новий трюк виявляє приховані думки ШІ та відновлює війну за дистиляцію
**Комп'ютерний трюк дозволяє оголити "мислення" моделей передового ШІ, розкриваючи можливі приховані дистиляції та витоки даних. Дослідники демонструють, що менші версії моделей можуть виявити їх приховані міркування.
- Дослідники виявили вразливість в API OpenAI, Anthropic та Google, яка відкриває внутрішнє міркування моделей ШІ.
- Метод дозволяє дистилювати інформацію з закритих моделей та відновлювати паролі і ключі API, хоча вже був виправлений.
- Дистиляція стає геополітичною темою, оскільки Китай і США змагаються за перевагу в ШІ.
Новий комп'ютерний трюк дозволяє оголити внутрішні міркування найбільш просунутих моделей штучного інтелекту, розкриваючи секрети, які технологічні компанії намагаються захистити. Згідно зі статтею Wired, нещодавні дослідження виявили вразливість в API OpenAI, Anthropic та Google, яка не лише полегшує дистиляцію в масштабах, але також може витікати паролі та ключі API.
Метод, розроблений вченими з Університету Тюбінгена, Інституту Макса Планка, MATS Research та компанії Snyk, дозволяє витягувати "приховані думки" передових моделей. Хоча вразливість вже була виправлена, знахідка пропонує докази --- хоча й не остаточні --- того, що деякі китайські моделі могли бути навчені, дистилюючи інформацію про міркування з американських моделей.
Трюк, що оголює міркування ШІ
Передові моделі ШІ вирішують складні проблеми, розділяючи їх на частини, які аналізують у "ланцюгу думок". Компанії зберігають це міркування в секреті, але надсилають зашифровану версію на комп'ютер користувача, щоб передати частину обчислень.
Атака дослідників базується на тому, що більшість компаній пропонують моделі різних розмірів. Менші моделі є слабшими, але також менш узгодженими, що означає, що вони більш схильні розкривати свої внутрішні думки.
Подача зашифрованих слідів міркування на меншу версію тієї ж моделі може розкрити приховане міркування, пояснює Олександр Панфілов, комп'ютерний вчений з Університету Тюбінгена. "Усі основні постачальники моделей передового рівня, які ми тестували, мають цю вразливість", - застерігає він.
Панфілов та його колеги протестували моделі OpenAI, Anthropic та Google через їх API і виявили ту ж проблему. Вони також продемонстрували, що метод може витягувати секретну інформацію, таку як ключі API та паролі, вбудовані в сліди міркування.
"Ідея обміну повідомленнями з варіантом моделі, що є слабшим, але має той же ключ розшифровки, але слабшу узгодженість, є геніальною", - коментує Флоріан Трамер, вчений з безпеки комп'ютерних систем в ETH Цюріх. "Це безумовно стає проблемою", - додає він.
Контроверсія дистиляції
Дистиляція є добре встановленою технікою для ефективного копіювання можливостей існуючих моделей до нових. Вона особливо поширена в розробці моделей з відкритими вагами або повністю завантажуваними.
Останнім часом дистиляція стала контроверсійною темою через заяви про те, що китайські компанії ШІ використовують її для копіювання кращих американських моделей. У лютому OpenAI повідомила законодавцям США, що DeepSeek, здається, скопіювала одну з її моделей для створення R1.
У червні Anthropic повідомила законодавцям, що Alibaba систематично дистилювала їх моделі для створення своєї, яка називається Qwen. Немає ознак того, що вони використовували цю конкретну техніку, але дослідники вважають, що їх метод дозволить дистилювати більше інформації з закритих моделей, ніж вважалося раніше.
Марк Цукерберг, генеральний директор Meta, заявив, що дистиляція є важливим принципом того, як працює екосистема відкритого коду. Він попередив, що обмеження цієї практики поставить США в невигідне становище.
З іншого боку, Кайл Міллер, дослідник Центру безпеки та нових технологій, говорить, що неясно, наскільки дистиляція насправді допомагає Китаю. "Якщо б було усунено можливість китайських лабораторій дистилювати, конкурентна ситуація не змінилася б кардинально", - стверджує він.
Дослідники підгодовували кожну модель 90 запитаннями, щоб перевірити, чи дистилюють моделі з відкритими вагами з закритих. Коли вони давали перші слова слідів міркувань, іноді вони помічали, що відкриті моделі генерують помітно схожі відповіді.
Докази схожості та реакції
Китайська модель з відкритими вагами Kimi K3 від Moonshot AI дала вихід, який виявився дивовижно схожим на сліди міркувань закритих моделей Claude Opus 4.8 та GPT 5.6 Sol для певних запитів. Незважаючи на схожість, дослідники зазначають, що робота не може встановити причинно-наслідковий зв'язок дистиляції.
Інші дві моделі з відкритими вагами, DeepSeek з Китаю та Inkling від американської компанії Thinking Machines, не продемонстрували такої схожості. Moonshot AI та Z.ai не відповіли на запити про коментарі.
Раніше в китайських соціальних мережах були спекуляції щодо можливості виявлення та використання слідів міркувань для дистиляції. Ярін Гал, комп'ютерний вчений з Оксфордського університету, говорить, що дистиляція не лише поширена, але й допомогла прискорити розвиток ШІ.
Компанії вже вжили заходів: Панфілов та його співавтори попередили OpenAI, Anthropic та Google, і кожна з них налаштувала своє API, щоб пом'якшити проблему. Майкл Ачіман, речник Anthropic, сказав, що вони цінують незалежні дослідження та почали розробляти короткострокові заходи.
Google та OpenAI відмовилися коментувати. Панфілов додає, що повне виправлення дистиляції вимагатиме фундаментального перегляду способу, яким працюють API.
Геополітичні та безпекові наслідки
Дистиляція стала питанням геополітичної важливості, оскільки США та Китай змагаються за перевагу в ШІ. Яструби жорсткої лінії щодо Китаю стверджують, що країна отримує стратегічну перевагу, дистилюючи американські технології.
Інші вважають, що дистиляція є широко використовуваним способом швидко підвищити можливості моделі ШІ. Цукерберг захищає цю практику з точки зору відкритого коду.
Кайл Міллер зазначає, що це лише покращує можливості існуючих моделей в обмеженій мірі, і що китайські компанії, здається, мають досвід, необхідний для створення передових моделей з нуля. "Ніхто тут, у США, не знає, наскільки дистиляція вигідна китайським лабораторіям", - говорить він.
Дослідники також підкреслюють, що метод може бути використаний для відновлення особистої інформації, хоча ця вразливість вже була виправлена. Проте деякі сліди міркувань все ще можуть бути виявлені тим же методом.
Панфілов та його колеги стверджують, що використання їхнього методу дозволить дистилювати більше інформації з закритих моделей, ніж вважалося раніше. Це може мати значні наслідки для інтелектуальної власності в індустрії ШІ.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Circle випустила 5 млрд USDC за тиждень: крипторинок знову чекає альтсезон

Криптофонди: 3,2 мільярда доларів за тиждень, Bank of America не бачила цього з жовтня 2025 року

Що варто зберігати: Розрив на залишках, розпад і дилема колекціонера

Lido DAO виділяє 60000 доларів на підтримку стандартів роботи валідаторів ValOS

Фундаментальний аналіз криптовалют: як оцінювати цифрові активи перед покупкою

Strategy витратила 369,7 мільйона доларів на купівлю 4.603 BTC

Заробіток на криптовалюті обернувся для росіянки втратою 4,5 млн рублів

Ethereum затверджує EIP-8141 для нових транзакцій у гаманцях

Стиснення в боковиках і переоцінка ставки: трейдер оцінив сценарії руху біткоїна та Ethereum

Інвестори продовжують вкладатися в ETF на ефір, біткоїн-фонди втрачають 201,8 млн доларів

Від Pay до універсального управління активами: BiyaPay розширює межі глобальних фінансових послуг

Артур Хейс прогнозує зростання Ethereum, ринок знову звертає увагу

Сценарій для Ethereum на 6 000 доларів: зафіксовано чистий приплив у 824,42 мільйона доларів

36-денний гальмування стейкінгу коштує депозиторам Ethereum понад 350 000 доларів у втрачених винагородах щодня

Revolut починає впровадження EURR, оскільки ЄЦБ деталізує заходи конфіденційності цифрового євро

Як відрізнити pipedog від сусіднього клонованого контракту з тим же байт-кодом

Постачання Ripple Dollar досягло 2,369 мільярдів доларів, зростання частки Ethereum

Останнє інтерв'ю Тома Лі: Чотири каталізатори, які підштовхнуть ETH до зростання цього року

Відкриття азійських ринків та волатильність криптоактивів: як Nikkei 225, KOSPI та торгівля з використанням йени впливають на біткоїн

Чистий приплив до ETF на базі Ethereum склав 824 мільйони доларів за минулий тиждень, BlackRock ETHA очолив з 567 мільйонами доларів

Чистий приплив до ETF на базі Ethereum склав 824 мільйони доларів за минулий тиждень, BlackRock ETHA лідирує з 567 мільйонами доларів

Обсяг оподатковуваної криптовалютної діяльності в Кореї становить близько 15 трильйонів вон… 11-е місце серед країн-аналізу

Дохід від застосунку Robinhood Chain досяг 1,84 мільйона доларів, обсяги торгівлі DEX досягли історичного максимуму

Віталік Бутерін та Лін Чжі-Чен виступлять з ключовими доповідями на ETHTaipei 2026, безкоштовні квитки доступні для обмеженої реєстрації

Скорочення випуску Solana на 18,9 мільйона SOL... Експеримент з квантовою стійкістю BTC

Cronos зупинив мережу після експлуатації Tectonic, що вплинула на 75000000 доларів

Маск знову розпалює суперечку про безпеку біткоїна

Генеральний директор Джеремі Аллер заявляє, що Circle створила «платформу для фінансової системи Інтернету», але cirBTC має лише 40 BTC

Артур Хейс назвав великий криптоактив, який ринок сильно недооцінює









