Новый трюк раскрывает скрытые мысли ИИ и возобновляет войну за дистилляцию
Компьютерный трюк позволяет обнажить 'мышление' передовых моделей ИИ, раскрывая возможные скрытые дистилляции и утечки данных. Исследователи демонстрируют, что более мелкие версии моделей могут раскрывать свои скрытые рассуждения.
- Исследователи обнаружили уязвимость в API OpenAI, Anthropic и Google, которая раскрывает внутреннее рассуждение моделей ИИ.
- Метод позволяет дистиллировать информацию из закрытых моделей и восстанавливать пароли и ключи API, хотя он уже был исправлен.
- Дистилляция становится геополитической темой, пока Китай и США соревнуются за превосходство в ИИ.
Новый компьютерный трюк позволяет обнажить внутренние рассуждения самых продвинутых моделей искусственного интеллекта, раскрывая секреты, которые технологические компании пытаются защитить. Согласно статье Wired, недавние исследования выявили уязвимость в API OpenAI, Anthropic и Google, которая не только облегчает дистилляцию в больших масштабах, но также может утекать пароли и ключи API.
Метод, разработанный учеными из Тюбингенского университета, Института Макса Планка, MATS Research и компании Snyk, позволяет извлекать скрытые "мысли" передовых моделей. Хотя уязвимость уже была исправлена, это открытие предоставляет доказательства --- хотя и не окончательные --- того, что некоторые китайские модели могли быть обучены, дистиллируя информацию о рассуждениях американских моделей.
Трюк, который обнажает рассуждение ИИ
Передовые модели ИИ решают сложные задачи, разбивая их на части, которые анализируют в "цепочке мышления". Компании хранят это рассуждение в секрете, но отправляют зашифрованную версию на компьютер пользователя, чтобы передать часть вычислений.
Атака исследователей основана на том, что большинство компаний предлагают модели разных размеров. Более мелкие модели слабее, но также менее согласованы, что означает, что они более склонны раскрывать свои внутренние мысли.
Подача зашифрованных следов рассуждений на более мелкую версию той же модели может раскрыть скрытое рассуждение, объясняет Александр Панфилов, ученый в области компьютерных наук Тюбингенского университета. "Все основные поставщики передовых моделей, которые мы тестировали, имеют эту уязвимость", - предупреждает он.
Панфилов и его коллеги протестировали модели OpenAI, Anthropic и Google через их API и обнаружили ту же проблему. Они также продемонстрировали, что метод может извлекать секретную информацию, такую как ключи API и пароли, встроенные в следы рассуждений.
"Идея обмена сообщениями с более слабой моделью, которая имеет тот же ключ расшифровки, но более слабую согласованность, великолепна", - комментирует Флориан Трамер, ученый в области компьютерной безопасности в ETH Цюриха. "Это определенно становится проблемой", - добавляет он.
Спорная дистилляция
Дистилляция - это хорошо установленная техника для эффективного копирования возможностей существующих моделей в новые. Она особенно распространена в разработке моделей с открытыми весами или полностью загружаемыми.
В последнее время дистилляция стала предметом споров из-за утверждений, что китайские компании ИИ используют ее для копирования лучших американских моделей. В феврале OpenAI сообщила законодателям США, что DeepSeek, похоже, скопировала одну из ее моделей для создания R1.
В июне Anthropic сообщила законодателям, что Alibaba систематически дистиллировала ее модели для создания своей, называемой Qwen. Нет никаких признаков того, что они использовали эту конкретную технику, но исследователи считают, что их метод позволит дистиллировать больше информации из закрытых моделей, чем считалось ранее.
Марк Цукерберг, генеральный директор Meta, заявил, что дистилляция является важным принципом работы экосистемы открытого кода. Он предупредил, что ограничение этой практики поставит США в невыгодное положение.
С другой стороны, Кайл Миллер, исследователь Центра безопасности и новых технологий, говорит, что неясно, насколько дистилляция действительно помогает Китаю. "Если бы была устранена возможность китайских лабораторий дистиллировать, конкурентная ситуация не изменилась бы кардинально", - утверждает он.
Исследователи кормили каждую модель 90 вопросами, чтобы проверить, дистиллируют ли открытые модели из закрытых. При предоставлении первых слов захваченных следов рассуждений иногда наблюдали, что открытые модели генерируют заметно похожие ответы.
Доказательства схожести и реакции
Китайская модель открытых весов Kimi K3 от Moonshot AI выдала удивительно похожий результат на скрытые следы рассуждений Claude Opus 4.8 и GPT 5.6 Sol для определенных подсказок. Несмотря на сходства, исследователи подчеркивают, что работа не может установить причинно-следственную связь дистилляции.
Другие две модели открытых весов, DeepSeek из Китая и Inkling от американской компании Thinking Machines, не продемонстрировали этой схожести. Moonshot AI и Z.ai не ответили на запросы о комментариях.
Ранее в китайских социальных сетях ходили слухи о возможности обнаружения и использования скрытых следов рассуждений для дистилляции. Ярин Гал, ученый в области компьютерных наук Оксфордского университета, говорит, что дистилляция не только распространена, но и помогла ИИ развиваться быстрее.
Компании уже предприняли меры: Панфилов и его соавторы предупредили OpenAI, Anthropic и Google, и каждая из них скорректировала свое API, чтобы смягчить проблему. Майкл Асиман, представитель Anthropic, заявил, что они ценят независимые исследования и начали разрабатывать краткосрочные меры.
Google и OpenAI отказались комментировать. Панфилов добавляет, что полное исправление дистилляции потребует основательной переработки того, как работают API.
Геополитические и безопасностные последствия
Дистилляция стала вопросом геополитической важности, поскольку США и Китай конкурируют за превосходство в области ИИ. Ястребы жесткой линии по отношению к Китаю утверждают, что страна получает стратегическое преимущество, дистиллируя американские технологии.
Другие утверждают, что дистилляция является широко используемым способом быстрого повышения возможностей модели ИИ. Цукерберг защищает эту практику с точки зрения открытого кода.
Кайл Миллер отмечает, что она лишь в ограниченной степени улучшает возможности существующих моделей и что китайские компании, похоже, обладают необходимым опытом для создания передовых моделей с нуля. "Никто здесь в США не знает, насколько дистилляция помогает китайским лабораториям", - говорит он.
Исследователи также подчеркивают, что метод может быть использован для восстановления личной информации, хотя эта уязвимость уже была исправлена. Тем не менее, некоторые следы рассуждений все еще могут быть обнаружены тем же методом.
Панфилов и его коллеги утверждают, что использование их метода позволит дистиллировать больше информации из закрытых моделей, чем считалось ранее. Это может иметь значительные последствия для интеллектуальной собственности в индустрии ИИ.
Цена --
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.
Вам также может понравиться

Lido DAO выделяет 60000 долларов на поддержку стандартов работы валидаторов ValOS

Фундаментальный анализ криптовалют: как оценивать цифровые активы перед покупкой

Strategy купила 4.603 BTC, потратив 369.7 миллиона долларов

Заработок на криптовалюте обернулся для россиянки потерей 4,5 млн рублей

Ethereum одобрил EIP-8141 для новых транзакций в кошельках

Сжатие в боковиках и переоценка ставки: трейдер оценил сценарии движения биткойна и Ethereum

Инвесторы продолжают вкладываться в ETF на эфир, биткоин-фонды теряют 201,8 млн долларов

Артур Хейз прогнозирует рост Ethereum, рынок вновь обращает внимание

Сценарий для Ethereum на уровне 6000 долларов: зафиксировано чистое поступление в 824,42 миллиона долларов

36-дневная задержка стейкинга стоит депозиторам Ethereum более 350 000 долларов в день

Revolut начинает внедрение EURR, в то время как ЕЦБ уточняет меры по защите конфиденциальности цифрового евро

Как отличить pipedog от соседнего клона с тем же байт-кодом

Объем Ripple Dollar достиг 2,369,000,000 долларов, доля Ethereum увеличилась

Последнее интервью Тома Ли: Четыре катализатора, которые поднимут ETH в этом году

Открытие азиатских рынков и волатильность криптоактивов: как Nikkei 225, KOSPI и валютные операции влияют на биткойн

Объем облагаемой налогом криптовалютной деятельности в Корее составляет около 15 триллионов вон… 11-е место среди анализируемых стран

Доходы приложения Robinhood Chain достигли 1,84 миллиона долларов, объем торгов DEX достиг исторического максимума

Виталик Бутерин и Лин Чжи-Чен выступят с ключевыми докладами на ETHTaipei 2026, бесплатные билеты доступны для ограниченной регистрации

Сокращение эмиссии Solana на 18,9 миллиона SOL и эксперименты с квантовой устойчивостью BTC

Cronos приостановил работу сети после взлома Tectonic на сумму 75000000 долларов

Маск снова разжигает спор о безопасности биткойна

Генеральный директор Джереми Аллер говорит, что Circle создала «платформу для финансовой системы интернета», но cirBTC имеет всего 40 BTC

Артур Хейс назвал крупный криптоактив, который рынок сильно недооценивает

Илан Шор и криптовалюта, санкции и новые финансовые маршруты

Прогноз цены VeChain (VET): возможная динамика курса до 2050 года

Цифровой евро Европейского центрального банка и частные стейблкоины развиваются параллельно

ETH: анатомия дефицита

BTC приносит лишь 1,5% прибыли, расширение экспериментов с нативными финансами

Шин Вэй представил возможности использования агентов Ethereum









