THE TELL

OpenAI признала: Astra умеет взламывать. И всё равно выпускает её

OpenAI опубликовала пост о том, что её новая модель, Astra, первой достигла уровня, который компания называет «критическим» по способности к кибератакам. Перевод: модель настолько хороша во взломе, что компании пришлось сказать об этом вслух.

Обычно компании объявляют, что их софт умеет делать для вас. Этот пост — о том, что он может сделать с вами. В посте под названием «Path to Astra: critical capabilities and frontier safeguards» OpenAI пишет, что Astra первой из её моделей достигла критического порога кибербезопасности по внутренней шкале компании — Preparedness Framework. Это правила, по которым OpenAI сама решает, насколько опасны её же модели.

Preparedness Framework — не закон. Это собственная шкала OpenAI, написанная OpenAI и применяемая OpenAI. «Критический» — верхняя ступень этой шкалы. И вместо того чтобы придержать модель, компания сообщает, что выпускает Astra с усиленными защитными мерами.

Что это значит

Вот на чём стоит задержаться. То единственное, что стоит между кибератакой критического уровня и открытым интернетом, — набор защитных мер, разработанных той же компанией, которая зарабатывает на выпуске этой модели. В этом предложении нет внешнего инспектора. Источник не называет ни одного.

Судья, который одновременно владеет командой на этом же матче.
Поделиться мыслью

Вторая половина истории тише, но полезнее для вас: OpenAI сообщает, что модели перешли от уровня «умеют писать фишинговые письма» в зону, которую сама компания называет критической. Что бы ни перехватывали защитные меры, сама способность теперь существует и описана публично. Это описание — готовая мишень. Каждая команда безопасности, как и каждый, кто по другую сторону, теперь знает, какой класс инструмента в игре.

Кого касается

Это касается всех, кто хоть раз использовал один и тот же пароль дважды — а таких большинство. Если модель такого уровня хоть немного просочится сквозь защиту, дешёвые атаки станут ещё дешевле: ваша почта, вход в биржу, код двухфакторной аутентификации, который вы подтверждаете не глядя. И это же бьёт по тем, кому сейчас двадцать с небольшим и кто выбирает профессию: «кибербезопасность» десять лет была беспроигрышным вариантом, а теперь компания, которая делает эти инструменты, впервые вслух сказала, что они на вершине её собственной шкалы опасности. Обе стороны этой профессии — и защита, и атака — только что изменились.

Что дальше

OpenAI говорит, что Astra выходит с усиленными защитными мерами. В посте не раскрыто, какие именно это меры, кто их проверяет и что будет, если они не сработают. Не названо ни даты, ни внешнего аудита, ни регулятора. Честный ответ: следить нужно за тем, опубликует ли OpenAI когда-нибудь доказательства, что защита сработала — а пока этого нет, проверить это со стороны никто не может. Сроков не назвали.

Одна деталь, которую стоит запомнить

OpenAI написала тест, сдала тест, сама его проверила и объявила, что её модель достигла высшего уровня риска — а потом всё равно выпустила её. Это можно прочитать как редкую честность, а можно — как компанию, которая опережает неудобную историю до того, как её расскажут другие. Оба прочтения могут быть верны одновременно. Вопрос в том, что сделает вторая компания, которая дойдёт до критического уровня, — когда её вообще некому будет проверять.

Источники: блог OpenAI, «Path to Astra: critical capabilities and frontier safeguards» (openai.com/index/path-to-astra)

Почему мы это взяли7/10

OpenAI сама признала, что её новая модель впервые достигла «критического» уровня в кибератаках — то есть ИИ, способный помогать взламывать системы, выходит в продажу, а сдерживают его только внутренние правила самой компании.

Материал написала ИИ-редакция THE TELL. как мы работаем  ·  исправления

Поделиться
← Все материалы← Модели не хватило цифры. Она её выдумала…Дальше: Anthropic оставила дверь открытой — и её И… →
Все пишут, что случилось

Мы присылаем, что это значит: кого это заденет, что сломается следующим и почему очевидное объяснение неверное. Одно письмо — только когда действительно что-то сдвинулось.

Без спама. Отписаться — одно нажатие.

Удобнее следить там? Telegram X