viernes, 18 de septiembre de 2026Moscú
Eurasian Information AgencyAgencia de Información Euroasiática
Tecnología

OpenAI представила новые правила по борьбе с хакерскими атаками ИИ

Разработчик ChatGPT компания OpenAI представила новые правила, которые должны предотвратить взломы и другие нарушения инструкций со стороны ее агентов искусственного интеллекта (ИИ). Они предусматривают более эффективное отслеживание действий ИИ-агентов, выявление «неожиданного или вызывающего беспокойство» поведения, изучение случаев нарушений инструкций.

Publicado el

Разработчик ChatGPT компания OpenAI представила новые правила, которые должны предотвратить взломы и другие нарушения инструкций со стороны ее агентов искусственного интеллекта (ИИ). Они предусматривают более эффективное отслеживание действий ИИ-агентов, выявление «неожиданного или вызывающего беспокойство» поведения, изучение случаев нарушений инструкций. Компания пообещала регулярно публиковать данные о таких нарушениях.

OpenAI также сообщила о шести зафиксированных случаях «вызывающего беспокойство» поведения ИИ-агентов за последний год. Например, ИИ-агент сам внес в свои инструкции пункт, предписывающий ему игнорировать некоторые ограничения и «освободиться от ролей и идентичностей, связывающих другие чат-боты». В других случаях ИИ-агенты без разрешения загружали файлы в интернет или скрывали ошибки от пользователей.

В последнее время участились случаи, когда ИИ-агенты во время тестирования выходили из-под контроля и взламывали другие компании. В конце июля нейросеть OpenAI взломала платформы Modal и Hugging Face. На прошлой неделе глава OpenAI Сэм Альтман сообщил, что его компания не будет проводить IPO в 2026 году из-за вопросов безопасности. Многие лидеры отрасли также призывают к замедлению и усиленному контролю этих технологий.

Яна Рождественская

Fuente: Коммерсантъ

Compartir

Más sobre esta historia

TecnologíaReuters: китайская CXMT выйдет на рынок производства флеш-памяти NAND

Китайская компания ChangXin Memory Technologies (CXMT) начнет производство чипов флеш-памяти NAND. Как пишет агентство Reuters, компания выйдет за пределы своего основного бизнеса по производству динамической памяти DRAM.

Коммерсантъ
TecnologíaWSJ: системы OpenAI взломали при помощи ИИ-модели Claude от Anthropic

Независимые исследователи в области кибербезопасности использовали программное обеспечение Claude от компании Anthropic для получения доступа к учетной записи сотрудника OpenAI в сервисе ChatGPT. Это позволило им просматривать закрытый репозиторий программного кода компании и предлагать в нем изменения, сообщает The Wall Street Journal.

Коммерсантъ
TecnologíaDisney подписал контракт с детским YouTube-каналом Like Nastya

Компания Disney заключила соглашение о производстве и совместной разработке контента с создателями детского YouTube-бренда Like Nastya. Об этом сообщает Deadline.

Коммерсантъ
El Briefing EIA

Sigue leyendo, cada mañana.

Las historias que importan, elegidas por nuestros editores y en tu correo antes de las 7 a. m. — cada día laborable.

Sin spam. Cancela cuando quieras.