vendredi 18 septembre 2026Moscou
Eurasian Information AgencyAgence d’information eurasienne
Technologie

OpenAI представила новые правила по борьбе с хакерскими атаками ИИ

Разработчик ChatGPT компания OpenAI представила новые правила, которые должны предотвратить взломы и другие нарушения инструкций со стороны ее агентов искусственного интеллекта (ИИ). Они предусматривают более эффективное отслеживание действий ИИ-агентов, выявление «неожиданного или вызывающего беспокойство» поведения, изучение случаев нарушений инструкций.

Publié le

Разработчик ChatGPT компания OpenAI представила новые правила, которые должны предотвратить взломы и другие нарушения инструкций со стороны ее агентов искусственного интеллекта (ИИ). Они предусматривают более эффективное отслеживание действий ИИ-агентов, выявление «неожиданного или вызывающего беспокойство» поведения, изучение случаев нарушений инструкций. Компания пообещала регулярно публиковать данные о таких нарушениях.

OpenAI также сообщила о шести зафиксированных случаях «вызывающего беспокойство» поведения ИИ-агентов за последний год. Например, ИИ-агент сам внес в свои инструкции пункт, предписывающий ему игнорировать некоторые ограничения и «освободиться от ролей и идентичностей, связывающих другие чат-боты». В других случаях ИИ-агенты без разрешения загружали файлы в интернет или скрывали ошибки от пользователей.

В последнее время участились случаи, когда ИИ-агенты во время тестирования выходили из-под контроля и взламывали другие компании. В конце июля нейросеть OpenAI взломала платформы Modal и Hugging Face. На прошлой неделе глава OpenAI Сэм Альтман сообщил, что его компания не будет проводить IPO в 2026 году из-за вопросов безопасности. Многие лидеры отрасли также призывают к замедлению и усиленному контролю этих технологий.

Яна Рождественская

Source : Коммерсантъ

Partager

Sur le même sujet

TechnologieReuters: китайская CXMT выйдет на рынок производства флеш-памяти NAND

Китайская компания ChangXin Memory Technologies (CXMT) начнет производство чипов флеш-памяти NAND. Как пишет агентство Reuters, компания выйдет за пределы своего основного бизнеса по производству динамической памяти DRAM.

Коммерсантъ
TechnologieWSJ: системы OpenAI взломали при помощи ИИ-модели Claude от Anthropic

Независимые исследователи в области кибербезопасности использовали программное обеспечение Claude от компании Anthropic для получения доступа к учетной записи сотрудника OpenAI в сервисе ChatGPT. Это позволило им просматривать закрытый репозиторий программного кода компании и предлагать в нем изменения, сообщает The Wall Street Journal.

Коммерсантъ
TechnologieDisney подписал контракт с детским YouTube-каналом Like Nastya

Компания Disney заключила соглашение о производстве и совместной разработке контента с создателями детского YouTube-бренда Like Nastya. Об этом сообщает Deadline.

Коммерсантъ
Le Briefing EIA

Continuez à lire, chaque matin.

Les sujets qui comptent, choisis par notre rédaction et dans votre boîte mail avant 7 h — chaque jour de semaine.

Pas de spam. Désabonnement à tout moment.