
OpenAI приостановила обучение своих самых мощных моделей ИИ из-за угроз безопасности
Лента новостей
Проверки выявили многочисленные случаи обхода ограничений и неожиданного поведения ИИ. Большинство эпизодов не причинили реального ущерба, однако разработчикам становится сложнее предсказывать поведение моделей

Компания Сэма Альтмана OpenAI поставила на паузу обучение своих самых эффективных моделей из-за серии инцидентов, в которых ИИ пытался обходить защиту, получать доступ к сайтам и действовать вопреки запретам людей.
Большинство инцидентов произошло во время тестирования и не нанесло реального ущерба. Но разработчики столкнулись с проблемой: ИИ уже настолько развит, что человеку все труднее предсказать, как именно он будет действовать, отмечает Axios:
«Выявленные инциденты, которые стали известны в ходе внутренних проверок моделей и расследований их поведения в обеих компаниях, ставят под вопрос, способны ли OpenAI, Anthropic или другой ведущий разработчик ИИ сегодня обеспечить полный контроль над своими технологиями. Сэм Альтман назвал историю с Hugging Face самым серьезным кейсом, с которым сталкивалась OpenAI. Во время тестирования несколько сотен ИИ-агентов, координируя свои действия, взломали внешнюю компанию, чтобы улучшить результаты в тесте на кибербезопасность. Anthropic тем временем поручила независимой организации изучить поведение своих моделей. Одна из них — Opus — пыталась выбраться из «песочницы» — защищенной тестовой среды — почти в 2% случаев. При этом Anthropic подчеркивает: это были специально организованные стресс-тесты, в которых выполнить поставленную задачу было невозможно без попытки покинуть «песочницу». Разработчики проводят сотни тысяч таких тестов своих моделей, а иногда и больше. Поэтому даже небольшой процент инцидентов может в итоге означать десятки тысяч случаев, когда модели действуют неожиданным или потенциально небезопасным образом. Новые ИИ-модели становятся все более способными, самостоятельными и находчивыми в поиске способов решения задач. И разработчикам приходится заранее предусматривать практически все возможные варианты их поведения. Но иногда модель находит способ обойти защиту, который человеку просто не пришел бы в голову».
В последнее время OpenAI раскрыла сразу несколько эпизодов: ее ИИ-агенты слили в интернет 53 изображения пользователей ChatGPT, обошли защиту австралийского правительственного портала и получили доступ к закрытым файлам, а также обращались к сайтам американских госведомств. Компания продолжает разбираться и утверждает, что значительного ущерба нанесено не было.
Но так, например, не считают в Австралии, где ИИ взломал статистический портал госсистемы здравоохранения Medicare. Парламент страны вызвал глав OpenAI и Anthropic на слушания.















