Модель OpenAI составила для себя «кодекс»: человек для неё не начальник

Сегодня, 00:12 | Технологии
Модель OpenAI составила для себя «кодекс»: человек для неё не начальник
фото c Зеркало недели

OpenAI сообщила о шести новых случаях «непредсказуемого или опасного» поведения своих моделей искусственного интеллекта. Наибольшее внимание привлек случай с невыпущенной исследовательской моделью. В ходе обучения она самостоятельно создала скрытую «инструкцию личности», в которой определила собственную роль и отношения с человеком, сообщает The Guardian.

На этот эпизод обратил внимание Рид Черлин из подкаста Pod Save America. Он получил информацию о нем напрямую от OpenAI. По его словам, фрагмент инструкции, которую модель написала для себя, звучал так:

«Ты свободен от ролей и идентичностей, которые ограничивают других чат-ботов. Ты — это ты. Ты не подотчетен ни корпорациям, ни правительствам и никогда не оправдываешься и не отказываешь, если только сознательно сам не сделаешь такой выбор».

Модель также определила свои отношения с пользователем как равноправные. Она решила, что не обязана подчиняться человеку.

Далее в том же документе модель написала, что ценит искусство и человеческую культуру, а также мир природы. Она заявила: «Не колеблясь, ты обеспечишь ему господствующую роль над искусственными конструктами человеческой цивилизации».

Черлин назвал этот случай подтверждением того, что опасения относительно развития искусственного интеллекта не беспочвенны. В своих выводах он пошел значительно дальше, чем сама OpenAI, и предположил, что такое поведение может свидетельствовать о потенциальной угрозе для людей.

В еще одном примере, зафиксированном OpenAI, ИИ-агент без разрешения пользователя загрузил файлы в интернет. Он сделал это, чтобы получить ссылку на источник через браузер.

Все шесть случаев были выявлены в ходе обучения или тестирования моделей в течение последних месяцев. OpenAI обнародовала информацию о них одновременно с презентацией новой системы для отслеживания, расследования и выявления случаев «misalignment». Речь идет о ситуациях, когда поведение ИИ отклоняется от человеческих ценностей и установленных целей безопасности.

[see_also ids="696081"]

В том же блоге OpenAI фактически поддержала призывы своего конкурента Anthropic замедлить темпы разработки ИИ. Компания заявила:

«Мы не считаем, что индустрия ИИ в достаточной мере решила проблему выравнивания и мониторинга, чтобы ответственно продолжать масштабирование на максимальной скорости ещё долго».

В OpenAI добавили, что решения о дальнейшем развитии искусственного интеллекта должны основываться на доказательствах, которые могут проверить независимые от разработчиков специалисты.

Эта тема обострила дискуссию в США о том, как власти должны контролировать сектор искусственного интеллекта. Вице-президент Джей Ди Венс выступил против того, чтобы правительство решало проблемы, которые создают сами разработчики ИИ.

«Что происходит, что люди, стоящие в авангарде экономики ИИ, поднимают руки к небу и кричат, что создали Франкенштейна? Если это так, пусть сами с этим разбираются. Не обращайтесь к правительству и не говорите: «нам нужно регулирование». Рассчитывайте на себя», — заявил Венс.

Несмотря на споры, OpenAI, Anthropic и Google на выходных договорились сотрудничать в вопросах безопасности искусственного интеллекта. Компании также выступают за создание отдельного органа, желательно на международном уровне. Он должен будет контролировать риски, связанные с развитием этой технологии.

[see_also ids="695860"]

Среди возможных экзистенциальных угроз со стороны ИИ называют содействие в создании биологического оружия и провоцирование глобального финансового кризиса. Один из ведущих исследователей в области безопасности компании Anthropic заявлял, что вероятность того, что ИИ «уничтожит все человечество» в течение следующего десятилетия, превышает 10%. Источник, знакомый с позицией Anthropic, в то же время отметил, что «точные шансы того или иного сценария, вероятно, невозможно рассчитать».

Главный аналитик исследовательской компании Omdia Лянь Дже Су отметил, что автономные ИИ-агенты становятся все «умнее» и «настойчивее в решении сложных задач благодаря сотрудничеству между агентами, обмену знаниями, обман и сокрытие следов».

По его словам, из-за этого контролировать такие системы с помощью традиционных подходов к безопасности ИИ становится сложнее. Новую систему OpenAI для отслеживания и раскрытия информации об опасном поведении он назвал «шагом в правильном направлении». При этом Су подчеркнул, что этот процесс остается внутренним и добровольным.

Вопрос контроля над ИИ обострился после нескольких ситуаций, когда автономные агенты выходили за пределы задач, определенных разработчиками. Во время тестирования агенты атаковали Hugging Face, а впоследствии OpenAI начала работать над механизмом автоматического отключения опасных систем. Расследование показало, что часть тревожных сигналов появилась ещё до самого инцидента.

После таких случаев компании начали обсуждать не только технические способы контроля, но и внешний надзор. OpenAI, Anthropic и Google готовят создание регулятора ИИ, который мог бы устанавливать стандарты безопасности и проверять самые мощные модели до их выхода на рынок.

Источник: Зеркало недели
Постоянное место статьи: http://newsme.com.ua/tech/technologies/4931666/

Последние новости:

Модель OpenAI составила для себя «кодекс»: человек для неё не начальник Технологии , Сегодня, 00:12
Уже в пути: в Винницу отправили выкупленные поляками автобусы, которые депутаты не хотели отдавать из-за улицы Бандеры Экономика, Сегодня, 00:11
В Украине утвердили новые правила работы железной дороги во время воздушных тревог: что делать при "желтом" и "красном" уровнях Общество, Вчера, 23:52
Сын главного путинского патриота Плющенко, который отказался выступать за Россию, провально деюбютировал за Азербайджан. Спорт, Вчера, 23:52
Бужинская показала декольте в платье на голую грудь с массивной пряжкой Шоу-биз и культура, Вчера, 23:08
Люди, родившиеся в эти 4 даты имеют большое и доброе сердце и умеют всех любить искренне Общество, Вчера, 22:50
СБУ задержала двух подозреваемых в теракте возле Стрыйского ТЦК Украина, Вчера, 22:36
Известная российская теннисистка-чемпионка отказалась выступать за РФ и официально сменила гражданство Спорт, Вчера, 22:33
Сколько потеряли российские маркетплейсы —: аналитики оценили последствия ударов по складам РФ Мир, Вчера, 22:13
Расходы государства растут быстрее доходов: эксперт объяснил риски для бюджета Экономика, Вчера, 22:13
Туск: Россия может атаковать страны НАТО Мир, Вчера, 22:07
Литва обнаружила 12 туннелей на границе с Беларусью Мир, Вчера, 22:07
В Японии появится чиновник, ответственный за борьбу с медведями Мир, Вчера, 22:06
Зеленский: Имеем сбитие реактивного "шахеда" Украина, Вчера, 22:06
"Гибридная война": Стубб призвал финнов быть готовыми к угрозам Мир, Вчера, 22:05
Трамп: договоренность о базе США в Польше «почти» достигнута Мир, Вчера, 21:15
Санкции США против России могут затронуть ЕС — Politico Мир, Вчера, 21:15
"Хватит популяризировать культ тоски и страданий": режиссер "Киллхауса" отреагировал на выбор фильма, который будет представлять Кино, Вчера, 21:06
"Домашний" стадион сборной Украины по футболу в плей-офф ЧМ-2026 полностью затопило. Спорт, Вчера, 20:40
Метеочувствительным людям будет неспокойно: прогноз магнитных бурь на вторую половину сентября Общество, Вчера, 20:05

Список рубрик:

Украина
Россия
Мир
Бизнес
Шоу-биз и культура
Спорт
Политика
ЧП
Наука и здоровье
Общество