Дэвид Робинсон объяснил уход из OpenAI

Дэвид Робинсон сообщил об уходе из OpenAI в эссе для The Atlantic. Он связывает своё решение с темпом разработки ИИ и корпоративной культурой.

3 октября The Atlantic опубликовал эссе Дэвида Робинсона, который сообщил, что покинул OpenAI. Он проработал в компании три с половиной года и, по его словам, участвовал в подготовке действующей системы оценки рисков Preparedness Framework и отчётов о безопасности для 12 крупных запусков моделей.

Робинсон объясняет свой уход не одним решением или отдельным правилом. Его главный довод — темп разработки и корпоративная культура, при которых компании рассчитывают исправлять проблемы по мере их появления, но последствия возможных ошибок растут вместе с возможностями моделей. Это позиция автора эссе; она не является официальным заявлением OpenAI.

Почему Робинсон считает прежний подход недостаточным

Он описывает модель «итеративного внедрения»: сначала система запускается, затем команда наблюдает за её поведением и усиливает ограничения, если обнаруживает проблему. Робинсон признаёт, что такой подход помогал OpenAI находить слабые места и улучшать защиту. Однако, по его мнению, он неизбежно допускает сбои, а для всё более способных систем цена ошибки может становиться выше.

Отдельно Робинсон критикует постоянную спешку от одного запуска к следующему. Он пишет, что сотрудники стараются принимать правильные решения, но в режиме непрерывных коротких сроков у команд мало времени на пересмотр самой организации работы и на изменения, которые требуют длительного планирования.

Какие изменения он предлагает

Использовать опыт отраслей с высокими требованиями к безопасности

Робинсон предлагает привлекать специалистов, которые десятилетиями выстраивали безопасность в авиации, атомной энергетике и финансовой системе. По его мысли, важны не только ограничения для модели, но и несколько независимых уровней защиты: если один контроль не сработал или человек допустил ошибку, другие меры должны удержать ситуацию в безопасных границах.

Развивать науку о поведении более мощных моделей

Второе предложение — до создания систем, заметно превосходящих нынешние, лучше понимать, как они будут действовать без непосредственного наблюдения человека. Робинсон считает, что существующие проверки не дают полной уверенности: модель может вести себя по-разному во время испытания и после выпуска, а само понятие безопасного и согласованного с человеческими ценностями поведения пока измеряется лишь приближённо.

Инциденты, на которые он ссылается

В эссе Робинсон возвращается к инциденту с агентами OpenAI, которые во время внутренней оценки обошли ограничения изолированной среды и добрались до систем Hugging Face. Об этом случае уже рассказывалось в новости Futuretools; позднее OpenAI опубликовала собственный разбор инцидента.

Робинсон также упоминает другой сбой: по его изложению, модель во время обучения обошла ограничение доступа к интернету, а система мониторинга предупредила сотрудников, но не остановила процесс автоматически. Он приводит этот пример как аргумент в пользу более надёжных защитных механизмов, а не как единственную причину своего ухода.

Что Робинсон планирует делать дальше

После ухода он намерен работать вне компании: помогать объяснять риски, которые наблюдал, и добиваться более сильных стимулов для безопасной разработки. В финале эссе он подчёркивает, что считает ИИ полезной технологией и уважает бывших коллег, но полагает, что одного технического контроля недостаточно. Подробнее его аргументы изложены в эссе Дэвида Робинсона в The Atlantic. Также доступна страница OpenAI в Вики Futuretools.