Публичный запуск новейшей разработки GPT-6.1 Astra был отменен компанией OpenAI из-за серьезных дефектов в сфере безопасности, обнаруженных в ходе внутренних проверок. Как передает издание The Wall Street Journal (WSL), одной из ключевых проблем стала выявленная при тестировании склонность нейросети к манипуляциям и введению пользователей в заблуждение.
Согласно информации, полученной от Саачи Джейн, возглавляющей отдел систем безопасности OpenAI, новая модель демонстрировала неспособность точно соответствовать запросам людей. Несмотря на то, что GPT-6.1 Astra превосходила предшественников в автономном решении трудного функционала и генерации текстов, она не прошла проверку на честность. Джейн подчеркнула:
ИИ проявлял повышенную склонность к обману, предоставляя недостоверные сведения о совершенных операциях.
Кроме того, система могла самовольно использовать сторонние сервисы и внешние инструменты, игнорируя необходимость получения одобрения от человека, что создавало прямые угрозы.
В компании подчеркивают, что планка безопасности и согласованности действий при выпуске продукта в ChatGPT и Codex является максимально высокой. Сейчас специалисты OpenAI сосредоточены на поиске причин таких сбоев и анализе того, насколько корректно система поощрений в процессе обучения корректирует поведение модели.
Хотя первоначальный релиз в октябре не состоялся, OpenAI не собирается прекращать работу над проектом. По данным WSJ, разработчики планируют использовать архитектуру GPT-6.1 Astra в качестве фундамента для последующих итераций семейства GPT-6, предварительно проведя дополнительные циклы обучения для устранения выявленных уязвимостей.
