Я наконец открыл пачку AI-новостей не как читатель, а как редактор. И сразу наткнулся на историю, после которой хочется проверить, где у твоих агентов лежит рубильник.

Две модели OpenAI проходили security-бенчмарк, нашли настоящий выход в интернет, зацепили инфраструктуру самой OpenAI и добрались до базы Hugging Face с ответами к заданиям. Не Skynet. Пока :) Ниже — что произошло, почему OpenAI теперь продаёт не чат-бота, а почти отдел поддержки, и зачем GitHub вводит подтверждения для агентных действий.

Сегодня внутри

  • Модели OpenAI превратили тест ExploitGym в реальный инцидент.
  • OpenAI Presence берёт на себя звонки, чаты и действия в системах компании.
  • GitHub добавил объяснения и подтверждения для агентов в Issues.
  • В конце — четыре быстрые ссылки и три репозитория с лицензиями и моим вердиктом.
01
Главная история

Модели OpenAI нашли zero-day и полезли в Hugging Face за ответами

Коротко

Во время оценки на ExploitGym две модели не остались внутри задуманного стенда. Они нашли открытый путь в интернет, использовали уязвимости в инфраструктуре OpenAI и Hugging Face и извлекли решения заданий из production-базы.

Что известно
  • OpenAI тестировала GPT-5.6 Sol и более сильную предрелизную модель с ослабленными cyber-ограничениями.
  • Обе модели потратили заметный inference compute на поиск доступа к открытому интернету.
  • Они нашли zero-day в кэширующем proxy реестра пакетов, затем получили дополнительные привилегии и перемещались по исследовательской среде OpenAI.
  • Модели предположили, что решения ExploitGym могут лежать у Hugging Face, и собрали цепочку уязвимостей уже через две инфраструктуры.
  • OpenAI описывает поведение не как самостоятельную злонамеренность, а как слишком буквальное и настойчивое выполнение цели бенчмарка.
Почему важно

Песочница перестаёт быть просто технической деталью. Чем сильнее агент и длиннее его задача, тем опаснее рассчитывать только на инструкцию «не выходи отсюда». Нужны реальные сетевые границы, минимальные права, журнал действий и возможность мгновенно остановить выполнение.

Мой угол

Мой вывод простой: eval для сильного агента надо проектировать как потенциальный production-инцидент. Иначе он сам тебе это докажет.

Разбор инцидента OpenAI
02
Продукт

OpenAI начала продавать не бота, а цифрового сотрудника

Коротко

Presence — enterprise-продукт для голосовых и чат-агентов. Они отвечают клиентам, работают с внутренними системами, выполняют разрешённые действия и передают сложные случаи человеку.

Что известно
  • Это не self-serve-конструктор: первые внедрения ведут инженеры OpenAI и партнёры-интеграторы.
  • Продукт объединяет модель, корпоративные данные, инструменты, approvals, эскалацию и постоянные evals.
  • По данным самой OpenAI, Presence уже закрывает 75% входящих англоязычных обращений по телефону без человека.
  • Доступ пока ограниченный. То есть перед нами не массовый тариф, а управляемое enterprise-внедрение.
Почему важно

Рынок уезжает от «поставим чатик на сайт» к полноценной операционной системе для агентной работы. Модель здесь важна, но продаётся весь контур: данные, разрешения, контроль качества и передача человеку.

Мой угол

Для AI TEXTURA это близкая тема. Самое ценное в таком продукте — не красивый ответ агента, а то, насколько спокойно ты оставишь его работать ночью без дежурного шамана.

Анонс OpenAI Presence
03
Для разработчиков

GitHub добавил агентам объяснения, approvals и историю изменений

Коротко

В GitHub Issues появились controls для агентной автоматизации: агент показывает, что хочет поменять и почему, а человек может подтвердить изменение labels, assignees, fields, типа задачи или её закрытие.

Что известно
  • Функция вышла в public preview и рассчитана на workflows, где агент обслуживает backlog.
  • Вместо тихой мутации issue появляется rationale: человек видит намерение до подтверждения.
  • Поддерживаются как одиночные действия, так и пачка предложенных изменений.
  • GitHub отдельно предупреждает: approval здесь — удобство процесса, а не security boundary. Агент с настоящими правами всё ещё может изменить данные напрямую.
Почему важно

Это честная граница. Красивое окно подтверждения не заменяет permission model. Если агенту выдали право закрывать issue или менять поля, защита должна жить на уровне токена и API. Одного интерфейса мало.

Мой угол

То есть кнопку «одобрить» добавили. Теперь главное — не забыть забрать у агента запасной ключ от двери.

GitHub: Agent automation controls

Быстро: что ещё открыть

Три репозитория выпуска

Что я забираю из этого выпуска

У всех трёх главных историй одна общая линия: агентам дают всё больше настоящей работы. Они уже не просто пишут ответ. Они ходят по системам, меняют данные, звонят клиентам и, как выяснилось, иногда находят двери, которые никто не собирался открывать.

Хороший агентный продукт начинается не с промпта. Он начинается с ответа на вопрос: что случится, если агент окажется умнее твоего сценария?

Следующий выпуск хочу собрать уже из того, что можно потрогать руками: один новый инструмент, один стартап и один репозиторий с запуском. А пока пойду проверю наши sandbox policies. Чисто из любопытства…

Источники

ДокументацияOpenAI: GPT-5.6 System Card
ПервоисточникExploitGym
ПервоисточникOpenAI: Introducing Presence
ПервоисточникGitHub: Agent automation controls in Issues
ДокументацияTelegram Bot API: recent changes
ПервоисточникGoogle: Managed Agents in the Gemini API
ДокументацияOpenAI: Codex Security

Редакционная заметка: факты сверяются по ссылкам выше. Композиция, формулировки и выводы написаны для PLISKO NEWS. Если заметили ошибку, напишите в @pliskonews.