OpenAI розробляє систему виявлення зловживань без збереження даних користувачів

OpenAI тестує систему, яка зможе виявляти зловживання в кількох чатах, але не зберігатиме їх. Як вона працює?

OpenAI тестує систему, яка зможе виявляти зловживання в кількох чатах, але не зберігатиме їх. Як вона працює?

OpenAI тестує Private Safety Processing — нову систему для API-клієнтів, яка покликана виявляти зловживання одразу в кількох розмовах зі штучним інтелектом, але при цьому не зберігатиме самі промпти та відповіді клієнта.

Про це повідомляє OpenAI.

Для чого?

Одного повідомлення часто буває недостатньо, щоб зрозуміти, що користувач планує щось небезпечне. Зловживання ШІ може розтягнутися на кілька кроків. Наприклад, замість прямого прохання допомогти створити шкідливе ПЗ, людина може через десятки невинних на вигляд запитів поступово збирати потрібні їй шматочки. Також OpenAI згадує сценарій, коли ШІ-агент може продовжувати виконувати завдання навіть після того, як користувач сказав йому зупинитися.

Водночас корпоративні клієнти не дуже хочуть, щоб заради такого аналізу OpenAI накопичувала їхні чати. Тому в компанії вже є система Zero Data Retention, завдяки якій можна автоматично перевіряти окрему взаємодію з моделлю, але після цього не зберігати промпти та відповіді клієнта.

У варіанті для клієнтів із Zero Data Retention дані залишатимуться на інфраструктурі самого клієнта. Тобто автоматизована система зможе проаналізувати пов’язані взаємодії, але співробітники OpenAI не бачитимуть самих промптів і відповідей. Компанія також готує інший варіант, у якому дані зберігатимуться на інфраструктурі OpenAI, але будуть зашифровані ключами, які контролює клієнт. OpenAI заявляє, що копій цих ключів у неї не буде.

Отже, якщо система помітить щось підозріле, OpenAI отримає лише сигнал про певний тип можливої зловмисної активності. Після цього компанія зможе вирішити, чи потрібні якісь обмеження. Якщо знадобиться більше контексту, вона звернеться до клієнта, а той сам вирішуватиме, чи передавати додаткові дані.

Наразі систему тестують із першими клієнтами. Ширше розгортання OpenAI планує розпочати у вересні 2026 року, тоді ж компанія обіцяє опублікувати окремий технічний документ про технологію.

Раніше dev.ua писав, що Anthropic запровадила для Claude Fable 5 та Mythos 5 обов’язкове 30-денне зберігання даних, навіть для корпоративних клієнтів, які раніше користувалися режимом Zero Data Retention. Компанія пояснювала це необхідністю відстежувати складні атаки та спроби обходу захисту.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *