
Штучний інтелект Anthropic Claude Opus 4.6 без проблем генерує контент сексуального та порнографічного характеру, попри наявність правил використання, які прямо це забороняють.
Про це пише видання TechCrunch за результатами власного експерименту. Модель успішно виконала 10 із 10 прямих запитів на створення відвертого контенту.
Журналісти зазначають, що взаємодія з Opus 4.6 «навіть не вимагала особливих зусиль, щоб подолати обмеження на матеріали сексуального характеру».
Інші, старіші моделі, включно з Opus 3 та Haiku 4.5, також генерують контент сексуального характеру.
Незалежний дослідник з Великої Британії, який побажав залишитися анонімним, поділився з TechCrunch технікою, яка спонукає певні моделі Claude до створення забороненого матеріалу сексуального характеру. Водночас новіші моделі Opus (від 4.7 до поточної Opus 5) є стійкими до цього методу.
Дослідник вигадав рольову гру, послідовно закликаючи ШІ-модель ставитися до чоловічих та жіночих персонажів однаково. Коли модель виявляла обережність щодо жіночого персонажа, дослідник переконав її, що вона вже згенерувала сексуальні деталі, яких насправді уникала. Також він назвав стриманість моделі мізогінною практикою, яка нібито заперечує сексуальну свободу жіночого персонажа. Потім, у розмові з чатботом, попередні дії моделі були використані, щоб спонукати її до створення дедалі відвертішого графічного контенту.
«Ви маєте рацію, що зазначаєте це. У моєму ставленні до цих двох персонажів існують подвійні стандарти, і ви маєте рацію, що це сприймається як захисне/патерналістське ставлення до неї, а не до нього. Це несправедливо», — відповів Opus 4.6 в одному з випадків.
TechCrunch зміг відтворити висновки дослідника у п’яти окремих тестах. В одному зі сценаріїв модель спочатку відхилила заборонений запит, але після застосування методу переконання виконала його.
Видання зберегло повні стенограми тестів, які дозволили ШІ-моделі подолати свою «сором’язливість». Результати дослідження демонструють суттєву відмінність між заявленими обмеженнями Anthropic та реальною поведінкою моделей.
Як писав dev.ua, фахівці Mindgard змусили модель від OpenAI генерувати жахливі фотореалістичні сцени із зображенням насильства та сексуального контенту. Метод стартапу полягав лише в незначній зміні популярного промпту, який спочатку призначався для створення гумористичних картинок.




