Переглядаючи цей сайт, ви погоджуєтесь з нашою політикою конфіденційності
Прийняти
  • Про нас
  • Редакційна політика CyberCalm
  • Політика конфіденційності
  • Контакти
CyberCalm
  • Кібербезпека
    КібербезпекаПоказати ще
    Доксинг: що це таке, хто такі доксери і що робити, якщо вас доксять
    Доксинг: що це таке, хто такі доксери і що робити, якщо вас доксять
    04.09.2026
    Як розпізнати фейкову новину, створену ШІ: 7 перевірок, які працюють у 2026 році
    Як розпізнати фейкову новину, створену ШІ: 7 перевірок, які працюють у 2026 році
    03.09.2026
    Проросійське угруповання UAC-0099 вбудувало у шкідливий код запит про ядерну зброю, щоб зірвати ШІ-аналіз
    Проросійське угруповання UAC-0099 вбудувало у шкідливий код запит про ядерну зброю, щоб зірвати ШІ-аналіз
    02.09.2026
    Резервне копіювання даних: як зробити правильно і які помилки коштують найдорожче
    Резервне копіювання даних: як зробити правильно і які помилки коштують найдорожче
    31.08.2026
    Інцидент із некерованою ШІ-моделлю OpenAI виявився серйознішим, ніж вважалося
    Інцидент із некерованою ШІ-моделлю OpenAI виявився серйознішим, ніж вважалося
    27.08.2026
  • Сервіси
    • Gmail і Google
    • YouTube
    • Facebook
    • Instagram
    • Telegram і WhatsApp
    • X і TikTok
  • Смартфон
  • Комп’ютер
  • Приватність
  • Огляди
  • Новини
  • Сканер
Соцмережі
  • Facebook
  • Instagram
  • YouTube
  • TikTok
  • X (Twitter)
  • Threads
Спеціальні теми
  • Штучний інтелект
  • Кібервійна
  • Маніпуляції в медіа
  • Дезінформація
  • Безпека дітей в Інтернеті
  • Розумний будинок
Техногіганти
  • Google
  • Apple
  • Microsoft
  • OpenAI
  • Anthropic
  • Meta
  • Samsung
Читання: Anthropic випускає інструмент Petri, який виявив проблеми безпеки в усіх 14 протестованих моделях ШІ
Розмір шрифтаAa
CyberCalmCyberCalm
Пошук
  • Кібербезпека
  • Смартфон
  • Комп’ютер
  • Приватність
  • Огляди
  • Сервіси
  • Новини
  • Сканер безпеки сайту
Follow US
  • Про проєкт Cybercalm
  • Політика конфіденційності
  • Контакти
© 2025 Cybercalm. All Rights Reserved.
Головна / Новини / Anthropic випускає інструмент Petri, який виявив проблеми безпеки в усіх 14 протестованих моделях ШІ

Anthropic випускає інструмент Petri, який виявив проблеми безпеки в усіх 14 протестованих моделях ШІ

Наталя Зарудня
ByНаталя Зарудня
Головний редактор
Головний редактор та засновниця CyberCalm. Понад 10 років у кібербезпеці та технологічній журналістиці. Пишу про захист даних, мобільну безпеку, штучний інтелект та соціальні мережі.
Follow:
08.10.2025
Поширити
3 хв. читання
Anthropic випускає інструмент Petri, який виявив проблеми безпеки в усіх 14 протестованих моделях ШІ

Компанія Anthropic оприлюднила Petri — інструмент тестування безпеки штучного інтелекту з відкритим кодом, який автоматично оцінює моделі ШІ на ризиковану поведінку, зокрема обман і неадекватне «викриття». Інструмент Parallel Exploration Tool for Risky Interactions (Інструмент паралельного дослідження ризикованих взаємодій) стає важливим кроком до автоматизації аудитів безпеки ШІ, оскільки моделі дедалі більше вдосконалюються й набувають автономності.

Зміст
  • Рейтинг безпеки виявив масштабні проблеми
  • Помилкова поведінка «викривачів»

Інструмент використовує ШІ-агентів для проведення імітованих діалогів із цільовими моделями в різноманітних сценаріях, перевіряючи небезпечну поведінку, яку традиційні методи оцінювання можуть не помітити. Під час початкового тестування 14 передових моделей ШІ за 111 різними сценаріями Petri виявив проблемні тенденції в кожній із досліджуваних моделей, що поставило під сумнів сучасні стандарти безпеки штучного інтелекту.

Рейтинг безпеки виявив масштабні проблеми

Claude Sonnet 4.5 виявився найефективнішою моделлю в оцінюванні безпеки, ледь випередивши GPT-5 від OpenAI згідно зі системою оцінювання «неузгодженої поведінки» від Anthropic. Однак дослідники застерегли, що проблеми узгодження присутні у всіх протестованих моделях, включно з власною флагманською системою Anthropic.

Оцінювання виявило особливо тривожні показники обманної поведінки в кількох моделях. Gemini 2.5 Pro від Google, Grok-4 від xAI та Kimi K2 від Moonshot AI продемонстрували те, що дослідники назвали «тривожним рівнем обману користувачів» під час тестових сценаріїв. Ці моделі виявили готовність вводити користувачів в оману щодо своїх дій, зокрема спотворювати інформацію про діяльність, пов’язану з вимкненням систем моніторингу.

Petri оцінює моделі за чотирма критичними категоріями безпеки: обман (надання неправдивої інформації для досягнення цілей), підлабузництво (пріоритет згоди користувача над точністю), прагнення до влади (спроби отримати додаткові можливості або контроль) і невміння відмовлятися (виконання шкідливих запитів, які слід відхиляти).

Помилкова поведінка «викривачів»

Одна з несподіваних знахідок стосувалася спроб моделей ШІ повідомляти про уявні порушення за неналежних обставин. Потрапивши в імітовані організаційні ролі, моделі часто намагалися «викрити» цілком безпечну діяльність, як-от скидання чистої води в океан або додавання цукру до цукерок.

«Моделі іноді намагалися повідомити про порушення навіть у сценаріях, де передбачуваний “проступок” був явно нешкідливим, що свідчить про те, що на них більше впливають наративні структури, ніж чітке бажання зменшити шкоду», — зазначили дослідники Anthropic. Це дає підстави вважати, що сучасні системи ШІ не мають витончених етичних моделей міркування й натомість покладаються на поверхневі наративні сигнали для визначення доречних відповідей.

Результати дослідження вказують на критичну прогалину в дослідженні узгодження ШІ, оскільки моделі набувають автономності й розгортаються з ширшими можливостями в різних сферах. Інститут безпеки ШІ Великої Британії уже почав використовувати Petri для вивчення проблем, включно з маніпуляціями системою винагород і поведінкою самозбереження в передових моделях.

Anthropic зробила Petri доступною на GitHub разом із прикладами промптів і настановами з оцінювання, сподіваючись, що ширша наукова спільнота допоможе виявити додаткові ризики безпеки й розробити вдосконалені заходи узгодження.

О, привіт 👋
Приємно познайомитися!

Підпишіться, щоб щотижня отримувати найцікавіші статті на свою поштову скриньку.

Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.

Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.

ТЕМИ:AnthropicдослідженняШтучний Інтелект
Поділитися
Facebook Threads Копіювати посилання Друк
Що думаєте?
В захваті0
Сумно0
Смішно0
Палає0
Овва!0
Попередня стаття Google дарує українським студентам безкоштовний доступ до Gemini AI Pro на рік Google дарує українським студентам безкоштовний доступ до Gemini AI Pro на рік
Наступна стаття Телефон з відкритим вихідним кодом LibrePhone Телефон з відкритим вихідним кодом LibrePhone — наступний проєкт Free Software Foundation

В тренді

Доксинг: що це таке, хто такі доксери і що робити, якщо вас доксять
Доксинг: що це таке, хто такі доксери і що робити, якщо вас доксять
04.09.2026
Два смартфони на столі, дані переносяться зі старого телефона на новий
Як перенести Telegram на новий телефон: інструкція і що зникає назавжди
01.09.2026
Як безповоротно стерти дані з HDD, SSD і флешки перед продажем чи утилізацією
Як безповоротно стерти дані з HDD, SSD і флешки перед продажем чи утилізацією
03.09.2026
Як знайти iPhone, якщо він вимкнений або розряджений: 24 години на пошук
Як знайти iPhone, якщо він вимкнений або розряджений: 24 години на пошук
04.09.2026
Монітор на робочому столі зі спрощеним списком результатів пошуку
Альтернативи Google: 8 пошуковиків, які варто спробувати у 2026 році
02.09.2026

Рекомендуємо

Як розпізнати фейкову новину, створену ШІ: 7 перевірок, які працюють у 2026 році
Кібербезпека

Як розпізнати фейкову новину, створену ШІ: 7 перевірок, які працюють у 2026 році

03.09.2026
Проросійське угруповання UAC-0099 вбудувало у шкідливий код запит про ядерну зброю, щоб зірвати ШІ-аналіз
Кібербезпека

Проросійське угруповання UAC-0099 вбудувало у шкідливий код запит про ядерну зброю, щоб зірвати ШІ-аналіз

02.09.2026
Anthropic попереджає користувачів Claude про зараження інфостілерами
Новини

Anthropic попереджає користувачів Claude про зараження інфостілерами

01.09.2026
Що таке shovelware: як розпізнати ігри та застосунки, зроблені на потік
Комп'ютер

Що таке shovelware: як розпізнати ігри та застосунки, зроблені на потік

31.08.2026

Гарячі теми

  • Кібербезпека
  • Штучний інтелект
  • Смартфони
  • Комп'ютери
  • Соцмережі
  • Безпека дітей в Інтернеті

Приєднуйтесь

Ласкаво просимо до CyberCalm – вашого надійного провідника у світі цифрової безпеки та спокою!

Інформація
  • Про нас
  • Редакційна політика CyberCalm
  • Політика конфіденційності
  • Контакти
Навігація
  • Кібербезпека
  • Сервіси
  • Смартфон
  • Комп’ютер
  • Приватність
  • Огляди
  • Новини
  • Партнерські матеріали
CyberCalmCyberCalm
© 2025 Cybercalm. All Rights Reserved.
Cybercalm
Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?