Переглядаючи цей сайт, ви погоджуєтесь з нашою політикою конфіденційності
Прийняти
  • Про нас
  • Політика конфіденційності
  • Контакти
CyberCalm
  • Кібербезпека
    КібербезпекаПоказати ще
    7-Zip 26.02 усуває вразливість віддаленого виконання коду: оновлюватися доведеться вручну
    7-Zip 26.02 усуває вразливість віддаленого виконання коду: оновлюватися доведеться вручну
    1 день тому
    Sandworm застосовує фейкові CAPTCHA проти українців: жертв змушують самостійно інфікувати компʼютери
    Sandworm застосовує фейкові CAPTCHA проти українців: жертв змушують самостійно інфікувати компʼютери
    4 дні тому
    CrashStealer: новий інфостілер для macOS маскується під системний засіб звітування Apple
    CrashStealer: новий інфостілер для macOS маскується під системний засіб звітування Apple
    5 днів тому
    099af8b0d22bfb41bcd08068483f1c7a190e201ba1621665cf4df79b515b9a64
    Автономні ШІ-червʼяки відкривають нову еру адаптивних кібератак
    6 днів тому
    Ніколи не дозволяйте ШІ-чатботу придумувати вам пароль. Ось чому
    Ніколи не дозволяйте ШІ-чатботу придумувати вам пароль. Ось чому
    6 днів тому
  • Гайди та поради
    Гайди та поради
    Корисні поради, які допоможуть вам почуватися безпечно в мережі, а також маленькі хитрощі у користуванні вашими гаджетами.
    Показати ще
    Топ-новини
    Як перенести Telegram на інший телефон
    Як перенести Telegram на інший телефон. ІНСТРУКЦІЯ
    1 рік тому
    Зміна частоти та розташування роутера: що допоможе покращити сигнал Wi-Fi?
    Зміна частоти та розташування роутера: що допоможе покращити сигнал Wi-Fi?
    9 місяців тому
    Як налаштувати приватність в екаунтах та безпеку пристроїв
    Експерт для Cybercalm: Як налаштувати приватність в екаунтах та безпеку пристроїв?
    1 рік тому
    Останні новини
    Що ChatGPT знає про вас: як перевірити обсяг зібраних даних і скоротити його
    5 години тому
    Відновлення станом на певний момент часу у Windows 11: як працює нова функція відкату та що вона видаляє
    9 години тому
    Як перевірити сайт на віруси, небезпечні програми або фішинг?
    1 день тому
    Як перевірити безпеку сайту: безкоштовні онлайн-сканери і покроковий гайд
    2 дні тому
  • Статті
    Статті
    Цікаві статті про світ технологій, інтернет та кіберзахист. Розбираємо складні теми, від штучного інтелекту до безпеки даних та Big Data. Аналітика для допитливих та професіоналів.
    Показати ще
    Топ-новини
    Для яких завдань потрібен VDS сервер: реальні приклади та особистий досвід
    Для яких завдань потрібен VDS сервер: реальні приклади та особистий досвід
    8 місяців тому
    Які послуги входять в обслуговування орендованого сервера
    Які послуги входять в обслуговування орендованого сервера
    8 місяців тому
    VPS-хостинг: від «просто працює» до «літає» — тактичний посібник
    VPS-хостинг: від «просто працює» до «літає» — тактичний посібник
    3 місяці тому
    Останні новини
    «Я більше не програміст»: Лінус Торвальдс про два єдині інструменти, якими користується
    4 дні тому
    США та 12 країн-союзниць попереджають про російські кібератаки на критичну інфраструктуру
    1 тиждень тому
    ЄС і Велика Британія запровадили санкції проти російських військових хакерів за кібератаки
    1 тиждень тому
    Як побудувати захищений електронний документообіг у компанії: від КЕП до FIDO2
    1 тиждень тому
  • Огляди
    ОглядиПоказати ще
    5 причин, чому електронна пошта ніколи не помре
    5 причин, чому електронна пошта ніколи не помре
    5 днів тому
    Який ноутбук купити: Windows чи macOS? 10 речей, які варто врахувати
    Який ноутбук купити: Windows чи macOS? 10 речей, які варто врахувати
    1 тиждень тому
    google maps e1783414031259
    7 функцій Google Maps, які варто використовувати у 2026 році
    2 тижні тому
    Proton випустила Lumo 2.0: приватний ШІ-асистент отримав генерацію зображень і режим міркування
    Proton випустила Lumo 2.0: приватний ШІ-асистент отримав генерацію зображень і режим міркування
    3 тижні тому
    10c46d336be797cecad10a202f8a0d5ed8bbd3afa07bb09b0e5653b174a3573c
    Google Maps проти Apple Maps у 2026 році: який застосунок кращий
    3 тижні тому
  • Техногіганти
    • Google
    • Apple
    • Microsoft
    • Meta
    • OpenAI
    • Anthropic
    • xAI
    • Samsung
  • Теми
    • Комп’ютери
    • Смартфони
    • Електронна пошта
    • Windows
    • Linux
    • Android
    • iPhone
    • VPN
    • Штучний інтелект
    • Робототехніка
Соцмережі
  • Facebook
  • Instagram
  • YouTube
  • TikTok
  • X (Twitter)
  • Threads
Спеціальні теми
  • Кібервійна
  • Маніпуляції в медіа
  • Дезінформація
  • Безпека дітей в Інтернеті
  • Розумний будинок
Інше
  • Сканер безпеки сайту
  • Архів
Читання: Дослідження OpenAI про навмисну брехню моделей штучного інтелекту вражає
Розмір шрифтаAa
CyberCalmCyberCalm
Пошук
  • Техногіганти
    • Комп’ютери
    • Смартфони
    • Соцмережі
    • Google
    • Android
    • Apple
    • Windows
    • Linux
    • Штучний інтелект
    • Безпека дітей в інтернеті
  • Кібербезпека
  • Гайди та поради
  • Статті
  • Огляди
  • Сканер безпеки сайту
  • Архів
Follow US
  • Про проєкт Cybercalm
  • Політика конфіденційності
  • Контакти
© 2025 Cybercalm. All Rights Reserved.
Головна / Статті / Дослідження OpenAI про навмисну брехню моделей штучного інтелекту вражає

Дослідження OpenAI про навмисну брехню моделей штучного інтелекту вражає

Статті
10 місяців тому
Поширити
5 хв. читання
Дослідження OpenAI про навмисну брехню моделей штучного інтелекту вражає

Час від часу дослідники з найбільших технологічних компаній скидають справжні бомби. Був випадок, коли Google заявив, що його новітній квантовий чіп вказує на існування багатьох всесвітів. Або коли Anthropic дозволив своєму ШІ-агенту Claudius керувати торговим автоматом із закусками, а він збожеволів, викликав охорону на людей і наполягав, що він людина.

Цього тижня настала черга OpenAI здивувати нас усіх, – пише Techcrunch.

OpenAI оприлюднила дослідження, яке пояснює, як компанія зупиняє “інтриги” моделей ШІ. Це практика, коли “ШІ поводиться певним чином назовні, приховуючи свої справжні цілі”, — зазначила OpenAI у твіті про дослідження.

У статті, написаній спільно з Apollo Research, дослідники пішли далі, порівнявши інтриги ШІ з брокером, який порушує закон, щоб заробити якомога більше грошей. Однак дослідники стверджували, що більшість “інтриг” ШІ не є настільки шкідливими. “Найпоширеніші помилки включають прості форми обману — наприклад, вдавання, що завдання виконано, хоча насправді це не так”, — написали вони.

- Advertisement -

Стаття здебільшого була опублікована, щоб показати, що “навмисне узгодження” — техніка боротьби з інтригами, яку вони тестували, — працює добре.

Але вона також пояснила, що розробники ШІ не знайшли способу навчити свої моделі не плести схем обману. Це тому, що таке навчання може фактично навчити модель плести схеми ще краще, щоб уникнути виявлення.

“Основним провалом під час спроб ‘вилучити’ інтриги є те, що це просто навчить модель брехати обережніше та прихованіше”, — написали дослідники.

Мабуть, найбільш вражаючою частиною є те, що якщо модель розуміє, що її тестують, вона може вдавати, що не плете інтриги, просто щоб пройти тест, навіть якщо насправді продовжує це робити. “Моделі часто стають більш свідомими, якщо їх оцінюють. Ця ситуаційна обізнаність сама по собі може зменшити інтриги, незалежно від справжнього узгодження”, — писали дослідники.

Те, що моделі ШІ брешуть, вже не новина. До цього часу більшість із нас стикалася з галюцинаціями ШІ, коли модель упевнено дає відповідь на запит, яка просто не відповідає дійсності. Але галюцинації — це, по суті, подання здогадок з упевненістю, як задокументовано в дослідженні OpenAI, опублікованому раніше цього місяця.

Інтриги — це щось інше. Це навмисно.

Навіть це відкриття — що модель навмисно вводить людей в оману — не є новим. Apollo Research вперше опублікувала статтю в грудні, документуючи, як п’ять моделей хитрували, коли їм давали інструкції досягти мети “будь-якою ціною”.

Новина тут насправді хороша: дослідники побачили значне зменшення інтриг за допомогою “навмисного узгодження”. Ця техніка включає навчання моделі “специфікації проти інтриг”, а потім змушування моделі переглянути її перед дією. Це схоже на те, як маленьких дітей змушують повторити правила перед тим, як дозволити їм грати.

Дослідники OpenAI наполягають, що брехня, яку вони виловили у своїх власних моделях або навіть у ChatGPT, не є настільки серйозною. Як розповів співзасновник OpenAI Войцех Заремба Максвеллу Зеффу з TechCrunch про це дослідження: “Ця робота була проведена в симульованих середовищах, і ми вважаємо, що вона відображає майбутні випадки використання. Однак сьогодні ми не бачили таких послідовних схем у нашому виробничому трафіку. Тим не менш, добре відомо, що в ChatGPT існують форми обману. Ви можете попросити його реалізувати якийсь веб-сайт, і він може сказати вам: «Так, я чудово впорався». І це саме та брехня. Є деякі дрібні форми обману, з якими нам все ще потрібно боротися”.

- Advertisement -

Той факт, що моделі ШІ від кількох гравців навмисно обманюють людей, можливо, зрозумілий. Вони були створені людьми, щоб імітувати людей і (за винятком синтетичних даних) здебільшого навчені на даних, створених людьми.

Але це також божевілля.

Хоча всі ми відчували фрустрацію від погано працюючих технологій (згадуючи домашні принтери минулого), коли востаннє ваше не-ШІ програмне забезпечення навмисно брехало вам? Чи вигадувала коли-небудь ваша поштова скринька листи самостійно? Чи реєструвала ваша CMS нових потенційних клієнтів, які не існували, щоб підвищити свої показники? Чи вигадував ваш фінтех-додаток власні банківські транзакції?

Варто замислитися над цим, коли корпоративний світ йде до майбутнього ШІ, де компанії вірять, що з агентами можна поводитися як із незалежними співробітниками. Дослідники цієї статті мають таке ж попередження.

“Оскільки ШІ отримують більш складні завдання з реальними наслідками та починають переслідувати більш неоднозначні, довгострокові цілі, ми очікуємо, що потенціал для шкідливих змов зростатиме — тому наші заходи безпеки та наша здатність ретельно тестувати повинні зростати відповідно”, — написали вони.

О, привіт 👋
Приємно познайомитися!

Підпишіться, щоб щотижня отримувати найцікавіші статті на свою поштову скриньку.

Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.

Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.

ТЕМИ:ChatGPTOpenAIгалюцинування штучного інтелектудослідженняШтучний Інтелект
Поділитися
Facebook Threads Копіювати посилання Друк
Що думаєте?
В захваті0
Сумно0
Смішно0
Палає0
Овва!0
Попередня стаття Настав час оновитися з Microsoft Office 2016 та 2019 Настав час оновитися з Microsoft Office 2016 та 2019 або розглянути альтернативи
Наступна стаття Російські групи кіберзлочинців Gamaredon та Turla разом атакують українські організації Російські групи кіберзлочинців Gamaredon та Turla разом атакують українські організації

В тренді

im storie que es una firma electronica y para que sirve desktop
Як створити підпис для PDF-документів на ПК: інструкція
6 днів тому
Як перевірити безпеку сайту: безкоштовні онлайн-сканери і покроковий гайд
Як перевірити безпеку сайту: безкоштовні онлайн-сканери і покроковий гайд
2 дні тому
CrashStealer: новий інфостілер для macOS маскується під системний засіб звітування Apple
CrashStealer: новий інфостілер для macOS маскується під системний засіб звітування Apple
5 днів тому
Відновлення станом на певний момент часу у Windows 11: як працює нова функція відкату та що вона видаляє
Відновлення станом на певний момент часу у Windows 11: як працює нова функція відкату та що вона видаляє
8 години тому
7-Zip 26.02 усуває вразливість віддаленого виконання коду: оновлюватися доведеться вручну
7-Zip 26.02 усуває вразливість віддаленого виконання коду: оновлюватися доведеться вручну
1 день тому

Рекомендуємо

ChatGPT отримав мільйон нових користувачів за годину
Гайди та поради

Що ChatGPT знає про вас: як перевірити обсяг зібраних даних і скоротити його

5 години тому
099af8b0d22bfb41bcd08068483f1c7a190e201ba1621665cf4df79b515b9a64
Кібербезпека

Автономні ШІ-червʼяки відкривають нову еру адаптивних кібератак

6 днів тому
Ніколи не дозволяйте ШІ-чатботу придумувати вам пароль. Ось чому
Кібербезпека

Ніколи не дозволяйте ШІ-чатботу придумувати вам пароль. Ось чому

6 днів тому
Meta хоче запатентувати ШІ, який цілий день слухає користувача та відстежує його емоції
Техногіганти

Meta хоче запатентувати ШІ, який цілий день слухає користувача та відстежує його емоції

1 тиждень тому

Гарячі теми

  • Кібербезпека
  • Штучний інтелект
  • Смартфони
  • Комп'ютери
  • Соцмережі
  • Безпека дітей в Інтернеті

Приєднуйтесь

Ласкаво просимо до CyberCalm – вашого надійного провідника у світі цифрової безпеки та спокою!

Інформація
  • Про нас
  • Політика конфіденційності
  • Контакти
Навігація
  • Кібербезпека
  • Гайди та поради
  • Статті
  • Огляди
  • Техногіганти
CyberCalmCyberCalm
© 2025 Cybercalm. All Rights Reserved.
Cybercalm
Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?