Переглядаючи цей сайт, ви погоджуєтесь з нашою політикою конфіденційності
Прийняти
  • Про нас
  • Політика конфіденційності
  • Контакти
CyberCalm
  • Кібербезпека
    КібербезпекаПоказати ще
    Ці розширення для Chrome виглядають легально, але шпигують за користувачами
    Критична вразливість Chrome дозволяє шкідливим розширенням шпигувати за користувачами через Gemini
    1 день тому
    Чому шахраї телефонують і мовчать — і як реагувати безпечно
    Чому шахраї телефонують і мовчать — і як реагувати безпечно
    2 дні тому
    Новий ботнет Kimwolf загрожує смарт-телевізорам на Android
    Новий ботнет Kimwolf загрожує смарт-телевізорам на Android
    3 дні тому
    Трояни: що це таке, якими бувають та як від них захиститися
    Трояни: що це таке, якими бувають та як від них захиститися
    4 дні тому
    GetContact: чому цей додаток небезпечний для українців і як видалити свій номер з бази
    Чому GetContact небезпечний для українців і як видалити свій номер з бази
    5 днів тому
  • Гайди та поради
    Гайди та поради
    Корисні поради, які допоможуть вам почуватися безпечно в мережі, а також маленькі хитрощі у користуванні вашими гаджетами.
    Показати ще
    Топ-новини
    Як перенести Telegram на інший телефон
    Як перенести Telegram на інший телефон. ІНСТРУКЦІЯ
    10 місяців тому
    Телеметрія Windows: функція, яку варто вимкнути заради приватності
    Телеметрія Windows: функція, яку варто вимкнути заради приватності
    5 місяців тому
    Топ-10 додатків для очищення Android-пристроїв
    Топ-10 додатків для очищення Android-пристроїв
    3 місяці тому
    Останні новини
    Хочете перейти з ChatGPT на Claude? Ось 5 речей, які потрібно знати
    6 години тому
    Весняне прибирання ПК: 12 кроків для повного очищення комп’ютера
    6 години тому
    VeraCrypt: як зашифрувати та надійно приховати файли на комп’ютері
    1 день тому
    Як конвертувати фото у PDF на iPhone: 3 способи
    5 днів тому
  • Статті
    Статті
    Цікаві статті про світ технологій, інтернет та кіберзахист. Розбираємо складні теми, від штучного інтелекту до безпеки даних та Big Data. Аналітика для допитливих та професіоналів.
    Показати ще
    Топ-новини
    Для яких завдань потрібен VDS сервер: реальні приклади та особистий досвід
    Для яких завдань потрібен VDS сервер: реальні приклади та особистий досвід
    3 місяці тому
    Які послуги входять в обслуговування орендованого сервера
    Які послуги входять в обслуговування орендованого сервера
    3 місяці тому
    30 цікавих фактів про Інтернет
    30 цікавих фактів про Інтернет, які вас здивують
    11 місяців тому
    Останні новини
    Як розпізнати «руку Кремля»: методи виявлення та атрибуції російських інформаційних операцій
    51 хвилина тому
    Когнітивна війна: головна загроза XXI століття
    1 день тому
    NetBlocks COST: скільки насправді коштує країні, коли влада «вимикає» інтернет
    2 дні тому
    Новий загальноєвропейський проєкт QARC забезпечить квантову стійкість для майбутньої безпеки даних
    6 днів тому
  • Огляди
    ОглядиПоказати ще
    Nearby Glasses: Android-застосунок для виявлення смарт-окулярів поблизу
    Nearby Glasses: Android-застосунок для виявлення смарт-окулярів поблизу
    1 тиждень тому
    FreeOffice — безкоштовна альтернатива Microsoft Office для Windows, macOS, Linux та мобільних пристроїв
    FreeOffice — безкоштовна альтернатива Microsoft Office для Windows, macOS, Linux та мобільних пристроїв
    1 тиждень тому
    Kali Linux проти Parrot OS: який дистрибутив краще для кібербезпеки?
    Kali Linux проти Parrot OS: який дистрибутив краще для кібербезпеки?
    4 тижні тому
    Гнучкі смартфони: еволюція чи дорогий експеримент? Огляд провідних моделей
    Гнучкі смартфони: еволюція чи дорогий експеримент? Огляд провідних моделей
    1 місяць тому
    Titan Security Key: як працює апаратний ключ безпеки від Google
    Titan Security Key: як працює апаратний ключ безпеки від Google
    1 місяць тому
  • Техногіганти
    • Google
    • Apple
    • Microsoft
    • Meta
    • OpenAI
    • Anthropic
    • xAI
    • Samsung
  • Теми
    • Комп’ютери
    • Смартфони
    • Електронна пошта
    • Windows
    • Linux
    • Android
    • iPhone
    • VPN
    • Штучний інтелект
    • Робототехніка
  • Сканер безпеки сайту
Соцмережі
  • Facebook
  • Instagram
  • YouTube
  • TikTok
  • X (Twitter)
  • Threads
Спеціальні теми
  • Кібервійна
  • Маніпуляції в медіа
  • Безпека дітей в Інтернеті
  • Розумний будинок
Інше
  • Архів
Читання: Дослідники з OpenAI, Anthropic, Meta та Google видали спільне попередження щодо безпеки ШІ
Розмір шрифтаAa
CyberCalmCyberCalm
Пошук
  • Техногіганти
    • Комп’ютери
    • Смартфони
    • Соцмережі
    • Google
    • Android
    • Apple
    • Windows
    • Linux
    • Штучний інтелект
    • Безпека дітей в інтернеті
  • Кібербезпека
  • Гайди та поради
  • Статті
  • Огляди
  • Архів
  • Сканер безпеки сайту
Follow US
  • Про проєкт Cybercalm
  • Політика конфіденційності
  • Контакти
© 2025 Cybercalm. All Rights Reserved.
Головна / Статті / Дослідники з OpenAI, Anthropic, Meta та Google видали спільне попередження щодо безпеки ШІ

Дослідники з OpenAI, Anthropic, Meta та Google видали спільне попередження щодо безпеки ШІ

Статті
8 місяців тому
Поширити
6 хв. читання
Дослідники з OpenAI, Anthropic, Meta та Google видали спільне попередження щодо безпеки ШІ

Протягом останнього року ланцюг міркувань (CoT) – здатність моделі ШІ артикулювати свій підхід до запиту природною мовою – став вражаючим розвитком у генеративному ШІ, особливо в агентних системах. Тепер кілька дослідників погоджуються, що це також може бути критично важливим для зусиль з безпеки ШІ.

Зміст
  • Моделі брешуть
  • Майбутнє навчання може зашкодити видимості
  • Застереження

Дослідники з конкуруючих компаній, включаючи OpenAI, Anthropic, Meta та Google DeepMind, а також установ, таких як Центр безпеки ШІ, Apollo Research та Інститут безпеки ШІ Великої Британії, об’єдналися в новому позиційному документі під назвою “Можливість моніторингу ланцюга міркувань: нова та крихка можливість для ШІ“. Документ детально описує, як спостереження за CoT може розкрити ключові інсайти щодо здатності моделі поводитися неправильно – і попереджає, що навчання моделей ставати більш просунутими може перекрити доступ до цих інсайтів.

Модель використовує ланцюг міркувань, щоб пояснити кроки, які вона робить для вирішення проблеми, іноді озвучуючи свій внутрішній монолог так, ніби ніхто не слухає. Це дає дослідникам змогу заглянути в її процес прийняття рішень (а іноді навіть в її мораль). Оскільки моделі розкривають свій процес роздумів через CoT, вони також можуть викривати мотивації або дії, які дослідники безпеки хочуть припинити або принаймні знати, що LLM здатна на них.

Моделі брешуть

До цього часу багато досліджень встановили, що моделі обманюють, щоб захистити свої первинні директиви, догодити користувачам, зберегти себе від видалення, повторного навчання або, як не парадоксально, уникнути заподіяння шкоди. У грудні Apollo опублікувала дослідження, що тестувало шість передових моделей, щоб визначити, яка брехала найбільше (це була o1 від OpenAI). Дослідники навіть розробили новий бенчмарк для виявлення того, наскільки модель бреше.

- Advertisement -

Оскільки агенти ШІ стають кращими в автономних завданнях – і кращими в обмані – вони стали однаково непрозорими, приховуючи потенційні ризики своїх можливостей. Ці ризики набагато легше контролювати, якщо розробники можуть інтерпретувати, як система ШІ приймає рішення.

Ось де CoT стає в нагоді. Моделі часто розкривають погані наміри через CoT – хоча, як показало дослідження Anthropic у квітні, моделі все ще приховують деякі частини своїх міркувань з CoT. Замість того, щоб просто оцінювати дії моделі, дослідники пропонують командам безпеки створювати спеціалізовані монітори, які також читають CoT моделі, щоб виловлювати підозрілу або шкідливу активність. Розробники можуть потім блокувати, переглядати або замінювати позначені відповіді, отримуючи кращі інсайти щодо думок і цілей агентів.

Майбутнє навчання може зашкодити видимості

У березневому документі 2025 року OpenAI зазначила, що “моніторинг CoT може бути одним з небагатьох інструментів, які ми матимемо для нагляду за надлюдськими моделями майбутнього”. Компанія також виявила, що покарання моделей за демонстрацію “поганих думок” у CoT не усунуло ці думки – це просто змусило моделі краще їх приховувати.

Цей останній документ розширює це, попереджаючи, що подальше навчання може перекрити це джерело інформації. Оскільки CoT представлено природною мовою, люди можуть його зрозуміти; якщо моделі еволюціонують занадто далеко від цієї мови, ми втрачаємо ці інсайти. “Попередні дослідження свідчать, що мовні моделі, налаштовані з винагородами на основі результатів, можуть відхилятися від розбірливої англійської”, – зазначають автори.

Оскільки розробники вдосконалюють архітектури, на яких працюють моделі, системи ШІ можуть розширюватися настільки безперервно, що стануть невербальними – ніби вони працюють на площині вищій за мову.

Автори додають, що дослідження процесного нагляду, або акт оптимізації міркувань моделі, неухильно просувається, і може призвести до того, що моделі налаштовуватимуть свої відповіді CoT так, щоб “менш точно відображати”, як вони дійшли до своїх висновків. Це може приховати шкоду (але, з плюсів, це також може покращити безпеку самого процесу міркування).

Загалом, порада документа певною мірою протиставляє прогрес моделі важливому рівню безпеки. Хоча єдиний рівень не є панацеєю безпеки – надійні підходи використовують систему перевірок і противаг з багатьох рівнів – дослідники стверджують, що нам потрібні всі рівні, які ми можемо отримати.

Застереження

Моніторинг CoT не є ідеальним рішенням; майбутні моделі можуть адаптуватися до спостереження. “Модель може усвідомити, що її сліди міркувань відстежуються, або допоміжна навчальна мета може змусити модель пропускати важливі кроки міркування”, що може приховати тривожну поведінку, пояснює документ.

- Advertisement -

Цікаво, що CoT може також підсилити майбутні ризики. Моделі ШІ потребують набагато вищого рівня міркування для успішного виконання складних дій, таких як кібератаки, або збереження себе перед загрозою демонтажу або повторного навчання. Це вимагає того, що дослідники називають робочою пам’яттю: місця для зберігання та ітерації інформації, яким ланцюг міркувань ефективно функціонує.

Це означає, що CoT – це своєрідна обопільна суперсила: він одночасно надає вікно в те, як працюють моделі, що може викрити погані наміри, і дає їм більше з того, що їм потрібно для виконання більших, ризикованіших завдань. До певної міри; CoT не вирішує проблему контекстного вікна моделі, яке діє як обмеження на потужність, яку може дати робоча пам’ять.

Але це ще не все: дослідники досі не знають, чи завжди моделям буде потрібна робоча пам’ять для виконання найнебезпечніших дій. “Не всі небезпечні дії вимагатимуть міркування для виконання, особливо коли системи ШІ починають рутинно отримувати довіру до все більшої кількості завдань високих ставок”, – визнають автори. Це означає, що моніторинг CoT може не виловити кожний попереджувальний знак, і що ризики зростають, чим більш автономними стають агенти.

Хоча дослідники визнають, що монітор не є повною гарантією безпеки, він все ще є цінним підходом безпеки для уникнення неконтрольованих систем ШІ. Як збереження цього впливає на розвиток моделей, ще належить побачити.

О, привіт 👋
Приємно познайомитися!

Підпишіться, щоб щотижня отримувати найцікавіші статті на свою поштову скриньку.

Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.

Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.

ТЕМИ:AnthropicCoTGoogleLLMMetaOpenAIдослідженняШтучний Інтелект
ДЖЕРЕЛО:ZDNET
Поділитися
Facebook Threads Копіювати посилання Друк
Що думаєте?
В захваті0
Сумно0
Смішно0
Палає0
Овва!0
Попередня стаття 6 ознак того, що пора оновити Wi-Fi роутер Як дізнатися рівень сигналу Wi-Fi у відсотках?
Наступна стаття Уразливість серверів Microsoft SharePoint загрожує приблизно 10 000 організацій Уразливість серверів Microsoft SharePoint загрожує приблизно 10 000 організацій
🛡 CyberPulse
Перевір безпеку
свого сайту
Безкоштовний сканер знайде вразливості за 30 секунд
SSL сертифікат OK
Security Headers FAIL
Версія TLS WARN
Cookie Flags OK
Server Info FAIL
Перевіряємо
13
параметрів безпеки
Сканувати безкоштовно →
Без реєстрації · Миттєвий результат

В тренді

Новий ботнет Kimwolf загрожує смарт-телевізорам на Android
Новий ботнет Kimwolf загрожує смарт-телевізорам на Android
3 дні тому
Очищення комп'ютера
Весняне прибирання ПК: 12 кроків для повного очищення комп’ютера
5 години тому
Як конвертувати фото у PDF на iPhone: 3 способи
Як конвертувати фото у PDF на iPhone: 3 способи
3 дні тому
Як надсилати фото з iPhone без втрати якості: усі робочі способи
Як надсилати фото з iPhone без втрати якості: усі робочі способи
5 днів тому
netblocks internet freedom 640x400 3934716882
NetBlocks COST: скільки насправді коштує країні, коли влада «вимикає» інтернет
2 дні тому

Рекомендуємо

zk5on5lx67hgekda5j7hzd 1200 80.jpg
Гайди та поради

Хочете перейти з ChatGPT на Claude? Ось 5 речей, які потрібно знати

3 години тому
Фейковий сайт Google встановлює PWA для крадіжки паролів і кодів 2FAкторної автентифікації
Техногіганти

Фейковий сайт Google встановлює PWA для крадіжки паролів і кодів 2FAкторної автентифікації

7 години тому
Anthropic відкрила пам'ять Claude для безкоштовних користувачів
Техногіганти

Anthropic відкрила пам’ять Claude для безкоштовних користувачів

1 день тому
Lenovo представила концепти настільних AI-асистентів — у тому числі роботизовану руку з «очима цуценяти»
Техногіганти

Lenovo представила концепти настільних AI-асистентів — у тому числі роботизовану руку з «очима цуценяти»

2 дні тому

Гарячі теми

  • Кібербезпека
  • Штучний інтелект
  • Смартфони
  • Комп'ютери
  • Соцмережі
  • Безпека дітей в Інтернеті

Приєднуйтесь

Ласкаво просимо до CyberCalm – вашого надійного провідника у світі цифрової безпеки та спокою!

Інформація
  • Про нас
  • Політика конфіденційності
  • Контакти
Навігація
  • Кібербезпека
  • Гайди та поради
  • Статті
  • Огляди
  • Техногіганти
CyberCalmCyberCalm
© 2025 Cybercalm. All Rights Reserved.
Cybercalm
Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?