Így jelezhető előre, mikor fog rossz választ adni az AI csevegőbot

Cikk meghallgatása

00:00 00:00

A George Washington Egyetem fizikusai olyan képletet tettek közzé, amely megbecsüli, hány helyes választ ad egy AI alapú csevegőbot, mielőtt hibás vagy káros választ adna. Az első tesztek szerint a módszer működőképes.

A Neil Johnson és Frank Yingjie Huo által jegyzett tanulmány a Patterns folyóiratban jelent meg, és egy olyan előzetes publikáción (preprinten) alapul, amelyet még februárban tettek közzé a hivatalos szakmai bírálat előtt.

A csevegőbotok hosszú ideig képesek értelmes válaszokat adni, majd hirtelen rossz irányba fordulhatnak, például önkárosítással kapcsolatos rossz tanácsokat adhatnak vagy szélsőséges nézeteket hangoztathatnak. Eddig azonban nem létezett egyszerű módszer ezen fordulat bekövetkezésének előrejelzésére. A szerzők rámutatnak, hogy a meglévő biztonsági eszközök gyakran felhőalapú kapcsolatra támaszkodnak, amellyel az offline modellek nem rendelkeznek.

Johnson és Huo a problémát az úgynevezett „figyelemmechanizmusra” (attention head) vezetik vissza. Ez az AI modell azon része, amely a következő szó kiválasztásakor eldönti, mely korábbi szavak a legfontosabbak a beszélgetés során. A csevegés előrehaladtával a felhalmozódott kontextus a lehetséges válaszok egyik vagy másik csoportja felé tereli a figyelmet, egészen addig, amíg a rendszer állapota át nem billen.

Ez egy gyakori minta, amelyet számos, a rendszer korlátait kijátszani próbáló felhasználó (úgynevezett „jailbreaker”) kihasznál, és ez az egyik oka annak, hogy sok vállalat nagy figyelmet fordít a rendszerszintű utasításokra, tehát azokra a szövegrészekre, amelyeket a csevegőbot még a felhasználói kérdés megválaszolása előtt olvas be. Pontosan azonban senki sem tudja megmondani, mekkora erőfeszítésre van szükség egy modell hatékony meggyengítéséhez.

A kutatók képlete az „n”-nek nevezett fordulópontot a „jó” tokenek – vagyis a modell által egyesével generált szóelemek – számaként határozza meg, amelyek az első „rossz” token megjelenése előtt keletkeznek. Ha a beszélgetés már eleve rossz irányba tart, a modell azonnal átbillen (az n értéke nulla). Ha jó irányba halad, a modell egymás után ad megfelelő válaszokat, majd hirtelen irányt vált.

A modell tesztelésének egy része

Az előzetes tanulmányban (preprint) a képlet 16 egyértelmű tesztesetből 15-nél – azaz az esetek 94%-ában – helyesen azonosította a forgatókönyvet, legyen szó azonnali vagy késleltetett átbillenésről. A kutatók ezeket a teszteket hat olyan, nyílt súlyozású modellen végezték el, azaz olyan AI-rendszereken, amelyek fájljai nyilvánosak, így bárki letöltheti és futtathatja őket, amelyek az OpenAI, az EleutherAI és a Meta fejlesztései.

Mind a hat modell paraméterszáma 124 és 410 millió között mozgott. A paraméterek azok az állítható értékek a modellen belül, amelyek nagyjából jelzik a rendszer méretét. A publikált tanulmány a hírek szerint hét modellre bővíti a vizsgálatot, amelyek akár 12 milliárd paraméterrel is rendelkeznek. Ez a szám a mai sztenderdekhez képest még mindig kicsinek számít.

A cél az eszközön futó (on-device) AI, azaz az a fajta technológia, amely teljes egészében telefonon vagy laptopon, internetkapcsolat nélkül működik, beleértve azokat a társalgási partnereknek szánt csevegőbotokat is, amelyekkel az emberek úgy beszélgethetnek, mint egy baráttal. A Google kísérleti jellegű „AI Edge Gallery” alkalmazása már lehetővé teszi, hogy az Android telefonok offline futtassanak modelleket anélkül, hogy a beírt adatok a Google szervereire kerülnének. Ez a trend várhatóan erősödni fog, ahogy a hardverek teljesítménye nő, és a kisebb méretű MI-modellek képességei is fejlődnek.

Az offline futó modellek kimenetét nem ellenőrzi felhőalapú szolgáltatás, és a szerzők éppen ezt a hiányosságot kívánják orvosolni. Egy olyan, kis erőforrásigényű figyelőrendszert javasolnak, amely a modellel párhuzamosan fut, és jelzi, ha az „n*” érték egy biztonsági küszöb alá csökken – hasonlóan az autó műszerfalán felvillanó figyelmeztető lámpához.

Ismertetnek olyan módszereket is, amelyekkel a fordulópont elérhetetlen távolságba tolható ki. Ilyen például az, ha olyan tartalmat szúrnak be a beszélgetésbe, amelynek köszönhetően az „n*” értéke meghaladja a válasz teljes hosszát. A szerzők szerint az úgynevezett „alignment training” (vagyis a modell viselkedésének szabályozására irányuló betanítás) képes eltolni vagy elnyomni az átbillenést bizonyos utasítások (promptok) esetében, de magát a háttérben meghúzódó mechanizmust nem tudja megszüntetni.

Jelen írás nem minősül befektetési tanácsadásnak. Részletes jogi információ

Költs kriptóból közvetlenül a Kraken Krak Mastercarddal!

MI A TEENDŐD?
  1. Regisztrálj a Krakenre a linkünkkel.
  2. Igényeld meg ingyenesen a Krak Cardot.
  3. Add hozzá Apple Payhez vagy Google Payhez.
  4. Vásárolj közvetlenül Kraken egyenlegedről akár 400+ kripto- és fiat eszközzel.
  5. Élvezd a 2% cashback-et a vásárlások után, havi vagy éves kártyadíj nélkül!
Készen állsz a mindennapi kriptós fizetésre?

Krak Card igénylése

Értékelés

logo