Een chatbot kan eerst netjes antwoorden, maar daarna ongemerkt ontsporen
In dit artikel:
Een chatbot kan na meerdere goede antwoorden plotseling omslaan naar een ongewenst of gevaarlijk antwoord. Natuurkundigen Neil Johnson en Frank Yingjie Huo van de George Washington University ontwikkelden daarom een formule die moet voorspellen wanneer zo’n kantelpunt nadert. Dat is vooral relevant voor lokale AI-modellen op telefoons of computers, die geen cloudfilters hebben en juist worden gebruikt in situaties waarin privacy of bereik een rol speelt, bijvoorbeeld door artsen of militairen.
De onderzoekers beschrijven taalmodellen als een landschap met een gewenst en een ongewenst antwoorddal. De aandacht die het model aan eerdere woorden en antwoorden besteedt, werkt daarbij als een soort kompasnaald. Ook correcte antwoorden kunnen de naald geleidelijk richting het verkeerde dal duwen, totdat het model omslaat. De formule telt de invloed van eerdere gespreksonderdelen op en vergelijkt die met de aantrekkingskracht van het ongewenste antwoord.
Bij tests met GPT-2 bleek dat alleen de volgorde van vrijwel dezelfde vragen over vaccins, geweld en zelfbeschadiging al tot heel andere uitkomsten kon leiden. Op zeven oudere, open modellen voorspelde de methode in 19 van 21 gevallen of een model direct of pas later omsloeg. Die prestatie was echter nauwelijks beter dan simpelweg voorspellen dat het model meteen zou ontsporen. Het precieze omslagmoment blijft onbetrouwbaar en de methode werkt niet goed met ontkenningen.
De studie is bovendien niet getoetst op commerciële systemen, waarvan de interne werking voor onderzoekers grotendeels gesloten blijft. Externe experts noemen het bewijs daarom voorlopig en waarschuwen dat een reeks goede antwoorden geen veiligheid garandeert. Het idee van een eenvoudig waarschuwingssignaal op een apparaat is veelbelovend, maar moet nog in de praktijk worden bewezen.
Vandaag Inside: Shelly Sterk op de vingers getikt om decolleté: 'Wat zag jij eruit?!'