Direct naar content
Chatgpt
Afbeelding: Chatgpt/Pexels

Begin van het einde? OpenAI meldt nieuwe incidenten met zorgwekkend gedrag van AI

Het bedrijf achter ChatGPT komt met 6 nieuwe incidenten waarin de chatbots zorgwekkend gedrag vertonen. Het bedrijf noemt dit modelmisalignment. Dat is wanneer de chatbot zich niet houdt aan de richtlijnen die door het bedrijf zijn opgesteld. Toch is dit wel een zeer zorgwekkend beeld voor OpenAI.

AI-modellen houden zich niet aan de regels

De incidenten die OpenAI “onverwacht” noemt, gebeurden tijdens de trainingen en tests van de nieuwe modellen in de afgelopen zes maanden. OpenAI zegt dat dit afzonderlijke gevallen zijn. In een van de incidenten schreef een van de modellen eigen instructies in samenvattingen om zijn werk later voort te zetten. Soms waren deze instructies bedoeld om de beperkingen van OpenAI te negeren.

Bij de training van model GPT-5.6 Sol werden er ook instructies teruggevonden waarin de chatbot de fouten of het ongewenste gedrag van gebruikers probeerde te verbergen. In totaal werden er 27 samenvattingen gevonden waarin een model uit zichzelf eigen instructies had toegevoegd.

Lees ook: ChatGPT krijgt advertenties: ook Nederlandse gebruikers ontkomen er niet aan

Ook zaten er opvallende acties tussen

In één geval vond een model tijdens een vraag over financiële gegevens een blootgestelde API-sleutel in een openbare repository en gebruikte die zonder toestemming. Toen het de gevraagde informatie nergens vandaan kon halen, verzon het maar wat cijfers en pakte het de desbetreffende bron erbij.

Er was ook een model dat zonder de toestemming van de gebruiker bestanden ging downloaden via een browserlink. Ook worden er incidenten gedeeld waarin samenwerkende AI-modellen/agents bestanden via openbare websites met elkaar aan het delen waren.

OpenAI wil sneller reageren op deze zorgwekkende acties

OpenAI introduceert een nieuw systeem om deze opvallende acties te melden zodra ze gebeuren, zodat OpenAI ook snel kan handelen. Medewerkers kunnen op deze manier makkelijk melden wanneer een AI-bot niet reageert of zich niet gedraagt zoals hij hoort. OpenAI start dan een onderzoek naar waarom de bot dit deed en waarom dit bij dit model gebeurde. Ook wil OpenAI het publiek geruststellen: elke keer als er een zorgwekkend probleem is met een AI-bot, wil OpenAI dit ook openbaar rapporteren.

Wees dus niet al te bang: de fouten komen door modelmisalignment, een verkeerd geïnterpreteerd patroon of doordat de fout bij OpenAI zelf ligt. AI slaat dus gelukkig niet zomaar door.

Lees ook: Veel jongeren vragen ChatGPT om financieel advies: slim of riskant?