GPT-Red: Unlocking Self-Improvement for Robustness
GPT-Red är ett automatiserat system från OpenAI som använder sig själv för att testa och förbättra AI-säkerhet.
Systemet simulerar attacker mot AI-modeller för att hitta svaga punkter, särskilt när det gäller så kallade prompt injections — när någon försöker lura AI:n att göra något den inte borde.
Läs hela hos OpenAI →
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör OpenAI.