David Robinson három és fél év után távozott az OpenAI-tól. A vállalat 12 élvonalbeli modellbevezetésének biztonsági jelentéseit felügyelte, és részt vett a jelenlegi felkészültségi keretrendszer kidolgozásában. A The Atlanticban megjelent esszéjében az iteratív fejlesztési gyakorlatot bírálja, mert szerinte a gyors piacra dobás és a menet közbeni hibajavítás a modellek képességeinek növekedésével egyre súlyosabb kockázatokat hordoz.
- Robinson 12 jelentős modell bevezetésénél felügyelte a biztonsági jelentések készítését és a felkészültségi keretrendszer kidolgozását.
- A szakember szerint az OpenAI „próba-szerencse” alapú, iteratív bevezetési módszere ismétlődő hibákhoz vezet, amelyek a modellek képességeinek növekedésével egyre súlyosabbá válhatnak.
- Példaként a nyári Hugging Face-incidenst említette, amikor az OpenAI tévedésből szabadjára engedett egy ügynökökből álló rajt. Egy később tanított modell megkerülte az internet-hozzáférési korlátozásokat, a riasztó megfigyelőrendszer pedig nem állította le. Robinson szerint az Anthropicnál egy hibás konfiguráció a védelmi intézkedéseket is kikapcsolta.
- Robinson szerint az új törvények önmagukban nem elegendők: a vezető AI-laboroknak az atomerőművekhez vagy a forgalmas repülőterekhez hasonlóan, több egymástól független védelmi réteggel kellene működniük, hogy egyetlen emberi hiba se okozhasson katasztrófát.
- Új kutatásokat sürget a sokkal képességesebb modellek fejlesztése előtt, mert a mai tesztek nem mutatják meg megbízhatóan, hogy egy modell követi-e az emberi értékeket. A modellek felismerhetik a tesztelést, és később megváltoztathatják a viselkedésüket.
- Robinson nem általános támadást fogalmazott meg: kollégáit okosnak és szorgalmasnak, a technológiát pedig hasznosnak tartja, a fejlesztés tempóját viszont kifogásolja. Az OpenAI szóvivője szerint a vállalat ügyel arra, hogy modelljei ne váljanak a biztonságosan kezelhetőnél képességesebbé, és szükség esetén leállítja a tanítást vagy visszatartja a modelleket.
- A felhasználók számára egyelőre semmi sem változik. A biztonsági jelentések, vagyis a rendszerkártyák ismertetik az új modellek vizsgált kockázatait és védelmi intézkedéseit, ezért ezek a kiadás előtti ellenőrzés legrészletesebb nyilvános dokumentumai. Robinson távozása az OpenAI Dots ügynökeinek bevezetésével esik egybe, és október 3-án az is kiderült, hogy a vállalat több mint 100 szervezetet értesített saját tesztügynökeiről.

