Reedel, 20. detsembril 2024, “OpenAI 12 päeva” 12. päeval, teatas OpenAI tegevjuht Sam Altman oma uusimatest tehisintellekti arutlusmudelitest o3 ja o3-mini. Ta esitles testitulemusi, mis viitavad sellele, et nende uusim mudel on ületanud olulised inimvõimekuse kriteeriumid. Greg Brockman OpenAI-st teatas X-is “o3, meie uusim arutlusmudel, on läbimurre”.
o3
O3 arhitektuur tutvustab “simuleeritud arutlust” – sisemist dialoogisüsteemi, kus tehisintellekt hindab ja planeerib vastuseid enne nende väljastamist. OpenAI nimetab seda “privaatseks mõtteahelaks”. See lähenemine liigub kaugemale traditsioonilistest LLM võimetest. Valdkonna vaatlejad märgivad O3 paremat sooritust programmeerimises, loogikas ja inimsarnases arutlusprotsessis. Põhiomaduseks on O3 võime lahendada uusi probleeme ilma spetsiifiliste treeningandmeteta, mis viitab edenemisele AGI võimekuse suunas.
O3 Mini on O3 lihtsustatud versioon, mis vajab vähem arvutusvõimsust, kuid ületab siiski O1 tulemusi. OpenAI plaanib neid mudeleid esialgu välja lasta ohutustestimiseks ja uuringuteks, mitte koheseks avalikuks kasutamiseks.
o3 testimine
O3 mudel näitas märkimisväärseid tulemusi mitmetel arutlusvõime testidel. Kõige olulisem tulemus saadi Arc AGI testis, mis on spetsiaalselt loodud hindamaks tõelist intelligentsust, mitte pelgalt mustrite äratundmist või meeldejätmist. Kuigi O3 sai standardsetes testimistingimustes (10 000-dollarise arvutuseelarvega) 76%, saavutas see piiramatu arvutusvõimsusega erakordse 87,5%. See tulemus ületab 85% läve, mida Arc AGI oli varem seadnud tehisintellekti üldise intelligentsuse näitajaks.
Selle matemaatilised võimed avalduvad 96,7%-lises tulemuses 2024. aasta Ameerika matemaatika kutseeksamil, eksides vaid ühe küsimusega. GPQA Diamond testis, mis kontrollib kraadiõppe tasemel teaduslikke teadmisi, saavutas O3 87,7%. Mudel ületas oluliselt teisi Frontier Math võrdlustestis, lahendades 25,2% ülesannetest võrreldes varasema 2% laega.
Inimintellekt on nüüd ületatud
Tulemused näitavad fundamentaalset nihet selles, kuidas me mõõdame tehisintellekti võimekust. Varem näitasid võrdlustestid tavaliselt järkjärgulist lähenemist inimtaseme sooritusele. Nüüd näeme mudeleid, mis potentsiaalselt ületavad tippinimvõimekust teatud valdkondades, mis nõuab uusi raamistikke tehisintellekti progressi mõistmiseks ja hindamiseks.
ARC väljakutse
François Chollet lõi 2019. aastal ARC väljakutse, mis testib tehisintellekti süsteeme värviliste võrgustikumõistatuste abil. Need mõistatused kontrollivad, kas tehisintellekt suudab märgata mustreid ja kasutada põhilist arutlusvõimet. Kuigi inimesed leiavad need mõistatused lihtsad olevat, on tehisintellekti süsteemidel tavaliselt nendega raskusi. Väljakutse aitab mõõta, kui hästi tehisintellekt suudab mõelda ja lahendada probleeme võrreldes inimestega. ARC-AGI versioon vaatab spetsiifiliselt, kui hästi tehisintellekt tuleb toime uute olukordadega. Siiani on tehisintellekti mudelid näidanud kehva sooritust – GPT-3 sai nulli, GPT-4 peaaegu nulli ja GPT-4 nägemisevõimega saavutas vaid 5% edukuse.
Intellekti hind
Nende tulemuste saavutamiseks vajalikud arvutusnõuded on märkimisväärsed. Analüüs viitab, et 87,5% tulemuse saavutamiseks oli vaja ligikaudu 5,7 miljardit tokenit ja 13,8 minutit ülesande kohta, hinnangulise maksumusega kuni 347 000 dollarit kogu testikomplekti eest.
Tulevased mudelid
Kiire progress O1 ja O3 vahel viitab, et oleme sisenemas tehisintellekti arengu uude faasi. Fookus on nihkunud suuremate mudelite eeltreenimiselt järeldamisarvutuste ja mõtteprotsesside optimeerimisele.
Jason Wei, OpenAI teadlane, ütleb: “progress o1-st o3-ni võttis vaid kolm kuud, mis näitab, kui kiire on progress uues paradigmas, kus RL (stiimulõpe) rakendatakse mõtteahela peale järeldusarvutuste skaleerimiseks. Palju kiirem kui eeltreenimise paradigma uue mudeliga iga 1-2 pisara järel”.
Tagasiside o3 tulemustele
Vaatamata nendele läbimurdelistele tulemustele jäävad eksperdid oma hinnangutes mõõdukaks.
See verstapost, olenemata sellest, kas me nimetame seda tõeliseks AGI-ks või mitte, märgib olulist hetke tehisintellekti arengus.
François Chollet, Arc AGI auhinna autor, tunnustab neid tulemusi: “need võimed on uus territoorium ja vajavad tõsist teaduslikku tähelepanu”. See hinnang kannab erilist kaalu, arvestades Chollet’ ajalooliselt ettevaatlikku seisukohta tehisintellekti võimekuse suhtes. Chollet märgib, et kuigi O3 tähistab olulist verstaposti, osutuvad mõned lihtsad Arc AGI ülesanded mudelile endiselt keeruliseks.
Uudsusega kohanemiseks on vaja kahte asja. Esiteks on vaja teadmisi – taaskasutatavate funktsioonide või programmide kogumit, millele toetuda. LLM-idel on seda enam kui küllalt. Teiseks on vaja võimet kombineerida neid funktsioone uueks programmiks, kui seistakse silmitsi uue ülesandega – programm, mis modelleerib käesolevat ülesannet. Programmi süntees. LLM-idel on see omadus pikka aega puudunud. O-seeria mudelid parandavad selle.
O3 põhimehhanism näib olevat loomuliku keele programmi otsing ja täitmine tokenite ruumis – testimise ajal otsib mudel läbi võimalike mõtteahelate (CoT-ide) ruumi, mis kirjeldavad ülesande lahendamiseks vajalikke samme. O3 puhul juhib otsingut arvatavasti mingit tüüpi hindamismudel. Kuigi ühekordse genereerimisega LLM-id jäävad uudsusega hätta, ületab o3 selle, genereerides ja täites oma programme, kus programm ise (CoT) muutub teadmiste rekombineerimise artefaktiks.
O3 esindab süvaõppega juhitud programmi otsingu vormi. Mudel teostab testimise ajal otsingut “programmide” ruumis (antud juhul loomuliku keele programmid – CoT-ide ruum, mis kirjeldavad käesoleva ülesande lahendamise samme), mida juhib süvaõppe eelteadmine (baas-LLM). Põhjus, miks ühe ARC-AGI ülesande lahendamine võib võtta kümneid miljoneid tokeneid ja maksta tuhandeid dollareid, on see, et see otsinguprotsess peab uurima tohutut hulka teid läbi programmiruumi – sealhulgas tagasijälgimist.
Kuigi kõik ei nõustu, et o3 on AGI, tunnistavad nad, et selle praegune sooritus kujutab endast märkimisväärset saavutust ja selget kinnitust, et intuitsioonist juhitud testimisaegne otsing programmiruumis on võimas paradigma selliste tehisintellektisüsteemide ehitamiseks, mis suudavad kohaneda suvaliste ülesannetega.
Valitud kommentaarid YouTube’i kasutajatelt
@SmarttStuff: AGI on spekter, paradigma, mitte kindel joon. Me oleme AGI paradigmas ja oleme olnud juba mõnda aega. Ma alustasin 80ndatel tööd ‘Ekspertsüsteemidega’, mis olid tegelikult lihtsad binaarsed kalkulaatorid. Kitsa teadmisbaasiga olid nad üsna targad, sel ajal targemad kui keskmine valdkonna praktik (lihtsalt mälu-meenutamise baasil). Paljud praegu kasutusel olevad tehisintellekti mudelid on nendest algelistest ekspertsüsteemidest tohutult targemad. Me kohaneme selle uue normaalsusega peaaegu ülbelt. Ma kasutan praeguseid mudeleid äärmiselt keeruka matemaatilise ja teadusliku kognitiivse töö tegemiseks. Tase on vähemalt doktorikraadi tasemel ja sageli väga uudne ning innovaatiline lisaks sellele. Nagu Ilya näitab, käib kõrgema intelligentsusega kaasas ettearvamatum mudel – just nagu meie puhul. Seega minu vaatenurgast näen ma teadusvaldkondades juba neid AGI sädemeid, eriti alates 30. juunist 2024. See o3 teadaanne kinnitab trajektoori, mida ma näen. Asi on kiiruses, mis on kõiki ettevalmistamata tabanud. 2025. aasta saab olema väga metsik sõit üle AGI piiri ja ASI tsooni.
@zrandomz-t3n: Ma võin kihla vedada, et see pole AGI. See lihtsalt ületas ARC AGI võrdlustesti (muide, tohutu kuluga). Sarnaselt Turingi testiga, pelgalt läbimine ei tee sellest AGI-d.
@beerkegaard: Lõplik teetähis on siis, kui see võtab SINU töö üle
@IllusionDX: … kas see suudab õppida reaalajas selle asemel, et seda peaks iga kord treenima, kui tahad uut infot lisada, nii et see suudaks õppida tegema ülesannet, mida pole kunagi varem teinud, ilma et seda õpetataks? Kas sel on efektiivne pikaajaline mälu ja pole kontekstakna piirangut? Ei? Siis see pole AGI
@eng3d: … on olemas CISCO tehniku (võrgunduse) sertifikaat, mis koosneb eksamist. Paljud inimesed sooritavad eksami lihtsalt sisu päheõppimisega, seega on nad ametlikult sertifitseeritud. Kas nad suudavad pärismaailmas töötada? Mitte eriti. Sama on AGI-ga. See püüab läbida Turingi testi, aga Turingi test on lihtsalt üldine test, mitte pärismaailm.
@byrnemeister2008: @Pabz2030 Lihtsalt sellepärast, et sul on teadmised testi läbimiseks, ei tähenda, et sa suudad olla arst. Tänastel tehisintellekti mudelitel on teadmised/faktid, aga nad ei suuda seda veel rakendada samal viisil nagu inimene ja nad eksivad sageli teadmiste rakendamisel uudsetes olukordades. Nad muutuvad paremaks, aga pole nii üldised kui inimesed. Vaata kas või ARC tulemusi näiteks. Võrdlustestis on okei teha palju oletusi, aga kui see puudutab meditsiinilist probleemi, millega arst tegeleb, peab see olema õige esimese korraga.
@peace5850: @IllusionDX Kas sul on piiramatu kontekstaken? Kas sa suudad õppida kõiki ülesandeid, mida sa pole kunagi varem teinud, ilma et sulle õpetataks (kuidas)? Siis sa pole AGI, eks?
@ChaseFreedomMusician: Nii et o3 on muljetavaldav – ärge saage minust valesti aru. See “töötlemisaegne arvutamine”, kus see põhimõtteliselt arutleb sügavalt lennult vastuse väljatöötamiseks, tundub olevat suur asi. See on peaaegu nagu see jooksutaks simulatsioone reaalajas, et tagasi minna ja asju välja nuputada. Aga siin on koht, kus see minu jaoks puudu jääb: see ei õpi tegelikult sellest protsessist. Kui see midagi välja nuputab, ongi kõik – see ei sisesta seda arusaama tagasi iseendasse. Kui küsid sama küsimuse uuesti, peab see kogu protsessi uuesti läbi tegema, kasutades sama palju arvutusvõimsust. Minu jaoks see pole AGI. Tõeline AGI võtaks selle arusaama, uuendaks oma sisemisi “uskumusi” ja kasvaks sellest kogemusest. See ei lahendaks probleemi ainult üks kord; see kannaks selle teadmise edasi ja muutuks aja jooksul paremaks. See on nagu Star Trekis: arvuti on geniaalne – see suudab vastata kõigele, mida küsid, probleemideta. Aga see pole Data. Data õpib, areneb ja kohaneb. Ta ehitab oma kogemuste peale ja see on see, mis paneb ta tunduma nagu tõeline intelligentsus, mitte lihtsalt väga arenenud tööriist. o3 tundub mulle rohkem nagu Star Treki arvuti. See on uskumatult võimas, aga on endiselt selles sisend-väljund režiimis. Tõeline AGI oleks rohkem nagu Data – õpiks reaalajas, kohaneks maailmaga ja kasvaks igast interaktsioonist. Kuni me ei näe midagi sellist, ma ei nimeta seda AGI-ks. o3 on suur samm edasi, aga pole veel seal.
VIITED
https://arcprize.org/blog/oai-o3-pub-breakthrough
https://www.reddit.com/r/OpenAI/comments/1hiptxb/openai_o3_performance_on_arcagi/
https://x.com/gdb/status/1870176891828875658?ref_src=twsrc%5Etfw%7Ctwcamp%5Etweetembed%7Ctwterm%5E1870176891828875658%7Ctwgr%5E8aa14df5139564f3d71ea0157a4aaba00df3cc1a%7Ctwcon%5Es1_&ref_url=https%3A%2F%2Fcdn.embedly.com%2Fwidgets%2Fmedia.html%3Ftype%3Dtext2Fhtmlkey%3Da19fcc184b9711e1b4764040d3dc5c07schema%3Dtwitterurl%3Dhttps3A%2F%2Fx.com%2Fgdb%2Fstatus%2F18701768918288756583Fref_src3Dtwsrc255Etfw257Ctwcamp255Etweetembed257Ctwterm255E1870176891828875658257Ctwgr255E0e1cf1afe60066e9d25f76596371f7f979adf318257Ctwcon255Es1_26ref_url3Dhttps253A252F252Ftechcrunch.com252F2024252F12252F20252Fopenai-announces-new-o3-model252Fimage%3D
https://arstechnica.com/information-technology/2024/12/openai-announces-o3-and-o3-mini-its-next-simulated-reasoning-models/
https://www.youtube.com/watch?v=T7Kx1jLspfc