OpenAI o1 – suurkeelemudelite uue põlvkonna avang

Varasemalt vihjatud mudel nimetusega “Q-star” ja “Strawberry” on nüüd OpenAI uus mudel o1. See parandab varasemate versioonide, näiteks GPT-4o, võimeid, eriti mõtlemise ja probleemide lahendamise osas. Kuigi OpenAI on tehniliste detailide osas salapärane, on nad andnud piisavalt vihjeid, et kokku panna informeeritud arusaam o1 toimimisest. Selles postituses vaatleme neid teadmisi, kuidas o1 mudel enne vastuste esitamist “mõtleb” ning miks see paistab eriti silma konkreetsete ülesannete lahendamisel, nagu programmeerimine ja matemaatika. Millised on uue mudeli ärirakendused?

Mis teeb OpenAI o1 mudeli eriliseks?

OpenAI o1 mudel rakendab uut funktsiooni – mõtteketti (Chain-of-Thought, CoT). Kui me ütleme, et mudel “mõtleb” enne vastamist, viitab see CoT-protsessile, mis võimaldab mudelil sisemiselt genereerida rea samme või arutelutokeneid (reasoning tokens) enne lõpliku väljundi esitamist. Kuigi kasutajad neid üksikuid samme ei näe, aitavad need mudelil pakkuda täpsemaid ja läbimõeldumaid vastuseid. Samas, kasutajad peavad maksma ka arutelutokenite eest.

Sellistes ülesannetes nagu programmeerimine, matemaatika ja andmeanalüüs, on CoT-protsess hindamatu, kuna see sunnib mudelit keerulisi probleeme väiksemateks, hallatavateks osadeks jagama. Selline lähenemine avab ukse ka uutele ärirakendustele, näiteks probleemide lahendamisele, kus osalt on vaja kinni pidada reeglitest, lähtuda ettevõtte võimalustest ning arvestada piirangutega, aga üles näidata ka loomingulisust. Kuigi kasutajaliideses näidatakse ainult lõplikku vastust, kulutab mudel rohkem aega sisemisele töötlemisele, kasutades lisaarvutusvõimsust, et leida lahendus. See on arvutusvõimsuse optimeerimine, mis võimaldab o1-l keerulistes olukordades eelkäijatest paremini hakkama saada.

Stiimulõpe on arutelu võti

O1 treenimiseks kasutas OpenAI segu stiimulõppetehnikatest, mis põhinevad kahel peamisel järelevalve tüübil: tulemuste järelevalve (outcome supervision) ja protsessi järelevalve (process supervision). Tulemuste järelevalve annab mudelile tagasisidet selle kohta, kas lõpptulemus on õige – eriti lihtne on seda teha valdkondades nagu matemaatika, kus vastuseid saab kergesti kontrollida, kas need on õiged või valed.

Tõeline võlu peitub aga protsessi järelevalves. See hõlmab mudeli õpetamist hindama üksikuid samme oma mõttekäigus. Traditsiooniliselt on kasutatud inimmärgistajai, kes mudeli treeningu ajal annavad mudelile tagasisidet, mis aitab mudelil õppida, kuidas toota täpsemaid vaheastmeid. Aja jooksul protsessi järelevalve täiustab mudeli võimet kriitiliselt mõelda ja paremaid otsuseid teha.

Uus mudel on parim saadaolev mudel programmeerimises ja matemaatikas

Miks siis o1 paistab silma valdkondades nagu programmeerimine ja matemaatika? Üks põhjus on see, et nende ülesannete jaoks on suhteliselt lihtne luua sünteetilisi treeningandmeid. Saab automaatselt luua matemaatikaülesandeid ja koodiväljakutseid ning seejärel kontrollida vastuseid kompilaatorite või matemaatiliste lahendustega. See võimaldab OpenAI-l treenida o1-d suurte ja kvaliteetsete andmekogumite abil, täiustades selle võimet lahendada probleeme, mis nõuavad struktureeritud põhjendusi.

See täiustus muudab o1 eriti väärtuslikuks valdkondades, mis nõuavad kriitilist mõtlemist ja tehnilist täpsust, nagu teadusuuringud, inseneriteadus ja andmeanalüüs. Ülesannetes, mis ei nõua palju põhjendusi – näiteks lihtne tekstisisu genereerimine või kõnestiili muutmine – ei pruugi o1 GPT-4o-st paremini töötada.

Ärilised perspektiivid

Sisuliselt on võimalik ka kõik äriülesanded ja -probleemid formaliseerida matemaatiliste ülesannetena. Seetõttu pakub o1 mudel põnevaid väljavaateid ärikasutuseks, eriti valdkondades, mis nõuavad keerulist põhjendamist. Esmalt võib mudelit proovida keerukate andmete analüüsis ja protsesside automatiseerimisel.

1. Täiustatud andmeanalüüs ja teadmiste loomine

O1 mudel paistab silma võimekusega suuri andmekogumeid töödelda ja nende üle järeldusi teha. Seetõttu on see väärtuslik ettevõtetele, kes keskenduvad andmepõhistele otsustele. Ettevõtted saavad seda näiteks kasutada:

  • Keerukate andmekogumite analüüsimiseks, et tuvastada suundumusi ja mustreid.
  • Ennustava analüüsi tegemiseks turu prognoosimiseks, riskihindamiseks ja kliendikäitumise analüüsiks.
  • Struktureerimata andmete (nt klienditagasiside, e-kirjad, sotsiaalmeedia sisu) põhjal teadmiste genereerimiseks.

Kasutades aruteluketi (CoT) põhjendusi, suudab o1 keerulisi küsimusi jaotada osadeks ja pakkuda varasematest mudelitest läbimõelduvamaid vastuseid.

2. Töövoo automatiseerimine

Mudel suudab hakkama saada mitmeastmeliste põhjendustega, mis võimaldab sel täita keerukamaid ülesandeid, mis hõlmavad planeerimist, otsuste tegemist ja vigade tuvastamist. Seetõttu saavad ettevõtted o1-d kasutada loogilist põhjendamist nõudvate korduvate ülesannete automatiseerimiseks, näiteks:

  • Klienditeeninduse päringute automatiseerimiseks, kus lahendamiseks on vaja mitut sammu ning need sammud muutuvad juhtumist tulenevalt.
  • Otsustamise toetamiseks tarneahela juhtimises, alates logistikaplaanide koostamisega kuni laovarude haldamiseni.

4. Prognoosimine

Finantssektor tegeleb sageli suurte ja keerukate andmetega. Tulenevalt mudeli tugevusest struktureeritud põhjendustes ja probleemide lahendamises võib o1 mudel finantsplaneerimise ja auditeerimise protsesse täiendada.

  • Täiustatud finantsmudelite, sealhulgas riskihindamiste ja hinnaprognooside koostamine.
  • Regulatiivsete vastavusprotsesside automatiseerimine, mis nõuavad loogilisi kontrolle ja dokumentide analüüsi.

5. Teadus- ja arendustegevus (R&D)

Ettevõtted, mis tegelevad palju teadusarendustegevusega, võiksid o1 võimekusest kasu saada keeruliste teadus- ja tehniliste andmete analüüsis.

  • Katsete kavandamisel ja läbiviimisel.
  • Suurel hulgal teadusartiklite analüüsimisel tuues välja peamised järeldused.

6. Kliendikogemuse parandamine

Kuigi klienditeenindusbotid on juba kasutusel, võiks o1 neid järgmisele tasemele viia:

  • Käsitledes keerulisemaid kliendipäringuid, mis nõuavad mitut sammu või otsuste tegemist.
  • Pakkudes isikupärastatud soovitusi, tuginedes kliendiandmete süvaanalüüsile. Seni on selliseid analüüse tehtud traditsiooniliste masinõppe mudelitega.
  • Haldades otsast lõpuni klienditoe vestlusi suurema täpsusega ja vähemate eskaleerumistega inimagentidele.

7. Töötajate koolitamine ja oskuste arendamine

Mudelil on loogilise põhjendamise võime, mida saab rakendada ka ettevõtete koolitustegevustes.

  • Töötajate isikupärastatud koolitusprogrammide ja materjalide loomise automatiseerimine arvestades iga töötaja taustaga.
  • Reaalsete stsenaariumite simuleerimine probleemide lahendamise harjutuste ja oskuste hindamiseks.
  • Automatiseeritud õpitoe pakkumine keerulistes valdkondades, nagu programmeerimine, finantsid või õigusküsimused.

Väljakutsed ja kaalutlused

Kuigi o1 mudelil on suur potentsiaal, peaksid ettevõtted arvestama ka teatud väljakutsetega:

  • Kulud: suurenenud arvutusvõimsuse kasutamine aruteluteketi põhjenduse jaoks võib viia kõrgemate tegevuskuludeni võrreldes lihtsamate mudelitega.
  • Usaldusväärsus: kuigi o1 mudel on põhjendamise ülesannetes üsnagi võimekas, on see nagu iga keelemudel, aldis eksimustele ja vigadele. Oluline on tagada, et kriitilised ärilised otsused valideeritakse ekspertide poolt.
o1 mudeli sooritused võrreldes varasemate mudelitega
o1 mudeli sooritus võrreldes gpt-4o mudeliga
o1 mudeli uudne lähenemine vastuste leidmisel: protsessi järelvalve ja tulemuste järelvalve
Mitte kõik pole uue mudeli kohta käivate lubadustega päri.

Mudeli tutvustusvideod

https://vimeo.com/1008662927/afb92a1211

https://vimeo.com/1008674785

Viited

https://openai.com/index/introducing-openai-o1-preview

https://openai.com/index/learning-to-reason-with-llms

https://aicoffeebreakwl.substack.com/p/how-openai-made-o1-think