Ažuriranja i interna pravila utiču na odgovore, dok naučna istraživanja potvrđuju promenljivost performansi modela
Veliki jezički modeli sve češće pokazuju promene performansi koje korisnici primećuju kroz različite rezultate za iste upite. Ove promene performansi velikih jezičkih modela postaju očigledne kada isti prompt ili instrukcija danas daje drugačiji odgovor nego pre nekoliko meseci. Korisnici primećuju da odgovori mogu biti formalniji, kraći ili manje kreativni, a promene se odnose i na kvalitet logičkog zaključivanja, brzinu i formulaciju odgovora.
Promene performansi velikih jezičkih modela
Korisnici često misle da su promene performansi velikih jezičkih modela subjektivne ili posledica drugačijeg konteksta. Međutim, ovi sistemi nisu statični. Proizvođači uvode nova ažuriranja, menjaju interna pravila ponašanja i unapređuju bezbednosne mehanizme. Nove verzije modela poboljšavaju logičko zaključivanje, izvršavanje instrukcija i brzinu generisanja odgovora, ali takođe smanjuju broj halucinacija i optimizuju troškove rada. Većina manjih ažuriranja prolazi nezapaženo, jer kompanije ne saopštavaju detalje, pa korisnici često nisu svesni promena.
Dodatno, interna pravila određuju kako model odgovara, odbija zahteve ili procenjuje rizike. Kod kompanije OpenAI, ova pravila su dokumentovana u Model Spec specifikaciji, dok ostali proizvođači primenjuju slične sisteme. Takve izmene mogu učiniti model opreznijim ili formalnijim, bez potrebe za novim treniranjem. Bezbednosni i pravni zahtevi, kao što je Evropski akt o veštačkoj inteligenciji, utiču na to da modeli češće odbijaju zahteve ili formulišu odgovore uz veći oprez.
Naučna istraživanja i razlike između modela
Prema istraživanju koje su 2023. godine sproveli Lingdžao Čen, Matei Zaharija i Džejms Zou sa Univerziteta Stanford i Univerziteta Kalifornije u Berkliju, performanse modela GPT-3.5 i GPT-4 značajno variraju tokom vremena. Analiza je pokazala da su na nekim zadacima modeli ostvarili bolje rezultate, dok je na drugim zabeležen pad, posebno u praćenju instrukcija, rešavanju matematičkih zadataka i generisanju koda. S druge strane, optimizacija infrastrukture omogućava brži rad i efikasnije korišćenje resursa, ali može dovesti do razlika u rezultatima i između korisnika istog modela.
Postoji suštinska razlika između zatvorenih i otvorenih modela. Zatvoreni modeli, poput GPT-a, Claude-a, Gemini-ja i Grok-a, funkcionišu kao usluge na serverima kompanija i njihovo ponašanje se može promeniti bez znanja korisnika. Otvoreni modeli, kao što su Llama, Mistral, Qwen ili Gemma, omogućavaju korisnicima da lokalno pokreću model i zadrže istu verziju. To je posebno važno za naučna istraživanja, gde je ponovljivost rezultata ključna.
Implikacije za korisnike i tržište
Stabilnost lokalnih modela daje korisnicima veću kontrolu, jer sami odlučuju kada će ažurirati sistem. S druge strane, komercijalni modeli često menjaju ponašanje bez najave, što može biti izazov za profesionalnu primenu. Promene performansi velikih jezičkih modela posebno utiču na industrije koje zavise od tačnosti i konzistentnosti odgovora, kao što su finansije, zdravstvo i pravne usluge. U tom kontekstu, kontinuirana optimizacija i usklađivanje sa propisima ostaju ključni faktori za razvoj tržišta.