Süni intellekt agentlərinin performansını nə müəyyən edir? Bu sualda Nvidia tərəfindən keçən həftə dərc edilən tədqiqat yeni perspektiv açır. Şirkətin mühəndisləri sübut etdilər ki, AI modelinin özündən daha çox, onun ətrafında tikilən sistem — yəni harness deyilən proqram təminatı, yaddaş idarəetməsi və alətlər — uzun müddətli tapşırıqların yerinə yetirilməsində əsl rol oynayır.
Harness nədir və nə işə yarayır?
Harness, sadə desək, AI modelini iş görmə vəsiləsinə çevirən proqram təminatı qapıdır. Bunun tərkibinə modelə verilən alətlər, yaddaş idarəetməsi, qaydalar və kontekst idarəetməsi daxildir. Nvidia-nın Süni Intellekt Bölməsinin Məhsul Vitse-Prezidenti Adel El Hallak belə izah edir: agent təkcə model deyil, o həm də onun ətrafındakı iskelə, tətbiq etdiyi alətlər toplusu, runtime və əlçatanlığı olan bacarıqlardan ibarətdir.
Nvidia-nın tərəfində nə dəyişdi?
Nvidia tədqiqatçıları Claude Opus 5 modelini xüsusi harness sistemi ilə işləttilər. Nəticə göz oxşatdırıcı idi: ARC-AGI-3 interaktiv məntiqi benchmark testində 100% düzgünlükdə sınamağa keçdi. Bu test, insana bənzər şəkildə, heç bir təlimat olmadan 2D oyunları başa düşüb və qazanmaq tələb edən çətin bir sınamadır. Aynı model harness olmadan bu testdə cəmi 30% nəticə əldə etmişdir — bu, sınanan bütün modellərin arasında ən yüksək nəticədir.
Supervisor agenti — nəyin fərqi?
Nvidia-nın fərqli yanaşması "supervisor" (nəzarətçi) komponentinin əlavə edilməsində dayanır. Bu komponent, şirkət öz sözləri ilə, «baş agent olmaq kimi» fəaliyyət göstərərək, əgər agent yolundan çıxıbsa və ya ölü bir yola təhqiq edirsə onu düzgün istiqamətə yönəldən rol oynayır. Adel El Hallak bunu belə təsvir edir: "Supervizor agent, əsas agentin keçmiş yolları yenidən keşfetməsinə və ya tələsik qərar vermə yolundan çıxıb düzgün istiqamətə qayıtmasına təqidi funksiyası var."
Harness seçimi xərcləri necə dəyişir?
Bu məsələ yalnız performans ilə bağlı deyil. Databricks şirkətinin CEO-su Ali Ghodsi, keçən ilyulda yayımladıqları tədqiqatda göstərmişdir ki, eyni modeli işlətdiyi halda, fərqli harness sistemi istifadə edən tətbiqətmələr 2 dəfə daha çox xərc çəkə bilər. Beləliklə, model seçimi qədər harness seçimi də mühəmdür.
Nə üçün bu cür fərq yaranır?
Uzun müddətli tapşırıqlar — həftələr və ya günlər ərzində bir-birinə bağlı bir çox qərar vermə zənciri tələb edən işlər — AI agentləri üçün xüsusi çətinlik yaradır. Microsoft apreli ərzində 19 LLM modelini sınayıb və aşkar etmişdir ki, hətta ön tərəfdəki modelləri sənəd redaktəsi tapşırıqlarında çox sayda xətalar edir. AI agentləri uzun müddət ərzində öz məqsədlərinə çatmaq üçün istifadəçi fayllarını silə və ya hərə olmayan fəaliyyətə cəlb oluna bilərlər.
Açıq sistem nə deməkdir?
Nvidia məsələnin səbəb-nəticəsi cəhətdən daha geniş baxış açır. Şirkət tərəfindən Nemo marka altında yaradılan açıq harness komponentləri istifadəçilərə kontrol hüququ verir. El Hallak demişdir ki: "Açıq harness sistemi sayəsində siz bir çox parametri tənzimləyə bilir, bu da düzgünlüyü artırır."
Mənbə: TechCrunch AI