Grok 4,5 агент сынағында озық шықты, Масктың Opus-Class туралы пікірін растап отыр

  • Grok 4,5 тәуелсіз агент бенчмаркінен озып, Musk-тың шығындар туралы мәлімдемесін қолдады.
  • Модель AutomationBench-AA тестінде 51,4%-ға жетіп, көшбасшылар арасындағы ең төмен шығын көрсетті.
  • Алайда, модель әр тапсырмаға орта есеппен 0,63 ереже бұзушылықты тіркеп, бәсекелестерге қарағанда көбірек көрсетті.

Илон Маск Grok 4.5-ті жылдамырақ әрі арзанырақ Opus-класты модель деп атады. Енді тәуелсіз және агенттік бенчмарк бұл мәлімдемені нақты мәліметпен бекітті.

Artificial Analysis жасаған AutomationBench-AA бойынша Grok 4.5 51,4%-дық көрсеткішпен бірінші орын алып, әр тапсырмаға 0,34 доллар жұмсады. Бұл модель Claude Fable 5-ті (48,6%) және Claude Opus 4,8-ді (48,5%) басып озды.

ЖИ модельдерінің AutomationBench-AA көрсеткіші.
ЖИ модельдерінің AutomationBench-AA көрсеткіші. Дереккөз: Artificial Analysis

Илон Маск мәлімдемесіне тәуелсіз түрде тексеру жүргізілді

SpaceXAI Grok 4.5-ті осы аптада көпшілікке таныстырды, оның негізінде 1,5 трлн параметрлі V9 платформасы жатыр. Масктің дәлелі бастапқы ішкі бағалауларға негізделген болатын.

AutomationBench-AA жағдайды өзгертті. Artificial Analysis бенчмаркті тәуелсіз түрде жүргізіп, өз тапсырмалар жиынтығын құпия ұстады, сондықтан сыртқы ықпалды болдырмады.

Тест кезінде Gmail, Slack, Salesforce және HubSpot сынды 40 имитацияланған қосымшадағы 657 тапсырма тексерілді. Агент қорғаныс шектеулерін бұзбай, мақсаттардың қандай үлесін орындай алғаны бағаланды.

X желісінде бізге жазылыңыз, сонда соңғы жаңалықтардан жедел хабардар боласыз

Grok 4.5: арзанырақ, жылдамырақ әрі көбіне талаптарға сәйкес

Grok 4.5-тің бір тапсырмаға 0,34 доллар жұмсауы Fable 5-тің 1,35 долларынан және Opus 4,8-дің 1,46 долларынан әлдеқайда төмен болды. Ең жақын көрсеткішті Gemini 3.5 Flash көрсетті – 0,49 доллар.

Модель әр тапсырма үшін шамамен 8 000 нәтиже токенін пайдаланды, бұл Opus 4,8-те қолданылған жалпы көлемнің төрттен біріне тең. Мұндай үнемділік шығын айырмашылығын анықтап, Маск ұсынған концепцияға сәйкес келеді.

«Бір тапсырмаға жалпы 0,44 млн токен тұтынумен, бұл модель көшбасшылар қатарында ең аз көрсеткішке ие. Осы тиімділік пен токен бағасының төмендігі бағаның арзан болуына мүмкіндік береді», – деп жазды Artificial Analysis өз X парақшасында.

Сонымен қатар, Grok 4.5 мақсаттардың 79,9%-ын орындап, тапсырмалардың 21,9%-ын толық аяқтады. Ең күрделі сала – қаржыда Grok 4.5 71%-дық көрсеткішке жетіп, Fable 5-тің 64%-ынан және Opus 4,8-дің 62%-ынан озып шықты.

Дегенмен, модель бәсекелестеріне қарағанда жиі ережені бұзды. Әр тапсырма үшін 0,63 жағдай тіркеліп, Opus 4,8-дің – 0,55 және Gemini 3.5 Flash-тың – 0,46 көрсеткішінен жоғары болды.

Мұндай айырмашылық агенттерді нақты қаржы жүйелеріне енгізетін компаниялар үшін маңызды, себебі бір ғана тәртіп бұзу нақты шығын келтіруі ықтимал.

YouTube арнамызға жазылыңыз, жетекшілер мен журналистердің сараптамалық пікірі мен сұхбаттарын көру үшін

Жауапкершіліктен бас тарту

BeInCrypto бейтарап әрі ашық ақпарат таратуды ұстанады. Бұл жаңалық мақаласы дәл әрі уақтылы ақпарат беруді мақсат етеді. Дегенмен, оқырмандарға фактілерді өз бетінше тексеруге және осы контент негізінде қандай да бір шешім қабылдамас бұрын маманмен кеңесуге кеңес беріледі. Назар аударыңыз: біздің Талаптар мен шарттар, Құпиялылық саясаты және Жауапкершіліктен бас тарту мәлімдемелері жаңартылды.