Илон Маск Grok 4.5-ті жылдамырақ әрі арзанырақ Opus-класты модель деп атады. Енді тәуелсіз және агенттік бенчмарк бұл мәлімдемені нақты мәліметпен бекітті.
Artificial Analysis жасаған AutomationBench-AA бойынша Grok 4.5 51,4%-дық көрсеткішпен бірінші орын алып, әр тапсырмаға 0,34 доллар жұмсады. Бұл модель Claude Fable 5-ті (48,6%) және Claude Opus 4,8-ді (48,5%) басып озды.
Илон Маск мәлімдемесіне тәуелсіз түрде тексеру жүргізілді
SpaceXAI Grok 4.5-ті осы аптада көпшілікке таныстырды, оның негізінде 1,5 трлн параметрлі V9 платформасы жатыр. Масктің дәлелі бастапқы ішкі бағалауларға негізделген болатын.
AutomationBench-AA жағдайды өзгертті. Artificial Analysis бенчмаркті тәуелсіз түрде жүргізіп, өз тапсырмалар жиынтығын құпия ұстады, сондықтан сыртқы ықпалды болдырмады.
Тест кезінде Gmail, Slack, Salesforce және HubSpot сынды 40 имитацияланған қосымшадағы 657 тапсырма тексерілді. Агент қорғаныс шектеулерін бұзбай, мақсаттардың қандай үлесін орындай алғаны бағаланды.
X желісінде бізге жазылыңыз, сонда соңғы жаңалықтардан жедел хабардар боласыз
Grok 4.5: арзанырақ, жылдамырақ әрі көбіне талаптарға сәйкес
Grok 4.5-тің бір тапсырмаға 0,34 доллар жұмсауы Fable 5-тің 1,35 долларынан және Opus 4,8-дің 1,46 долларынан әлдеқайда төмен болды. Ең жақын көрсеткішті Gemini 3.5 Flash көрсетті – 0,49 доллар.
Модель әр тапсырма үшін шамамен 8 000 нәтиже токенін пайдаланды, бұл Opus 4,8-те қолданылған жалпы көлемнің төрттен біріне тең. Мұндай үнемділік шығын айырмашылығын анықтап, Маск ұсынған концепцияға сәйкес келеді.
«Бір тапсырмаға жалпы 0,44 млн токен тұтынумен, бұл модель көшбасшылар қатарында ең аз көрсеткішке ие. Осы тиімділік пен токен бағасының төмендігі бағаның арзан болуына мүмкіндік береді», – деп жазды Artificial Analysis өз X парақшасында.
Сонымен қатар, Grok 4.5 мақсаттардың 79,9%-ын орындап, тапсырмалардың 21,9%-ын толық аяқтады. Ең күрделі сала – қаржыда Grok 4.5 71%-дық көрсеткішке жетіп, Fable 5-тің 64%-ынан және Opus 4,8-дің 62%-ынан озып шықты.
Дегенмен, модель бәсекелестеріне қарағанда жиі ережені бұзды. Әр тапсырма үшін 0,63 жағдай тіркеліп, Opus 4,8-дің – 0,55 және Gemini 3.5 Flash-тың – 0,46 көрсеткішінен жоғары болды.
Мұндай айырмашылық агенттерді нақты қаржы жүйелеріне енгізетін компаниялар үшін маңызды, себебі бір ғана тәртіп бұзу нақты шығын келтіруі ықтимал.
YouTube арнамызға жазылыңыз, жетекшілер мен журналистердің сараптамалық пікірі мен сұхбаттарын көру үшін









