Kazakh

Grok 4,5 агент сынағында озық шықты, Масктың Opus-Class туралы пікірін растап отыр

  • Grok 4,5 тәуелсіз агент бенчмаркінен озып, Musk-тың шығындар туралы мәлімдемесін қолдады.
  • Модель AutomationBench-AA тестінде 51,4%-ға жетіп, көшбасшылар арасындағы ең төмен шығын көрсетті.
  • Алайда, модель әр тапсырмаға орта есеппен 0,63 ереже бұзушылықты тіркеп, бәсекелестерге қарағанда көбірек көрсетті.

Илон Маск Grok 4.5-ті жылдамырақ әрі арзанырақ Opus-класты модель деп атады. Енді тәуелсіз және агенттік бенчмарк бұл мәлімдемені нақты мәліметпен бекітті.

Artificial Analysis жасаған AutomationBench-AA бойынша Grok 4.5 51,4%-дық көрсеткішпен бірінші орын алып, әр тапсырмаға 0,34 доллар жұмсады. Бұл модель Claude Fable 5-ті (48,6%) және Claude Opus 4,8-ді (48,5%) басып озды.

ЖИ модельдерінің AutomationBench-AA көрсеткіші.
ЖИ модельдерінің AutomationBench-AA көрсеткіші. Дереккөз: Artificial Analysis

Илон Маск мәлімдемесіне тәуелсіз түрде тексеру жүргізілді

SpaceXAI Grok 4.5-ті осы аптада көпшілікке таныстырды, оның негізінде 1,5 трлн параметрлі V9 платформасы жатыр. Масктің дәлелі бастапқы ішкі бағалауларға негізделген болатын.

AutomationBench-AA жағдайды өзгертті. Artificial Analysis бенчмаркті тәуелсіз түрде жүргізіп, өз тапсырмалар жиынтығын құпия ұстады, сондықтан сыртқы ықпалды болдырмады.

Тест кезінде Gmail, Slack, Salesforce және HubSpot сынды 40 имитацияланған қосымшадағы 657 тапсырма тексерілді. Агент қорғаныс шектеулерін бұзбай, мақсаттардың қандай үлесін орындай алғаны бағаланды.

X желісінде бізге жазылыңыз, сонда соңғы жаңалықтардан жедел хабардар боласыз

Grok 4.5: арзанырақ, жылдамырақ әрі көбіне талаптарға сәйкес

Grok 4.5-тің бір тапсырмаға 0,34 доллар жұмсауы Fable 5-тің 1,35 долларынан және Opus 4,8-дің 1,46 долларынан әлдеқайда төмен болды. Ең жақын көрсеткішті Gemini 3.5 Flash көрсетті – 0,49 доллар.

Модель әр тапсырма үшін шамамен 8 000 нәтиже токенін пайдаланды, бұл Opus 4,8-те қолданылған жалпы көлемнің төрттен біріне тең. Мұндай үнемділік шығын айырмашылығын анықтап, Маск ұсынған концепцияға сәйкес келеді.

«Бір тапсырмаға жалпы 0,44 млн токен тұтынумен, бұл модель көшбасшылар қатарында ең аз көрсеткішке ие. Осы тиімділік пен токен бағасының төмендігі бағаның арзан болуына мүмкіндік береді», – деп жазды Artificial Analysis өз X парақшасында.

Сонымен қатар, Grok 4.5 мақсаттардың 79,9%-ын орындап, тапсырмалардың 21,9%-ын толық аяқтады. Ең күрделі сала – қаржыда Grok 4.5 71%-дық көрсеткішке жетіп, Fable 5-тің 64%-ынан және Opus 4,8-дің 62%-ынан озып шықты.

Дегенмен, модель бәсекелестеріне қарағанда жиі ережені бұзды. Әр тапсырма үшін 0,63 жағдай тіркеліп, Opus 4,8-дің – 0,55 және Gemini 3.5 Flash-тың – 0,46 көрсеткішінен жоғары болды.

Мұндай айырмашылық агенттерді нақты қаржы жүйелеріне енгізетін компаниялар үшін маңызды, себебі бір ғана тәртіп бұзу нақты шығын келтіруі ықтимал.

YouTube арнамызға жазылыңыз, жетекшілер мен журналистердің сараптамалық пікірі мен сұхбаттарын көру үшін


BeInCrypto ұсынған криптовалюта нарығына қатысты ең соңғы талдауды оқу үшін мында басыңыз.

Жауапкершіліктен бас тарту

Біздің веб-сайттағы барлық ақпарат адал ниетпен және тек жалпы ақпарат беру мақсатында жарияланады. Біздің веб-сайттағы ақпаратқа сүйеніп қабылданған кез келген шешімге оқырманның өзі жауапты болады. Қосымша ақпаратты біздің Пайдалану шарттары, Құпиялылық саясаты және Жауапкершіліктен бас тарту ескертпесі беттерінен оқи аласыз.