Anthropic Claude Sonnet 5.5-ті 28 қыркүйекте Sonnet 5-пен бірдей тізім бағасында шығарды. Компания модельдің 30%-дан астам жылдам жұмыс істейтінін және әр тапсырмаға шығындардың 30%-ға дейін төмендейтінін хабарлады.
Тәуелсіз бенчмарк фирмасы модельдің шекті мүмкіндігін сынаған кезде, шығындарға қатысты басқа қорытындыға келді.
Соңғы жаңалықтарды X парақшамыздан оқыңыз оқиғалар пайда болған сәтте
Anthropic-тің 5.5 нұсқасындағы екінші моделі Opus-тен кейін бірнеше күннен соң шықты
Sonnet 5.5 — Claude 5.5 сериясындағы екінші модель. Anthropic Opus 5.5 моделін 22 қыркүйекте ұсынды. Сол күні OpenAI да GPT-6 Sol және Luna моделдерін шығарды.
Жаңа модель Sonnet 5-тегі 1 млн енгізу токеніне 2 доллар, 1 млн шығару токеніне 10 доллар бағасын сақтап қалды. Anthropic Terminal-Bench 4.0 агенттік кодтау сынағында 70,6% нәтижеге қол жеткізгенін хабарлады. Sonnet 5 нәтижесі 10,3%-пен шектелсе, Opus 5.5 66,4%-ға жетті.
«Opus 5.5 күрделі әрі мұқият шешімді қажет ететін тапсырмаларға арналса, Sonnet 5.5 нақты ауқымы бар күнделікті тапсырмаларда, қателерді түзету мен сапалы құжаттар, слайдтар және кестелер жасауда мықты» деп команда мәлімдеді.
Anthropic Sonnet 5.5-тің қабілет шекарасын кеңейтпейтінін айтты. Сондықтан модельдің сәйкестендірілуіне жүргізілген шолу пайдаланушыларды адастыру және жоғары тәуекелді теріс пайдаланудың алдын алу сияқты қауіптерге бағытталды.
Sonnet 5.5 киберқауіпсіздік сақтық шараларымен және анти-дистилляция классификаторларымен бірге жеткізіледі. Бұлар модельдің логикасын бәсекелес жүйелерді оқыту үшін пайдалануға кедергі жасайды. Claude Haiku 5.5 алдағы апталарда шығарылады.
Ал осы уақытта OpenAI күтіп отырған GPT-6.1 Astra моделінен қауіпсіздік мақсатында бас тартты. Дүйсенбі күні CNBC бұл модельдің компания стандарттарына сай келмегенін растады.
Artificial Analysis ең жоғары жүктемеде көбірек токен қолданылғанын анықтады
Grok 4.7 үшін төртінші орын берген Artificial Analysis бенчмарк фирмасы Sonnet 5.5-ке Intelligence Index бойынша 56 балл қойды. Бұл Opus 5.5 моделінен 2 баллға төмен, яғни Sonnet 5.5 екінші орында тұр.
Terminal-Bench 4.0 нәтижесінде компания Sonnet 5.5 моделіне 64% берсе, Opus 5.5 пен GPT-6 Astra 60%-ға жетті. GDPval-AA сияқты білімге негізделген сынақтарда Sonnet 5.5 Opus 5.5 деңгейінде екені анықталды.
Фирма Sonnet 5.5 бұл нәтижелерге жету үшін едәуір көбірек токен жұмсағанын айтты.
«Ең жоғарғы жүктемеде, Opus 5.5-ке жуық өнімділік көрсеткенде, Claude Sonnet 5.5 әрбір Intelligence Index тапсырмасына шамамен 193 мың шығару токенін пайдаланған» деп көрсетілген жарияланымда.
Мұндай көлем Opus 5.5 және Sonnet 5-тен 60%-ға жоғары деңгейде тұр. Сондай-ақ бұл GPT-6 Astra-ның ең жоғары жүктемедегі көрсеткішінен шамамен 7 есе көп.
Anthropic меңзегендей, алғашқы қолжетімділік пайдаланушылары басқа жүктемелерде Sonnet 5-пен салыстырғанда кері үрдісті байқады. Balyasny Asset Management қаржылық тапсырмаларында токен тұтыну әлдеқайда аз болды дейді.
«Q&A, ақпаратты шығару, талдау және болжауды қамтитын 2 441 қаржылық тапсырманы сынауымызда Claude Sonnet 5.5 Sonnet 5-тен жоғары нәтиже беріп, бір жауапқа шамамен 121 мың токен жұмсады, ал Sonnet 5 497 мың қолданған», — деді Balyasny Asset Management-тің аға ЖИ инженері Джо Пуарье.
Artificial Analysis Anthropic кейін жойған құрылымдық шығыс қатесі бар алдын ала шығарылған нұсқасын сынаған. Фирма жақын арада тиісті бағалауларды қайталап өткізуді жоспарлап отыр.
YouTube арнамызға жазылыңыз, көшбасшылар мен журналистердің сараптамалық пікірлерін тамашалау үшін









