Осы тақырыпқа қатыстыБолашақ технологиялары және ЖИ кеңесі

Mythos қайта оралды: Anthropic сынақтары Fable 5-тің ерекше тәуекелді болмағанын көрсетті

  • Сынақтар Opus 4,8, GPT-5,5 және Kimi K2,7 бірдей осал тұстарды анықтай алатынын көрсетті.
  • Claude Fable 5 әлемдік деңгейде, көбірек қорғау шараларымен, 2 шілде қайта оралады.
  • Fable 5-тің жаңа классификаторлары бейтарап код жазу және жөндеу тапсырмаларын көбірек белгілеп отыр.

Anthropic ішкі сынақтар Claude Fable 5 жеке киберқауіпсіздік қауіптерін тудырмайтынын анықтады, ал Claude Mythos 5 әлем бойынша 2 шілдеде қайта ұсынылады.

Fable 5-тің әлемдік қайта іске қосылуымен бірге берілген бұл мәлімдеме 12 маусымда АҚШ-тың экспортты бақылауына байланысты 18 күндік тоқталысқа нүкте қойды. Anthropic шектеудің нақты қаупін анықтау үшін бәсекелес үлгілерді сынап көрді.

Anthropic не себепті Fable 5-ті тоқтатты

Fable 5 және Mythos 5 9 маусымда таныстырылып, бірдей негізгі үлгіні қолданды, бірақ Fable 5 көпшілікке, ал Mythos 5 тек шектеулі, Project Glasswing жобасының сенімді серіктестеріне қорғаныстық киберқауіпсіздік жұмыстары үшін қолжетімді болды.

Экспортты бақылаулар Amazon зерттеушілері Fable 5-тің қауіпсіздік жүйесін айналып өтудің жолын тапқан соң пайда болды. Бұл тәсіл үлгіні бағдарламалық жасақтама осалдықтарын анықтауға және бір жағдайда осы осалдықты пайдалану жолын көрсетуге итермеледі.

Anthropic-тің сынақтары бойынша Claude Opus 4,8, GPT-5,5 және Kimi K2,7 Fable 5 Amazon есебіндегі белгілегендей осалдықтарды анықтай алады. Әрбір сыналған үлгі сондай-ақ сол бір эксплуатацияны қайталап көрсете алды.

Мұндай нәтиже бүкіл индустрияда бар кемшілікті көздеген шектеу болуы ықтимал дегенді байқатады, арнайы Fable-ге тән қауіп емес. Дегенмен, Anthropic бұл тәсілді бұғаттайтын қуаттырақ классификатор әзірледі, ол енді жүйелі кодтау мен оңалту бойынша сұрауларды да белгілейді.

Шектеулер қалай жұмыс істейді

Fable 5 компания жасаған кез келген үлгі арасындағы ең жоғары қауіпсіздік шегін пайдаланып іске қосылды. Классификаторлар кішкене қауіпті болып көрінетін сұрауларды да, тек айқын зиянды сұраулармен қатар, бұғаттайды. Amazon есебінен кейін үйретілген жаңа классификатор аталған айналып өту әрекетін 99%-дан астам жағдайларда бұғаттайды, Anthropic дерегіне сәйкес. Бұғатталған сұраулар енді автоматты түрде Opus 4,8-ге бағытталады.

Мұндай қауіпсіздік шегі өз құнын талап етеді. Anthropic классификатор зиянсыз кодтау және қателерді түзету сұрауларын тым жиі белгілейтінін мойындап, жалған оң нәтижелерді азайту үшін оны одан әрі жетілдіретінін хабарлады. Mythos 5, шектеулер саны аздау болғандықтан, мемлекеттік органдардың 26 маусымда мақұлдауынан өткен тек Mythos 5 ұйымдары үшін ғана қайта іске қосылды.

Anthropic-тің деректері күрделірек сұрақты алға тартады: әлсіз үлгілердің өзі Fable 5-ке қойылған тыйымға себеп болған әрекетті орындай алса, жаңа үздік үлгілер іске қосылғанда, реттеушілер қандай стандарттарды қолданады?

Жауапкершіліктен бас тарту

BeInCrypto бейтарап әрі ашық ақпарат таратуды ұстанады. Бұл жаңалық мақаласы дәл әрі уақтылы ақпарат беруді мақсат етеді. Дегенмен, оқырмандарға фактілерді өз бетінше тексеруге және осы контент негізінде қандай да бір шешім қабылдамас бұрын маманмен кеңесуге кеңес беріледі. Назар аударыңыз: біздің Талаптар мен шарттар, Құпиялылық саясаты және Жауапкершіліктен бас тарту мәлімдемелері жаңартылды.