Anthropic го претстави Claude Sonnet 5.5, вториот модел од фамилијата Claude 5.5 по Opus 5.5. Според компанијата, тој е „јасна надградба“ на Sonnet 5, генерира одговори над 30% побрзо и е нивниот најбрз Sonnet модел досега.
Anthropic го позиционира Sonnet 5.5 како побрза и поевтина алтернатива на Opus 5.5, кој останува наменет за сложена работа што бара внимателно расудување. Новиот модел е најсилен во јасно дефинирани секојдневни задачи, поправање грешки во код и изработка на документи, презентации и табели.
Третиот модел, Claude Haiku 5.5, наменет за апликации со голем обем и ниски трошоци, треба да стигне „во наредните недели“.
Најголемиот скок, според резултатите на Anthropic, е кај програмирањето. На тестот Terminal-Bench 4.0, кој мери колку добро моделот извршува сложени задачи во командна линија, Sonnet 5.5 има 70,6%, наспроти 10,3% кај Sonnet 5, а тоа е повеќе и од 66,4%, колку што Opus 5.5 има во најдобрата поставка. На CursorBench 4.0, со задачи од вистински сесии во Cursor, има 55,5%, односно 2,3 процентни поени помалку од Opus 5.5.
Кај деловните задачи, на тестот GDPval-AA на независната компанија Artificial Analysis, кој опфаќа задачи од 44 занимања, Sonnet 5.5 е само два поени зад Opus 5.5 и околу 400 поени пред Sonnet 5. Сепак, и самиот Anthropic признава дека тестовите покажуваат само еден дел од способностите, а дека Opus 5.5 останува „јасно посилен“ за сложена и отворена работа.
Цената е иста како кај Sonnet 5, односно 2 долари за милион влезни „токени“ и 10 долари за милион излезни, што е двојно пониско од Opus 5.5 за влезните и излезните „токени“. Според Anthropic, новиот модел за истата работа троши значително помалку „токени“, па во нивните тестови една задача чини до 30% помалку. Инвестициската компанија Balyasny, која го тестирала пред објавата, наведува дека во нивните финансиски задачи трошел околу 121.000 „токени“ по одговор, наспроти 497.000 кај Sonnet 5.
Sonnet 5.5 е и првиот Sonnet модел со заштити за сајбер безбедност слични на оние кај Opus 5.5, бидејќи според компанијата неговите способности во оваа област се значително подобрени. Рутинското програмирање и поправањето грешки не се засегнати, но поризичните барања видливо ќе се префрлаат на Sonnet 5.
Дополнително, поради опасноста од таканаречена дестилација, кога преку илјадници лажни профили се извлекуваат способностите на моделот, ова е првиот Sonnet модел со класификатори што спречуваат извлекување на неговото расудување.
Моделот е достапен на сите платформи на Anthropic, како и преку Amazon Web Services, Google Cloud и Microsoft Azure.
Тоа што поевтиниот модел на некои тестови го достигнува, па дури и го надминува Opus 5.5, сугерира дека разликата меѓу двата модели сè повеќе се сведува на цената и сложеноста на задачата. Сепак, повеќето тестови ги изведе самата компанија, па останува да се види колку овие резултати ќе се потврдат во секојдневната работа.







































