Компания Anthropic представила свои новейшие разработки — модели Claude Fable 5.1 и ее идентичного «близнеца» Mythos 5.1, предназначенного исключительно для проверенных организаций. Как пишет trendingtopics.eu, аналитики из Artificial Analysis уже успели протестировать новинку, и результаты оказались впечатляющими: Fable 5.1 заняла первую строчку в глобальном рейтинге производительности нейросетей.
Однако за блестящими цифрами бенчмарков скрывается любопытная экономическая коллизия. Anthropic заявляет о снижении стоимости чтения кэша на 75%, что теоретически должно сократить расходы пользователей на четверть. В реальности же замеры Artificial Analysis показали, что выполнение одной задачи на Fable 5.1 обходится примерно на 20% дороже, чем на предыдущей версии, из-за возросшего потребления токенов новой моделью.
Рекордные баллы в индексе интеллекта
В ходе предварительной оценки Fable 5.1 набрала 66 баллов в индексе интеллекта Artificial Analysis при настройке максимальной логики (max reasoning). Это самый высокий показатель за всю историю наблюдений, оставивший позади Claude Opus 5 и конкурентов в лице GPT-5.6 Sol и Grok 4.6. Разрыв с предшественницей Fable 5 составил весомые четыре пункта.
Модель демонстрирует лидерство и в специализированных дисциплинах. В тесте Humanity’s Last Exam она достигла точности 59,1%, а в банковском сценарии 𝜏³ прибавила сразу девять пунктов. Сама Anthropic отмечает колоссальный скачок в решении научных агентских задач — с 24,7% до 52,6%, что указывает на качественное изменение способности ИИ к автономному планированию.
Гонка за качеством ответов привела к тому, что Fable 5.1 стала избыточно «болтливой», расходуя в 1,7 раза больше выходных токенов. Снижение цены на кэш — это не столько щедрость, сколько попытка компенсировать возросшие аппетиты модели. Мы наблюдаем опасный тренд: интеллект растет, но его себестоимость для конечного разработчика остается высокой, заставляя выбирать между точностью и бюджетом. Эпоха дешевых вычислений для сложных задач пока откладывается.
Баланс между стоимостью и качеством
Для тех, кто умеет считать деньги, Anthropic предусмотрела гибкость. Использование настройки «xhigh» вместо «max» позволяет сохранить 65 баллов производительности, при этом стоимость выполнения задачи падает с 3,76 до 2,72 доллара. Всего доступно пять уровней усилий, где потребление токенов может различаться в одиннадцать раз.
Стоит отметить, что в задачах по работе со знаниями Fable 5.1 идет практически вровень с Claude Opus 5. Новая модель лидирует в аналитическом качестве, но иногда уступает в подаче результатов. Кроме того, Fable 5.1 проявляет большую смелость: она чаще пытается ответить на сложные вопросы (93,4% попыток), но при этом и галлюцинирует чаще, чем ее предшественница.
Интеграция модели уже началась через Claude API и облачные платформы AWS, Google Cloud и Azure. Важный нюанс для индивидуальных пользователей: Fable 5.1 не входит в стандартную подписку Claude Pro — за работу с ней придется доплачивать отдельно. В этом контексте Opus 5 остается наиболее рациональным выбором для большинства сценариев, предлагая схожую эффективность при меньших затратах.
Оставить комментарий