Claude Opus 5 Vượt Trội Hơn Fable 5 Trên Hầu Hết Các Tiêu Chí—Với Giá Bằng Một Nửa

By: rootdata|2026/07/24 18:28:43

Claude Opus 5 đã ra mắt hôm nay. Nó rẻ hơn để doanh nghiệp vận hành so với mô hình hàng đầu của Anthropic, Claude Fable 5, mà công ty đã định vị là sản phẩm tiên tiến hàng ngày cho người dùng trả phí. Hơn nữa, Opus 5 cũng vượt trội hơn trên các tiêu chí quan trọng.

Để hiểu Opus 5 phù hợp ở đâu: Dòng sản phẩm của Anthropic chạy bốn cấp độ. Haiku nhanh và rẻ. Sonnet là tầm trung. Opus là cỗ máy làm việc nặng. Trên đó là lớp Mythos—một cấp độ mà Anthropic đã giới thiệu vào mùa xuân này—bao gồm Claude Fable 5 cho công chúng, và Claude Mythos 5, một phiên bản với ít hạn chế hơn dành riêng cho các nhà nghiên cứu an ninh mạng đã được kiểm tra và các nhà điều hành cơ sở hạ tầng quan trọng thông qua Dự án Glasswing.

Fable 5 đã gặp khó khăn trong vai trò là sản phẩm chủ lực cho người đăng ký. Nó ra mắt vào ngày 9 tháng 6, bị rút lại toàn cầu ba ngày sau đó sau khi chính phủ Hoa Kỳ ban hành lệnh kiểm soát xuất khẩu khẩn cấp do một lỗ hổng jailbreak, và trở lại vào ngày 30 tháng 6—chỉ để ngay lập tức chuyển sang mô hình chỉ tín dụng, không còn bao gồm trong các gói tiêu chuẩn. Opus 5 giờ đây lấp đầy vị trí mà Fable 5 không thể giữ.

Lovable, một nền tảng phát triển với hàng triệu người dùng, đã chạy Opus 5 trong các đánh giá nội bộ của mình và lưu ý rằng những cải tiến không chỉ nằm ở điểm số thô: "Nó không chỉ tốt hơn trong các nhiệm vụ lập trình agentic khó nhất của chúng tôi, tăng 22% so với Opus 4.7, mà còn ổn định hơn, với sự biến động ít hơn rất nhiều từ lần chạy này sang lần chạy khác," Fabian Hedin cho biết trong một tuyên bố được chia sẻ bởi Anthropic.

Các tiêu chí

Có thể nghe có vẻ lạ, nhưng Opus vượt qua Fable trên hầu hết mọi thứ sẽ quan trọng đối với người dùng hàng ngày mà không được gán nhãn là lớp Mythos như Fable.

Trên Frontier-Bench v0.1—một tiêu chí kiểm tra xem các tác nhân lập trình AI có thể hoàn thành các nhiệm vụ kỹ thuật phần mềm thực tế từ đầu đến cuối hay không, được chấm điểm dưới dạng tỷ lệ phần trăm các nhiệm vụ đã hoàn thành—Opus 5 đạt 43.3%. Fable 5 đạt 33.7%. GPT-5.6 Sol của OpenAI, đối thủ thương mại chính của Anthropic, đạt 34.4%.

Biên độ rộng nhất là trên ARC-AGI-3, một bài kiểm tra giải quyết vấn đề thực sự được xây dựng xung quanh các câu đố mới mà một mô hình không thể đã ghi nhớ từ dữ liệu đào tạo, được chấm điểm dưới dạng tỷ lệ phần trăm các câu đố đã giải quyết. Opus 5 đạt 30.2%; GPT-5.6 Sol đạt 7.8%; và Fable 5 không được kiểm tra. Trên GDPval-AA v2—một tiêu chí công việc kiến thức được chấm điểm qua xếp hạng Elo, hệ thống xếp hạng kiểu cờ vua được sử dụng để đo lường hiệu suất tương đối trên các nhiệm vụ chuyên nghiệp thực tế—Opus 5 đạt 1,861 so với 1,747 của Fable 5 và 1,736 của GPT-5.6 Sol.

Zapier đã kiểm tra Opus 5 trên AutomationBench, một đánh giá chấm điểm xem một mô hình có thể thực hiện một quy trình làm việc kinh doanh đầy đủ từ đầu đến cuối mà không cần sự trợ giúp của con người hay không. Phán quyết của họ: mô hình "đã lấy một workbook sức khỏe tài khoản thô và thực hiện một chuỗi ngăn chặn rủi ro đầy đủ từ đầu đến cuối: đánh dấu các tài khoản có nguy cơ, cảnh báo chủ sở hữu đúng và tóm tắt cho các hoạt động giữ chân. Các mô hình trước đó không vượt qua; Opus 5 đạt 100%."

Anthropic cũng đang quảng bá Opus 5 như một bản nâng cấp nghiên cứu. Ultima Genomics, một công ty giải mã DNA, cho biết mô hình "hành xử giống như một nhà khoa học cẩn thận hơn bất kỳ mô hình nào mà chúng tôi đã chạy. Nó tìm kiếm các bài kiểm tra thống kê đúng để loại trừ các yếu tố gây nhiễu, kiểm tra lại kết quả của mình bằng các phương pháp độc lập và giữ đúng hướng qua các phân tích nhiều bước dài."

Tuy nhiên, hai lĩnh vực này—pháp lý và sức khỏe—là những lĩnh vực duy nhất mà Fable 5 xuất sắc hơn một chút.

Bản phát hành diễn ra một tuần sau khi Moonshot AI, một công ty khởi nghiệp có trụ sở tại Bắc Kinh được Alibaba hỗ trợ, công bố Kimi K3—một mô hình mở với 2.8 triệu tham số (có nghĩa là bất kỳ ai cũng có thể tải xuống mã cơ bản để chạy độc lập) mà Moonshot mô tả là hệ thống AI mở lớn nhất thế giới. Các tiêu chí độc lập liên tục xếp Kimi K3 đứng thứ ba tổng thể, đứng sau cả Fable 5 và GPT-5.6 Sol, vượt qua hai mô hình này trong các lĩnh vực cụ thể.

Opus 5 hiện có sẵn qua API với giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra. (Token là đơn vị thông tin cơ bản mà một mô hình AI có thể xử lý trong cả đầu vào và đầu ra). Một chế độ Nhanh chạy ở tốc độ khoảng 2.5 lần tốc độ mặc định cũng có sẵn, với giá gấp đôi giá cơ bản—10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra.

Bản phát hành này có thể chấm dứt nỗi lo lắng về việc Fable 5 không có sẵn công khai. Opus cũng có sẵn qua đăng ký cho mọi người.

Giá --

--

Tuyên bố miễn trừ trách nhiệm: Nội dung này chỉ được cung cấp nhằm mục đích xây dựng thương hiệu và cung cấp thông tin chung, không phải là lời khuyên về tài chính, đầu tư, pháp lý hoặc thuế. Mọi sự kiện, phần thưởng, sự kiện trực tuyến hoặc thông tin liên quan được đề cập trong nội dung này không được xem là khuyến nghị, chào mời hoặc lời mời mua, bán, giao dịch hoặc thực hiện bất kỳ hoạt động nào khác liên quan đến tài sản crypto hay sử dụng bất kỳ dịch vụ nào. Tài sản crypto có mức biến động cao và có thể dẫn đến thua lỗ. Dịch vụ và các sự kiện trực tuyến của WEEX có thể không khả dụng tại tất cả khu vực và phải tuân theo các luật, quy định và điều kiện đủ điều kiện hiện hành. Bạn có trách nhiệm bảo đảm việc sử dụng các dịch vụ của WEEX tuân thủ luật pháp địa phương và tự đánh giá cẩn thận các rủi ro trước khi tham gia bất kỳ hoạt động nào liên quan đến crypto.

Bạn cũng có thể thích

iconiconiconiconiconiconicon
Bộ phận CSKH:@weikecs
Hợp tác kinh doanh:@weikecs
Giao dịch Định lượng & MM:[email protected]
Chương trình VIP:[email protected]