Anthropic triển khai Claude Sonnet 5.5 với hiệu năng và khả năng lập trình vượt trội, tiệm cận mô hình Opus 5.5 nhưng với mức giá chỉ bằng một nửa.
Anthropic ra mắt Claude Sonnet 5.5, mạnh hơn Opus 5.5 ở nhiều bài kiểm tra lập trình
Vào ngày 29/09, công ty trí tuệ nhân tạo Anthropic đã chính thức ra mắt Claude Sonnet 5.5, phiên bản thứ hai thuộc dòng Claude 5.5 và là bản nâng cấp của Claude Sonnet 5 ra mắt hồi tháng 6.
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family.
— Claude (@claudeai) September 28, 2026
It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work. pic.twitter.com/UvXD8mDTF1
Sonnet 5.5 được Anthropic định vị là mô hình cân bằng giữa hiệu năng, tốc độ và chi phí, hướng đến những công việc thường ngày như lập trình, sửa lỗi phần mềm, xử lý tài liệu, bảng tính, slide và thiết kế giao diện. Mô hình mới được cho là nhanh hơn hơn 30% so với Sonnet 5, đồng thời tiêu tốn ít token hơn để hoàn thành cùng một công việc, qua đó giúp giảm tới 1/3 chi phí xử lý trong phần lớn tác vụ.
Dù được nâng cấp đáng kể, Sonnet 5.5 vẫn giữ nguyên mức giá 2 USD cho mỗi triệu input token và 10 USD cho mỗi triệu output token, chỉ bằng một nửa so với Claude Opus 5.5.
Sonnet 5.5 vượt Opus 5.5 ở nhiều bài kiểm tra lập trình
Khả năng lập trình và vận hành như một AI agent là điểm cải thiện nổi bật nhất của Sonnet 5.5.
Trong Terminal-Bench 4.0, benchmark đánh giá khả năng AI tự sử dụng terminal để giải quyết các tác vụ lập trình nhiều bước, Sonnet 5.5 đạt 70,6%, vượt Opus 5.5 với 66,4% và bỏ xa mức 10,3% của Sonnet 5.
Kết quả thử nghiệm độc lập của Artificial Analysis cũng cho thấy xu hướng tương tự. Sonnet 5.5 đạt 63,6%, nhỉnh hơn Opus 5.5 ở mức 59,6% và OpenAI GPT-6 Astra với 59,1%.
Anthropic has launched Claude Sonnet 5.5: it scores 56 on the Artificial Analysis Intelligence Index, just 2 points behind Opus 5.5 (max), but at the highest Output Tokens per Task we’ve seen
— Artificial Analysis (@ArtificialAnlys) September 28, 2026
With max effort, Sonnet 5.5 gains 18 points over Sonnet 5 and to #2 on the Intelligence… pic.twitter.com/aunF6RTycN
Khoảng cách về chi phí còn thể hiện rõ hơn trong FrontierCode. Khi chạy ở chế độ High effort, Sonnet 5.5 đạt hiệu quả tương đương GPT-6 Sol nhưng Anthropic cho biết chi phí cho mỗi tác vụ chỉ bằng khoảng một phần năm.
Năng lực của mô hình mới cũng không chỉ giới hạn ở lập trình. Trong GDPval-AA, benchmark sử dụng hệ thống Elo để đánh giá AI trên các công việc thực tế thuộc 44 ngành nghề, Sonnet 5.5 đạt 1.844 điểm, gần như ngang bằng 1.846 điểm của Opus 5.5 và cao hơn mức 1.487 điểm của GPT-6 Sol.
Sonnet 5.5 cũng thu hẹp khoảng cách với Opus 5.5 ở nhiều tác vụ khác như computer use, nhận diện biểu đồ, xử lý công việc tri thức dài hạn và hiểu hình ảnh. Anthropic thậm chí cho biết đây là mô hình Sonnet đầu tiên có thể hoàn thành Pokémon Red chỉ dựa vào ảnh chụp màn hình.
Tuy nhiên, đơn giá rẻ hơn không đồng nghĩa Sonnet 5.5 luôn tốn ít tiền hơn. Artificial Analysis ghi nhận ở chế độ High effort, mô hình sử dụng tới 193.000 token cho mỗi tác vụ, nhiều hơn khoảng 60% so với Opus 5.5. Vì vậy, chi phí thực tế có thể lên tới 7,6 USD/tác vụ, cao hơn khoảng 50% so với Sonnet 5.
Nguyên nhân nằm ở việc High effort cho phép mô hình suy luận lâu và sử dụng nhiều token hơn để đạt chất lượng cao nhất. Với Medium effort, thiết lập mặc định trên ứng dụng Claude, Anthropic cho biết Sonnet 5.5 vẫn vượt Sonnet 5 về khả năng lập trình nhưng chi phí cho mỗi tác vụ chỉ bằng khoảng 1/10. Do đó, chi phí thực tế của Sonnet 5.5 sẽ phụ thuộc khá nhiều vào mức effort mà người dùng lựa chọn.
Hiệu quả thực tế được cải thiện
Bên cạnh các bài kiểm tra tiêu chuẩn, Anthropic còn đưa Sonnet 5.5 vào thử nghiệm với một số doanh nghiệp để đánh giá khả năng xử lý công việc thực tế.
Epic Games cho biết mô hình có thể làm việc với hàng chục nghìn dòng mã nguồn, phân tích kiến trúc hệ thống và luồng dữ liệu với chất lượng tương đương các mô hình cao cấp hơn, trong khi vẫn duy trì tốc độ phản hồi tốt ở những tác vụ kéo dài nhiều giờ.
Kết quả từ Slack cũng cho thấy hiệu quả cải thiện ngay cả khi không cần điều chỉnh cách sử dụng. Sau khi thay Sonnet 5 bằng Sonnet 5.5 mà giữ nguyên prompt, chatbot nội bộ của công ty đạt kết quả tốt hơn trong gần như toàn bộ bài kiểm tra offline, hoàn thành công việc với ít bước hơn và giảm khoảng 14% lượng output token.
Những người dùng thử sớm cũng đánh giá Sonnet 5.5 có khả năng cộng tác tự nhiên hơn, đặc biệt trong các công việc cần kết hợp giữa nội dung và trình bày. Mô hình có thể thiết kế giao diện tốt hơn và tạo ra những bộ slide gần như hoàn chỉnh từ dữ liệu cùng mẫu trình bày có sẵn.
Anthropic tăng cường bảo mật cho Sonnet 5.5
Cùng với việc nâng cấp hiệu năng, Anthropic cũng đưa một số lớp bảo vệ vốn được áp dụng trên Opus xuống Sonnet 5.5. Đây là mô hình Sonnet đầu tiên được triển khai với các biện pháp bảo vệ an ninh mạng tương tự Opus 5.5, nhằm hạn chế những yêu cầu có rủi ro cao mà không ảnh hưởng đáng kể đến các tác vụ lập trình thông thường.
Mô hình cũng được bổ sung cơ chế chống distillation attack, hình thức khai thác lượng lớn tương tác với một AI để sao chép năng lực của mô hình sang một hệ thống khác, có thể không đi kèm các lớp bảo vệ tương ứng.
Dù Sonnet 5.5 đã vượt Opus 5.5 ở một số benchmark, đặc biệt là lập trình, Anthropic vẫn duy trì sự phân cấp giữa hai dòng sản phẩm: Sonnet 5.5 hướng đến tốc độ, chi phí và khối lượng công việc hằng ngày, còn Opus 5.5 tiếp tục là mô hình dành cho những bài toán phức tạp cần suy luận sâu và duy trì phán đoán trong thời gian dài.
Coin68 tổng hợp