August 21, 2026 Bella

Cartesia Sonic: Công Nghệ Đứng Sau Voice AI Thời Gian Thực

AI Voice đang chuyển từ khả năng “biết nói” sang trò chuyện tự nhiên với con người. Để làm được điều đó, một hệ thống không chỉ cần tạo ra giọng nói giống người thật mà còn phải phản hồi nhanh, duy trì ngữ cảnh và thể hiện cảm xúc trong lời nói.

Đây cũng là bài toán mà Cartesia Sonic tập trung giải quyết. Đây là dòng mô hình Text-to-Speech (TTS) được thiết kế cho các ứng dụng Voice AI thời gian thực.

Vậy điều gì giúp Cartesia Sonic tạo ra speech nhanh mà vẫn giữ được độ tự nhiên? Câu trả lời nằm ở sự kết hợp giữa State Space Models (SSMs), streaming TTS và cơ chế xử lý context trong quá trình tạo giọng nói.

1. Cartesia Sonic là gì?

Cartesia là công ty AI tập trung vào các hệ thống tương tác thời gian thực. Nền tảng của hãng có Sonic cho Text-to-Speech và Ink cho Speech-to-Text, hướng tới các ứng dụng như voice agent, trợ lý AI và hệ thống hội thoại bằng giọng nói. 

Với TTS truyền thống, quy trình thường khá đơn giản: đưa toàn bộ văn bản vào model, chờ model tạo audio rồi mới phát cho người dùng.

Tuy nhiên, cách này không thật sự phù hợp với một cuộc hội thoại realtime.

Nếu AI phải mất vài giây để tạo xong toàn bộ câu trả lời rồi mới bắt đầu nói, người dùng sẽ cảm nhận rõ độ trễ. Trong khi đó, một cuộc trò chuyện tự nhiên đòi hỏi AI phải bắt đầu phản hồi gần như ngay lập tức.

Cartesia Sonic được xây dựng theo hướng streaming TTS. Thay vì chờ toàn bộ audio hoàn thành, model có thể tạo và stream âm thanh theo từng phần. Nhờ đó, ứng dụng có thể bắt đầu phát audio trong khi những phần còn lại vẫn đang được xử lý. 

Đây là điểm quan trọng đối với Voice AI: người dùng không nhất thiết phải chờ AI “nói xong”, mà chỉ cần AI bắt đầu nói đủ nhanh.

2. State Space Models: nền tảng phía sau Cartesia Sonic

Một trong những điểm đáng chú ý của Cartesia là hãng phát triển các mô hình dựa trên State Space Models (SSMs).

Transformer hiện là kiến trúc quen thuộc trong phần lớn hệ thống AI hiện đại. Với cơ chế attention, Transformer có khả năng xem xét mối quan hệ giữa các token trong một sequence để tạo ra output phù hợp.

SSM tiếp cận bài toán theo một hướng khác.

Thay vì liên tục xử lý toàn bộ lịch sử sequence thông qua attention, mô hình duy trì một state đại diện cho thông tin đã được xử lý. Khi dữ liệu mới xuất hiện, state tiếp tục được cập nhật.

Có thể hình dung đơn giản:

Input → Cập Nhật State → Tạo Output → Tiếp Tục Cập Nhật State

Cách tiếp cận này đặc biệt đáng chú ý với các bài toán xử lý sequence liên tục hoặc có độ dài lớn.

Cartesia cho biết các model của họ được xây dựng trên SSM, hướng tới độ trễ thấp, xử lý context dài và hiệu quả tính toán ở quy mô lớn. Hãng cũng cho biết đội ngũ đã nghiên cứu các kiến trúc như SSM và Mamba. 

Tuy nhiên, sẽ không chính xác nếu nói đơn giản rằng “SSM nhanh hơn Transformer nên Cartesia Sonic nhanh hơn”.

Latency thực tế còn phụ thuộc vào model, inference stack, GPU, streaming, network và nhiều thành phần khác.

Điểm quan trọng hơn là Cartesia lựa chọn kiến trúc phù hợp với mục tiêu xây dựng AI có khả năng tương tác theo thời gian thực.

3. Streaming TTS: khi AI không cần chờ nói xong

Hãy tưởng tượng một LLM đang tạo câu trả lời:

“Xin chào, hôm nay tôi có thể giúp bạn…”

Nếu TTS phải đợi toàn bộ câu trả lời hoàn thành mới bắt đầu xử lý, người dùng sẽ phải chờ.

Với streaming TTS, phần text đầu tiên có thể được chuyển sang Cartesia Sonic ngay khi xuất hiện:

LLM → Text Chunk → Sonic → Audio Chunk → Phát Ngay

Trong lúc người dùng nghe phần đầu tiên, LLM tiếp tục tạo phần tiếp theo và Sonic tiếp tục tạo audio.

Cartesia hỗ trợ streaming thông qua nhiều endpoint. Trong đó, WebSocket cho phép gửi text thành nhiều phần và nhận audio theo từng chunk. Cách này đặc biệt phù hợp khi transcript được tạo liên tục bởi một LLM. 

Nhờ đó, Voice AI có thể giảm đáng kể cảm giác chờ đợi của người dùng.

Tuy nhiên, streaming cũng tạo ra một vấn đề khác: nếu text được gửi quá nhỏ, giọng nói có thể trở nên thiếu tự nhiên.

4. Vì sao Cartesia Sonic cần Context Buffering?

LLM thường sinh văn bản từng token hoặc từng nhóm token. Nếu TTS lập tức biến từng nhóm nhỏ thành audio, model có thể không có đủ context để quyết định cách ngắt câu và thể hiện prosody.

Ví dụ, nếu hệ thống nhận lần lượt:

“Xin chào” → “tôi là” → “Sonic”

Việc tạo ba đoạn audio độc lập có thể khiến giọng nói bị ngắt hoặc thay đổi ngữ điệu giữa các đoạn.

Cartesia sử dụng continuations để giải quyết vấn đề này. Các đoạn text thuộc cùng một context có thể được nối tiếp trong quá trình tạo speech, giúp duy trì prosody giữa các phần audio. 

Sonic cũng có cơ chế buffering. Thay vì tạo speech ngay lập tức từ một token đơn lẻ, model có thể chờ thêm text để có đủ context hoặc tạo audio khi thời gian buffer tối đa đạt tới giới hạn.

Giá trị max_buffer_delay_ms hiện hỗ trợ từ 0 đến 5.000 ms, với mặc định 3.000 ms. 

Điều này cho thấy một nguyên tắc quan trọng của realtime TTS:

Nhanh nhất chưa chắc đã tốt nhất.

Buffer quá ít, AI phản hồi nhanh nhưng giọng nói dễ bị “gãy”. Buffer quá nhiều, speech tự nhiên hơn nhưng người dùng lại phải chờ lâu.

Vì vậy, một hệ thống Voice AI cần cân bằng giữa latency, context và độ tự nhiên của speech.

5. Cartesia Sonic 3.5 có gì đáng chú ý?

Phiên bản hiện tại được Cartesia khuyến nghị là Sonic 3.5. Model có snapshot ổn định sonic-3.5-2026-05-04 và hỗ trợ 42 ngôn ngữ, trong đó có tiếng Việt. 

So với các phiên bản trước, Cartesia Sonic 3.5 tập trung cải thiện chất lượng speech, pacing và khả năng thể hiện cảm xúc.

Cartesia cũng nhấn mạnh khả năng xử lý tốt hơn những nội dung dễ gây lỗi cho TTS như:

  • Mã xác nhận
  • Số điện thoại
  • ID
  • Email
  • Chuỗi chữ và số
  • Các từ có nhiều cách phát âm tùy ngữ cảnh

Model cũng được cải thiện về khả năng xử lý multilingual và những trường hợp như từ đồng âm khác nghĩa trong tiếng Anh. 

Một chi tiết cần lưu ý là một số tính năng điều khiển speedvolume từng có trên Sonic 3 hiện đang tạm thời bị vô hiệu hóa trên Sonic 3.5.

Vì vậy, khi triển khai thực tế, cần kiểm tra đúng model và tính năng được hỗ trợ thay vì áp dụng thông tin từ tài liệu của các phiên bản Sonic cũ

6. Từ Cartesia Sonic đến hạ tầng Voice AI

Để một hệ thống Voice AI realtime hoạt động hiệu quả, chỉ có một model tốt là chưa đủ.

Một pipeline thực tế có thể bao gồm:

Người Dùng Nói → Speech-to-Text → LLM → Text-to-Speech → Audio

Mỗi bước đều tạo ra một phần latency.

Vì vậy, GPU, inference engine, network và cách triển khai model đều ảnh hưởng đến trải nghiệm cuối cùng.

Điều này càng rõ khi hệ thống phải phục vụ nhiều người dùng cùng lúc. Một voice agent dành cho cá nhân có thể chỉ cần xử lý một vài phiên hội thoại, trong khi hệ thống chăm sóc khách hàng có thể phải xử lý hàng trăm hoặc hàng nghìn phiên đồng thời.

Khi đó, bài toán không còn chỉ là latency mà còn bao gồm throughput, concurrency và chi phí inference.

Cartesia hiện cũng hỗ trợ self-hosted Sonic 3.5 trên Kubernetes, cho phép doanh nghiệp triển khai Voice AI trên hạ tầng riêng. Theo tài liệu của hãng, self-hosting có thể giúp giảm network latency nhờ đưa hệ thống đến gần người dùng hơn, đồng thời đáp ứng các yêu cầu về isolation và data sovereignty.

Đây cũng là nơi GPU Cloud trở nên đáng chú ý đối với các đội ngũ phát triển AI.

Thay vì phải đầu tư ngay một hệ thống GPU riêng, doanh nghiệp có thể sử dụng GPU Cloud để thử nghiệm model, benchmark inference, xây dựng prototype hoặc triển khai workload AI theo nhu cầu.

Kết luận

Cartesia Sonic là một ví dụ tiêu biểu cho xu hướng Voice AI đang chuyển từ công nghệ chuyển văn bản thành giọng nói sang nền tảng cho những cuộc hội thoại realtime giữa con người và AI.

Thay vì chỉ tập trung vào chất lượng âm thanh, Sonic được xây dựng xoay quanh bài toán real-time interaction, kết hợp SSM với streaming TTS và cơ chế duy trì context trong quá trình tạo speech.

Sonic 3.5 tiếp tục cải thiện chất lượng, khả năng biểu cảm và hỗ trợ đa ngôn ngữ, trong khi streaming audio giúp AI có thể bắt đầu phản hồi trước khi toàn bộ câu trả lời được tạo xong.

Cuối cùng, để xây dựng một Voice AI thực sự tự nhiên, model và hạ tầng không thể tách rời. Kiến trúc model quyết định khả năng xử lý, nhưng GPU, inference, network và cách triển khai mới quyết định hệ thống có thể biến khả năng đó thành trải nghiệm realtime đến đâu.

Với GPU Cloud của iRender, đội ngũ phát triển có thể linh hoạt thử nghiệm, benchmark và triển khai các workload AI mà không cần đầu tư ngay vào hạ tầng GPU vật lý.

Mục tiêu cuối cùng của Voice AI không chỉ là khiến AI nói giống con người, mà còn là khiến AI phản hồi nhanh, tự nhiên và liền mạch đến mức cuộc trò chuyện trở nên thật sự giống con người.

Nguồn tham khảo: www.cartesia.ai

, , , , , , , , , , , ,

Bella

Greeting everyone. I work as an Assistant Customer at iRender. I always hope to know more about AI and share benefits information with them.
Contact

iRENDER TEAM

MONDAY – FRIDAY: 24/7 Support
SATURDAY – SUNDAY: 6:00 AM – 11:59 PM
(UTC+7)
Hotline: (+84) 912-785-500
Skype: iRender Support
Email: [email protected]
Address 1: 68 Circular Road #02-01, 049422, Singapore.
Address 2: No.22 Thanh Cong Street, Hanoi, Vietnam.

Contact
[email protected]