Song song hóa toàn diện: Vượt qua Single-Token Generation với Speculative Decoding
1. Giới thiệu
Speculative Decoding đã nổi lên như một kỹ thuật tối ưu hóa cốt lõi nhằm giảm thiểu memory-bandwidth bottleneck trong quá trình serving Large Language Model (LLM). Bằng cách xác thực nhiều candidate token trong chỉ một forward pass của verifier model, kỹ thuật này cho phép các hệ thống production đạt được mức tăng tốc inference đáng kể.
Tuy nhiên, khi hạ tầng serving tiếp tục phát triển, các framework speculative decoding truyền thống đang dần chạm tới một giới hạn mang tính cấu trúc, bắt nguồn từ cách draft token được tạo ra. Hôm nay, chúng tôi rất vui được giới thiệu cách Speculators và vLLM đang vượt qua những giới hạn này bằng việc cung cấp hỗ trợ open-source toàn diện cho ba thuật toán parallel drafting tiên tiến: P-EAGLE, DFlash và DSpark.
Hình 1. Các thuật toán parallel drafting như P-EAGLE, DFlash và DSpark mang lại mức cải thiện hiệu năng đáng kể so với các thuật toán autoregressive drafting như EAGLE-3. Các Speculator model được đề cập ở trên có thể được tìm thấy trong Speculators Collection trên RedHatAI HuggingFace Hub.
2. Giới hạn của Recursive Drafting
Sự ra đời của các framework như EAGLE và MTP đã tạo nên một bước chuyển đổi lớn về paradigm trong speculative decoding. Thay vì buộc speculator model phải “đoán” một cách mù quáng dựa trên surface-level text, EAGLE cho thấy một kiến trúc speculator có thể truy cập trực tiếp vào các internal hidden states giàu thông tin của verifier model, từ đó làm tăng đáng kể token acceptance rate.
Mặc dù là một bước đột phá, các phiên bản nâng cao như EAGLE-3 vẫn hoạt động dưới một hạn chế mang tính nền tảng: auto-regressive drafting. Để đề xuất một chuỗi candidate token, kiến trúc speculator phải tạo từng token theo tuần tự, thực hiện một forward pass riêng cho mỗi token.
Thiết kế auto-regressive này tạo ra hai đánh đổi lớn trong môi trường production:
- Hạn chế về Model Size: Vì chi phí drafting tăng tuyến tính theo speculation length, các speculator model buộc phải duy trì kích thước cực kỳ nhỏ và nhẹ. Nếu không, thời gian dành cho drafting có thể tiêu tốn phần thời gian vừa được tiết kiệm nhờ quá trình verifier-model verification.
- Tuning vận hành phức tạp: Việc mở rộng tuyến tính giới hạn đáng kể số lượng token có thể draft trong thực tế. Việc lựa chọn speculation length (K) tối ưu trở thành một biến số nhạy cảm mà các engineering team phải liên tục điều chỉnh, tùy thuộc vào từng use case cụ thể và real-time server loading.
Hình 2. Parallel drafting tạo ra nhiều draft token trong một bước duy nhất, trong khi auto-regressive drafting chỉ tạo ra một draft token ở mỗi bước.
3. Chuyển dịch sang Parallel Drafting
Parallel drafting tái thiết kế hoàn toàn sự đánh đổi này bằng cách loại bỏ sequential execution khỏi drafting phase. Thay vì lặp qua các bước single-token generation, các thuật toán parallel drafting dự đoán đồng thời toàn bộ một candidate block gồm nhiều token.
Bằng cách flatten drafting phase thành một single forward pass, độ trễ (latency) của quá trình tạo các proposal không còn phụ thuộc vào số lượng token được speculate. Sự thay đổi về kiến trúc này giúp đơn giản hóa production serving theo hai khía cạnh chính:
Khả năng mở rộng về độ biểu đạt (Capacity for Expressiveness): Vì speculator model chỉ cần chạy một lần cho mỗi block, developer có thể sử dụng các draft architecture lớn hơn, mạnh hơn và có khả năng biểu đạt tốt hơn. Các speculator model sâu hơn có thể nắm bắt những context phức tạp hơn, từ đó đạt acceptance rate cao hơn mà không tạo thêm sequential latency penalty.
Đơn giản hóa việc tuning tham số (Simplified Parameter Tuning): Việc tách drafting cost khỏi block length giúp loại bỏ gánh nặng vận hành khi phải liên tục hyper-tune speculation parameters dựa trên sự thay đổi của server load.
Ý tưởng parallel drafting thực ra đã được nghiên cứu từ trước, với Medusa và PARD là những ví dụ tiêu biểu. P-EAGLE, DFlash và DSpark tiếp tục phát triển nền tảng này bằng cách kết hợp parallel execution với deep verifier-state conditioning, tận dụng chính insight đã giúp EAGLE đạt được thành công lớn.
4. Bên trong hệ thống: Kiến trúc Inference & Training
P-EAGLE, DFlash và DSpark đều dựa trên hidden states của verifier model để tạo draft token theo phương thức parallel, nhưng mỗi thuật toán lại sử dụng một cách tiếp cận khác nhau để đạt được mục tiêu này. Hình 3 minh họa và so sánh trực tiếp kiến trúc của ba phương pháp.
Hình 3. So sánh giữa P-EAGLE, DFlash và DSpark. P-EAGLE đưa hidden states từ verifier vào làm một phần input của speculator model. DFlash project các hidden states vào KV-cache. DSpark xây dựng trên DFlash backbone, đồng thời bổ sung sequential correction và confidence estimator.
Một thách thức chung của cả ba phương pháp nằm ở training. Bất kỳ parallel speculator nào cũng phải thực hiện next-K prediction tại mọi token position trong toàn bộ training sequence. Với một sequence có độ dài N và lookahead window là K, việc tính loss một cách trực tiếp trên toàn bộ matrix sẽ khiến chi phí memory và compute tăng đến mức không khả thi. Mỗi thuật toán giải quyết vấn đề này theo một cách khác nhau.
P-EAGLE
P-EAGLE kế thừa trực tiếp nền tảng của EAGLE, trong đó sử dụng hidden states của verifier model làm input features. Thay vì sử dụng các features này để dự đoán token theo tuần tự, P-EAGLE ánh xạ chúng tới nhiều future positions cùng lúc, từ đó tạo ra toàn bộ một chuỗi candidate token chỉ trong một parallel step.
Để giữ cho quá trình training ở mức khả thi, P-EAGLE triển khai cơ chế draft block sparsification: loại bỏ các token theo lookahead dimension (K) dựa trên một decaying rate, tập trung quá trình optimization vào những token tức thời quan trọng nhất, đồng thời prune các future position ở xa khỏi quá trình tính loss.
DFlash
DFlash xử lý verifier features theo một cách khác. Thay vì đưa hidden states vào như các standard inputs, DFlash project chúng và inject trực tiếp vào KV-cache của speculator model. Cách tiếp cận này giúp conditioning cơ chế attention của speculator bám sát state chính xác của verifier mà không làm tăng input sequence length, từ đó cho phép model tạo ra một block candidate token có độ chính xác cao thông qua block diffusion.
Trong quá trình training, DFlash triển khai sequence length sparsification. Thay vì tính block loss tại mọi token position trong một sequence có độ dài N, thuật toán chọn ngẫu nhiên các anchor point trên timeline và chỉ thực hiện block prediction tại những điểm này. Cách làm này giúp tiết kiệm GPU memory trong khi vẫn duy trì representative coverage.
DSpark
DSpark kế thừa parallel backbone của DFlash và bổ sung thêm hai cải tiến quan trọng.
Đầu tiên, DSpark mở rộng kiến trúc với một lightweight autoregressive correction head, cho phép các future token được condition mạnh hơn dựa trên các token trước đó. Cách tiếp cận này kết hợp lợi thế về throughput của parallel generation với khả năng duy trì sequential coherence của autoregressive refinement.
Thứ hai, DSpark giải quyết một downstream bottleneck quan trọng: verification cost. Parallel drafting có thể tạo ra nhiều draft token với chi phí thấp, nhưng verifier vẫn phải xử lý toàn bộ số token đó. DSpark giới thiệu một confidence head để đánh giá (score) các draft token trước khi chúng được chuyển tới verifier, chỉ forward những token có khả năng được accepted cao. Điều này giúp giảm lượng verification compute bị lãng phí và cải thiện end-to-end throughput.
5. Hiệu năng Inference
Hình 1 minh họa mức cải thiện hiệu năng mà các thuật toán parallel drafting mang lại khi so sánh với EAGLE-3. Ba model và thuật toán parallel drafting tương ứng được trình bày như sau:
| Model | Algorithm | Use case | Hardware |
|---|---|---|---|
| Qwen3-8B | P-EAGLE | Math reasoning (GSM8k) | 1× A100 |
| Qwen3-30B-A3B | DFlash | Coding (HumanEval) | 2× A100 |
| gemma-4-31B-it | DSpark | Coding (HumanEval) | 2× A100 |
Trong tất cả các trường hợp, parallel drafting đều cho thấy mức cải thiện đáng kể so với EAGLE-3. Hiệu năng thực tế sẽ thay đổi tùy theo model, task và hardware configuration. Chúng tôi khuyến khích cộng đồng tự benchmark trên chính workload của mình để đánh giá hiệu quả trong từng trường hợp sử dụng.
6. Production Serving với vLLM và Speculators
Việc tích hợp các thuật toán parallel drafting tiên tiến vào môi trường production đòi hỏi một infrastructure stack ổn định và được tối ưu hóa. Repository Speculators cung cấp một ecosystem thống nhất để train và evaluate các model thế hệ mới này, với khả năng tích hợp hoàn toàn với vLLM.
Việc khởi chạy một speculative engine được hỗ trợ bởi parallel drafting cũng đơn giản như truyền các configuration flags phù hợp ngay khi initialization:
Bằng cách chuyển từ single-token generation sang block-level parallel drafting, toàn bộ inference pipeline của bạn trở nên parallel từ đầu đến cuối, giúp tối đa hóa hardware utilization và mang lại khả năng acceleration ổn định mà không làm thay đổi chất lượng đầu ra.
(Speculative decoding vẫn bảo toàn chính xác output distribution của verifier model thông qua rejection sampling, do đó chất lượng đầu ra về mặt toán học là hoàn toàn tương đương với standard decoding.)
7. Bắt đầu sử dụng
Parallel drafting hiện đã được hỗ trợ đầy đủ, open-source và sẵn sàng cho production. Chúng tôi khuyến khích cộng đồng khám phá repository, sử dụng các training pathway được tài liệu hóa để xây dựng parallel speculator của riêng mình, đồng thời benchmark chúng trực tiếp trên vLLM.
- Repository: Speculators
- Pre-trained speculators: Speculators Collection trên HuggingFace
- Training guides: Speculator tutorials
iRender - GPU Cloud cho AI/Học máy với vLLM
Việc triển khai AI hay học máy với vLLM không nhất thiết phải là một bài toán phức tạp và tốn kém. Thay vì chật vật với những nền tảng khó sử dụng hay đau đầu tính toán các loại chi phí phát sinh vô lý, iRender AI mang đến cho bạn một lối đi thông minh hơn: Hiệu năng thô đạt 100%, băng thông PCIe độc quyền triệt tiêu nghẽn cổ chai và toàn quyền Root Access để bạn tự do làm chủ môi trường MLOps của mình.
Đặc biệt, với chính sách giá trọn gói cố định minh bạch theo giờ/ngày, doanh nghiệp của bạn hoàn toàn kiểm soát được dòng tiền mà không lo bất kỳ khoản phí ẩn (Hidden Fee) nào.
👉 Đã đến lúc đưa dự án AI của bạn bứt phá. [Đăng ký tài khoản iRender ngay hôm nay] để trải nghiệm hạ tầng chuẩn Tier III hoặc liên hệ trực tiếp qua Zalo: 0915 875500 để nhận tư vấn giải pháp tối ưu nhất!
Trân trọng cảm ơn!
Nguồn: vllm.ai
AI Insights
AI/DeepLearning & Khám phá những chuyển động mới.






