August 12, 2026 Bella

NVIDIA Nemotron 3.5 Lightning đã có mặt trên Ollama

NVIDIA Nemotron 3.5 Lightning  hiện đã có mặt trên Ollama và chạy hoàn toàn trên chính thiết bị của bạn. Đây là một mô hình mở 30 tỷ tham số (3 tỷ tham số hoạt động) của NVIDIA, được xây dựng cho các tác nhân (agent) hoạt động liên tục: thu thập ngữ cảnh, gọi công cụ và xử lý các tác vụ nhiều bước.

Nemotron 3.5 Lightning được tạo ra cho các tác vụ mang tính agent như đọc tệp, gọi công cụ, sắp xếp kết quả và thử lại những thao tác bị lỗi. Phần lớn các bước này không cần một mô hình lớn. Với 3 tỷ tham số hoạt động trên mỗi token, nó được thiết kế cho các hệ thống cục bộ thay vì trung tâm dữ liệu, và việc chạy cục bộ đồng nghĩa dữ liệu của bạn sẽ luôn nằm trên thiết bị của bạn.

1. Điểm nổi bật của mô hình

  • Chạy ngay tại nơi bạn làm việc: 30 tỷ tham số tổng cộng nhưng chỉ có 3 tỷ tham số hoạt động trên mỗi token, dựa trên kiến trúc Mixture-of-Experts lai. Mô hình có thể chạy cục bộ trên PC NVIDIA RTX, máy trạm NVIDIA RTX PRO, NVIDIA DGX Spark và DGX Station, đồng thời cũng chạy được trong trung tâm dữ liệu và đám mây.
  • Được xây dựng cho các khung agent: được phát triển cùng Nemotron Coalition và huấn luyện cho những công cụ mà lập trình viên đã sử dụng, bao gồm lập trình, gọi công cụ, tuân theo chỉ dẫn và xử lý hội thoại nhiều lượt.
  • Ngữ cảnh 1 triệu token: độ dài ngữ cảnh lên tới 1 triệu token, đủ chỗ cho lịch sử sử dụng công cụ dài trong các quy trình làm việc nhiều lượt.
  • Suy luận được tối ưu: giải mã suy đoán (speculative decoding) sử dụng dự đoán nhiều token (MTP), DFlash hoặc DSpark, cho thông lượng cao hơn tới 4 lần so với các mô hình mở tương đương.
  • Tùy biến theo ý bạn: đây là một mô hình mở được huấn luyện trên các bộ dữ liệu mở. Bạn có thể hậu huấn luyện (post-train) cho một tác vụ cụ thể và chạy kết quả ở bất kỳ đâu, từ thiết bị biên đến trung tâm dữ liệu.

2. Những gì bạn có thể xây dựng

Nemotron 3.5 Lightning đặc biệt mạnh ở các loại tải công việc sau:

  • Trợ lý cá nhân chạy lâu dài. Email, lịch, dự án và đặt chỗ. Khi chạy cục bộ, agent có thể sử dụng ngữ cảnh cục bộ và không có dữ liệu nào được gửi đi nơi khác.
  • Các coding sub-agent. Chạy kiểm thử, tìm kiếm trong codebase và áp dụng tái cấu trúc mã, ngay bên trong các khung làm việc mà bạn đang sử dụng.
  • Vận hành an ninh bảo mật. Làm giàu cảnh báo, phân loại sự cố, truy vấn log, tương quan các chỉ dấu và chuẩn bị kết quả có cấu trúc cho các nhà phân tích.
  • Một tầng cục bộ đi cùng đám mây. Nemotron 3.5 Lightning xử lý các bước có khối lượng lớn ở cục bộ, còn mô hình lưu trữ trên đám mây lớn hơn sẽ đảm nhận số ít bước thực sự cần đến nó. Cùng một CLI, cùng một API.
  • Một chuyên gia do bạn tự huấn luyện. Trọng số mở và bộ dữ liệu mở, vì vậy bạn có thể hậu huấn luyện Nemotron 3.5 Lightning cho một công việc hẹp cụ thể và chạy kết quả đó ngay trên máy cục bộ.

3. Bắt đầu

Tải xuống Ollama, sau đó chạy Nemotron 3.5 Lightning bằng công cụ mà bạn lựa chọn.

Chat thông thường

ollama run nemotron-3.5-lightning

Claude Code

ollama launch claude –model nemotron-3.5-lightning

OpenClaw

ollama launch openclaw –model nemotron-3.5-lightning

Hermes Agent

ollama launch hermes –model nemotron-3.5-lightning

OpenCode

ollama launch opencode –model nemotron-3.5-lightning

Đối với người dùng Apple Silicon, Ollama cung cấp mô hình với hiệu năng hàng đầu: nemotron-3.5-lightning:30b-mlx.

Xem thêm các tích hợp trên trang mô hình.

Mẫu sử dụng tương tự cũng hoạt động với các mô hình chạy trên đám mây của Ollama, vì vậy một agent có thể gửi một bước riêng lẻ đến một mô hình lớn hơn mà không cần thay đổi bất kỳ phần nào khác.

4. Benchmarks

Nemotron 3.5 Lightning cung cấp thông lượng cao hơn 4 lần và thời gian hoàn thành tác vụ nhanh hơn 30% so với các mô hình mở hàng đầu khác có kích thước tương đương, đồng thời đạt độ chính xác dẫn đầu trong các tác vụ agentic, lập trình và suy luận.

Đối với các agent chạy liên tục, thông lượng là con số quan trọng nhất: nhiều bước xử lý hơn mỗi phút đồng nghĩa các tác vụ dài sẽ hoàn thành nhanh hơn. Kết quả đầy đủ và cấu hình thử nghiệm có trong bài viết ra mắt của NVIDIA.

5. Kết luận

Nemotron 3.5 Lightning cho thấy xu hướng mới của AI cục bộ: mô hình mở ngày càng mạnh hơn, hỗ trợ context dài, tool calling và các tác vụ agent chạy liên tục mà không phụ thuộc hoàn toàn vào đám mây. Nếu bạn muốn triển khai Nemotron trên Ollama với hiệu năng cao hơn, xử lý nhiều phiên làm việc đồng thời hoặc xây dựng hệ thống RAG và AI Agent thực tế, GPU Cloud của iRender với các cấu hình RTX 4090, RTX 5090 và hạ tầng tối ưu cho AI & Deep Learning sẽ giúp bạn mở rộng từ thử nghiệm local sang môi trường AI chuyên nghiệp một cách nhanh chóng và linh hoạt.

Nguồn tham khảo: https://ollama.com/

, , , , , , , , , , , , , ,

Bella

Greeting everyone. I work as an Assistant Customer at iRender. I always hope to know more about AI and share benefits information with them.
Contact

INTEGRATIONS

Python
PyTorch
TensorFlow
JAX
Hugging Face
Jupyter
Anaconda
LangChain
LlamaIndex
vLLM
Ollama
ElevenLabs
Cartesia
Fish Audio / Higgs Audio
And many more…

iRENDER TEAM

MONDAY – FRIDAY: 24/7 Support
SATURDAY – SUNDAY: 6:00 AM – 11:59 PM
(UTC+7)
Hotline: (+84) 912-785-500
Skype: iRender Support
Email: [email protected]
Address 1: 68 Circular Road #02-01, 049422, Singapore.
Address 2: No.22 Thanh Cong Street, Hanoi, Vietnam.

Contact
[email protected]