Ollama hỗ trợ Muse Glimmer của Meta Superintelligence Labs ngay khi vừa ra mắt
Muse Glimmer trên Ollama hiện đã chính thức ra mắt. Muse Glimmer là mô hình mở mới nhất của Meta và cũng là mô hình đầu tiên được phát hành bởi Meta Superintelligence Labs. Đây là mô hình đa phương thức (multimodal) 30B được xây dựng chuyên biệt cho AI agent chạy cục bộ, hỗ trợ độ dài ngữ cảnh hơn 128K token và được phát hành theo giấy phép Apache 2.0.
Với Ollama, giờ đây bạn có thể sử dụng Muse Glimmer để vận hành các ứng dụng agent lập trình như Claude Code, Codex, Pi và nhiều công cụ khác, cũng như các trợ lý cá nhân chạy lâu dài như OpenClaw và Hermes.
Trên Apple Silicon, mô hình này khả dụng thông qua MLX engine của Ollama, cung cấp hiệu năng hàng đầu với hỗ trợ mới cho DFlash và đầu vào hình ảnh.
Để chạy Muse Glimmer, hãy tải phiên bản Ollama mới nhất và chạy:
ollama run muse-glimmer
Để đạt hiệu năng tối ưu bằng MLX engine của Ollama trên Apple Silicon, sử dụng:
ollama run muse-glimmer:30b-mlx
Chạy Muse Glimmer cho coding agent cục bộ trên Ollama
Để chạy Muse Glimmer với Claude Code, hãy tải Ollama và chạy:
ollama launch claude –model muse-glimmer
Đối với một coding agent nhẹ hơn, hãy thử Pi:
ollama launch pi –model muse-glimmer
Đối với các framework trợ lý cá nhân như OpenClaw và Hermes, sử dụng:
ollama launch openclaw –model muse-glimmer
ollama launch hermes –model muse-glimmer
Lệnh ollama launch cũng hoạt động với Codex, OpenCode, GitHub Copilot và nhiều công cụ khác. Xem tất cả các tích hợp trong tài liệu của Ollama.
Muse Glimmer cũng hỗ trợ mức độ suy luận có thể điều khiển được: low, medium, high và xhigh. Hãy dùng high hoặc xhigh cho các tác vụ lập trình phức tạp và tác vụ agentic, còn các mức thấp hơn khi tốc độ quan trọng hơn.
Muse Glimmer trên Apple Silicon với MLX và DFlash
Hiệu năng hàng đầu trên Apple Silicon với hỗ trợ mới cho DFlash và đầu vào hình ảnh
MLX engine của Ollama hiện đã hỗ trợ DFlash, được xây dựng dựa trên hỗ trợ trước đó cho dự đoán nhiều token (MTP). Với DFlash, Muse Glimmer trên Ollama chạy nhanh hơn 1,5–1,8 lần trên Apple Silicon.
Để chạy Muse Glimmer bằng MLX engine của Ollama, hãy sử dụng mô hình muse-glimmer:30b-mlx.
Bộ mã hóa nhận thức (perception encoder) chuyên dụng 1,8 tỷ tham số của Muse Glimmer mang lại cho nó khả năng hiểu hình ảnh gốc (native image understanding). Với hỗ trợ đầu vào hình ảnh mới trong MLX engine, các coding agent có thể sử dụng mô hình này để thực hiện gọi công cụ liên tiếp với độ trễ thấp cho những tác vụ cần hình ảnh, chẳng hạn như:
- Xây dựng website hoặc ứng dụng từ bản vẽ hoặc mockup
- Các ứng dụng sử dụng máy tính được hỗ trợ bởi ảnh chụp màn hình
- Đọc tài liệu, hóa đơn và biểu đồ
3. Kết luận
Muse Glimmer trên Ollama cho thấy xu hướng mới của AI cục bộ và AI agent mã nguồn mở: mô hình ngày càng mạnh hơn, hỗ trợ đa phương thức, context dài và tối ưu cho lập trình, RAG cũng như trợ lý cá nhân. Với hỗ trợ MLX trên Apple Silicon, DFlash và đầu vào hình ảnh, Muse Glimmer đặc biệt phù hợp cho các workflow agent chạy cục bộ với độ trễ thấp.
Nếu bạn muốn triển khai Muse Glimmer trên Ollama với hiệu năng cao hơn, xử lý context dài, xây dựng hệ thống RAG hoặc AI Agent thực tế mà không cần đầu tư dàn GPU đắt đỏ, dịch vụ GPU Cloud của iRender với các cấu hình RTX 4090, RTX 5090 và hạ tầng tối ưu cho AI & Deep Learning có thể giúp bạn mở rộng từ môi trường local sang AI inference ở quy mô production.
Nguồn tham khảo: https://ollama.com/


