Needle2: mô hình AI 14MB chạy trên Raspberry Pi và điện thoại cũ
Needle2 là mô hình AI 45 triệu tham số nặng 14MB, chạy trong 28MB RAM trên Raspberry Pi hay điện thoại cũ. Nó làm được gì, hỏng ở đâu, khi nào nên dùng.
Một mô hình AI nặng 14MB, chạy trong khoảng 28MB RAM, đủ nhẹ để nằm trong cảm biến hay điện thoại cũ và vẫn gọi được lệnh điều khiển thiết bị. Đó là Needle2 của Cactus Compute, công bố công khai giữa tháng 08/2026. Bài này nói rõ nó làm được gì thật, nó hỏng ở đâu, và vì sao con số 45 triệu tham số vừa là điểm mạnh vừa là giới hạn cứng bạn không nên bỏ qua.
Needle2 là gì
Needle2 là mô hình nền tảng chuyên một việc: nhận câu lệnh của người, đối chiếu với danh sách công cụ được khai báo trước, rồi trả về lệnh gọi công cụ đúng khuôn. Nhóm Cactus Compute xây nó trên kiến trúc Simple Attention Network, nén xuống mức CQ2-bit bằng bộ nén riêng Cactus Quants, và đóng gói vào engine tự viết thay vì dựa trên llama.cpp.
Kết quả là các con số không giống thứ bạn quen thấy ở LLM:
| Thông số | Needle2 | Model local phổ thông (7B Q4) |
|---|---|---|
| Tham số | 45 triệu | 7 tỷ |
| Dung lượng tải về | 14MB (một nhị phân) | 4GB đến 5GB |
| RAM một phiên | khoảng 28MB | 5GB đến 6GB |
| Cửa sổ ngữ cảnh | 256 token trượt | 8,000 đến 128,000 token |
| Phép tính mỗi token | 70 MFLOPs | cao hơn nhiều bậc |
| Giấy phép | Apache 2.0 | tùy model |
Con số 70 MFLOPs mỗi token là chỗ đáng chú ý: nhóm phát triển đối chiếu với 164 MFLOPs của một transformer dày tương đương, và tuyên bố tiết kiệm từ 7 đến 85 lần so với các model họ đem ra so. Trọng số nằm công khai trên Hugging Face, mã nguồn ở repo cactus-compute/needle, bài báo kỹ thuật đăng arXiv từ 07/2026.
Điểm khiến nó chạy được trong 28MB RAM bất kể hội thoại dài bao nhiêu: bộ đệm KV dùng cửa sổ trượt 256 token, với phần khai báo công cụ được ghim lại làm neo. Bộ nhớ có chặn trên cố định. Đổi lại, model không có ký ức dài, mỗi lượt gần như bắt đầu lại.
Vì sao 14MB là chuyện lớn
Nhóm Cactus đặt vấn đề thẳng: AI ở biên lâu nay đồng nghĩa với Mac và PC, tức khoảng 1.5 tỷ máy trong hơn 21 tỷ thiết bị kết nối. Phần còn lại là công tắc, cảm biến, đồng hồ, camera, robot hút bụi. Những thứ đó có vài chục MB RAM rảnh, không phải vài GB. Needle2 nhắm đúng khoảng trống đó.
Việc Needle2 làm được
Bốn nhóm việc, tất cả đều xoay quanh một trục: biến câu nói thành hành động có cấu trúc.
Gọi công cụ. Bạn khai báo trước các hàm mà thiết bị có, ví dụ bật đèn, đặt nhiệt độ, mở rèm. Model đọc câu lệnh và chọn hàm cùng tham số. Nếu không hàm nào phục vụ được yêu cầu, nó trả về danh sách rỗng thay vì đoán bừa. Đây là hành vi thiết kế có chủ ý, đáng giá hơn nhiều so với một model cố tỏ ra hữu ích.
Trích xuất theo khuôn. Đưa vào một đoạn văn bản, nhận về các trường có kiểu dữ liệu định trước. Đầu ra bị ràng buộc bằng văn phạm nên luôn là JSON hợp lệ, không cần khâu vá lỗi cú pháp thường thấy khi bắt model lớn trả JSON.
Tự chấm điểm tin cậy. Mỗi câu trả lời kèm điểm tự tin đã hiệu chỉnh. Bạn dựng ngưỡng: dưới ngưỡng thì không thực thi, hỏi lại người dùng. Với một model 45 triệu tham số, cơ chế này không phải tính năng phụ mà là điều kiện để dùng được.
Chọn công cụ trong danh mục lớn. Nhà nhiều thiết bị thì danh sách hàm dài. Needle2 thu hẹp còn năm công cụ khả dĩ nhất mỗi lượt trước khi quyết định.
Ràng buộc quan trọng: tham số trong lệnh gọi chỉ được lấy từ những gì có mặt trong câu đầu vào. Model không tự bổ sung giá trị mặc định. Nghe khô khan nhưng đây là thứ giữ cho nó không bịa ra "đặt nhiệt độ 22 độ" khi bạn chưa nói con số nào.
Và chỗ nó hỏng
Phần này quan trọng hơn phần trên. Ngay sau khi Needle2 công bố, người dùng trên Hacker News đem ra thử và bắt được vài lỗi không nhỏ.
Bốn lỗi đã có người ghi nhận
Hỏi cho phòng ấm hơn, model đề xuất bật làm mát. Lệnh tương đối kiểu tăng thêm 5 độ bị hiểu thành đặt cứng 5 độ. Model thiên vị lệnh khóa cửa, trả về lệnh đó cả khi đầu vào là từ vô nghĩa như "potato". Thử bằng tiếng Đức, điểm tự tin tụt rõ dù nhóm phát triển có nhắc tới hỗ trợ nhiều ngôn ngữ.
Bốn lỗi này cùng chỉ về một nguyên nhân: ở cỡ 45 triệu tham số, model đang khớp mẫu câu chứ chưa thật sự suy luận. Nó nhận ra hình dạng "điều chỉnh nhiệt độ" và bắn ra hàm tương ứng, nhưng không nắm được hướng của phép điều chỉnh hay tính tương đối của con số.
Với tiếng Việt, tình hình còn mỏng hơn. Model card ghi locale mặc định en-US, mọi ví dụ đều bằng tiếng Anh, và không có phép đo tiếng Việt nào được công bố. Nếu tiếng Đức đã làm điểm tự tin giảm thì tiếng Việt khó khá hơn. Chưa ai đo, nên ở đây không có kết luận nào để đưa ra, chỉ có mức kỳ vọng nên hạ xuống.
Hệ quả thực dụng: đừng nối Needle2 vào những thứ mà sai một lệnh là có hậu quả. Khóa cửa, cổng, bình nóng lạnh, ổ cắm công suất lớn nên để automation cứng theo điều kiện rõ ràng, giống cách làm trong bài 10 automation Home Assistant. Đèn, rèm, quạt, cảnh vui vẻ thì sai cũng chỉ mất công bật lại.
Tốc độ trên phần cứng thật
Số do nhóm phát triển công bố, chưa có phép đo độc lập nào đối chiếu:
| Thiết bị | Tốc độ sinh (token/giây) | Ghi chú |
|---|---|---|
| Raspberry Pi 5 | 500 | nạp đầu vào trên 800 token/giây |
| Meta Quest 3S, Apple Vision Pro | 400 đến 1,500 | dải rộng tùy tác vụ |
| Điện thoại dưới 200 USD (Samsung A-Series) | 300 đến 700 | tầm giá dưới 5 triệu đồng ở Việt Nam |
Ở mức 500 token/giây trên Pi 5, một lệnh gọi công cụ dài vài chục token trả về gần như tức thì. Đây chính là điểm bán hàng thật của Needle2: không phải thông minh hơn, mà là nhanh hơn và không cần mạng. Một lệnh bật đèn qua API đám mây mất từ vài trăm mili giây đến vài giây và phụ thuộc đường truyền; cùng lệnh đó chạy trong nhà thì không có khâu chờ nào.
Nhị phân dựng sẵn có cho macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS cùng watchOS và tvOS, và cả WebAssembly. Bản cho vi điều khiển ESP32-S3 cũng nằm trong danh sách, tức là cùng lớp phần cứng với các dự án DIY trong bài nhà thông minh ESP32.
Ghép vào Home Assistant: hiện trạng thật
Chưa có tích hợp chính thức. Nhóm Cactus nói model được huấn luyện riêng cho các tác vụ dạng Home Assistant, nhưng ở thời điểm 08/2026 mọi thứ vẫn là tự dựng.
Cách một thành viên cộng đồng Home Assistant đã làm chạy được:
Đường tự dựng đang có người chạy được
Chạy Needle2 trên một máy trong nhà
Needle2 CLINgười thử dùng Mac mini M1 làm máy suy luận, chạy nền. Raspberry Pi 5 về lý thuyết đủ sức nhưng chưa thấy báo cáo.
Viết lớp chuyển đổi API
Một shim Python nhận request theo chuẩn OpenAI rồi dịch sang lệnh gọi Needle CLI. Đây là phần bạn phải tự viết, không có sẵn.
Cài extended_openai_conversation qua HACS
HACSDùng bản của cộng đồng, không phải tích hợp OpenAI trong nhân Home Assistant, vì bản nhân không cho đổi địa chỉ máy chủ.
Sửa manifest để trỏ về máy nhà
Phải vá thủ công để chấp nhận base URL nội bộ. Bước này sẽ phải làm lại sau mỗi lần cập nhật.
Gom thiết bị thành nhóm
Thay vì phơi từng bóng đèn riêng, gom theo phòng. Người thử báo cách này giúp model chọn đúng hơn rõ rệt.
Kết quả người thử báo lại: phản hồi "gần như tức thì". Nhưng đọc kỹ năm bước trên thì rõ đây là bản vá ghép nhiều mảnh, không phải thứ cắm vào là chạy. Và nó chỉ giải quyết khâu hiểu câu lệnh; muốn điều khiển bằng giọng nói bạn vẫn cần model nhận dạng tiếng nói riêng, đúng như phần chuỗi xử lý mô tả trong bài Home Assistant Voice. Needle2 thay được mắt xích hiểu ý, không thay được cả dây.
Cần gì để thử ngay
Máy chủ tối thiểu là một Raspberry Pi 5 đã cài Home Assistant, hoặc bất cứ máy Linux nào đang chạy nền trong nhà. Cài thư viện bằng pip install cactus-needle, có sẵn bản dựng cho NVIDIA CUDA và Apple Silicon Metal nếu muốn tăng tốc, dù ở cỡ 14MB thì CPU đã dư. API Python dùng kiểu khai báo công cụ bằng decorator rồi gọi phương thức chạy; xem README trong repo để lấy đúng cú pháp hiện hành thay vì chép lại từ bài viết, vì dự án còn mới và API còn đổi.
Needle2 đứng ở đâu giữa các lớp AI
Đây là chỗ dễ nhầm nhất. Needle2 không cạnh tranh với những thứ bạn đang dùng, nó nằm ở một tầng khác hẳn.
| Lớp | Ví dụ | Cỡ | Việc phù hợp |
|---|---|---|---|
| Thiết bị nhỏ | Needle2 | 14MB | dịch lệnh thành hành động, trích xuất dữ liệu, chạy ngay trên cảm biến hoặc Pi |
| Máy cá nhân | Qwen3, Gemma 3 qua Ollama | 3GB đến 8GB | chat, tóm tắt, hỏi đáp tài liệu, không cần mạng |
| Máy chủ nhà | model 14B trở lên tự host | 10GB trở lên | trợ lý cả nhà, xử lý ngữ cảnh dài |
| Đám mây | ChatGPT, Claude, Gemini | không giới hạn | suy luận khó, tiếng Việt tinh tế, kiến thức mới |
Muốn hiểu tầng thứ hai, bài chạy LLM trên máy tính cá nhân đi từ chọn model theo RAM đến cài công cụ. Tầng thứ ba nằm trong bài Home Assistant AI tự host. Còn nếu bạn chưa rõ tham số và lượng tử hóa nghĩa là gì, đọc LLM là gì trước sẽ đỡ mất thời gian.
Về vị thế cạnh tranh trong chính tầng nhỏ nhất: nhóm phát triển nói Needle2 ngang ngửa các model nhỏ khác như FunctionGemma 270M, LFM2.5 230M và Apple FM, trong khi nhỏ hơn từ 5 đến 70 lần và dùng 2 bit thay vì 16 bit. Họ cũng báo rằng sau khi tinh chỉnh cho tác vụ riêng, độ chính xác tăng từ 21 đến 58 điểm và vượt DeepSeek V4 Flash ở ba trong bốn phép đo. Cần nhớ đây là số của chính nhà phát triển, trên phép đo họ chọn.
Nên thử, và không nên tin ở đâu
Cân đo trước khi bỏ buổi tối vào nó
Ưu điểm
- Nhẹ tới mức chạy được trên phần cứng bạn đã có, kể cả điện thoại cũ trong ngăn tủ
- Dữ liệu không rời khỏi nhà, không phí theo lượt gọi, không phụ thuộc đường mạng
- Apache 2.0, trọng số và mã nguồn công khai, dùng thương mại được
- Đầu ra JSON bị ràng buộc văn phạm nên không cần vá lỗi cú pháp
- Biết từ chối bằng danh sách rỗng khi không có công cụ nào phù hợp
Nhược điểm
- Không phải chatbot: không hội thoại, không suy luận, không kiến thức chung
- Tiếng Việt chưa có xác nhận nào; dấu hiệu từ tiếng Đức cho thấy nên hạ kỳ vọng
- Đã có lỗi thật bị ghi nhận: hiểu ngược lệnh, thiên vị một hàm cố định
- Ngữ cảnh 256 token, không có ký ức giữa các lượt
- Chưa có tích hợp Home Assistant chính thức; phải tự viết shim và vá manifest
Cách đọc bảng trên: cột phải không phải lý do bỏ qua Needle2, mà là danh sách những chỗ bạn không được đặt cược vào nó. Dùng nó cho đèn, rèm, cảnh, quạt, cảm biến báo trạng thái. Đừng dùng cho khóa, cổng, thiết bị công suất lớn, hay bất cứ lệnh nào mà một lần sai là phải đi sửa hậu quả.
Nếu bạn đang định thử: nối một nhóm đèn duy nhất, viết ngưỡng tự tin, ghi log mọi lệnh gọi trong hai tuần rồi đọc lại xem nó chọn sai bao nhiêu lần. Đó là dữ liệu duy nhất đáng tin cho nhà bạn, vì phép đo của nhà phát triển làm bằng tiếng Anh trên tác vụ họ chọn. Cần thêm thiết bị điều khiển để dựng thử, bài thiết bị nhà thông minh giá rẻ có danh sách theo hạng mục và giá tại Việt Nam, hoặc dò nhanh nhóm thiết bị điều khiển thông minh để so giá hiện tại.
Vì sao nó đáng theo dõi dù chưa hoàn thiện
Needle2 không phải model tốt nhất, nó là bằng chứng cho một hướng đi: tách phần hiểu câu lệnh ra khỏi phần suy nghĩ, rồi nhồi riêng phần hiểu câu lệnh xuống thứ phần cứng rẻ nhất. Nếu hướng này đi tiếp, lớp AI trong nhà sẽ không còn nằm ở một máy chủ hay một API mà rải vào từng thiết bị, mỗi cái tự xử phần việc của nó.
Điều đó liên quan trực tiếp tới cuộc chơi mã nguồn mở đang diễn ra, mô tả trong bài AI nguồn mở: giấy phép Apache 2.0 kèm trọng số công khai nghĩa là nhà sản xuất thiết bị Việt Nam có thể nhúng thẳng vào sản phẩm mà không trả phí bản quyền hay gửi dữ liệu người dùng ra ngoài. Với cỡ 14MB, chi phí tính toán không còn là lý do để từ chối. Còn nếu bạn muốn hiểu tại sao tầng "gọi công cụ" lại là mắt xích quyết định của mọi hệ tự động hóa, bài AI agent là gì giải thích vòng lặp đầy đủ mà Needle2 chỉ đảm nhiệm một khâu.
Việc cần làm bây giờ không phải thay hệ thống. Là để mắt xem đến bản Needle3 thì bốn lỗi ở trên còn bao nhiêu, và có ai đo tiếng Việt chưa. Các bài khác cùng chủ đề nằm ở chuyên mục AI.
Cơ sở của bài viết
Toàn bộ thông số kỹ thuật lấy từ trang chủ Cactus Compute, repo cactus-compute/needle và model card trên Hugging Face (tra ngày 28/08/2026). Các lỗi ghi trong mục "chỗ nó hỏng" lấy từ báo cáo của người dùng trên thảo luận Hacker News, không phải phép đo của MyAutoLife. Bài này chưa dựng thử trên phần cứng, nên mọi số tốc độ đều là số nhà phát triển công bố. Khi nào dựng xong sẽ cập nhật lại phần đo thật.
Câu hỏi thường gặp
Needle2 có thay được ChatGPT không?
Không, và nó không cố làm vậy. Needle2 chỉ gọi công cụ và trích xuất dữ liệu có cấu trúc, không phải mô hình hội thoại. Hỏi nó một câu kiến thức hay nhờ viết văn thì bạn nhận được kết quả vô nghĩa.
Needle2 nói được tiếng Việt không?
Chưa có xác nhận. Model card ghi locale mặc định en-US và ví dụ đều bằng tiếng Anh. Người thử tiếng Đức báo điểm tự tin của model tụt rõ, nên khả năng tiếng Việt hoạt động tốt là thấp. Chưa có ai đo công khai.
Chạy Needle2 cần phần cứng gì?
Rất ít. Nhị phân 14MB, một phiên chạy trong khoảng 28MB RAM. Raspberry Pi 5 dư sức, điện thoại Android tầm dưới 5 triệu đồng cũng chạy, thậm chí có bản cho vi điều khiển ESP32-S3.
Needle2 khác gì chạy Ollama trên laptop?
Khác về lớp bài toán. Ollama chạy model vài tỷ tham số nặng hàng GB để chat và suy luận. Needle2 nhẹ hơn khoảng một nghìn lần, chỉ dịch câu lệnh thành lệnh gọi thiết bị. Hai thứ bổ sung nhau, không thay nhau.
Khi nào KHÔNG nên dùng Needle2?
Khi bạn cần hiểu câu nói tự nhiên tiếng Việt, khi lệnh mang tính tương đối kiểu tăng thêm 5 độ, hoặc khi sai một lệnh là gây hậu quả thật như mở khóa cửa. Ba trường hợp này dùng model lớn hơn hoặc automation cứng an toàn hơn.
Needle2 có miễn phí không?
Có. Giấy phép Apache 2.0, trọng số công khai trên Hugging Face, mã nguồn trên GitHub, dùng cho mục đích thương mại được. Chi phí duy nhất là phần cứng bạn đã có sẵn và thời gian tự cấu hình.
MyAutoLife Team
Đội ngũ MyAutoLife tự kiểm chứng mọi sản phẩm trước khi đánh giá. Dữ liệu, giá và quan điểm dựa trên trải nghiệm thực tế tại Việt Nam.
Kiểm duyệt chuyên môn: Hung Tran
Bài viết liên quan
ChatGPT trên iPhone qua Shortcuts: setup, automation mẫu và giới hạn
Cách ghép ChatGPT vào iPhone bằng Shortcuts và Siri: ba đường setup theo đời máy, năm automation dùng được ngay, cùng những giới hạn cần biết trước khi dựng.
Kimi K3 là gì: mô hình 2.8 nghìn tỷ tham số của Moonshot AI
Kimi K3 của Moonshot AI là gì, mạnh ở đâu, giá bao nhiêu, so với ChatGPT, Claude và Gemini thế nào, và người Việt dùng được tới đâu mà không mất tiền.
AI nguồn mở 2026: bản đồ model, công cụ và khi nào nên chọn thay bản trả phí
Bản đồ AI nguồn mở 2026 cho người Việt: các dòng model Llama, Qwen, Gemma, DeepSeek, hệ công cụ đi kèm, so sánh với bản đóng và khi nào nên chọn mỗi bên.
Nhận bản tin MyAutoLife
Mỗi tuần 1 email: AI tools đáng dùng + mẹo smart home. Không spam, hủy bất kỳ lúc nào.