Chuyện thật. Chị giám đốc một công ty kế toán — kiểm toán ngồi đối diện chúng tôi, tay cầm bản nháp hợp đồng. Chị nói thẳng: dữ liệu bên chị là hồ sơ tài chính khách hàng, hợp đồng lao động, bảng lương. Không đời nào chị đẩy mấy thứ đó lên API của một nhà cung cấp ở nước ngoài.
Rồi chị hỏi câu mà chúng tôi nghe hoài: “Vậy chạy tại chỗ được không?”
Được. Nhưng chạy tại chỗ không phải là toàn bộ câu trả lời. Câu hỏi thật nằm ở chỗ khác: phần nào nên ở lại trong nhà, phần nào nên gọi ra ngoài, và ai chịu trách nhiệm khi hệ thống trả lời sai.
Bài này là những gì chúng tôi rút ra sau vài dự án như vậy — về triển khai mô hình ngôn ngữ nhỏ SLM Local, về hệ thống AI agent đa tác tử, và về việc nối chúng vào CRM với ERP.
Triển Khai Mô Hình Ngôn Ngữ Nhỏ SLM Local: Khi Nào Đáng Làm?
Nói cho gọn: SLM là một mô hình ngôn ngữ nhỏ hơn hẳn những cái tên cloud bạn vẫn nghe. Thay vì hàng trăm tỷ tham số nằm trên cụm máy chủ của người khác, bạn có một mô hình gọn nhẹ, đủ giỏi cho một số việc nhất định, và chạy trên máy của chính bạn.
Vài thuật ngữ bạn sẽ gặp, nói một câu cho xong: lượng tử hoá (quantization) chỉ là cách nén bớt trọng số để mô hình nhẹ đi; kết quả thường là các file GGUF, chạy bằng những công cụ như llama.cpp hay Ollama — cài xong là có một mô hình trả lời ngay trên máy, không cần internet.
Vậy khi nào nên chạy tại chỗ?
- Dữ liệu nhạy cảm không ra khỏi tường lửa. Bệnh án, hồ sơ pháp lý, dữ liệu lương, hợp đồng chưa ký. Không phải vì cloud dở — mà vì có những tài liệu bạn không muốn phải giải thích với ai về việc tại sao nó lại nằm ở đó.
- Chi phí dễ đoán. Bạn mua cái máy một lần. Chạy một trăm lượt hay một trăm nghìn lượt một ngày, tiền máy vẫn thế. Không hoá đơn theo token, không sốc cuối tháng.
- Chạy được khi mạng chập chờn. Nhà máy, kho bãi, chi nhánh ở tỉnh. Với nhiều nơi, internet đứt vài tiếng là chuyện bình thường.
- Độ trễ thấp và ổn định. Không phụ thuộc đường truyền quốc tế, không chờ dữ liệu đi nửa vòng trái đất rồi quay lại.
- Không bị ai đó quyết định thay. Nhà cung cấp đổi giá, đổi chính sách, khai tử một phiên bản model — bạn không phải chạy theo.
Còn phần phải đánh đổi thì cũng thật, không tô hồng được:
- Suy luận yếu hơn. Việc nhiều bước, chuỗi logic dài, tính toán chính xác — mô hình lớn vẫn hơn. Đừng tự lừa mình.
- Cần máy khoẻ. Một máy có GPU tử tế, và một người biết chăm nó.
- Cần người vận hành. Cập nhật, giám sát, sửa prompt, đánh giá chất lượng đầu ra. Một SLM không tự tốt lên theo thời gian.
- Chất lượng phụ thuộc vào ngữ cảnh bạn đưa vào. SLM không “biết tuốt”; bạn phải đưa đúng tài liệu, đúng ví dụ, đúng định dạng mong muốn.
Câu hỏi tự kiểm tra: công việc này là phân loại, trích xuất, tóm tắt, hay trả lời theo khuôn mẫu đã biết? Nếu đúng như vậy — SLM local thường là đủ. Còn nếu cần suy luận nhiều bước trên dữ liệu lộn xộn — đó là sân của mô hình lớn.
Hệ Thống AI Agent Đa Tác Tử (Multi-Agent): Chia Việc Cho Một Đội
Một agent ôm hết mọi thứ nghe thì tiện, cho tới lúc nó sai và bạn không biết sai ở đâu. Hệ thống AI agent đa tác tử (multi-agent) chia việc giống như một đội ngũ thật: một agent điều phối, và vài agent chuyên môn.
Agent điều phối giữ bức tranh lớn: nó nhận yêu cầu, chia nhỏ, quyết định gọi ai, và biết lúc nào phải đưa cho người thật. Mỗi agent chuyên môn có bộ công cụ riêng, prompt riêng và quyền truy cập riêng.
Ví dụ cho dễ hình dung. Một khách hàng doanh nghiệp gửi yêu cầu báo giá.
- Agent nghiên cứu lục lại lịch sử mua hàng, tra thông tin công ty, rồi tóm tắt bối cảnh thành một bản ngắn.
- Agent chăm sóc khách hàng đọc bản đó, soạn thư trả lời đúng giọng văn của công ty, và hỏi thêm hai thông tin còn thiếu.
- Agent kế toán đối chiếu dữ liệu công nợ trước khi ai đó báo giá, vì khách này còn một hoá đơn chưa thanh toán.
- Cả ba trả kết quả về agent điều phối, nó gộp lại và chuyển cho sales duyệt.
Không agent nào cần biết hết mọi thứ. Đó chính là điểm hay: công cụ nhỏ thì dễ kiểm thử, quyền hạn hẹp thì lỡ sai cũng không thiệt hại nhiều, và mỗi lần gọi chỉ mang theo ngữ cảnh cần thiết nên rẻ hơn.
Nhưng đa tác tử không phải lúc nào cũng đúng. Nếu quy trình của bạn là một đường thẳng — nhận vào, xử lý, trả ra — thì một agent với vài công cụ là đủ, và dễ hiểu hơn nhiều.
Nghe quen không? Đội nào cũng từng thêm người vào một việc mà một người làm được. Với agent, cái giá là: chi phí nhân lên, ngữ cảnh bị mất khi chuyền tay, và có khi hai agent cứ lịch sự đẩy việc cho nhau. Đa tác tử chỉ đáng làm khi có thật nhiều loại việc khác nhau, chứ không phải khi có thật nhiều việc.
Ghép SLM local với multi-agent: bài toán chi phí và quyền riêng tư
Đây là phần chúng tôi thích nhất, vì nó giải hai bài toán cùng lúc.
Bạn không cần chọn một trong hai. Một hệ thống AI agent đa tác tử (multi-agent) cho phép mỗi agent dùng một mô hình khác nhau — và đó là chỗ tiền tiết kiệm được, chỗ dữ liệu được giữ lại.
Cách chúng tôi thường làm:
- Cửa vào dùng SLM local. Phân loại yêu cầu, trích xuất thông tin, trả lời câu hỏi đơn giản, soạn email theo mẫu. Phần lớn lưu lượng nằm ở đây, và nó chạy trên máy bạn.
- Việc khó mới gọi mô hình lớn. Những yêu cầu cần suy luận sâu, hoặc cần đọc tài liệu dài. Trước khi gửi đi, hệ thống gỡ bỏ phần thông tin nhận dạng được.
- Agent điều phối cũng có thể là SLM local. Chia việc và gọi đúng người không cần mô hình thông minh nhất phòng.
- Viết ra thành quy tắc: cái gì không bao giờ rời khỏi nhà. Đừng để nó trong đầu một người. Và log lại mọi lần chuyền tay.
Kết quả là một mức chi phí nền dễ đoán, cộng thêm phần cloud chỉ dành cho những ca thật sự khó.
AI Agent Tích Hợp CRM Và ERP
Nếu từng thử nối AI vào hệ thống nội bộ, bạn biết cảm giác: demo rất hay, nhưng mọi thứ dừng ở chỗ “gợi ý”. Nhân viên vẫn phải tự mở CRM ra và nhập lại.
AI agent tích hợp CRM và ERP khác ở chỗ nó ghi. Cuộc gọi kết thúc, agent đã ghi biên bản vào deal trên HubSpot kèm ba bước tiếp theo. Tồn kho chạm ngưỡng, nó tạo đề nghị mua hàng trong ERP. Hoá đơn về, nó khớp với đơn hàng rồi đẩy bút toán sang phần mềm kế toán như MISA hay Xero.
Đọc thì hay. Ghi mới là chỗ tiết kiệm thời gian thật — vì ghi là phần con người đang phải gõ tay.
Nhưng ghi cũng là chỗ nguy hiểm nhất, nên có vài nguyên tắc:
- Ghi có kiểm soát. Hành động liên quan tới tiền, tới dữ liệu khách hàng hoặc xoá dữ liệu thì cần người duyệt. Phần còn lại có thể chạy tự động.
- Có dấu vết. Ai ghi gì, lúc nào, dựa trên căn cứ nào — tra được.
- Chống ghi trùng. ERP rất ghét một hoá đơn bị nhập hai lần.
- Bắt đầu bằng đọc. Dữ liệu chủ (master data) trong ERP thường không sạch như ta tưởng. Cho agent đọc trước, đối chiếu, rồi mới cho ghi.
Nhắc lại chuyện chị giám đốc kế toán lúc đầu: chị không cần một hệ thống thông minh hơn chị. Chị cần một hệ thống không làm rò dữ liệu và bớt cho chị mấy việc nhập liệu.
Bắt đầu từ đâu?
Đừng bắt đầu bằng “số hoá toàn bộ”. Bắt đầu bằng một quy trình duy nhất, có điểm đau rõ ràng, và đo được trước — sau.
Ba câu hỏi nên trả lời trước khi viết dòng code nào:
- Dữ liệu đi qua đây có nhạy cảm không? Nếu có, phần nào buộc phải ở lại trên máy của bạn?
- Việc này là một đường thẳng hay nhiều nhánh? Một nhánh thì một agent là đủ.
- Hệ thống này được phép ghi vào đâu, và ai duyệt?
Ở Mon AI, chúng tôi làm việc với những đội ngũ muốn bắt đầu từ đúng một quy trình như vậy — có khi chỉ là hộp thư chung, có khi là đối soát hoá đơn. Nếu bạn đang cân nhắc chuyện chạy tại chỗ, hãy liên hệ với chúng tôi. Bạn cũng có thể tự thử một agent ở trang bản demo.
Chạy tại chỗ được không? Được — nếu bạn biết rõ phần nào nên ở lại trong nhà.



