Tình huống: đội pháp lý, cơ quan quản lý, hoặc chính bản đánh giá rủi ro của bạn đã kết luận rằng hồ sơ khách hàng, hồ sơ vụ việc, bệnh án hay nội dung hợp đồng không được gửi đến API AI của bên thứ ba — chấm hết. Điều đó không có nghĩa là bạn từ bỏ AI. Nó có nghĩa là mô hình đến với dữ liệu thay vì dữ liệu đi đến mô hình. Bài viết này trình bày ba cấp độ chủ quyền dữ liệu mà chúng tôi thiết kế, những lựa chọn phần cứng và mô hình thực sự hiệu quả trong năm 2026, cùng những đánh đổi mà không ai đưa vào bộ slide bán hàng.
Vì sao "cứ dùng API đám mây" không còn là câu trả lời
Với hầu hết doanh nghiệp, một dịch vụ AI đám mây được cấu hình tốt kèm thỏa thuận xử lý dữ liệu là đủ — chúng tôi xây dựng trên Azure hằng ngày và nói điều đó công khai. Nhưng ba nhóm sau thường xuyên không thể chấp nhận phương án này:
- Các tổ chức chịu quản lý của châu Âu. Bản thân GDPR không cấm AI đám mây, nhưng các đánh giá rủi ro chuyển dữ liệu sau phán quyết Schrems II, các quy định ngành (bí mật ngân hàng, hồ sơ y tế, đặc quyền pháp lý) và nghĩa vụ minh bạch của EU AI Act khiến câu hỏi "chính xác thì prompt này đi đâu, và ai có thể bị buộc phải đọc nó?" trở thành vấn đề cấp hội đồng quản trị. Với một số loại dữ liệu, câu trả lời sạch duy nhất là: nó không bao giờ rời khỏi hạ tầng do chúng ta kiểm soát.
- Chính phủ và khu vực công. Tài liệu mật hoặc hạn chế lưu hành, cơ sở dữ liệu công dân, hồ sơ đấu thầu. Nhiều quốc gia hiện đã ban hành quy định rõ ràng rằng những dữ liệu như vậy chỉ được xử lý trong môi trường quốc gia được công nhận hoặc on-premise. Một endpoint suy luận do nước ngoài vận hành — dù mã hóa đến đâu — thường bị loại vì chính sách trước cả khi bàn đến kỹ thuật.
- Các công ty có bí mật thương mại. Thiết kế chưa công bố, tài liệu M&A, mô hình định giá. Không quy định nào bắt buộc họ, nhưng họ quyết định một cách hợp lý rằng phần chất lượng nhỉnh hơn của một mô hình đám mây tiên tiến không đáng để phải băn khoăn chuyện gì xảy ra với prompt của mình.
Ba cấp độ chủ quyền dữ liệu
| Cấp độ | Nơi chạy suy luận | Phù hợp với ai |
|---|---|---|
| 1. Đám mây ghim theo khu vực | Đám mây công cộng, khóa vào một region EU (hoặc quốc gia), khóa mã hóa do khách hàng quản lý, không lưu giữ dữ liệu cho giám sát lạm dụng | Hầu hết doanh nghiệp quan tâm GDPR; bước chủ quyền dữ liệu nhanh và rẻ nhất |
| 2. Vùng riêng trên đám mây tư nhân | Năng lực GPU chuyên dụng trong đám mây chủ quyền hoặc trung tâm dữ liệu trong nước, mô hình do bạn chọn, cô lập về mạng | Ngân hàng, bảo hiểm, tập đoàn y tế; dữ liệu ở lại trong nước và trong tenant của bạn |
| 3. On-premise hoàn toàn | Máy chủ của bạn, tủ rack của bạn, có thể ngắt hẳn khỏi internet (air-gap) | Chính phủ, các lĩnh vực gần quốc phòng, đặc quyền pháp lý, bất kỳ ai trả lời "nó có được rời khỏi tòa nhà không?" bằng chữ không |
Công sức kỹ thuật tăng vọt từ cấp 1 lên cấp 3 — và mức độ kiểm soát cũng vậy. Câu hỏi đúng không bao giờ là "cấp nào an toàn nhất?" mà là "cấp nhẹ nhất nào vẫn thỏa mãn nghĩa vụ thực tế của chúng ta?"
Mô hình cục bộ thực sự làm được gì trong năm 2026
Khoảng cách giữa mô hình trọng số mở và mô hình tiên tiến nhất đã thu hẹp đến mức, với các tác vụ doanh nghiệp có phạm vi rõ ràng, một mô hình cục bộ được phục vụ tốt không còn là sự thỏa hiệp:
- Xử lý tài liệu thông minh — tóm tắt hồ sơ vụ việc, trích xuất trường dữ liệu từ hợp đồng, phân loại thư từ. Các mô hình trọng số mở trong khoảng 8–70B xử lý việc này xuất sắc, đặc biệt khi có retrieval làm nền tảng.
- Trợ lý nội bộ — chatbot trên chính sách, quy trình và kho tri thức của bạn, với mọi truy vấn và mọi tài liệu đều ở lại trong mạng nội bộ.
- Công việc đa ngôn ngữ — các mô hình mở hiện đại xử lý tiếng Việt, tiếng Đức, tiếng Pháp và các ngôn ngữ ngoài tiếng Anh tốt hơn hẳn thế hệ trước; với những lĩnh vực chuyên sâu, một bản fine-tune LoRA trên chính kho ngữ liệu của bạn sẽ lấp nốt phần khoảng cách còn lại.
- Đầu ra có cấu trúc — trích xuất JSON, điền biểu mẫu, soạn báo cáo theo mẫu. Constrained decoding trên máy chủ cục bộ thực tế còn đáng tin cậy hơn so với prompt một API từ xa.
Những gì chúng vẫn làm kém hơn: suy luận mở kiểu frontier, các tác vụ agentic nhiều bước rất dài, và độ cập nhật về kiến thức thế giới. Một kiến trúc trung thực sẽ đặt các tác vụ đó — nếu chúng tồn tại và dữ liệu cho phép — lên tầng đám mây, và giữ phần việc nhạy cảm ở cục bộ. Thiết kế "não đôi" đó chính là mẫu hình chúng tôi triển khai nhiều nhất.
Bài toán phần cứng
Cú sốc về giá nhỏ hơn nhiều so với hầu hết CTO nghĩ. Một máy chủ duy nhất với hai GPU 48 GB chạy được mô hình 70B lượng tử hóa với thông lượng vững vàng cho khối lượng xử lý tài liệu của vài trăm nhân viên. Một mô hình 8–14B — đủ cho Q&A dựa trên retrieval và trích xuất dữ liệu — chạy trên một GPU cấp workstation. Cụ thể:
- Thí điểm: một workstation GPU, một máy chủ vLLM hoặc llama.cpp, retrieval trên kho tài liệu của bạn. Chứng minh giá trị trong vài tuần.
- Sản xuất: hai máy chủ suy luận sau load balancer để dự phòng, một node embedding+retrieval không cần GPU, giám sát, và một quy trình cập nhật mô hình offline (trọng số mới đến qua ổ đĩa, được đánh giá trên bộ test của bạn, rồi mới đưa lên).
- Điều cần tránh: mua phần cứng trước khi đo thông lượng token thực tế. Hầu hết các cuộc trao đổi "chúng tôi cần một cụm GPU" kết thúc bằng hai máy chủ sau khi khối lượng công việc được đo đạc thật sự.
Điểm quản trị mà mọi người bỏ qua: một mô hình cục bộ không chỉ bảo vệ dữ liệu đi vào — nó bảo vệ cả dấu vết kiểm toán. Mọi prompt, mọi tài liệu được truy xuất, mọi câu trả lời đều có thể ghi log vào SIEM của chính bạn, lưu giữ theo lịch của chính bạn, và xuất trình cho cơ quan quản lý mà không phải xin vendor những bản log họ có thể không hề giữ. Với nghĩa vụ tài liệu hóa của EU AI Act, việc sở hữu toàn bộ log suy luận là một siêu năng lực thầm lặng.
Những gì bạn phải đánh đổi — nói thẳng
- Nhịp độ mô hình. Bạn sẽ chạy các mô hình trọng số mở của quý này, không phải bản phát hành frontier của tuần này. Với các tác vụ có phạm vi rõ ràng điều này hiếm khi quan trọng; với trợ lý mở đôi khi lại có.
- Trách nhiệm vận hành. Driver GPU, cập nhật mô hình, hoạch định năng lực giờ là vấn đề của bạn (hoặc của đối tác). Cấp 1 và 2 thuê ngoài được phần lớn việc này; cấp 3 thì không.
- Độ co giãn. Một đợt tăng đột biến lưu lượng không thể được trung tâm dữ liệu của người khác hấp thụ hộ. Hãy định cỡ theo đỉnh tải hoặc xếp hàng đợi một cách mềm mại.
Một mẫu hình triển khai hiệu quả
- Phân loại dữ liệu trước. Hầu hết tổ chức phát hiện chỉ 10–30% use case AI của họ thực sự chạm đến dữ liệu đòi hỏi cấp 2 hoặc 3. Hãy định tuyến phần còn lại lên đám mây ghim theo khu vực và dành ngân sách chủ quyền dữ liệu cho nơi thực sự cần.
- Bắt đầu với retrieval, không phải fine-tune. Một mô hình cục bộ với retrieval tốt trên tài liệu của bạn thắng một mô hình fine-tune không có retrieval, và nó kiểm toán được — bạn chỉ ra được chính xác nguồn nào tạo ra câu trả lời.
- Xây bộ đánh giá trước khi chọn mô hình. Năm mươi tác vụ thực từ chính khối lượng công việc của bạn, chấm điểm mù. Mô hình "tốt nhất" trên các bảng xếp hạng công khai thường không phải mô hình tốt nhất trên hồ sơ của bạn.
- Thiết kế đường cập nhật ngay từ ngày đầu. Một hệ thống AI chủ quyền mà hai năm sau vẫn chạy mô hình của ngày ra mắt là một hệ thống đang hỏng dần. Trọng số, prompt và chỉ mục retrieval đều cần một quy trình đưa lên đã được kiểm thử.
MERSO IT đứng ở đâu
Chúng tôi xây dựng ở cả hai phía của ranh giới này: AI trên nền Azure khi đám mây được chấp nhận, và các triển khai trọng số mở cục bộ — phục vụ bằng vLLM, pipeline retrieval, bộ khung đánh giá, ghi log tích hợp SIEM — khi không. Vì làm việc trong cả hai thế giới, chúng tôi sẽ nói thẳng với bạn cấp độ nào workload của bạn thực sự cần, thay vì bán cho bạn cấp nặng nhất.