MERSO IT

AI · Chủ quyền dữ liệu

LLM cục bộ và chủ quyền dữ liệu: AI không bao giờ rời khỏi tòa nhà của bạn

MERSO IT Insights · Cập nhật tháng 7 2026 · 9 phút đọc

Một lõi mạng nơ-ron được bảo vệ bên trong pháo đài kính, các dòng dữ liệu được giữ trọn trong những bức tường của nó

Tình huống: đội pháp lý, cơ quan quản lý, hoặc chính bản đánh giá rủi ro của bạn đã kết luận rằng hồ sơ khách hàng, hồ sơ vụ việc, bệnh án hay nội dung hợp đồng không được gửi đến API AI của bên thứ ba — chấm hết. Điều đó không có nghĩa là bạn từ bỏ AI. Nó có nghĩa là mô hình đến với dữ liệu thay vì dữ liệu đi đến mô hình. Bài viết này trình bày ba cấp độ chủ quyền dữ liệu mà chúng tôi thiết kế, những lựa chọn phần cứng và mô hình thực sự hiệu quả trong năm 2026, cùng những đánh đổi mà không ai đưa vào bộ slide bán hàng.

Vì sao "cứ dùng API đám mây" không còn là câu trả lời

Với hầu hết doanh nghiệp, một dịch vụ AI đám mây được cấu hình tốt kèm thỏa thuận xử lý dữ liệu là đủ — chúng tôi xây dựng trên Azure hằng ngày và nói điều đó công khai. Nhưng ba nhóm sau thường xuyên không thể chấp nhận phương án này:

Ba cấp độ chủ quyền dữ liệu

Cấp độNơi chạy suy luậnPhù hợp với ai
1. Đám mây ghim theo khu vựcĐám mây công cộng, khóa vào một region EU (hoặc quốc gia), khóa mã hóa do khách hàng quản lý, không lưu giữ dữ liệu cho giám sát lạm dụngHầu hết doanh nghiệp quan tâm GDPR; bước chủ quyền dữ liệu nhanh và rẻ nhất
2. Vùng riêng trên đám mây tư nhânNăng lực GPU chuyên dụng trong đám mây chủ quyền hoặc trung tâm dữ liệu trong nước, mô hình do bạn chọn, cô lập về mạngNgân hàng, bảo hiểm, tập đoàn y tế; dữ liệu ở lại trong nước và trong tenant của bạn
3. On-premise hoàn toànMáy chủ của bạn, tủ rack của bạn, có thể ngắt hẳn khỏi internet (air-gap)Chính phủ, các lĩnh vực gần quốc phòng, đặc quyền pháp lý, bất kỳ ai trả lời "nó có được rời khỏi tòa nhà không?" bằng chữ không

Công sức kỹ thuật tăng vọt từ cấp 1 lên cấp 3 — và mức độ kiểm soát cũng vậy. Câu hỏi đúng không bao giờ là "cấp nào an toàn nhất?" mà là "cấp nhẹ nhất nào vẫn thỏa mãn nghĩa vụ thực tế của chúng ta?"

Mô hình cục bộ thực sự làm được gì trong năm 2026

Khoảng cách giữa mô hình trọng số mở và mô hình tiên tiến nhất đã thu hẹp đến mức, với các tác vụ doanh nghiệp có phạm vi rõ ràng, một mô hình cục bộ được phục vụ tốt không còn là sự thỏa hiệp:

Những gì chúng vẫn làm kém hơn: suy luận mở kiểu frontier, các tác vụ agentic nhiều bước rất dài, và độ cập nhật về kiến thức thế giới. Một kiến trúc trung thực sẽ đặt các tác vụ đó — nếu chúng tồn tại và dữ liệu cho phép — lên tầng đám mây, và giữ phần việc nhạy cảm ở cục bộ. Thiết kế "não đôi" đó chính là mẫu hình chúng tôi triển khai nhiều nhất.

Bài toán phần cứng

Cú sốc về giá nhỏ hơn nhiều so với hầu hết CTO nghĩ. Một máy chủ duy nhất với hai GPU 48 GB chạy được mô hình 70B lượng tử hóa với thông lượng vững vàng cho khối lượng xử lý tài liệu của vài trăm nhân viên. Một mô hình 8–14B — đủ cho Q&A dựa trên retrieval và trích xuất dữ liệu — chạy trên một GPU cấp workstation. Cụ thể:

Điểm quản trị mà mọi người bỏ qua: một mô hình cục bộ không chỉ bảo vệ dữ liệu đi vào — nó bảo vệ cả dấu vết kiểm toán. Mọi prompt, mọi tài liệu được truy xuất, mọi câu trả lời đều có thể ghi log vào SIEM của chính bạn, lưu giữ theo lịch của chính bạn, và xuất trình cho cơ quan quản lý mà không phải xin vendor những bản log họ có thể không hề giữ. Với nghĩa vụ tài liệu hóa của EU AI Act, việc sở hữu toàn bộ log suy luận là một siêu năng lực thầm lặng.

Những gì bạn phải đánh đổi — nói thẳng

Một mẫu hình triển khai hiệu quả

  1. Phân loại dữ liệu trước. Hầu hết tổ chức phát hiện chỉ 10–30% use case AI của họ thực sự chạm đến dữ liệu đòi hỏi cấp 2 hoặc 3. Hãy định tuyến phần còn lại lên đám mây ghim theo khu vực và dành ngân sách chủ quyền dữ liệu cho nơi thực sự cần.
  2. Bắt đầu với retrieval, không phải fine-tune. Một mô hình cục bộ với retrieval tốt trên tài liệu của bạn thắng một mô hình fine-tune không có retrieval, và nó kiểm toán được — bạn chỉ ra được chính xác nguồn nào tạo ra câu trả lời.
  3. Xây bộ đánh giá trước khi chọn mô hình. Năm mươi tác vụ thực từ chính khối lượng công việc của bạn, chấm điểm mù. Mô hình "tốt nhất" trên các bảng xếp hạng công khai thường không phải mô hình tốt nhất trên hồ sơ của bạn.
  4. Thiết kế đường cập nhật ngay từ ngày đầu. Một hệ thống AI chủ quyền mà hai năm sau vẫn chạy mô hình của ngày ra mắt là một hệ thống đang hỏng dần. Trọng số, prompt và chỉ mục retrieval đều cần một quy trình đưa lên đã được kiểm thử.

MERSO IT đứng ở đâu

Chúng tôi xây dựng ở cả hai phía của ranh giới này: AI trên nền Azure khi đám mây được chấp nhận, và các triển khai trọng số mở cục bộ — phục vụ bằng vLLM, pipeline retrieval, bộ khung đánh giá, ghi log tích hợp SIEM — khi không. Vì làm việc trong cả hai thế giới, chúng tôi sẽ nói thẳng với bạn cấp độ nào workload của bạn thực sự cần, thay vì bán cho bạn cấp nặng nhất.

Đang cân nhắc giữa AI đám mây và AI cục bộ cho dữ liệu chịu quản lý? Hãy mô tả ràng buộc của bạn — chúng tôi sẽ phác thảo kiến trúc nhẹ nhất thỏa mãn nó.

Trao đổi với MERSO IT