Phần lớn anh em đang dùng AI để làm nhanh một việc vốn làm bằng cơm. Việc đó tốt, nhưng nó chỉ là một nửa. Nửa còn lại là Knowledge Graph đi cùng Agentic AI, tức là xếp lại dữ liệu của mình thành đồ thị rồi giao cho AI đọc, để nó chỉ ra những mối quan hệ mà trước giờ mình không nhìn thấy. Đấy mới là chỗ ra được sản phẩm mới, thị trường mới, chứ không phải chỗ tiết kiệm vài giờ công.
Video gốc dài 33 phút. Bài này viết thêm ba thứ video chỉ lướt qua: cấu trúc thật của một node trong kho tri thức, câu lệnh tôi chạy trên database đồ thị, và bảng so sánh giữa lưu bằng file với lưu bằng database.
Bài này đi qua những đâu?
- Vì sao dùng AI thay việc thủ công chưa phải chỗ đáng tiền nhất
- Bộ não của AI bây giờ mạnh tới đâu, đo bằng con số nào
- Khả năng kết nối đổi được cái gì trong công ty của anh em
- Dữ liệu dạng đồ thị khác dữ liệu dạng bảng ở chỗ nào
- Một node trong kho tri thức trông ra sao, có mẫu chép về dùng luôn
- Vì sao lưu tri thức bằng file thì tới một lúc là tắc
- Database đồ thị chạy khác file ở chỗ nào, kèm số đo thật
- Áp vào việc bán hàng thì ra kết quả gì
- Giới hạn thật của cách làm này
Vì sao dùng AI thay việc thủ công chưa phải chỗ đáng tiền nhất?
Vì nó chỉ hạ chi phí của việc anh em đang làm, chứ không tạo ra việc mới.
Anh em có một quy trình chạy bằng người, nhiều bước, chậm. Anh em đưa AI vào thay một khúc. Hiệu suất lên. Tôi đồng ý, đó là cách tiếp cận kinh điển và nó đúng. Nhưng nó là bài toán trừ. Trừ thời gian, trừ nhân công, và trần của nó là chi phí hiện tại của anh em.
Còn bài toán cộng thì sao? Tức là làm ra dịch vụ mà trước đây mình không đủ năng lực để làm. Muốn vậy cần hai thứ đi cùng nhau. Một là bộ não đủ giỏi. Hai là dữ liệu xếp theo kiểu cho phép nhìn ra quan hệ. Thiếu một trong hai là quay về bài toán trừ.
Bộ não của AI bây giờ mạnh tới đâu?
Nó đã vượt qua ngưỡng của người có bằng tiến sĩ trong chính chuyên ngành của họ, đo trên bài test GPQA, và vượt hơn 20 điểm.
GPQA là bộ 448 câu trắc nghiệm do chính chuyên gia sinh học, vật lý, hóa học viết ra, thiết kế để không tra Google được. Trong bài báo gốc, tiến sĩ đúng chuyên ngành trả lời đúng 65%, tính thoáng ra thì 74%. Người giỏi nhưng trái ngành, tra mạng thoải mái hơn 30 phút mỗi câu, chỉ được 34%.
Bây giờ nhìn sang máy.

Con số cụ thể của từng hãng là bao nhiêu?
| Ai làm bài | Điểm GPQA |
|---|---|
| Người trái ngành, được tra mạng | 34% |
| Người có bằng tiến sĩ đúng ngành | 65% tới 74% |
| Gemini 3.1 Pro Preview | 94,1 |
| GPT-5.4 | 92,0 |
| GPT-5.3 Codex | 91,5 |
| Claude Opus 4.7 | 91,4 |
| Kimi K2.6 | 91,1 |
Anh em để ý cột bên phải. Năm 2023 mấy con này còn quanh 29,7 điểm. Ba năm sau là 94. Không phải nhích lên, mà là nhảy bậc.
Còn kỹ năng ngồi máy tính thì sao?
Cũng đã chạm người. Ở mảng dùng máy tính, tức là mở file, bấm vào app, điền form: người trung bình được khoảng 72,36%, Kimi K2.6 được 73%, Claude Sonnet 4.6 được 72,1%. Có mô hình đã nhỉnh hơn người.
Nói cho dễ hình dung nhá. Thuê một người vừa có trình độ tiến sĩ, vừa giải được toán khó, vừa thao tác máy tính nhanh, thì lương tháng bao nhiêu? Bây giờ một gói dùng cỡ 100 đô một tháng. Anh em không thuê nổi người như thế với dưới 3 triệu một tháng. Không có cửa.
Khả năng kết nối đổi được cái gì?
Nó biến bộ não đó từ một người ngồi ngoài cổng thành một nhân sự có thẻ ra vào hệ thống của anh em.
Trước đây bộ não giỏi mà không chọc được vào dữ liệu công ty thì cũng chỉ hỏi đáp chung chung. Muốn nối vào phải biết API, biết viết code, biết mở kết nối database. Anh em không làm công nghệ thì đứng ngoài.
Bây giờ nó là một danh sách có công tắc.

Khi nó vào được rồi thì câu hỏi của anh em đổi hẳn tính chất. Không còn hỏi kiến thức chung, mà hỏi trên chính đống dữ liệu của mình. Tôi có nhiều buổi Zoom với cộng đồng học viên. Tôi hỏi buổi hôm qua ai trao đổi nhiều nhất, ai đóng góp giải pháp. Nó tự vào bản ghi, tự trích, tự đúc kết. Trước đây việc này là ngồi search và đọc tay.
Cách dựng đội ngũ agent kiểu này tôi có chia sẻ riêng trong bài đội ngũ AI Agent vận hành cả công ty.
Vì sao nhiều năng lực như vậy mà doanh nghiệp vẫn chỉ dùng được một phần nhỏ?
Vì phần lớn anh em mới nối AI vào công cụ, chưa nối AI vào dữ liệu có cấu trúc quan hệ. Khoảng cách giữa năng lực lý thuyết và mức dùng thật rất lớn, và có báo cáo đo hẳn ra.

Chỗ trống giữa hai đường chính là phần anh em chưa lấy. Nó không nằm ở chỗ mua model xịn hơn. Nó nằm ở chỗ dữ liệu của anh em đang để dạng mà AI không đọc ra quan hệ.
Dữ liệu dạng đồ thị là gì, và nó khác dạng bảng ở chỗ nào?
Bản chất nó là mỗi điểm dữ liệu được nối với các điểm liên quan bằng một sợi dây có tên. Còn dạng bảng thì mỗi dòng nằm riêng, muốn biết dòng này liên quan dòng kia thì phải tự đi ghép.
Tôi lấy một tệp dữ liệu demo về một cửa hàng bán thiết bị bay không người lái. Có sản phẩm, có phụ kiện, có gói combo, có chương trình khuyến mãi.

Ở đây tôi đang dùng Obsidian để xem. Nhưng anh em bỏ qua tool đi. Tool nào cũng được. Cái đáng giá là mấy sợi dây kia, không phải phần mềm vẽ ra chúng.
Một node trong kho tri thức trông ra sao?
Nó là một file chữ thuần, có phần đầu ghi thuộc tính, phần thân ghi mô tả, và mấy mục liệt kê nó dính với ai.

Anh em chép mẫu này về là dùng được ngay:
---
type: accessory
price_usd: 169.99
---
# Apex Pro Spare Battery
Pin thong minh dung luong 5000mAh cho SkyHawk Apex Pro, cho phep 34 phut
bay lien tuc. Co cell tu can bang, thong bao trang thai qua app.
Bao hanh 200 chu ky sac. Tuong thich Apex Pro va FalconView Pro X qua
adapter (ban rieng).
## Category
[[Batteries]]
## Official Accessory For
[[SkyHawk Apex Pro]]
## Compatible With (via adapter)
[[FalconView Pro X]]
## In Bundles
[[Apex Pro Creator Kit]]
[[Apex Pro Fly More Combo]]Chỗ quyết định nằm ở tên các mục. Official Accessory For khác hẳn Compatible With (via adapter). Cùng là quan hệ giữa pin với máy bay, nhưng ý nghĩa kinh doanh khác hẳn. Một cái bán kèm được ngay, một cái phải bán thêm adapter. Nhét cả hai vào một cột tên là "liên quan" thì mất luôn phần đắt.
Đấy là việc của người, không phải việc của máy. AI viết hộ anh em nội dung, nhưng đặt tên quan hệ thì anh em phải tự làm, vì đó là nghiệp vụ của anh em.
AI trả lời khác đi thế nào khi có đồ thị?
Nó trả lời kèm cả vùng xung quanh, chứ không trả lời trơ một món.
Tôi hỏi con trợ lý một câu rất thường: tôi là người mới, nên mua gì.

Nó làm được vậy vì nó đi từ node Beginner Drones, lần ra các máy gắn với node đó, rồi từ mỗi máy lần tiếp sang thông số, phụ kiện, gói combo, khuyến mãi. Để dạng bảng thì nó trả về đúng một dòng sản phẩm, và anh em phải hỏi thêm bốn lần nữa.
Anh em thấy chỗ ra tiền chưa? Cái làm ra doanh thu không phải câu trả lời "nên mua Zephyr". Cái làm ra doanh thu là ba phụ kiện và gói combo tự bám theo.
Vì sao Google trả về được cả vợ con và học vấn của một người?
Vì Google cũng lưu tri thức dạng đồ thị. Đây không phải ý tưởng mới.
Anh em search một cái tên bất kỳ, bên phải hiện ra ngày sinh, công ty, người thân, giá trị tài sản. Đó là các node nối vào nhau. Nếu anh em có kiểu dữ liệu đó cho tệp khách của mình, anh em hỏi được những câu mà bảng không trả lời nổi. Tôi ví dụ: hai người này có bạn chung nào, hai công ty này từng dính nhau ở đâu.
Và đây mới là chỗ đáng tiền: giá trị lớn thường nằm ở tri thức ẩn. Giống bộ não có neuron nối nhau, có những nối kết đang tồn tại mà mình chưa biết. Để dạng bảng thì mình chỉ tìm được cái mình đã nghĩ ra để tìm. Để dạng đồ thị thì AI chỉ cho mình cái mình chưa nghĩ tới.
Lưu tri thức bằng file có ổn không?
Tôi nói luôn là không ổn. Chạy demo thì được, chạy thật thì tắc.
Rất nhiều người đang nói về second brain, về Obsidian. Tôi không chê tool. Tôi nói bản chất: Obsidian là cái để xem. Dữ liệu của nó nằm ở các file chữ. Mà file thì không có cơ chế nào để tìm nhanh khi dữ liệu lớn lên. Thiết kế thư mục khéo tới đâu cũng vậy, vì thiếu thứ nằm bên dưới.
| Lưu bằng file | Lưu bằng database đồ thị | |
|---|---|---|
| Tìm khi dữ liệu lớn | Quét lần lượt, càng nhiều file càng lâu | Có chỉ mục, thời gian gần như không đổi |
| Chiến lược thực thi | Không có | Có, tự chọn đường chạy rẻ nhất |
| Đo được chỗ chậm | Không | Có, đọc thẳng số lần chạm dữ liệu |
| Nhiều người ghi cùng lúc | Dễ đè nhau | Có giao dịch, có khóa |
| Phân quyền, bảo mật | Theo quyền thư mục | Theo user, theo vai trò |
| Hợp cho việc gì | Thử ý tưởng, kho nhỏ, một người dùng | Chạy thật, nhiều nguồn, nhiều người |
Muốn tìm nhanh thì phải đưa vào database. Câu đó cũ mèm nhưng vẫn đúng nguyên. Nếu anh em nghiêm túc xây một thứ chạy lâu dài và tích lũy dữ liệu đủ nhiều, đừng dừng ở file.
Database đồ thị chạy khác file ở chỗ nào?
Khác ở chỗ nó có chiến lược thực thi. Đây là điểm anh em cần nhớ, còn cú pháp thì kệ nó, AI viết hộ được.
Tôi đưa nguyên kho drone vừa rồi vào Neo4j.

Nhìn mấy cái tên quan hệ đó đi anh em. IS_UPGRADE_OF là thứ cho phép hỏi "máy này lên đời ba bậc thì tới máy nào". HAS_DEAL là thứ cho phép hỏi "trong chuỗi lên đời đó, chỗ nào đang có khuyến mãi". Ghép hai câu lại là ra một kịch bản bán hàng. Không có tên quan hệ thì không có câu hỏi.
Chiến lược thực thi là cái gì?
Là việc database nhìn câu lệnh của anh em rồi tự chọn đường chạy rẻ nhất trước khi chạy. File không có thứ này.

274 lần chạm, 15 mili giây. Cùng câu hỏi đó mà quét file thì tính bằng phút. Quan trọng hơn con số: có bản kế hoạch này thì anh em nhìn ra chỗ chậm và sửa được. Không có nó thì chỉ biết là chậm.
Anh em nào từng đọc kế hoạch thực thi bên SQL sẽ thấy quen ngay. Cùng một tư duy thôi, chỉ khác là đồ thị đi theo quan hệ chứ không đi theo bảng.
Áp vào việc bán hàng thì ra kết quả gì?
Ra được câu hỏi kiểu này: trong danh sách người quan tâm mà chưa mua, ai có hành vi giống người đã mua rồi.
Dữ liệu khách của tôi nằm rải nhiều nơi: Zoom, YouTube, giới thiệu. Tôi gom hết về một đồ thị. Người là node. Buổi webinar là node. Khóa học là node. Rồi nối bằng quan hệ có tên: đã tham dự buổi nào, đã ghi danh khóa nào, đến từ nguồn nào, đang ở giai đoạn nào.
Xong thì hỏi được câu này bằng chữ, AI tự dịch ra câu lệnh:
Cau hoi: webinar nao co nhieu cap ngoi chung nhat, giua mot ben la
lead chua mua va mot ben la customer da mua?
MATCH (customer:Person)-[:ENROLLED_IN]->(:Course)
MATCH (lead:Person)
WHERE NOT EXISTS { MATCH (lead)-[:ENROLLED_IN]->(:Course) }
MATCH (customer)-[:ATTENDED]->(w:WebinarEvent)<-[:ATTENDED]-(lead)
RETURN
w.name AS webinar,
w.date AS date,
count(DISTINCT customer) AS so_customer,
count(DISTINCT lead) AS so_lead,
count(DISTINCT customer) * count(DISTINCT lead) AS so_cap
ORDER BY so_cap DESCAnh em đọc lại đoạn WHERE NOT EXISTS đi. Đó là chỗ định nghĩa thế nào là "chưa mua": người chưa có sợi dây ENROLLED_IN nào. Định nghĩa nằm trong dữ liệu, không nằm ở một cột trạng thái do ai đó gõ tay. Nên nó không bao giờ lệch.
Kết quả xếp theo số cặp. Buổi nào nhiều cặp nhất là buổi mà người chưa mua và người đã mua ngồi cạnh nhau đông nhất. Đó là buổi nên đem đi làm bằng chứng xã hội, và là danh sách nên đưa cho đội kinh doanh trước.
Cùng cách đó anh em hỏi được: người này chưa mua nhưng giống ai đã mua, giống ở điểm nào. Trước đây muốn ra được thứ này phải có người phân tích dữ liệu giỏi ngồi làm mấy ngày.
Bức tranh tổng: bốn bước
| Bước | Việc phải làm | Ai làm | Dấu hiệu xong |
|---|---|---|---|
| 1 | Liệt kê các loại thực thể trong nghiệp vụ của mình | Anh em, không giao AI | Viết ra được 5 tới 10 loại node, gọi tên bằng tiếng của ngành mình |
| 2 | Đặt tên cho từng loại quan hệ giữa chúng | Anh em, không giao AI | Mỗi tên quan hệ trả lời được một câu hỏi kinh doanh cụ thể |
| 3 | Đổ dữ liệu vào, mỗi node một file chữ có mục liên kết | AI làm phần lớn | Xem bằng mắt thấy đồ thị nối chằng chịt, không có node mồ côi |
| 4 | Chuyển kho file sang database đồ thị, nối AI vào | AI làm phần lớn | Hỏi bằng chữ ra kết quả, đọc được kế hoạch thực thi |
Bước 1 và bước 2 là chỗ anh em không giao được cho ai. Bước 3 và bước 4 thì cứ vứt cho AI, cách điều phối nhiều agent cùng làm tôi có chia sẻ trong bài dynamic workflow điều phối subagent.
Muốn bắt đầu bước 1 và 2 mà chưa biết mở đầu ra sao, anh em vứt đề bài này cho nó:
Vai cua may: kien truc su du lieu.
Nghiep vu cua anh: [mo ta cong viec kinh doanh trong 5 den 10 cau].
Viec 1. Liet ke cac loai thuc the trong nghiep vu tren. Moi loai ghi
ro no la cai gi va co nhung thuoc tinh nao.
Viec 2. Liet ke cac loai quan he giua chung. Ten quan he viet HOA,
co huong ro rang, vi du IS_UPGRADE_OF.
Viec 3. Voi TUNG quan he, viet mot cau hoi kinh doanh ma chi co
quan he do moi tra loi duoc. Quan he nao khong nghi ra
cau hoi thi bo di, dung giu cho day.
Viec 4. Chi ra 3 quan he ma may nghi anh dang bo sot, kem ly do.
Dau ra: mot bang thuc the, mot bang quan he, khong giai thich dai.Việc 3 là chỗ quan trọng nhất trong đề bài trên. Nó ép cả anh em lẫn AI bỏ đi những quan hệ nghe hay mà không dùng vào đâu.
Giới hạn thật
Tôi không giấu mấy chỗ này, vì anh em làm thì sẽ gặp.
Đồ thị chỉ giỏi bằng người đặt tên quan hệ. Đây là giới hạn lớn nhất, không tool nào chữa được. Đặt hết thành "liên quan" thì đồ thị chỉ là cái bảng vẽ đẹp. Giá trị nằm ở chỗ phân biệt IS_UPGRADE_OF với ALTERNATIVE_TO.
Đổ dữ liệu vào lần đầu là việc nặng. Ai bảo AI tự làm hết thì chưa làm bao giờ. AI viết được nội dung node, nhưng dữ liệu thật nằm ở Excel, ở CRM, ở phần mềm kế toán, mỗi nơi một kiểu đặt tên. Khâu khớp tên tốn công nhất và phải có người ngồi soát.
Node mồ côi thì đồ thị mất tác dụng ngay. Nhập nửa vời, một nửa node không có dây nào, thì AI trả lời thiếu mà vẫn trả lời tự tin. Loại sai này không báo lỗi.
Chạy trên file vẫn được, tới một ngưỡng. Tôi không bảo anh em dựng Neo4j từ hôm đầu. Cứ làm bằng file cho quen tư duy. Nhưng đừng xây hệ thống thật trên nền file, vì đến lúc đổi là phải nhập lại từ đầu.
Số đo 274 lần chạm trong 15 mili giây là trên tệp demo. Kho thật to hơn nhiều thì con số khác đi. Ý nghĩa của nó nằm ở chỗ anh em đo được, còn để file thì không đo được gì.
Chốt sớm chuyện ai được đọc dữ liệu nào. Gom dữ liệu khách về một chỗ rồi nối AI vào, thì một câu hỏi vu vơ cũng kéo ra được thứ đáng lẽ chỉ vài người được xem. Phân quyền phải nghĩ trước lúc đổ dữ liệu, đừng để sau.
Bảy ngày tới anh em làm được gì?
- Chọn đúng một mảng nghiệp vụ nhỏ. Danh mục sản phẩm, hoặc tệp khách, chọn một thôi.
- Viết ra giấy 5 tới 10 loại thực thể. Chưa mở máy vội.
- Viết ra 5 tới 8 loại quan hệ, tên viết hoa, có hướng.
- Với mỗi quan hệ, viết một câu hỏi kinh doanh mà chỉ nó mới trả lời được. Cái nào bí thì gạch đi.
- Làm 20 node bằng file Markdown theo mẫu ở trên. Đúng 20, đừng tham.
- Mở bằng công cụ xem đồ thị. Tìm node mồ côi và nối lại.
- Nối AI vào thư mục đó, hỏi ba câu ở bước 4. Xem nó trả lời có đúng vùng xung quanh không.
Hết bảy ngày mà thấy chạy được thì lúc đó mới bàn tới database. Cứ làm đi, sai thì sửa.
Câu hỏi hay gặp
Knowledge Graph là gì, nói ngắn gọn? Là cách lưu tri thức trong đó mỗi mẩu thông tin là một node, các node nối nhau bằng quan hệ có tên rõ ràng. Khác bảng ở chỗ quan hệ được ghi thẳng vào dữ liệu, nên máy đi từ điểm này sang điểm kia mà không cần ghép tay.
Có bắt buộc dùng Neo4j không? Không. Bắt đầu bằng file Markdown có liên kết là đủ để quen tư duy. Chuyển sang database đồ thị khi dữ liệu lớn tới mức tìm chậm, hoặc khi cần nhiều người dùng chung và phân quyền.
Obsidian có phải Knowledge Graph không? Obsidian là công cụ để xem. Dữ liệu thật của nó là các file chữ. Đồ thị hiển thị đẹp nhưng bên dưới không có chỉ mục, không có chiến lược thực thi, nên khi kho lớn lên thì tìm chậm dần.
Không biết viết code thì làm được không? Được. Cú pháp câu lệnh giờ AI viết hộ. Anh em ra đề bài bằng chữ. Phần anh em phải tự làm là chọn thực thể và đặt tên quan hệ, vì đó là nghiệp vụ chứ không phải kỹ thuật.
Bắt đầu từ dữ liệu nào là hợp lý nhất? Chọn mảng mà anh em hay phải trả lời câu hỏi kiểu "cái này liên quan cái kia thế nào". Thường là danh mục sản phẩm hoặc tệp khách. Đừng bắt đầu bằng dữ liệu giao dịch, vì nó nhiều dòng mà ít quan hệ.
Bao lâu thì thấy kết quả? Một tuần là ra bản chạy được với 20 tới 30 node và trả lời được vài câu hỏi thật. Dựng kho đủ để đội kinh doanh dùng hàng ngày thì tính bằng tháng, phần lớn thời gian nằm ở khâu làm sạch và khớp tên.
Đúc kết
Bộ não đã sẵn, rẻ hơn thuê người rất nhiều lần. Khả năng chọc vào hệ thống cũng đã sẵn, bấm một phát là xong. Thứ còn thiếu nằm ở phía anh em: dữ liệu đang để dạng bảng, nên AI giỏi mấy cũng chỉ trả lời được từng ô một.
Mọi thứ mới đều sinh ra từ chỗ nối được hai mẩu tri thức trước đó nằm rời nhau. Startup cũng chỉ là giao thoa tri thức của mấy ngành khác nhau. Đồ thị là cách bày dữ liệu ra để chỗ giao thoa đó tự lộ, thay vì ngồi chờ nghĩ ra.
Cứ chọn một mảng nhỏ, làm 20 node, xem nó nối ra sao. Tùy anh em, làm bằng file hay bằng database đều được. Miễn là bắt đầu từ việc đặt tên cho các sợi dây.
Anh em nào muốn đi cùng cho nhanh thì tôi có chương trình coaching về Agentic AI, thông tin tôi để ở phần mô tả video.
Nguồn tham khảo
- Rein và cộng sự, GPQA: A Graduate-Level Google-Proof Q&A Benchmark, arXiv 2311.12022. arxiv.org
- Bảng xếp hạng GPQA, số liệu chốt 13/05/2026. pricepertoken.com
- Anthropic, Labor market impacts. anthropic.com
- Neo4j Cypher Manual, Understanding query plans. neo4j.com
- Bài liên quan trên Wecommit: đội ngũ AI Agent vận hành cả công ty · AI Agent kiểm tra hóa đơn đầu vào · dynamic workflow điều phối subagent · tối ưu chi phí token khi vận hành kênh YouTube · Claude Fable 5, ba thay đổi cho doanh nghiệp



