Tôi làm công nghệ gần 15 năm, phần lớn thời gian đi tối ưu hệ thống cho ngân hàng, chứng khoán, bảo hiểm, viễn thông và bệnh viện. Khi tôi quyết định đổ tiền của công ty và thời gian của anh em trong công ty vào Agentic AI, tôi phải trả lời cho chính mình một câu trước đã: cái lõi này có bền không, hay chỉ là một đợt sốt rồi tắt?
Bài này là ba căn cứ tôi dùng để trả lời câu đó. Không phải nhận định chung chung. Mỗi căn cứ đều có mốc thời gian, có tên bài báo gốc, có con số.
Video gốc dài 45 phút. Bài viết này bổ sung thứ video không có: mốc ngày tháng đã tra lại từ nguồn gốc, bảng số liệu chép ra được, và một bộ câu hỏi tự soi để anh em mang về dùng.
Bài này trả lời câu hỏi nào?
- Vì sao AI có từ năm 1950 mà tới sau 2017 mới chạy được việc?
- Transformer sửa đúng hai chỗ nào, và vì sao hai chỗ đó mở khoá cả ngành?
- ONNX cộng SLM hạ rào cản xuống bằng cách nào?
- Dòng tiền của doanh nghiệp có thật sự đi về hướng agent không?
- Đã có ai cho agent chạy thật chưa, và họ chạy tới đâu?
- Phép so sánh với thời Internet đứng được ở chỗ nào, gãy ở chỗ nào?
- Doanh nghiệp của anh em đang ở đâu, và bảy ngày tới làm được gì?
Vì sao học AI theo tool thì càng học càng rối?
Vì tool đẻ ra nhanh hơn tốc độ anh em học. Hôm nay một cái tên, tuần sau mười cái tên. Học theo tool thì tuần nào cũng thấy mình tụt lại.
Tôi ví dụ. Một người hỏi tôi nên dùng công cụ nào để tóm tắt tài liệu. Câu hỏi đó không sai, nhưng nó không có đáy. Trả lời xong một cái tên thì tháng sau lại hỏi tiếp. Còn nếu người đó hiểu bản chất mô hình ngôn ngữ đang làm gì, hiểu dữ liệu của mình được phép đi tới đâu, thì tự chọn được, và chọn đúng cả với những công cụ chưa ra đời.
Nên phần đầu bài này tôi đi vào nguyên lý. Chỉ hai nguyên lý thôi. Hiểu hai cái đó là nhìn ra được cả bức tranh.
Căn cứ thứ nhất: lõi công nghệ có bền không?
Câu trả lời ngắn: bền, và lý do bền nằm ở hai thứ đã được công bố công khai, có ngày tháng, có bài báo gốc. Một là kiến trúc Transformer năm 2017. Hai là sự kết hợp giữa chuẩn ONNX và mô hình ngôn ngữ nhỏ.
AI có từ năm 1950, vì sao tới 2017 mới chạy được?
Khái niệm AI không mới. Ngay trong video tôi có mở lại bài của Alan Turing năm 1950, bài Computing Machinery and Intelligence đăng trên tạp chí Mind, số 49, trang 433 tới 460. Ông ấy đặt câu hỏi máy có nghĩ được không, và đề ra một phép thử. Bảy mươi năm trước đã có rồi.
Vậy vì sao tắc lâu thế? Tắc ở hai chỗ, và cả hai đều là chuyện kỹ thuật rất đời.
Chỗ thứ nhất là máy không hiểu. Cách làm cũ cho máy đọc chữ tuần tự từ trái sang phải, hết từ này tới từ kia. Anh em xem hai câu này:
Nhà trường kỷ luật các sinh viên vì họ vi phạm kỷ luật. Nhà trường kỷ luật các sinh viên vì họ muốn duy trì kỷ luật.
Chữ họ ở câu trên chỉ sinh viên. Chữ họ ở câu dưới chỉ nhà trường. Cùng một chữ, hai nghĩa ngược nhau. Máy đọc tuần tự thì tới chữ họ nó đã quên mất đầu câu, nó không phân biệt được. Con người mình đọc thì nhìn cả câu một lượt nên hiểu ngay.
Chỗ thứ hai là chậm. Đọc tuần tự tức là phải xong từ này mới sang từ kia, không chia việc ra làm song song được. Đã chậm mà lại còn không hiểu. Dữ liệu ngoài internet nhiều bao nhiêu cũng vô nghĩa.
Transformer sửa đúng hai chỗ nào?
Ngày 12 tháng 6 năm 2017, một nhóm tám tác giả nộp lên arXiv bài Attention Is All You Need. Phần lớn nhóm này làm ở Google Brain và Google Research, một người ở University of Toronto. Ý tưởng của họ đơn giản tới mức khó chịu: thay vì đọc lần lượt, đưa cả câu vào một lượt và xét trên toàn bộ ngữ cảnh.

Sửa một chỗ mà được hai. Đọc toàn bộ ngữ cảnh thì máy biết chữ họ ánh xạ vào đâu, tức là nó hiểu. Và vì không phải đọc lần lượt nữa nên các phép tính chia ra chạy song song được, tức là nó nhanh. Mà muốn chạy song song thật nhiều phép nhân ma trận thì cắm thêm phần cứng, cụ thể là GPU.

Tới đây thì bài toán còn lại chỉ là hai thứ: có dữ liệu không, và có phần cứng không. Dữ liệu thì loài người tạo ra trên internet mấy chục năm rồi, có sẵn. Phần cứng thì ai chịu chi là có. Đó là lý do các tập đoàn lao vào tranh nhau mua GPU, và là lý do NVIDIA ngày 29 tháng 10 năm 2025 trở thành công ty đầu tiên đóng cửa phiên với vốn hoá trên 5 nghìn tỷ đô.
Chữ T trong GPT chính là Transformer. Cùng một gốc đó.
LLM thật ra đang làm việc gì?
Bản chất nó đoán từ. Chỉ vậy thôi.
Mô hình ngôn ngữ lớn học từ một khối dữ liệu khổng lồ, học xem những từ nào hay đi cùng nhau và đi với xác suất bao nhiêu. Anh em gõ vào Hello, how are you? I'm thì nó tra lại thói quen đã học và đoán rằng từ tiếp theo nhiều khả năng là fine. Con số mấy chục tỷ hay mấy trăm tỷ tham số mà anh em hay thấy chính là độ dày của cái kho thói quen đó.
Hiểu đúng chỗ này thì bớt được rất nhiều ảo tưởng. Nó đoán, nên nó có xác suất đoán trượt. Không phải nó dối anh em, nó đang làm đúng việc của nó.
Nếu chỉ có LLM thì sân chơi thuộc về ai?
Thuộc về vài ông lớn, và anh em đứng ngoài.
Muốn huấn luyện một mô hình lớn thì phải có hàng trăm triệu tới hàng tỷ đô để mua phần cứng. Ngoài đời không ai có ngần đó máy. Nên nếu câu chuyện dừng ở LLM thì đây là sân của Microsoft, Google, OpenAI, còn lại tèo hết.
Còn một chỗ vướng nữa ít người để ý. Mỗi hãng làm mô hình bằng một bộ công nghệ khác nhau, xong lại phải chạy trên một loại phần cứng hợp với nó. Giống như ông này viết văn bản ra file .txt, ông kia ra .doc, ông nữa ra .docx. Ai muốn đọc của ai thì phải cài đúng phần mềm của người đó. Bó hẹp.
Hai chỗ vướng này được gỡ bởi thứ thứ hai, và đây mới là phần tôi thấy đáng tin nhất.
ONNX giải bài toán gì?
ONNX là chuẩn chung để đóng gói mô hình, viết đầy đủ là Open Neural Network Exchange.
Anh em hình dung như file PDF. Trước khi có PDF thì gửi tài liệu cho nhau là một cực hình, máy người nhận phải cài đúng phần mềm mới mở được. Có PDF rồi thì ai cài một trình đọc là mở được hết, không cần biết bên kia soạn bằng gì. ONNX làm đúng việc đó cho mô hình AI, còn cái trình đọc thì gọi là ONNX Runtime.
Dòng thời gian của nó thế này, tôi đã tra lại từng mốc:
| Mốc | Chuyện gì xảy ra | Vì sao nó quan trọng |
|---|---|---|
| 7 tháng 9 năm 2017 | Microsoft và Facebook công bố ONNX | Hai ông lớn vốn cạnh tranh nhau lại ngồi chung để làm một định dạng chung |
| 6 tháng 12 năm 2017 | AWS gia nhập, ONNX 1.0 sẵn sàng cho môi trường chạy thật | Từ ý tưởng thành thứ dùng được, và có ba ông lớn đứng sau |
| 14 tháng 11 năm 2019 | LF AI nhận ONNX làm dự án cấp tốt nghiệp | Chuẩn này chuyển sang quản trị trung lập, không hãng nào một mình nắm hướng đi |

Mốc 2019 là mốc tôi để ý nhất. Một chuẩn nằm trong tay một hãng thì nó là công cụ cạnh tranh của hãng đó. Một chuẩn nằm dưới quản trị trung lập thì nó là hạ tầng chung. Hai thứ đó khác nhau về bản chất, không phải khác nhau về mức độ.
SLM chứng minh được điều gì bằng số?
Chứng minh rằng mô hình nhỏ vẫn làm được việc, nếu dữ liệu huấn luyện sạch.
Phát súng đầu là năm 2019. Nhóm Noah's Ark Lab của Huawei cùng Đại học Khoa học và Công nghệ Hoa Trung nộp bài TinyBERT: Distilling BERT for Natural Language Understanding ngày 23 tháng 9 năm 2019. Bản TinyBERT bốn lớp nhỏ hơn mô hình gốc 7,5 lần, suy luận nhanh hơn 9,4 lần, mà vẫn giữ hơn 96,8% kết quả của BERT gốc trên bộ đo GLUE.
Tới năm 2023 thì Microsoft Research đẩy thêm một nhịp nữa. Ngày 20 tháng 6 năm 2023 họ nộp bài Textbooks Are All You Need. Tên bài đặt nhại đúng bài Transformer bảy năm trước, và nội dung cũng đúng tinh thần đó: đổi một giả định mà cả ngành đang tin.
Giả định cũ là càng nhiều dữ liệu càng khôn. Họ chứng minh ngược lại. Mô hình phi-1 của họ chỉ có 1,3 tỷ tham số, học trên 7 tỷ token đã lọc kỹ, huấn luyện 4 ngày trên 8 con A100. Kết quả so với những mô hình to hơn nó hàng trăm lần:
| Mô hình | Tham số | Dữ liệu huấn luyện | HumanEval | MBPP |
|---|---|---|---|---|
| phi-1 | 1,3 tỷ | 7 tỷ token | 50,6% | 55,5% |
| StarCoder | 15,5 tỷ | 1 nghìn tỷ token | 33,6% | 52,7% |
| PaLM-Coder | 540 tỷ | 780 tỷ token | 35,9% | 47,0% |
| GPT-3.5 | 175 tỷ | không công bố | 47,0% | không công bố |
| WizardCoder | 16 tỷ | 1 nghìn tỷ token | 57,3% | 51,8% |

Tôi để nguyên dòng WizardCoder trong bảng, dù nó cao hơn phi-1 ở cột HumanEval. Bảng này là để anh em thấy quan hệ giữa kích thước và kết quả đã đứt, không phải để trao huy chương cho ai.
Sang 2024 thì các hãng đua nhau ra mô hình nhỏ. Microsoft ra Phi-3 ngày 23 tháng 4 năm 2024, gồm Phi-3-Mini 3,8 tỷ tham số, Phi-3-Small 7 tỷ và Phi-3-Medium 14 tỷ. Google ra Gemma từ tháng 2 năm 2024 rồi Gemma 2 ngày 27 tháng 6. Alibaba ra Qwen2.5 ngày 19 tháng 9. Và ngày 20 tháng 5 năm 2024, Microsoft giới thiệu Copilot+ PC, tức là đưa hẳn mô hình nhỏ xuống chạy trong máy tính cá nhân.
Anh em thấy thứ tự chưa ạ? Tháng 4 ra mô hình nhỏ, tháng 5 nhét vào máy tính. Không phải trùng hợp.
Ghép ONNX với SLM thì doanh nghiệp được gì?
Được quyền chạy AI trên máy của chính mình, dữ liệu không phải rời khỏi cửa.
Luồng nó thế này. Một hãng nào đó huấn luyện mô hình nhỏ, rồi xuất ra định dạng .onnx. Rất nhiều hãng chia sẻ luôn phần trọng số ra ngoài, không thu tiền. Công ty của anh em tải về, cài ONNX Runtime, chạy ngay trên máy chủ của mình.

| Tiêu chí | Mô hình nhỏ chạy tại chỗ | Mô hình lớn trên cloud |
|---|---|---|
| Dữ liệu nằm ở đâu | Trong máy chủ hoặc máy tính của công ty | Đẩy lên hạ tầng của hãng |
| Trả tiền kiểu gì | Trả một lần cho phần cứng, chạy bao nhiêu cũng vậy | Trả theo từng lượt gọi |
| Trần năng lực | Thấp hơn, hợp việc gọn | Cao hơn, hợp việc cần suy luận nhiều bước |
| Phụ thuộc hãng | Thấp, tải về là của mình | Cao, hãng đổi giá hoặc đổi chính sách là mình chịu |
Đây chính là chỗ tôi thấy vững. Không phải vì một hãng nào giỏi, mà vì cái nền này có ba chân: một chuẩn chung do tổ chức trung lập giữ, một loạt mô hình nhỏ tải về được, và phần cứng ngày càng rẻ. Ba chân đó không phụ thuộc vào việc hãng nào thắng cuộc đua năm nay.
Chuyện hãng tự nâng cấp mô hình cho mình dùng thì tôi có chia sẻ kỹ hơn ở bài ba thay đổi lớn khi Claude Fable 5 ra mắt.
Căn cứ thứ hai: dòng tiền có đi về hướng đó không?
Công nghệ hay mà không ai chi tiền thì cũng chỉ là bài báo. Nên căn cứ thứ hai của tôi là dòng vốn và dòng việc.
Ngày 26 tháng 8 năm 2025, Gartner ra thông cáo dự báo tới năm 2026 sẽ có 40% ứng dụng doanh nghiệp gắn agent chuyên trách từng việc, tăng từ mức dưới 5% của năm 2025.

Từ dưới 5% lên 40% trong một năm là một bước rất dốc. Nhưng anh em đọc kỹ chữ nhá: đây là dự báo, không phải số đã đo. Tôi để nguyên chữ đó vì nó quan trọng.
Trong danh sách xu hướng công nghệ 2026 của Gartner còn hai con số nữa, đều gắn mốc 2030. Một là 80% tổ chức sẽ chuyển các đội kỹ thuật phần mềm đông người thành đội nhỏ có AI hỗ trợ. Hai là 40% danh mục ứng dụng doanh nghiệp sẽ gồm ứng dụng tự dựng trên nền tảng AI-native, tăng từ mức 2% của năm 2025.
Còn về quy mô thị trường, bản tổng hợp của MarketsandMarkets mà tôi mở trong video ghi: 4,81 tỷ đô năm 2024, 7,06 tỷ đô năm 2025, dự báo 93,20 tỷ đô năm 2032, tốc độ tăng kép 44,6% một năm, khu vực tăng nhanh nhất là châu Á Thái Bình Dương.

Vì bài này bàn chuyện tương lai nên tôi tách bạch ra cho anh em dễ trích:
| Con số | Nguồn và ngày | Loại |
|---|---|---|
| 40% ứng dụng doanh nghiệp có agent chuyên trách vào 2026, từ dưới 5% năm 2025 | Gartner, thông cáo 26/08/2025 | Dự báo |
| 80% tổ chức chuyển sang đội nhỏ có AI hỗ trợ vào 2030 | Gartner, xu hướng công nghệ 2026 | Dự báo |
| 40% danh mục ứng dụng dựng trên nền tảng AI-native vào 2030, từ 2% năm 2025 | Gartner, xu hướng công nghệ 2026 | Dự báo |
| Quy mô thị trường 4,81 tỷ đô năm 2024 và 7,06 tỷ đô năm 2025 | MarketsandMarkets | Số đã ước tính cho năm đã qua |
| Dự báo 93,20 tỷ đô năm 2032, tăng kép 44,6% một năm | MarketsandMarkets, kỳ dự báo 2025 tới 2032 | Dự báo |
| NVIDIA đóng cửa phiên trên 5 nghìn tỷ đô vốn hoá ngày 29/10/2025 | Số liệu thị trường chứng khoán | Đã xảy ra |
| Các hãng database đưa agent vào lõi sản phẩm | Quan sát của tôi trong dự án đang làm | Nhận định của tôi, tháng 2/2026 |
Riêng dòng cuối tôi nói rõ thêm. Công việc chính của tôi nhiều năm là tối ưu database cho doanh nghiệp lớn, nên chỗ nào các hãng database dịch chuyển là tôi thấy sớm. Và thứ tôi thấy là họ đưa agent vào thẳng trong lõi, đặt tiêu chí AI đứng đầu. Đây là quan sát nghề của tôi, tôi không có bảng số để chứng minh, nên anh em cứ đọc nó đúng như vậy.
Nếu anh em đang đi từ hướng database sang, hai bài này nói kỹ phần nền mà bài hiện tại cố ý không đụng tới: tối ưu SQL nên bắt đầu từ đâu và vì sao có index mà SQL vẫn chậm.
Căn cứ thứ ba: đã có ai chạy thật chưa?
Rồi. Và tôi chia làm ba loại: dự án của người khác, dự án ở công ty tôi, dự án cá nhân của tôi.
Dự án của người khác thì tôi lấy Project Sid làm ví dụ. Nhóm Altera nộp bài Project Sid: Many-agent simulations toward AI civilization ngày 31 tháng 10 năm 2024. Họ thả từ chục tới hơn một nghìn agent vào một thế giới ảo dựng trên Minecraft, không viết kịch bản, rồi để chúng tự sống. Kết quả là các agent tự chia vai, tự đặt ra luật chung rồi tự sửa luật, và truyền bá văn hoá cho nhau. Chúng còn tự mua bán với nhau bằng đồng tiền trong game.

Tôi không lấy cái này ra để doạ ai. Ý của tôi hẹp thôi: một nghìn agent phối hợp được với nhau mà không cần người điều khiển từng bước, thì chuyện năm bảy agent phối hợp trong một quy trình kế toán của công ty anh em là chuyện nhỏ hơn nhiều bậc.
Ở công ty tôi thì việc chính là tư vấn quyết định tối ưu cho khách hàng. Trước đây việc đó cần nhân sự bảy tám năm kinh nghiệm ngồi phân tích. Bây giờ tôi ra đề bài, một nhóm agent tự chia nhau phân tích rồi trả kết quả về. Thời gian giảm nhiều lần và độ chính xác thì cao hơn, vì máy không bỏ sót dòng nào. Cách tôi dựng đội agent kiểu đó tôi có chia sẻ nguyên quy trình ở bài để đội ngũ AI agent vận hành cả công ty, còn một ví dụ nghiệp vụ cụ thể thì nằm ở bài AI agent kiểm tra hoá đơn đầu vào.
Dự án cá nhân thì tôi nuôi một con trợ lý riêng. Nó quản file trên một máy tính tôi để dành cho nó, tự mở trình duyệt lấy thông tin, tổng hợp lại rồi báo cáo. Ngay trong video tôi có hỏi nó đang chạy bộ não nào, nó trả lời là Kimi K2.5.
Ba loại đó cộng lại mới thành căn cứ. Một cái thôi thì mới chỉ là chuyện kể. Ba cái ở ba bối cảnh khác nhau mà cùng chạy được thì mới đáng để đổ tiền vào.
So sánh với thời Internet đứng được ở chỗ nào?
Chỗ này tôi phải nói cho sòng phẳng. Phép so sánh với thời Internet là nhận định của tôi, không phải số liệu. Tôi không có nghiên cứu nào đo được hai giai đoạn rồi kết luận chúng giống nhau. Anh em đừng mang câu đó đi trích như một dữ kiện.
Vậy tôi dựa vào đâu mà nói? Dựa vào ba thứ đo được, không phải dựa vào cảm giác:
- Có một chuẩn chung do tổ chức trung lập giữ. ONNX về LF AI ngày 14 tháng 11 năm 2019. Chuẩn chung là thứ làm cho người ngoài cuộc chơi được, vì không phải xin phép ai.
- Có thứ tải về dùng không mất tiền. Mô hình nhỏ của Microsoft, Google, Alibaba đều có bản mở, tải về là chạy. Đây là chỗ khác hẳn thời phần mềm doanh nghiệp phải mua giấy phép từng ghế ngồi.
- Rào cản kỹ thuật hạ xuống mức người không chuyên vẫn vào được. Việc khó nhất và tốn tiền nhất là huấn luyện mô hình thì các hãng làm hộ rồi. Phần còn lại là thiết kế cho các agent phối hợp với nhau, và cái đó là tư duy nghiệp vụ chứ không phải tư duy kiến trúc sư hệ thống.
Câu tôi nói trong video là: chưa có thời điểm nào mà anh em mình xuất phát gần với thế giới như bây giờ, và chưa có thời điểm nào rào cản hạ thấp như bây giờ. Đó là câu của tôi, và nó đứng trên ba điểm ở trên.
Còn chỗ phép so sánh này gãy thì tôi nói luôn ở mục giới hạn phía dưới. Có mấy chỗ gãy thật.
Ba lợi thế Agentic AI mang lại là gì?

| Lợi thế | Nó đổi cái gì | Loại |
|---|---|---|
| Chi phí thử một ý tưởng và thời gian ra bản chạy được giảm rất mạnh | Trước đây một ý tưởng chết ngay ở câu "không có người, không có tiền". Bây giờ dựng thử được rồi mới quyết | Tôi đã làm và đo được trong dự án của mình |
| Không cần bỏ hàng trăm triệu đô để huấn luyện mô hình | Phần đó hãng làm rồi. Việc của mình là thiết kế luồng cho các agent phối hợp | Dữ kiện, vì mô hình mở tải về được |
| Điểm xuất phát của người kỹ thuật và người không kỹ thuật gần như nhau | Thứ quyết định là hiểu nghiệp vụ và biết ra đề bài, không phải biết viết code | Nhận định của tôi, tháng 2/2026 |
Lợi thế thứ ba là chỗ tôi hay bị hỏi lại nhất, nên tôi nói rõ. Tôi không bảo người kỹ thuật hết giá trị. Tôi bảo khoảng cách giữa hai bên hẹp lại, vì phần khó nhất đã được đóng gói. Người hiểu nghiệp vụ sâu mà chịu học cách ra đề bài thì đi rất nhanh.
Và thứ quyết định lâu dài, theo tôi, là trải nghiệm khách hàng. Anh em cứ nhìn Agentic AI qua ống kính đó thì ý tưởng ra rất nhiều. Còn nhìn qua ống kính cắt giảm chi phí thì ý tưởng cạn rất nhanh.
Doanh nghiệp của anh em đang ở đâu?
Đây là bộ câu hỏi tôi dùng khi ngồi với một công ty lần đầu. Anh em chép về, ngồi với trưởng bộ phận, trả lời từng dòng.
BỘ CÂU HỎI TỰ SOI · DOANH NGHIỆP TÔI ĐANG Ở ĐÂU VỚI AGENTIC AI
Cách dùng: trả lời từng câu bằng một dòng. Câu nào không trả lời được bằng
dữ kiện thì ghi "chưa biết". Đừng đoán, vì chỗ "chưa biết" mới là việc phải làm.
[A] NGHIỆP VỤ
A1. Ba việc tốn người nhất tháng vừa rồi là việc gì? Mỗi việc mất bao nhiêu giờ?
A2. Trong ba việc đó, việc nào đã có quy trình viết ra giấy?
A3. Việc nào làm sai thì sửa được trong ngày? Việc đó giao cho agent trước.
A4. Thế nào là xong? Ai là người nghiệm thu?
[B] DỮ LIỆU
B1. Dữ liệu để làm việc đó nằm ở đâu? File, database, hay trong đầu người?
B2. Dữ liệu nào tuyệt đối không được rời khỏi máy của công ty?
B3. Ai được đọc, ai được sửa, ai được xoá?
[C] MÔ HÌNH
C1. Việc nào cần suy luận nhiều bước? Việc đó gọi lên mô hình lớn.
C2. Việc nào chỉ phân loại, trích xuất, tóm tắt ngắn? Việc đó thử mô hình nhỏ tại chỗ.
C3. Nếu ngày mai hãng đổi giá gấp đôi thì việc nào của tôi chết?
[D] CHI PHÍ
D1. Một lượt chạy tốn bao nhiêu tiền? Đã đo hay đang đoán?
D2. Một tháng chạy bao nhiêu lượt?
D3. So với làm bằng cơm thì rẻ hơn hay đắt hơn? Viết hai con số cạnh nhau.
[E] NGƯỜI
E1. Ai trong công ty sẽ là người ra đề bài cho agent?
E2. Người đó hiểu nghiệp vụ hay chỉ biết dùng công cụ?
E3. Sau 30 ngày, ai đứng ra nói việc này chạy được hay không chạy được?Trả lời hết bộ này thì anh em có luôn danh sách việc nên làm trước. Không cần ai tư vấn thêm.
Việc nào chạy tại chỗ, việc nào gọi lên cloud?
Đây là luật tôi đang dùng. Chép về rồi sửa lại theo công ty mình.
LUẬT PHÂN VIỆC · CHẠY TẠI CHỖ HAY GỌI LÊN CLOUD
CHẠY TẠI CHỖ, tức mô hình nhỏ đóng gói .onnx chạy bằng ONNX Runtime, khi:
[1] Dữ liệu thuộc nhóm không được rời khỏi máy công ty.
[2] Việc lặp lại nhiều lần trong ngày, mỗi lần một đoạn ngắn.
[3] Việc chỉ cần phân loại, trích xuất trường, chấm theo mẫu, tóm tắt ngắn.
[4] Chấp nhận kết quả kém hơn mô hình lớn một chút, đổi lấy việc không trả
tiền theo từng lượt gọi.
GỌI LÊN CLOUD, tức mô hình lớn của hãng, khi:
[1] Việc cần suy luận nhiều bước, đọc tài liệu dài, viết dài.
[2] Việc chạy thưa, vài chục lượt một ngày trở xuống.
[3] Dữ liệu đưa lên đã cắt bỏ phần định danh khách hàng.
[4] Sai một lần thì có người soát lại trước khi dùng.
DÙ CHẠY Ở ĐÂU CŨNG PHẢI GHI SỔ:
ngay | viec | mo hinh dung | so luot | tien | ai nghiem thu
ĐỌC SỔ MỖI TUẦN MỘT LẦN. Việc nào tiền tăng mà kết quả không tăng thì
đưa về chạy tại chỗ, hoặc bỏ.Chuyện đo tiền cho từng lượt gọi tôi có chia sẻ cách làm chi tiết ở bài tối ưu chi phí token khi cho AI vận hành kênh YouTube.
Giới hạn thật ở đâu?
Phần này tôi viết dài hơn thường lệ, vì bài nguyên lý mà không có phần này thì thành bài quảng cáo.
Lõi của nó là đoán, nên nó sai được. Mô hình ngôn ngữ đoán từ tiếp theo theo xác suất. Việc nào mà sai một lần là mất tiền thật hoặc mất uy tín thật thì phải có người nghiệm thu. Đây cũng là lý do tôi không tin câu AI thay thế hết con người. Nó là con người cộng AI.
Mô hình nhỏ không khôn bằng mô hình lớn. Đừng mang mô hình nhỏ đi làm việc cần suy luận nhiều bước rồi kết luận nó tệ. Nó không được sinh ra để làm việc đó.
Số dự báo vẫn chỉ là dự báo. Trong bảng ở trên, năm dòng là dự báo. Con số 40% của Gartner có thể lệch, và lệch là bình thường. Cái đáng tin trong đó là hướng đi, không phải con số lẻ.
Phép so sánh với thời Internet gãy ở ba chỗ. Một, thời Internet thì hạ tầng rẻ dần đều, còn ở đây phần cứng cho mô hình lớn vẫn đắt và vẫn nằm trong tay ít người. Hai, chuẩn chung của Internet có từ rất sớm và gần như không đổi, còn ở đây cách các agent nói chuyện với nhau vẫn đang thay đổi từng quý. Ba, thời Internet ai làm trước thì giữ được lợi thế nhiều năm, còn ở đây lợi thế kỹ thuật bốc hơi trong vài tháng vì hãng nào cũng nâng cấp liên tục. Nên thứ giữ được lâu là hiểu biết nghiệp vụ, không phải mẹo dùng công cụ.
Chỗ hỏng đắt nhất lại nằm ở vận hành của chính anh em, không nằm ở công nghệ. Một vòng lặp viết sai, agent gọi mô hình mười nghìn lần trong đêm, mỗi lần vài phần nghìn đô thì lúc chạy chẳng ai để ý, cuối tháng nhìn hoá đơn mới giật mình. Hoặc một agent được cấp quyền ghi vào hệ thống thật rồi ghi sai hàng loạt. Nên trước khi mở quyền cho nó, hãy làm ba việc: đặt hạn mức chi cho mỗi luồng, để mọi thao tác ghi ở chế độ cần người duyệt, và ghi sổ từng lượt gọi. Chuyện điều phối nhiều agent sao cho không giẫm chân nhau tôi có phân tích ở bài dynamic workflow và cách Opus 4.8 điều phối subagent.
Bảy ngày tới anh em làm được gì?
- Ngày 1. Chép bộ câu hỏi tự soi ở trên, ngồi với hai trưởng bộ phận, trả lời hết mục A và mục B.
- Ngày 2. Chọn đúng một việc từ câu A3. Tiêu chí duy nhất: sai thì sửa được trong ngày.
- Ngày 3. Viết quy trình của việc đó ra giấy như đang bàn giao cho người mới vào. Đầu vào là gì, các bước, đầu ra thế nào là đạt.
- Ngày 4. Ra đề bài cho một con agent làm đúng việc đó. Chưa cần đội ngũ, một con thôi.
- Ngày 5. Chạy song song với người. Người làm mười ca, agent làm mười ca đó, rồi so kết quả.
- Ngày 6. Điền luật phân việc ở mục trên cho đúng việc này. Nó nên chạy tại chỗ hay gọi lên cloud?
- Ngày 7. Mở sổ ra, viết hai con số cạnh nhau: giờ công tiết kiệm được, và tiền đã tiêu. Chỉ hai con số đó mới quyết được có làm tiếp hay không.
Cứ làm đi. Sai thì sửa. Bản đầu chưa xịn nhưng chạy được đã.
Câu hỏi hay gặp
Tôi không biết lập trình thì có làm được không?
Được. Phần khó nhất là huấn luyện mô hình thì các hãng đã làm hộ rồi. Việc còn lại là hiểu nghiệp vụ, chia việc ra thành các bước rõ ràng, và ra đề bài cho agent. Người làm nhân sự, kinh doanh, kế toán làm được, miễn là chịu viết quy trình của mình ra giấy trước đã.
Mô hình nhỏ chạy tại chỗ có thay được mô hình lớn không?
Không thay được, và cũng không nên thay. Mô hình nhỏ hợp với việc gọn và lặp nhiều: phân loại, trích xuất trường, tóm tắt ngắn. Việc cần suy luận nhiều bước thì vẫn phải gọi mô hình lớn. Chia việc cho đúng thì được cả hai, vừa giữ được dữ liệu vừa đỡ tiền.
Con số 40% của Gartner có đáng tin không?
Nó là dự báo công bố ngày 26 tháng 8 năm 2025, không phải số đã đo. Cái đáng tin là hướng: từ dưới 5% lên hai chữ số trong một năm nghĩa là các hãng phần mềm doanh nghiệp đang gắn agent vào sản phẩm của họ. Anh em cứ dùng nó làm chỉ dấu về hướng đi, đừng dùng làm cam kết.
Nên bắt đầu từ mô hình nào?
Đừng bắt đầu từ mô hình. Bắt đầu từ một việc đang tốn người mà sai thì sửa được trong ngày. Chọn việc xong thì mô hình nào cũng thử được, và đổi mô hình chỉ mất vài phút. Còn chọn mô hình trước rồi đi tìm việc cho nó thì làm mãi không xong.
Dữ liệu khách hàng của tôi có bị hãng dùng để huấn luyện không?
Đây là câu phải đọc điều khoản của từng hãng, không có câu trả lời chung. Nhưng có một cách né hẳn: việc nào đụng dữ liệu nhạy cảm thì cho chạy mô hình nhỏ tại chỗ, dữ liệu không rời khỏi máy công ty. Đó chính là giá trị lớn nhất của cặp ONNX cộng mô hình nhỏ.
Đầu tư bây giờ có sợ vài năm nữa gãy không?
Cái gãy được là công cụ, và công cụ thì tháng nào cũng gãy. Cái không gãy là ba thứ: hiểu nghiệp vụ của mình, biết chia việc thành các bước nghiệm thu được, và biết ra đề bài. Ba thứ đó đổi công cụ nào cũng mang theo được. Nên tôi đầu tư vào ba thứ đó, không đầu tư vào một cái tên.
Đúc kết
Tôi tin Agentic AI vì ba chỗ, không phải vì một chỗ. Lõi công nghệ có bài báo gốc và mốc ngày tháng rõ ràng, từ Transformer 2017 tới ONNX về tổ chức trung lập năm 2019 và mô hình nhỏ chứng minh được bằng số năm 2023. Dòng tiền và dòng việc đang đi cùng hướng đó. Và tôi cùng nhiều người khác đã cho nó chạy thật trong dự án, không phải chạy trong slide.
Thứ tôi khuyên anh em học không phải là công cụ. Là nguyên lý. Hiểu nguyên lý thì tuần sau ra thêm hai mươi cái tên mới, anh em vẫn nhìn ra chúng chỉ là một gốc, và không còn hoang mang nữa.
Còn nếu anh em thấy cần đi sát sao hơn thì tôi có mở nhóm coaching để làm cùng. Tuỳ anh em, phong cách nào cũng được.
Nguồn tham khảo
- Vaswani và cộng sự,
Attention Is All You Need, arXiv 1706.03762, nộp 12/06/2017: arxiv.org/abs/1706.03762 - Turing,
Computing Machinery and Intelligence, Mind 49, trang 433 tới 460, năm 1950 - Microsoft và Facebook công bố ONNX, 07/09/2017: azure.microsoft.com
- AWS,
Announcing the Availability of ONNX 1.0, 06/12/2017: aws.amazon.com - LF AI nhận ONNX làm dự án cấp tốt nghiệp, 14/11/2019: lfaidata.foundation
- Jiao và cộng sự,
TinyBERT: Distilling BERT for Natural Language Understanding, arXiv 1909.10351, nộp 23/09/2019: arxiv.org/abs/1909.10351 - Gunasekar và cộng sự,
Textbooks Are All You Need, arXiv 2306.11644, nộp 20/06/2023: arxiv.org/abs/2306.11644 - Microsoft giới thiệu Phi-3, 23/04/2024: azure.microsoft.com
- Microsoft giới thiệu Copilot+ PC, 20/05/2024: blogs.microsoft.com
- Gartner, dự báo 40% ứng dụng doanh nghiệp có agent chuyên trách vào 2026, 26/08/2025: gartner.com
- MarketsandMarkets, quy mô thị trường Agentic AI 2025 tới 2032: marketsandmarkets.com
- Altera,
Project Sid: Many-agent simulations toward AI civilization, arXiv 2411.00114, nộp 31/10/2024: arxiv.org/abs/2411.00114



