Agentic AI là gì? Bản chất nó là một con AI được phép nghĩ trước rồi tự tay làm, thay vì chỉ trả lời rồi để anh em gõ tiếp. Bài này tôi đi lại đúng con đường đã dẫn tới nó, từ năm 2017 tới bây giờ, để anh em thấy nó không phải một cái tên mới người ta đặt cho vui.
Video gốc dài 37 phút. Bài viết này bổ sung thêm ảnh cắt từ chính video, ngày tháng và tên bài báo đọc ra từ khung hình, cùng hai mẫu copy được mà trong video tôi chưa đưa.
Bài này trả lời những câu nào?
- Vì sao AI bùng nổ từ năm 2017 chứ không phải sớm hơn.
- GenAI làm được tới đâu, rồi hụt ở đâu.
- Hai lỗ đầu các hãng đã vá bằng gì.
- Lỗ thứ ba vá bằng gì, và đó chính là chỗ đẻ ra agent.
- Vì sao lại là bây giờ chứ không phải hai năm trước.
- Một đội agent chạy thật trông ra sao.
- Hai mẫu copy được: phiếu kiểm ba lỗ, và đề bài giao cho agent.
Bài này lo phần vì sao. Còn phần làm thế nào, tức là dựng đội agent theo ba bước, tôi có chia sẻ riêng ở bài AI Agent vận hành doanh nghiệp. Ở đây tôi không nhắc lại.
Vì sao AI bùng nổ từ 2017 chứ không phải sớm hơn?
AI bùng nổ từ 2017 vì năm đó kiến trúc Transformer ra đời, cho phép máy đọc cả câu một lúc thay vì đọc tuần tự từng chữ. Nhờ vậy hai thứ vốn chặn đường trước đó được gỡ cùng lúc: máy hiểu được đống dữ liệu lộn xộn ngoài kia mà không cần ai gán nhãn, và việc tính toán chia ra chạy song song được.
Tôi luôn đặt một câu hỏi thế này. Đã có chuyện gì xảy ra trong quá khứ thì mới ra kết quả của hôm nay? Tìm được đúng cái mốc đó là hiểu được cả chuỗi phía sau.
Trước 2017 máy đọc dữ liệu kiểu gì?
Trước 2017, các giải thuật đọc dữ liệu tuần tự, đúng kiểu con người đọc sách từng chữ một. Hai hậu quả đi kèm: chậm, và đọc tới cuối thì quên mất đầu.

Còn một chỗ khó nữa, chỗ này mới đau. Câu chữ của con người rất oái oăm. Tôi ví dụ hai câu chỉ khác đúng một từ cuối:
- Tôi không cất vừa cái laptop vào cặp vì nó quá to.
- Tôi không cất vừa cái laptop vào cặp vì nó quá nhỏ.
Chữ "nó" ở câu trên chỉ cái laptop. Chữ "nó" ở câu dưới lại chỉ cái cặp. Cùng một chữ, hai vật khác nhau, và cái quyết định là toàn bộ ngữ cảnh chứ không phải chữ đứng cạnh. Máy đọc từng từ một thì không tài nào phân biệt được, đúng không ạ?
Transformer đổi được cái gì?
Transformer đổi cách đọc. Thay vì rà từng từ, nó đưa cả câu vào một lúc rồi soi qua nhiều lớp phân tích khác nhau: lớp nhìn cú pháp, lớp nhìn quan hệ nhân quả, lớp nhìn ngữ nghĩa. Soi xong nó biết trong câu đó từ nào quan trọng, từ nào dính với từ nào.
Cách này công bố trong bài báo Attention Is All You Need, nhóm tác giả của Google, đăng lên arXiv tháng 6 năm 2017.

Hệ quả thứ nhất: mọi thứ chúng ta đã viết ra suốt hai chục năm, blog, diễn đàn, email, video, đều thành nguyên liệu học được. Không cần ai ngồi gán nhãn.
Hệ quả thứ hai: đưa cả câu vào một lúc nghĩa là chia ra tính song song được. Mà tính song song thì chạy trên GPU.
Tới năm 2021, nhóm nghiên cứu ở Stanford gọi lớp mô hình dựng trên nền này là mô hình nền tảng, trong bài On the Opportunities and Risks of Foundation Models đăng tháng 8 năm 2021. Nền tảng ở đây nghĩa là một cái nền dùng chung, ghép vào y tế được, ghép vào giáo dục được, làm với chữ được, làm với ảnh và tiếng cũng được.
Vì sao chuyện này làm vốn hóa NVIDIA dựng đứng?
Vì mấu chốt của cuộc đua rút gọn lại còn đúng hai thứ: một kiến trúc biết đọc đống dữ liệu ngoài kia, và phần cứng đủ khỏe để chạy song song. Ai cũng nhìn ra vế thứ hai nằm ở đâu.

Anh em nhìn đoạn trước 2017 thì nó lưu rưu, đi ngang gần hai chục năm. Đoạn sau thì dựng đứng. Cái giải thuật vốn chẳng liên quan gì tới một hãng bán card đồ họa, nhưng nó quyết định luôn số phận của hãng đó.
GenAI làm được tới đâu rồi hụt ở đâu?
GenAI làm được việc sinh ra kết quả từ câu hỏi của mình, nhưng nó hụt ở ba chỗ: nó bịa, nó quên, và nó không tự làm. Ba chỗ này không phải lỗi vặt, nó nằm ngay trong cách hoạt động.
Giai đoạn 2018 tới 2021, các hãng dạy AI đoán từ tiếp theo. GPT-1, GPT-2 rồi GPT-3. Đoán thì tốt dần, nhưng nói chuyện chưa ra giọng người.
Tôi hình dung thế này cho dễ. Anh em gõ vào một câu tiếng Anh quen thuộc rồi bỏ trống mấy chữ cuối, bảo nó điền. Nó điền được ngay. Nhưng nó điền theo xác suất trên đống mẫu đã học, chứ nó không biết đâu là đáp án đúng. Nó chỉ biết chữ nào hay đi sau chữ nào.
Tới năm 2022, ChatGPT mở cho công chúng với mô hình GPT-3.5. Cái mới không nằm ở chỗ đoán giỏi hơn, mà ở hai thứ: một ô chat để ai cũng dùng được, và một cách huấn luyện có người chấm điểm câu trả lời để nó nói cho ra giọng người. Hai tháng sau, Reuters dẫn ước tính của UBS nói ChatGPT đạt khoảng 100 triệu người dùng hàng tháng, bản tin đăng ngày 02/02/2023.
Ba lỗ của GenAI là ba lỗ nào?

Lỗ một, nó bịa. Thuật ngữ là hallucination, tôi gọi là ảo giác. Bản chất nó không hiểu mình. Nó đoán chữ tiếp theo dựa trên tập chữ mình vừa đưa. Không có dữ kiện thì nó vẫn phải đẻ ra một câu trả lời, mà đẻ ra thì có khi là bịa.
Lỗ hai, nó quên. Trí nhớ ngắn hạn, thuật ngữ là context window. Chat một mạch thật dài thì nó quên mất đoạn đầu mình nói gì. Quên rồi thì nó lại trả lời linh tinh, tức là quay về lỗ một.
Lỗ ba, nó không làm. Cái này mới kinh. Hỏi xong, ai làm? Mình làm. Nó nói, mình gõ. Mà đến việc nói nó còn chưa chắc đúng.
Hai lỗ đầu áp vào hệ thống thật là vỡ mồm luôn. Trả lời bừa trong một hệ thống đang chạy tiền thật thì chết.
Hai lỗ đầu các hãng đã vá bằng gì?
Hai lỗ đầu được vá bằng hai hướng khác hẳn nhau: lỗ quên thì các hãng tự nới bên trong mô hình, lỗ bịa thì cắm thêm dữ liệu thật từ bên ngoài vào.
Trí nhớ ngắn hạn nới được tới đâu?
Nới được rất xa, và nới rất nhanh. Chỉ hơn một năm sau khi ChatGPT ra mắt, Google công bố Gemini 1.5 xử lý được hàng triệu token trong một lượt.

Anh em hình dung token là đơn vị đo độ dài của chữ. Một cuốn tiểu thuyết 1382 trang nhét gọn vào một lượt hỏi. Vứt vào một bộ phim gần 45 phút rồi hỏi cảnh này diễn ra ở phút nào, nó trả về đúng mốc. Báo cáo ghi độ chính xác của phép tìm kiếm này trên 99,7%.
Nới xong lỗ hai thì lại lòi ra một chuyện. Mô hình học từ dữ liệu ngoài internet, nó chẳng học dữ liệu công ty tôi bao giờ. Nó không biết chính sách của tôi, không biết đơn hàng của tôi, không biết khách của tôi là ai.
Ảo giác vá bằng RAG như thế nào?
Vá bằng cách cắm dữ liệu thật của mình vào, bắt nó tra trước rồi mới trả lời. Thay vì để nó bịa, mình bảo nó là bây giờ tìm trong kho của tao đã.
Có hai hãng cùng đi đường này, cách nhau đúng ba tháng. Google ra REALM ngày 10/02/2020. Facebook AI Research ra RAG ngày 22/05/2020.

Về mặt tư tưởng thì hai bên giống nhau: lấy dữ liệu bên ngoài về bổ trợ cho luồng trả lời. Tôi ví dụ cho dễ hình dung. Anh em đưa toàn bộ nội dung website của mình vào, thế là hỏi được chính sách công ty, hỏi được thông tin sản phẩm, và nó trả lời bằng chữ của công ty mình chứ không bịa.
Tới đây thì ổn rồi. Nó nhớ dài hơn, nó trả lời sát hơn. Chỉ còn thiếu đúng một bước: nó vẫn không làm.
Lỗ thứ ba, nó không làm, vá bằng gì?
Lỗ thứ ba vá bằng hai việc ghép lại: cho nó quyền nghĩ trước khi trả lời, và cho nó quyền gọi công cụ để tự tay làm. Ghép đúng hai thứ đó thì ra cái mà bây giờ người ta gọi là agent.
Chain of Thought là gì?
Chain of Thought là bắt nó nháp trước rồi mới chốt. Viết tắt là CoT, do nhóm ở Google công bố tháng 1 năm 2022.
Tư duy gốc nằm ở một câu hỏi rất đơn giản. Tại sao mình cứ bắt nó trả lời ngay lập tức? Việc nào cần suy luận nhiều bước thì con người còn phải nháp, huống gì nó. Đừng cắm đầu đẻ ra kết quả luôn, chỉ có chết thôi.
Nhưng nháp không thôi thì vẫn chưa đủ.
Vì sao nghĩ không thôi vẫn sai, làm không thôi cũng sai?
Vì nghĩ mà không tra thì nghĩ trên dữ kiện tưởng tượng, còn tra mà không nghĩ thì tra loạn xạ không biết dừng ở đâu. Chỗ này có một bài báo chứng minh bằng thí nghiệm, tên là ReAct, ghép từ Reason và Act, đăng lên arXiv ngày 06/10/2022 và cập nhật ngày 10/03/2023.

Anh em đọc cột bên phải sẽ thấy nhịp làm việc của nó: Thought 1 nghĩ, Act 1 đi tìm, Obs 1 đọc kết quả, thấy chưa đủ thì Thought 2 nghĩ tiếp, Act 2 tìm tiếp. Bốn vòng thì ra đáp án đúng.
Nghĩ rồi làm, làm xong nhìn lại, chưa đủ thì nghĩ tiếp. Đó là toàn bộ cơ chế. Nghe đơn giản, nhưng nó là cái bản lề.
Vậy một agent gồm những gì?
Một agent gồm ba phần: một cái đầu để suy luận, một bộ công cụ để chạm được vào thế giới thật, và một vòng lặp nghĩ rồi làm rồi nhìn lại.
Cái đầu chính là mô hình ngôn ngữ, cái đã học loạn xà ngầu ngoài kia. Bộ công cụ là thứ mình cắm thêm vào: cho nó chọc vào database để tra đơn hàng, cho nó gọi API của phần mềm khác, cho nó tìm trên web. Vòng lặp là cái nhịp ReAct ở trên.
Bản chất nó là chuyện quyền hạn, không phải chuyện thông minh. Anh em thuê một ông tư vấn rất giỏi nhưng bắt ông ấy ngồi yên, chỉ được nói, không được đụng vào máy. Ông ấy giỏi mấy thì mình vẫn là người gõ. Đưa chìa khóa cho ông ấy thì câu chuyện khác hẳn. Chuyện đưa chìa khóa tới đâu và giữ lại quyền gì, tôi có phân tích trong bài AI Agent kiểm tra hóa đơn đầu vào, ở đó là một con agent làm việc thật trên chứng từ.
Vì sao lại là bây giờ chứ không phải hai năm trước?
Vì hai điều kiện vừa đủ cùng lúc: người ta đã chứng minh được nhiều agent tự phối hợp với nhau mà không cần kịch bản, và các mô hình mới đủ sức bám một việc dài hàng tiếng thay vì vài phút.
25 nhân vật ảo trong làng Smallville chứng minh điều gì?
Chứng minh rằng nhiều con agent thả vào cùng một chỗ thì chúng tự trao đổi, tự nhớ, tự sinh ra kế hoạch, mà không ai viết sẵn kịch bản cho chúng.
Đây là dự án Generative Agents của nhóm Stanford, đăng lên arXiv ngày 07/04/2023. Họ dựng một ngôi làng ảo tên Smallville với 25 nhân vật, mỗi nhân vật gắn một mô hình ngôn ngữ và một nhân thân riêng. Có người làm thợ cắt tóc, có người là bố của người kia.

Kết quả là chúng sống như một xã hội thu nhỏ. Sáng dậy, đi làm, gặp nhau thì hỏi thăm, nhớ được hôm nay đã gặp ai. Một nhân vật định tổ chức sinh nhật thì nó tự lên danh sách mời, rồi đi mời thật.
Một con agent làm được việc dài bao lâu?
Trước đây là vài phút tới vài chục phút. Bây giờ đã tính bằng giờ. Nhóm METR đo thứ này bằng một cách rất gọn: lấy các việc kỹ thuật phần mềm, đo xem người thật làm hết bao lâu, rồi xem model làm xong được việc dài tới đâu với tỷ lệ thành công 50%.

| Model | Việc dài nhất làm xong với tỷ lệ 50% | Mốc ra mắt trên đồ thị |
|---|---|---|
| GPT-2 | Gần bằng 0 | 2019 |
| GPT-3 | Vài chục giây | 2020 |
| GPT-3.5 | Dưới 10 phút | 2022 |
| GPT-4 | Khoảng vài chục phút | 2023 |
| GPT-5 | 2 giờ 18 phút | Tháng 8/2025 |
| Claude Opus 4.5 | Gần 5 tiếng | Cuối 2025 |
Nguồn: bài đo của METR đăng ngày 19/03/2025 và cập nhật sau đó. Nhóm này ghi thêm một con số đáng nhớ hơn cả bảng trên: độ dài việc mà model làm xong được gấp đôi sau khoảng 7 tháng, và đã giữ nhịp đó suốt 6 năm.
Anh em thấy ý nghĩa của con số đó chưa ạ? Một việc mà hôm nay agent làm chưa nổi, bảy tháng nữa nó làm được một nửa số lần. Nên cái đáng đầu tư không phải là con model, mà là cách mình mô tả công việc cho nó.
GenAI và Agentic AI khác nhau ở chỗ nào?
Khác ở quyền hạn và ở nhịp làm việc, không khác ở độ thông minh của cái đầu. Cùng một mô hình, bỏ vào hai khung khác nhau thì ra hai thứ khác nhau.
| Điểm so | GenAI | Agentic AI |
|---|---|---|
| Mình đưa cho nó cái gì | Một câu hỏi | Một đề bài kèm tiêu chí nghiệm thu |
| Nó trả về cái gì | Một câu trả lời | Một việc đã làm xong, kèm bằng chứng |
| Nó có được nghĩ trước không | Không, trả lời ngay | Có, nghĩ rồi làm rồi nhìn lại |
| Nó chạm được vào đâu | Chỉ chữ trong ô chat | Database, API, web, file |
| Ai gõ tay ở bước cuối | Mình | Nó, mình chỉ duyệt |
| Sai thì phát hiện lúc nào | Khi mình đọc lại | Ngay trong vòng lặp, nếu có tiêu chí |
| Nhiều con cùng làm được không | Không, mỗi lượt một cuộc chat | Được, chia vai rồi bàn giao cho nhau |
Nhìn dòng cuối là thấy chỗ chuyển. Một con làm hết mọi việc thì nhanh hết chỗ nhớ. Chia vai ra thì mỗi con gọn một việc. Chuyện điều phối nhiều con cùng lúc thì tôi có chia sẻ ở bài Dynamic workflow Opus 4.8, ở đó là gần trăm con chạy song song, khác hẳn quy mô của bài này.
Một đội agent chạy thật trông ra sao?
Trông giống một nhóm chat có mấy nhân sự, mỗi người một việc, và một người trưởng nhóm nhận đề bài rồi chia ra. Đây là thứ tôi đang chạy trong công việc của mình.
Nói qua để anh em biết tôi đứng ở đâu mà nói. Tôi làm công nghệ gần 15 năm, chủ yếu là các dự án về database và tối ưu cho doanh nghiệp lớn, ngân hàng và các tổ chức. Việc của tôi là ngồi phân tích rất nhiều dữ liệu để ra quyết định tối ưu. Trước đây việc kiểm tra này cần một bạn kỹ sư 3 tới 5 năm kinh nghiệm ngồi làm. Bây giờ khoảng 90% phần kiểm tra đó tôi giao cho một đội agent.

Mô hình là một ông trưởng nhóm cộng một nhóm chuyên môn. Tôi chỉ giao việc cho ông trưởng nhóm. Ông ấy đọc ý định của tôi rồi gọi đúng con cần gọi. Con chuyên hiệu năng thì đi tra hiệu năng. Con chuyên câu lệnh thì đi soi câu lệnh. Con chuyên vẽ thì vẽ đồ thị. Xong việc, ông trưởng nhóm gom lại trả cho tôi.
Tôi không định nghĩa cứng là phải kiểm cái A rồi kiểm cái B. Tôi đưa nguồn tri thức của mình vào, dạy nó bằng chính các mẫu tôi đã làm, rồi để chúng nó tự bàn với nhau.
Hai chi tiết trong ảnh đáng để anh em copy về cách làm:
- Nó đọc ý định trước, rồi mới gọi con phù hợp. Đây chính là bước "nghĩ" của ReAct, đặt ở tầng điều phối.
- Chưa rõ thì nó hỏi lại. Tôi gõ ngày kết thúc bị thừa một chữ số. Nó không tự sửa, không tự đoán, nó dừng lại hỏi. Vì nó đang làm trên hệ thống thật, cái gì chưa rõ mà nguy hiểm thì phải có người xác nhận.
Cái thứ hai quan trọng hơn cái thứ nhất nhiều. Một con agent biết dừng lại hỏi thì mới dám cho nó chạm vào hệ thống thật.
Việc của anh em đang tắc ở lỗ nào?
Trước khi quyết định làm agent, tôi khuyên anh em điền cái phiếu này đã. Mất 10 phút, và nó chặn được cái sai hay gặp nhất: làm agent cho một việc vốn chỉ cần sửa cách hỏi.
PHIẾU KIỂM BA LỖ
Điền một phiếu cho một việc. Đừng điền chung nhiều việc.
VIỆC ĐANG LÀM: ..............................................
HIỆN NAY AI LÀM: [ ] người [ ] AI chat [ ] phần mềm sẵn có
LỖ 1, NÓ BỊA
Câu trả lời có cần dữ liệu riêng của công ty không? [ ] có [ ] không
Sai một con số thì hậu quả là gì: ........................
Đánh dấu "có" nghĩa là phải nối vào nguồn dữ liệu thật.
Chưa nối nguồn mà đã hỏi thì kiểu gì cũng có ngày nó bịa.
LỖ 2, NÓ QUÊN
Một lần làm hết bao nhiêu bước: ....... bước
Bước sau có cần kết quả của bước trước không? [ ] có [ ] không
Đánh dấu "có" nghĩa là phải bắt nó ghi lại từng bước ra file.
Đừng tin vào trí nhớ trong một đoạn chat.
LỖ 3, NÓ KHÔNG LÀM
Sau khi có câu trả lời, ai là người gõ tay: ..............
Mỗi lần gõ tay hết bao nhiêu phút: ....... phút
Một tháng lặp lại bao nhiêu lần: ....... lần
Số phút nhân số lần = ....... phút một tháng.
Đây là con số duy nhất trong phiếu này nói cho anh em biết
có đáng làm agent hay không.
CHỐT
Đánh dấu được lỗ 3, và số phút một tháng trên 600
=> làm agent, bắt đầu từ việc này.
Chỉ đánh dấu lỗ 1 hoặc lỗ 2
=> chưa cần agent. Nối nguồn dữ liệu và sửa cách hỏi trước.
Không đánh dấu được ô nào
=> việc này đang ổn. Đi tìm việc khác.Con số 600 phút một tháng là ngưỡng tôi tự đặt, tương đương 10 tiếng. Dưới mức đó thì công dựng agent và công nuôi nó thường lớn hơn công tiết kiệm được. Anh em cứ chỉnh lại theo giá công của mình.
Đề bài giao cho agent nên viết thế nào?
Viết như một bản mô tả công việc, không viết như một câu hỏi. Có bốn phần không được thiếu: việc, quyền, hàng rào, và tiêu chí nghiệm thu.
ĐỀ BÀI GIAO CHO MỘT AGENT
VIỆC
<một câu, động từ đứng đầu, không quá 20 chữ>
NGUỒN DỮ LIỆU ĐƯỢC ĐỌC
1. <tên nguồn> quyền: chỉ đọc
2. <tên nguồn> quyền: chỉ đọc
CÔNG CỤ ĐƯỢC GỌI
1. <tên công cụ> tối đa <N> lần mỗi lượt
2. <tên công cụ> tối đa <N> lần mỗi lượt
VÒNG LÀM VIỆC, lặp tối đa <N> vòng
[1] Nghĩ viết ra một câu: vì sao chọn bước tiếp theo này
[2] Làm gọi đúng một công cụ, không gọi hai cái một lúc
[3] Nhìn đọc kết quả trả về, chép lại nguyên văn phần dùng tới
[4] Chưa đủ dữ kiện thì quay lại [1]. Đủ rồi thì sang ĐẦU RA.
HÀNG RÀO, không được vượt
1. Tham số nào chưa rõ thì HỎI LẠI. Cấm tự đoán, cấm tự sửa.
2. Cấm mọi lệnh ghi, xóa, sửa. Chỉ được đọc.
3. Hết <N> vòng mà chưa xong thì dừng lại và báo. Cấm trả lời đại.
4. Mỗi con số trong báo cáo phải chỉ ra được nó lấy từ bước [3] nào.
ĐẦU RA
1. Kết luận, tối đa 5 dòng
2. Bảng số liệu, có một cột ghi nguồn của từng dòng
3. Việc đề xuất làm tiếp, xếp theo mức nặng
4. Một mục "chỗ tôi chưa chắc", bắt buộc có, không được để trống
NGHIỆM THU
Đạt khi: <tiêu chí đo được, có con số>
Hỏng khi: có một con số trong báo cáo mà không dẫn được nguồnBa dòng đáng chú ý nhất trong mẫu trên, và cũng là ba dòng anh em hay bỏ:
- Hàng rào số 1. Không có dòng này thì nó đoán. Nó luôn đoán, vì bản chất nó là máy đoán chữ.
- Hàng rào số 4. Đây là cách rẻ nhất để bắt ảo giác. Con số nào mà không dẫn được nguồn thì con số đó là bịa.
- Mục "chỗ tôi chưa chắc". Bắt buộc phải có, và bắt buộc không được để trống. Nó ép con agent tự khai ra chỗ yếu thay vì gói tất cả vào một câu trả lời trông rất chắc.
Cả chặng đường gói lại trong một bảng
| Mốc | Thứ ra đời | Nó vá lỗ nào | Nguồn |
|---|---|---|---|
| 06/2017 | Kiến trúc Transformer | Chưa vá lỗ nào, nó mở đường | Bài báo Attention Is All You Need, arXiv 1706.03762 |
| 02/2020 | REALM, của Google | Lỗ 1, nó bịa | arXiv 2002.08909 |
| 05/2020 | RAG, của Facebook AI Research | Lỗ 1, nó bịa | arXiv 2005.11401 |
| 08/2021 | Tên gọi mô hình nền tảng | Chưa vá, nó đặt tên cho hiện tượng | Bài của nhóm Stanford, arXiv 2108.07258 |
| 01/2022 | Chain of Thought | Nửa đầu của lỗ 3, cho nó nghĩ | arXiv 2201.11903 |
| 10/2022 | ReAct | Nửa sau của lỗ 3, nghĩ ghép với làm | arXiv 2210.03629 |
| 11/2022 | ChatGPT với GPT-3.5 | Không vá gì, nó đưa AI ra đại chúng | Bản tin Reuters ngày 02/02/2023 |
| 04/2023 | Generative Agents, làng Smallville | Chứng minh nhiều agent tự phối hợp được | arXiv 2304.03442 |
| 02/2024 | Gemini 1.5 với cửa sổ triệu token | Lỗ 2, nó quên | Báo cáo Gemini 1.5 của Google |
| 03/2025 | Phép đo độ dài việc của METR | Cho biết vì sao lại là bây giờ | metr.org |
Nhìn cả bảng thì thấy một điều thú vị. Lỗ 3 được vá trước lỗ 2. ReAct có từ cuối 2022, còn cửa sổ triệu token tới đầu 2024 mới có. Nghĩa là ý tưởng agent không mới, chỉ là hồi đó chưa có đủ trí nhớ để nó chạy được việc dài.
Cách hiểu này có giới hạn gì?
Có, và tôi nói thẳng bốn chỗ.
Một, ba lỗ không mất hẳn, chỉ nhẹ đi. RAG làm giảm ảo giác chứ không xóa được ảo giác. Cửa sổ dài hơn không có nghĩa là nó nhớ đúng mọi thứ trong đó. Con số 99,7% của Google là đo trên một phép tìm kiếm cụ thể, không phải cam kết cho mọi câu hỏi. Anh em thiết kế hệ thống thật thì phải giả định là nó vẫn sai, rồi dựng chỗ chặn.
Hai, đo bằng việc kỹ thuật phần mềm không suy ra được mọi nghề. Bảng của METR đo trên việc lập trình. Việc kế toán, việc bán hàng, việc chăm khách có cấu trúc khác hẳn. Lấy con số 5 tiếng đó áp thẳng sang nghề của mình là suy diễn, không phải dữ liệu.
Ba, cho agent quyền hành động là mở ra một loại hỏng mới. Con GenAI trả lời sai thì mình đọc rồi bỏ. Con agent làm sai thì nó đã làm rồi. Nó chạy một vòng lặp hỏng, gọi công cụ mười nghìn lần, hoặc ghi nhầm vào hệ thống thật. Đây là lý do trong mẫu đề bài ở trên tôi để hàng rào "chỉ được đọc" làm mặc định. Muốn cho quyền ghi thì mở từng cái một, và mở sau khi đã chạy song song đủ lâu.
Bốn, phần đắt nhất không phải công nghệ, là mô tả nghiệp vụ. Cái đội agent tôi đưa ảnh ở trên chạy được không phải vì tôi biết dựng agent. Nó chạy được vì tôi đã làm việc kiểm tra database đó hàng nghìn lần và mô tả lại được cho nó. Ai chưa mô tả nổi việc của mình thành từng bước thì có công cụ xịn tới đâu cũng tắc ở đúng chỗ đó.
Còn một giới hạn nữa thuộc về tiền, tôi không nhắc ở đây vì nó đủ dài để thành một bài riêng. Anh em đọc Tối ưu chi phí token khi cho AI vận hành kênh YouTube. Việc dài hàng tiếng nghĩa là hóa đơn dài hàng tiếng.
Bảy ngày tới anh em làm được gì?
Không cần dựng hệ thống gì cả. Bảy ngày này chỉ để tìm đúng một việc và mô tả nó cho tử tế.
- Ngày 1. Liệt kê 10 việc anh em đang làm bằng tay mỗi tuần. Ghi thêm số phút mỗi lần và số lần mỗi tháng.
- Ngày 2. Điền phiếu kiểm ba lỗ ở trên cho 3 việc tốn nhiều phút nhất.
- Ngày 3. Chọn đúng một việc có đánh dấu lỗ 3. Đừng chọn hai.
- Ngày 4. Viết việc đó ra thành các bước, đánh số. Chưa đụng tới AI. Bước nào mình cũng chưa nói rõ được thì đó là bước sẽ hỏng đầu tiên.
- Ngày 5. Điền mẫu đề bài ở trên cho việc đó. Phần khó nhất là mục nghiệm thu, cứ ngồi lâu ở đó.
- Ngày 6. Chạy thử bằng tay: mình đóng vai agent, làm đúng theo đề bài mình vừa viết. Chỗ nào mình phải tự suy đoán thì chỗ đó đề bài còn thiếu.
- Ngày 7. Sửa lại đề bài theo những chỗ vừa vấp. Xong. Tuần sau mới tính chuyện dựng.
Cứ làm đi, sai lại sửa. Bản đầu bao giờ cũng còn nhiều chỗ chưa ổn, chạy được đã.
Câu hỏi hay gặp
Agentic AI khác Generative AI ở chỗ nào?
Generative AI sinh ra nội dung khi mình hỏi. Agentic AI nhận một đề bài, tự nghĩ ra các bước, tự gọi công cụ để làm, rồi trả về việc đã xong. Cùng một mô hình ngôn ngữ ở bên trong, khác nhau ở quyền dùng công cụ và ở vòng lặp nghĩ rồi làm rồi nhìn lại.
Agent có cần RAG không, hay RAG là chuyện cũ rồi?
Vẫn cần, và cần hơn trước. RAG vá lỗ bịa, agent vá lỗ không làm. Hai lỗ khác nhau nên hai thứ không thay thế nhau. Một con agent chạm được vào hệ thống thật mà vẫn bịa số thì nguy hiểm hơn hẳn một con chat bịa số, vì nó làm luôn theo con số nó vừa bịa.
Cửa sổ ngữ cảnh triệu token rồi thì cần gì chia nhiều agent?
Nhét được không có nghĩa là dùng tốt. Chat càng dài thì càng nhiều thứ nhiễu chen vào giữa, và mỗi lượt gọi lại phải trả tiền cho toàn bộ đống đó. Chia vai ra thì mỗi con chỉ đọc đúng phần của nó, gọn hơn và rẻ hơn.
Không biết code thì có làm được không?
Được, nhưng chỗ khó không nằm ở code. Chỗ khó nằm ở việc mô tả công việc của mình thành từng bước có tiêu chí nghiệm thu. Ai làm nghề lâu năm thì phần này lại mạnh hơn dân kỹ thuật thuần.
Nên bắt đầu bằng một agent hay một đội?
Một con, cho một việc. Dựng đội ngay từ đầu thì lúc hỏng không biết hỏng ở con nào. Chạy được một con rồi, thấy nó tắc vì phải ôm quá nhiều việc, lúc đó mới tách ra.
Model đổi liên tục thì học bây giờ có phí không?
Không. Thứ nhanh hỏng là tên model và cách bấm nút. Thứ giữ được là ba lỗ và cách vá từng lỗ, cùng với bản mô tả nghiệp vụ của chính anh em. Đổi model thì mô tả đó vẫn dùng lại được. Model nào đang tới đâu thì tôi có chia sẻ ở bài Claude Fable 5.
Đúc kết
Agentic AI không phải một cái tên mới. Nó là chỗ kết của ba lần vá liên tiếp: vá chuyện nó bịa bằng dữ liệu thật, vá chuyện nó quên bằng cửa sổ dài hơn, vá chuyện nó không làm bằng vòng nghĩ rồi làm.
Hiểu được ba lỗ đó thì anh em nhìn một việc bất kỳ là biết ngay nó tắc ở đâu, và biết mình đang cần cái gì. Đó mới là thứ dùng được lâu.
Còn việc bắt đầu thì nhỏ thôi. Điền một cái phiếu, chọn một việc, viết một đề bài. Cứ làm đi. Tùy anh em, làm theo cách nào cũng được.
Anh em nào làm việc với database và muốn hiểu phần nền phía dưới cái demo ở trên, tôi có hai bài để sẵn: Tối ưu SQL nên bắt đầu từ đâu và Vì sao có index mà SQL vẫn chậm.
Nguồn tham khảo
- Vaswani và cộng sự,
Attention Is All You Need, arXiv 1706.03762, tháng 6/2017: arxiv.org/abs/1706.03762 - Guu và cộng sự,
REALM: Retrieval-Augmented Language Model Pre-Training, arXiv 2002.08909, ngày 10/02/2020: arxiv.org/abs/2002.08909 - Lewis và cộng sự,
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv 2005.11401, ngày 22/05/2020: arxiv.org/abs/2005.11401 - Bommasani và cộng sự,
On the Opportunities and Risks of Foundation Models, arXiv 2108.07258, tháng 8/2021: arxiv.org/abs/2108.07258 - Wei và cộng sự,
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, arXiv 2201.11903, tháng 1/2022: arxiv.org/abs/2201.11903 - Yao và cộng sự,
ReAct: Synergizing Reasoning and Acting in Language Models, arXiv 2210.03629, ngày 06/10/2022: arxiv.org/abs/2210.03629 - Park và cộng sự,
Generative Agents: Interactive Simulacra of Human Behavior, arXiv 2304.03442, ngày 07/04/2023: arxiv.org/abs/2304.03442 - METR,
Measuring AI Ability to Complete Long Tasks, ngày 19/03/2025: metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks - Reuters, bản tin về tốc độ tăng người dùng của ChatGPT, ngày 02/02/2023: reuters.com



