A-Jie (nhân vật minh họa, trưởng nhóm kỹ thuật tại một đội nhóm freelance phục vụ khách hàng nước ngoài — không phải khách hàng thực) có thói quen lướt tin công nghệ vào giờ giải lao uống cà phê buổi chiều. Hôm đó anh thấy một đoạn phỏng vấn của CNBC Television với tiêu đề: mô hình mới nhất của OpenAI sử dụng ít hơn 54% token trong “agentic coding” (kiểu quy trình mà AI tự lên kế hoạch các bước, viết code, chạy kiểm thử) so với các mô hình khác. Trên màn hình, Sam Altman nói điều đó với người dẫn chương trình như thể đó là bước tiến hiển nhiên nhất.
Ngón tay A-Jie dừng lại trên màn hình. Anh không chuyển ngay vào kênh của nhóm. Anh nhớ lại ba tháng trước — một nhà cung cấp mô hình khác từng tuyên bố “cải thiện hiệu suất lớn”, và anh đã đổi toàn bộ quy trình agent mà không suy nghĩ nhiều. Hóa đơn cuối tháng không giảm mà còn tăng. Bài học anh rút ra rất đơn giản: cái mà người khác gọi là “tiết kiệm” chưa chắc là khoản tiết kiệm mà bạn thực sự nhận được.
Câu Nói Của CNBC Thực Sự Đang Nói Điều Gì
Theo đoạn phỏng vấn này của CNBC Television, Sam Altman nói với người dẫn chương trình rằng mô hình mới nhất của OpenAI sử dụng ít hơn 54% token so với các mô hình khác trong các tác vụ agentic coding. Nói cách khác, “hiệu quả token” đã tăng 54% — nhưng cụm từ này bản thân nó có thể mang nhiều nghĩa khác nhau.
Có một chi tiết mà ban đầu A-Jie không để ý: “so với cái gì” không nhất quán giữa các cách các hãng tin khác nhau tường thuật cùng một cuộc phỏng vấn. URL trang video của chính CNBC ghi là “than Anthropic's latest” (hiệu quả hơn mô hình mới nhất của Anthropic), trong khi một số trang công nghệ đưa tin rằng con số này đến từ một benchmark tên là ExploitBench — mô hình mới của OpenAI hòa với mô hình đối thủ nhưng chỉ dùng khoảng một phần ba lượng token đầu ra. Nói cách khác, đây nhiều khả năng là một so sánh trực tiếp với đối thủ cạnh tranh, chứ không phải bước tiến giữa các thế hệ mô hình của chính OpenAI. Đây là một trích dẫn trực tiếp từ cuộc phỏng vấn, và bản thân đoạn clip của CNBC không giải thích thêm con số này được tính như thế nào — liệu đó là tổng lượng token giảm để hoàn thành cùng một tác vụ, ít vòng lặp “thử lại—sửa lỗi” hơn, hay so sánh với một mô hình đối thủ cụ thể trên một benchmark cụ thể. Đoạn clip không nói rõ.
A-Jie hiểu rất rõ rằng agentic coding không giống trò chuyện thông thường: mô hình phải tự lên kế hoạch các bước, viết code, chạy kiểm thử, sửa lại khi có lỗi — một tác vụ có thể lặp đi lặp lại hàng chục vòng trước khi hoàn tất. Đó chính là lý do vì sao “tiết kiệm token” lại hấp dẫn đến vậy trong bối cảnh agentic coding — vì mỗi vòng lặp đều tốn tiền, nên về lý thuyết, càng ít vòng lặp thì hóa đơn càng giảm rõ rệt.
Một Con Số Phần Trăm, Nhiều Ý Nghĩa Có Thể
Trước khi chuyển tin này vào kênh nội bộ, A-Jie đã làm một việc: tách “tiết kiệm 54%” ra thành các khả năng cụ thể mà nó có thể mang.
Khả năng đầu tiên là bản thân mô hình “nói ít hơn” — tạo ra ít token hơn để hoàn thành cùng một việc. Khả năng thứ hai là khả năng lập kế hoạch của mô hình tốt hơn, đi ít đường vòng sai hơn — ít vòng lặp “thử, sai, làm lại” hơn nên tổng token giảm. Khả năng thứ ba là benchmark chính thức dùng một tập tác vụ cụ thể, và kết quả có thể hoàn toàn khác trên các dự án thực tế, lộn xộn, đa tệp của nhóm A-Jie. Khả năng thứ tư chỉ nảy ra với A-Jie sau khi anh tìm hiểu thêm: con số 54% này có thể hoàn toàn không phải so với thế hệ trước của chính OpenAI — mà là so với mô hình của một công ty khác. Nếu đây là con số từ việc “đánh bại đối thủ” chứ không phải “bước tiến thế hệ của chính mình”, thì câu trả lời cho câu hỏi “hóa đơn của tôi có thực sự giảm nếu đổi mô hình không” có thể hoàn toàn khác — và thậm chí có thể chẳng liên quan gì đến mô hình mà nhóm A-Jie đang dùng.
Những kiểu “tiết kiệm” khác nhau này sẽ ảnh hưởng đến hóa đơn thực tế của nhóm A-Jie theo những cách hoàn toàn khác nhau, và bản thân đoạn phỏng vấn của CNBC chưa bao giờ trả lời đó là kiểu nào. Đây chính xác là điều bài viết này muốn nhấn mạnh: bất kỳ tuyên bố nào rằng “Mô hình X tiết kiệm N% so với Mô hình Y” — mà không nói rõ cơ sở đo lường (cùng một tập tác vụ, cùng một cách tính phí, benchmark chính thức hay kiểm thử độc lập của bên thứ ba) — chỉ nên được xem là “một hướng đáng chú ý”, chứ không phải “con số bạn chắc chắn sẽ tiết kiệm được”.
Bước Ngoặt: Anh Nhận Ra Mình Không Hề Có “Đường Cơ Sở” Để So Sánh
A-Jie định hỏi thẳng một kỹ sư: “Nếu đổi sang mô hình mới này, chúng ta tiết kiệm được bao nhiêu?” Nhưng chưa kịp hỏi hết câu, anh nhận ra một điều căn bản hơn — nhóm của anh chưa bao giờ thực sự đo xem quy trình agentic coding hiện tại tiêu tốn bao nhiêu token để hoàn thành một tác vụ điển hình. Bài học lần trước không phải là “mô hình mới chưa đủ tốt”, mà là họ không có con số thực tế “trước khi đổi” để so sánh. Họ chỉ có thể đoán xem có tiết kiệm được gì không, và chỉ nhận ra sau khi hóa đơn tăng lên — rằng họ chẳng tiết kiệm được gì cả.
Lúc đó anh mới nhận ra câu hỏi thực sự chưa bao giờ là “con số 54% của Sam Altman có chính xác không”, mà là: nếu bạn còn không có đường cơ sở sử dụng của chính mình, thì bất kỳ tỷ lệ phần trăm nào được công bố chính thức cũng chỉ là một con số không có điểm tham chiếu.
Lần Này Anh Không Vội Đổi — Anh Làm Một Việc Khác Trước
Lần này, A-Jie không lập tức chuyển đổi quy trình agent. Anh yêu cầu nhóm ghi lại lượng token sử dụng của các tác vụ điển hình đã chạy trong hai tuần qua — loại tác vụ chắc chắn liên quan đến việc lập kế hoạch, viết code, kiểm thử lặp đi lặp lại của agentic coding — liệt kê rõ mô hình, loại tác vụ, số vòng hoàn thành và tổng lượng token cho từng tác vụ. Khi đường cơ sở đó đã vững, dù nhà cung cấp nào sau này tuyên bố “hiệu quả hơn X%”, họ cũng có con số thực tế để đối chiếu, thay vì ra quyết định chỉ dựa trên một tiêu đề tin tức.
Đối với các nhóm freelance hoặc phát triển nhỏ ở Đài Loan, đây thực ra là bước đầu tiên cần có trước khi tin vào bất kỳ tuyên bố “cải thiện hiệu quả” nào: đừng vội tin vào con số phần trăm, hãy nhìn thấy mức sử dụng hiện tại của chính mình trước. Chỉ khi đó bạn mới có cơ sở để đánh giá liệu khoản “tiết kiệm” mà người khác nói đến có thực sự là tiết kiệm cho bạn hay không.
Câu Hỏi Thường Gặp
Con số “tiết kiệm 54% token” mà Sam Altman nói có phải là con số được bảo đảm chính thức không? So với cái gì?
Không phải là con số được bảo đảm chính thức. Đây là một phát biểu bằng lời của Sam Altman trong cuộc phỏng vấn với CNBC Television — không phải tài liệu định giá chính thức hay báo cáo benchmark chính thức của OpenAI. Và ngay cả “so với cái gì” cũng không hoàn toàn rõ ràng: nhiều hãng tin đưa tin về cùng một cuộc phỏng vấn với cách diễn giải không nhất quán — có nơi nhấn mạnh so sánh với mô hình cũ của chính OpenAI, trong khi URL trang video của chính CNBC lại ghi là so sánh với mô hình mới nhất của Anthropic (“than Anthropic's latest”), và một số nguồn khác trích dẫn con số từ benchmark ExploitBench, so sánh lượng token sử dụng với mô hình đối thủ khi hiệu năng ngang nhau. Bài viết này luôn gắn nhãn con số đó là “theo CNBC đưa tin”, và cơ sở đo lường chính xác của nó vẫn đang chờ xác minh đối chiếu với thông tin công khai chính thức của OpenAI. Độc giả không nên coi đây trực tiếp là tỷ lệ phần trăm chi phí mà bản thân họ sẽ tiết kiệm được.
“Agentic coding” là gì, và vì sao nó đặc biệt tiêu tốn token nhanh?
Đây là kiểu sử dụng trong đó AI tự lên kế hoạch các bước, viết code, chạy kiểm thử, rồi sửa lại và chạy lại dựa trên kết quả — khác với hỏi đáp đơn thuần, một tác vụ thường cần lặp lại nhiều vòng, mỗi vòng đều tiêu tốn token, nên lượng sử dụng tích lũy thường cao hơn nhiều so với dự đoán.
Khi thấy tin tức về một mô hình “tiết kiệm token hơn”, doanh nghiệp nên đánh giá việc đổi mô hình như thế nào?
Trước tiên hãy xác nhận cơ sở đo lường của tuyên bố đó (benchmark chính thức, kiểm thử độc lập, hay một trích dẫn phỏng vấn như thế này), sau đó chạy thử ở quy mô nhỏ so với đường cơ sở sử dụng thực tế của nhóm mình — thay vì đổi toàn bộ chỉ dựa trên một tiêu đề tin tức. Điều này giúp tránh lặp lại khoảng cách giữa “tuyên bố tiết kiệm” và “hóa đơn thực tế không giảm”.
Nhóm chúng tôi hiện chưa ghi lại đường cơ sở sử dụng token, nên bắt đầu từ đâu?
Có thể bắt đầu từ một vài loại tác vụ chạy thường xuyên nhất. Ghi lại mô hình sử dụng, loại tác vụ, số vòng cần để hoàn thành và tổng lượng token. Sau khi tích lũy được dữ liệu trong hai đến ba tuần, bạn sẽ có con số thực tế để đối chiếu với bất kỳ so sánh mô hình hay tuyên bố nào của nhà cung cấp trong tương lai — thay vì đánh giá theo cảm tính.
Ghi Chú Về Nguồn
Bài viết này được chuyển thể từ video do kênh YouTube CNBC Television đăng tải ngày 9 tháng 7 năm 2026, “OpenAI's newest AI model is 54% more token efficient on agentic coding, Sam Altman tells CNBC”, được tổ chức lại và viết lại chứ không dịch nguyên văn. Theo quá trình xác minh sự thật, cùng cuộc phỏng vấn này cũng được đưa tin bởi bài báo của CNBC.com và một số trang công nghệ khác (như TechStartups), và cách mô tả “54% này so với cái gì” của họ không hoàn toàn nhất quán; bài viết này trình bày trung thực sự không nhất quán đó trong nội dung và phần Câu hỏi thường gặp, thay vì tự áp đặt một kết luận duy nhất cho độc giả. “A-Jie” trong bài viết này là nhân vật minh họa nhằm mục đích giải thích, không phải trường hợp khách hàng thực. Mọi phát biểu trong bài viết này về “tiết kiệm 54% token” đều là trích dẫn những gì Sam Altman nói trong cuộc phỏng vấn với CNBC và các nguồn tin khác, không phải tài liệu định giá hay bảo đảm hiệu năng chính thức của OpenAI, và không cấu thành bất kỳ cam kết tiết kiệm chi phí nào. Độc giả nên đánh giá dựa trên dữ liệu đo lường thực tế của chính mình khi cân nhắc lợi ích tiềm năng.
Hành Động Ngay
Đừng vội tin vào tiêu đề tin tức tiếp theo tuyên bố “hiệu quả hơn X%”. Dùng thử AI Token King miễn phí, chúng tôi sẽ giúp bạn liệt kê lượng token thực tế mà GPT, Claude, Gemini và các mô hình khác sử dụng trong các tác vụ agentic coding để so sánh song song, giúp bạn xây dựng đường cơ sở của riêng mình trước — và đối chiếu bất kỳ tuyên bố hiệu quả nào trong tương lai với con số thực tế, thay vì đổi mô hình theo cảm tính.