麥策知識學院 Mai Strategy Knowledge Academy
Góc nhìn ngành7 phút đọc

Tại sao trợ lý báo giá AI của bạn càng dùng càng lệch? Mấu chốt nằm ở phản hồi

Nhiều nhà in kết nối AI chăm sóc khách hàng và báo giá tự động rồi bỏ mặc cho chạy, nửa năm sau mới nhận ra nó chẳng thông minh hơn mà chỉ giỏi lặp lại cùng một lỗi. Một bài nghiên cứu về Effective Feedback Compute đã chỉ rõ nguyên nhân, đồng thời mở ra giải pháp giúp các xưởng in luyện AI ngày càng chuẩn xác

麥策知識學院Người sáng lập học viện Hung Tsung-Yuan

FacebookLINEThreadsLinkedInXPinterestEmail
Tại sao trợ lý báo giá AI của bạn càng dùng càng lệch? Mấu chốt nằm ở phản hồi
ChatGPTPerplexityClaude

Tại sao công cụ AI dùng nửa năm mà hiệu quả lại chững lại?

Một hai tháng nay đi gặp khách hàng, tôi được mấy chủ xưởng in vừa và nhỏ hỏi cùng một câu: Trợ lý báo giá AI hay chatbot tự động trả lời LINE đưa vào từ năm ngoái, lúc mới dùng thử thì rất ấn tượng, sao càng dùng lại càng thấy giậm chân tại chỗ, thậm chí thỉnh thoảng còn sai lệch ngớ ngẩn hơn?

Hiện tượng này được phân tích rất sâu trong bài nghiên cứu gần đây có tiêu đề 《Scaling Laws for Agent Harnesses via Effective Feedback Compute》 của nhóm tác giả Xuanliang Zhang và cộng sự, bản tiếng Trung tôi đọc là bài tổng hợp từ Wisely Chen

Nó định lượng trực tiếp một thực tế ngược với suy nghĩ thông thường: Bạn cứ tưởng 'cho thêm sức mạnh tính toán, gắn thêm công cụ, cho chạy thêm vài lượt' thì AI sẽ giỏi lên, nhưng thực ra không phải

Nghiên cứu dùng raw tokens và tool calls để giải thích tỷ lệ thành công của tác vụ, hệ số tương quan R² chỉ đạt 0.33 đến 0.42

Dịch ra ngôn ngữ thực tế tại xưởng in: Bạn mở lịch sử trò chuyện của AI CSKH đến mức chi tiết nhất, tăng số lần tính lại báo giá từ một thành ba, rồi nối thêm hai cơ sở dữ liệu nữa vào... Những hành động dạng 'tôi đã làm rất nhiều' đó chỉ giải thích được khoảng 30–40% kết quả, 60% còn lại chẳng liên quan gì đến việc bạn tiêu tốn bao nhiêu tài nguyên

Tôi đối chiếu điều này với việc dạy thợ học việc. Một người thợ cả cho thợ phụ in 200 tờ bài tập mỗi ngày, nhưng in xong không bao giờ nhặt lỗi, không bảo chỗ nào lệch màu chồ tay, thì người thợ phụ đó in một vạn tờ cũng vẫn dậm chân tại chỗ. Họ không giỏi hơn, họ chỉ mệt hơn mà thôi

Tại sao công cụ AI dùng nửa năm mà hiệu quả lại chững lại?|Tại sao trợ lý báo giá AI của bạn càng dùng càng lệch? Mấu chốt nằm ở phản hồi minh hoạ cho phần này

EFC rốt cuộc là gì? Liên quan gì đến việc 'dạy thợ'?

Khái niệm cốt lõi của bài nghiên cứu gọi là Effective Feedback Compute, viết tắt là EFC. Nghĩa là: Không phải mọi tương tác đều có giá trị, chỉ có 'phản hồi hiệu quả' mới giúp AI thực sự tiến bộ

Nó định nghĩa phản hồi hiệu quả phải thỏa mãn đồng thời bốn điều kiện, tôi dùng kịch bản ngành in để đối chiếu từng cái:

・Informative (Phải có nội dung thực chất): Phản hồi mang lại thông tin mới. Khách chê báo giá đắt nhưng không nói đắt ở tiền giấy hay khâu gia công sau in, đó là loại phản hồi vô giá trị

・Valid (Phải chính xác): Phản hồi đáng tin cậy, không phải nhiễu hay đoán mò. Nhân viên kinh doanh ghi đại 'khách này không quan tâm giá', rốt cuộc ghi ngược hoàn toàn, nạp loại phản hồi sai này vào còn tệ hơn không nạp

・Non-redundant (Không trùng lặp): Đừng nhắc lại điều đã biết. Hệ thống ghi lại 100 lần 'khách muốn giấy Couché 100 gsm' thực ra chẳng tạo thêm thông tin mới nào

・Retained (Phải được ứng dụng): Điều này là gắt nhất. Phản hồi có thực sự đi vào quyết định lần sau không? Nhân viên kinh doanh đưa ra nhận định đúng trong nhóm trò chuyện nhưng không ai tổng hợp vào logic báo giá, thì coi như chưa từng nói

Con số mấu chốt nằm ở đây: Bài nghiên cứu làm một thực nghiệm đối chứng, trong điều kiện ngân sách tài nguyên tính toán hoàn toàn giữ nguyên, chỉ tập trung nâng cao chất lượng phản hồi, tỷ lệ thành công của tác vụ đã nhảy từ 27% lên 90%

Chi phí không tốn thêm một xu, chỉ bằng cách làm cho phản hồi có hiệu lực, tỷ lệ thành công đã tăng hơn gấp ba lần. Khi tính toán lại, năng lực giải thích R² từ 0.33 vọt một phát lên 0.94 đến 0.99

Cách nói này thực ra chính là 'luyện tập cố ý' (deliberate practice) mà khoa học học tập đã đề cập nhiều thập kỷ qua: Phản hồi phải cụ thể, phải đúng, và phải đi vào lần luyện tập tiếp theo. Luyện mà không kiểm điểm, kiểm điểm mà không sửa, coi như chưa luyện. AI cũng giống như con người, rất ăn khớp với nguyên lý này

EFC rốt cuộc là gì? Liên quan gì đến việc 'dạy thợ'?|Tại sao trợ lý báo giá AI của bạn càng dùng càng lệch? Mấu chốt nằm ở phản hồi minh hoạ cho phần này

Báo giá AI, theo sát đơn hàng, CSKH của xưởng in: Thiết kế vòng lặp phản hồi như thế nào?

Hiểu được nguyên lý rồi, vấn đề trở thành: Trong quy trình in ấn, làm sao nối vòng lặp này lại một cách thực tế. Tôi đưa ra vài cách có thể bắt tay vào làm ngay trong tuần này

Thứ nhất, dựng trước một bảng đối chiếu 'đáp án chuẩn'. Tìm ra 20–30 mặt hàng hay báo giá nhất trong nửa năm qua như catalogue đóng ghim giữa, sách đóng gáy keo nhiệt, decal/tem dán, hộp giấy... rồi tổng hợp mã vật tư chuẩn, loại giấy, khâu gia công sau in và khoảng giá hợp lý thành một tài liệu dữ liệu thực tế (ground truth). Báo giá do AI đưa ra không khớp với bảng này thì bạn mới có 'tín hiệu đúng/sai' để hiệu chỉnh, bằng không nó báo lệch bạn cũng chẳng hề hay biết

Thứ hai, mỗi lần AI phạm lỗi đều phải lưu lại nhật ký, và phải ghi tới nguyên nhân gốc rễ. Không phải ghi chung chung 'báo sai rồi', mà phải ghi rõ 'nó tính nhầm giấy bìa 250 gsm thành 200 gsm', 'quên tính phí phủ bóng/tráng phủ'. Điều này tương ứng với yêu cầu Informative, phải cụ thể đến mức có thể đưa ra hành động

Thứ ba, định kỳ nạp lại các trường hợp thất bại. Mỗi tháng dành ra một giờ, lấy các ca AI báo lệch hoặc CSKH trả lời sai trong tháng để điều chỉnh câu lệnh (prompt) hoặc quy tắc của nó. Bước này mới chính là Retained, vòng lặp phản hồi có 'khép kín' hay không là nhìn vào đây. Nhật ký trò chuyện trôi qua không tính là phản hồi, chỉ khi được tổng hợp và đưa vào cải tiến quy tắc thì mới thực sự có giá trị

Thứ tư, mỗi khi thêm một tính năng, hãy cho qua điều kiện thứ tư của EFC trước. Muốn nối thêm một công cụ, mở thêm một luồng trả lời tự động, hãy tự hỏi: Liệu nó có thực sự làm thay đổi phán đoán lần tới của AI không? Nếu không, thêm vào chỉ thuần túy là đốt tiền và tăng gánh nặng bảo trì

Đối với phía thiết kế cũng tương tự. Nếu bạn dùng AI hỗ trợ tạo hình, sửa bản thảo, viết đề xuất (proposal), mỗi ý kiến sửa đổi của khách hàng chính là tín hiệu phản hồi của bạn. Hãy ghi lại cụ thể 'vì sao khách trả lại bản thiết kế này', lần sau đề xuất tránh ngay điều đó thì tỷ lệ trúng đích mới tăng lên; nếu chỉ ném file bị trả về một góc mà không tổng hợp nguyên nhân, sửa 100 bản thì vẫn dậm chân tại chỗ

Báo giá AI, theo sát đơn hàng, CSKH của xưởng in: Thiết kế vòng lặp phản hồi như thế nào?|Tại sao trợ lý báo giá AI của bạn càng dùng càng lệch? Mấu chốt nằm ở phản hồi minh hoạ cho phần này

Muốn triển khai tính năng bộ nhớ AI, phải lắp một cánh cổng kiểm soát trước

Một số nhà cung cấp quảng cáo tính năng bộ nhớ kiểu 'AI sẽ ghi nhớ thói quen của công ty bạn', nghe rất êm tai. Nhưng bài nghiên cứu có một cảnh báo mà tôi rất đồng tình

Kiến trúc bộ nhớ giải quyết điều kiện thứ tư khó nhất trong bốn điều kiện là 'retain', nhưng nó 'chỉ' giải quyết việc nhớ được, chứ không giúp bạn lọc xem ba điều kiện đầu có đúng hay không, có trùng lặp hay không

Nói cách khác, nếu bạn nhồi nhét cả những phản hồi sai lệch, trùng lặp và đầy nhiễu vào, những ký ức sai lầm này sẽ bị gọi ra sử dụng lặp đi lặp lại, mức độ độc hại còn lớn hơn là không có bộ nhớ. Chẳng khác nào phóng đại hiện tượng 'càng sai càng tệ' từ từng lần lẻ tẻ thành vĩnh viễn

Vì vậy, khi triển khai bất kỳ tính năng bộ nhớ nào, nhất định phải đi kèm một 'cánh cổng ghi dữ liệu': Thông tin này có đủ nội dung thực chất, đủ tin cậy, không trùng lặp hay không? Đạt chuẩn rồi mới lưu. Đối với xưởng in, điều đó có nghĩa là đừng để sở thích khách hàng do kinh doanh tiện tay ghi chú mà chưa qua kiểm chứng tự động trở thành 'sự thật' của hệ thống

Cũng phải nói một cách thành thật, bài nghiên cứu này không phải linh đơn diệu dược. Ngưỡng 0.94 đến 0.99 của hạn mức trên sử dụng thông tin lý tưởng mà chỉ sau khi sự việc xảy ra mới biết đáp án (nghiên cứu gọi là Oracle-EFC), hệ thống thực tế không làm được. Cho nên đó là trần lý thuyết, chứ không phải con số bạn lấy được ngay vào ngày mai. Còn việc 'phản hồi có thực sự làm thay đổi quyết định hay không' thì bản thân nó đã khó đánh giá rồi. Nhưng cho dù trừ hao những yếu tố đó, định hướng cốt lõi thì tôi cực kỳ tán thành

Cuộc cạnh tranh công cụ AI trong tương lai sẽ không nằm ở việc ai gắn nhiều tính năng hơn, khung trò chuyện của ai dài hơn, mà là ai giúp cho mỗi lần phản hồi đều thực sự được đưa vào sử dụng. Một trợ lý AI giỏi không phải là bắt nó làm việc nhiều hơn, mà giống như một người thợ cả giỏi, khiến cho mỗi bước nó làm đều thực sự học hỏi được điều gì đó

Muốn triển khai tính năng bộ nhớ AI, phải lắp một cánh cổng kiểm soát trước|Tại sao trợ lý báo giá AI của bạn càng dùng càng lệch? Mấu chốt nằm ở phản hồi minh hoạ cho phần này

Tóm tắt trọng tâm

・Cấp thêm tài nguyên tính toán và công cụ cho AI chỉ giải thích được 30–40% kết quả (R²: 0.33–0.42), 60% còn lại phụ thuộc vào chất lượng phản hồi

・Giữ nguyên tài nguyên tính toán, chỉ làm cho phản hồi có hiệu lực thì tỷ lệ thành công có thể nhảy từ 27% lên 90%, khác biệt nằm ở 'luyện đúng' chứ không phải 'luyện nhiều'

・Phản hồi hiệu quả phải đạt đồng thời: Có nội dung thực chất, chính xác, không trùng lặp, được đưa vào ứng dụng; thiếu điều kiện thứ tư xem như luyện công vô ích

・Tính năng bộ nhớ AI chỉ giải thích việc 'nhớ được' chứ không giúp lọc lỗi sai; không lắp cổng ghi dữ liệu thì ký ức sai lầm còn độc hại hơn là không có bộ nhớ

・Định kỳ mỗi tháng nạp lại các trường hợp thất bại khi AI báo giá hay sửa bản thảo mới là hành động mấu chốt giúp nó vận hành ngày càng chuẩn xác

Suy ngẫm mở rộng

Đối với xưởng in và studio thiết kế, nguồn cảm hứng thực sự không phải là 'có nên đưa AI vào hay không', mà là 'sau khi đưa vào có thiết kế cơ chế kiểm điểm/đánh giá hay chưa'. Phần lớn mọi người mắc kẹt ở bước đầu tiên rồi dừng lại, coi việc kết nối công cụ là đích đến. Lời khuyên là hãy bắt đầu từ một việc nhỏ: Chọn một kịch bản tần suất cao, ví dụ báo giá catalogue hoặc tư vấn in mẫu decal, dựng sẵn một bảng đáp án chuẩn gồm 30 hạng mục, rồi xếp lịch một giờ mỗi tháng chuyên lấy các ca AI trả lời sai để sửa quy tắc. Vòng lặp này chạy trơn tru rồi mới tính đến việc bật tính năng bộ nhớ hoặc mở rộng phạm vi. Đối với các đơn vị cung cấp dịch vụ tích hợp, đây cũng là một điểm tựa để gắn kết lâu dài với khách hàng: Bạn giúp khách hàng thiết kế tốt vòng lặp phản hồi, hệ thống sẽ càng dùng càng sát với nhu cầu của họ, thay vì dùng nửa năm đã bị chê thiếu chuẩn xác rồi bỏ xó

Đọc thêm

FAQ / Câu hỏi thường gặp

Tại sao hệ thống báo giá AI dùng lâu ngày lại ngày càng kém chuẩn xác?
Thông thường đây không phải là vấn đề năng lực của mô hình, mà là do thiếu vòng lặp phản hồi. Mỗi lần AI báo giá nếu không có tín hiệu đúng/sai rõ ràng dội lại, cũng không ai định kỳ lấy các trường hợp lỗi để điều chỉnh quy tắc, nó sẽ liên tục lặp lại cùng một phán đoán sai lầm, thậm chí còn phóng đại nó lên
Effective Feedback Compute (EFC) là gì?
EFC là một khái niệm đo lường chất lượng phản hồi của AI, chỉ những phản hồi đạt đồng thời bốn điều kiện 'có nội dung thực chất, chính xác, không trùng lặp, được thực sự ứng dụng' mới được tính là có hiệu lực. Bài nghiên cứu chứng minh rằng, trong điều kiện tài nguyên tính toán không đổi, chỉ cần nâng cao chất lượng phản hồi thì tỷ lệ thành công của tác vụ có thể tăng từ 27% lên 90%
Các xưởng in vừa và nhỏ muốn công cụ AI càng dùng càng chuẩn thì bước đầu tiên nên làm gì?
Hãy dựng trước một bảng đối chiếu đáp án chuẩn, tổng hợp mã vật tư chuẩn, loại giấy, khâu gia công sau in và mức giá hợp lý của 20–30 mặt hàng thường báo giá nhất. Có được tài liệu thực tế (ground truth) này thì khi AI báo lệch bạn mới phát hiện và hiệu chỉnh được, đây là điểm khởi đầu để xây dựng vòng lặp phản hồi
Tính năng 'bộ nhớ' của AI có đáng để triển khai không?
Rất đáng, nhưng bắt buộc phải đi kèm một cánh cổng ghi dữ liệu. Tính năng bộ nhớ chỉ giải quyết việc 'nhớ được', chứ không giúp bạn lọc thông tin sai lệch hay trùng lặp. Nếu nhồi nhét cả nhiễu và phán đoán sai vào, những ký ức sai lầm này sẽ bị sử dụng lặp đi lặp lại, rốt cuộc còn tệ hơn là không có bộ nhớ
Nhà thiết kế dùng AI hỗ trợ sửa bản thảo làm sao để nó ngày càng hiểu ý khách hàng hơn?
Hãy ghi chép lại và tổng hợp nguyên nhân cụ thể mỗi lần khách hàng trả lại bản thảo, lần sau trình bày phương án tránh ngay điều đó thì tỷ lệ trúng đích mới tăng lên. Nếu chỉ bỏ xó file bị trả lại mà không phân tích nguyên nhân, sửa thêm bao nhiêu bản thì vẫn chỉ quay mòng mòng tại chỗ, đó chính là sự khác biệt giữa việc vòng lặp phản hồi có được khép kín hay không

Nguồn tham khảo

  1. Agent 也需要「及時反饋」:Effective Feedback Compute 與 Agent 的 deliberate practice · ai-coding.wiselychen.com
ChatGPTPerplexityClaude
FacebookLINEThreadsLinkedInXPinterestEmail
Cẩm nang chủ đềHướng dẫn đầy đủ về các phương pháp in: chọn in kỹ thuật số, offset, in lụa hay letterpress thế nào để không tốn tiền oanBài viết này thuộc chuyên đềĐọc cẩm nang
Bản tin

Bản tin In ấn × AI hàng tuần

Kiến thức in ấn và AI mà nhà thiết kế, thương hiệu và doanh nghiệp dùng được trước khi bắt tay — một email mỗi tuần

Đăng ký nghĩa là bạn đồng ý nhận bản tin, có thể hủy bất cứ lúc nào

Công cụ miễn phí MINDS

Tách nền AI, đóng dấu thương hiệu, tạo sticker LINE — công cụ thiết kế miễn phí, chạy ngay trên trình duyệt, không cần tải lên.

Dùng miễn phí

Tập đoàn MINDS

Cần dịch vụ in ấn hoặc quà tặng thực tế?

Từ in ấn cao cấp đến đặt hàng online và quà Tết — các thương hiệu thành viên của Tập đoàn MINDS lo phần còn lại.

Hỏi qua LINE