Các agent AI đang mở ra nhiều cơ hội đột phá, nhưng việc đảm bảo chúng hoạt động đáng tin cậy trong môi trường thực tế là một thách thức lớn. Một câu trả lời nghe có vẻ tự tin từ agent có thể hoàn toàn sai, gây ảnh hưởng đến doanh thu và lòng tin của khách hàng. Hợp tác cùng Motorway, một sàn giao dịch xe hơi trực tuyến tại Anh, AWS đã xây dựng một pipeline đánh giá toàn diện giúp giảm tỷ lệ truy vấn sai từ 1/8 xuống chỉ còn 1/50, đồng thời rút ngắn thời gian phát hiện sự cố từ vài giờ xuống còn vài phút.
Bài viết này, dựa trên kinh nghiệm thực tế của Motorway và đội ngũ AWS Prototyping and AI Customer Engineering (PACE), sẽ giới thiệu một bản thiết kế chi tiết để các doanh nghiệp có thể tự xây dựng quy trình đánh giá, đảm bảo các agent AI hoạt động ổn định và hiệu quả trước khi đưa vào vận hành chính thức.
Thách thức: Agent AI “tự tin” nhưng không đáng tin cậy
Việc đánh giá một mô hình ngôn ngữ lớn (LLM) thường tập trung vào chất lượng văn bản tạo ra. Tuy nhiên, đánh giá một agent AI phức tạp hơn nhiều. Nó không chỉ là về câu trả lời cuối cùng, mà còn là toàn bộ quá trình agent sử dụng các công cụ (tools), lập luận và đưa ra quyết định. Một agent có thể thất bại theo nhiều cách:
- Lỗi chọn công cụ: Agent gọi sai công cụ tìm kiếm, dẫn đến kết quả không liên quan.
- Hiểu sai ngữ nghĩa: Truy vấn như “xe xăng, hybrid và xe điện dưới 5 năm tuổi” đòi hỏi agent phải phân tích chính xác nhiều ràng buộc cùng lúc.
- Mất ngữ cảnh: Trong các cuộc hội thoại nhiều lượt, agent có thể “quên” các yêu cầu tinh chỉnh của người dùng ở lượt trước.
- Thiếu nhất quán: Do tính chất không xác định (non-deterministic) của LLM, cùng một truy vấn có thể cho ra các kết quả khác nhau ở những lần chạy khác nhau.
Motorway đã xây dựng một agent AI hỗ trợ tìm kiếm xe cho các đại lý, thay thế hàng giờ lọc thủ công bằng các truy vấn ngôn ngữ tự nhiên. Với khoảng 1.500 người dùng đồng thời vào giờ cao điểm, việc đảm bảo agent hoạt động chính xác là yêu cầu bắt buộc. Bất kỳ sai sót nào cũng ảnh hưởng trực tiếp đến niềm tin của đại lý và hoạt động kinh doanh.

Giải pháp: Pipeline đánh giá toàn diện từ thử nghiệm đến production
Để giải quyết thách thức này, Motorway và AWS đã xây dựng một pipeline đánh giá end-to-end kết hợp SDK mã nguồn mở Strands Agents và Amazon Bedrock AgentCore, một dịch vụ được quản lý hoàn toàn để triển khai và vận hành agent AI ở quy mô lớn. Giải pháp này bao gồm:
- Chiến lược đánh giá hai giai đoạn: Kiểm thử tại thời điểm build với thư viện
strands-agents-evalsvà giám sát trong môi trường production vớiAmazon Bedrock AgentCore Evaluations. - Khung đánh giá ba lớp: Đánh giá khả năng sử dụng công cụ (tool usage), lập luận (reasoning) và chất lượng đầu ra (output quality).
- Pipeline triển khai năm giai đoạn: Tích hợp các “cổng chất lượng” (quality gates) để tự động chặn các bản phát hành không đạt tiêu chuẩn.
Giai đoạn 1: Đánh giá tại thời điểm build với khung 3 lớp
Trước khi triển khai, agent cần phải vượt qua một quy trình kiểm thử nghiêm ngặt để phát hiện sớm các vấn đề. Khung đánh giá này được chia thành ba lớp, mỗi lớp có một ngưỡng đạt/không đạt riêng.

-
Lớp 1: Sử dụng công cụ (Tool Usage) – Ngưỡng >95%: Lớp này xác minh agent có gọi đúng công cụ với các tham số chính xác hay không. Ví dụ, truy vấn “xe diesel giá từ £7.000 đến £20.000” phải gọi công cụ
search_vehiclesvới các bộ lọc được định kiểu(fuel_type=diesel, min_price=7000, max_price=20000). Việc đánh giá này hoàn toàn tự động và dựa trên mã. -
Lớp 2: Lập luận (Reasoning) – Ngưỡng >85%: Đánh giá liệu quy trình ra quyết định của agent có logic hay không. Lớp này sử dụng phương pháp LLM-as-judge (dùng một LLM khác để chấm điểm) để xem xét tính hợp lý trong chuỗi suy luận của agent. Một agent đưa ra câu trả lời đúng nhưng với lập luận sai sẽ rất dễ thất bại khi điều kiện thay đổi.
-
Lớp 3: Chất lượng đầu ra (Output Quality) – Ngưỡng >90%: Đánh giá xem câu trả lời cuối cùng có hữu ích, chính xác và có thể hành động được không. Lớp này cũng sử dụng LLM-as-judge để đảm bảo người dùng nhận được kết quả mong muốn.
Để xử lý tính không nhất quán của LLM, quy trình này sử dụng chỉ số pass^k (pass to the power of k), đo lường xác suất thành công trong k lần thử liên tiếp. Điều này rất quan trọng đối với các agent phục vụ khách hàng, nơi người dùng mong đợi sự ổn định mỗi lần tương tác. Một agent có tỷ lệ thành công 75% mỗi lần thử chỉ có 42% cơ hội thành công trong 3 lần thử liên tiếp (0.75³).
Giai đoạn 2: Giám sát trong môi trường production với AgentCore Evaluations
Sau khi agent được triển khai lên Amazon Bedrock AgentCore Runtime, dịch vụ AgentCore Evaluations sẽ cung cấp khả năng giám sát liên tục. Nó tích hợp với Strands Agents thông qua OpenTelemetry và cho phép lấy mẫu từ 1-5% lưu lượng truy cập thực tế để đánh giá.

AgentCore Evaluations cung cấp hai chế độ:
- Đánh giá theo yêu cầu (On-demand evaluation): Phân tích các tương tác cụ thể của agent từ log trên Amazon CloudWatch, hữu ích cho việc gỡ lỗi hoặc xác thực các bản vá.
- Đánh giá trực tuyến (Online evaluation): Tự động lấy mẫu lưu lượng truy cập trực tiếp và áp dụng các bộ đánh giá (evaluators) trong nền.
Ngoài các bộ đánh giá có sẵn, doanh nghiệp có thể tạo các bộ đánh giá tùy chỉnh để kiểm tra các yêu cầu đặc thù của mình như độ tươi mới của dữ liệu, giới hạn quyền truy cập, hoặc các hành động bị cấm.
Tích hợp “cổng chất lượng” vào pipeline triển khai
Đánh giá không phải là một bước làm sau cùng, mà phải là một “cổng chất lượng” (quality gate) tích hợp trong pipeline CI/CD. Một lỗi ở bất kỳ giai đoạn nào cũng sẽ tự động chặn việc triển khai, ngăn không cho các phiên bản lỗi tiếp cận người dùng.

Pipeline triển khai được đề xuất bao gồm 5 giai đoạn chính:
- Đánh giá tại thời điểm build: Chạy unit test, kiểm tra tính đúng đắn của tool và đánh giá 3 lớp.
- Xác thực trên môi trường staging: Sử dụng AgentCore Evaluations với lưu lượng truy cập giả lập.
- Chế độ Shadow (Shadow mode): Xử lý song song một bản sao của lưu lượng truy cập production thực tế mà không ảnh hưởng đến người dùng. Chế độ này giúp phát hiện các vấn đề về hiệu năng tải, độ trễ và các thuật ngữ chuyên ngành không có trong dữ liệu thử nghiệm.
- Thử nghiệm A/B: Chuyển 5% lưu lượng truy cập thực tế sang agent mới để đo lường kết quả thực tế.
- Triển khai production: Chuyển 100% lưu lượng truy cập và tiếp tục giám sát liên tục.
Bài học cho doanh nghiệp Việt Nam
Câu chuyện thành công của Motorway cung cấp một khuôn mẫu giá trị cho các doanh nghiệp đang tìm cách khai thác sức mạnh của agent AI một cách an toàn và hiệu quả. Một agent AI hoạt động trôi chảy không có nghĩa là nó đang làm đúng. Việc xác minh lựa chọn công cụ, tính đúng đắn của tham số, sự mạch lạc trong lập luận và tính nhất quán là tối quan trọng.
Bằng cách kết hợp kiểm thử tại thời điểm build và giám sát trong môi trường production, doanh nghiệp có thể tự tin triển khai các agent AI phức tạp, từ agent dịch vụ khách hàng, tư vấn tài chính đến các agent hỗ trợ trong ngành y tế, với bằng chứng rõ ràng rằng chúng hoạt động như thiết kế.
Để bắt đầu, các doanh nghiệp có thể tham khảo kho mã nguồn đi kèm từ AWS để triển khai một pipeline mẫu và tùy chỉnh cho các yêu cầu đặc thù của mình.


