👋 Hi! Bạn cần tư vấn gì về dịch vụ AWS?

Khi vận hành các agent AI ở quy mô lớn, doanh nghiệp thường đối mặt với một loại lỗi khó phát hiện: các bảng điều khiển (dashboard) đều báo cáo chỉ số tốt, tỷ lệ hoàn thành 99%, độ trễ ổn định và không có lỗi đột biến. Tuy nhiên, khiếu nại của khách hàng về các kết quả không chính xác vẫn xuất hiện. Đây là những “thất bại âm thầm” về hành vi, khác với các sự cố hạ tầng thông thường. Để giải quyết vấn đề này, AWS đã ra mắt tính năng tối ưu hóa trong Amazon Bedrock AgentCore, giúp tự động phát hiện, giải thích và ưu tiên xử lý các lỗi hành vi này, ngay cả khi chúng không tạo ra bất kỳ tín hiệu lỗi nào.

Vấn đề nan giải: Những thất bại “âm thầm” của agent AI

Các thất bại về hành vi của agent AI có thể gây ra hậu quả nghiêm trọng cho doanh nghiệp mà không bị phát hiện bởi các hệ thống giám sát truyền thống. Ví dụ, một yêu cầu sửa đổi đơn hàng không bao giờ được thực thi, một sản phẩm được báo là “còn hàng” trong khi API kiểm kho đã hết thời gian chờ, hoặc một bước phê duyệt quan trọng bị bỏ qua. Từ góc độ hệ thống, các phiên này hoàn thành “thành công” và vượt qua các bài kiểm tra sức khỏe (health check).

Những lỗi này chỉ được phát hiện thông qua khiếu nại của khách hàng, thường là nhiều tuần sau khi chúng bắt đầu ảnh hưởng đến người dùng ở quy mô lớn. Ngay cả khi lỗi tạo ra tín hiệu, việc xác định lỗi nào cần được ưu tiên xử lý trước trong hàng trăm lỗi tích lũy hàng ngày cũng là một thách thức. Việc xem xét từng trace riêng lẻ chỉ cho biết điều gì đã xảy ra trong một phiên, nhưng không cho thấy đó là một mẫu lỗi ảnh hưởng đến 30% lưu lượng truy cập hay chỉ là một trường hợp cá biệt.

AgentCore Optimization: Giải pháp giám sát hành vi từ AWS

Tính năng phân tích chuyên sâu (insights) trong Amazon Bedrock AgentCore Optimization hoạt động như một lớp thông minh bên trên các công cụ giám sát hiện có của doanh nghiệp. Nó sử dụng dữ liệu trace mà các công cụ đã thu thập và chuyển đổi chúng thành thông tin chi tiết về hành vi, có thể hành động ngay lập tức. Điều này giúp các nhóm phát triển chuyển từ việc kiểm tra trace một cách thụ động sang phát hiện mẫu lỗi một cách chủ động, giúp tìm ra lỗi, hiểu phạm vi ảnh hưởng và khắc phục chúng theo thứ tự ưu tiên.

Sơ đồ quy trình phân tích và gom cụm của AgentCore để tạo ra các phân tích chuyên sâu.

Báo cáo phân tích chuyên sâu cung cấp ba khả năng chính:

  • Khám phá mẫu lỗi và phân tích nguyên nhân gốc rễ (RCA): Tự động phát hiện và xếp hạng các cụm lỗi từ hàng trăm phiên mà không cần định nghĩa danh mục từ trước. Mỗi cụm lỗi đi kèm một giải thích tổng hợp, giúp nhà phát triển hành động mà không cần xem từng trace.
  • Phân tích mục đích người dùng (User Intent Analysis): Tiết lộ cách người dùng tương tác với agent trong các kịch bản khác nhau, cho thấy sự phân bổ thực tế các yêu cầu của người dùng, từ đó phát hiện các lỗ hổng cần giải quyết.
  • Phân tích quy trình thực thi (Execution Insights): Cho thấy các chiến lược mà agent sử dụng để phản hồi, cách các hành động tiến triển và nơi hành vi thực tế của agent khác với thiết kế ban đầu.

Khám phá mẫu lỗi và phân tích nguyên nhân gốc rễ (RCA)

AgentCore phân tích từng trace của phiên dựa trên một hệ thống phân loại có cấu trúc gồm 11 loại lỗi hành vi, bao gồm hallucination (tạo ra thông tin sai lệch), hành động không chính xác, vi phạm hướng dẫn tác vụ, lỗi điều phối, và các vấn đề xử lý ngữ cảnh. Cách tiếp cận này giúp phát hiện các lỗi âm thầm không dựa vào tín hiệu lỗi đơn thuần.

Quy trình phân cụm lỗi và phân tích nguyên nhân gốc rễ (RCA) trong AgentCore.

Đối với mỗi cụm lỗi, AgentCore truy ngược lại đồ thị thực thi để xác định nguyên nhân gây ra lỗi, chứ không chỉ nơi nó xuất hiện. Bằng cách loại bỏ các nhánh không liên quan, hệ thống có thể thực hiện phân tích RCA hiệu quả ngay cả trên các phiên dài, thu hẹp một quy trình 50 bước xuống còn đường dẫn thực thi cụ thể dẫn đến lỗi. Kết quả sẽ chỉ ra vị trí gốc rễ, phân loại nguyên nhân và đề xuất cách khắc phục (thay đổi system prompt, cập nhật mô tả công cụ, hoặc công việc hạ tầng).

Phân tích mục đích người dùng và quy trình thực thi

Ngoài việc phân tích lỗi, AgentCore còn cung cấp hai góc nhìn bổ sung về hành vi của agent:

  • Phân tích mục đích người dùng: Bằng cách gom cụm các prompt thực tế mà người dùng gửi cho agent, tính năng này cho thấy sự phân bổ các trường hợp sử dụng trong môi trường production. Doanh nghiệp có thể phát hiện ra rằng 40% lưu lượng truy cập là cho một trường hợp sử dụng đã được thiết kế, 30% được hỗ trợ một phần, và 30% còn lại là những yêu cầu hoàn toàn không lường trước được.
  • Phân tích quy trình thực thi: Tính năng này trích xuất cách tiếp cận và kết quả mà agent đạt được trong mỗi phiên. Bằng cách gom cụm các bản tóm tắt này, nó tiết lộ các mẫu thực thi, bao gồm các chiến lược phổ biến mà agent sử dụng, mối tương quan giữa các chiến lược đó với thành công hay thất bại, và nơi hành vi thực tế của agent khác với thiết kế ban đầu.

Hướng dẫn cài đặt và sử dụng

Để sử dụng tính năng phân tích chuyên sâu, doanh nghiệp có thể cấu hình từ giao diện điều khiển AgentCore trong mục Optimizations > Insights > Create Insights. Quá trình cài đặt rất đơn giản:

  1. Chọn loại phân tích: Lựa chọn giữa Failure analysis, User intent analysis, và Execution summary. Có thể chạy độc lập hoặc cùng nhau.
  2. Kết nối với agent: Chọn một agent endpoint đã được triển khai qua AgentCore runtime hoặc trỏ trực tiếp đến một log group trên Amazon CloudWatch nếu agent chạy bên ngoài.
  3. Thiết lập lịch trình: Chọn chế độ chạy lặp lại (hàng ngày, hàng tuần, hàng tháng) để tự động tạo báo cáo, hoặc chạy một lần (one-time) cho một khoảng thời gian cụ thể để điều tra sự cố.
  4. Cấu hình tùy chọn: Có thể thêm bộ lọc, lấy mẫu (sampling) hoặc cấu hình quyền IAM để truy cập log.
Giao diện cấu hình để tạo một phân tích chuyên sâu trong Amazon Bedrock AgentCore.

Ví dụ thực tế: Phân tích agent tư vấn thị trường

Hãy xem xét một agent phân tích xu hướng thị trường cung cấp phân tích đầu tư, khuyến nghị cổ phiếu và dữ liệu hiệu suất ngành. Sau khi chạy 10 phiên, đây là những gì AgentCore insights đã phát hiện:

Phân tích lỗi

Insights đã xác định một loại lỗi: “Tạo dữ liệu tài chính giả mạo mà không gọi công cụ” (Hallucinated Financial Data Without Tool Invocation), ảnh hưởng đến 1/10 phiên. Agent đã tạo ra các điểm dữ liệu tài chính cụ thể và trình bày chúng như thông tin thực tế mà không gọi các công cụ truy xuất dữ liệu có sẵn. Lỗi này không tạo ra tín hiệu lỗi và phiên hoàn thành thành công, nhưng insights đã chỉ ra nguyên nhân gốc rễ và đề xuất củng cố system prompt để bắt buộc gọi công cụ trước khi đưa ra các tuyên bố số liệu.

Báo cáo phân tích lỗi cho thấy lỗi Hallucination dữ liệu tài chính.

Phân tích mục đích người dùng

Phân tích mục đích người dùng đã gom các yêu cầu thành 3 loại, cho thấy 50% lưu lượng truy cập (5/10 phiên) là để truy xuất hồ sơ và đánh giá danh mục đầu tư. Thông tin này cho biết doanh nghiệp cần ưu tiên đầu tư vào độ tin cậy của tính năng này trước tiên, vì nếu nó thất bại, trải nghiệm của 50% người dùng sẽ bị ảnh hưởng.

Báo cáo phân tích mục đích người dùng cho thấy sự phân bổ các loại yêu cầu.

Phân tích quy trình thực thi

Các bản tóm tắt thực thi cho thấy hành vi của agent được nhóm thành ba mẫu, với mẫu chiếm ưu thế (6/10 phiên) là agent hoàn thành quy trình tư vấn đầy đủ từ đầu đến cuối, bao gồm phân tích tài chính đa ngành và phân bổ danh mục đầu tư. Điều này xác nhận rằng agent đang hoạt động đúng như thiết kế trong phần lớn các trường hợp.

Báo cáo tóm tắt thực thi cho thấy các mẫu hành vi của agent.

Lợi ích cho doanh nghiệp

Tính năng tối ưu hóa trong Amazon Bedrock AgentCore cung cấp một công cụ mạnh mẽ để giám sát và cải thiện hiệu suất của các agent AI khi chúng gặp phải các lỗi “âm thầm”. Doanh nghiệp có thể sử dụng nó để xác thực sau khi triển khai, giám sát chủ động hàng tuần để phát hiện các lỗi vô hình trước khi khách hàng phát hiện, và xếp hạng mức độ ưu tiên khắc phục dựa trên tác động thực tế. Bằng cách này, các nhóm phát triển có thể đảm bảo rằng các agent AI không chỉ hoạt động, mà còn hoạt động một cách chính xác và hiệu quả, mang lại giá trị kinh doanh thực sự.