👋 Hi! Bạn cần tư vấn gì về dịch vụ AWS?

Khi các ứng dụng AI ngày càng phức tạp, việc điều phối nhiều agent chuyên biệt trở thành thách thức lớn cho doanh nghiệp. AWS đã giới thiệu một kiến trúc kết hợp LangGraph, Strands và Amazon Bedrock AgentCore để xây dựng các hệ thống AI đa agent, sẵn sàng cho môi trường production. Giải pháp này đặc biệt hữu ích cho các quy trình nghiệp vụ phức tạp như giám sát thị trường tài chính, đòi hỏi sự phối hợp, ra quyết định linh hoạt và khả năng phục hồi lỗi mạnh mẽ.

Bài viết này, dựa trên chia sẻ từ AWS, trình bày cách kiến trúc và triển khai một hệ thống AI đa agent sử dụng LangGraph và Strands trên hạ tầng AWS. Doanh nghiệp có thể học cách triển khai điều phối quy trình dựa trên trạng thái với hệ thống checkpoint của LangGraph, tích hợp các agent Strands cho các tác vụ lập luận chuyên sâu và sử dụng AgentCore để triển khai ở quy mô lớn.

Thách thức của hệ thống AI tác tử (Agentic AI)

Khi các ứng dụng AI phát triển từ chatbot đơn giản sang các hệ thống tự hành tinh vi, các phương pháp tiếp cận một agent truyền thống thường không đủ khả năng xử lý các quy trình kinh doanh phức tạp. Các ngành như dịch vụ tài chính là một ví dụ điển hình. Hệ thống giám sát thị trường phải điều phối nhiều agent chuyên biệt để phân tích các mẫu giao dịch, điều tra hoạt động đáng ngờ và tạo báo cáo toàn diện, đồng thời duy trì các tiêu chuẩn tuân thủ và độ tin cậy nghiêm ngặt.

Giải pháp được AWS đề xuất kết hợp hai framework: LangGraph cho việc điều phối quy trình ở cấp độ vĩ mô và Strands cho khả năng lập luận thông minh của từng agent. Sự kết hợp này, cùng với Amazon Bedrock AgentCore được phát hành vào năm 2025, tạo ra một nền tảng vững chắc cho các hệ thống agentic AI (AI tác tử – có khả năng tự lập kế hoạch và hành động) sẵn sàng cho môi trường production.

LangGraph: Điều phối quy trình vĩ mô

LangGraph cung cấp khả năng điều phối cấp production cho các hệ thống đa agent thông qua ba năng lực cốt lõi:

  • Máy trạng thái dựa trên đồ thị (Graph-based state machines): LangGraph mô hình hóa các quy trình làm việc của agent dưới dạng đồ thị có hướng, trong đó các node đại diện cho các hàm chứa logic của agent và các cạnh xác định luồng thực thi. Cách tiếp cận này giúp biến các quy trình phức tạp thành mã nguồn dễ đọc và bảo trì.
  • Quản lý trạng thái liên tục (Persistent state management): Hệ thống checkpoint của framework tự động lưu lại toàn bộ trạng thái của quy trình sau mỗi lần thực thi node. Nhờ các checkpoint này, hệ thống có thể phục hồi suôn sẻ sau lỗi và hỗ trợ tương tác có sự tham gia của con người (human-in-the-loop).
  • Độ tin cậy cấp production: LangGraph bao gồm các chiến lược thử lại tích hợp sẵn với exponential backoff (thời gian chờ tăng dần theo cấp số nhân) để xử lý các lỗi hệ thống. Nền tảng cũng cung cấp khả năng quan sát toàn diện thông qua OpenTelemetry để tích hợp dễ dàng với hầu hết các ứng dụng observability.

Lớp điều phối này sẽ định tuyến các truy vấn giữa các agent Strands chuyên biệt. Sơ đồ quy trình làm việc được định nghĩa bao gồm: một trạng thái dùng chung, một bộ điều phối (orchestrator) chọn agent chuyên biệt nào sẽ được gọi, định tuyến có điều kiện giữa chúng và lưu trữ dựa trên checkpoint để phục hồi.

Sơ đồ điều phối quy trình làm việc của agent phân tích thị trường bằng LangGraph

Strands: Lập luận thông minh cho từng agent

Strands Agent hoạt động trên một kiến trúc không phụ thuộc vào mô hình (model-agnostic), cho phép nó thích ứng với cơ sở hạ tầng hiện có. Agent này triển khai một vòng lặp lập luận liên tục đánh giá đầu ra của công cụ và đưa ra quyết định dựa trên kết quả trung gian, giúp xây dựng các quy trình phân tích đa bước phức tạp.

Với Strands, doanh nghiệp có thể cấu hình các tương tác công cụ bên ngoài bằng cách xác định schema và các mẫu truy cập. Ví dụ, đối với agent giám sát, AWS tách biệt việc khám phá dữ liệu khỏi việc truy xuất để tránh hiện tượng hallucination (ảo giác) và tăng cường khả năng chống lại các cuộc tấn công injection.

Tại sao nên kết hợp LangGraph và Strands?

Nhiều trường hợp sử dụng trong doanh nghiệp phải tuân theo các quy trình làm việc nghiêm ngặt, được xác định trước. Việc chỉ dựa vào bản chất phi xác định của một LLM để thực hiện đúng các bước là một rủi ro. Tuy nhiên, các bước cụ thể trong những quy trình đó lại đòi hỏi khả năng lập luận linh hoạt của LLM.

Sự kết hợp giữa LangGraph và Strands giải quyết vấn đề này, cho phép xây dựng các hệ thống nơi việc điều phối xác định (deterministic) chứa đựng trí thông minh linh hoạt (dynamic) được khoanh vùng.

  • Trí thông minh cấp “Node”: LangGraph xác định quy trình điều phối cấp cao. Các agent Strands được đặt tại các node cụ thể, nơi quy trình phức tạp có thể yêu cầu phân tích từ LLM hoặc xử lý các tình huống không rõ ràng.
  • Cô lập ngữ cảnh (Context isolation): Bằng cách đặt các agent Strands riêng lẻ vào các node LangGraph riêng biệt, bộ nhớ được phân chia. Mỗi agent quản lý ngữ cảnh và lịch sử công cụ tập trung của riêng mình, trong khi LangGraph duy trì một trạng thái phiên làm việc có cấu trúc, bao quát mà các agent khác nhau có thể cập nhật và tham chiếu độc lập.
  • Tăng cường khả năng điều phối: Bằng cách nhúng Strands, doanh nghiệp có thể tích hợp một framework agent doanh nghiệp toàn diện vào đồ thị của mình, tận dụng khả năng định tuyến mạnh mẽ của LangGraph cùng với các tính năng tích hợp, kiểm soát và an toàn của Strands.

Triển khai và vận hành trên AWS với AgentCore

Amazon Bedrock AgentCore cung cấp một dịch vụ được quản lý hoàn toàn để triển khai và vận hành các agent ở quy mô lớn, giảm bớt gánh nặng quản lý cơ sở hạ tầng.

  • Runtime Deployment: AgentCore runtime biến mã agent cục bộ thành các bản triển khai cloud-native với cấu hình tối thiểu. Dịch vụ này không phụ thuộc vào framework và hoạt động tốt với LangGraph và Strands. Nó cung cấp cơ sở hạ tầng được xây dựng có mục đích cho các workload agent động, bao gồm thời gian chạy kéo dài cho các cuộc điều tra dài hạn, thực thi độ trễ thấp và tự động co giãn theo nhu cầu.
  • Memory Integration: LangGraph tích hợp với bộ nhớ của AgentCore thông qua gói langgraph-checkpoint-aws, cung cấp cả khả năng lưu trữ checkpoint ngắn hạn và truy xuất bộ nhớ dài hạn thông minh. Điều này giải quyết thách thức cơ bản về tính không trạng thái của agent: mỗi tương tác được xây dựng dựa trên kiến thức trước đó thay vì bắt đầu lại từ đầu.
  • Observability and Operations: AgentCore tích hợp sẵn với Amazon CloudWatch và AWS X-Ray, ghi lại các dấu vết thực thi của agent, các lệnh gọi công cụ và các chỉ số hiệu suất. Điều này mang lại khả năng quan sát toàn diện từ cấp độ điều phối quy trình cao xuống đến từng lệnh gọi LLM và các bước lập luận riêng lẻ.

Kết luận

Kiến trúc kết hợp giữa khả năng điều phối quy trình mạnh mẽ của LangGraph và khả năng lập luận thông minh của Strands, được triển khai trên hạ tầng AWS với AgentCore, cho phép doanh nghiệp xây dựng các hệ thống AI đa agent phức tạp và đáng tin cậy. Cách tiếp cận này giúp tách biệt các mối quan tâm: LangGraph quản lý điều phối vĩ mô, trong khi Strands cung cấp công cụ lập luận chi tiết trong từng node.

Doanh nghiệp có thể mở rộng kiến trúc này cho các kịch bản điều phối phức tạp khác như pipeline xử lý tài liệu, tự động hóa dịch vụ khách hàng hoặc hệ thống giám sát tuân thủ. Để tìm hiểu sâu hơn về chi tiết kỹ thuật, bạn có thể tham khảo kho mã nguồn trên GitHub.