ארכיטקטורת מערכות multi-agent
עוזר multi-agent בייצור בארכיטקטורת supervisor-worker לפלטפורמת בניית טפסים

The Challenge
פלטפורמת בניית טפסים מובילה רצתה שהמשתמשים שלה יבנו טפסים, אוטומציות, רשימות אנשי קשר ודפים דרך עוזר שיחתי אחד. משמעות הדבר הייתה תיאום של יכולות מתמחות רבות, קריאה בטוחה לשירותי backend חיים בשם המשתמש, עצירה לאישור אנושי לפני שינויים הרסניים, וכל זאת במערכת שיכולה לגדול ולהיות נצפית בייצור.
The Solution
בנינו מערכת multi-agent בארכיטקטורת supervisor-worker על AWS Bedrock AgentCore, מתוזמרת עם LangGraph. סוכן supervisor מפרש כל בקשה ומנתב אותה לסוכנים מתמחים (אנשי קשר, אוטומציות, טפסים, טפסים חכמים, דפים, מחברים) מעל פרוטוקול Agent-to-Agent (A2A), ומזרים התקדמות בחזרה למשתמש. כל סוכן מגיע ל-backend שלו דרך שרתי Model Context Protocol (MCP), כאשר הכלים נשלפים לפי בקשה תחת ההרשאות של הקורא עצמו, כך שכל פעולה מוגבלת לחשבון הנכון. עריכות טפסים עוברות דרך מכונת מצבים של validate-then-commit: הסוכן מריץ כל שינוי בהרצה יבשה (dry-run), מתקן את עצמו בשגיאות ולידציה, וממתן כל עריכה בעלת תופעות לוואי מאחורי אישור אנושי מובנה שנבנה על interrupts ו-checkpoints עמידים של LangGraph, כך שאישור שורד גם אם הקונטיינר מופעל מחדש. הצטיידנו במכשור OpenTelemetry לתוך Arize ו-Datadog בכל המערכת, הוספנו הסתרת PII בצינור המעקב, והשקנו חבילת הערכה אוטומטית (בדיקות מקודדות בתוספת LLM-as-judge) המחוברת ל-CI.
Results
- עוזר multi-agent בייצור: שישה סוכנים מתמחים ויותר מ-90 כלי backend מעל MCP
- פריימוורק סוכנים לשימוש חוזר (graph משותף, A2A, MCP, human-in-the-loop) שמתרחב על ידי הוספת סוכנים
- אישורי human-in-the-loop עמידים ששורדים הפעלה מחדש של קונטיינרים
- חבילת בדיקות אוטומטית בת 70 קבצים בתוספת צינור הערכה של Arize המחובר ל-CI