סקירת שוק — סוכני עזרה AI ברשת פנימית סגורה (on-prem / air-gapped)
הוכנה על ידי אטלס · 25/09/2026 · לקראת מפגש הפיתוח של Mystique Help Agent (שני 05/10, 10:00)
עדכון מסגרת (25/09): Mystique Help Agent הוא פרויקט למקום העבודה ולא מיזם עסקי עצמאי — זכויות הקוד שייכות למעסיק לפי חוזה. הערך האישי בפרויקט הוא מקצועי (האדם שמביא AI לארגון), והתשתית המומלצת היא קוד פתוח בפייתון. הסקירה שלהלן שימושית בעיקר להבנת הנוף ולכיוון הטכני.
1. המגמה הגדולה
השוק של Private AI (AI שרץ בתוך גבולות הארגון, בלי ענן) הוא אחד הכיוונים החמים ב-2026:
- JPMorganChase התקינו אינפרנס on-prem מ-SambaNova (הערכת שווי 11 מיליארד דולר) — הבנקים הגדולים עוברים למודלים פנימיים.
- Cisco השיקה AI POD ל-Splunk שמגיע גם ללקוחות on-prem; Broadcom בנתה "AI Factory" פרטית מלאה.
- Pokee AI שחררה מודל אג'נטי (Isaac 28B) שנועד במפורש לרוץ "בתוך גבולות הלקוח" — on-prem, VPC או on-device.
- Arinox + Altos (קבוצת Acer) מוכרות מערכת AI air-gapped מוכנה מהקופסה.
מסקנה: הכיוון של Mystique Help Agent תואם בדיוק את כיוון השוק, ולא נגדו.
2. מפת השחקנים (בקטגוריות)
- פלטפורמות אינפרנס/חומרה: SambaNova, NVIDIA, Arinox/Altos — נמכרות לארגונים גדולים במיליונים; לא מתחרות ברמת הסוכן.
- ערימות קוד פתוח (self-hosted): Ollama, Open WebUI, AnythingLLM, PrivateGPT, LiteLLM — חינמיות או זולות, דורשות הרכבה עצמית.
- ניהול ידע ארגוני עם AI: ONES Wiki (עד 30 משתמשים חינם, גם on-prem), Confluence Data Center, XWiki, BookStack — פותרים וויקי, לא סוכן עזרה פעיל.
- עוזרי help desk בענן: Freshdesk Freddy AI — $29 לסוכן בחודש, אבל הכל בענן; לא רלוונטי לרשת סגורה.
3. הפער בשוק
אין כמעט שחקן שנותן "סוכן עזרה מוכן שרץ ברשת הפנימית שלך, על המסמכים שלך". הכול מכוון לענקים או למרכיבים-לבד. בפרויקט פנימי זה דווקא בשורה טובה: הארגון שלך יקבל משהו שגם ענקים משלמים עליו מיליונים, בעלות של מאות דולרים בלבד.
4. המלצת תשתית טכנית לפיתוח בפייתון (קוד פתוח, אפס ענן)
- מודל: Ollama על GPU אחד בשרת הפנימי (למשל Qwen או Llama בגדלים 8B-32B, לפי החומרה שיש) — התקנה אופליין מקובץ, בלי כל קריאה החוצה.
- שרת: FastAPI (פייתון) — קל להרים מול תשתית devops קיימת, קונטיינר אחד של Docker.
- חיבור למסמכים (RAG): LangChain או LlamaIndex + מסד וקטורי פנימי (ChromaDB / Qdrant self-hosted) — כולם פייתון ורצים אופליין.
- ממשק משתמש: Gradio או Open WebUI — ממשק צ'אט מוכן תוך יום עבודה.
- תנודתיות/תחזוקה: הכל נשאר בתוך הרשת הפנימית; עדכוני מודל דורשים העברת קובץ ידנית (או אספקה מתוזמנת של devops).
5. שאלות פתוחות למפגש
- איזו חומרה קיימת בפועל בארגון (GPU? רק CPU?) — זה קובע את גודל המודל.
- אילו מסמכים/מערכות הסוכן צריך לדעת (נהלים, help desk, הדרכות)?
- מה התשתית ש-devops מספקים — Docker מותר? מסד נתונים פנימי?
- איך מודדים הצלחה: פחות פניות לתמיכה? זמן תשובה מהיר יותר?
קובץ זה עובד אופליין ללא אינטרנט — פתח אותו בכל דפדפן.