למה הסוכן עובד מצוין בהדגמה ונשבר מול לקוח אמיתי
סוכני AI מצליחים היטב בסבב שאלה ותשובה יחיד ונחלשים בשיחה רב-סבבית. במחקר CRMArena-Pro של Salesforce מ-24.05.2025 ההצלחה ירדה מכ-58% לכ-35%, ובלוח התוצאות של Sierra המובילים במבחן הידע הארגוני עומדים על 47.9% עד 55.2% בלבד. ההדגמה לא משקרת, היא בודקת תרחיש אחר לגמרי.
ההדגמה עבדה בלי תקלה אחת. הסוכן ענה על שאלה על מדיניות החזרות, שלף הזמנה לפי מספר, וסגר את השיחה במשפט מנוסח יפה. שבועיים אחרי ההשקה מגיעות התלונות: לקוח ששאל שלוש שאלות ברצף וקיבל בסוף תשובה שסותרת את מה שנאמר לו בהתחלה, לקוח שקיבל נוהל שכבר לא בתוקף, ולקוח אחד שפשוט לא קיבל תשובה.
ואז מגיע השלב שבו מחפשים את האשם ומוצאים אותו בבית. ההגדרה כנראה לא הייתה מדויקת, הפרומפט כנראה לא היה מספיק טוב, אולי חסר עוד מדריך. זו כמעט אף פעם לא הסיבה. הפער בין ההדגמה לבין לקוח אמיתי הוא פער מובנה, הוא נמדד במחקר, ויש לו מספרים.
בקצרה
סוכני AI נמדדים היטב בסבב שאלה ותשובה יחיד ונחלשים בשיחה רב-סבבית. במחקר של Salesforce מ-24.05.2025 שיעור ההצלחה ירד מכ-58% לכ-35%. בלוח התוצאות של Sierra, המודלים המובילים במבחן שדורש ידע ארגוני מגיעים ל-47.9% עד 55.2% בלבד, לעומת 85.3% עד 87.9% אצל המובילים במבחן הסביבה הנקייה. ההדגמה לא משקרת, היא בודקת תרחיש אחר.
מה בעצם ההבדל בין הדגמה לשיחה עם לקוח אמיתי?
ההבדל הוא מספר התורות. הדגמה בודקת שאלה אחת ותשובה אחת, ולקוח אמיתי מנהל שיחה שנמשכת ארבעה, חמישה או עשרה מהלכים, מוסיף פרטים תוך כדי, משנה כיוון באמצע, ומצפה שהסוכן יזכור מה נאמר לפני שלושה משפטים.
המספר שמתאר את הפער הזה פורסם ב-24.05.2025. Salesforce AI Research בנתה סביבת בדיקה בשם CRMArena-Pro, עם 19 משימות שירות ומכירות שאומתו על ידי מומחים, בסביבות B2B ו-B2C. שיעור ההצלחה בסבב יחיד עמד על כ-58%. באותן משימות עצמן, בשיחה רב-סבבית, הוא ירד לכ-35%.
באותו מחקר עלה ממצא נוסף שנוגע ישירות לעסק שמפעיל סוכן על מידע לקוחות: המודעות של הסוכן לסודיות המידע הייתה כמעט אפסית מטבעה, וכשהוסיפו לו תדריך ממוקד ששיפר את זה, ביצועי המשימה עצמה בדרך כלל ירדו. כלומר יש כאן מאזן, ולא רק כפתור שאפשר לשפר.
סבב יחיד: כ-58%
שאלה אחת, תשובה אחת. זה התרחיש שמוצג בהדגמות מכירה.
שיחה רב-סבבית: כ-35%
אותן משימות בדיוק, בשיחה הלוך ושוב. זה התרחיש של לקוח.
מודעות לסודיות: כמעט אפסית
ותדריך שמשפר אותה בדרך כלל מוריד את הצלחת המשימה.
המקור
CRMArena-Pro, Salesforce AI Research, פורסם 24.05.2025.
למה הסוכן נשבר דווקא כשהוא צריך את הידע של העסק?
כי זה בדיוק המקום שבו הביצועים צונחים במדידה, ולא רק בתחושה. לוח התוצאות של Sierra Research, שנבדק ב-31.08.2026, מפריד בין שתי סביבות בדיקה, וההפרש ביניהן הוא כמעט חצי.
ב-τ²-bench Text, שבודק קמעונאות, תעופה וטלקום בסביבה מוגדרת היטב, המובילים הם Qwen3.5-397B-A17B עם 87.9%, Gemini 3.0 Pro עם 85.4% ו-Claude Opus 4.5 עם 85.3%. במבחן τ³-Knowledge, שהושק במרץ 2026 ומוסיף ידע ארגוני אמיתי בתחום הבנקאות, המובילים הם מודלים אחרים לגמרי, והציונים שלהם נמוכים בהרבה: Qwen 3.8 Max עם 55.2%, Claude Opus 5 עם 48.7% ו-Grok 4.5 עם 47.9%, לפי Sierra Research. ואלה לא אותם מודלים שנמדדו פעמיים. אלה שתי רשימות מובילים נפרדות, ולכן מה שמושווה כאן הוא רמת הקושי של שני המבחנים, לא ביצועים של מודל מסוים.
בעברית פשוטה: כל עוד הסוכן פועל בעולם נקי ומוגדר, הטובים ביותר עוברים 85%. ברגע שהמבחן דורש להישען על נהלים, מחירונים וחריגים ספציפיים, אפילו הטובים ביותר נכשלים בכמחצית מהמקרים. וזה בדיוק החלק שההדגמה לא בודקת, כי היא רצה על תוכן הדגמה מוכן מראש. מי שרוצה להבין איך מזינים ידע ארגוני למערכת כזו, ההסבר נמצא בכתבה על מה זה RAG בהסבר פשוט, והתמונה הרחבה של מה סוכנים באמת עושים בעסק קטן ב-2026 נמצאת במבחן המציאות של סוכני AI.
ויש כאן עוד שכבה, שאף אחד לא מודד היום. המחקר המקורי של τ-bench, שפורסם ב-17.06.2024 על ידי Sierra, הציג מדד בשם pass^k: לא אם הסוכן הצליח פעם אחת, אלא אם הוא מצליח שוב ושוב על אותה משימה. התוצאה שם הייתה pass^8 מתחת ל-25% בקמעונאות. זה נתון מ-2024 ולא תמונת מצב עדכנית, ולוח התוצאות הנוכחי מציג pass^1 בלבד, כך שמספר עקביות עדכני פשוט לא פורסם. הרעיון עצמו נשאר תקף. ריצה מוצלחת אחת לא אומרת דבר על ריצה שמינית.
אם הכישלון מדיד, למה ההדגמה כל כך משכנעת?
כי תחושת השיפור אינה מדידה של שיפור, ויש לכך ניסוי מבוקר. METR פרסמה ב-10.07.2025 ניסוי מבוקר אקראי עם 16 מפתחים מנוסים על 246 משימות, שנאספו בין פברואר ליוני 2025. המשתתפים עבדו עם כלי AI והיו 19% איטיים יותר. לפני הניסוי הם ציפו להיות מהירים ב-24%, ואחרי שסיימו הם עדיין האמינו שהיו מהירים ב-20%.
המספר הזה כבר לא עומד לבדו, ומי שמצטט אותו היום מצטט חצי סיפור. ב-24.02.2026 פרסמה METR עדכון שבו היא מודיעה שהיא משנה את מבנה הניסוי. בסבב השני, שהתחיל באוגוסט 2025 עם 10 מהמפתחים המקוריים ועוד 47 חדשים, התוצאה הגולמית התהפכה לכיוון של האצה: האצה מוערכת של 18% אצל המפתחים המקוריים, ו-4% בלבד אצל החדשים, בשני המקרים עם רווח סמך שחוצה את האפס. METR עצמה כותבת שהנתונים האלה הם "ראיה חלשה מאוד", בין היתר משום שמפתחים החלו לסרב להשתתף כשנדרשו לעבוד בלי AI. כלומר: הקביעה ש-AI מאט מפתחים מנוסים אינה עומדת היום כעובדה נוכחית.
מה שכן שרד את העדכון הוא הממצא החשוב יותר לענייננו, והוא פער התפיסה. גם ב-2026 METR מציינת שהערכות עצמיות של מפתחים לגבי כמה הם הואצו "יכולות להיות בלתי אמינות למדי". הפער הזה, בין המדידה לבין ההרגשה, הוא בדיוק מה שהופך הדגמה למכשיר שכנוע חזק. ההדגמה מריצה תרחיש קצר, נקי ומוכר לספק, ומשאירה תחושה של מהירות. התחושה לא נבדקת מול שעון.
לצד זה יש עדות ברורה שהעזרה כן עובדת, אבל לא לכולם באותה מידה. Brynjolfsson, Li ו-Raymond בדקו 5,179 נציגי תמיכה ו-3 מיליון שיחות, ומצאו עלייה של 14% בפניות שנסגרות בשעה, אבל 34% אצל המתחילים וכמעט אפס אצל המנוסים. הנתון מגיע מנייר העבודה של NBER, שפורסם באפריל 2023 ועודכן בנובמבר 2023, וגרסת כתב העת שלו הופיעה ב-Quarterly Journal of Economics באפריל 2025. הכלי עצמו נפרס בעיקר בין נובמבר 2020 לפברואר 2021, כלומר לפני ChatGPT, ולכן מדובר בממצא על דפוס ולא במדידה של הכלים של היום. הדפוס הוא מה שרלוונטי כאן. מי שמריץ את ההדגמה מול הספק הוא בדרך כלל האדם הכי מנוסה בחדר, וזה בדיוק הפרופיל שאצלו נמצא השיפור הקטן ביותר.
המסקנה התפעולית פשוטה: עסק שלא מדד את זמן הטיפול לפני ההטמעה, ידווח על חיסכון שאין לו דרך לאשש. שווה לקרוא לצד זה את הניתוח של מתי סוכן AI באמת מחזיר את ההשקעה.
מה קרה לחברה שכן הפעילה סוכן בקנה מידה מלא
Klarna, שהעבירה את שירות הלקוחות שלה לסוכן AI, חזרה לגייס נציגים אנושיים. ב-09.05.2025 דיווח Entrepreneur שהמנכ"ל Sebastian Siemiatkowski הפך את המדיניות, כשהנימוק הוא שהבוט אמנם היה זול יותר, אבל האיכות הייתה נמוכה יותר. בציטוט שלו לסוכנות Bloomberg, כפי שהובא באותו דיווח: "Really, investing in the quality of human support is the way of the future for us". בתקופת המדיניות הקודמת כוח האדם בחברה ירד ב-22% ל-3,500 עובדים, ולפי אותו דיווח בעיקר בשל עזיבה טבעית ולא בשל פיטורים.
זו לא חברה שנכשלה בגלל תקציב קטן או בגלל שאין לה אנשי טכנולוגיה. זו חברה שהגיעה לגבול האיכות של סוכן שמנהל שיחות אמיתיות, וגילתה אותו אחרי ההשקה ולא לפניה.
בצד התחזיות, Gartner העריכה ב-25.06.2025 שיותר מ-40% מפרויקטי הסוכנים ייסגרו עד סוף 2027, בגלל עלויות מטפסות, ערך עסקי לא ברור ובקרות סיכון חסרות. באותה הודעה גרטנר גם העריכה שמתוך אלפי ספקים שמכריזים על עצמם כספקי סוכנים, רק כ-130 הם אמיתיים. שתי ההערכות האלה הן הערכת אנליסטים ולא מדידה, והן מגיעות מחברה שמוכרת ייעוץ בדיוק בתחום שהיא חוזה. שווה לקרוא אותן ככיוון, לא כנתון.
ומה קורה כשהשיחה מתנהלת בעברית?
עברית מוסיפה שכבת כשל שאינה מופיעה בשום הדגמה שנעשית באנגלית. ומה שמוזר הוא שדווקא בישראל השימוש גבוה במיוחד: לפי Anthropic Economic Index מ-15.09.2025, ישראל מדורגת ראשונה בעולם בשימוש ב-Claude ביחס לאוכלוסייה, עם מדד 7.0 מול 4.57 בסינגפור ו-4.10 באוסטרליה.
ובכל זאת, אין לספקים הגדולים מספר פומבי לאיכות העברית שלהם. Anthropic מפרסמת טבלת ביצועים רב-לשונית על פני 14 שפות, ועברית אינה ברשימה, לפי התיעוד של Anthropic.
בזיהוי דיבור התמונה מדידה יותר. ElevenLabs מסווגת בתיעוד שלה את העברית ב-Scribe v2 בדרגת Good, כלומר שיעור שגיאת מילים שבין 10% ל-20%, בעוד שאנגלית, צרפתית וגרמנית מסווגות Excellent עם עד 5%. המחקר הישראלי מדויק יותר: ivrit.ai, בשיתוף מכון ויצמן והדסה, פרסמה ב-Interspeech 2025 (אוגוסט 2025) תוצאות של 6.2% שגיאה על מאגר הבדיקה הנקי, 11.3% על KAN, 20.7% על Common Voice ו-24.1% על FLEURS, לפי ISCA Archive.
התרגום התפעולי: על הקלטה נקייה בעברית התמלול מדויק. על שיחת טלפון אמיתית, עם רעש רקע, מבטא ושני דוברים, אחת מכל ארבע או חמש מילים עלולה להישמע אחרת. הדגמה של סוכן קולי שנעשית בחדר שקט לא בודקת את זה בכלל. מי ששוקל סוכן שעונה לטלפון, שווה לעבור קודם על סוכן קולי לעסק קטן ושיחות שלא נענות ועל השוואת כלי תמלול בעברית. הפירוט המלא של מה כל ספק מתעד ומה הוא לא מתעד בעברית מרוכז בבדיקה של תמיכת סוכני AI בעברית.
איך מריצים פיילוט שחושף את הכשל לפני החתימה?
מריצים על התוכן של העסק ולא על תוכן ההדגמה של הספק, בשיחות שלמות ולא בשאלות בודדות, וכמה פעמים על אותה שאלה. זה כל הסוד, והוא לוקח בערך שבוע עבודה מפוזר.
לשלוף 30 שיחות אמיתיות מהחודש האחרון
מהוואטסאפ, מהמייל או מהטלפון. לא שאלות שנכתבו לצורך הבדיקה, כי אלה תמיד יוצאות נקיות מדי.
להריץ כל שיחה בארבעה תורים לפחות
זה התרחיש שבו CRMArena-Pro מדדה ירידה מ-58% ל-35%. שאלה בודדת פשוט לא בודקת אותו.
לשתול שאלה שהתשובה שלה קיימת רק בנוהל פנימי
חריג במדיניות ביטולים, מחיר ללקוח ותיק, תנאי אספקה לאזור מסוים. זה מבחן τ³-Knowledge בגרסה של העסק.
להריץ כל תרחיש חמש פעמים
ולספור בכמה מהן התשובה זהה. זה ההיגיון של pass^k בגרסה שאפשר לעשות ידנית.
לבדוק מה קורה כשהסוכן לא עונה בכלל
הודעה שנשלחה ולא נענתה נראית ללקוח כמו התעלמות, ובעסק היא לא נספרת בכלל.
להריץ בעברית מדוברת, לא בעברית כתובה יפה
עם שגיאות כתיב, קיצורים והודעות קוליות, כמו שלקוחות באמת כותבים ומדברים.
התקלות השקטות ראויות להדגשה נפרדת, כי הן היחידות שאף אחד לא מתלונן עליהן. n8n מתעדת בתיעוד הרשמי שלה ארבע תקלות נפוצות בצומת ה-AI Agent, בהן שגיאת ערך ריק בפרומפט, גרסה ישנה של צומת הזיכרון בתבנית מועתקת, ומודל שיחה שלא חובר. מבחינת הלקוח כל אחת מהן נראית אותו דבר: הודעה שנשלחה ולא נענתה. למי שמריץ את n8n על שרת משלו נוסף כאן שיקול נפרד לגמרי, והוא מפורט במדריך אבטחת n8n בהתקנה עצמית.
מה בדיוק מודדים בפיילוט?
שישה מספרים, וכולם נספרים ידנית בטבלה אחת. אין צורך בכלי מדידה, יש צורך במשמעת.
שיעור סגירה ללא אדם
כמה שיחות נסגרו במלואן בלי מעורבות אנושית, מתוך 30.
שיעור עקביות
מתוך חמש הרצות של אותו תרחיש, בכמה התקבלה אותה תשובה.
תשובות שגויות בביטחון
המסוכנות ביותר, כי הלקוח לא יודע שהתשובה שגויה ופועל לפיה.
זמן טיפול לפני ואחרי
נמדד בשעון על עשר פניות לפני ההטמעה, אחרת אין למה להשוות.
עלות לפי יחידת החיוב האמיתית
תוצאה, קרדיט או דקה, ולא מחיר מנוי חודשי שמופיע בעמוד הראשי.
מספר הפניות שהסוכן לא ענה עליהן בכלל
הכשל השקט. אם אף אחד לא סופר אותו, הוא לא מופיע בשום דוח.
שווה לשים לב לסעיף השלישי ברשימה. שיעור התשובות השגויות בביטחון מתקשר ישירות לאופן שבו מודלים ממציאים פרטים כשחסר להם מידע, וההסבר המלא נמצא בכתבה על הזיות AI בעסק קטן.
איפה בדיוק שמים את המסירה לאדם?
בארבע נקודות קבועות, ורצוי להגדיר אותן לפני ההשקה ולא אחרי התלונה הראשונה. הכלל הפשוט: כל מקום שבו טעות עולה כסף, פוגעת בלקוח או נוגעת במידע אישי, מקבל אדם בלולאה.
כל פעולה שמזיזה כסף
זיכוי, ביטול, הנחה, שינוי תנאי תשלום. הסוכן מכין את הפעולה, אדם מאשר אותה.
כל שיחה שנוגעת במידע אישי רגיש
CRMArena-Pro מצאה מודעות סודיות כמעט אפסית. זו לא הגדרה שאפשר לתקן בפרומפט.
התור השלישי בלי פתרון
אם אחרי שלושה מהלכים הנושא לא נסגר, מעבירים לאדם. כאן מתחיל האזור שבו הביצועים נופלים.
לקוח שמביע תסכול
זה בדיוק המקום שבו Klarna דיווחה על ירידת איכות. מסירה מיידית, בלי ניסיון נוסף.
מי שבונה את המסלול הזה בוואטסאפ ימצא את הפירוט המעשי בכתבה על סוכן שירות לקוחות בוואטסאפ. הסעיף השני ברשימה, זה שנוגע במידע אישי, נשען על סיבה נוספת מלבד איכות התשובה: קלט שמגיע מזרים יכול להכיל הוראות מוסתרות, וזה בדיוק הנושא של הכתבה על הזרקת פקודות לסוכן דרך מייל.
מהו שיעור הכלה ריאלי, ומה זה אומר על הכסף?
אין מספר אחד, ויש טווח שאפשר לעגן בשני קצוות מדודים. בקצה העליון, Intercom מפרסמת בעמוד הבית של Fin, נכון לבדיקה ב-31.08.2026, ש-Fin מגיעה לשיעור פתרון ממוצע של 76% על פני יותר מ-12,000 לקוחות, ושחלק מהלקוחות עוברים 85%. זו הצהרה של הספק על המוצר שהוא מוכר, בלי מתודולוגיה שפורסמה ובלי מדידה חיצונית, ולכן היא קצה עליון ולא ממוצע שאפשר לצפות לו. בקצה התחתון, אותן משימות CRM מורכבות בשיחה רב-סבבית נמדדו על כ-35% במחקר עצמאי.
ההפרש בין 35% ל-76% הוא לא ויכוח, הוא הבדל בתמהיל המשימות. פניות פשוטות וחוזרות, שעות פתיחה, מצב הזמנה, מדיניות החזרות, יושבות בקצה הגבוה. פניות שמערבות חריגים, כמה מהלכים וידע פנימי, יושבות בקצה הנמוך. עסק שרוב הפניות אליו מהסוג הראשון יראה מספר גבוה, ולהיפך. המספר היחיד שקובע הוא זה שיוצא מהפיילוט של העסק עצמו.
ומכאן לכסף. בדף התמחור של Fin, שנבדק ב-31.08.2026, המחיר הוא 0.99 דולר לכל תוצאה, במינימום 50 תוצאות בחודש, בלי דמי הקמה או פלטפורמה. עסק עם 300 פניות בחודש ושיעור פתרון של 76% מגיע ל-228 תוצאות, כלומר כ-226 דולר לחודש. אם שיעור הפתרון בפועל יוצא 45%, מדובר ב-135 תוצאות וכ-134 דולר, אבל גם ב-165 פניות שחוזרות לאדם. כדאי לחשב את שתי השורות, לא רק את הראשונה. הרחבה על השאלות שכדאי לשאול לפני חתימה נמצאת בכתבה על חמש שאלות לפני שקונים כלי AI חדש.
שני מספרים אחרונים שנותנים פרופורציה. Gartner דיווחה ב-15.04.2026, על בסיס סקר ה-CIO והמנהלים הטכנולוגיים שלה לשנת 2026, שרק 17% מהארגונים פרסו סוכני AI בפועל, בעוד יותר מ-60% מצפים לעשות זאת בתוך שנתיים. ובדוח GenAI Divide של MIT NANDA מיולי 2025, שהתבסס על 52 ראיונות מובנים, ניתוח של יותר מ-300 יוזמות פומביות ו-153 תשובות סקר, שיעור ההגעה לפריסה עמד על כ-67% כשהיה שותף חיצוני מול כ-33% בבנייה פנימית. הדוח עצמו מגדיר את הממצאים שלו "ממצאים מוקדמים", ומבהיר שהמספרים נשענים על דיווח עצמי של המרואיינים ולא על מדידה חיצונית. הכיוון בכל זאת ברור מספיק כדי לשקול אותו. עסק של עד 20 עובדים בלי איש טכנולוגיה ייעודי נמצא בצד הפחות טוב של המשוואה כשהוא בונה לבד.
הצעד לשבוע הקרוב
לפתוח טבלה, לשלוף 20 שיחות אמיתיות מהחודש האחרון, ולהריץ כל אחת מהן דרך גרסת הניסיון של הסוכן בארבעה תורים לפחות, פעמיים כל אחת. לספור שלושה מספרים בלבד: כמה נסגרו בלי אדם, בכמה התשובה הייתה זהה בשתי ההרצות, וכמה תשובות היו שגויות. שעה וחצי עבודה. שלושת המספרים שיוצאים מהטבלה הזו שווים יותר מכל הדגמה שאפשר לראות, כי הם נמדדו על העסק הזה ולא על עסק אחר.
שאלות נפוצות
למה סוכן AI מצליח בהדגמה ונכשל מול לקוח אמיתי?
כי ההדגמה בודקת סבב שאלה ותשובה יחיד, ולקוח אמיתי מנהל שיחה של כמה מהלכים, מוסיף פרטים תוך כדי ומצפה שהסוכן יזכור מה נאמר קודם. במחקר CRMArena-Pro של Salesforce מ-24.05.2025 שיעור ההצלחה באותן משימות עצמן ירד מכ-58% בסבב יחיד לכ-35% בשיחה רב-סבבית. הכשל אינו בהגדרה של העסק אלא בסוג התרחיש שנבדק בהדגמה.
מה קורה לסוכן כשמוסיפים לו את הידע הפנימי של העסק?
רמת הקושי קופצת, ובלוח התוצאות של Sierra Research שנבדק ב-31.08.2026 זה נראה כך: במבחן τ²-bench Text המוגדר היטב המובילים עומדים על 85.3% עד 87.9%, ואילו במבחן τ³-Knowledge, שמוסיף ידע ארגוני אמיתי בבנקאות, המובילים הם מודלים אחרים ומגיעים ל-47.9% עד 55.2% בלבד. נהלים פנימיים, מחירונים וחריגים הם בדיוק החלק שההדגמה של הספק אינה בודקת, כי היא רצה על תוכן הדגמה מוכן מראש.
כמה שיחות צריך כדי לבדוק סוכן לפני שחותמים?
כ-30 שיחות אמיתיות מהחודש האחרון, כל אחת בארבעה תורים לפחות, וכל תרחיש בכמה הרצות חוזרות כדי לבדוק עקביות. השיחות צריכות להיות שיחות שהיו באמת, מהוואטסאפ או מהמייל, ולא שאלות שנכתבו לצורך הבדיקה. שאלות מומצאות יוצאות נקיות מדי ומייצרות תוצאה גבוהה שלא תחזור על עצמה בייצור מול לקוחות.
האם שיעור הפתרון שהספק מפרסם רלוונטי לעסק שלי?
רק כנקודת ייחוס. Intercom מפרסמת ש-Fin מגיעה ל-76% פתרון ממוצע על פני יותר מ-12,000 לקוחות, אבל זו הצהרה של הספק על מוצר שהוא מוכר. מחקר על משימות CRM מורכבות בשיחה רב-סבבית נותן כ-35%. התמהיל של הפניות בעסק קובע היכן בטווח הזה התוצאה תיפול.
למה כדאי למדוד את זמן הטיפול לפני ההטמעה ולא רק אחריה?
כי תחושת החיסכון אינה מדידה שלו. בניסוי מבוקר של METR מ-10.07.2025, מפתחים מנוסים עם כלי AI היו 19% איטיים יותר, ובכל זאת האמינו בסיום שהיו מהירים ב-20%. בעדכון מ-24.02.2026 METR מדווחת שהתוצאה הגולמית התהפכה לכיוון של האצה, אך מגדירה אותה "ראיה חלשה מאוד". פער התפיסה עצמו נשאר: בלי מדידת בסיס לפני ההטמעה, אין דרך לדעת אם החיסכון קיים או שהוא רק מורגש.