יחידה SKILL-EVAL · SYSTM Daily Public Lab
סקיל בדיקת fixtures לסוכן
Daily Public Lab · 2026-09-11סקיל לשימוש חוזר עם trigger, קלט ופלט יציבים, suite עובד ו-fixture חסום שמוכיח את שער הכשל.
תוכן10
מה מקבלים
סקיל לשימוש חוזר עם trigger, קלט ופלט יציבים, suite עובד ו-fixture חסום שמוכיח את שער הכשל.
כלל ההחלטה
כל case נבדק מול equals, contains, notContains או type. מבנה חסר, נתיב לא תקין או assertion לא נתמך מחזירים block.
מה הכלי אינו עושה
הוא אינו מפעיל מודל ואינו מודד איכות כללית. pass מתייחס רק לפלטים השמורים ול-assertions שסופקו.
מקורות ראשיים
- OpenAI — Evaluation best practices — ללא תאריך מוצג; נבדק 11.09.2026. הדף מציין שה-Evals platform הישן נמצא בתהליך הוצאה משימוש; החבילה אינה תלויה בו.
- NIST AI RMF Core — Measure — מסגרת 1.0 פורסמה 26.01.2023; נבדק 11.09.2026.
- JSON Schema Draft 2020-12 — פורסם 16.06.2022; נבדק 11.09.2026. החבילה אינה טוענת למימוש מלא של JSON Schema.
המפרט
- הרצה
- Node.js, מקומית וללא רשת או מודל
- קלט
- eval-suite.json עם פלטים שמורים ו-assertions
- פלט
- pass / block ורשימת assertions שנכשלו
- מגבלה
- בדיקת fixtures שסופקו; לא מדד איכות כללי ולא הוכחת מוכנות
שלוש הדקות הראשונות
1
מורידים ובודקיםפותחים את הקובץ המצורף ומריצים את ה-suite או את בדיקת ה-smoke.
npm test
node bin/eval-regression.mjs fixtures/eval-suite.json --text2
שומרים casesמוסיפים קלט ופלט שנבדקו ידנית, בלי פרטים אישיים, ומגדירים מה חייב להישאר יציב.
3
מריצים בכל שינוימריצים אחרי שינוי prompt, מודל או כלי; expected values מתעדכנים רק לאחר סקירה אנושית.
פקודת התחלה
npm test
node bin/eval-regression.mjs fixtures/eval-suite.json --textגבול הבדיקה
הפלט מתייחס רק ל-fixtures ול-assertions שסופקו. אין בו קריאת מודל, שיפוט סמנטי פתוח או הוכחת איכות.
קבצים להורדה
איפה זה נכנס אצלנו
החבילה הופכת פלטים שנבדקו ל-regression gate שאפשר להריץ בכל שינוי. היא מיישמת תהליך בדיקה חוזר בלי לטעון לתאימות רשמית או למדד איכות כולל.
