רגע, מה זה בכלל טוקנים?
טוקנים הם יחידות המידע שהמודל קורא וכותב. טקסט, קוד, קבצים והיסטוריית השיחה מתחלקים לטוקנים, וככל שהמודל צריך לעבד יותר מהם - כך גדלים השימוש והעלות.
יש עוד מושג חשוב שכדאי להכיר: Cache.
ה-Cache הוא זיכרון זמני. Claude לא באמת "זוכר" את כל השיחה כמו בן אדם. בכל פעם שאנחנו שולחים הודעה חדשה, הוא מקבל שוב את ההקשר של השיחה הקודמת כדי להבין מה קורה. אם חלק גדול מהמידע כבר נשלח קודם ולא השתנה, Claude יכול להשתמש בעותק שנשמר בזיכרון הזמני במקום לעבד את כולו מחדש. הקריאה הזאת חסכונית הרבה יותר.
כשעובדים עם כלי פיתוח מתקדם כמו Claude Code, הטוקנים הם המנוע של המערכת- אבל הם גם משפיעים על מכסת השימוש והעלות שלנו. ככל שהמודל קורא יותר קוד וקבצים שלא לצורך, חלון ההקשר מתמלא, התשובות נהיות איטיות ומבולבלות יותר, והתקציב נגמר מהר.
הנה מדריך פרקטי ופשוט, שלב אחרי שלב, שיעזור לכם לחסוך בטוקנים ולשמור על עבודה מהירה ויעילה! 🚀
🔹 1. צרו מבנה תיקיות מסודר עם קובץ ניווט
צרו קובץ md ראשי בפרויקט שישמש כ"ראוטר" (מפת דרכים). הקובץ הזה יסביר למודל בקצרה איפה כל רכיב נמצא, כך שהוא יקרא רק את הקבצים הרלוונטיים למשימה ולא יסרוק את כל הפרויקט סתם.
🔹 2. שמרו על קבצים קצרים
משתמשים בקבצי md להנחיות? השתדלו לשמור אותם קצרים וממוקדים. קבצים קצרים וממוקדים עוזרים למודל לטעון לזיכרון רק את מה שבאמת נחוץ באותו רגע.
🔹 3. פתחו שיחה חדשה לכל נושא
אל תגררו שיחה אחת ארוכה! ככל שהשיחה ארוכה יותר, יותר היסטוריה נשלחת שוב למודל בכל הודעה. חלק ממנה אמנם יכול להיקרא מה-Cache בצורה חסכונית יותר, אבל הוא עדיין תופס מקום בחלון ההקשר. סיימתם משימה? פתחו שיחה חדשה. צריכים בכל זאת להמשיך את השיחה? הפעילו את הפקודה /compact. ככה הכלי יסכם את השיחה ויקטין את חלון ההקשר לפני שממשיכים.
🔹 4. החזיקו צוות סוכנים ממוקד
חלקו את המשימות בין סוכנים שונים (לדוגמה: סוכן לעיצוב, סוכן לבסיס הנתונים וכו'). הגדירו לכל סוכן לקרוא רק את הקבצים הרלוונטיים אליו, בלי להעמיס במידע מזהם. כך גם מידע רב שסוכן אחד צריך לקרוא לא בהכרח נשאר בתוך השיחה הראשית.
🔹 5. השתמשו במודל שמתאים למשימה לא כל משימה צריכה את המודל החזק והיקר ביותר. למשימות פשוטות אפשר להשתמש במודל זול ומהיר יותר ובמצב חשיבה נמוך, ולשמור מודל חזק כמו Opus ומצב חשיבה גבוה למשימות שבאמת דורשות חשיבה מורכבת. כמשתמשים בסוכנים מומלץ יש להגדיר לכל סוכן את המודל שבו הוא ישתמש ורמת החשיבה שלו בהתאם למשימות שהוא מבצע.
🔹 6. כותבים באנגלית? זה חוסך!
בשפות כמו עברית, המודל משתמש בדרך כלל ביותר טוקנים עבור אותה כמות מידע בהשוואה לאנגלית. אם נוח לכם לכתוב הנחיות או הערות באנגלית- זה פתרון חסכוני במיוחד.
🔹 7. הציבו גבול לקבצים גדולים
תכתבו הנחיה ברורה בקובץ ה-md הראשי: "אם קובץ עולה על מספר שורות מסוים (למשל 200 שורות), שאל אותי קודם אם נחוץ לקרוא אותו". הטיפ הקטן הזה יכול למנוע קריאה של קבצי ענק ללא צורך.
🔹 8. השתדלו לא לחזור לסשן גדול אחרי הפסקה ארוכה
ה-Cache (הזיכרון הזמני של השיחה) לא נשמר לנצח. הוא יכול להישמר עד כשעה. לכן אם חוזרים לסשן גדול אחרי הפסקה ייתכן שההיסטוריה כבר לא נמצאת ב-Cache. לפעמים דווקא הודעה קטנה בסשן ישן עלולה לגרום לעיבוד מחדש של הרבה מאוד מידע.
🔹 9. תנו הנחיות קצרות וברורות לSkills
בתחילת כל Skill או כלי שהמודל מפעיל, הגדירו בדיוק מתי להשתמש בו. כשההנחיה קצרה וממוקדת, קל יותר למודל להבין מתי באמת צריך להשתמש בכלי, בלי להעמיס הוראות מיותרות.
🔹 10. אל תעמיסו MCP שלא לצורך
העדיפו API על פני MCP. שימוש בmcp לעיתים טוען לחינם הרבה כלים, במקום לטעון כל פעם רק את היכולת הנדרשת.
🔹 11. השתמשו בכלי אופטימיזציה לטוקנים
הכירו את הכלי token-optimizer שמסייע לצמצם ולנקות את נפח הטוקנים ביעילות.
הקישור לכלי: https\://github.com/alexgreensh/token-optimizer
בנוסף, כדאי מדי פעם להריץ: /usage. הפקודה מאפשרת לראות את מצב מכסת השימוש שלכם. אפשר גם להשתמש ב-/context כדי לראות מה תופס מקום בחלון ההקשר ולנתח את השימוש שלכם.
למה זה חשוב לנו ואיך זה עוזר באופן מעשי?
החיסכון בטוקנים הוא לא רק עניין של מחיר – הוא משנה לחלוטין את חווית הפיתוח:
💡 תשובות מדויקות יותר: כשהמודל לא מוצף במידע מיותר, הוא נשאר ממוקד במשימה ולא מתבלבל או שוכח הנחיות.
💡 מהירות עבודה: פחות טוקנים מיותרים לקריאה ולעיבוד = עבודה מהירה יותר.
💡 חיסכון כספי משמעותי: צמצום טוקנים ושימוש נכון ב-Cache יכולים לחסוך משמעותית בעלויות ובמכסת השימוש.
