ChatGPT מצב קול במחשב: מדברים לדסקטופ, והוא מפעיל כמה סוכנים בבת אחת

ChatGPT מצב קול במחשב: מדברים לדסקטופ, והוא מפעיל כמה סוכנים בבת אחת
23.7.2026 · OpenAI · ChatGPT · Codex · גרסה 26.715
ב-23 ביולי 2026 OpenAI הכריזה רשמית שמצב הקול של ChatGPT נכנס לאפליקציית הדסקטופ ל-Mac ול-Windows, בגרסה 26.715. זה לא עוד "מיקרופון שמכתיב טקסט": זו יכולת לדבר עם המחשב ולתאם דרכו כמה סוכני AI שרצים בו-זמנית ב-ChatGPT Work וב-Codex. ההודעה הרשמית מנוסחת בדיוק כך: "Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice."
בשורה אחת: מה זה מצב קול של ChatGPT במחשב
מצב קול (ChatGPT Voice) הוא שיחה חיה עם ChatGPT באפליקציית הדסקטופ, שבה אפשר לקטוע אותו באמצע משפט ולהמשיך לדבר בזמן שהוא כבר מבצע. הוא מבוסס על מודל בשם GPT-Live, זמין למנויי Plus, Pro, Business, Edu ו-Enterprise, ופועל רק באפליקציה המותקנת - לא בדפדפן.
מה זה בעצם מצב קול באפליקציית הדסקטופ
מצב הקול החדש בנוי משני מודלים שעובדים יחד, וזה ההסבר לכל מה שמרגיש שונה בו. לפי התיעוד של OpenAI, GPT-Live מנהל את השיחה החיה, ובמקביל GPT-5.6 Terra הוא זה שמתחיל ומתאם את המשימות בתוך האפליקציה. במילים אחרות: מודל אחד מדבר איתכם, מודל שני עובד ברקע, ואתם לא צריכים לחכות שאחד מהם יסיים כדי לפנות לשני.
הרשימה הרשמית של מה שאפשר לעשות בקול ב-Work וב-Codex כוללת חמישה דברים: להתחיל משימה, לתעדף אותה, לקטוע או להסיט אותה בזמן שהעבודה ממשיכה ברקע; לתאם כמה סוכנים בכמה שיחות ופרויקטים; לחזור לעבודה קיימת עם ההקשר והכלים המחוברים שכבר יש לה, כולל מסמכים, יומן, אנשי קשר ותקשורת; לקבל עדכוני התקדמות בקול או על המסך, כולל כשמשימה נתקעה או הסתיימה; ולראות מתי ChatGPT מקשיב, עם אפשרות להשתיק את המיקרופון באמצע.
איך מפעילים מצב קול ב-ChatGPT במחשב, צעד אחר צעד
התהליך עצמו קצר, אבל יש בו נקודה אחת שמפילה כמעט את כולם בפעם הראשונה. אלה השלבים לפי התיעוד הרשמי:
פותחים צ'אט או משימה חדשים ולגמרי ריקים באפליקציית הדסקטופ של ChatGPT.
בוחרים Start new voice chat - לפני ששולחים הודעה כלשהי.
בפעם הראשונה מאשרים גישה למיקרופון, בוחרים קול, ובמק גם עוברים על הגדרת ההקשר מהמסך.
מתחילים לדבר. בסיום לוחצים End. כדי לחזור לשיחה קולית קודמת פותחים אותה ובוחרים Start voice chat.
הנקודה שמפילה את כולם: שיחה חייבת להתחיל במצב קול. אם התחלתם להקליד ואז לחצתם על המיקרופון, קיבלתם הכתבה קולית - הדיבור שלכם הופך לטקסט בתיבה ואתם עדיין צריכים ללחוץ שליחה. זו לא אותה יכולת. מצב קול הוא שיחה חיה שבה אפשר לקטוע ולהמשיך לדבר; הכתבה היא רק דרך אחרת להקליד.
שתי הערות שחוסכות זמן. הראשונה: אפשר לקבוע קיצור מקשים ייעודי לפתיחת שיחה קולית ב-Settings > Voice > Voice chat hotkey. OpenAI לא מפרסמת ברירת מחדל לקיצור הזה, אז צריך להגדיר אותו פעם אחת. השנייה: רק שיחה קולית אחת יכולה להיות פעילה בכל האפליקציה בו-זמנית, כך שאם משהו לא נפתח - כדאי לבדוק שאין שיחה קולית פתוחה בחלון אחר.
מלכודת האפליקציה הלא נכונה: מאז 9 ביולי 2026 יש אפליקציית דסקטופ אחת חדשה שמאחדת Chat, Work ו-Codex. האפליקציה הישנה שונתה לשם ChatGPT Classic והיא ממשיכה לקבל עדכוני מודלים ותיקוני אבטחה, אבל לא את יכולות הסוכנים החדשות. אם פתחתם את האפליקציה ואין שום זכר למצב קול, סביר שאתם פשוט בגרסה הישנה.
מה ההבדל בין מצב קול מתקדם לבין GPT-Live
מצב הקול הקודם, Advanced Voice Mode, עבד בתורות: אתם מדברים, המודל מזהה שהפסקתם, ורק אז עונה. OpenAI מתארת את הבעיה במפורש - זיהוי סוף התור מבוסס על שקט, ולכן גם הפסקה קצרה או רעש רקע יכלו להתפרש כ"סיימתי" ולגרום למודל לקטוע אתכם בזמן הלא נכון. GPT-Live בנוי אחרת: הוא מעבד קלט ומייצר פלט ברצף, ומקבל החלטות כמה פעמים בשנייה אם לדבר, להמשיך להקשיב, לעצור, לקטוע או להפעיל כלי. זה גם מה שמאפשר לו להעביר משימה כבדה למודל אחר ולהמשיך לדבר איתכם בזמן שהיא רצה.
| Advanced Voice (הקודם) | GPT-Live (החדש) | |
|---|---|---|
| אופן השיחה | תורות: מדברים, מחכים, מקבלים תשובה | מקשיב ומדבר באותו הזמן |
| קטיעה באמצע | מבוססת זיהוי שקט, נוטה לטעות ברעש רקע | חלק מהתכנון של המודל |
| שיתוף מסך ווידאו | נתמך | לא נתמך בהשקה. במק יש במקום זה Appshots |
| הפעלת סוכנים בקול | לא | כן, ב-Work וב-Codex באפליקציית הדסקטופ |
| GPTs מותאמים אישית | נתמך | לא נתמך, ממשיכים לעבוד עם Advanced |
בהגדרות אפשר לבחור בין שלוש אפשרויות קול: Live (החדשה), Advanced (הקודמת, ומי שצריך שיתוף מסך או וידאו בנייד עדיין זקוק לה) ו-Standard (שמתמללת את מה שאמרתם ורק אז עונה). יש גם הגדרת Intelligence עם שלוש רמות - Instant, Medium ו-High - שקובעת כמה עומק חשיבה המודל משקיע בשאלות קשות. רמה גבוהה יותר עונה לאט יותר, במיוחד כשהיא מחפשת ברשת.
שליטה קולית בכמה סוכנים במקביל ב-Work וב-Codex
זה החלק שבאמת חדש. עד עכשיו, כדי להריץ שלוש משימות במקביל, הייתם צריכים לפתוח שלושה שרשורים ולהקליד בכל אחד. עכשיו אומרים משפט אחד, והוא מתפצל. OpenAI מפרסמת בתיעוד שלוש דוגמאות לפקודות קוליות שמאצילות עבודה: "עבור על הבריף של ההשקה היום וסכם לי אילו החלטות מחכות לאישור", "תתחיל משימת Codex שמריצה את הבדיקות ובודקת כל מה שנכשל", ו"תבדוק מה המשימות הפעילות ותסכם לי מה תקוע".
פעם: מקלידים כל הוראה
שיחת טקסטכל משימה נוספת דורשת לעצור את מה שעושים ולהתחיל להקליד מחדש.
עכשיו: אומרים וממשיכים
ChatGPT Voiceאפשר לקטוע, לתקן ולהוסיף הוראה - בלי לעצור את מה שכבר רץ.
חשוב להבין מה הקול לא עושה: הוא לא מוסיף לכם הרשאות. לפי התיעוד, מצב הקול פועל בדיוק לפי אותן הרשאות של הצ'אט, ה-Work או ה-Codex שהוא מפעיל. ברירת המחדל היא "מבקש אישור" - הסוכן קורא ועורך קבצים בתיקיית העבודה ומריץ פקודות שגרתיות, ושואל לפני שהוא יוצא לאינטרנט או חורג מגבולות התיקייה. מצבים רחבים יותר צריך להדליק מראש בהגדרות.
כשה-ChatGPT רואה את המסך: Screen Context ו-Appshots במק
GPT-Live לא תומך בשיתוף מסך או וידאו, ובמק OpenAI נתנה במקום זה משהו אחר: Appshots. מדליקים Screen context ב-Settings > Voice, ואז באמצע שיחה אומרים "Take a look at this". ChatGPT מצלם את החלון הקדמי ומשתמש בו כהקשר. אפשר גם לצלם ידנית בכל רגע בלחיצה על שני מקשי ה-Command יחד, או בקיצור מקשים משלכם.
שלושה דברים ששווה לדעת לפני שמפעילים את זה. ראשית, appshot לוקח יותר ממה שרואים: הוא כולל גם את תמונת החלון וגם את הטקסט הנגיש שלו, כולל טקסט שנמצא מחוץ לאזור הגלילה הנראה. OpenAI כותבת את זה במפורש ומזהירה לא לשתף חלונות עם מידע רגיש. שנית, במק צריך לאשר שתי הרשאות מערכת: Screen & System Audio Recording ו-Accessibility. שלישית, יש עיוורון מתועד: ב-Google Docs, Gmail, Google Sheets ו-Google Slides ChatGPT מקבל לרוב רק את הצילום הנראה ולא את המסמך המלא. Appshots קיים רק במק - בווינדוס אין לו מקבילה.
Remote באייפון: להפעיל את הסוכנים מהנייד
אפשר להמשיך לדבר עם הסוכנים גם כשאתם לא מול המחשב, דרך Remote. הפרט שכדאי לדעת מראש: הצימוד מתחיל מהמחשב, לא מהטלפון. פותחים את האפליקציה במחשב המארח, בוחרים Set up Remote בסרגל הצד, סורקים מהטלפון את קוד ה-QR ומאשרים את אותו חשבון ואותה סביבת עבודה. כל טלפון מצומד לכל מחשב בנפרד.
שלושה סייגים אמיתיים. הראשון: Remote עצמו תומך ב-iOS ובאנדרואיד, אבל מצב קול דרך Remote מתועד לאייפון בלבד. OpenAI לא אומרת אם אנדרואיד מוחרג בכוונה או שהוא פשוט עוד לא הגיע. השני: המחשב המארח חייב להישאר ער, מחובר ומחובר לאותו חשבון. במקבוק זה עובד עם המכסה פתוח וחיבור לחשמל; עם מכסה סגור צריך גם מסך חיצוני, ובחירה ב-Sleep עוצרת את הגישה. השלישי: הכל בא מהמחשב, לא מהטלפון - הקבצים, ההרשאות, הכלים המחוברים והאתרים שאתם מחוברים אליהם. הטלפון הוא שלט, לא סביבת עבודה.
מגבלות שימוש: כמה דקות דיבור מקבלים בכל מסלול
זה הפרט שהכי חסר בכל הכתבות על ההשקה, והוא זה שיקבע אם היכולת שימושית לכם ביומיום. מצב הקול בדסקטופ צורך מכסה נפרדת משלו, שנמדדת בחלונות מתגלגלים של חמש שעות:
| מסלול | דיבור בכל חלון של 5 שעות |
|---|---|
| Plus | כ-15 עד 30 דקות |
| Pro (100 דולר לחודש) | כשעה עד שעתיים וחצי |
| Pro (200 דולר לחודש) | ללא הגבלה |
| Business | כ-45 דקות |
| Enterprise / Edu (ותיק) | כ-45 דקות |
שתי הערות שמשנות את התמונה. הראשונה: גם "ללא הגבלה" ב-Pro הגבוה הוא רק על הדיבור. המשימות שהקול מפעיל ממשיכות לצרוך את מכסת ה-Codex הרגילה שלכם. השנייה: בסביבות עבודה עסקיות עם חיוב לפי קרדיטים, דקת דיבור בדסקטופ עולה כ-6 קרדיטים - כפול מהמחיר של שיחה קולית רגילה בצ'אט. ובכל מקרה, מצב הקול בדסקטופ לא זמין דרך מפתח API.
לארגונים: ב-Enterprise וב-Edu ההשקה מתחילה בתקופת גישה מוקדמת של שבועיים, ובמהלכה מנהל סביבת העבודה חייב להדליק גם את Voice וגם את Early Model Access. אם Voice דלוק אבל Early Model Access כבוי, העובדים ימשיכו לראות רק את מצב הקול הישן.
האם מצב הקול עובד בעברית
התשובה הכנה: OpenAI לא מפרסמת רשימת שפות נתמכות ל-GPT-Live, ולא אומרת מילה על עברית ספציפית. מה שהיא כן אומרת זה שהמודל עבר אופטימיזציה ל"חלק מהשפות הפופולריות ב-ChatGPT", ושבשפות מסוימות הוא עלול להישמע במבטא לא ילידי או לסבול מפערי שטף. יש הגדרת שפה ב-Settings > Voice > Language, ובחירה בשפה שאתם מדברים בה בפועל משפרת את דיוק הזיהוי. אפשר גם לבקש ממנו באמצע שיחה לעבור לשפה אחרת.
ההמלצה המעשית: אל תסמכו על התמלול העברי כשהפעולה בצד השני היא בלתי הפיכה. תמלולי הקול, לפי OpenAI, אינם רשומה מילה במילה של מה שנאמר. לפני שמאשרים מחיקה, שליחת מייל או שינוי בקובץ - שווה להעיף מבט בטקסט על המסך ולוודא שהוא הבין נכון.
מה זה נותן לבעל עסק ולפרילנסר, לא רק למפתחים
OpenAI הדגימה את היכולת דרך תרחיש קידוד - מפתח שביקש בקול אחד לפתוח שרשור חדש, לפתוח בקשת מיזוג ולאתר את שורש הבאג, ושלושת הדברים קרו במקביל בזמן שהוא המשיך לדבר. הדפוס הזה, ולא הקוד, הוא מה שרלוונטי לכולם:
בעל עסק: לפתוח את היום בקול
"תבדוק מה קרה עם הדוח שביקשתי אתמול, ותתחיל לסכם לי את הפניות של השבוע" - שתי משימות יוצאות לדרך ב-Work, ואתם ממשיכים לענות למיילים בזמן שהן מתקדמות. העדכון חוזר אליכם בקול כשמשהו מסתיים או נתקע.
מול מסמך פתוח: לשאול בלי לתאר
במק, כשגיליון או חוזה פתוחים מולכם, אומרים "תסתכל על זה" ואז שואלים ישירות על מה שרואים. אין צורך להעתיק, לצרף או להסביר במילים איזה טור מעניין אתכם.
בזמן ריבוי משימות: יד אחת פנויה
כשהידיים תפוסות במשהו אחר, נותנים הוראה בקול והעבודה מתקדמת בלי לעצור את מה שעושים. עם מכסה של 15 עד 30 דקות ב-Plus, זה מתאים לפקודות קצרות ומדויקות יותר מאשר לשיחה ארוכה.
מה כדאי לדעת לפני שנותנים לו לפעול במחשב
כשמצרפים את מצב הקול ליכולת Computer Use, ChatGPT באמת מזיז את העכבר, מקליד ופותח אפליקציות. כמה דברים שכדאי לדעת מראש: Computer Use הוא תוסף שצריך להתקין בנפרד, והוא שואל אישור לפני שהוא משתמש באפליקציה מסוימת (יש אפשרות "תמיד לאשר" לאותה אפליקציה). בווינדוס הוא רץ על שולחן העבודה הפעיל ומשתלט על החזית - כלומר לא תוכלו להמשיך לעבוד באותו מחשב בזמן שהוא עובד; במק אפשר להריץ משימה מתוחמת ברקע ולהמשיך במקביל. מנהלי ארגון יכולים לכבות את היכולת לגמרי.
ובצד הפרטיות: קטעי האודיו של שיחות קוליות נשמרים יחד עם התמלול בהיסטוריית השיחות למשך 30 יום. OpenAI לא משתמשת בהם לאימון מודלים אלא אם בחרתם במפורש לשתף אותם בהגדרות; בסביבות Business, Enterprise ו-Edu אין בכלל אפשרות לשתף אותם.
שאלות נפוצות על מצב קול של ChatGPT במחשב
איך מפעילים מצב קול ב-ChatGPT במחשב?
פותחים צ'אט או משימה חדשים באפליקציית הדסקטופ, ובוחרים Start new voice chat לפני שליחת ההודעה הראשונה. בפעם הראשונה מאשרים גישה למיקרופון ובוחרים קול. אפשר גם להגדיר קיצור מקשים ייעודי ב-Settings > Voice > Voice chat hotkey.
איזה מנוי צריך בשביל ChatGPT Voice בדסקטופ?
לפי התיעוד של OpenAI היכולת זמינה במסלולי Plus, Pro, Business, Edu ו-Enterprise. במסלולים Free ו-Go היא לא מופיעה ברשימת המסלולים הנתמכים. שיחה קולית רגילה בצ'אט כן קיימת גם במסלולים החינמיים, אבל היא לא מפעילה סוכנים.
האם מצב הקול של ChatGPT עובד בעברית?
OpenAI לא מפרסמת רשימת שפות נתמכות ל-GPT-Live ולא מתייחסת לעברית ספציפית. היא כן מציינת שבשפות מסוימות המודל עלול להישמע במבטא לא ילידי או לסבול מפערי שטף. יש הגדרת שפה ב-Settings > Voice > Language, וכדאי לוודא את התמלול לפני שמאשרים פעולה בלתי הפיכה.
ChatGPT Voice עובד גם בדפדפן?
לא. היכולת לתאם סוכנים ב-Work וב-Codex בקול פועלת רק באפליקציית הדסקטופ ל-Mac ול-Windows, ובנוסף דרך Remote באייפון. שיחה קולית רגילה בצ'אט כן קיימת בדפדפן ובאפליקציות הנייד, אבל היא לא מפעילה סוכנים.
מה ההבדל בין מצב קול לבין הכתבה קולית?
הכתבה הופכת את הדיבור שלכם לטקסט בתיבת ההודעה, ואתם עדיין לוחצים שליחה. מצב קול הוא שיחה חיה שבה אפשר לקטוע ולהמשיך לדבר בזמן שהוא עובד. ההבדל המעשי: שיחה חייבת להתחיל במצב קול, ואם התחלתם להקליד ואז לחצתם על המיקרופון - קיבלתם הכתבה.
האם ChatGPT יכול לראות את המסך שלי?
במק אפשר להדליק Screen context ב-Settings > Voice ואז לומר "Take a look at this", וChatGPT מצלם את החלון הקדמי. הצילום כולל גם טקסט שנמצא מחוץ לאזור הגלילה הנראה, אז לא כדאי לשתף חלונות עם מידע רגיש. בווינדוס היכולת הזו לא קיימת, וארגונים יכולים לחסום אותה.
כמה זמן דיבור מקבלים בכל חודש?
המכסה לא חודשית אלא נמדדת בחלונות מתגלגלים של חמש שעות: כ-15 עד 30 דקות ב-Plus, כשעה עד שעתיים וחצי ב-Pro של 100 דולר, ללא הגבלה ב-Pro של 200 דולר, וכ-45 דקות ב-Business וב-Enterprise ותיק. המשימות שהקול מפעיל צורכות בנפרד את מכסת ה-Codex שלכם.
מצב קול לא מופיע לי באפליקציה, מה לבדוק?
לפי הסדר: שאתם באפליקציית הדסקטופ החדשה ולא ב-ChatGPT Classic, שהמסלול שלכם ברשימה הנתמכת, שהשיחה נפתחה כשיחה קולית מלכתחילה, שהמיקרופון מאושר, ושאין כבר שיחה קולית פעילה בחלון אחר של האפליקציה. בסביבת עבודה ארגונית ייתכן שהמנהל עדיין לא הדליק את היכולת.
השורה התחתונה
ChatGPT Voice הופך את הדסקטופ מ"כותבים לו הוראות" ל"מדברים איתו תוך כדי עבודה". מי שכבר מנוי Plus ומעלה יכול להוריד את אפליקציית הדסקטופ ולנסות את זה היום - רק כדאי לזכור שהמכסה ב-Plus היא 15 עד 30 דקות בכל חמש שעות, ושהיא מתאימה הרבה יותר לפקודות קצרות ומדויקות מאשר לשיחה ארוכה.
קריאה נוספת: ChatGPT Work - המדריך המלא לסוכן שמבצע משימות מקצה לקצה · מדריך Codex: איך עובדים נכון עם סוכני AI · Computer Use - כשה-AI משתלט על המחשב · Codex מהנייד · התוסף של ChatGPT לכרום · היכולות הקוליות הקודמות של OpenAI
הירשמו לעדכונים במייל
רוצים להישאר צעד אחד קדימה?
עדכונים על כלי AI, מדריכים וטיפים - ישר למייל. בלי ספאם.
