הקפיצה הגדולה הבאה של הבינה המלאכותית היא אל העולם האמיתי

מהנדסים ומשקיעים מסתערים על "מודלים של העולם", המכונים גם "מודלי פעולה גדולים", בתקווה לחולל בתחום הרובוטיקה את המהפכה ש־ChatGPT חולל בכתיבה ובתכנות

בינה מלאכותית מוטמעת ברובוט כלב / צילום: ap, Joan Mateu Parra
בינה מלאכותית מוטמעת ברובוט כלב / צילום: ap, Joan Mateu Parra

מודלי השפה הגדולים של הבינה המלאכותית כיום מצטיינים אולי בעבודות משרדיות, אך לפי אנשים בתחום, כדי לבצע עבודות בעולם הפיזי, דרושים מודלי פעולה גדולים (large action models), המכונים גם "מודלים של העולם" (world models).

לינקדאין רוצה שהמשתמשים יסתמכו פחות על AI. הרבה פחות
כך תגלו מה הצ'אטבוט יודע עליכם

לפי השיטה, שנועדה לאמן את הבינה המלאכותית להפעיל רובוטים, המודלים מאומנים באמצעות משחקי וידאו וסימולציות, ולא על ספרות, קוד ותמונות. לאחרונה הטכנולוגיה הגיעה לנקודה שבה המודלים מסוגלים לנווט במרחב תלת ממדי ואף לתפעל עצמים באופן עצמאי באמצעות סדרה פשוטה של הוראות.

הטכנולוגיה עדיין נמצאת בחיתוליה, לדברי מוריץ באייר לנץ, שמשקיע בכמה חברות בתחום. "אם משווים את זה למודלי שפה גדולים, אנחנו בערך בשלב של GPT-2" אמר. (המודל ש־OpenAI השיקה בשנת 2019).

אף שמודלים של העולם עדיין נמצאים בשלב ראשוני יחסית, כמה מהשמות הבולטים בתעשיית הטכנולוגיה כבר מסתערים על התחום. ההימור הוא שארכיטקטורה חדשה מיסודה תוכל להביא את הבינה המלאכותית למקומות שאליהם מערכות המבוססות על מודלי השפה הגדולים של ימינו אינן מסוגלות להגיע. וחלוצי התחום מקווים שיום אחד יהיה אפשר למזג בין שתי הגישות.

איך עובדים ה"מודלים של העולם" 

 המטרה 
להטמיע בינה מלאכותית ברובוטים שפועלים בעולם האמיתי, תוך צמצום טעויות ואפשרות פגיעה באנשים

 האימון
בעזרת משחקי וידאו. המודל מתעד כל פריים במשחק לצד הפעולות שמבצעים המשתמשים. כך הבינה המלאכותית יכולה לקשר בין פעולות לבין התוצאות שלהן

המגבלה
הרובוט צריך להיות בעל ארבע רגליים, כלי רכב על גלגלים או רחפן, ושניתן לשלוט בו באמצעות בקר משחק או עכבר ומקלדת

ממילים לעולמות

במשך כחצי מיליארד שנה בעלי חיים פיתחו בהדרגה מוחות המסוגלים ליצור מודל של העולם שסביבם ולהשתמש במפה המנטלית הזאת כדי לתכנן את פעולתם הבאה. השפה, לעומת זאת, קיימת רק כמאה אלף שנה, והיא מעין קיצור דרך שבני האדם יצרו כדי לעבד ולהעביר רעיונות, גדולים כקטנים.

"טקסט הוא בסך הכול ייצוג חלקי של העולם האמיתי, שבו מידע הולך לאיבוד", אמר קנט רולינס, מנהל המוצר הראשי של ג'נרל אינטואישן ולשעבר מנהל האקוסיסטם של פורטנייט באפיק גיימז. "העולם היה קיים הרבה לפני שהיה לנו טקסט, ולכן כשאנחנו משתמשים בטקסט כדי לתאר אותו, אנחנו בהכרח מחמיצים היבטים מהותיים ממנו".

חוקרי רובוטיקה יודעים זאת כבר זמן רב. מערכות הבקרה של הרובוטים המתוחכמים יותר כיום מסתמכות על סימולציות המבוססות על חוקי הפיזיקה כדי לדמות את העולם הפיזי. גם אלה הן מודלים של העולם, אלא שהן נכתבות בקפידה בקוד ומותאמות למטרות ספציפיות מאוד. מערכת שעובדת עבור סוג אחד של רובוט אינה מתאימה בהכרח לאחר.

חברות הסטארט-אפ שמפתחות כיום מודלים של העולם שואפות ליצור מערכת בקרה שתהיה מגוונת בהפעלת רובוטים כפי שמודלי השפה הגדולים של ימינו מגוונים ביצירת טקסט, מסונטות ועד תוכנה.

אימון שמבוסס על משחקי וידאו

סטארט-אפ מניו יורק בשם ג'נרל אינטואישן, המפתח מודלים של העולם, משלים בימים אלה סבב גיוס לפי שווי של יותר מ־6 מיליארד דולר, שיהפוך אותו למעבדת הבינה המלאכותית היקרה ביותר מסוגה. הבסיס לאימון המודל שלו הוא משחקי וידאו: המודל מתעד כל פריים במשחק לצד הפעולות שמבצעים המשתמשים, מכל לחיצה על כפתור ועד תזוזה של מוט השליטה. בניגוד לרובוטים שאומנו באמצעות וידאו בלבד, בשיטה זו הבינה המלאכותית יכולה לקשר בין פעולות המשתמשים לבין התוצאות שלהן בעולמות וירטואליים, וכך נוצר מודל פעולה גדול.

לאחר התאמה קלה, המודל יכול להפעיל רובוט בעולם האמיתי כאילו היה דמות במשחק וידאו. עם זאת, יש מגבלה: הרובוט צריך להיות בעל ארבע רגליים, כלי רכב על גלגלים או רחפן, מהסוג שבדרך כלל משדר למשתמש וידאו בזמן אמת וניתן לשלוט בו באמצעות בקר משחק או עכבר ומקלדת. מאפיינים אלה נפוצים למדי בקרב רובוטים בשימוש נרחב, אך אינם מתאימים לרוב הרובוטים דמויי האדם שהולכים על שתי רגליים.

המודל של ג'נרל אינטואישן מאומן על מיליוני שעות שבהן בני אדם שיחקו במשחקי וידאו. הנתונים נאספו ממדל.טי־וי, שירות אחות של החברה ופלטפורמה להקלטה ולשיתוף של קטעים ממשחקים.

במשרדי ג'נרל אינטואישן בניו יורק, ז'נבה וסביבתם, החברה מציגה לראווה כלב רובוטי. בעוד שבינה מלאכותית רגילה להפעלת רובוט כזה עשויה לדרוש אימון בהיקף עצום, למודל הזה מספיקות דקות ספורות של התאמה. המערכת צריכה לדעת היכן היא נמצאת, באיזה סוג של גוף היא פועלת ומה המטרה שלה, ומשם היא כבר יוצאת לדרך, לדברי באייר לנץ, שמשקיע בג'נרל אינטואישן.

הדגמות קודמות של מודלים של העולם, כמו מודלי ג'יני שהציגה גוגל דיפמיינד, התמקדו ביצירת עולמות חדשים שבהם ניתן לאמן רובוטים. הדור החדש כבר מסוגל לתפוס את העולם שסביבו ולהחליט מה לעשות הלאה. ג'ק פארקר הולדר, שהוביל בעבר את פעילות גוגל בתחום המודלים של העולם, היה ממייסדי אמיולייט הלונדונית. המעבדה הצעירה מנהלת מגעים לגיוס של יותר מ־500 מיליון דולר ממשקיעים, ובצוות הטכנולוגי שלה נמנים גם שישה עובדים לשעבר בגוגל, לפי מסמכים שבחן וול סטריט ג'ורנל.

שפה+פעולה=?

חברות אחרות המפתחות מודלים של העולם ממעטות לחשוף פרטים על מערכות הבינה המלאכותית שהן בונות, אך הרכישות שלהן והפרסומים של המהנדסים שלהן מספקים כמה רמזים.

בראש הסטארטאפ וורלד לאבס עומדת פרופ' פיי־פיי לי מאוניברסיטת סטנפורד, שעבדה בעבר בגוגל ומכונה "הסנדקית של הבינה המלאכותית". החברה רכשה לאחרונה את חברת הרובוטיקה סניקס. בראש AMI לאבס עומד יאן לקון, לשעבר המדען הראשי לבינה מלאכותית במטא. נראה שהחברה פועלת בכיוון רחב יותר ובוחנת כמה ארכיטקטורות שחורגות ממודלי השפה הגדולים המסורתיים. (שתי החברות סירבו להגיב לכתבה).

בעוד שג'נרל אינטואישן וסטארט־אפים אחרים מדגישים את היכולות שלהם בתחום הרובוטיקה, משקיעים ושותפים עסקיים פוטנציאליים מעלים שאלה נוספת: כיצד יכולים מודלים של העולם לשפר את היכולות של המודלים מבוססי השפה הקיימים כיום?

כדי שמודלי שפה גדולים יוכלו לעבד תמונות וקול, יש לאמן אותם ישירות על התכנים האלה ולהמיר את הקלט לטוקנים, כפי שהם עושים עם מילים. הניסיון לעבד כך סביבה תלת ממדית התברר כבלתי יעיל במידה קיצונית, והתוצאה היא מודלים איטיים מכדי להפעיל רובוט ברוב המצבים.

בעולם האמיתי "אי אפשר פשוט לפספס משהו בערך"

אבל גם למודלים של העולם יש בעיות משלהם. היה קל יחסית לקדם את ChatGPT מדור אחד למשנהו דווקא משום שבתחילת דרכו הוא התמודד רק עם טקסט. ככל שמודלי שפה גדולים גדלים ומוזנים ביותר ויותר נתונים, הם נעשים גדולים וחכמים יותר, אך ממשיכים לטעות, לדברי ג'ורג' קונידריס, פרופסור לרובוטיקה באוניברסיטת בראון וממייסדי רילטיים רובוטיקס, המפתחת מערכות לרובוטים תעשייתיים.

כשמדובר ברובוטים, יש הרבה פחות מצבים שבהם נהיה מוכנים לקבל הזיות וטעויות אחרות.

"העולם האמיתי מורכב מאוד, ויש בו המון מקרים חריגים וגבולות קשיחים, ואי אפשר פשוט לפספס משהו בערך", אמר קונידריס. "אם הרובוט שלך פוגע במשהו בזמן שהוא נע, הכול משתנה".

יש הסבורים כי שיפור היעילות של מודלי שפה גדולים עשוי להספיק כדי להפוך אותם לבינה המלאכותית שתפעיל רובוטים ויישומים תלת ממדיים אחרים. אך קיימת גם אפשרות לשלב בין שתי הגישות: מודלי שפה גדולים יוכלו להיעזר במודלים של העולם, כפי שהם נעזרים כיום בתוכנות אחרות כדי לבצע משימות.

בינתיים, קל להבחין בכך שגם ג'נרל אינטואישן וגם אמיולייט אינן ממוקמות באזור מפרץ סן פרנסיסקו, שהוקסם מהאפשרות שבינה מלאכותית המבוססת על מודלי שפה גדולים תוביל ל"בינת על".

כששאלתי את מנכ"ל ג'נרל אינטואישן, פים דה ויטה, אם בינת על היא המטרה של החברה שלו, הוא הסתייג. "אני בניו יורק כי אני רוצה להתרחק מכל ההתנהגות הכתית הזאת ופשוט להתמקד בהערכה מדעית של היכולות של מודלים ברובוטים", אמר. "אין צורך להפוך את זה למשהו גדול יותר ממה שזה".

כתבה זו תורגמה על ידי גלובס באופן בלעדי מתוך The Wall Street Journal. לינק לכתבה המקורית באנגלית