צילום מסך עם שאלה כתובה מציג למודל שני סוגי מידע בבת אחת. מודל מולטימודלי מסוגל לעבד כמה סוגים כאלה ולחבר ביניהם. הוא יכול, למשל, להתייחס לגרף שבתמונה בזמן שהוא עונה על שאלה בטקסט, או לשלב מידע חזותי וקולי מתוך קטע וידאו.
המידע מומר לייצוגים מספריים שהמודל למד לקשר במהלך האימון. יש מערכות שמשלבות רכיבים נפרדים לראייה, שפה וקול, ואחרות מאומנות לשילוב הדוק יותר. המילה מולטימודלי אינה מבטיחה שכל מוצר מקבל ומייצר את כל סוגי המדיה; צריך לבדוק אילו קלטים ופלטים הוא תומך בהם בפועל.
היכולת שימושית לקריאת מסמכים סרוקים, להסבר תרשימים ולסיוע בנגישות. באתר שעוסק גם בתיעוד חריג היא מאפשרת לשאול שאלות על חומר חזותי, אך זיהוי תוכן אינו בדיקה של מקור הקובץ. מודל יכול לתאר עצם בתמונה בלי לדעת היכן צולמה או אם נערכה. לכן ניתוח התמונה והבדיקה של תאריך, מקור ושרשרת ההפצה הם שלבים משלימים. כאשר מחברים למודל כלים והרשאות פעולה, הוא יכול להיות גם חלק מסוכן AI.
