מודל Gemini 2.0 Flash של Google מאפשר כעת לבצע עריכות תמונה באמצעות שפה טבעית באופן מובנה. בניגוד למערכות מולטימודאליות קודמות שהסתמכו על שילוב מודלים נפרדים (כמו שימוש במודל שפה יחד עם Imagen 3 ליצירת תמונות), Gemini 2.0 Flash מטפל במולטימודאליות על ידי יצירת תמונות ישירות בתוך אותה מערכת שמעבדת טקסט. זה מבטל את הצורך בתקשורת בין מודלים, ומפחית משמעותית את זמן התגובה.
מכיוון ש-Gemini 2.0 Flash כבר לא תלוי ב-Imagen 3, הוא מציע תגובות מהירות יותר ואינטראקציות חלקות יותר. בנוסף, אתם יכולים אפילו להטמיע טקסט ארוך יותר ישירות על תמונות!
ראו דוגמה זו שבה הפכתי את אילון מאסק לבחור עם שיער ארוך.
איך זה עובד?
כדי להתחיל, היכנסו ל-AI Studio של Google, התחברו עם חשבון Google שלכם והגדירו את המודל ל-Gemini 2.0 Flash Experimental. ודאו גם שפורמט הפלט מוגדר ל-“Images and text”.
לאחר מכן, העלו את קובץ התמונה שלכם על ידי לחיצה על כפתור “+” בפינה הימנית התחתונה של שדה ההנחיה.
כפי שתראו, Gemini מאפשר לכם להנחות את ה-AI בצורה מדויקת לעדכן רק חלקים ספציפיים של התמונה. הוא לא מייצר תמונה חדשה לגמרי מאפס, אלא משנה רק את מה שאתם מציינים במפורש בהנחיה.
הנה דוגמה שמראה את Gemini מוסיף זילוף שוקולד לקרואסונים.
זה מדהים כי שום היבט אחר בתמונה המקורית לא השתנה מלבד תוספת זילוף השוקולד – שאגב, נראה מציאותי להפליא.
אתם רואים למה אני מתכוון?
Gemini 2.0 Flash Experimental מסוגל גם להוסיף טקסט על התמונה, ראו דוגמה זו שבה ביקשתי ממנו להוסיף את המילים “Generative AI Publication”.
האותיות חדות, קריאות וממוקמות היטב. לפי תוצאה זו, ל-Gemini עשויות להיות יכולות עיבוד טקסט הטובות ביותר מבין מודלי התמונה הנוכחיים – מתחרים כמו Midjourney ו-Flux לא משיגים רמה כזו של חדות או דיוק.
דוגמאות מעשיות ומקרי שימוש
תנו לי להראות לכם כמה מגניבות שמצאתי באינטרנט שבהן עריכת תמונה באמצעות שיחה באמת עובדת. הביטו בדוגמה למטה שבה משתמש X בשם fofr השתמש ב-Gemini 2.0 Flash כדי לשנות פוזה של דוגמנית מתמונת פרופיל אחת.
התוצאה הסופית נראית מדהימה, ואין פגם או עיוות בתמונה החדשה.
מקרה שימוש מגניב נוסף שהוצג על ידי משתמש X בשם Kurawa Dono הוא שילוב שתי תמונות יחד. אתם יכולים להעלות תמונה של מוצר ודוגמן ואז לבקש מה-AI לגרום לדוגמן להחזיק את המוצר.
עריכת תמונה מובנית ב-Google AI Studio
אם אתם מוכרים מוצרים באינטרנט, שיטה זו מייעלת משמעותית את תהליך העבודה שלכם, ומבטלת את הצורך בצילומים נרחבים או עריכות פוטושופ ידניות.
הנה עוד אחת, אתם יכולים לבצע העברת סגנון על ידי העלאת כל תמונה והעתקת הסגנון שלה ליצירת תמונה חדשה. זו הודגמה באופן מושלם על ידי משתמש X בשם Robert Riachi בפוסט שלו.
העברת סגנון אינה חדשה בעולם מחוללי התמונות עם AI, אבל לעשות זאת בשפה טבעית היא חוויה חדשה ומהנה לחלוטין.
מחשבות לסיכום
בכנות, חשבתי שגוגל כבר מפגרת במרוץ יצירת תמונות בינה מלאכותית. OpenAI שחררה לאחרונה מוצרים מרגשים חדשים כמו GPT-4.5 וה-AI SDK החדש שלהם. בינתיים, לסין היה עוד “רגע DeepSeek” עם השחרור של ManusAI, מה שגרם להתקדמות האחרונה של גוגל להיראות מרשימה פחות בהשוואה.
אבל טעיתי.
גוגל בהחלט חזרה למרוץ. השחרור של Gemma 3 27B ו-Gemini 2.0 Flash עם יכולת מולטימודאלית מובנית ליצירת תמונות באותו יום הוא מרשים ביותר.
אני הופתעתי מהיכולת של Gemini לשנות תמונות ישירות דרך הנחיות בשפה טבעית. זה בעצם inpainting על סטרואידים, שמציע רמה של דיוק וגמישות שלא ראיתי קודם.
כמי שמתעניין ב-AI וכמפתח שעובד באופן קבוע עם כלי AI, אני לא יכול שלא להתרגש מכל האפשרויות שהמודלים החדשים האלה פותחים. ההזדמנויות ליצירתיות וחדשנות הן עצומות.
אני באמת לא יכול לחכות לקבל גישה ל-API ולהתחיל בניסויים משלי – לבנות דברים חדשים, מעניינים, ומקווה שגם שימושיים. בינתיים, אני ממליץ בחום לנסות את Gemini 2.0 Flash Experimental בעצמכם, לשחק עם התכונות, ולגלות את מקרי השימוש היצירתיים שלכם.