להפסיק לבקש מ-AI "תעשה לי סרטון" ולהתחיל לביים אותו!
מדריך מעשי שמלמד להפוך תמונות ורעיונות לשוטים קולנועיים מדויקים באמצעות שפת מצלמה מקצועית, תנועה, עדשות, קומפוזיציה ופרומפטים מוכנים להעתקה.
🎯 למי המדריך מתאים?
ליוצרות ויוצרים, בעלי עסקים, אנשי תוכן, מעצבים, אנשי שיווק וכל מי שרוצה לעבור מיצירת וידאו אקראית ב-AI לבימוי שיטתי, מדויק ועקבי.
🎬 פתיחה - להפוך פרומפט לבימוי
במדריך הזה אני מלמדת איך להפוך תמונות יצירת תמונות וסרטוני AI מתהליך של ניסוי וטעייה לתהליך של בימוי - עם דגש מרכזי על עבודה ב-Google Flow, מול המודל העדכני של גוגל ליצירה ועריכה של וידאו, Gemini Omni 1.1 Flash. במקום לבקש מהמודל "סרטון קולנועי", נגדיר מי נמצא בפריים, מה קורה, כיצד המצלמה נעה, איזו עדשה משרתת את הסיפור, איך הפריים בנוי, מה האור פועל, מה חייב להישאר עקבי ומה אסור להשתנות.
המדריך נבנה בראש ובראשונה כ-Google Flow Edition, מותאם למודל הנוכחי Gemini Omni 1.1 Flash.
לצד זאת, עקרונות הבימוי, הצילום ו-Prompt Engineering שבו הם אוניברסליים וניתנים להתאמה גם למערכות Image-to-Video ו-Text-to-Video נוספות. יכולות המודלים והממשקים משתנות עם הזמן, ולכן יש להתייחס לפרומפטים כתבניות מקצועיות ולבצע התאמות לפי הכלי והמודל הזמינים.
כשאני כותבת רפרנס, אני מעדיפה את המונח "the subject". אין צורך להוסיף תיאורי גיל, יופי או מגדר שאינם נחוצים, כי כל פרט חדש עלול להפוך למשתנה שהמודל ינסה לפרש.
:Prompt Template
Use the uploaded reference image as the exact visual identity reference. Preserve the subject's exact facial features, facial structure, hairstyle, skin texture, body proportions, clothing, accessories, and overall identity consistently throughout the entire shot.
מגבלות שימושיות:
🚫No facial distortion
תווי הפנים ומבנה הפנים חייבים להישאר יציבים וזהים לתמונת המקור לאורך כל השוט.
🚫No identity drift
הזהות של הדמות לא "נודדת" או משתנה בהדרגה בין פריים לפריים.
🚫No facial morphing
אין מעברי צורה נזילים או "המסה" של הפנים במהלך התנועה.
🚫No body deformation
פרופורציות הגוף נשארות טבעיות ונכונות, ללא עיוותים אנטומיים.
🚫No duplicated limbs
אין הופעה של ידיים, רגליים או אצבעות כפולות שהמודל "ממציא" מעצמו.
🚫No unintended clothing changes
הלבוש והאביזרים נשארים עקביים ולא משתנים באמצע השוט ללא סיבה.
🚫No environmental warping
הסביבה סביב הדמות נשארת יציבה, בלי עיוותים או "גליים" לא רצויים ברקע.
🎥 תנועות וזוויות
שם
תיאור והוראת פרומפט
🔗 איך מחברים טכניקות
הטכניקות הן אבני לגו. אני לא ממליצה לדחוס שש תנועות שונות לקליפ קצר; עדיף ליצור Shot List ולייצר כל שוט בנפרד.
85mm portrait lens, medium close-up, natural eye-level camera position, shallow depth of field, precise critical focus on the eyes, soft optical bokeh, subtle cinematic PUSH IN.
Cinematic Walk
35mm cinematic lens, medium-long shot, natural eye-level perspective, moderate depth of field, smooth stabilized FOLLOW SHOT with realistic environmental parallax.
Epic Reveal
24mm wide-angle cinematic lens, extreme wide shot, slightly low camera position, deep environmental focus, gradual PULLBACK revealing the full scale of the location.
💡 כללי עבודה מקצועיים
יותר פירוט אינו תמיד טוב יותר. הוראות סותרות יוצרות תוצאה פחות יציבה.
סדר החשיבה שלי: סיפור - שוט - עדשה - מצלמה - פוקוס - תנועה.
ב-Image-to-Video עדיף לשמור את תיאור הזהות קצר ומדויק ולא להמציא מחדש את האדם.
תנועה ריאליסטית דורשת הוראות פיזיקה: משקל גוף, אינרציה, מגע עם הקרקע, שיער ובד.
חשוב לא פחות מהחיובי: אותה זהות, אותו לבוש, אותו עולם ואותה לוגיקת אור לאורך כל השוט.
אם שוט מורכב לא מצליח, מפצלים אותו. שליטה טובה נוצרת משוטים מדויקים ולא מפרומפט עמוס.
📝 דף עבודה לבניית פרומפט
רגע לפני כתיבת הפרומפט, כדאי לעבור על השאלות המנחות:
כאשר יש תשובה ברורה לכל אחת מהשאלות, הפרומפט מפסיק להיות תיאור כללי והופך להוראת בימוי.
🆕 עדכון: המודל החדש בגוגל פלואו•Gemini Omni 1.1 Flash
גוגל שחררה גרסה מעודכנת למשפחת Gemini Omni בשם Omni 1.1 Flash, שמתמקדת בדיוק בנקודה שהכי כואבת בעבודה עם וידאו AI: איך שומרים על רצף, זהות והקשר כשסצנה נמשכת מעבר לכמה שניות בודדות. חשוב להבין - הגרסה הזו לא מחליפה את שפת הבימוי שלמדנו במדריך הזה, היא רק נותנת לה עוד כלים ליישום בפועל בתוך Google Flow.
רינדור סופי עד 4K ← הארכת הסצנה (עד 40 שניות) ← בדיקת רצף וזהות ← טיוטה מהירה ב-360p
ארבע יכולות שכדאי להכיר:
הארכת סצנה מודעת-הקשר - במקום להתבסס רק על הפריים האחרון כמו בגרסאות קודמות, המודל מנתח עד 10 שניות מהסרטון הקיים, ולכן שומר טוב יותר על זהות הדמות, כיוון האור וההיגיון הסיפורי כשממשיכים סצנה. אפשר להאריך במקטעים של כ-3 עד 10 שניות בכל פעם, עד לסך מצטבר של כ-40 שניות.
שליטה בפריים פתיחה וסיום - במקום לתאר תנועה במילים בלבד, אפשר להעלות שני פריימים - התחלתי וסופי - והמודל בונה את כל התנועה שביניהם. שימושי במיוחד לסיבובי מצלמה, מעברי זום ולופים חלקים וסגורים.
רפרנס וידאו לעקביות - אפשר לצרף עד 3 שניות מסרטון נפרד כרפרנס תנועה וסגנון, בדומה לעיקרון של תמונת רפרנס לשמירת זהות שמופיע בסעיף שמירת זהות למעלה - רק שכאן הרפרנס משמש בעיקר לתנועה ולא רק למראה החזותי.
מצב טיוטה מהיר וזול - רינדור ב-360p רץ מהר משמעותית ובעלות נמוכה בהרבה מרינדור באיכות מלאה. הרעיון: לבדוק כיוון, קומפוזיציה ותנועה בזול, ולהעלות לרזולוציה גבוהה (עד 4K, באמצעות Upscale) רק את השוטים שבאמת עובדים.
PRO TIPגם עם מודל חדש וחכם יותר, הפרומפט הוא עדיין מי שקובע. תארו את הרפרנס, את התנועה ואת מה שאסור להשתנות - בדיוק לפי הנוסחה SUBJECT → ACTION → CAMERA → CONTINUITY שכבר מוכרת לכן ממדריך זה.
First / Last Frame Transition
Use the first uploaded image as the exact starting frame and the second uploaded image as the exact ending frame. Generate smooth, continuous, physically plausible camera and subject motion between the two frames, preserving the subject's identity, clothing, and lighting throughout the transition.
Scene Extension
Continue the scene exactly from where the reference footage ends. Keep the subject's identity, clothing, lighting direction, and environment fully consistent. Maintain the same camera movement style and pace established in the previous footage, without introducing a cut.
שווה להכיר גם את המגבלה הכי פחות מדוברת: המודל לא מקבל קובצי אודיו כקלט ולא עורך קול קיים, והוא אף מתעלם מהאודיו שנמצא בתוך סרטון הרפרנס עצמו. הפסקול נוצר אוטומטית בהתאם לתמונה, ואם רוצים דיאלוג או מוזיקה ספציפיים - יש לתאר אותם במילים בתוך הפרומפט, ולא לצרף קובץ שמע.
איך זה נראה בפועל? מתארים את הדיאלוג כמשפט מדויק בתוך מרכאות, מוסיפים הנחיה על טון הדיבור והרגש, ובנפרד מתארים את המוזיקה - הסגנון, האווירה והאופן שבו היא מתפתחת לאורך השוט:
Dialogue & Music in Words - אנגלית
The subject says the line "We found it" in a calm, quietly confident tone, with natural lip-sync to the words. Soft ambient piano plays gently in the background, low in volume, slowly building in intensity as the shot progresses.
Dialogue & Music in Words - עברית
The subject says the line "מצאנו את זה" in a calm, quietly confident tone, with natural lip-sync to the words. Soft ambient piano plays gently in the background, low in volume, slowly building in intensity as the shot progresses.
שימו לב למבנה: משפט אחד וברור בתוך מרכאות עבור הדיאלוג עצמו, תיאור נפרד של הטון והרגש שבו הוא נאמר, ואז תיאור נפרד של המוזיקה - כלי הנגינה, העוצמה וכיוון ההתפתחות שלה. אפשר לכתוב את שאר הפרומפט באנגלית ואת המשפט הנאמר עצמו בעברית בדיוק כמו בדוגמה השנייה - המודל מבין דיאלוג בעברית בדיוק כפי שהוא מבין אותו באנגלית, וזה מאפשר לדמות "לדבר" עברית טבעית כשצריך. ככל שהתיאור מדויק וממוקד יותר, כך גם קל יותר למודל "לשמוע" בדיוק את מה שדמיינתן.
נכון לעכשיו Omni 1.1 Flash זמין בתוך Google Flow, ב-Gemini App (הארכת סצנה בלבד, למנויי Plus, Pro ו-Ultra), וכן דרך Google AI Studio למפתחות ולמפתחים. לפי הודעת גוגל, הוא צפוי להחליף בהדרגה חלק מהשימושים שהיו שייכים עד כה למשפחת Veo, כך שסביר שהיכולות האלה ימשיכו להשתלב עמוק יותר בממשקים הקיימים בחודשים הקרובים.
🔄 7 שלבי העבודה המומלציםGoogle Flow Workflow
תמונת רפרנס: התחילו מחומר מקור ברור ואיכותי כאשר שמירת זהות חשובה.
בחירת שוט: הגדירו קודם מה הצופה צריך לראות ולהרגיש.
מבנה הנוסחה: SUBJECT ➔ ACTION ➔ CAMERA ➔ LENS ➔ COMPOSITION ➔ LIGHTING ➔ PHYSICS ➔ CONTINUITY
יצירת וריאציה: אל תשנו הכול בבת אחת; בדקו שינוי אחד או שניים בכל איטרציה.
בדיקת Identity & Continuity: עברו על הפנים, הידיים, הלבוש, הסביבה, התאורה והפיזיקה.
תיקון ממוקד: אם שוט נכשל, תתקנו את ההוראה הספציפית במקום להעמיס עוד תיאורים.
Shot List: בסצנה מורכבת, צרו כמה שוטים קצרים ומדויקים וחברו אותם בעריכה.
PRO TIPב-Google Flow עדיפה היררכיה ברורה בתוך Prompt אחד: סיפור - שוט - עדשה - מצלמה - פוקוס - תנועה.
✨ סיכום
היכולת החשובה ביותר אינה לזכור עשרות פקודות בעל-פה, אלא להבין מה כל החלטה עושה לצופה. ברגע שאני יודעת מה אני רוצה שהצופה יראה, ירגיש ויבין, קל הרבה יותר לתרגם את זה לשפה שהכלי מסוגל לבצע - מסגור, תנועה, עדשה ותאורה. זו בדיוק המהות של המדריך הזה: לא עוד ניחושים מול המסך, אלא שפה מקצועית וברורה שהופכת כל רעיון לתסריט צילום מדויק.