FLUX 3: מודל אחד שמייצר תמונה, וידאו וקול, מיוצרי Stable Diffusion
היוצרים של Stable Diffusion שחררו את FLUX 3, מודל מולטימודלי אחד שמייצר תמונות, סרטונים באורך עד 20 שניות עם קול מסונכרן, ואפילו חוזה פעולות לרובוטים. בדקנו מה חדש ולמה כולם מדברים על זה.
FLUX 3 הוא מודל היסוד החדש של Black Forest Labs, החברה שהקימו החוקרים שעמדו מאחורי Stable Diffusion. במקום מודל נפרד לכל משימה, FLUX 3 מייצר תמונות, וידאו וקול מאותה מערכת אחת, ומוסיף יכולת חדשה של חיזוי פעולות לרובוטים. נכון לסוף יולי 2026 הוא בגישה מוקדמת ומוגבלת, אבל הכיוון ברור.
רוב כלי היצירה שאנחנו מכירים עושים דבר אחד. מודל אחד לתמונות, מודל שני לווידאו, מודל שלישי לקול. FLUX 3 מנסה לשבור את החלוקה הזאת עם גישה אחרת: מערכת אחת שלמדה תמונה, וידאו וקול יחד, ומייצרת את שלושתם מאותו סט משקלים.
השם FLUX כבר מוכר. הגרסה הראשונה, FLUX.1, הפעילה מחוללי תמונות רבים והפכה לאחת ממשפחות המודלים הפתוחות הפופולריות. עכשיו Black Forest Labs לוקחת את זה צעד קדימה. בדקנו מה FLUX 3 באמת יודע לעשות, במה הוא שונה מ-Sora ומ-Veo, ומתי כדאי לכם להתחיל להתעניין.
מה זה FLUX 3?
FLUX 3 הוא מה שהחברה מכנה מודל יסוד מולטימודלי. במקום להרכיב שלושה מודלים נפרדים מאחורי ממשק אחד, המערכת אומנה על תמונות, וידאו וקול במקביל. הרעיון הוא שכל סוג מדיה מלמד את המודל משהו אחר: תמונות מלמדות מבנה ומרחב, וידאו מוסיף תנועה ופיזיקה לאורך זמן, וקול מחבר בין אירועים לצלילים שהם מייצרים.
Black Forest Labs קוראת לשיטה Self-Flow, גרסה של flow matching שמאחדת את כל סוגי המדיה במסגרת אחת. התוצאה היא מודל שמייצר וידאו עם קול מובנה, עורך תמונות, כותב טקסט קריא בתוך התמונה, ואפילו מנסה לחזות פעולות של רובוט. הכל מאותה רשת.
כשמודל אחד לומד תמונה, וידאו וקול יחד, הוא מבין קשרים שמודל בודד מפספס. דלת שנטרקת אמורה גם להישמע, כדור שנופל אמור להאיץ. איחוד המדיה הוא ניסיון לתת ל-AI הבנה עקבית יותר של איך העולם עובד.
היכולות המרכזיות של FLUX 3
01וידאו עם קול מסונכרן
FLUX 3 מייצר קטעי וידאו באורך עד 20 שניות עם פסקול מובנה: דיבור, אפקטים קוליים ומוזיקה. הקול לא מודבק אחר כך, הוא נוצר יחד עם התמונה. זה כולל דיבור בכמה שפות ושרשור של כמה שוטים לרצף אחד.
02יצירה מטקסט, מתמונה ומווידאו
אפשר להתחיל מטקסט, מתמונה קיימת או מווידאו קיים. יש שליטה בפריימים מרכזיים, כלומר אפשר להגדיר נקודות עוגן ולתת למודל להשלים את התנועה ביניהן. זה נותן ליוצרים יותר כיוון ופחות הפתעות.
03תמונות וטקסט קריא
מעבר לווידאו, FLUX 3 ממשיך את המסורת של FLUX בתמונות סטילס. הוא מייצר תמונות, עורך אותן לפי הוראה, ומצליח להציג טקסט קריא בתוך התמונה, נקודה שבה מודלים רבים עדיין מתקשים.
04חיזוי פעולות לרובוטים
היכולת הכי מפתיעה היא ה-Action. אותו מודל שמייצר וידאו מנסה גם לחזות רצף פעולות פיזי, מה שמקרב אותו לתחום ה-AI הפיזי והרובוטיקה. זה עדיין מוקדם, אבל זה מסמן לאן Black Forest Labs מכוונת.
05ריבוי שפות
הדיבור שנוצר בווידאו תומך בכמה שפות. לקהל הישראלי זה אומר שבהמשך אפשר יהיה לבדוק עד כמה המודל מסתדר עם עברית, גם אם בשלב זה המיקוד הוא באנגלית ובשפות הנפוצות.
06בסיס לגרסת קוד פתוח
כמו ב-FLUX.1, החברה מתכננת גם גרסת FLUX 3 Dev עם משקלים פתוחים שאפשר יהיה להוריד ולהריץ. הרישיון צפוי להיות לא מסחרי, אבל עצם קיומו מבדל את FLUX מהמתחרים הסגורים.
FLUX 3 הוא לא עוד מחולל וידאו. הוא ניסיון לבנות מודל יסוד אחד שמבין תמונה, קול ותנועה יחד, עם דלת פתוחה לקוד פתוח.
FLUX 3 מול Sora, Veo ו-Kling
שוק יצירת הווידאו ב-AI כבר צפוף. Sora 2 של OpenAI, Veo של גוגל ו-Kling כולם חזקים. ההבדל של FLUX 3 הוא לא בהכרח באיכות, אלא בגישה: מודל אחד לכל סוגי המדיה, ותוכנית לקוד פתוח. הטבלה מסכמת את ההבדלים המרכזיים.
| קטגוריה | FLUX 3 | Sora 2 | Veo 3.1 | Kling |
|---|---|---|---|---|
| מפתחת | Black Forest Labs | OpenAI | Kuaishou | |
| מדיה נתמכת | תמונה, וידאו, קול, פעולה | וידאו + קול | וידאו + קול | וידאו |
| קול מסונכרן | כן, מובנה | כן | כן | מוגבל |
| קוד פתוח | מתוכנן (גרסת Dev) | לא | לא | לא |
| בולט ב- | איחוד מדיה ו-AI פיזי | פיזיקה ריאליסטית | רזולוציה עד 4K | זמינות ומחיר |
המסקנה הפשוטה: אם אתם צריכים וידאו מוכן עכשיו, Sora ו-Veo זמינים ובוגרים יותר. אם מעניין אתכם הכיוון של מודל אחד לכל המדיה, או אופציה עתידית של קוד פתוח, FLUX 3 הוא השחקן שכדאי לעקוב אחריו.
מה זה אומר למשתמשים בישראל?
נכון לעכשיו FLUX 3 בגישה מוקדמת ומוגבלת, אז רוב המשתמשים בישראל עדיין לא יוכלו להיכנס ולהתנסות. היכולת הרב-לשונית מבטיחה שבהמשך אפשר יהיה לבדוק עברית, אבל כמו תמיד, שווה לצפות שהתמיכה באנגלית תהיה חזקה יותר בהתחלה.
הזווית המעניינת באמת היא הקוד הפתוח. אם וכאשר תצא גרסת FLUX 3 Dev, מפתחים ישראלים יוכלו להריץ אותה על חומרה מקומית, בדומה למה שקורה היום עם מודלים פתוחים אחרים. מי שרוצה להבין את היתרון של הרצה מקומית יכול לקרוא את הסקירה שלנו על מודל בקוד פתוח כמו DeepSeek, ולראות איך זה עובד בפועל.
שווה לזכור ש-FLUX 3 עדיין לא זמין לכולם. חלק מהיכולות, כמו יצירת תמונות וחיזוי פעולות, מתגלגלות בהדרגה. מחיר רשמי עוד לא פורסם, ומי שמסתמך על הכלי לעבודה אמיתית עדיף שימתין לשלב יציב יותר.
כמה FLUX 3 עולה ואיך נכנסים?
Black Forest Labs עוד לא פרסמה מחיר רשמי ל-FLUX 3. הגישה כרגע היא דרך תוכנית early access מוגבלת באתר הרשמי, כשרכיב הווידאו נפתח ראשון. יצירת התמונות וה-Action אמורות להצטרף בשבועות ובחודשים הקרובים, וגרסת הקוד הפתוח מתוכננת מאוחר יותר ב-2026.
איך מתחילים עם FLUX 3?
כל עוד המודל בגישה מוקדמת, ההתחלה היא בעיקר הרשמה והתנסות זהירה. שלושה צעדים פשוטים.
01הצטרפו לגישה המוקדמת
היכנסו לאתר הרשמי של Black Forest Labs בכתובת bfl.ai והירשמו לתוכנית ה-early access של FLUX 3. הגישה מאושרת בהדרגה, אז ייתכן שתצטרכו להמתין לאישור.
02התחילו מהווידאו
רכיב הווידאו הוא הראשון שנפתח. נסו פרומפט קצר וברור, הגדירו את הסצנה, ותנו למודל לייצר קטע עם קול. התחילו ממשהו פשוט לפני שאתם בונים רצף מרובה שוטים.
03עקבו אחרי גרסת הקוד הפתוח
אם אתם מפתחים או רוצים להריץ מקומית, שווה לעקוב אחרי ההכרזה על FLUX 3 Dev. זאת תהיה נקודת הכניסה הזולה והגמישה ביותר, בדומה לדרך שבה FLUX.1 הפך פופולרי.
למי FLUX 3 מתאים?
- אתם יוצרים או סטודיו שרוצים וידאו עם קול מובנה במקום להרכיב שכבות בנפרד
- מעניין אתכם הכיוון של מודל אחד לכל סוגי המדיה
- אתם מפתחים שמחכים לגרסת קוד פתוח כדי להריץ מקומית
- אתם עוקבים אחרי חדשות AI ורוצים להיות בין הראשונים להתנסות
- מעניין אתכם השילוב של יצירת מדיה עם רובוטיקה ו-AI פיזי
- אתם צריכים כלי וידאו מוכן ויציב לעבודה כבר עכשיו
- אתם לא רוצים להמתין לאישור גישה מוקדמת
- חשוב לכם מחיר ידוע מראש
- אתם עובדים בעיקר בעברית וזקוקים לתמיכה מלאה כבר היום
- אתם מעדיפים כלי עם קהילה גדולה ומדריכים בשפע, כמו Sora או Veo
✓מה חשוב לזכור
- FLUX 3 הוא מודל מולטימודלי אחד שמייצר תמונה, וידאו וקול, מבית Black Forest Labs
- החברה הוקמה ב-2024 על ידי החוקרים שעמדו מאחורי Stable Diffusion
- הווידאו מגיע עד 20 שניות עם קול מסונכרן, כולל דיבור, אפקטים ומוזיקה
- יש גם יכולת חדשה של חיזוי פעולות לרובוטים, כיוון של AI פיזי
- נכון לסוף יולי 2026 המודל בגישה מוקדמת, וגרסת קוד פתוח מתוכננת בהמשך
שאלות ותשובות
מה זה FLUX 3? ▼
FLUX 3 הוא מודל יסוד מולטימודלי של חברת Black Forest Labs. בניגוד למודלים שעושים דבר אחד, הוא מייצר תמונות, וידאו וקול מאותה מערכת, ואף מנסה לחזות פעולות פיזיות של רובוט.
מי עומד מאחורי FLUX 3? ▼
Black Forest Labs, חברה גרמנית מפרייבורג שהוקמה ב-2024 על ידי החוקרים שעמדו מאחורי Stable Diffusion. החברה גייסה כ-31 מיליון דולר בסבב ההתחלתי, בהובלת קרן a16z.
כמה FLUX 3 עולה? ▼
נכון לסוף יולי 2026 לא פורסם מחיר רשמי. הגישה כיום היא דרך תוכנית early access מוגבלת, וגרסת קוד פתוח בשם FLUX 3 Dev מתוכננת מאוחר יותר השנה.
מה אורך הווידאו ש-FLUX 3 מייצר? ▼
המודל מייצר קטעי וידאו באורך עד 20 שניות, עם קול מסונכרן שנוצר יחד עם התמונה, כולל דיבור בכמה שפות, אפקטים קוליים ומוזיקה.
במה FLUX 3 שונה מ-Sora ומ-Veo? ▼
Sora ו-Veo מתמקדים בעיקר בווידאו והם מודלים סגורים. FLUX 3 מנסה לאחד תמונה, וידאו, קול ופעולה במודל אחד, ומתכנן גם גרסת קוד פתוח, משהו שאין למתחרים הסגורים.
אפשר להשתמש ב-FLUX 3 בעברית? ▼
הדיבור שנוצר בווידאו תומך בכמה שפות, אבל בשלב הגישה המוקדמת המיקוד הוא באנגלית ובשפות הנפוצות. תמיכה מלאה בעברית תצטרך להיבחן כשהמודל ייפתח לקהל רחב.