שי מגזימוף
עב EN

מרכזי נתונים מבוזרים מאובטחים יותר

אש ועשן שחור עולים ממרכז נתונים של AWS באיחוד האמירויות לאחר מתקפות כטב"ם איראניות, מרץ 2026.
דובאי, איחוד האמירויות, 1 במרץ 2026. כטב"מים איראניים פגעו בשני מרכזי נתונים של Amazon AWS באזור ME-CENTRAL-1. שניים מתוך שלושה אזורי זמינות יצאו מכלל פעולה. צילום: Getty Images / BBC.

מה שמדאיג אותי בג'יגה-ואט באתר אחד הוא כמה עלול להיעלם באירוע אחד.

מרכז נתונים צריך תחנת משנה, חיבורי סיבים אופטיים וקירור תעשייתי, לצד ה-GPUs. אבטחת סייבר מגינה על חלק מהמערכת הזאת; היא לא פותרת את החשיפה לנזק פיזי. בסכומים שמתחייבים להשקיע היום, קשה יותר להתעלם מהחשיפה הזאת. Stargate של OpenAI הוכרז כתוכנית של 500 מיליארד דולר על פני ארבע שנים, ולאחר מכן הוצג כתוכנית בהיקף 500 מיליארד דולר ו-10 ג'יגה-ואט. Meta הכריזה על קמפוס AI של 10 מיליארד דולר על שטח של 4 מיליון רגל רבוע בלואיזיאנה. TSMC הודיעה שהיקף השקעתה בארה"ב יגיע ל-165 מיליארד דולר.

קמפוס אחד

כשהתחלנו לתכנן קיבולת AI בקנה מידה של ג'יגה-ואט בישראל, שקלנו קודם קמפוס אחד. כך היה קל יותר להסביר את התוכנית ולחבר את ה-GPUs זה לזה. זה גם ריכז את הסיכון.

ואז שאלנו שאלת אבטחה אחת. כמה מקיבולת ה-AI של המדינה אנחנו שמים בתוך תחום כשל אחד?

השאלה הזאת הורידה את התוכנית מהפרק. בישראל, כטב"מים, טילים, תקלות ברשת החשמל וביטוח סיכוני מלחמה משנים את המקומות שבהם אפשר לבנות ואת מה שאפשר לבטח.

האירוע באיחוד האמירויות הפך את השאלה למוחשית. ב-1 במרץ 2026, כטב"מים איראניים פגעו ישירות בשני מרכזי נתונים של Amazon AWS בדובאי, שניים מתוך שלושה אזורי זמינות באזור ME-CENTRAL-1 יצאו מכלל פעולה, 109 שירותים נכשלו, ובנקים, פלטפורמות תשלומים ואפליקציות הסעות הושבתו. לבניינים היו כל אמצעי ההגנה הסטנדרטיים: גדרות, מצלמות, חשמל מגובה, גנרטורי גיבוי. אף אחד מהם לא תוכנן לעמוד בפגיעת כטב"ם. AWS הנחתה את הלקוחות להעביר עומסי עבודה לאזור אחר והזהירה שההתאוששות תיקח שבועות, בהתחשב בנזק הפיזי. BBC, Data Center Dynamics.

מלחמת רוסיה באוקראינה דחפה את אותו מהלך בקנה מידה גדול יותר: יעד קטן יותר לאתר, מפוזר על פני תחומי כשל אמיתיים.

חשמל נכנס, חום יוצא

אם מסירים את השיווק, מרכז נתונים הוא מכונה לשתי עבודות: להכניס חשמל לתוך ארונות שרתים, ולהוציא מהם חום, בבטחה, למשך שנים. רוב העלות ורוב הסיכון נמצאים בתשתיות האלה, לא בקירות.

החשמל נכנס במתח גבוה ויורד שלב אחר שלב: הרשת מספקת 138 עד 345 קילו-וולט, תחנת המשנה באתר מורידה את המתח לרמה בינונית, שנאים ליד האולם מורידים אותו לכ-415 וולט, בארון השרתים המתח יורד שוב, והשבב פועל בפחות מוולט אחד. המתח נשאר גבוה כמה שיותר זמן כי אנרגיה שאובדת כחום בכבל עולה עם ריבוע הזרם; מתח גבוה יותר אומר זרם נמוך יותר, פחות חום ופחות נחושת. משוואה אחת מעצבת את כל הבניין.

שרשרת החשמל, מבחוץ פנימה: רשת, תחנת משנה, שנאי, ארון, שבב. כל שלב מוריד מתח ומעלה זרם. כל העיצוב קיים כדי לספק הרבה חשמל לשבב קטן מבלי להמיס את החוטים.

השנאים הגדולים פועלים ב-50 עד 100 MVA כל אחד; הם מיוצרים לפי הזמנה, וזמני האספקה יכולים לעלות על שנה כי הם תלויים בפלדה מיוחדת עם מעט ספקים. אז המפעילים קונים יתירות, ולכל רמה יש שם מדויק: N זה בדיוק מספיק ציוד להפעלה, N+1 זה רכיב יתיר אחד, 2N זה סט שני מלא, ו-Uptime Institute מסווג את זה לדרגות Tier. בפנים, הבניין כבר מחולק ליחידות בכוונה. אולם מחולק ליחידות (pods) של כ-1.6 עד 2.5 מגה-ואט, כל אחת עם השנאים וציוד המיתוג שלה וגנרטור דיזל בגודל מנוע קטר, כשסוללות ה-UPS מגבות את העומס בכשישים השניות שלוקח לגנרטור להתניע. מהנדסים יגידו לכם שלתקלה חשמלית יש "רדיוס פגיעה" קטן יותר מכשל קירור. Blast radius הוא מונח מקצועי; כאן אשתמש ב"רדיוס הפגיעה". אפילו בניין בודד בנוי סביב חלוקת הסיכון.

כל וואט שמכניסים ל-GPU חוזר כוואט חום בערך; אולם של 100 מגה-ואט הוא גוף חימום של 100 מגה-ואט, והקירור הוא חצי מהמכונה. ליעילות יש מספר אחד, PUE, היחס בין צריכת החשמל הכוללת של המתקן לצריכת החשמל של ציוד ה-IT: הממוצע בתעשייה הוא סביב 1.6, ה-hyperscalers הטובים ביותר פועלים בסביבות 1.1. למים יש מדד משלהם, WUE, ואתר בינוני יכול לצרוך מאות מיליוני ליטרים בשנה אם הוא נשען על קירור באידוי, שאוויר יבש הופך ליעיל, וזה אחד השיקולים בבחירת אתר במדבר. ככל שהארונות הופכים צפופים יותר, אוויר לבדו מפסיק לעבוד, וקירור נוזלי ישיר לשבב הופך לחובה.

נתיב החום: שבב, לוחית קירור, לולאת נוזל קירור, צ'ילר, מגדל קירור. ההספק הופך לחום בשבב, ועבודת הבניין היא להזיז את החום הזה החוצה, לולאה אחר לולאה, מבלי לתת לשבב להתחמם יתר על המידה.

החוט הקצר

הטענה לטובת ריכוז אמיתית. אימון מודל גדול הוא סינכרוני: עשרות אלפי GPUs עובדים בסנכרון מלא וממתינים זה לזה, לכן הקישורים ביניהם חייבים להיות מהירים וקצרים, וחיבורי נחושת מהירים עובדים רק למרחק של כמה מטרים. מארג NVLink בתוך הארון הרבה יותר מהיר מהרשת שבין הארונות. ככל שהטוקנים שלכם צריכים להיות זולים יותר, כך אורזים את ה-GPUs בצפיפות רבה יותר.

לכן ההספק לארון ממשיך לטפס. במשך שנים ארונות שרתים צרכו פחות מ-10 קילוואט; ה-GB200 NVL72 של Nvidia אורז 72 GPUs בארון עם קירור נוזלי אחד, בהספק של 120 קילוואט ומעלה, ומפת הדרכים לשנת 2027, שנבנתה על ארכיטקטורת חשמל חדשה של 800 VDC, מצביעה על הספק שבין 600 קילוואט למגה-ואט לארון. ספקו 600 קילוואט במערכת ישנה של 54 וולט ותצטרכו כ-11,000 אמפר; עשו זאת ב-800 וולט ותצטרכו כ-750. כשמציבים GPUs קרוב זה לזה, האימון יעיל יותר. זה גם חושף חלק גדול יותר מההשקעה לאותה תקלה.

ההספק לארון עולה ככל שיותר GPUs חולקים חיבורים קצרים ומהירים יותר.

הריכוז לא נעצר בגדר. ריצת אימון מסונכרנת, ולכן צריכת החשמל שלה משתנה בחדות: מאמר Llama 3 של Meta מתאר עשרות אלפי GPUs שההספק שלהם עולה ויורד יחד באותו רגע, "בסדר גודל של עשרות מגה-ואט," מספיק כדי להעמיס על הרשת, ומהנדסים ממש הריצו עומסי דמה רק כדי למנוע מהתנודות האלה לפגוע במערכת החשמל. ביולי 2024, תקלה בודדת ניתקה מהרשת כ-1.5 ג'יגה-ואט של מרכזי נתונים בווירג'יניה בבת אחת. בקנה מידה של ג'יגה-ואט, תחום הכשל מתרחב לרשת החשמל עצמה; שימו ג'יגה-ואט מאחורי חיבור אחד לרשת, ותקלה מקומית הופכת לתקלה אזורית.

מפעל רגיל צורך חשמל בקצב יציב. ריצת אימון מסונכרנת קופצת בין הספק מלא לסרק, עשרות מגה-ואט בשבריר שנייה. בקנה מידה של ג'יגה-ואט, תנודה במקום אחד יכולה לערער את כל רשת החשמל.

תחומי כשל

תחום כשל הוא חלק ממערכת שיכול להיכשל לבד מבלי להפיל את השאר. Google Cloud משתמשת בדיוק בשפה הזו: Region או Availability Zone יכולים לשמש תחום כשל, ופיזור ביניהם משפר את הזמינות. הדוגמה של Google עצמה היא החשבון של הרעיון: שני רכיבים, שכל אחד מהם זמין ב-99.9%, כשהם ממוקמים בתחומי כשל נפרדים, מורידים את הסיכוי ששניהם ייכשלו בו-זמנית לאחד למיליון, אם הם עצמאיים.

גם בתחומים אחרים משתמשים במדדים דומים כדי לתכנן למקרה של כשל.

תחוםמה הם כבר קוראים לזה
ענןתחומי כשל, אזורים, אזורי זמינות
ביטוחהפסד מקסימלי צפוי
רשתות חשמלתכנון N-1 לתרחיש מגירה
ביטחוןהבטחת משימה
תשתית קריטיתסיכון מבוסס השלכות (CISA)
מרכזי נתוניםUptime Tier III ו-Tier IV

כמה ערך, הספק וקיבולת לאומית אפשר לאבד באירוע מקומי אחד, וכמה מהר יכול השאר להמשיך לעבוד? קחו פלטפורמת AI של 40 מיליארד דולר. באתר אחד נמצאת כל ההשקעה; בארבעה אתרים שווים בגודלם, בכל אחד נמצא רבע ממנה; בשנים-עשר מודולים של 100 מגה-ואט, בכל אחד מושקעים כ-3.3 מיליארד דולר. אתרים נפרדים יכולים להגביל את מה שאירוע מקומי אחד משבית, בתנאי שאינם תלויים באותן מערכות פגיעות. המספרים להלן מניחים עצמאות כזאת.

ארכיטקטורהתחומי כשלערך לתחוםריכוז
אתר ענק אחד140 מיליארד דולר1.00
ארבעה אתרים410 מיליארד דולר0.25
שנים-עשר מודולים123.3 מיליארד דולר0.08

אחד-עשר מתוך שנים-עשר

כשהאתרים עצמאיים, תקלה מקומית משאירה את שאר הקיבולת פועלת. ההפסד הממוצע לאורך זמן יכול להישאר זהה: אם לכל אתר אותה הסתברות כשל עצמאית, ההפסד הצפוי נראה דומה באתר אחד או בארבעה. אני שואל שאלה אחרת: כמה קיבולת שורדת אירוע אחד, וכמה זמן נמשכת ההתאוששות.

הדוגמה מניחה שהאירוע פוגע באתר אחד ושהמערכות התומכות בכל מודול עצמאיות. בתנאים האלה, אחד-עשר מתוך שנים-עשר המודולים נשארים זמינים.

פיזור עובד רק כשהאתרים יכולים להיכשל באופן עצמאי. תחנת משנה משותפת, מסלול סיב משותף, תלות במערכת קירור משותפת, מישור בקרה משותף או פרצת אבטחה משותפת הופכים כמה בניינים בחזרה לתחום כשל אחד; אירוע וירג'יניה שצוין לעיל הוא בדיוק זה, בניינים רבים ותחום כשל אחד. מרחק לבדו לא יוצר עצמאות.

הצעות למרכזי נתונים בצבירים צפופים במסלול מעלות את אותו חשש. כתבתי עליהן בפוסט הם עשויים מקומפיוט.

מחיר המרחק

פיזור יקר יותר. צריך תחנות משנה, מתקני קירור, אבטחה וצוות בכל אתר, מאבדים יתרונות לגודל, וביצועי הרשת נפגעים כשהאתרים רחוקים זה מזה. השאלה אם המחיר הזה שווה את התשלום תלויה בסיכונים באותם אתרים.

אני בונה מודלים של שיבוש מאירוע יחיד בעזרת המדדים שמבטחים, מתכנני ענן ומתכנני רשת כבר משתמשים בהם: תחומי כשל, הפסד מקסימלי צפוי והמשכיות תפעולית. מול העלות הנוספת של אתרים עצמאיים צריך לשקול כמה קיבולת אנחנו עלולים לאבד וכמה זמן יידרש להתאושש.

מדינה קטנה

ישראל היא מדינה קטנה עם יתרונות אמיתיים לכך: שמש, כישרון, דחיפות, וצורך אמיתי במחשוב משלה. אם מחשוב AI הופך קריטי לביטחון, לכלכלה, למדע ולממשלה, אז מרכזי נתונים הם תשתית לאומית, ותשתית לאומית לא צריכה להיות תלויה בבניין אחד. מדינות קטנות לא יכולות להתייחס לסיכון לתשתיות כתיאורטי.

מחשוב AI בקנה מידה ג'יגה-ואט הוא המטרה. אנחנו בונים אותו כרשת של מפעלים קטנים יותר: מודולריים, מוקשחים, מחוברים, מפוזרים על פני תחומי כשל אמיתיים. אולם GPU מחובר לכמה מאות מגה-ואט, משוכפל על פני אתרים שכל אחד מהם יכול להיכשל באופן עצמאי.

באפריל 2024 עצרתי עם האופניים שלי ליד הבית וצילמתי יירוטים וטילים שהאירו את השמים מעל ישראל. מאז, כשאני מסתכל על תוכנית של אתר, אני שואל מה ימשיך לעבוד אם הוא ייפגע.



מקורות

  • מתקפות כטב"ם על AWS ME-CENTRAL-1 באיחוד האמירויות, 1-3 במרץ 2026: שני מתקנים נפגעו ישירות, שניים מתוך שלושה אזורי זמינות אופליין, 109+ שירותים פגועים, ההתאוששות צפויה לקחת שבועות. BBC, Data Center Dynamics.
  • OpenAI Stargate, הוכרז ב-500 מיליארד דולר על פני ארבע שנים ומאוחר יותר מוגדר כתוכנית 500 מיליארד דולר, 10GW. OpenAI, OpenAI.
  • מרכז נתונים ל-AI של Meta בשווי 10 מיליארד דולר, 4 מיליון רגל רבוע בפריש ריצ'לנד, לואיזיאנה. Opportunity Louisiana.
  • השקעה מתוכננת של TSMC בארה"ב של עד 165 מיליארד דולר. TSMC.
  • Nvidia GB200 NVL72: 72 GPUs בארון נוזלי אחד, 120 קילוואט ומעלה, תחום NVLink בודד. Nvidia.
  • ארכיטקטורת 800 VDC של Nvidia לארונות של 1 מגה-ואט ומעלה, החל מ-2027. Nvidia.
  • תנודות הספק מסונכרנות בסדר גודל של עשרות מגה-ואטים. Meta, The Llama 3 Herd of Models.
  • כיצד החשמל והקירור במרכז נתונים עובדים בפועל (שרשרת חשמל, PUE, WUE, יחידות (pods), גנרטורים, יתירות). SemiAnalysis, Datacenter Anatomy Part 1 וPart 2.
  • סיכון קסקדת רשת מעומסים מסונכרנים גדולים, ואירוע ווירג'יניה ביולי 2024 שבו ~1.5 ג'יגה-ואט של מרכזי נתונים התנתקו בו זמנית. SemiAnalysis.
  • הפסקת החשמל בחצי האי האיברי מ-28 באפריל 2025: כ-2,200 מגה-ואט אבדו תוך שניות, קריסה מלאה בפחות מחצי דקה. דוח סופי של ENTSO-E.
  • תחומי כשל, אזורים ואזורי זמינות כיחידת אמינות. Google Cloud.
  • סיווג Uptime Institute Tier (Tier III ניתן לתחזוקה במקביל, Tier IV עמיד בפני תקלות). Uptime Institute.
  • תשתית קריטית מוגדרת על פי השלכת שיבוש. CISA.