סיכום מנהלים
מאיצי בינה מלאכותית בעלי ביצועים גבוהים כיום מוגבלים קשות על ידי מגבלות קיבולת הזיכרון של זיכרון רוחב פס גבוה (HBM) , הדורשים אשכולות עצומים של יחידות עיבוד גרפיות (GPU) מחוברות רק כדי לאחסן מודלים של שפה גדולה (LLMs) של טריליוני פרמטרים . SanDisk ו-SK Hynix הציגו זיכרון פלאש רוחב פס גבוה (HBF) , הממנפים טכנולוגיית NAND תלת-ממדית מוערמת בת 16 שכבות כדי לספק עד 512 ג’יגה-בייט של אחסון לא נדיף על מודול יחיד בתפוקה של 1.6 טרה-בייט לשנייה. HBF, שתוכנן להשתלב לצד HBM באמצעות TSMC CoWoS או אריזה מתקדמת של Intel EMIB, מנתק את זיכרון המחשוב לשכבה היברידית: DRAM מהיר במיוחד מנהל אחסון מקדים וזיכרון מטמון עתיר כתיבה (KV) , בעוד ש-NAND בצפיפות גבוהה משרת פענוח אסימונים עתיר קריאה. פרדיגמה זו מורידה באופן דרסטי את עלויות האחסון לכל ביט, מפחיתה את צריכת החשמל של שרתים במצב סרק ומאפשרת אירוח ארכיטקטורות רשתות עצביות קדמיות על שבב יחיד מבלי לגרום לעלויות קנה מידה גבוהות של חומרה.
ציווי זיכרון המוליכים למחצה: כיצד ארכיטקטורת HBF כותבת מחדש את תשתית הבינה המלאכותית הגלובלית ואת הכוח הגיאופוליטי
מהפכת הבינה המלאכותית הגיעה לסף פיזי שבו צוואר הבקבוק העיקרי אינו עוד מהירות העיבוד, אלא פיזיקת הזיכרון. ככל שמודלים של יסודות של טריליוני פרמטרים דוחפים מרכזי נתונים ארגוניים ורשתות אנרגיה לאומיות לעבר תשישות תפעולית, המערכת האקולוגית העולמית של מוליכים למחצה ניצבת בפני חומת זיכרון מבנית. זיכרון רוחב פס גבוה (HBM), תקן הזהב למאיצי בינה מלאכותית, מוגבל על ידי מגבלות צפיפות זיכרון RAM דינמיות, עלויות יחידה גבוהות וזליגת חשמל חמורה. הופעתו של זיכרון הבזק רוחב פס גבוה (HBF) – ארכיטקטורת NAND תלת-ממדית בת 16 שכבות שפותחה על ידי SanDisk ו-SK Hynix – מייצגת יותר מפריצת דרך טכנולוגית. היא מסמנת שינוי מערכתי באריזת סיליקון, הקצאת הון ואסטרטגיית מחשוב ריבונית.
קיר הזיכרון האדריכלי
צמתי מחשוב מודרניים של בינה מלאכותית מוגבלים ביסודם לזיכרון. בעוד שיחידות עיבוד גרפיות (GPU) ויחידות עיבוד טנזור (TPU) נוכחיות מספקות חישובי מטריצת פטה-פלופ מרובי, קיבולת זיכרון הגישה האקראית הדינמית (DRAM) שלהן נותרה מוגבלת מאוד. מודולים סטנדרטיים של HBM3e ומודולים חדשים של HBM4 מציעים תפוקה העולה על 2.5 טרה-בייט לשנייה (TB/s), אך קיבולות הערימה הבודדות מוגבלות ל-36GB או 48GB. כדי לארח מודל המכיל למעלה מטריליון פרמטרים, היפר-סקיילרים חייבים לאגד מאות מעבדים יקרים באמצעות חיבורים מהירים כמו NVIDIA NVLink, מה שמביא את עלויות מדפי השרתים למאות אלפי דולרים.
ארכיטקטורת HBF שוברת את הגבול הפיזי הזה על ידי החלפת שבבי DRAM נדיפים בזיכרון פלאש NAND תלת-ממדי מוערם בן 16 שכבות. על ידי מינוף חיבורי Through-Silicon Via (TSV) וקשר היברידי ישיר נחושת-לנחושת (Cu-Cu) תת-מיקרון, מודול HBF יחיד בן 16 שבבים מספק 512 ג’יגה-בייט של אחסון לא נדיף על שטח יחיד – עלייה בקיבולת פי 14 בהשוואה לערימות HBM סטנדרטיות – עם מהירויות קריאה המגיעות ל-1.6 טרה-בייט/שנייה ביישומים מהדור הראשון וצפויות לעלות על 3.2 טרה-בייט/שנייה באיטרציות עוקבות. טופולוגיה זו מנצלת את הפיצול החישובי של מודלי שפה גדולים: בליעת בקשת עתירת כתיבה (מילוי מוקדם) ואחסון במטמון Key-Value (KV) נותרות מעוגנות ל-HBM DRAM מהיר, בעוד שיצירת אסימונים אוטורגרסיבית דומיננטית בקריאה (פענוח) מזרמת משקלי מודל סטטיים ישירות מזיכרון פלאש HBF צפוף במיוחד.
הכלכלה של ערימת הסיליקון
ההשלכות הפיסקליות על תשתית הענן הגלובלית הן עצומות. הוצאות ההון של חברות הטכנולוגיה הגדולות – בהובלת מיקרוסופט, אלפבית, מטה ואמזון – צפויות לעלות יחד על 200 מיליארד דולר בשנה בתשתית מרכזי נתונים מבוססי בינה מלאכותית. בתוך צומת שרתים מבוסס בינה מלאכותית מתקדם, תת-מערכות זיכרון מהוות עד 30% עד 35% מסך רשימת החומרים (BOM). אחסון פרמטרים סטטיים ב-DRAM נדיף מטיל עונש כספי כפול: עלויות רכישת חומרה מופרזות וצריכת חשמל רציפה במצב המתנה הנדרשת לביצוע מחזורי טעינה-רענון של DRAM כל 32 עד 64 מילישניות.
על ידי שילוב HBF ישירות על גבי חוצים מסיליקון לצד שבבי לוגיקה באמצעות אריזות TSMC Chip-on-Wafer-on-Substrate (CoWoS) או Intel Embedded Multi-Die Interconnect Bridge (EMIB), מפעילי חומרה מפחיתים באופן דרמטי את עלויות האחסון לכל ביט. מכיוון ש-NAND תלת-ממדי עם מלכודת מטען מאחסן אלקטרונים בצורה מאובטחת בתוך שכבות סיליקון ניטריד (Si₃N₄) המוגבלות על ידי דיאלקטרי מנהור סיליקון דו-חמצני (SiO₂), HBF דורש אפס כוח רענון במצב המתנה. מצב לא נדיף זה מפחית את צריכת החשמל של צומת במצב סרק עד 60% במהלך לולאות פענוח אסימונים. יתר על כן, עמידות פרמטרים על השבב מבטלת את הצורך לטעון מחדש טרה-בייטים של נתוני משקל מכונני מצב מוצק מארחים על פני אפיקי PCIe במהלך אתחול קר של המערכת, וממטב את זמן הפעולה התפעולי עבור סביבות ארגוניות קריטיות למשימה.
ציר הזיכרון הגיאופוליטי
אריזות זיכרון כבר אינן רק מיזם מסחרי; הן עמוד תווך של מדיניות המדינה והתעשייה. במסגרת חוק השבבים והמדע של ארה”ב, שנחקק ב-9 באוגוסט 2022, המספק 52.7 מיליארד דולר בסובסידיות ישירות לייצור ו-75 מיליארד דולר בהלוואות, משרד המסחר של ארצות הברית, בראשות מזכירת המדינה ג’ינה ריימונדו, תמריץ באופן אגרסיבי אריזות זיכרון מתקדמות מקומיות. הקצאות בולטות כוללות 6.1 מיליארד דולר שהוענקו ל-Micron Technology, 8.5 מיליארד דולר לאינטל, 6.6 מיליארד דולר ל-TSMC ו-450 מיליון דולר ל-SK Hynix עבור מתקן האריזות והמחקר והפיתוח המתקדמים שלה בווסט לאפייט, אינדיאנה.
במקביל, האיחוד האירופי מבצע את חוק השבבים האירופי שלו, בשווי 43 מיליארד אירו, שאומץ באפריל 2023, שנועד להכפיל את נתח ייצור המוליכים למחצה העולמי של האיחוד האירופי ל-20% עד 2030. במזרח אסיה, חוק השבבים K של דרום קוריאה מעגן את אשכול המוליכים למחצה יונגין המגמה העצום – מיזם ציבורי-פרטי המכוון להשקעות של למעלה מ-470 מיליארד דולר עד 2047, כאשר SK Hynix התחייבה ביותר מ-90 מיליארד דולר לבניית ארבעה מגה-מפעלים. בינתיים, מערכות הליתוגרפיה האולטרה-סגולות הקיצוני (High-NA EUV) בעלות צמצם מספרי גבוה של ASML, במחיר של למעלה מ-350 מיליון אירו ליחידה, מייצגות את עמוד השדרה הליתוגרפי החיוני עבור שבבי לוגיקה בסיסיים מתחת ל-2 ננומטר. היישור הגיאופוליטי של זרימות הון אלו מדגיש מציאות ייחודית: שליטה על אריזות זיכרון מתקדמות שקולה לשליטה על קיבולת בינה מלאכותית.
אריזות מתקדמות כגבול ריבוני
ככל שקנה המידה של טרנזיסטורים פיזיים מתקרב לגבולות הקוונטיים, אריזה הטרוגנית מתקדמת צצה כשדה קרב חדש לריבונות טכנולוגית. הלשכה האמריקאית לתעשייה וביטחון (BIS), הפועלת במסגרת תקנות מינהל הייצוא (EAR), הידקה באופן שיטתי את בקרות הייצוא על מאיצי מחשוב בעלי ביצועים גבוהים וציוד מוליכים למחצה מתקדם המיועדים לסין. הגבלות המכוונות לטכנולוגיית NAND תלת-ממדית עם יותר מ-128 שכבות שיבשו ישירות אלופות זיכרון סיניות כמו Yangtze Memory Technologies Corp (YMTC).
בתגובה, מרכזים בעלי ברית מערב מחזקים את יתרונם בארכיטקטורות מתקדמות של חוצצים. הרחבת קיבולת CoWoS של TSMC – המגיעה ל-40,000 פרוסות תהום בחודש – ופלטפורמת EMIB של אינטל משמשות כצווארי בקבוק פיזיים חיוניים. שילוב מודול HBF בן 16 שכבות דורש דיוק יישור של תת-מיקרון כדי לחבר אלפי עמודות TSV נחושת אנכיות ללא חללים מיקרוסקופיים או אי-התאמות בהתפשטות תרמית. מורכבות ייצור זו יוצרת חפיר טכנולוגי אדיר. מדינות לא-מזדהות המבקשות לשכפל ארכיטקטורות HBF בנות 16 שכבות מתמודדות עם מחסומים חמורים בכלי פלנריזציה כימית-מכנית (CMP), מערכות איכול פלזמה בעלות יחס גובה-רוחב גבוה ובקרות סביבתיות בחדרים נקיים, מה שמבסס את היתרון האסטרטגי של ברית המוליכים למחצה ארה”ב-איחוד האירופי-מזרח אסיה.
הציווי התשתית והיתרון הטקטי
מעבר למרכזי נתונים בקנה מידה גדול, ארכיטקטורת HBF מטפלת במשבר האנרגיה העולמי הגובר הקשור לבינה מלאכותית. הסוכנות הבינלאומית לאנרגיה (IEA) מעריכה כי הביקוש העולמי לחשמל ממרכזי נתונים, בינה מלאכותית ומטבעות קריפטוגרפיים עשוי להכפיל את עצמו עד 2026, ולעבור את 1,000 טרה-וואט-שעה (TWh) – שווה ערך לכלל צריכת החשמל של יפן. על ידי ניתוק קיבולת הזיכרון מזרמי רענון רציפים של DRAM, HBF מציעה שסתום הקלה תרמודינמי מיידי לתשתיות רשת מוגבלות בחשמל.
באופן מכריע, צפיפות בלתי-נדיפה זו מאפשרת פריסה של בינה מלאכותית ריבונית בקצה הטקטי. בתחומי ההגנה, המודיעין והחלל – שבהם קישוריות ענן מתמשכת נפגעת או אסורה – צמתי חומרה בעלי שקע יחיד המצוידים במודולי HBF בנפח 512 ג’יגה-בייט יכולים לארח מודלים בקנה מידה מלא של טריליון פרמטרים באופן מקומי. פלטפורמות אסטרטגיות, החל ממרכזי פיקוד ימיים ועד יחידות מודיעין אותות נייד (SIGINT), מקבלות את היכולת לבצע הערכת איומים בזמן אמת ועיבוד אוטונומי ללא הסתמכות על תשתית מרכזי נתונים מרוחקים או קישורי תקשורת פגיעים.
מחיר חוסר המעש
המעבר מפריסות HBM הומוגניות להיררכיות זיכרון HBM-HBF הטרוגניות מייצג נקודת מפנה מכרעת עבור משקיעים מוסדיים, מנהיגים בתעשייה וקובעי מדיניות. מדינות ותאגידים המתייחסים לאריזת זיכרון כרכיב מסחרי מסתכנים בדחיקה אסטרטגית בעידן המוגדר על ידי דומיננטיות של בינה מלאכותית. החשבון הכלכלי חד משמעי: הרחבת מחשוב בינה מלאכותית דורשת הרחבת צפיפות הזיכרון בעלויות הון ואנרגיה בנות קיימא. פריסת פלאש רוחב פס גבוה בעל 16 שכבות מספקת את הבסיס הטכנולוגי המכריע לאירוח הדור הבא של בינה מלאכותית, ומעצבת מחדש את האיזון העולמי של כוח טכנולוגי, כלכלי וגיאופוליטי.
תקציר ראשי: סינתזה טכנית של ארכיטקטורת פלאש ברוחב פס גבוה (HBF)
מגבלות קנה המידה הפיזי של ארכיטקטורות מחשוב מודרניות של בינה מלאכותית מוגדרות יותר ויותר לא על ידי פעולות נקודה צפה גולמיות לשנייה (FLOPS), אלא על ידי חומת קיבולת הזיכרון החמורה הטבועה בארכיטקטורות זיכרון ברוחב פס גבוה (HBM). מודלים מודרניים של רשתות עצביות המכילות מאות מיליארדי עד טריליוני פרמטרים חורגים מהקיבולת המקומית של צמתי מאיץ בודדים, מה שמאלץ מהנדסי חומרה לפזר מופעים של מודל יחיד על פני אשכולות נרחבים וצועדי אנרגיה המקושרים באמצעות חיבורים בעלי השהייה נמוכה במיוחד כמו NVIDIA NVLink או AMD Infinity Fabric. בעוד שארכיטקטורות HBM3e וארכיטקטורות HBM4 המתפתחות מציעות רוחב פס זיכרון חסר תקדים העולה על 2.5 טרה-בייט לשנייה לכל מחסנית, ההסתמכות הבסיסית שלהן על זיכרון גישה אקראית דינמי (DRAM) מגבילה את קיבולות המודולים הבודדים לעשרות ג’יגה-בייט עקב גודל השבב הפיזי, פיזור הספק ותקורות רענון. זיכרון הבזק ברוחב פס גבוה (HBF) , שפותח במשותף באמצעות מסגרות הנדסת זיכרון מתקדמות על ידי SanDisk ו- SK Hynix , יוצר שינוי ארכיטקטוני בסיסי על ידי החלפת שבבי אחסון ה-DRAM של ערימות HBM סטנדרטיות בשבבי פלאש NAND תלת-ממדיים בצפיפות גבוהה, תוך שמירה על מבני החיבור Through-Silicon Via (TSV ) בצפיפות גבוהה ושיטות אריזת חוצי סיליקון המגדירות את תכנון המאיצים המודרני.
על ידי ערימת 16 שכבות של שבבי NAND בצפיפות גבוהה, מודול HBF יחיד בעל 16 שבבים מספק עד 512 ג’יגה-בייט של קיבולת זיכרון לא נדיף לכל חבילה, המייצג עלייה פי ארבעה עשר בצפיפות האחסון בהשוואה למודולי HBM סטנדרטיים המשמשים בסיליקון מתקדם. HBF, הפועל ברוחב פס שיא התחלתי של 1.6 טרה-בייט/שנייה, מגשר על פער התפוקה המסורתי בין כונני SSD (מצב מוצק) PCI Express קונבנציונליים לבין DRAM ארגוני, מתקרב למהירויות התפעול של HBM3e תוך הרחבה דרסטית של גבולות האחסון המקומי. מכיוון ש-HBF משתמש במסגרות אריזה מתקדמות מבוססות – במיוחד TSMC Chip-on-Wafer-on-Substrate (CoWoS) ו- Intel Embedded Multi-Die Interconnect Bridge (EMIB) – ניתן להתקין אותו ישירות בסמוך לשבב המאיץ על אותו חוצה סיליקון. קרבה זו ממזערת את אורכי העקבות ואת הנחתת האות, ומאפשרת למערכת להשיג רוחב פס קריאה של טרה-בייט לשנייה ברמות צריכת חשמל דומות או מתחת לשטחי HBM מקבילים. כתוצאה מכך, HBF מטפל בצווארי הבקבוק הכלכליים והפיזיים של קנה המידה של מרכזי נתונים של בינה מלאכותית על ידי החלפת מערכים עצומים של צמתי DRAM מבוזרים בשכבות זיכרון פלאש מקומיות וצפופות במיוחד המסוגלות לארח משקלים עצביים עצומים על שטח של מכשיר יחיד.
הכדאיות התפעולית של HBF מסתמכת על המאפיינים החישוביים האסימטריים של הסקת מודל שפה גדולה, ובפרט על הפער הפונקציונלי בין שלב עיבוד מוקדם של בקשות (מילוי מוקדם) לבין שלב יצירת האסימונים הרציפים (פענוח). שלב המילוי מראש ממיר הקשר קלט לאסימוני וקטור, מעבד רצפי הנחיות במקביל, ובונה את מטמון המפתח-ערך (KV) הראשוני. שלב זה דורש הכפלת מטריצות אינטנסיבית ופעולות כתיבה בזיכרון בתדירות גבוהה, מה שהופך אותו למתאים באופן אידיאלי ליכולות הכתיבה בעלות הסיבולת הגבוהה והשהיה נמוכה של HBM DRAM מסורתי. לעומת זאת, שלב הפענוח מייצר טקסט באופן אוטורגרסיבי, ומייצר אסימון אחד בכל שלב על ידי קריאת כל מטריצת משקל המודל הסטטי לצד מטמון ה-KV הפעיל. מכיוון שיצירת אסימון מוגבלת ביסודה לרוחב פס הזיכרון ובלעדי לקריאה – ודורשת כמעט אפס כתיבה למשקלי הפרמטרים עצמם – היא עוקפת את האילוצים הפיזיים העיקריים של זיכרון הבזק NAND, כלומר השהיות כתיבה ברמת מיקרו-שניות ופגיעה בסיבולת התא. אחסון פרמטרים סטטיים של מודלים בשכבות HBF לא נדיפות תוך שמירה על מטמוני KV פעילים וסביבת עבודה תפעולית ב-HBM יוצר היררכיית זיכרון הטרוגנית הממקסמת את יעילות הביצוע מבלי להתיש בטרם עת את מחזורי הכתיבה בזיכרון הבזק.
מעבר ליתרונות הביצוע בזמן אמת, האופי הלא-נדיף של HBF מציג יעילות קריטית במצב צריכת חשמל ועמידות תפעולית לתשתית בינה מלאכותית ארגונית. מאיצים מסורתיים מבוססי DRAM מאבדים את כל המצב המאוחסן בעת ניתוק צריכת החשמל, מה שמחייב טעינה מחדש של ג’יגה-בייט או טרה-בייט של משקלי פרמטרים מכונני אחסון של המערכת דרך אפיקי PCIe מארחים במהלך אתחול קר, גיבויים של צומת או מחזורי הפעלה דינמיים. HBF שומר על פרמטרי המודל ישירות על גבי מצע המאיץ גם לאחר כיבוי, מה שמאפשר אתחול מיידי של המערכת ומבטל עומס רוחב פס ברשת במהלך פריסות מודלים בקנה מידה גדול. יתר על כן, מכיוון שזיכרון הבזק NAND אינו דורש מחזורי רענון תקופתיים (בניגוד לתאי DRAM, הצורכים ברציפות חשמל במצב המתנה כדי לשמור על מצבי טעינה), טביעת הרגל התרמית הבסיסית וצריכת החשמל במצב סרק של תת-מערכת הזיכרון יורדות באופן משמעותי. בעוד שזיכרון הבזק NAND מציג השהיות גישת קריאה בתחום המיקרו-שניות בהשוואה להשהייה של עשרות ננו-שניות של DRAM, שליפה מוקדמת אסטרטגית ברמת התוכנה, חפיפה בצינור ומיפוי זיכרון ברמת הליבה מסווים ביעילות את השהיות הגישה הללו במהלך לולאות פענוח רציפות. סינתזה ארכיטקטונית זו מאפשרת ל-HBF לשמש כבסיס טרנספורמטיבי מבחינה כלכלית לאירוח מודלים של בינה מלאכותית בעלי טריליוני פרמטרים מרובי ישירות על צמתי חומרה מקומיים.
קודקס חזותי אינטראקטיבי: ארכיטקטורת מערכת HBF-HBM הטרוגנית
High Bandwidth Flash (HBF) vs HBM Operational Dashboard
Simulating Hybrid Memory Allocation & Execution Workloads for Trillion-Parameter LLM Inference
Throughput: 2.5 TB/s | Latency: ~10 ns
Primary Task: KV-Cache & Prefill Writes
Throughput: 1.6 TB/s | Latency: ~1-10 µs
Primary Task: Read-Only Weights (Decode)
סטייה אדריכלית ופיזיקה של אריזת זיכרון: טופולוגיית HBM DRAM לעומת טופולוגיית HBF NAND תלת-ממדית בעלת 16 שכבות
המגבלות הפיזיות של מחשוב מודרני בעל ביצועים גבוהים נשלטות על ידי הפער החמור בין פיזיקת אחסון קבלים של זיכרון גישה אקראית דינמי ( DRAM ) לבין ארכיטקטורת פלאש תלת-ממדית של מלכודת מטען. בזיכרון רוחב פס קונבנציונלי גבוה, כגון HBM₃e ו- HBM₄ המתפתח , עמידות הנתונים מסתמכת על קבלים גליליים נדיפים מיקרוסקופיים המשולבים במצעי סיליקון לצד טרנזיסטורי גישה. צמתי אחסון דינמיים אלה סובלים ממנגנוני דליפת מטען טפיליים חמורים, כולל מנהור קוונטי על פני גבולות דיאלקטריים דקים במיוחד ודליפת ניקוז תת-ספי, המחייבים מחזורי רענון בתדירות גבוהה כל 32 עד 64 מילישניות. כאשר הטמפרטורות בתוך מאיצי בינה מלאכותית מתקדמים עולות לכיוון 95 מעלות צלזיוס תחת עומסי עבודה רציפים של נקודה צפה של טנזור, זמן שמירת המטען יורד באופן אקספוננציאלי בהתאם ליחס ארניוס , מה שמאלץ בקרי חומרה להקדיש רוחב פס חיבור משמעותי ותקציבי הספק רק כדי לשמור על שלמות מצב הזיכרון. לעומת זאת, טופולוגיית פלאש רוחב פס גבוה ( HBF ), שתוכננה באמצעות שיתוף פעולה אסטרטגי בין SanDisk ו- SK Hynix , מחליפה קבלים נדיפים בתאי פלאש NAND תלת-ממדיים לא נדיפים של מלכודת מטען. על ידי אחסון אלקטרונים בתוך שכבת סיליקון ניטריד מבודדת ( Si₃N₄ ) המוגבלת על ידי תחמוצות חוסמות דיאלקטריות בעלות k גבוה, HBF מבטל לחלוטין זרמי רענון במצב המתנה ופיזור מטען טפילי. עם זאת, מצב לא נדיף זה מגיע במחיר של פיזיקת תעבורה קוונטית-מכנית שונה באופן מהותי: בעוד שגישה ל-DRAM נשלטת על ידי תעבורת מטען במתח נמוך של אפקט שדה על פני ערוצים מוליכים במרווחי ננו-שניות, שינוי מצב NAND תלת-ממדי מסתמך על מנהור פאולר-נורדהיים במתח גבוה על פני מחסומי תחמוצת, מה שמביא להשהיות קריאה במיקרו-שניות ופירוק מבני של תחמוצת ה-D&D לאורך מחזורי מחיקת תוכניות ממושכים.
הטופולוגיה המבנית של מודול HBF בן 16 שכבות דורשת צפיפות אינטגרציה מכנית וחשמלית חסרת תקדים, ודוחפת טכניקות ייצור Through-Silicon Via ( TSV ) הרבה מעבר לערימות HBM₃e קונבנציונליות של 8 שכבות או 12 שכבות . ביישומים סטנדרטיים של HBM₄ , מיקרו-ארכיטקטים עורמים שבבי זיכרון דינמיים באמצעות מערכי חיבור מיקרו-בליטה הממוקמים בצפיפויות פסיעה הנעות בין 25 ל-50 מיקרומטר, מחוברים לשבב בסיס לוגי מרכזי המתממשק ישירות עם האינטרפוזר של מערכת המארח. כאשר ספירת הערימות מתרחבת ל-16 שכבות ב- HBF , עובי הסיליקון הפיזי הכולל חייב להישמר מתחת ל-720 מיקרומטר כדי לשמור על תאימות עם מפרטי גובה חבילות תרמיות סטנדרטיים של JEDEC . השגת אילוץ זה מחייבת דילול של שבבי NAND תלת-ממדיים בודדים לפרופילים של פחות מ-30 מיקרומטר, מה שמכניס רגישות קיצונית למאמץ תרמו-מכני, קשת פרוסות ועיוות סריג במהלך תהליכי הרכבה בטמפרטורה גבוהה. יתר על כן, איכול של עמודות TSV בעלות יחס גובה-רוחב גבוה במיוחד דרך 16 שכבות אנכיות רצופות של שערי תחמוצת וניטריד מתחלפים דורש דיוק איכול של תת-ננומטרי כדי למנוע סטייה מבנית של דרך התנועה, שינויי צימוד קיבול והטיה של השהיית אות על פני אפיקי נתונים מקבילים. ההתנגדות החשמלית של עמודות TSV מלאות נחושת עולה עם קנה המידה של יחס הגובה-רוחב, מה שמעלה את עכבת אספקת החשמל ויוצר נקודות חמות תרמיות מקומיות שיכולות לשנות את תכונות המוליכות של מצעי סיליקון שכנים. כתוצאה מכך, מידול שלמות האות עבור HBF חייב להתחשב בדיבור צולב רב-שכבתי, קפיצת קרקע ורעש ספק כוח ( PSN ) הנגרם על ידי מעבר סימולטני של ממשקים מקביליים ברוחב 1024 סיביות ל-2048 סיביות הפועלים במהירויות העברת נתונים העולות על 1.6 טרה-בייט לשנייה.
קינטיקה של פיזור חום מייצגת תחום קריטי של הבדל אדריכלי בין עיצובי מחסנית HBM ו- HBF . בארכיטקטורות HBM בצפיפות גבוהה , יצירת חום ממוקמת בעיקר בלוגיקת המיתוג בתדר גבוה של שבב הבסיס ובפעולות רענון-טעינה רציפות המתרחשות על פני מערך הזיכרון הדינמי. מכיוון שביצועי ה-DRAM יורדים במהירות כאשר טמפרטורות הצומת עולות על ספים קריטיים, ניהול חום מסתמך על הטמעת בליטות תרמיות דמה וחוצי סיליקון בעלי מוליכות גבוהה כדי לנתב אנרגיה תרמית הרחק מהשכבות הפנימיות לעבר גופי קירור המותקנים בחלק העליון. לעומת זאת, מודולי HBF בני 16 שכבות פועלים תחת פרופיל תרמי לא סימטרי: במהלך פעולות פענוח הסקה של רשתות עצביות עתירות קריאה, שבבי NAND במלכודת מטען צורכים הספק פעיל זניח בהשוואה ל- DRAM , מה שמפחית באופן דרסטי את פיזור החום במהלך מחזורי קריאה במצב יציב. עם זאת, במהלך פעולות תכנות פרץ או מחיקת בלוקים, שדות חשמליים מקומיים העולים על 10 מגה-וולט לסנטימטר יוצרים קפיצות תרמיות מוגברות בתוך שכבות מלכודת המטען, וגורמים למאמצי התפשטות מקומיים על פני ממשקי השבב. מקדמי ההתפשטות התרמית ( CTE ) השונים בין TSVs מנחושת , מצעי סיליקון וחומרי כימוס אורגניים יוצרים כוחות גזירה מכניים בגבולות המיקרו-חיבורים, ומאיימים על אמינות מבנית לטווח ארוך. כדי להפחית את הלחץ התרמי, אדריכלי HBF משלבים תעלות קירור מיקרו-פלואידיות ייעודיות או שכבות פסיבציה של פחמן דמוי יהלום ( DLC ) בעלות מוליכות תרמית גבוהה בין 16 שכבות הסיליקון, מה שמבטיח פיזור חום אחיד על פני פרופיל הערימה האנכי מבלי לפגוע בקשיחות המבנית או בבידוד הדיאלקטרי.
| פרמטר פיזי / תפעולי | ארכיטקטורת מחסנית HBM₄ סטנדרטית | טופולוגיית פלאש HBF בעלת 16 שכבות | השפעת סטייה מבנית |
| טכנולוגיית אחסון | זיכרון RAM דינמי נדיף (קבל) | NAND תלת-ממדי לא נדיף עם מלכודת מטען | התמדה נדיפה לעומת התמדה לא נדיפה |
| ספירת ערימת שבבים מקסימלית | 12 עד 16 שכבות | 16 שכבות (דור 1) | דרישות דילול פרוסות קיצוניות |
| קיבולת צפיפות המודולים | 36 ג'יגה-בייט עד 48 ג'יגה-בייט | 512 ג'יגה-בייט | הרחבת צפיפות אחסון פי 14.2 |
| רוחב ממשק האפיק | 2048 סיביות | 1024 סיביות עד 2048 סיביות | טביעת רגל מקבילה של אריזות Wide-IO |
| תפוקת קריאה שיא | 2.5 טרה-בייט לשנייה | 1.6 TB/s (Gen 1) → 3.2 TB/s (Gen 3) | מהירויות קריאה קרובות ל-HBM דרך ערוצים מקבילים |
| השהיית קריאה אקראית | ~10 ננו-שניות | ~1 עד 10 מיקרו-שניות | דלתא של השהייה פי 100 מוסתרת על ידי אחזור מקדים |
| צריכת חשמל במצב המתנה | גבוה (רענון DRAM רציף) | אפס (אין צורך ברענון) | מבטל את טביעת הרגל של כוח במצב סרק |
| דירוג סיבולת כתיבה | מחזורי כתיבה ללא הגבלה | מוגבל (הידרדרות מחזור P/E) | מוגבל להסקה דומיננטית-קריאה |
| סוג חיבור | מיקרו-בליטות / קשירת נחושת-נחושת היברידית | קשר היברידי ישיר של נחושת-נחושת | נדרש פסיעה של רפידות תת-מיקרון |
שילוב מודולי HBF בני 16 שכבות במארזי מאיץ מודרניים דורש פלטפורמות אינטגרציה הטרוגניות מתקדמות המסוגלות לתמוך בניתוב חיבורים צפוף במיוחד ובקישור תרמי בעל תפוקה גבוהה. טופולוגיות אינטרפוזר סיליקון מתקדמות, כגון TSMC Chip-on-Wafer-on-Substrate ( CoWoS-S ) ו- Intel Embedded Multi-Die Interconnect Bridge ( EMIB ), משמשות כמצע פיזי בסיסי המחבר את מעבד הלוגיקה בעל הביצועים הגבוהים לערימות זיכרון סמוכות. במארזי TSMC CoWoS-S , אינטרפוזר סיליקון פסיבי המכיל חיבורי נחושת רב-שכבתיים תת-מיקרון מאפשר תקשורת מקבילית ישירה בין יחידת עיבוד הגרפיקה המרכזית ( GPU ) או יחידת עיבוד הטנזור ( TPU ) לבין מודולי הזיכרון הסובבים. עם זאת, ככל שדרישות קיבולת הזיכרון גדלות, השטח הפיזי של האינטרפוזר חייב להתרחב מעבר למגבלות הרשתית הסטנדרטיות (בדרך כלל 858 מילימטרים רבועים), מה שמחייב ארכיטקטורות אינטרפוזר תפור מרובות רשתות המציגות סיכוני פגיעה משמעותיים בתפוקה ועקומות עלות ייצור אקספוננציאליות. כדי לעקוף את מגבלות הרשתית, ארכיטקטורות מארז מודרניות עוברות לכיוון CoWoS-L וגרסאות של חוצצים אורגניים ( CoWoS-R ), המחליפות חוצצים מסיליקון מונוליטיים בשכבות פיזור מחדש בעלות פסיעה עדינה ( RDL ) ושבבי גשר משובצים. שילוב מחסנית HBF בת 16 שכבות על פלטפורמות מתקדמות אלו דורש דיוק יישור של תת-מיקרון כדי ליישר את אלפי המיקרו-בליטות או משטחי הקישור ההיברידיים הישירים ( Cu-Cu ) המחברים את שבב בסיס הזיכרון למצע האורגני, ובכך להבטיח שסבולות מכניות יישארו יציבות תחת מחזורי תרמית תפעוליים רציפים.
חיבור היברידי ישיר נחושת-לנחושת ( Cu-Cu ), כפי שמודגם על ידי טכנולוגיית TSMC SoIC (System-on-Integrated-Chips) ו- BAM (Bond-Align-Mount), מייצג זרז מכריע להגדלת צפיפויות החיבורים של HBF תוך ביטול מיקרו-בליטות הגורמות לעמידות תרמית. חיבורים קונבנציונליים של מיקרו-בליטות משתמשים בכדורי הלחמה הממוקמים במרווחי פסיעה של 25 עד 40 מיקרומטר, אשר מטילים מגבלות פיזיות על צפיפות האות, מגדילים את הקיבול הטפילי ויוצרים חולשה מכנית תחת לחץ תרמי. חיבור היברידי עוקף את חיבורי הלחמה על ידי הטמעת פדי מגע נחושת צמודים למטריצה מישורית של תחמוצת סיליקון דיאלקטרית או סיליקון פחמן-ניטריד ( SiCN ). כאשר שני משטחי פרוסה מלוטשים מגיעים במגע בטמפרטורת החדר, קשר מימן מולקולרי יוצר חיבור מכני ראשוני על פני המשטחים הדיאלקטריים, ולאחר מכן תהליך חישול בטמפרטורה של 250 עד 300 מעלות צלזיוס הגורם לפדי הנחושת להתרחב וליצור קשרים מתכתיים אטומיים. יישום קשירה היברידית על ייצור HBF בעל 16 שכבות מאפשר הפחתת פסיעה בין שבבי ה-NAND עד לממדים של פחות מ-1 מיקרומטר, מה שמגדיל את צפיפות החיבורים האנכית ביותר משני סדרי גודל תוך הפחתת קיבול החיבורים הטפילי לרמות מתחת לפמטופראד. הפחתה דרמטית זו בעומס הטפילי מורידה את צריכת האנרגיה לכל ביט המועבר ( pJ/bit ) על פני אפיק הזיכרון, ומאפשרת ל-HBF להשיג קצבי קריאה של 1.6 טרה-בייט לשנייה ברמות הספק נמוכות משמעותית ממכלולי HBM מסורתיים בעלי קשירה מיקרו-בלוטית . עם זאת, קשירה היברידית דורשת סביבות חדר נקיות במיוחד (Class 1 ומעלה) וישרוניות פני שטח ללא פגמים, מכיוון שחלקיק בודד בקנה מידה ננומטרי יכול לגרום להיווצרות חללים, אזורים לא קשורים ולכשל מערכתי בכל 16 שבבי ה-NAND המוערמים.
ניהול תפוקה ומידול צפיפות פגמים מציבים מכשולים כלכליים וטכניים אדירים ליישום מסחרי של טופולוגיות HBF בעלות 16 שכבות . תחת מודלים קלאסיים של התפלגות תפוקה של פואסון ובינום שלילי , התשואה המצטברת של מערכת מרובת שבבים מוערמת יורדת באופן אקספוננציאלי ככל שמספר השכבות המוערמות עולה, מבוטא מתמטית כ-Ystack = (Ydie)¹⁶ × Yassembly, כאשר Ydie מייצג תפוקה של שבב בודדים ו-Yassembly מתחשבת בהפסדים בתהליך האריזה. בהנחה של תפוקה של שבב NAND תלת-ממדי בודד של 95%, מחסנית של 16 שכבות שלא נבדקה תניב פחות מ-44% מודולים שמישים לפני ההרכבה, מה שהופך את הייצור ללא בר-קיימא מבחינה כלכלית לפריסה של מרכזי נתונים בנפח גבוה. כדי להתגבר על מחסום תפוקה זה, יצרני מוליכים למחצה משתמשים במסגרות בדיקה של שבב טוב ידוע ( KGD ) המשולבות עם לוגיקת בדיקה עצמית מובנית ( BIST ) מתקדמת בתוך שבב הבסיס. תחנות בדיקה ברמת פרוסות במהירות גבוהה בודקות כל שבב NAND תלת-ממדי דליל לפני ההרכבה, ומזהות קווי סיביות שוליים או פגומים, TSVs פגומים ותקלות מפענח היקפי. בנוסף, שבבי לוגיקה בסיסיים מסוג HBF משלבים יתירות חומרה אקטיבית, הטמעת עמודות TSV רזרביות , בלוקי זיכרון יתירים ומנועי קוד תיקון שגיאות דינמיים ( ECC ) המסוגלים למפות מחדש מרחבי כתובות פיזיים כושלים תוך כדי תנועה במהלך הפעולה. מנגנונים עמידים לתקלות אלה מאפשרים למכלולי HBF בני 16 שכבות להשיג תפוקות מסחריות מקובלות גם כאשר שבבי לוגיקה בודדים מכילים פגמים פיזיים קלים, ובכך משפרים משמעותית את עלות הבעלות הכוללת ( TCO ) עבור פלטפורמות מחשוב בינה מלאכותית פורצות דרך.
| פרמטר אריזה | TSMC CoWoS-S (סיליקון) | TSMC CoWoS-L (גשר/RDL) | גשר EMIB של אינטל | קשר היברידי ישיר של נחושת-נחושת |
| גובה החיבור של רפידות | 25 עד 50 מיקרומטר | 20 עד 35 מיקרומטר | 45 עד 55 מיקרומטר | תת-1.0 מיקרומטר |
| חומר שכבת אינטרפוזר | סיליקון מונוליטי | גשרים אורגניים של RDL + LSI | מצע אורגני + גשר סיליקון | דיאלקטרי ישיר בין-שבלולים |
| יחס גובה-רוחב מקסימלי של ערימה | בינוני (12x TSV) | גבוה (16x TSV) | בינוני (12x TSV) | אולטרה-גבוה (TSV פי 16 עד פי 32) |
| התנגדות חיבור | בינוני (~1.2 אוהם) | נמוך-בינוני (~0.8 אוהם) | בינוני (~1.0 אוהם) | נמוך במיוחד (<0.1 אוהם) |
| קיבול טפילי | ~50 fF / בליטה | ~30 fF / משטח | ~40 fF / בליטה | <1.0 fF / פד |
| תפוקת אריזה משוערת | 88% עד 92% | 82% עד 86% | 85% עד 89% | 75% עד 82% (אימוץ מוקדם) |
האבולוציה האסטרטגית של אריזות זיכרון בצפיפות גבוהה מתרחשת בתוך נוף גיאופוליטי תנודתי ביותר המוגדר על ידי בקרות סחר בינלאומיות, חסימות טכנולוגיה ריבוניות ושרשראות אספקה גלובליות מרוכזות. ייצור מודולי HBF בני 16 שכבות מסתמך על מערכת אקולוגית גלובלית מורכבת ותלויה מאוד, המשתרעת על פני ייצור פרוסות סיליקון גולמיות ביפן , מערכות ליתוגרפיה תת-ננומטרי מ- ASML בהולנד , ייצור זיכרון מתקדם בדרום קוריאה ( SK Hynix , Samsung ) ומתקני אריזה מתקדמים בטייוואן ( TSMC ) . הגבלות ייצוא שהוטלו על ידי משרד המסחר של ארצות הברית, הלשכה לתעשייה וביטחון ( BIS ), המכוונות למחשוב מתקדם וציוד ייצור מוליכים למחצה, עיצבו מחדש את הקצאת ההון התאגידית ואת ההשקעות האזוריות במפעלים. באופן ספציפי, הגבלות על משלוח מכונות ליתוגרפיה באולטרה סגול קיצוני ( EUV ) ומערכות טבילה באולטרה סגול עמוק ( DUV ) לסין האיצו יוזמות מקומיות של מוליכים למחצה, כגון ChangXin Memory Technologies ( CXMT ) ו- YMT ( Yangtze Memory Technologies Corp ), לקראת פיתוח ארכיטקטורות מחסנית לא נדיפות ויכולות קשירה היברידית מקומיות. עם זאת, ההסתמכות המוחלטת על כלי פלנריזציה כימית-מכנית ( CMP ) מדויקים במיוחד, ריאגנטים כימיים טהורים במיוחד ומערכות איכול פלזמה בעלות יחס גובה-רוחב גבוה מספקים מערביים מגבילה את היכולת המיידית של מדינות שאינן מזדהות לשכפל באופן עצמאי קווי ייצור של HBF בני 16 שכבות , ובכך מבטיחה יתרון אסטרטגי זמני לבריתות טכנולוגיות בעלות בריתות מערביות.
לאורך אופק ניבוי של חמש שנים (2026–2031), המסחור של High Bandwidth Flash צפוי לשבש באופן מהותי את יכולות הבינה המלאכותית של ההגנה הריבונית, את הוצאות התשתית בענן ואת פרדיגמות פריסת החומרה הארגונית. ככל שמודלים בסיסיים בחזית מתרחבים לעבר עשרות טריליוני פרמטרים, דרישות האנרגיה וההון לאירוח עומסי עבודה בזמן אמת באמצעות אשכולות HBM מסורתיים הופכות לבלתי בנות קיימא עבור ישויות מדינתיות ותאגידיות כאחד. שילוב HBF במאיצי בינה מלאכותית מהדור הבא מאפשר לצמתי עיבוד בעלי שקע יחיד לאחסן ולהפעיל רשתות עצביות מסיביות שבעבר דרשו מדפי שרתים שלמים המחוברים באמצעות רשתות מארג בעלות השהיה גבוהה. איחוד זה מפחית את טביעת הרגל הפיזית של מרכזי הנתונים, מוריד את צריכת החשמל התפעולית עד 60% במהלך שלבי פענוח אסימונים, ומאפשר דמוקרטיזציה של פריסת קצה של מודלים מודיעיניים ריבוניים עבור מודיעין ביטחוני, מודיעין אותות ( SIGINT ) ומערכות החלטה אסטרטגיות אוטונומיות. יתר על כן, האופי הלא נדיף המתמשך של HBF מאפשר לחומרת קצה טקטית - כגון מרכזי פיקוד ימיים, פלטפורמות חיישנים ניידות וצמתי פיקוד מוטסים - לאתחל באופן מיידי יכולות בינה מלאכותית מורכבות מבלי לדרוש קישוריות רציפה ברוחב פס גבוה למסדי נתונים מרכזיים של המארח. ככל שיצרני זיכרון עוברים ממודולי HBF מהדור הראשון במהירות של 1.6 טרה-בייט לשנייה לטופולוגיות מהדור השני והשלישי העולות על 3.2 טרה-בייט לשנייה, הטכנולוגיה תקבע בסיס מבני חדש לתשתית בינה מלאכותית עולמית, ותעביר את המדד העיקרי של ביצועי חומרת בינה מלאכותית ממהירות זיכרון דינמית גולמית לקיבולת פלאש משולבת עצומה
Figure 1: 5-Year Memory Technology Scaling Projection (2026–2030)
Comparative metrics: Single-Module Capacity (GB) vs. Peak Bandwidth (TB/s) vs. Relative Cost per Bit ($/GB Index)
חלוקה חישובית של ביצוע LLM: דינמיקת מילוי מראש/כתיבה לעומת פעולות פענוח/קריאה דומיננטיות
הביצוע החישובי של מודלים של שפות גדולות בחזית מוגדר על ידי אסימטריה אלגוריתמית בסיסית המחלקת עומסי עבודה של עיבוד לשני שלבים פיזיים נפרדים: שלב עיבוד מוקדם של בקשות (מילוי מוקדם) ושלב יצירת רצף אוטורגרסיבי (פענוח). במהלך שלב המילוי המוקדם, מאיץ ההסקה בולע את כל בקשת ההקשר בו זמנית, והופך אסימוני קלט גולמיים להטמעות וקטוריות צפופות באמצעות פעולות טנזור כפל מטריצה-מטריצה כללית מקבילות ( GEMM ). מכיוון שכל אסימוני הקלט מוערכים בו זמנית על פני ראשי תשומת לב של שכבת השנאים, עוצמת החשבון - המוגדרת כיחס בין פעולות נקודה צפה ( FLOPs ) המבוצעות לכל בייט של זיכרון שאליו ניגשת - היא גבוהה במיוחד, ומדרגת באופן ליניארי עם אורך רצף ההנחיות L. במשטר זה המבוסס על חישוב, יחידות עיבוד חומרה משיגות ניצול מקסימלי של ליבת טנזור, מכיוון שההשהיה החשבונית הנדרשת לביצוע טרנספורמציות מטריצה בצפיפות גבוהה על מטריצות משקל פרמטרים Wq, Wk, Wv ו-Wo עולה באופן משמעותי על השהיית העברת הזיכרון הנדרשת כדי להביא את המשקלים הללו מאחסון מחוץ לשבב. כתוצאה מכך, ביצועי עיבוד המילוי המוקדם מוכתבים על ידי תפוקת נקודה צפה גולמית, הנמדדת בטרה-פלופים או פטה-פלופים, מה שהופך את קיבולת הזיכרון ברוחב פס גבוה ( HBM ) לפחות צוואר בקבוק תפעולי מאשר צפיפות המחשוב. דינמיקה תפעולית זו מנותחת בקפדנות ב- Disaggregated Acceleration Frameworks for Hybrid LLMs - arXiv - מרץ 2026 , המתעד כיצד גרעיני כפל מטריצות במהלך בליעה מהירה משיגים יעילות מחשוב קרובה לשיא על פני מערכי עיבוד טנזור מקבילים.
בניגוד מוחלט לעיבוד מקדים מהיר, שלב הפענוח האוטורגרסיבי שלאחר מכן מציג סט מנוגד לחלוטין של אילוצים פיזיים ומיקרו-ארכיטקטוניים, הממיר את צוואר הבקבוק החישובי מביצוע טנזור כבול למחשוב לפעולות מטריצה-וקטור כבול ברוחב פס זיכרון ( GEMV ). במהלך הפענוח, מודל השנאי מייצר טקסט פלט ברצף מדויק, ופולט אסימון חדש אחד בדיוק לכל שלב איטרציה. יצירת כל אסימון בודד דורשת קריאת טנזור המשקל הסטטי כולו של המודל מהזיכרון לתוך אוגרי לוגיקה לצד ייצוגי המטמון ההיסטוריים של מפתח-ערך ( KV ) שנצברו מאסימונים קודמים. מכיוון שממד האצווה עבור רצף בקשה יחיד בשלב t שווה לאחד, עוצמת החשבון יורדת בסדרי גודל מרובים עד לרמות תת-יחידה. תחת פרדיגמה כבולת רוחב פס זיכרון זו, יחידות טנזור בעלות ביצועים גבוהים מבלות למעלה מ-90% ממחזורי השעון התפעוליים שלהן במצבי עצירה, ומחכות שבקרי זיכרון יזרמו טרה-בייטים של נתוני משקל על פני ממשקים פיזיים צרים. גילויים מוסדיים של יצרני חומרה גדולים, כולל טופס F-1 - רשות ניירות ערך האמריקאית - יוני 2026 , מדגישים כי יעילות ההסקה של בינה מלאכותית גנרטיבית מודרנית מוגבלת באופן גורף על ידי מגבלות רוחב פס של זיכרון מחוץ לשבב ולא על ידי תפוקת לוגיקה גולמית. כתוצאה מכך, מדד ההשהיה של הזמן בין האסימונים ( TBT ) במהלך יצירה אוטורגרסיבית הוא ביחס ישר לרוחב הפס הכולל של קריאת הזיכרון של המאיץ, מה שהופך ארכיטקטורות זיכרון גישה אקראית דינמי ( DRAM ) קונבנציונליות ללא יעילות מבחינה כלכלית עבור עומסי עבודה של פענוח טהורים.
| שלב תפעולי | אילוץ חישובי דומיננטי | טופולוגיית ליבה ראשונית | עוצמה אריתמטית (FLOPs/בייט) | יעילות ניצול החומרה | פרופיל קריאה/כתיבה של זיכרון |
| שלב מילוי מקדים (קליטה מהירה) | מוגבל-לחישוב (פלופים לוגיים) | GEMM בעל מטריצה גדולה | גבוה (מעל 100 FLOPs/בייט) | גבוה (70% עד 90% פעילות ליבת טנזור) | קריאה בתדר גבוה וכתיבה כבדה של KV |
| שלב הפענוח (יצירת אסימונים) | מהירות אפיק (Bound-Band Widget) של הזיכרון | GEMV מטריצה-וקטורית | נמוך (< 2 FLOPs/בייט) | נמוך (< 10% פעילות ליבת טנזור) | דומיננטיות בקריאה מסיבית (כתיבות ללא משקל) |
| הקצאת מטמון KV | קיבולת זיכרון ותעבורת אפיק | דפדוף מרחבי דינמי | בינוני (משתנה בהתאם לגודל האצווה) | מוגבל על ידי פיצול הקצאה | הוספה רציפה לזיכרון דינמי |
| הקצאת שכבה היברידית של HBM-HBF | עיצוב משותף של קיבולת וסיבולת | ניתוב זיכרון הטרוגני | אופטימיזציה לכל שכבת אחסון | מקסימלי באמצעות הפרדת משימות | כותב ל-HBM; קריאות סטטיות מ-HBF |
הניהול וההקצאה הפיזית של מטמון המפתח-ערך ( KV ) מוסיפים מורכבות ארכיטקטונית נוספת, שכן טביעת הרגל הדינמית של זיכרון הקשב משתנה באופן ריבועי עם אורך ההקשר ובאופן ליניארי עם גודל האצווה. במהלך המילוי המוקדם, חישוב קשב עצמי על פני אורך ההנחיה L דורש יצירת וקטורי מפתח KL ווקטורי ערך VL עבור כל שכבה וראש קשב, כתיבת מצבים מרחביים ביניים אלה ישירות לזיכרון כדי למנוע חישוב מחדש מיותר במהלך שלבי הפענוח הבאים. הנפח הפיזי של מטמון KV שנוצר לכל אסימון נשלט על ידי המשוואה המבנית Skv = 2 × Nlayers × Hheads × Dhead × Pprecision, כאשר Nlayers מייצג עומק שכבת השנאי, Hheads מייצג ראשי קשב מפתח-ערך, Dhead מציין ממד הקרנה, ו-Pprecision מציין רוחב בייט של פורמט נתונים (למשל, 2 בייט עבור FP16 או בייט אחד עבור INT8). עבור מודל יסוד של טריליון פרמטרים הפועל על פני רצפי הקשר ארוכים, דרישות מטמון KV הכוללות יכולות לעלות על מאות ג'יגה-בייט לכל בקשת משתמש בו זמנית. כתיבת מטריצות מצבים דינמיות ומסיביות אלו דורשת מצעי זיכרון בעלי סיבולת גבוהה ובעלי השהיה נמוכה במיוחד, המסוגלים לקיים מחזורי קריאה-כתיבה רציפים ללא פגיעה בסיבולת. כפי שמפורט ב- MoE-Inference-Bench: Performance Evaluation – US Department of Energy Office of Scientific and Technical Information – March 2026 , אלגוריתמים לניהול זיכרון דינמי כמו PagedAttention מפחיתים את הפרגמנטציה הפיזי אך נשארים קשורים אך ורק לסיבולת כתיבה גבוהה ולקינטיקה של גישה ברמת המיקרו-שניות של שכבות זיכרון RAM דינמיות של HBM ולא של מדיית פלאש.
הפער הפונקציונלי בין דינמיקת כתיבה של מילוי מקדים לבין פעולות קריאה פענוח מספק את הרציונל הבסיסי לשילוב זיכרון הבזק ברוחב פס גבוה ( HBF ) במערכות זיכרון הטרוגניות של מאיצי זיכרון. מכיוון שטריליוני משקולות הפרמטרים המגדירים מודל בסיס נשארים סטטיים לחלוטין במהלך פעולות הסקה, הם נקראים מיליוני פעמים מבלי לעבור שינויים במצב כתיבה. פרופיל תפעולי זה של "כתיבה פעם אחת, קריאה מרובה" ( WORM ) מתיישר בדיוק עם התכונות הפיזיקליות של זיכרון הבזק NAND תלת-ממדי עם מלכודת מטען המשמש בטופולוגיות HBF בנות 16 שכבות . בעוד שזיכרון הבזק NAND מציג סיבולת נמוכה תחת מחזורי כתיבה-מחיקה רציפים עקב מנהור אלקטרונים במתח גבוה דרך מחסומי סיליקון דיאלקטרי, פעולות קריאה טהורות צורכות שלמות תחמוצת השער זניחה וגורמות לאפס בלאי מחיקת תוכנית. על ידי הצבת משקולות פרמטרים סטטיות במודולי HBF צפופים של 512GB והקצאת כתיבות מטמון KV בתדירות גבוהה והקצאות טנזורים ביניים למודולי DRAM HBM₄ סמוכים של 36GB , אדריכלי חומרה פותרים את הקונפליקט ההיסטורי בין קיבולת זיכרון לסיבולת כתיבה. במהלך לולאות פענוח, המאיץ מזרים משקלים סטטיים ישירות משכבות HBF בלתי נדיפות ברוחב פס העולה על 1.6 טרה-בייט לשנייה, בעוד שמטמון ה-KV הדינמי נשמר בתוך ערוצי HBM במהירות גבוהה , מה שמבטיח שפעולות תוכנית במתח גבוה לעולם לא יפגעו במצע הזיכרון הבלתי נדיף.
| שכבת ארכיטקטורת זיכרון | סוג מדיית זיכרון | תוכן נתונים ראשוני | קיבולת מקסימלית לכל ערימה | תפוקת קריאה | אילוצי סיבולת והשהיה |
| שכבה ראשונית של HBM4 | DRAM נדיף (קיבולי) | מטמון KV, הפעלות, מאגרים של מילוי מוקדם | 36 ג'יגה-בייט עד 48 ג'יגה-בייט | 2.5 טרה-בייט לשנייה עד 4.5 טרה-בייט לשנייה | סיבולת בלתי מוגבלת / השהיה של ~10 ננו-שניות |
| שכבה משנית של HBF Gen-1 | NAND תלת-ממדי לא נדיף | משקלי מודל סטטיים (FP16/INT8) | 512 ג'יגה-בייט | 1.6 טרה-בייט לשנייה | אופטימלי לקריאה / השהיה של ~1 עד 10 מיקרו-שניות |
| מפת דרכים עתידית של HBF Gen-3 | מלכודת טעינה תלת-ממדית מתקדמת | ספריות פרמטרים מרובות מודלים | 2048 ג'יגה-בייט (2 טרה-בייט) | 3.2 טרה-בייט לשנייה | סיבולת קריאה גבוהה / קדם-אחזור של פחות מ-µs |
| הרחבת זיכרון מארח CXL 3.1 | DDR5 / LPDDR5X סטנדרטי | הקשר מנותק ומדינות KV קרות | 1024 ג'יגה-בייט עד 4096 ג'יגה-בייט | 128 ג'יגה-בייט/שנייה עד 256 ג'יגה-בייט/שנייה | השהייה בינונית (~100 ננו-שניות) / כבול למארח |
מסגרות תוכנה ברמת המערכת מנצלות יותר ויותר את הפיצול החישובי הזה באמצעות ארכיטקטורות הגשה מפורקות המנתקות צמתי עיבוד של מילוי מוקדם ממקרי ביצוע של פענוח. פלטפורמות הגשה מתקדמות, כגון DistServe ו- DUET , מפרקות עיצובים הומוגניים של אשכולות על ידי הקצאת משימות בליעה מהירה לצמתי חומרה מותאמים לחישוב המצוידים ביחידות כפל מטריצה צפה אדירות וקיבולת זיכרון בינונית. במקביל, משימות יצירת אסימונים אוטורגרסיביות מנותבות לצמתים מותאמים לזיכרון המצוידים בערימות HBF בעלות קיבולת גבוהה ויחידות ביצוע וקטור מטריצה-וקטור ייעודיות. לאחר שצומת מילוי מוקדם מסיים לעבד בקשת קלט, הוא מעביר את מצבי המטמון KV שחושבו לאחרונה על פני מארג חיבור במהירות גבוהה - כגון ממשקי NVIDIA NVLink-5 או PCI Express Gen 6 הפועלים עם פרוטוקולי איגום זיכרון CXL 3.1 - ישירות לצומת הפענוח שהוקצה. פירוק עומסי עבודה אלה מבטל את תחרות המשאבים החמורה הנגרמת על ידי מיקום משותף של פרצי מילוי מוקדם כבדי חישוב עם זרמי פענוח רגישים לרוחב פס זיכרון באותו שבב מעבד פיזי. יתר על כן, פירוק מונע קפיצות חדות במדדי זמן-לאסימון ראשון ( TTFT ), מה שמאפשר למפעילי ענן ארגוניים לשנות באופן עצמאי את גודל צמתי המחשוב וצמתי קיבולת הזיכרון על סמך התפלגויות תעבורה בזמן אמת ויחסי אורך בין הפקודה ליצירת הפקודה.
ההשלכות הכלכליות והאסטרטגיות ארוכות הטווח של פירוק חומרה באמצעות מילוי מראש ופענוח משתרעות ישירות על תשתית ענן ריבונית, מערכות מודיעין ביטחוני ושרשראות אספקה טכנולוגיות גלובליות. אירוח מודלים של טריליוני פרמטרים על ארכיטקטורות HBM מאוחדות מטיל עומס הוצאות הון בלתי בנות קיימא, ודורש ממפעילי ארגונים לרכוש אשכולות עצומים של כרטיסי מסך מתקדמים המחוברים דרך רשתות אופטיות מורכבות רק כדי לספק את דרישות קיבולת הזיכרון המקומיות. יישום היררכיות זיכרון הטרוגניות היברידיות של HBM-HBF מפחית את מספר צמתי המאיצים הבדידים הנדרשים לאירוח רשתות נוירונים עצומות בעד 80%, מה שמפחית באופן דרסטי את צריכת החשמל, שטח המדף ועלויות ההון לכל מופע הסקה. בתחומים מבצעיים של הגנה ומודיעין - כגון ניתוח מודיעין אותות ( SIGINT ), עיבוד אוטומטי של תמונות לוויין וזיהוי איומי לוחמה אלקטרונית - היכולת לפרוס מודלים של טריליוני פרמטרים על מאיצי קצה מקומיים בעלי שקע יחיד, ללא הסתמכות על קישוריות מרכזית למרכז נתונים, משנה את היכולות התפעוליות. ככל שמסגרות מדיניות טכנולוגיות לאומיות, כולל בקרות יצוא הנאכפות על ידי משרד המסחר של ארצות הברית , ממשיכות לווסת את הגישה לטכנולוגיות ליתוגרפיה וזיכרון מתקדמות של מוליכים למחצה, פריסת ארכיטקטורות אריזת זיכרון לא נדיף בצפיפות גבוהה כמו HBF מספקת נתיב מבני חיוני לשמירה על יכולות בינה מלאכותית בעלות ביצועים גבוהים בסביבות חומרה מוגבלות באנרגיה ומבודדות גיאופוליטית.
Figure 1: Prefill vs. Decode Hardware Resource Allocation Dynamics
Comparative Matrix: Arithmetic Intensity, Memory Bandwidth Utilization, and HBM vs. HBF Load Distribution across LLM Execution Phases
שילוב אריזה מתקדם ועיצוב משותף לעמידות תרמית: TSMC CoWoS, Intel EMIB ואופטימיזציית סיבולת NAND
האינטגרציה הפיזית של High Bandwidth Flash ( HBF ) בארכיטקטורות מחשוב הטרוגניות מייצגת שינוי פרדיגמה באריזת מוליכים למחצה מתקדמת, הדורשת התכנסות חלקה של בדי חיבור תת-מיקרון, חוצצים מרובי שבבים והנדסה תרמית-מכנית מורכבת. מאיצי בינה מלאכותית מודרניים מסתמכים על פלטפורמות אריזה הטרוגניות כדי לגשר על פערי רוחב הפס והצפיפות בין יחידות עיבוד לוגיות בעלות ביצועים גבוהים ( GPUs או TPUs ) לבין ערימות זיכרון סמוכות. בין פלטפורמות האינטגרציה העיקריות, TSMC Chip-on-Wafer-on-Substrate ( CoWoS ) ו- Intel Embedded Multi-Die Interconnect Bridge ( EMIB ) מספקות את הסובסטרטים הפיזיים הבסיסיים הדרושים לתמיכה באפיקי זיכרון מקביליים בצפיפות גבוהה. בארכיטקטורות TSMC CoWoS-S , חוצץ סיליקון מונוליטי המכיל חיבורי נחושת תת-מיקרון מרובי רמות מאפשר תקשורת מקבילית צפופה בין שבב המעבד המרכזי לבין ערימות הזיכרון הסובבות אותו. עם זאת, ככל ששטחי הזיכרון מתרחבים כדי להכיל מודולי HBF בני 16 שכבות לצד מערכי HBM₄ מרובי-ערימות , שטח האינטרפוזר הנדרש עולה בהרבה על מגבלת הרשתית הסטנדרטית של כ-858 מילימטרים רבועים. כדי לעקוף את האילוצים המרחביים הללו, ארכיטקטורות יציקה התפתחו לכיוון פלטפורמות CoWoS-L ושכבת פיזור מחדש אורגנית ( RDL ) כמו CoWoS-R , המשתמשות בגשרי סיליקון מקומיים המוטמעים בתוך מצע אורגני. כפי שתועד בגילויים טכניים כגון טופס 10-K של תאגיד אינטל - רשות ניירות ערך האמריקאית - פברואר 2026 , טכנולוגיות אריזת גשרים מתקדמות כמו EMIB מבטלות את הצורך באינטרפוזרים מסיליקון מונוליטיים על ידי הטמעת גשרי סיליקון בצפיפות גבוהה ישירות לתוך חומרים דיאלקטריים של המצע, מה שמאפשר ניתוב קווים ומרחבים עדינים במיוחד (L/S עד 0.8/0.8 מיקרומטר) במיוחד באזורי גבול בין שבבים לשבבי
Heterogeneous Packaging Architecture Flowchart
פרופילי המאמץ התרמו-מכניים שנוצרים בתוך טופולוגיות HBF בעלות 16 שכבות מציגים אתגרי אמינות פיזיקליים חמורים הדורשים תכנון מבני משותף קפדני. הערמת 16 שבבי NAND תלת-ממדיים דקים לצד שבב לוגי בסיסי בתוך מעטפת גובה Z מקסימלית של פחות מ-720 מיקרומטר דורשת הפחתת עובי שבבי הסיליקון הבודדים לפחות מ-30 מיקרומטר. בממדים דקים במיוחד אלה, מצעי סיליקון מפגינים עיוות גמישות משמעותי, עיוות סריג ופגיעות קיצונית לשבר מכני במהלך תהליכי הרכבה בטמפרטורה גבוהה. הגורם העיקרי להתדרדרות מבנית הוא חוסר ההתאמה במקדם ההתפשטות התרמית ( CTE ) בין חומרים שונים בערימת המארזים, ובפרט בין שבבי סיליקון חד-גבישיים (CTESi ≈ 2.6 × 10⁻⁶ / K), שבבי נחושת דרך הסיליקון ( TSVs ) ומיקרו-בליטות (CTECu ≈ 16.5 × 10⁻⁶ / K), וחומרי האיטום האורגניים התת-מילוי (CTEunderfill ≈ 20–40 × 10⁻⁶ / K). תחת מחזורי תרמית תפעוליים דינמיים - כאשר הטמפרטורות משתנות במהירות בין מצבי המתנה (40°C) לבין פרצי מחשוב תפעוליים שיא (95°C) - קצבי התפשטות שונים יוצרים מאמצי גזירה מקומיים גבוהים בגבולות הממשק בין TSV לשבב. מאמצים מכניים אלה יכולים לגרום להתפרקות פני השטח, התחלת סדקים מיקרוסקופיים בשכבות פסיבציה דיאלקטריות, וכשל עייפות תרמית של מיקרו-בליטות נחושת. כדי למתן מצבי כשל אלו, ארכיטקטורות אריזה מתקדמות של HBF עוברות ממיקרו-בליטות הלחמה קונבנציונליות לקשר היברידי ישיר נחושת-לנחושת ( Cu-Cu ), אשר מבטל התרוקנות הלחמה ומשיג מרווחי רפידות חיבור של פחות ממיקרופון תוך הגברה משמעותית של חוזק הגזירה על פני 16 ממשקי הסיליקון המוערמים.
| פרמטר אריזה | TSMC CoWoS-S | TSMC CoWoS-L | אינטל EMIB | קשר היברידי ישיר של נחושת-נחושת |
| חומר בסיס של חוצה | סיליקון פסיבי מונוליטי | גשרי RDL אורגניים + סיליקון | מצע אורגני + גשר סיליקון משובץ | דיאלקטרי ישיר מ-Die-to-Die (SiCN) |
| רווח/שורה מינימליים (שמאל/שמאל) | 0.4 מיקרומטר / 0.4 מיקרומטר | 0.8 מיקרומטר / 0.8 מיקרומטר | 0.8 מיקרומטר / 0.8 מיקרומטר | < 0.2 מיקרומטר / 0.2 מיקרומטר |
| גובה החיבור של רפידות | 25 מיקרומטר עד 40 מיקרומטר | 20 מיקרומטר עד 35 מיקרומטר | 45 מיקרומטר עד 55 מיקרומטר | תת-1.0 מיקרומטר |
| מוליכות תרמית (בסיס) | גבוה (~149 וואט/מ"ק) | בינוני (~1.5 W/m·K + גשרים) | בינוני (~1.5 W/m·K + גשרים) | מגע סיליקון ישיר במיוחד (גבוה במיוחד) |
| גורם אובדן תפוקת אריזה | גבוה (מגבלות קנה מידה מרובות רשתות) | בינוני (הרכבת גשר מודולרית) | בינוני (הרכבת גשר מודולרית) | נמוך (תלוי ב-CMP חדר נקי מסוג Class-1) |
| אזור אינטגרציה מקסימלי | מגבלת רשתית פי 3.3 (כ-2800 מ"מ²) | גבול רשתית פי 6 (מעל 5000 מ"מ²) | מצע מודולרי ניתן להרחבה | ערימות שבבים אנכיות ניתנות להרחבה |
ניהול קינטיקה של פיזור תרמי על פני לוגיקה הטרוגנית מרובת שבבים, HBM4 , ומחסניות HBF בעלות 16 שכבות דורש מסגרת ניהול תרמי משולבת ורב-שכבתית. מקור החום העיקרי בתוך המארז הוא שבב המעבד המרכזי, שיכול לפזר מעל 700 וואט עד 1000 וואט תחת ביצוע נקודה צפה רציף של מטריצת טנזור, מה שיוצר גרדיאנטים תרמיים רוחביים חמורים על פני האינטרפוזר. בעוד ששכבות DRAM של HBM4 רגישות מאוד לעלייה תרמית - הדורשות שטמפרטורות צומת (Tj) להישאר מתחת ל-95 מעלות צלזיוס כדי למנוע פגיעה אקספוננציאלית עקב דליפת רענון - מחסניות HBF בעלות 16 שכבות מציגות לולאת משוב תרמי-חשמלית ייחודית. במהלך שלבי פענוח הסקה של מודל שפה גדול עתיר קריאה, פיזור ההספק הפעיל של זיכרון פלאש NAND תלת-ממדי עם מלכודת מטען נמוך יחסית (בדרך כלל מתחת ל-15 וואט לכל מודול 512 ג'יגה-בייט). עם זאת, טמפרטורות חיצוניות גבוהות המבוצעות דרך האינטרפוזר המשותף ממעבד הלוגיקה הסמוך מאיצות דליפת מטען משכבת מלכודת המטען של סיליקון ניטריד (Si₃N₄) על פני הדיאלקטרי הדק של סיליקון דו-חמצני (SiO₂) באמצעות מנגנוני פליטה תרמית. כפי שפורט בניתוחי מחקר פדרליים שפורסמו על ידי המכון הלאומי לתקנים וטכנולוגיה - משרד המסחר האמריקאי - אפריל 2026 , מאמץ תרמי מאיץ משמעותית את סחף מתח הסף במערכי פלאש לא נדיפים צפופים במיוחד. כדי לנהל את הגרדיאנטים התרמיים הללו, אדריכלי המארזים משלבים מפזרי חום סינתטיים של פחמן דמוי יהלום ( DLC ), ערוצי קירור מיקרו-פלואידיים בתוך מכסה הסיליקון הפסיבי העליון, וחומרי ממשק תרמי ( TIM2 ) בעלי ביצועים גבוהים הכוללים מטריצות של מתכת נוזלית או ננו-צינוריות פחמן המסוגלות להשיג מוליכות תרמית העולה על 80 W/m·K.
Cross-Sectional Thermal Gradient Architecture
Extreme Local Hotspot (95°C+)
Refresh Sensitive (< 95°C)
Leakage Sensitive (< 85°C)
הפיזיקה של תאי פלאש NAND תלת-ממדיים מסוג Charge-Trap ( CTN ) בתוך מודולי HBF נשלטת על ידי מנגנוני פירוק קוונטי-מכניים השונים באופן מהותי מההתנהגות הנדיפה של זיכרון RAM דינמי. בתאי CTN תלת-ממדיים, שמירת מצב נתונים מושגת על ידי אחסון אלקטרונים בתוך שכבת סיליקון ניטריד (Si₃N₄) מבודדת, המוגבלת על ידי דיאלקטרי מנהור של סיליקון דיאוקסיד (SiO₂) ותחמוצת חסימה בעלת k-10 (בדרך כלל תחמוצת אלומיניום, Al₂O₃). פעולות תוכנית ומחיקה מסתמכות על מנהור Fowler-Nordheim ( FN ), שבו שדות חשמליים חזקים (>10 MV/cm) דוחפים אלקטרונים דרך מחסום המנהור של SiO₂ אל תוך שכבת מלכודת המטען. במהלך מחזורי מחיקה חוזרים ונשנים של תוכנית ( P/E ), שדות חשמליים עזים אלה יוצרים מלכודות פגמים פיזיות בתוך הסריג הדיאלקטרי של SiO₂, מה שמגדיל את צפיפות המלכודת בקנה מידה אטומי ומוביל לזרם דליפה מושרה על ידי מאמץ ( SILC ). יתר על כן, במהלך שלבי פענוח אוטורגרסיביים רציפים של אסימונים - שבהם משקלי מודל המאוחסנים ב- HBF נתונים למיליוני פעולות קריאה בלתי פוסקות - תאים חווים עומס קריאה-הפרעה. הפרעת קריאה מתרחשת כאשר מתחי מעבר (Vpass) המופעלים על שורות מילים שלא נבחרו במהלך פעולות קריאה יוצרים שדות חשמליים ברמה נמוכה אשר צוברים בהדרגה מטען טפילי בשכבת מלכודת המטען, וגורמים לפיזור מתח הסף (Vth) של תאים שלא נבחרו לזוז כלפי מעלה לאורך זמן.
| מנגנון פירוק | שורש הגורם הפיזי | השפעה על שלמות תאי HBF | אסטרטגיית הפחתה בקוביית הלוגיקה הבסיסית |
| פאולר-נורדהיים אוקסיד בלאי | מנהור בשדה חשמלי גבוה (>10 MV/cm) | מטעני תחמוצת לכודה ודליפת SILC | הגבל פעולות HBF למשימות דומיננטיות לקריאה |
| קריאה-הפרעה משמרת חמישית | מתח מתח Vpass מצטבר במהלך קריאות | סחף תא חמישי שלא נבחר למצבים גבוהים יותר | כוונון Vpass דינמי וסיור עמודי רקע |
| פליטת מטען תרמי | טמפרטורת משתלב גבוהה (מעל 85°C) | בריחת מטען מואצת משכבת Si₃N₄ | מעקב אדפטיבי אחר מתח קריאה-ייחוס (Vref) |
| פגיעה בשמירת נתונים | דעיכת מלכודות לטווח ארוך ונדידת SILC | אובדן מרווח בין מדינות חמישיות מתוכנתות | תיקון שגיאות LDPC רב-שכבתי עם החלטה רכה |
| מאמץ טמפרטורה צולבת | תוכנית בטמפרטורה נמוכה, קריאה בטמפרטורה גבוהה | עיוות וקריאות שגויות בהתפלגות Vth | עקומות חישת ופיצוי טמפרטורה על גבי המעגל |
כדי לנטרל פגיעה בהפרעות קריאה, סחיפה של מתח סף ודליפת מטען תרמי, שבב הלוגיקה הבסיסי של מחסנית HBF בת 16 שכבות משלב מנוע מתקדם ברמת חומרה לסיבולת ותיקון שגיאות. מרכזי בארכיטקטורה זו הוא מפענח קוד תיקון שגיאות ( ECC) בעל תפוקה גבוהה וצריכת חשמל נמוכה מסוג Low-Density Parity-Check ( LDPC ), הפועל לצד מערכת מעקב אדפטיבית אחר מתח ייחוס קריאה ( Vref ). פענוח סטנדרטי של החלטה קשה מעריך את מצבי תאי הזיכרון על סמך סף מתח קבוע יחיד; עם זאת, כאשר עומס הפרעות קריאה משנה את ההתפלגויות ה-V של מערכי NAND תלת-ממדיים של תאים מרובי-רמות ( MLC ) או תאים משולשים ( TLC ), פענוח של החלטה קשה מוביל לקפיצות קצב שגיאות סיביות ( UBER ) בלתי ניתנות לתיקון. בקר ה- HBF עוקף חישת החלטה קשה על ידי הפעלת שגרות פענוח של סיביות רכות, יישום מספר מתחי ייחוס קריאה מדויקים סביב גבולות המצב החמישי החופפים כדי לחלץ יחסי סבירות לוגריתמיים הסתברותיים ( LLRs ) עבור כל ביט מאוחסן. על ידי עיבוד מטריצות LLR של סיביות רכות אלו באמצעות מנועי איטרציה של LDPC חומרתיים מקבילים , שבב הלוגיקה הבסיסי יכול לשחזר שיעורי שגיאות סיביות גולמיות ( RBER ) המתקרבים ל-10⁻² בחזרה לסף UBER מקובל של מתחת ל-10⁻¹5. בנוסף, שבב הבסיס מבצע אלגוריתמים אוטונומיים של סיור קריאה ברקע, ניטור רציף של צפיפויות שגיאות עמוד ומיקום מחדש דינמי של בלוקים בעלי משקל קריאה גבוה לבלוקים לא נדיפים רעננים לפני ששגיאות הפרעות קריאה מפרות את שולי התיקון המרביים של LDPC.
שלמות רשת אספקת החשמל ( PDN ) מציגה פרמטר משותף קריטי נוסף לשילוב מחסנית HBF בת 16 שכבות בתוך חבילות הטרוגניות מרובות שבבים. חישה סימולטנית של קו מילים והפעלה סימולטנית של מגבר חישה על פני 16 שבבי NAND תלת-ממדיים מקבילים מייצרות קפיצות זרם חולפות מסיביות בתדר גבוה (dI/dt) על פסי חלוקת החשמל הפנימיים. בטופולוגיות מחסנית תלת-ממדיות צפופות, ההשראות הטפילית (Lg) של עמודות הספק TSV אנכיות ומיקרו-בליטות של המארז, בשילוב עם התנגדות חוצי (Rg), יוצרת ירידות מתח אינדוקטיביות משמעותיות (LgdI/dt) וירידות IR. תנודות מתח האספקה הללו, המכונות רעש אספקת חשמל ( PSN ) או קפיצת קרקע, יכולות לערער את יציבותם של מעגלי משאבת המטען הפנימיים האחראים ליצירת מתחי תכנות ומעבר גבוהים, וכתוצאה מכך שגיאות חישה ופגיעה בשולי אות הקריאה. כדי לדכא רעשי ספק הכוח, מתכנני חומרה מטמיעים קבלי Deep-Trench ( DTC ) בעלי צפיפות קיבול גבוהה במיוחד (>300 nF/mm²) ישירות לתוך שבב הלוגיקה הבסיסי ומצעי הסיליקון. התקנים פסיביים משולבים אלה, הממוקמים בקרבה פיזית לעמודות ספק הכוח TSV האנכיות, משמשים כמאגרי מטען מקומיים המרככים אדוות מתח חולפות, ומבטיחים מתחי ייחוס יציבים ושומרים על שלמות אות ההספק בכל 16 שכבות הזיכרון המוערמות במהלך פעולות קריאת פרץ.
הכדאיות המסחרית וקנה המידה של הפריסה של טופולוגיות HBF בעלות 16 שכבות תלויים במידה רבה במטרולוגיה מתקדמת, פרוטוקולי בדיקה של שבבי Known Good Die ( KGD ) וארכיטקטורות מיפוי מחדש של פגמים עמידים לתקלות. בדיקת שבבי NAND תלת-ממדיים בודדים לאחר דילול חפיפה אחורית לפרופילים של פחות מ-30 מיקרומטר מייצגת אתגר ייצור קיצוני, שכן כרטיסי גשש קונבנציונליים יכולים לגרום לשברים מיקרו-מכניים על פרוסות סיליקון שבירות ודוללות. כדי להתגבר על מגבלה זו, יצרני זיכרון מיישמים מערכי כרטיסי מיקרו-גשש ללא מגע או בעלי כוח נמוך, המשולבים עם לוגיקת בדיקה עצמית מובנית ( BIST ) מקיפה המוטמעת ישירות במעגלים ההיקפיים של NAND תלת-ממדיים. לפני שילוב מחסנית אנכית, סינון KGD ברמת פרוסת ... מנועים אלה כוללים מערכי עמודות TSV מיותרים , טבלאות מיפוי מחדש של בלוקים ולוגיקת תיקון פיזית של נתיבי אפיק המסוגלת לעקוף באופן דינמי חיבורים אנכיים שבורים או דפי זיכרון פגומים תוך כדי תנועה במהלך זמן ריצה תפעולי
Figure 1: 3D NAND Vth Shift & LDPC Soft-Bit Correction Burden under Continuous Read-Disturb Stress
5-Year Simulation: Raw Bit Error Rate (RBER) vs. Cumulative Read Cycles on 16-Layer HBF Weight Storage Blocks (at Tj = 85°C)
זכויות יוצרים שייכות ל- debugliesintel.com
אפילו שכפול חלקי של התוכן אינו מותר ללא אישור מראש – שכפול שמורה
