2023年春、ChatGPTが世界を席巻した後、マイクロソフトが最初に公表した発言がある。
**「データセンターに電力が不足している」**というものだった。
AIブームによって突然電力を多く使うようになったわけではない。問題はもっと古く、もっと根本的だった。
世界中のデータセンターが消費する電力の30〜40パーセントは、演算に使われない。
データをメモリからプロセッサへ、プロセッサからメモリへと移動させるプロセス — その移動自体に消費される。
数百兆ウォン規模のAIシステムが、実際には半分近くの時間を待機に費やしている。
強力なエンジンを持つ車が交通渋滞に捕まっている状況だ。
問題はエンジンではない。道路が詰まっているのだ。
1. メモリの壁という物理法則
半導体業界の人々は、この問題を**「メモリの壁(Memory Wall)」**と呼ぶ。1994年に初めて名付けられた概念だ。
プロセッサの速度は毎年急速に成長しているが、メモリとプロセッサ間のデータ転送速度はその速度に追いつけないという物理的な限界を指す。→ 30年が経過した。壁は消えていない。むしろさらに高くなった。
NVIDIAのH100 GPUが処理できる演算量は、毎秒数千兆回に達する。
しかし、このGPUが実際に推論タスクを実行する時 — ユーザーが「この文の次に何が来るか?」と尋ねる時 — 演算装置自体が遊んでいる時間が全体の半分を超えることがある。**<データが来るのを待つ時間>**だ。
なぜこのようなことが起こるのか。現在のサーバーの主力メモリであるDDR5の構造を詳しく見れば答えがある。
DDR5のデータバスは片道1車線だ。読み出し(Read)と書き込み(Write)が同じ物理線路を共有する。
データがメモリから出てきている間、他のデータは入ってこられない。
方向が変わるたびに信号が安定化するのを待たなければならない。
この待機時間を「バスの方向転換ペナルティ(Bus Turnaround Penalty)」と呼ぶ。
方向転換ごとに約15〜20クロックサイクル、物理的には11〜15ナノ秒が費やされる。
ナノ秒? それがどれほど大きな時間なのか。
ChatGPTに質問を入力すると、応答が単語単位で流れてくる。
その単語一つが生成される間に、GPUは数億回のメモリ読み書きを繰り返す。
方向が変わるたびに待機する。数億回待機する。小さな損失が数億回積み重なると、それは小さな損失ではなくなる。
問題は、これが性能低下で終わらないことだ。
待機している間にも、メモリバスには電気が流れている。
データを送っていないにもかかわらず、回路の寄生容量を充電・放電しながら電力を消費する。
AIが思考している間、電力は何もしていないのに消費される。
これがデータセンター電力危機の実際の構造だ。
最先端AI演算が問題なのではない。最先端AIが「待機する」方法が問題なのだ。
2. 血管が詰まれば心臓は意味をなさない
人体には「心臓が強ければ健康だ」という直感がある。
しかし、動脈が詰まっていたら? どんなに強い心臓も、血液を体の隅々まで送り届けることはできない。心不全は心臓自体の問題ではないことが多い。
コンピュータアーキテクチャも同様だ。
プロセッサが強力になるほど、データを供給する「血管」の問題がより顕著になる。強い心臓に比べて血管が細すぎるためだ。
この比喩が単なる修辞ではない理由は、実際の人の血液循環とデータインターコネクト間の動作原理が驚くほど類似しているからだ。
血液循環における鍵は、酸素を組織へ「送り」二酸化炭素を肺へ「持ち帰る」という二方向の流れが同時に行われることだ。
動脈と静脈は完全に分離された経路を使用する。
そのため、酸素供給と老廃物除去が同時に進行する。
もし動脈と静脈が同じ血管を共有していたら、血液は方向転換のたびに流れを止め、待たなければならなかっただろう。
DDR5はその悪い想像の中の血管だ。
CXL(Compute Express Link)は、動脈と静脈を分離した構造だ。
CXLはPCIe(PCI Express)の物理層を基盤としている。
PCIeは元々、データを送信する線路(TX)と受信する線路(RX)を物理的に分離した全二重(Full-Duplex)方式で設計されている。読み出しデータがRX線路を流れている間に、書き込みデータはTX線路を通じて同時に転送される。
方向転換ペナルティは構造自体から消滅する。
実証データはこの違いを数値で示している。
読み出しと書き込みが半々で混在するトラフィック環境 — 実際のAIワークロードはまさにこの状況だ — において、CXLベースシステムの実効帯域幅は、同じクロック速度を持つDDR5チャネルに比べて55〜61パーセント向上する。
もちろん、CXLにもコストはかかる。
PCIeパケット処理と外部コントローラーを経由するため、**信号遅延時間(Latency)**が増加する。
->DDR5が75〜85ナノ秒であるのに対し、CXLは130〜200ナノ秒レベルだ。信号が到着するのに2倍近く時間がかかる。
それでは、CXLはより遅いのではないか?
ここで二つの概念を区別する必要がある。
遅延時間(Latency)は、最初のデータが到着するまでにかかる時間だ。
帯域幅(Bandwidth)は、単位時間あたりどれだけのデータを転送できるかだ。
速い列車が頻繁に来ないのと、少し遅い列車が絶え間なく続くのと違いだ。
GPT-4、LLaMA、Geminiのような大規模言語モデルが推論を実行する際に必要なのは、数千億個のパラメータデータを絶えず供給されることだ。
単発の応答速度ではなく、データ供給の持続性が性能を決定する。
この環境では、遅延時間の損失は帯域幅の利得で十分に補償される。血管が太くなった。心臓がよりよく動けるようになった。
3. 放置されたメモリがお金になる方法
技術的な改善よりも、より即座に注目される話がある。お金の話だ。
現在、大規模データセンターで管理者が最も不便に感じている現象の一つがある。
**「遊休メモリ(Stranded Memory)」**だ。翻訳すると「孤立したメモリ」、あるいは「放置されたメモリ」。
現在のサーバー構造では、メモリはそれぞれのCPUノードに物理的に固定されている。
ノードAのCPUが忙しく作業して停止すると、そのノードに挿さっている256ギガバイトのメモリは何もせずにその場に留まる。
ノードBがメモリをより必要としても、ノードAのメモリを借りる方法がない。物理的な障壁がそれを阻んでいる。
この状況をデータセンター規模に拡大すると規模が変わる。
数千台のサーバーのうち、実際に負荷が高いノードは全体のほんの一部だ。
残りのノードのメモリの大部分は放置されたまま電力を消費して待機している。
理論上十分なメモリ容量があるにもかかわらず、特定のノードでメモリ不足が発生する。そのため、メモリをさらに購入する。放置されたメモリがあるままに。
CXLスイッチはこの構造を解体する。
CXLベースのメモリプーリング(Memory Pooling)アーキテクチャでは、物理メモリが仮想化スイッチを通じて一つの共有リソースプールにまとめられる。
ノードBがメモリを必要とすると、プールから1ギガバイト単位で即座に割り当てられる。
ノードBの作業が終わると、メモリはプールに戻り、他のノードが使用できるようになる。
これがサーバー容量計画にどのような意味を持つのか。
既存の方法では、ピーク負荷に対応するためにメモリを「過剰プロビジョニング」する必要があった。
実際に同時に使われなくても、最悪の状況に備えて各ノードに十分なメモリを常時挿しておかなければならなかった。
この過剰分こそが放置されたメモリの正体だ。
CXLプーリング環境では、全体のメモリリソースを最適に活用できるため、
同じワークロードを処理するために購入しなければならない物理メモリの総量が減る。
さらに、個々のノードに超高密度RDIMMを一杯に詰め込む代わりに、比較的安価な汎用64ギガバイトRDIMMを多数CXL PCIe拡張スロットに分散配置する方法で、購入単価を下げることができる。
同じ利用可能なメモリを構築するための設備費用が最大50パーセントまで削減されるという実証データがある。
運用コストも変わる。
CXL物理コントローラーには、トラフィック密度をマイクロ秒単位で感知する電力管理回路が搭載されている。
データフローが少なくなると、リンクを超低電力状態に切り替える。
次のデータ要求が来ると、ナノ秒単位で復旧する。
サムスン電子の量産データによると、このメカニズムでメモリモジュールの遊休待機電力を最大50パーセント以上削減する。
さらに進めると、インラインハードウェア圧縮技術との組み合わせがある。
ZeroPoint TechnologiesのDenseMem圧縮IPをCXL 3.1コントローラーと同じダイ(Die)内にパッケージングすると、全てのデータ圧縮・解凍がハードウェアアクセラレータ端で自動的に行われる。
CPUの演算リソースを1バイトも使わずに、物理メモリに保存されるデータを最大3対1の比率で圧縮する。
結果は逆説的に聞こえる。
メモリチップの物理的な個数を増やさなくても、オペレーティングシステムが認識する論理的なメモリサイズが3倍になる。
実際にバスを通過する信号パケットのサイズが減るので、転送電力もさらに低くなる。
設備投資費、運用費、電力費が同時に削減される。これがCXLが単なる性能規格ではない理由だ。
4. サムスン電子が先駆けた道
CXLが学術規格の議論から実際の製品へと降りてくるのに、先駆けて動いた企業がある。
サムスン電子は2021年5月、業界初となるCXL 1.1ベースのCMM-D(CXL Memory Module-DRAM)を開発した。
当時、ほとんどのサーバーメーカーがCXLを「2025年以降の技術」と分類していた時期だった。サムスンはそれ以前にすでに実物を作っていた。
2022年5月、CXL 2.0規格をネイティブに適用した第2世代CMM-D 2.0が量産段階に入った。
単一スロットで最大256ギガバイトの容量をサポートし、36GB/sの実効帯域幅を安定的に提供する製品だった。
次の段階はCMM-D 3.1だ。
PCIe 6.0インターフェースを基盤に、単一モジュールで1TBのメモリ空間を提供し、帯域幅は毎秒72GB/sに達する。
この数値が持つ意味は、単なる数字ではない。
既存のCPUソケットに直結されたメモリチャネルの総帯域幅の限界を、単一CXLスロットが超え始めるという意味だ。
SKハイニックスは異なる道を選んだ。
2026年3月、グローバルフラッシュサミットで次世代CMM-DDR5モジュールの実物を公開すると同時に、HMSDK(Heterogeneous Memory Software Development Kit)をオープンソースで公開した。ハードウェアだけを売るつもりはないという宣言だ。→開発者が異種メモリプールをソフトウェアで直接制御できるエコシステムを先に作ろうとしているのだ。
Micronは2023年に開発したCXL 2.0互換CZ120シリーズで、現業データセンターの検証サイクルを通過し、商用信頼性データを積み上げている。
3社がそれぞれ異なる方向から同じ山を登っている。
NVIDIAは2026年末に発売予定のVera CPUにCXL 3.1を標準搭載すると発表した。
Intelの第5世代XeonとAMD EPYC Turinは、すでにCXL 2.0以上をサポートしている。
Googleは世界中のデータセンターにCXL物理インターコネクトを積極的に配置している。
市場が規格を待っていた段階を過ぎ、規格が市場を作り出す段階に突入した。
業界の推計によると、グローバルCXL市場は2028年までに約158億ドルに成長する見込みだ。2024年の推計値は12億ドルだった。
4年間で13倍だ。
5. 韓国がこの戦いに勝てる理由
CXLという新しい規格は、技術地図を再描画する。
既存で有利だったものが相対的に不利になり、既存では不可能だった参入が可能になる。
韓国の半導体産業は、長らく不均衡な構造を持っていた。
世界最高水準のDRAM製造能力を保有しているが、コア設計知的財産権(IP)を創出するファブレス部門、高付加価値パッケージングのOSAT領域、そして精密検査装置分野では、グローバルTop 10に自国企業が名を連ねるのは難しかった。
DRAMを作るのが上手な国ではあったが、半導体エコシステムを主導する国ではなかった。
CXLがこの構造を揺るがす。
新しいインターコネクト標準は、新しいチップを必要とする。
スイッチチップ、コントローラーチップ、PHY IP、検査装置、高多層基板。これらの各分野で、韓国企業が異例の先駆的な位置を占めている。
Panmnesia:スイッチチップの世界初
KAIST(韓国科学技術院)の研究者を中心に創業したPanmnesiaは、
世界で初めてポートベースルーティングを完全に実行するCXL 3.2フルスペックシングルスイッチチップセットを開発した。
「PCIe 6.4-CXL 3.2 Fusion Switch」という名のこのチップは、一つの物理半導体内でCPU・GPU・アクセラレータ・共有メモリデバイスを束ね、コンポーザブル共有システムとして接続する。
差別化された点は、スイッチホップ(Hop)を経由する際の遅延オーバーヘッドを二桁ナノ秒(ns)未満に削減したことだ。
生成AI推論プロセスにおけるボトルネックの一つであるKV(キー・バリュー)キャッシュ処理を、スイッチ内部にハードウェアアクセラレータ回路として内蔵した。
CES 2025で最高革新賞を受賞し、シリーズA投資で800億ウォンを調達し、累積企業価値3,400億ウォンを超えた。
グローバルビッグテックと実証評価を進めている。
MetisX:メモリ内で計算するチップ
サムスン電子とSKハイニックスのアーキテクチャ設計本部の出身者が集まったMetisXは、異なる方向の問いを投げかけた。
CPUやGPUにデータを持ち込んで計算するのではなく、メモリ内で直接計算したらどうなるか?
「コンピュテーショナルメモリ(Computational Memory)」と呼ばれるこの概念を、CXL 3.0アーキテクチャ上で実現した。
CXLメモリモジュールのコントローラーチップセット内に、ベクトル演算エンジンとデータ圧縮・フィルタリング回路を内蔵した。
AIベクトル類似度計算やRAG(検索拡張生成)タスクに必要な大規模データフィルタリングがメモリデバイス内で完了し、加工された結果値のみがプロセッサに伝達される。
バスを往復するデータ量が根本的に減る。
→ プロセッサの発熱が低下し、データセンターの冷却コストが削減される。
シリーズAで600億ウォンを調達し、グローバルクラウド企業と共同エンジニアリングを進めている。
Dinotiia:ベクトルデータベース専用半導体
生成AIにおけるRAG(検索拡張生成)と長期記憶の実装に不可欠なのがベクトルデータベースだ。
テキスト、画像、音声を高次元数値ベクトルに変換し、類似度を計算する作業だ。
Dinotiiaは、この作業を専用に処理するVDPU(Vector Data Processing Unit)を設計し、それをクラウドで制御する「Seahorse」プラットフォームを商用化している。
VDPUをCXLインターコネクトロジックと完全に整合させ、多国籍SoCメーカーや基板設計業者を対象にIPライセンシング営業を展開している。
OpenEdgeTechnology:IPで稼ぐ会社
直接チップを販売しなくても、半導体エコシステムの恩恵を受ける方法がある。設計資産(IP)を販売することだ。
OpenEdgeTechnologyは、オンチップインターコネクトIP、メモリコントローラーIP、PHY IPをグローバル市場に供給する上場IP専門企業だ。
CXLベースのコントローラーチップセットを量産しようとする国内外のファウンドリ顧客が必須でライセンスしなければならないDDR5およびLPDDR5X IPを保有している。
チップが製造されるたびにロイヤリティが積み上がる構造だ。2025〜2026年がその臨界点と分析される。
6. 検査する者が品質を制御する
チップを作るのと同じくらい重要なことがある。
作られたチップが正しく動作するかを確認することだ。
新しい規格が登場するたびに、検査装置市場も新たに開かれる。
既存のDDR5検査装置では、CXLモジュールを正しく検査できない。プロトコルが異なり、速度が異なり、要求されるテスト条件が異なる。
Neosemはこの空白を先駆けて埋めた企業だ。
2023年、業界初となるCXL 1.1標準検査プラットフォームを商用化した。
ここで止まらず、CXL 2.0規格対応の高速・高温バーンイン(Burn-in)検査装置の国産化を完了し、サムスン電子に商用1号機を独占納品した。
Neosemの検査方式が差別化されている理由は、動作条件の極端性にある。
メモリが実際に稼働している間、チャンバー内部の温度を極限まで上げ、極限まで下げる熱ストレスを連続的に加えながら、リアルタイムで欠陥を追跡する。
常温で正常に動作するチップが、温度変化でエラーを示す場合がある。そのエラーを出荷前に捉えるのだ。
世界中の半導体検査市場は、米国のTeradyneと日本のAdvantestが掌握していた。NeosemはCXLという新しい規格で、この二つの巨人よりも先に量産検査装置を納品することに成功した。
Exiconは、サムスン電子ファウンドリの4ナノプロセスを適用したCXL 3.0特化メモリモジュールおよびプロトコル分析装置の開発に注力している。
PCIeインターフェース分析特許を基盤に、シリコンバレーに支社を設立し、顧客の多様化を推進している。
Faduは、CXL物理プロトコルと互換性のあるコントローラーチップセットとFPGAベースの概念実証カードのフィールドテストを進めている。
Qualitas Semiconductorは、64GT/s以上の速度を物理ノイズなしで伝送するPCIe 6.0およびCXL 3.1互換PHY設計資産を確保し、グローバルシステム半導体メーカーと早期検証を行っている。
7. 基板がなければチップは宙に浮く
半導体チップは、それ自体では完成品ではない。
基板(Substrate)という土台の上に載って初めて動作する。
CXLの高速信号は、基板に特別な要求をする。64GT/s以上の信号が歪みなく通過するには、基板素材と積層設計が一般的なサーバー基板とは異なっていなければならない。
**TLB(Tezla)**は、CXLモジュール用高周波動作無損失信号伝送層設計と次世代低電力LPCAMM専用モジュール基板プロセス技術を先駆けて確保した企業だ。
急増するグローバル需要に対応するため、ベトナムに第2工場を早期稼働させ、AI制御自動化ロボットで一桁ppmの歩留まりを達成した。サムスン電子とSKハイニックスの同時核心協力会社だ。
Daeduck GDSは、FC-BGA(Flip-Chip Ball Grid Array)大型パッケージング基板の増設投資を完了したグローバル・トップティア・パッケージングボードメーカーだ。
微細化されるバンプ接合密度と多層化トレンドにより製品単価が跳ね上がる構造において、技術障壁が高まるほど恩恵が大きくなる位置にある。
8. 本当の戦いはここから始まる
技術が完成していると思われるかもしれない。チップもあり、スイッチもあり、検査装置もあり、基板もある。規格も定められている。
しかし、なぜCXLはまだサーバー市場の主流ではないのか。
いくつかの理由があるが、その一つが意外な点にある。ソフトウェア設計ツールのコストだ。
SynopsysやCadenceのような多国籍企業が独占するEDA(Electronic Design Automation)ソフトウェアは、半導体設計の必須ツールだ。
ライセンス費用は年間数億から数十億ウォンに達する。
Panmnesia、MetisX、Dinotiiaのようなスタートアップが世界初の技術を開発したとしても、次世代チップを設計するにはこのソフトウェアを使い続けなければならない。有意義な量産売上が上がる前のスタートアップにとって、このコストは財務的窒息だ。
この問題は技術の問題ではない。構造の問題だ。
科学技術情報通信部と中小ベンチャー企業部が今すべきことが、国庫補助金を細かく分けて配る方式ではない理由がここにある。
EDAソフトウェア調達費用に対する税額控除限度を大幅に拡大し、
長期リース支援保証基金を常時運営しなければならない。
サムスン電子・SKハイニックスファウンドリのMPW(Multi-Project Wafer)スロットを国内の強小ファブレスに優先配分する制度的装置が必要だ。
それがなければ、世界初の技術を開発したチームが量産段階で外国資本に売却されたり、外国ファブレスに吸収されたりする 일이繰り返される。
人類がAIインフラをどのように設計するかを巡って、今新しいルールが書かれている。
そのルールを書くテーブルに、韓国企業が座っている。初めてだ。
9. メモリの壁の向こう側
30年前に名付けられた問題があると述べた。メモリの壁。
その壁を乗り越えようとする試みは続いていた。より高速なDRAMを作り、より多くのチャネルを接続し、より高密度なチップを積層した。しかし、壁は消えなかった。
アーキテクチャ自体がその壁を作っていたからだ。
CXLはアーキテクチャを変える試みだ。メモリとプロセッサの境界をなくし、読み出しと書き込みが同時に流れる物理線路を作り、固定されたノードに縛られ放置されていたメモリを共有リソースにする。
この変化が完成した時、どのような世界が来るのか。
より高速なAIではない。より少ない電力で、より多くのAIが可能になる世界だ。
今、AIインフラ拡張の本当の障壁が土地ではなく電力網であり — そしてその電力浪費の大部分がデータが待つ時間から来るのであれば —
CXLが解決する問題は技術問題ではない。エネルギー問題だ。
データをより効率的に移動させることができれば、AIをより少ないコストでより多くの人々に提供できる。
今あなたが使っているAIサービスの応答速度とサブスクリプション料金の一部は、このメモリバスの方向転換ペナルティから来ている。
ならば、問いが残る。
私たちは30年間「より強力なプロセッサ」に向かって走ってきた。壁はいつも別の場所ににあった。次の壁はどこにあるのだろうか。そして、その壁を発見するのに私たちはどれだけ時間がかかるのだろうか。
参考資料
- CXL Consortium Technical Working Group. CXL 2.0 및 3.0 사양 표준 백서 (Compute Express Link Specification). Compute Express Link 공식 기술 문서 저장소. 2022–2024.
- 카이스트(KAIST) 차세대 메모리 시스템 공동 연구소. 차세대 고대역폭 컴퓨팅을 위한 메모리 계층 및 CXL 인터커넥트 성능 분석. 대한민국 학술원 전자공학 회보. 2023.
- 삼성전자 메모리사업부 신사업전략팀. CMM-D 제품군 기술 로드맵 및 데이터센터 메모리 병목 극복 가치 평가. Samsung Semiconductor 기술 백서 시리즈. 2022–2024.
- ZeroPoint Technologies; Rambus 공동 분석 연구진. CXL 메모리 풀링 환경에서의 총소유비용(TCO) 및 전력 효율 모델 분석. IEEE Computer Architecture Letters. 2024.
- 노근창 외. 한국 시스템 반도체 기업들의 이기종 컴퓨팅 패러다임 선점 분석 보고서. 현대차증권 산업 분석 리포트. 2024–2025.
- SK하이닉스 솔루션개발 센터 소프트웨어 연구소. HMSDK 및 헤테로지니어스 아키텍처를 위한 오픈소스 제어 스택 기술 동향. SK Hynix 기술 세미나 발표 자료. 2026.
- Wulf, Wm. A.; McKee, Sally A. Hitting the Memory Wall: Implications of the Obvious. ACM SIGARCH Computer Architecture News. 1995.
- NVIDIA Corporation. Vera CPU Architecture Overview and CXL Integration Roadmap. NVIDIA GTC Technical Proceedings. 2025.
- Intel Corporation. 5th Gen Intel Xeon Processor Platform: CXL 2.0 Implementation Guide. Intel Developer Zone Technical Documentation. 2024.
- AMD Corporation. EPYC Turin Architecture: Memory Subsystem and CXL Controller Design. AMD Developer Resources. 2024.
- Google Infrastructure. Hyperscale Memory Disaggregation with CXL: Early Deployment Data from Production Workloads. Google Research Technical Report. 2025.
- Rambus Inc. PCIe 6.0 Physical Layer Controller for CXL 3.1: Performance and Power Characterization. Rambus Product Technical Documentation. 2024.
- 파네시아(Panmnesia). PCIe 6.4-CXL 3.2 Fusion Switch: Low-Latency Composable Memory Architecture. CES 2025 Innovation Award Technical Submission. 2025.
- 메티스엑스(MetisX). Computational Memory Architecture on CXL 3.0: Near-Memory Processing for AI Vector Workloads. Hot Chips Symposium Proceedings. 2025.
- 네오셈(Neosem). CXL 2.0 Module Burn-in Test Solution: Field Validation Report for Next-Generation Memory Qualification. 반도체 장비 기술 협의회 발표 자료. 2024.
参考文献
- CXL Consortium Technical Working Group. *CXL 2.0 및 3.0 사양 표준 백서 (Compute Express Link Specification)*. Compute Express Link 공식 기술 문서 저장소. 2022–2024.
- KAIST (한국과학기술원) 차세대 메모리 시스템 공동 연구소. *차세대 고대역폭 컴퓨팅을 위한 메모리 계층 및 CXL 인터커넥트 성능 분석*. 대한민국 학술원 전자공학 회보. 2023.
- Samsung Electronics Memory Business Unit New Business Strategy Team. *CMM-D 제품군 기술 로드맵 및 데이터센터 메모리 병목 극복 가치 평가*. Samsung Semiconductor 기술 백서 시리즈. 2022–2024.
- ZeroPoint Technologies; Rambus Joint Analysis Research Team. *CXL 메모리 풀링 환경에서의 총소유비용(TCO) 및 전력 효율 모델 분석*. *IEEE Computer Architecture Letters*. 2024.
- Wulf, Wm. A.; McKee, Sally A. *Hitting the Memory Wall: Implications of the Obvious*. *ACM SIGARCH Computer Architecture News*. 1995.