posts / 과학

데이터센터 전력의 40%는 계산이 아니라 대기에 쓰인다

phoue

13 min read --

2023년, 챗GPT 열풍이 정점에 달했을 때 마이크로소프트가 내놓은 발언은 예상 밖이었다. 데이터센터에 전기가 부족하다는 것이었다.

GPU를 더 사야 한다는 이야기가 아니었다. 이미 갖춰놓은 GPU조차 전력을 감당할 곳이 없다는 이야기였다.

전 세계 데이터센터가 쓰는 전력의 30~40퍼센트는 계산에 들어가지 않는다. 데이터를 메모리에서 프로세서로, 프로세서에서 다시 메모리로 옮기는 이동 자체에 소모된다. 수백조 원짜리 AI 인프라가 시간의 절반 가까이를 기다리는 데 쓴다.

엔진이 문제가 아니다. 도로가 막혀 있다.

지금 당신이 쓰는 AI 챗봇의 응답이 느려지거나 구독료가 오르내리는 데는 이 낭비가 섞여 있다. 서버 회사가 전기요금을 아끼는 방법을 찾아내면 그 절감분의 일부는 결국 요금에 반영된다. 데이터센터 전력 문제는 특정 기업의 재무제표 항목이 아니라, AI를 쓰는 모두의 비용 구조에 이미 들어와 있는 변수다.

전기가 부족하다는 마이크로소프트의 발언은 그래서 단순한 하소연이 아니었다. GPU를 아무리 늘려도 전력망이 버티지 못하면 그 GPU는 켜지지 못한다. 반도체 회사가 아니라 전력회사의 허가가 AI 확장 속도를 결정하는 상황이 이미 벌어지고 있다. 그런데 이 전력 부족의 상당 부분이 연산이 아니라 대기에서 새고 있다면, 문제를 푸는 순서가 바뀐다. 발전소를 더 짓기 전에, 새는 곳부터 막아야 한다.

메모리 벽이라는 오래된 물리 법칙

1994년, 반도체 업계는 이 현상에 이름을 붙였다. 메모리 벽(Memory Wall). 프로세서 속도는 매년 가파르게 성장하는데, 메모리와 프로세서 사이 데이터 전송 속도는 그 성장을 따라잡지 못한다는 물리적 한계였다.

서른 해가 지났다. 벽은 사라지지 않았다. 오히려 높아졌다.

엔비디아 H100 GPU는 초당 수천조 번의 연산을 처리한다. 그런데 이 GPU가 실제로 추론 작업을 수행할 때 — 사용자가 다음 문장을 예측해 달라고 요청할 때 — 연산 장치가 데이터를 기다리며 노는 시간이 전체의 절반을 넘는 경우가 있다.

이유는 현재 서버 주력 메모리인 DDR5의 구조에 있다. DDR5 데이터 버스는 편도 1차선이다. 읽기와 쓰기가 같은 물리 선로를 공유한다. 데이터가 나오는 동안에는 다른 데이터가 들어갈 수 없고, 방향이 바뀔 때마다 신호가 안정되기를 기다려야 한다.

이 대기 시간을 방향 전환 패널티(Bus Turnaround Penalty)라 부른다. 전환 한 번마다 약 15~20클록 사이클, 시간으로는 11~15나노초가 걸린다.

나노초는 작은 단위처럼 들린다. 그런데 GPU가 단어 하나를 생성하는 동안 수억 번의 메모리 읽기와 쓰기가 반복된다. 방향이 바뀔 때마다 기다리는 일이 수억 번 쌓이면, 그것은 더 이상 작은 손실이 아니다.

더 무거운 문제는 따로 있다. 기다리는 동안에도 메모리 버스에는 전기가 흐른다. 데이터를 보내지 않으면서도 회로의 기생 커패시턴스를 충전하고 방전하며 전력을 태운다. AI가 생각하는 동안, 전기는 아무 일도 하지 않으면서 빠져나간다.

 a modern AI data center
a modern AI data center

이것이 데이터센터 전력 위기의 실제 구조다. 문제는 AI 연산 자체가 아니다. AI가 기다리는 방식이다.

혈관이 막히면 심장은 소용없다

인체에는 심장이 강하면 건강하다는 직관이 있다. 그런데 동맥이 막혀 있다면 사정이 다르다. 아무리 강한 심장도 혈액을 몸 구석구석까지 보내지 못한다. 심부전의 원인이 심장 자체가 아닐 때가 많은 이유다.

컴퓨터 아키텍처도 같은 구조를 가진다. 프로세서가 강력해질수록 데이터를 공급하는 통로의 문제가 두드러진다. 심장은 세졌는데 혈관이 그만큼 넓어지지 않았기 때문이다.

이 비유가 단순한 수사에 그치지 않는 이유는 두 시스템의 작동 원리가 실제로 닮았기 때문이다. 혈액순환에서 핵심은 산소를 조직으로 보내는 흐름과 이산화탄소를 폐로 되가져오는 흐름이 동시에 이루어진다는 점이다. 동맥과 정맥은 완전히 분리된 경로를 쓴다. 그래서 공급과 회수가 동시에 진행된다.

만약 동맥과 정맥이 하나의 혈관을 함께 썼다면, 혈액은 방향이 바뀔 때마다 흐름을 멈추고 기다려야 했을 것이다. DDR5는 그 가정 속의 혈관과 같다.

CXL(Compute Express Link)은 동맥과 정맥을 분리한 구조에 해당한다. PCIe(PCI Express) 물리 계층을 기반으로 하는데, PCIe는 애초에 송신 선로와 수신 선로를 물리적으로 나눈 전이중(Full-Duplex) 방식으로 설계되어 있다. 읽기 데이터가 한쪽 선로를 타고 흐르는 동안 쓰기 데이터는 다른 선로로 동시에 이동한다. 방향 전환 패널티가 구조 자체에서 사라진다.

실증 데이터가 이 차이를 숫자로 보여준다. 읽기와 쓰기가 절반씩 섞인 혼합 트래픽 환경 — 실제 AI 워크로드가 정확히 이 조건이다 — 에서 CXL 기반 시스템의 유효 대역폭은 같은 클록 속도의 DDR5 채널보다 55~61퍼센트 높다.

물론 공짜는 아니다. PCIe 패킷 처리와 외부 컨트롤러를 거치면서 신호 지연시간이 늘어난다. DDR5가 75~85나노초인 데 비해 CXL은 130~200나노초 수준이다. 신호가 도착하는 데 거의 두 배가 걸린다.

그렇다면 CXL이 더 느린 기술 아닌가. 여기서 지연시간(Latency)과 대역폭(Bandwidth)을 구분해야 한다. 지연시간은 첫 데이터가 도착하는 데 걸리는 시간이고, 대역폭은 단위 시간에 옮길 수 있는 데이터의 총량이다. 빠른 기차가 뜸하게 오는 것과, 조금 느린 기차가 끊임없이 이어지는 것의 차이다.

GPT-4나 LLaMA 같은 대형 언어 모델이 추론할 때 필요한 것은 수천억 개 매개변수를 끊김 없이 공급받는 일이다. 단발성 응답 속도보다 데이터 공급의 지속성이 성능을 결정한다. 이 조건에서는 지연시간의 손실을 대역폭의 이득이 충분히 상쇄한다. 혈관이 굵어졌고, 심장은 그만큼 더 잘 뛸 수 있게 됐다.

운동할 때 몸이 하는 일과 비슷하다. 근육이 산소를 더 요구하면 심박수가 오르는 동시에 혈관이 확장된다. 심박수만 올리고 혈관을 그대로 두면 압력만 세지고 실제로 조직에 도달하는 산소량은 크게 늘지 않는다. AI 추론도 마찬가지다. 프로세서 클록을 더 올리는 방향으로만 십수 년을 투자해 왔는데, 정작 병목은 혈관 쪽에 있었다. CXL은 혈관을 넓히는 선택이고, 그 선택이 지연시간이라는 작은 비용을 감수할 만한 이유는 실제 부하 패턴이 순간적인 반응이 아니라 지속적인 공급을 요구하기 때문이다.

이 그림이 하드웨어의 전부는 아니다. 메모리 풀링을 실제로 쓰려면 운영체제와 하이퍼바이저 단에서 이기종 메모리를 인식하고 배치하는 소프트웨어 계층이 함께 성숙해야 한다. 다중 소켓 환경에서 캐시 일관성을 안정적으로 유지하는 일, 장애가 났을 때 어느 노드에 얼마만큼의 메모리가 걸려 있는지 추적하는 일은 여전히 초기 단계의 엔지니어링 과제다. 배관을 새로 깔았다고 수압이 곧바로 안정되지는 않는다.

방치된 메모리가 돈이 되는 방법

기술적 개선보다 더 즉각적으로 다가오는 이야기가 있다. 돈이다.

대형 데이터센터 운영자들이 오래 골치를 앓아온 현상이 있다. 유휴 메모리, 영어로는 스트랜디드 메모리(Stranded Memory)라 부른다. 고립된 메모리라는 뜻이다.

현재 서버 구조에서 메모리는 각 CPU 노드에 물리적으로 고정된다. 노드 A의 CPU가 일을 마치고 멈추면, 그 노드에 꽂힌 256기가바이트 메모리는 아무것도 하지 않은 채 그 자리에 남는다. 노드 B가 메모리를 더 필요로 해도 노드 A의 메모리를 빌릴 방법이 없다. 물리적 경계가 막고 있다.

 DRAM memory modules installed in a server rack
DRAM memory modules installed in a server rack

이 상황을 데이터센터 규모로 확장하면 낭비의 크기가 달라진다. 수천 대 서버 중 실제 부하가 높은 노드는 일부에 불과하다. 나머지 노드의 메모리 대부분은 전기를 먹으며 방치된 채 서 있다. 이론상 전체 용량은 충분한데도 특정 노드에서는 메모리 부족이 발생한다. 그래서 메모리를 더 산다. 방치된 메모리를 그대로 둔 채로.

CXL 스위치는 이 구조를 해체한다. CXL 기반 메모리 풀링(Memory Pooling) 아키텍처에서는 물리 메모리들이 가상화 스위치를 거쳐 하나의 공유 자원 풀로 묶인다. 노드 B가 메모리를 필요로 하면 풀에서 1기가바이트 단위로 즉시 할당받고, 작업이 끝나면 메모리는 다시 풀로 돌아가 다른 노드가 쓸 수 있게 된다.

이것이 서버 용량 계획에 미치는 의미는 크다. 기존 방식에서는 피크 부하를 감당하기 위해 메모리를 과잉으로 갖춰야 했다. 실제로는 동시에 쓰이지 않아도 최악의 상황에 대비해 각 노드에 충분한 메모리를 상시 꽂아두어야 했고, 그 과잉분이 방치된 메모리의 정체였다.

동일한 가용 메모리를 구축하는 설비 비용이 CXL 풀링 환경에서 최대 50퍼센트까지 줄어든다는 실증 데이터가 있다. 개별 노드마다 초고밀도 RDIMM을 채우는 대신, 상대적으로 저렴한 범용 64기가바이트 RDIMM 여러 개를 CXL PCIe 확장 슬롯에 분산 배치하는 방식으로 구매 단가를 낮출 수 있기 때문이다.

운영 비용의 구조도 바뀐다. CXL 물리 컨트롤러에는 트래픽 밀도를 마이크로초 단위로 감지하는 전력 관리 회로가 들어 있다. 데이터 흐름이 잦아들면 링크를 초저전력 상태로 전환하고, 다음 요청이 오면 나노초 단위로 복구한다. 삼성전자 양산 데이터에 따르면 이 메커니즘으로 메모리 모듈의 유휴 대기 전력을 최대 50퍼센트 이상 줄인다.

여기에 인라인 하드웨어 압축 기술이 더해진다. ZeroPoint Technologies의 DenseMem 압축 IP를 CXL 3.1 컨트롤러와 같은 다이(Die) 안에 패키징하면, 데이터 압축과 해제가 하드웨어 가속기 단에서 자동으로 처리된다. CPU 연산 자원을 하나도 쓰지 않으면서 물리 메모리에 저장되는 데이터를 최대 3대 1 비율로 압축한다.

결과는 다소 역설적이다. 메모리 칩의 물리적 개수를 늘리지 않아도 운영체제가 인식하는 논리적 메모리 용량은 세 배가 된다. 버스를 통과하는 신호 패킷의 크기도 줄어드니 전송 전력이 한 번 더 낮아진다. 설비투자비와 운영비와 전력비가 동시에 줄어드는 구조다. CXL이 단순한 성능 규격에 머물지 않는 이유가 여기에 있다.

숫자를 몸으로 느껴지는 단위로 옮겨보면 이렇다. 만 대 규모의 GPU 서버를 운용하는 하이퍼스케일러가 있다고 하자. 메모리 설비 투자에서 절반을 줄인다는 것은, 같은 예산으로 그만큼 더 많은 서버를 늘릴 수 있다는 뜻이거나, 같은 서버 규모를 절반의 메모리 예산으로 유지할 수 있다는 뜻이다. 어느 쪽으로 쓰든 방치된 메모리에 묶여 있던 자본이 풀려난다. 지금까지는 그 자본이 그냥 서서 전기만 먹고 있었다.

삼성전자가 먼저 걸어간 길

CXL이 학술 논의에서 실제 제품으로 내려오는 데 앞서 움직인 곳이 있다.

삼성전자는 2021년 5월, 업계 최초로 CXL 1.1 기반 CMM-D(CXL Memory Module-DRAM)를 개발했다. 당시 대부분의 서버 업체는 CXL을 2025년 이후의 기술로 분류하고 있었다. 삼성은 그 전에 이미 실물을 만들었다.

2022년 5월에는 CXL 2.0 규격을 네이티브로 적용한 2세대 CMM-D 2.0이 양산 단계에 들어갔다. 단일 슬롯에서 최대 256기가바이트를 지원하고, 36GB/s의 유효 대역폭을 안정적으로 제공하는 제품이었다.

다음 단계인 CMM-D 3.1은 PCIe 6.0 인터페이스를 기반으로 단일 모듈에서 1테라바이트 메모리 공간을 제공하며 대역폭은 초당 72기가바이트에 이른다. 이 수치는 단순한 스펙 상승이 아니다. 기존 CPU 소켓에 직결된 메모리 채널의 총 대역폭 한계를 단일 CXL 슬롯이 넘어서기 시작한다는 뜻이다.

SK하이닉스는 다른 경로를 택했다. 2026년 3월 글로벌 플래시 서밋에서 차세대 CMM-DDR5 모듈 실물을 공개하면서, 동시에 HMSDK(Heterogeneous Memory Software Development Kit)를 오픈소스로 공개했다. 하드웨어만 팔지 않겠다는 선언이었다. 개발자들이 이기종 메모리 풀을 소프트웨어로 직접 제어할 수 있는 생태계를 먼저 만들겠다는 뜻이다.

마이크론은 2023년 개발한 CXL 2.0 호환 CZ120 시리즈로 현업 데이터센터 검증 사이클을 통과하며 상용 신뢰성 데이터를 쌓는 중이다. 세 회사가 각자 다른 방향에서 같은 산을 오르고 있다.

엔비디아는 2026년 말 출시 예정인 베라 CPU(Vera CPU)에 CXL 3.1을 기본 탑재한다고 발표했다. 인텔의 5세대 제온과 AMD 에픽 튜린은 이미 CXL 2.0 이상을 지원하고, 구글은 전 세계 데이터센터에 CXL 물리 인터커넥트를 적극적으로 배치하고 있다.

시장이 규격을 기다리던 단계는 지났다. 규격이 시장을 만들어가는 단계로 들어섰다. 업계 추산에 따르면 글로벌 CXL 시장은 2028년까지 약 158억 달러로 성장할 전망이다. 2024년 추산치는 12억 달러였다. 4년 만에 열세 배다.

한국이 이 싸움에 낄 수 있는 이유

clean room wafer
clean room wafer

새로운 규격은 기술 지도를 다시 그린다. 기존에 유리했던 위치가 덜 유리해지고, 기존에 막혀 있던 진입로가 열린다.

한국 반도체 산업은 오래 불균형한 구조를 지녀왔다. DRAM 제조 역량은 세계 최고 수준이지만, 핵심 설계 지식재산권을 만드는 팹리스 부문과 고부가가치 패키징을 담당하는 OSAT 영역, 정밀 검사 장비 분야에서는 자국 기업이 글로벌 상위권에 이름을 올리기 어려웠다. DRAM을 잘 만드는 나라였지, 반도체 생태계를 주도하는 나라는 아니었다.

CXL은 이 구조를 흔든다. 새로운 인터커넥트 표준은 새로운 칩을 요구한다. 스위치 칩, 컨트롤러 칩, PHY IP, 검사 장비, 고다층 기판. 이 영역들에서 한국 기업들이 이례적으로 앞선 자리를 차지하고 있다.

카이스트(KAIST) 연구진을 중심으로 창업한 파네시아는 세계 최초로 포트 기반 라우팅을 완전히 수행하는 CXL 3.2 풀 스펙 싱글 스위치 칩셋을 개발했다. ‘PCIe 6.4-CXL 3.2 퓨전 스위치’라는 이름의 이 칩은 하나의 물리 반도체 안에서 CPU와 GPU, 가속기, 공유 메모리 장치를 묶어 컴포저블 공유 시스템으로 연결한다. 스위치 홉을 경유할 때 발생하는 지연 오버헤드를 두 자릿수 나노초 미만으로 줄였고, 생성형 AI 추론의 병목 원인 중 하나인 KV(키-값) 캐시 처리를 스위치 내부 하드웨어 가속 회로로 내장했다. CES 2025에서 최고 혁신상을 받았고, 시리즈 A 투자로 800억 원을 조달해 누적 기업가치 3,400억 원을 넘어섰다.

삼성전자와 SK하이닉스의 아키텍처 설계 본부 출신들이 모인 메티스엑스는 다른 질문에서 출발했다. CPU나 GPU로 데이터를 옮겨서 계산하는 대신 메모리 안에서 직접 계산하면 어떨까. ‘컴퓨테이셔널 메모리(Computational Memory)‘라 불리는 이 개념을 CXL 3.0 아키텍처 위에 실현했다. CXL 메모리 모듈의 컨트롤러 칩셋 안에 벡터 연산 엔진과 데이터 압축·필터링 회로를 내장해, AI 벡터 유사도 계산이나 RAG(검색 증강 생성) 작업에 필요한 대규모 데이터 필터링이 메모리 장치 안에서 끝나고 가공된 결과값만 프로세서로 넘어간다. 버스를 왕복하는 데이터량이 근본적으로 줄어드니 프로세서 발열도 낮아지고 냉각 비용도 함께 준다. 시리즈 A에서 600억 원을 조달했고 글로벌 클라우드 기업들과 공동 엔지니어링을 진행 중이다.

디노티시아는 생성형 AI의 RAG와 장기 기억 구현에 핵심적인 벡터 데이터베이스 작업 — 텍스트와 이미지, 음성을 고차원 수치 벡터로 바꾸고 유사도를 계산하는 일 — 을 전용으로 처리하는 VDPU(Vector Data Processing Unit)를 설계했다. 이를 클라우드에서 제어하는 ‘씨홀스(Seahorse)’ 플랫폼을 상용화하는 중이며, VDPU를 CXL 인터커넥트 로직과 정렬해 다국적 SoC 제조사와 기판 설계 업체를 대상으로 IP 라이선싱 영업을 펼치고 있다.

직접 칩을 팔지 않고도 생태계의 수혜를 받는 방법도 있다. 설계 자산(IP)을 파는 것이다. 오픈엣지테크놀로지는 온칩 인터커넥트 IP, 메모리 컨트롤러 IP, PHY IP를 글로벌 시장에 공급하는 상장 IP 전문사다. CXL 기반 컨트롤러 칩셋을 양산하려는 국내외 파운드리 고객이라면 반드시 라이선싱해야 하는 DDR5·LPDDR5X IP를 보유하고 있다. 칩이 만들어질 때마다 로열티가 쌓이는 구조이고, 2025~2026년이 그 임계점으로 분석된다.

검사하는 자가 품질을 통제한다

칩을 만드는 것만큼 중요한 일이 있다. 만들어진 칩이 실제로 제대로 작동하는지 확인하는 일이다.

새로운 규격이 나올 때마다 검사 장비 시장도 새로 열린다. 기존 DDR5 검사 장비로는 CXL 모듈을 제대로 볼 수 없다. 프로토콜이 다르고 속도가 다르고 요구되는 테스트 조건이 다르다.

네오셈은 이 공백을 먼저 채운 회사다. 2023년 업계 최초로 CXL 1.1 표준 검사 플랫폼을 상용화했고, 이어 CXL 2.0 규격에 대응하는 고속 고온 번인(Burn-in) 검사 장비의 국산화를 완료해 삼성전자에 상용 1호 장비를 독점 납품했다.

네오셈의 검사 방식이 다른 이유는 동작 조건의 극단성에 있다. 메모리가 실제로 가동되는 동안 챔버 내부 온도를 극한으로 올렸다가 낮추는 열 스트레스를 연속으로 가하면서 실시간으로 결함을 추적한다. 상온에서는 정상 작동하다가 온도 변화에서만 오류를 드러내는 칩이 있는데, 그 오류를 출하 전에 잡아내는 작업이다.

전 세계 반도체 검사 시장은 오래 미국의 테러다인(Teradyne)과 일본의 어드반테스트(Advantest)가 장악해 왔다. 두 회사는 DDR 세대마다 검사 표준을 사실상 먼저 정의해 온 곳들이다. 네오셈은 CXL이라는 새 규격에서 이 두 거인보다 먼저 양산 검사 장비를 납품하는 데 성공했다. 표준이 바뀌는 짧은 틈에 순서가 뒤집힌 셈이다.

엑시콘은 삼성전자 파운드리의 4나노 공정을 적용한 CXL 3.0 특화 메모리 모듈 및 프로토콜 분석 장비 개발에 집중하며, PCIe 인터페이스 분석 특허를 기반으로 실리콘밸리 지사를 설립해 고객 다변화를 추진하고 있다. 파두(Fadu)는 CXL 물리 프로토콜과 호환되는 컨트롤러 칩셋과 FPGA 기반 개념 실증 카드의 필드 테스트를 진행 중이다. 퀄리타스반도체는 64GT/s 이상의 속도를 물리 노이즈 없이 전달하는 PCIe 6.0·CXL 3.1 호환 PHY 설계 자산을 확보해 글로벌 시스템 반도체 업체들과 조기 검증을 수행하고 있다.

기판이 없으면 칩은 붕 뜬다

반도체 칩은 그 자체로 완성품이 아니다. 기판(Substrate)이라는 토대 위에 올라가야 비로소 작동한다. CXL 고속 신호는 기판에 특별한 조건을 요구한다. 64GT/s 이상의 신호가 왜곡 없이 통과하려면 기판 소재와 적층 설계가 일반 서버 기판과는 달라야 한다.

Macro photograph of a high-density chip substrate (FC-BGA package)
Macro photograph of a high-density chip substrate (FC-BGA package)

티엘비(TLB)는 CXL 모듈용 고주파 동작 무손실 신호 전송층 설계와, 차세대 저전력 LPCAMM 전용 모듈 기판 공정 기술을 먼저 확보한 회사다. 급증하는 글로벌 수요에 대응해 베트남에 제2공장을 조기 가동했고, AI 제어 자동화 로봇으로 한 자릿수 ppm 수율을 달성했다. 삼성전자와 SK하이닉스의 동시 핵심 협력사이기도 하다.

대덕전자는 FC-BGA(Flip-Chip Ball Grid Array) 대형 패키징 기판 증설 투자를 마친 패키징 보드 제조사다. 범프 접합 밀도가 미세해지고 다층화가 진행될수록 제품 단가가 도약하는 구조여서, 기술 장벽이 높아질수록 오히려 수혜가 커지는 위치에 있다.

이렇게 나열하면 완결된 밸류체인처럼 보인다. 스위치가 있고, 컨트롤러가 있고, 검사 장비가 있고, 기판이 있다. 그런데 이 조각들이 실제로 맞물려 돌아가려면 아직 한 단계가 더 남아 있다.

진짜 싸움은 여기서 시작된다

기술은 이미 갖춰진 것처럼 보인다. 칩도 있고 스위치도 있고 검사 장비도 있고 기판도 있다. 표준도 정해져 있다.

그런데 CXL은 왜 아직 서버 시장의 주류가 아닌가. 여러 이유가 있지만 뜻밖의 지점 하나가 걸린다. 소프트웨어 설계 도구의 비용이다.

Synopsys나 Cadence 같은 다국적 기업이 독점하는 EDA(Electronic Design Automation) 소프트웨어는 반도체 설계의 필수 도구다. 라이선스 비용은 연간 수억에서 수십억 원에 이른다. 파네시아, 메티스엑스, 디노티시아 같은 스타트업이 세계 최초의 기술을 만들어냈다 해도, 다음 세대 칩을 설계하려면 이 소프트웨어를 계속 써야 한다. 유의미한 양산 매출이 나오기 전 스타트업에게 이 비용은 재무적 목을 조른다.

세계 최초의 기술을 개발한 팀이 정작 다음 칩을 그릴 도구를 빌릴 돈이 없어 멈춘다.

이건 기술의 문제가 아니다. 구조의 문제다.

과학기술정보통신부와 중소벤처기업부가 지금 해야 할 일은 국책 보조금을 쪼개어 나눠주는 방식이 아니다. EDA 소프트웨어 조달 비용에 대한 세액공제 한도를 대폭 늘리고, 장기 리스 지원 보증 기금을 상시 운영해야 한다. 삼성전자·SK하이닉스 파운드리의 MPW(멀티프로젝트웨이퍼) 슬롯을 국내 강소 팹리스에 우선 배정하는 제도적 장치도 필요하다.

그것이 없으면 세계 최초의 기술을 개발한 팀이 양산 단계에서 외국 자본에 팔리거나 외국 팹리스에 흡수되는 일이 반복된다. 스위치 칩을 처음 만든 나라가, 그 칩을 양산하는 단계에서는 이름이 빠지는 일이 생긴다.

인류가 AI 인프라를 어떻게 설계할지를 두고 새로운 규칙이 지금 쓰이는 중이다. 그 규칙을 쓰는 테이블에 한국 기업들이 처음으로 앉아 있다.

이 싸움을 회사 단위로만 보면 절반만 보인다. 데이터센터 한 곳의 전력 소비는 이제 중소 도시 하나와 맞먹는 규모로 커졌고, 신규 데이터센터 건설 인허가에서 전력망 접속 가능 여부가 부지 선정보다 앞서는 조건이 되는 사례가 늘고 있다. 전력회사와 지방정부가 AI 인프라 확장 속도를 사실상 조율하는 위치에 서게 된 것이다.

이 그림에서 CXL의 위치는 미묘하다. 메모리 병목을 줄여 같은 연산을 더 적은 전력으로 처리하게 만드는 기술은, 발전소를 새로 짓는 것보다 빠르게 실행할 수 있는 몇 안 되는 해법이다. 반도체 설계의 문제가 국가 전력 계획의 변수로 연결되는 지점이 바로 여기다. 마이크로소프트가 전기 부족을 처음 언급했을 때, 그 말은 GPU 회사의 문제가 아니라 전력망 운영자의 문제로 번지고 있었다.

메모리 벽의 저편

서른 해 전에 이름 붙여진 문제가 있었다. 메모리 벽. 그 벽을 넘으려는 시도는 계속 있었다. 더 빠른 DRAM을 만들고, 더 많은 채널을 연결하고, 더 고밀도로 칩을 쌓았다. 벽은 사라지지 않았다.

아키텍처 자체가 그 벽을 만들고 있었기 때문이다.

CXL은 아키텍처를 바꾸는 시도다. 메모리와 프로세서의 경계를 허물고, 읽기와 쓰기가 동시에 흐르는 물리 선로를 만들고, 고정된 노드에 묶여 방치되던 메모리를 공유 자원으로 바꾼다.

이 변화가 완성되었을 때 오는 것은 더 빠른 AI가 아니다. 더 적은 전기로 더 많은 AI를 쓸 수 있는 세상이다.

지금 AI 인프라 확장의 진짜 장벽이 부지가 아니라 전력망이라면, 그리고 그 전력 낭비의 상당 부분이 데이터가 기다리는 시간에서 온다면, CXL이 푸는 문제는 기술 문제가 아니라 에너지 문제다.

데이터를 더 효율적으로 옮길 수 있다면 AI를 더 적은 비용으로 더 많은 사람에게 줄 수 있다. 지금 당신이 쓰는 AI 서비스의 응답 속도와 구독료 일부는, 이 메모리 버스의 방향 전환 패널티에서 새어나온다.

A single empty server rack corridor
A single empty server rack corridor

서른 해 동안 업계는 더 강한 프로세서를 향해 달려왔다. 벽은 매번 다른 곳에서 나타났다.

다음 벽은 어디에 있을까. 그리고 그 벽을 알아채는 데 우리는 또 얼마나 걸릴까.


참고자료
  1. CXL Consortium Technical Working Group. CXL 2.0 및 3.0 사양 표준 백서. Compute Express Link 공식 기술 문서 저장소. 2022–2024.
  2. 카이스트(KAIST) 차세대 메모리 시스템 공동 연구소. 차세대 고대역폭 컴퓨팅을 위한 메모리 계층 및 CXL 인터커넥트 성능 분석. 대한민국 학술원 전자공학 회보. 2023.
  3. 삼성전자 메모리사업부 신사업전략팀. CMM-D 제품군 기술 로드맵 및 데이터센터 메모리 병목 극복 가치 평가. Samsung Semiconductor 기술 백서 시리즈. 2022–2024.
  4. ZeroPoint Technologies; Rambus 공동 분석 연구진. CXL 메모리 풀링 환경에서의 총소유비용(TCO) 및 전력 효율 모델 분석. IEEE Computer Architecture Letters. 2024.
  5. 노근창 외. 한국 시스템 반도체 기업들의 이기종 컴퓨팅 패러다임 선점 분석 보고서. 현대차증권 산업 분석 리포트. 2024–2025.
  6. SK하이닉스 솔루션개발 센터 소프트웨어 연구소. HMSDK 및 헤테로지니어스 아키텍처를 위한 오픈소스 제어 스택 기술 동향. SK Hynix 기술 세미나 발표 자료. 2026.
  7. Wulf, Wm. A.; McKee, Sally A. Hitting the Memory Wall: Implications of the Obvious. ACM SIGARCH Computer Architecture News. 1995.
  8. NVIDIA Corporation. Vera CPU Architecture Overview and CXL Integration Roadmap. NVIDIA GTC Technical Proceedings. 2025.
  9. Intel Corporation. 5th Gen Intel Xeon Processor Platform: CXL 2.0 Implementation Guide. Intel Developer Zone Technical Documentation. 2024.
  10. AMD Corporation. EPYC Turin Architecture: Memory Subsystem and CXL Controller Design. AMD Developer Resources. 2024.
  11. Google Infrastructure. Hyperscale Memory Disaggregation with CXL: Early Deployment Data from Production Workloads. Google Research Technical Report. 2025.
  12. Rambus Inc. PCIe 6.0 Physical Layer Controller for CXL 3.1: Performance and Power Characterization. Rambus Product Technical Documentation. 2024.
  13. 파네시아(Panmnesia). PCIe 6.4-CXL 3.2 Fusion Switch: Low-Latency Composable Memory Architecture. CES 2025 Innovation Award Technical Submission. 2025.
  14. 메티스엑스(MetisX). Computational Memory Architecture on CXL 3.0: Near-Memory Processing for AI Vector Workloads. Hot Chips Symposium Proceedings. 2025.
  15. 네오셈(Neosem). CXL 2.0 Module Burn-in Test Solution: Field Validation Report for Next-Generation Memory Qualification. 반도체 장비 기술 협의회 발표 자료. 2024.
#cxl-architecture#memory-wall#ai-datacenter-power#ddr5-bandwidth-limit#memory-pooling-tco#samsung-cmm-d#panmnesia-cxl-switch#metisx-computational-memory#neosem-cxl-test-equipment#korean-semiconductor-value-chain

Recommended for You

스페이스X를 이해하는 6개의 조각 — 로켓, 물, 땅, 그리고 돈

스페이스X를 이해하는 6개의 조각 — 로켓, 물, 땅, 그리고 돈

3 min read --
사이버캡 해외 진출, 운전대 없는 차가 넘어야 할 벽

사이버캡 해외 진출, 운전대 없는 차가 넘어야 할 벽

6 min read --
로켓엔진 혼합비, 왜 산소를 최대로 안 넣을까

로켓엔진 혼합비, 왜 산소를 최대로 안 넣을까

7 min read --
스페이스X가 텍사스에 2억 2천만 달러 쏘는 이유

스페이스X가 텍사스에 2억 2천만 달러 쏘는 이유

6 min read --
로켓은 왜 산소로 가득 차 있을까 — 액체산소의 정체

로켓은 왜 산소로 가득 차 있을까 — 액체산소의 정체

5 min read --
탄산음료 이산화탄소, 트림 못하면 어디로 갈까

탄산음료 이산화탄소, 트림 못하면 어디로 갈까

4 min read --

Advertisement

댓글