
Reflection AI가 현지시각 10월 5일 오픈웨이트 모델 Beam을 공개했습니다. 정확히 쓰면 공개하겠다고 발표했습니다. 가중치는 아직 나오지 않았고, 기술 보고서와 모델 카드, 개발자용 아티팩트까지 묶어 이달 중에 Apache 2.0으로 풀겠다고 했어요. 그러니까 이번에 세상에 나온 것은 모델이 아니라 모델에 대한 수치입니다.
회사부터 보겠습니다. Reflection AI는 2024년에 생긴 브루클린의 연구소이고, 공동 창업자 두 사람 모두 구글 딥마인드 출신입니다. CEO 미샤 라스킨(Misha Laskin)은 딥마인드에서 Gemini의 보상 모델링을 맡았고, CTO 이오아니스 안토노글루(Ioannis Antonoglou)는 AlphaGo와 AlphaZero를 함께 만든 뒤 Gemini의 인간 피드백 기반 강화학습을 이끌었습니다. 지금까지 모은 돈이 약 47억 달러, 2026년 4월 기준 기업가치는 프리머니 250억 달러입니다. 투자자 명단에 엔비디아와 세쿼이아, 라이트스피드가 들어 있고요.
모델 자체의 생김새는 이렇습니다. 희소 전문가 혼합(sparse Mixture-of-Experts) 구조로 총 5,010억 개 파라미터를 갖되 토큰마다 실제로 켜지는 것은 230억 개입니다. 레이어는 52층이고 국소 어텐션과 전역 어텐션을 번갈아 배치했어요. 컨텍스트는 네이티브 256K, 중간 학습 단계를 거쳐 유효 100만 토큰까지 늘렸다고 합니다. 사전학습에 쓴 토큰은 23조 8천억 개인데, 원시 인터넷 토큰의 약 95%를 걸러 내고 통상적인 필터였다면 버렸을 1조 8천억 토큰을 되살렸다는 설명이 붙어 있습니다. 학습에는 엔비디아 GB300 NVL72 6,144장을 썼고, 강화학습에는 GB300 1만 500장을 4주 미만 돌려 1억 회가 넘는 롤아웃을 만들었습니다. 채점과 학습에 동원된 샌드박스가 누적 13억 개, 피크에는 17만 개가 동시에 떠 있었다고 하고요. 텍스트 전용입니다. 멀티모달이 아니라는 뜻이에요.
여기까지는 발표문을 옮긴 것이고, 제가 글을 쓰기 시작한 이유는 그다음에 나오는 한 문장 때문입니다.
▸ 회사가 쓴 문장과 헤드라인이 쓴 문장이 다릅니다
외신 제목들은 대체로 "중국 모델에 맞서는 미국의 오픈 모델"이라는 틀로 이 발표를 전했습니다. 그런데 Reflection이 공식 블로그에 적어 둔 문장은 그보다 좁습니다. "고급 추론 벤치마크에서 GLM-5.2에 비견할 만한 점수를 3~4배 적은 추론 연산으로 달성한다." 비교 대상이 GLM-5.2라고 명시돼 있어요.
표를 끝까지 보면 왜 그렇게 적었는지가 보입니다. 에이전트형 터미널 작업을 재는 Terminal Bench v2.1에서 Beam은 80.1점입니다. 같은 행의 서방 오픈웨이트 모델들은 Thinking Machines Lab의 Inkling이 63.8점, 엔비디아의 Nemotron 3 Ultra가 56.4점이니 격차가 큽니다. GLM-5.2는 81.0점으로 사실상 호각이고요. 그런데 같은 행에 GLM-5.3이 88.2점, Kimi K3가 88.3점, Qwen 3.8 Max가 86.6점, DeepSeek V4.1 Flash가 90.6점으로 함께 적혀 있습니다. SWE Bench Pro v1에서는 Beam 65.5점이 GLM-5.2의 62.1점을 앞서지만 Qwen 3.8 Max의 67.7점에는 못 미치고, 난도를 올린 v2-Hard에서는 Beam이 77.2점인데 GLM-5.3은 84.3점, Kimi K3는 88.2점입니다.
그래서 이 발표를 "미국이 중국을 따라잡았다"로 요약하는 것은 정확하지 않습니다. 더 정확한 표현은, 서방 진영의 오픈웨이트 최고 기록이 꽤 큰 폭으로 갱신됐고 중국의 직전 세대와 어깨를 나란히 했다는 쪽입니다. 현행 중국 프런티어와의 거리는 아직 남아 있어요. 한 가지 분명히 해 둘 것은, 이 사실을 숨긴 쪽이 Reflection은 아니라는 점입니다. 자기가 지는 행까지 같은 표에 넣어 공개했고 비교 기준도 GLM-5.2라고 써 두었습니다. 압축이 일어난 자리는 발표문이 아니라 제목이었습니다.
▸ 3~4배를 계산할 때 빼놓은 세 가지
엔지니어에게 더 중요한 숫자는 점수가 아니라 비용 쪽입니다. 3~4배 적은 추론 연산이 사실이라면 같은 품질을 3분의 1에서 4분의 1 수준의 연산으로 서빙한다는 뜻이니까요. 총 5,010억 중 230억만 켜는 구조라면 방향 자체는 그럴듯합니다.
그런데 Reflection은 이 추정치를 어떻게 냈는지도 같이 적어 두었는데요. 계산에서 제외한 항목이 셋입니다. 프롬프트 프리필(prompt prefill), 컨텍스트 길이에 따라 달라지는 어텐션 연산, 그리고 서빙 오버헤드. 이 세 가지를 빼고 모델 자체의 연산량만 비교했다는 뜻입니다.
구조끼리 비교할 때 이렇게 셈하는 것은 부당한 방식이 아닙니다. 서빙 스택이 제각각인데 거기까지 넣으면 모델 비교가 아니라 인프라 비교가 되어 버리니까요. 다만 빠진 셋이 하필 긴 입력에서 청구서를 좌우하는 부분입니다. 프리필은 입력 토큰 수에 비례해 들고, 어텐션 비용은 컨텍스트가 길어질수록 가파르게 올라갑니다. 그리고 Beam이 간판으로 내건 사양이 네이티브 256K, 유효 100만 토큰짜리 컨텍스트예요. 긴 문서를 통째로 넣고 코드베이스를 통째로 읽히는 용도로 쓰라고 만든 모델인데, 그 모델의 효율을 말하는 숫자는 길이가 비용으로 환산되는 구간을 계산에서 덜어 낸 상태에서 나왔습니다. 한 매체는 이를 두고 모델 연산 비교이지 고객이 실제로 지불할 금액의 측정치는 아니라고 평했는데, 공정한 요약이라고 봅니다.
거짓이라는 이야기가 아닙니다. 다만 그 숫자가 답하는 질문과 도입을 검토하는 사람이 던지는 질문이 다르다는 것이죠. 더구나 가중치가 아직 나오지 않았으니 지금 시점에 이 수치를 독립적으로 재현해 본 곳은 없습니다. 외신들도 성능 주장이 독립 검증을 거치지 않았다는 단서를 달아 두었고요.
▸ 오픈웨이트가 여는 것과 열지 않는 것
용어를 한 번 짚고 가는 편이 좋겠습니다. 이번 발표에서 열리는 것은 가중치와 기술 보고서, 모델 카드, 개발자 아티팩트이고 라이선스는 Apache 2.0입니다. 받아서 돌리고, 파인튜닝하고, 상용 서비스에 얹을 수 있어요. 열리지 않는 것은 학습 데이터와 학습 코드입니다. 발표문은 웹과 라이선스를 구매한 독점 데이터셋이라고만 적었고 그 출처를 특정하지 않았습니다. 어떤 기준으로 95%를 걸러 냈는지도 상세히 공개되지는 않았고요. 그러니까 이 모델은 실행할 수 있지만 다시 만들 수는 없습니다. 오픈웨이트와 오픈소스가 같은 말이 아니라는, 이미 여러 번 반복된 구분이 여기서도 그대로 적용됩니다.
그러면 47억 달러를 모은 회사가 왜 결과물을 무료로 푸느냐는 질문이 남는데요. 답은 발표문 안에 있습니다. Reflection이 팔려는 물건은 모델이 아니라 AI 팩토리입니다. 기관이 자기 데이터로 자기 땅 위에서 모델을 돌리도록 구축하고 운영해 주는 사업이고, 대상은 기업과 공공, 그리고 국가입니다. 가중치가 공짜여야 이 사업이 성립해요. 자기 데이터를 밖으로 내보낼 수 없어서 외부 API를 못 쓰는 고객에게는 받아서 안에 두고 돌릴 수 있는 모델이 필요하고, 그 모델을 설치하고 운영하는 일이 상품이 되는 구조입니다. 엔비디아가 투자자 명단에 있는 것도, 2029년까지 스페이스X와 약 63억 달러, 네비우스와 10억 달러가 넘는 컴퓨트 계약을 미리 묶어 둔 것도 같은 그림 안에 있습니다. 합치면 73억 달러어치 연산을 선구매해 둔 셈인데, 가중치를 무료로 푸는 회사가 그만한 추론 역량을 확보해 두는 이유는 그 연산을 자기가 팔 것이기 때문이겠죠.
▸ 이 계약서에 한국 회사 이름이 적혀 있습니다
이 사업 모델의 첫 사례로 거론되는 곳이 한국입니다. 신세계그룹은 현지시각 3월 16일 샌프란시스코에서 Reflection AI와 한국 소버린 AI 팩토리 건립을 위한 양해각서를 맺었습니다. 전력 용량 250MW 규모로, 국내에 지어졌거나 지어질 예정인 AI 데이터센터 가운데 가장 큽니다. 역할은 Reflection이 칩과 모델, 풀스택 엔지니어링을 맡고 신세계가 부지와 전력, 인허가, 금융, 건축을 맡는 구도고요. 체결식에는 정용진 신세계그룹 회장과 라스킨뿐 아니라 하워드 러트닉 미국 상무부 장관이 참석해 지원 의사를 밝혔습니다. 미국 정부가 2025년에 시작한 AI 수출 프로그램을 통한 기술 협력의 첫 대표 사례로 꼽히기 때문입니다. 라스킨은 이 자리에서 "신세계와 함께 우리는 한국이 주체적으로 진화시켜 나갈 수 있는 AI 인프라를 창출할 것"이라고 했습니다.

서울 신세계백화점 본점. 신세계그룹이 Reflection AI와 맺은 250MW AI 팩토리 양해각서는 아직 건립 지역이 정해지지 않았습니다. 출처: Wikimedia Commons, Minseong Kim
다만 아직 양해각서 단계입니다. 양사는 연내에 조인트벤처를 세워 클라우드와 맞춤형 AI 솔루션을 제공하는 풀스택 AI 팩토리를 구축한다는 계획을 밝혔지만, 건립 지역과 투자 규모는 확정되지 않았다고 했어요. 해외 매체 일부가 10조 원대 사업비를 언급했는데 양측이 발표한 숫자는 아닙니다. 그러니 이번에 나온 Beam의 수치와 3월에 맺은 이 각서를 묶어 한국에 곧 무엇이 생긴다고 읽는 것은 성급합니다. 다만 묶어서 볼 이유는 분명히 있습니다. 그 팩토리 안에서 돌아갈 것으로 지목된 모델이 이번에 수치를 공개한 바로 그 모델이고, 추론 연산을 3~4배 아낀다는 주장은 250MW짜리 시설의 설계 전제를 바꾸는 종류의 주장이니까요. 전력 설비와 냉각, 랙 수량은 결국 초당 몇 토큰을 뽑느냐에서 역산되는 숫자들입니다.
그래서 이달 안에 가중치가 실제로 올라오면 확인할 것이 생깁니다. 기술 보고서가 3~4배의 산정 조건을 어디까지 열어 주는지, 모델 카드가 학습 데이터를 어느 수준까지 설명하는지, 그리고 제3자가 같은 벤치마크를 돌렸을 때 표의 숫자가 재현되는지. 앞의 둘은 Reflection이 정하는 몫이고, 마지막 하나는 공개 이후 며칠이면 커뮤니티가 답을 내놓을 겁니다. 그런데 정작 도입을 검토하는 쪽에 필요한 네 번째 항목은 아무도 대신 재어 주지 않습니다. 여러분이 실제로 쓰는 컨텍스트 길이와 동시 요청 수, 쓰는 서빙 스택에서 프리필과 어텐션과 오버헤드를 전부 포함해 뽑은 토큰당 비용이요. 벤더가 내놓은 비율이 아니라 그 절대값이 예산서에 들어가는 숫자입니다. 오픈웨이트 모델이 늘어날수록 고를 수 있는 선택지는 많아지겠죠. 그 선택지를 비교할 자를 우리 쪽에서 들고 있는지에 대해서는 고민이 필요합니다.
커버 이미지: 엔비디아 DGX GB200 NVL72 랙 — Wikimedia Commons, Pokiiri
전체 사이트에서 댓글·관련 글을 함께 보시려면
이야기 공장에서 보기 →