10월 2일에 NVIDIA가 책상 위 컴퓨터를 하나 내놨습니다. DGX Spark 64GB. 10월 23일부터 Acer·ASUS·Dell·Gigabyte·HP·MSI를 통해 $4,999부터 팔립니다.

스펙은 이렇습니다. GB10 Grace Blackwell 칩, 64GB 통합 메모리, 한 대에서 최대 100B 파라미터 모델. 두 대를 ConnectX-7로 묶으면 128GB를 공유하며 최대 200B까지 봅니다. NVIDIA 테스트에서 Qwen 3.8 27B 기준 2-node가 최대 1.7배 성능을 냈습니다.

그런데 이 글은 스펙 자랑이 목적이 아닙니다. 질문이 바뀌었기 때문입니다. "작은 모델을 로컬에서 돌릴 수 있나"에서 "private agent를 항상 켜두는 게 클라우드보다 경제적인가"로.

뭐가 들어있나: 사양보다 생태계

항목 내용
칩·메모리 GB10 Grace Blackwell, 64GB 통합 메모리
모델 규모 단독 최대 100B, 2대 연결 시 최대 200B
확장 ConnectX-7 연결 + Sync Cluster Assistant 자동 구성
OS·도구 DGX OS, Ollama·vLLM·llama.cpp·LM Studio, Agent Toolkit
가격·일정 $4,999부터, 10월 23일 출시

중요한 건 박스가 아니라 기본값입니다. Ollama·vLLM·PyTorch가 그냥 돌고, NVIDIA가 사용 예로 "24시간 coding·research agent 실행"을 직접 듭니다. 로컬 AI의 용도가 "가끔 돌려보는 취미"에서 "항상 켜두는 집사"로 바뀌고 있다는 선언에 가깝습니다.

참고로 배경에 RAM 쇼티지 이야기도 있습니다. 128GB 모델이 $6,950까지 올랐다는 10월 3일 보도도 있으니, 가격은 출시 시점에 한 번 더 확인하세요. 이 글의 계산법은 가격 숫자가 바뀌어도 그대로 씁니다.

경제학: 켜두는 게 싼가를 계산해보기

구매 전에 계산할 식은 하나입니다.

월 클라우드 GPU 비용 × 실제 사용 시간
  vs
기기값 ÷ 사용 개월 수 + 전기 + 관리 시간
  × privacy 요구 × 항상 켜둘 agent 수

감이 오게 예시를 들어봅니다. (숫자는 예시, 자기 숫자로 바꿔 계산하세요.)

예시 A: 하루 2시간 쓰는 개인
- 클라우드: 시간당 과금 × 60시간이 월 수십 달러 수준
- 로컬: $4,999 ÷ 36개월 ≈ 월 $139 + 전기
→ 가볍게 쓰면 클라우드가 싸다

예시 B: 24시간 agent 3개를 돌리는 팀
- 클라우드: 상시 인스턴스 × 3 + 트래픽, 월 수백~수천 달러
- 로컬: 2-node 묶어도 월 할부 개념으로 수백 달러 + 데이터가 밖에 안 나감
→ 켜둘수록, 민감할수록 로컬이 유리해진다

여기에 privacy가 곱해집니다. 코드·문서가 외부로 안 나간다는 값은 계산서에 잘 안 잡히지만, 계약서 한 줄로 수천 달러가 오갑니다. 보안 글의 격리 이야기가 하드웨어로 내려온 셈입니다.

오픈 모델과 만나면: 점수표가 아니라 내 작업으로

로컬에서 돌릴 모델은 오픈웨이트입니다. 고르는 법은 오픈웨이트 글에서 다뤘습니다. Intelligence 46점대 MiMo, 45점 GLM-5.3, 44점 Kimi K3 같은 모델들이 후보입니다.

그리고 측정은 노트북도 대상이 됐습니다. 9월 29일 나온 AA-AgentPerf-Local이 DGX Spark·Ryzen AI Halo·MacBook Pro(M5 Pro)·RTX 5090에서 오픈 모델 4종의 에이전트 실행 속도를 잽니다. "내 기계에서 agent가 몇 분에 일을 끝내는가"가 공식 벤치가 된 것입니다. 방법은 AIPerf 글의 p95·동시성 측정과 속도 글의 작업 완료 시간 개념을 그대로 쓰면 됩니다.

로컬 agent 합격선 (예시):
[ ] 내 대표 작업 5개가 밤새 3회 연속 성공하는가
[ ] 작업당 평균 시간이 다음 날 아침에 문제없는 수준인가
[ ] 소음·발열·전기가 감당되는가 (책상 위 서버의 현실)
[ ] 모델 업데이트·백업을 누가 하는가 (관리 주체 지정)

CodeBridge Mini Lab: 사기 전에 2주 재기

① 지금 클라우드에서 쓰는 agent 1개를 정한다
② 2주간 기록한다:
   - 실행 시간 (시간/일), 월 예상 비용
   - 외부 반출 금지 데이터 비율
   - 밤새 돌리고 싶은 작업 수
③ 판정:
   - 하루 8시간 이상 + 민감 데이터 30% 이상 → 로컬 검토
   - 가끔 + 민감 없음 → 클라우드 유지
   - 애매하면: 작은 로컬 (노트북·RTX)부터 시험

성공 1건당 비용 계산에 "켜둔 시간"을 곱한 것입니다. 기기값은 한 번, 클라우드는 매달 나갑니다. 사용 패턴이 답을 정합니다.

결론: 서버를 살지가 아니라 시간을 재는 게 먼저다

정리하면 순서가 이렇습니다.

사용 시간 재기 → 민감도 매기기 → 항상 켜둘 agent 수 세기 → 그다음 가격표 보기

DGX Spark 64GB의 의미는 "100B를 책상에"가 아니라 "24시간 agent를 집에"입니다. 질문이 바뀐 만큼 답도 바뀝니다. 살지 말지가 아니라, 얼마나 켜둘지가 먼저입니다. 2주 로그가 그 답을 줍니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

로컬이든 클라우드든 에이전트를 밤새 믿고 돌리려면 검증 루프와 권한 설계가 먼저입니다. Claude Code로 실제 프로젝트에 하네스를 쌓는 과정이 이 글의 24시간 agent 이야기와 바로 이어집니다.