LLM은 틀린 답을 하면 다시 질문할 수 있습니다. 로봇은 틀린 판단을 하면 벽에 부딪힐 수 있습니다.
이 차이가 Physical AI, 또는 embodied AI를 이해할 때 가장 중요한 출발점입니다.
Mistral이 2026년 공개한 Robostral Navigate는 8B 규모의 모델로, 단일 RGB 카메라 영상과 자연어 지시를 받아 로봇이 공간을 이동하도록 설계됐습니다. LiDAR나 여러 카메라를 필수로 두는 접근과 달리 일반 카메라 한 대를 중심으로 내비게이션을 수행한다는 점을 강조합니다.
모델 크기보다 더 흥미로운 질문은 이것입니다.
언어 모델의 ‘다음 토큰’과 로봇의 ‘다음 행동’은 무엇이 다를까요?
현실에서는 출력이 곧 다음 입력을 바꿉니다
챗봇은 문장 하나를 생성해도 방 안의 상태가 바뀌지 않습니다.
로봇은 앞으로 50cm 움직이면 카메라에 보이는 장면이 달라집니다.
카메라 관찰
→ 행동 선택
→ 실제 이동
→ 새로운 카메라 관찰
→ 다음 행동 선택
즉 Physical AI는 본질적으로 **닫힌 루프(closed loop)**입니다.
한 번 전체 경로를 계산하고 끝내는 것이 아니라, 행동 결과를 계속 관찰하면서 계획을 수정해야 합니다.
CodeBridge 미니 실험: 지도 대신 ‘관찰 가능한 것’만 적어보기
로봇이 없더라도 다음 사고 실험을 해볼 수 있습니다.
집이나 사무실에서 한 위치를 정하고 다음 지시를 적습니다.
복도를 나가서 오른쪽으로 돌고, 두 번째 문 앞에서 멈춰라.
이제 전체 평면도를 아는 사람의 관점이 아니라 카메라 한 대만 가진 로봇의 관점에서 단계별로 적어보세요.
현재 화면에서 보이는 것:
확실한 것:
불확실한 것:
다음 1~2초 동안 안전하게 할 수 있는 행동:
행동 후 다시 확인해야 할 것:
해보면 “두 번째 문”이라는 표현도 생각보다 어렵다는 것을 알 수 있습니다.
- 첫 번째 문을 제대로 인식했는가?
- 문이 열린 상태면 같은 객체로 인식하는가?
- 사람이 가로막으면 어떻게 할까?
- 카메라 각도가 바뀌면 위치를 유지할 수 있을까?
Physical AI에서는 언어 이해와 시각 인식, 상태 추정, 행동 제어가 연결됩니다.
단일 RGB 카메라가 흥미로운 이유
LiDAR, depth camera, 여러 센서를 쓰면 더 풍부한 공간 정보를 얻을 수 있습니다. 반면 센서가 늘어나면 비용과 보정, 하드웨어 복잡도도 커집니다.
일반 RGB 카메라만으로 충분한 내비게이션을 수행할 수 있다면 더 많은 기기에 적용하기 쉬워질 수 있습니다.
하지만 ‘센서가 하나라서 간단하다’고만 보면 안 됩니다. 센서가 줄어든 만큼 모델이 이미지에서 거리, 방향, 장애물 의미를 더 많이 추론해야 할 수 있습니다.
로봇에서는 hallucination이라는 단어도 다르게 느껴집니다
텍스트에서 존재하지 않는 사실을 만들어내는 hallucination은 잘 알려진 문제입니다.
로봇에서는 다음과 같은 형태가 될 수 있습니다.
- 실제로 없는 통로가 있다고 판단
- 통과 가능한 공간을 장애물로 판단
- 사람의 움직임을 잘못 예측
- 현재 위치를 잃어버림
이런 오류는 단순한 답변 품질 문제가 아니라 안전과 연결됩니다.
그래서 embodied AI에서는 모델 정확도 외에도:
- 행동 속도 제한
- 충돌 감지
- 비상 정지
- 사람 우선 규칙
- 불확실할 때 정지
같은 시스템 레벨 안전장치가 중요합니다.
‘더 똑똑한 모델’만으로 해결되지 않는 이유
로봇은 현실의 지연과 노이즈를 피할 수 없습니다.
- 카메라 프레임이 늦게 온다.
- 바닥이 미끄럽다.
- 바퀴가 예상만큼 움직이지 않는다.
- 조명이 바뀐다.
- 사람이 갑자기 앞을 막는다.
따라서 계획을 잘 세우는 것과 실제 제어가 안정적인 것은 다른 문제입니다.
이 관점은 소프트웨어 에이전트에서도 유용합니다. 루프 엔지니어링과 그래프 엔지니어링이 중요한 이유도 결과를 관찰하고 다음 행동을 바꾸는 구조에 있습니다.
결론: Physical AI의 핵심은 ‘생각’과 ‘현실’을 계속 연결하는 것입니다
Robostral Navigate는 언어 모델 기술이 화면 속 텍스트를 넘어 물리적인 공간으로 확장되는 흐름을 보여줍니다.
하지만 로봇에서는 한 번의 좋은 추론보다 더 중요한 것이 있습니다.
행동하고, 관찰하고, 틀렸으면 바로 수정하는 루프.
AI가 현실 세계와 연결될수록 모델 자체뿐 아니라 센서, 제어, 안전장치, 검증 방법까지 함께 보는 시각이 필요합니다.