SayCan 언어 행동 모델 분석: LLM과 로봇 어포던스의 결합 원리
구글 SayCan은 LLM의 의미 점수(say)와 로봇 어포던스(can)를 곱해 자연어 명령을 실행 가능한 스킬 시퀀스로 바꾼 Physical AI 출발점 연구예요.
구글 SayCan은 LLM의 의미 점수(say)와 로봇 어포던스(can)를 곱해 자연어 명령을 실행 가능한 스킬 시퀀스로 바꾼 Physical AI 출발점 연구예요.
VoxPoser는 LLM과 비전 언어 모델을 결합해 로봇의 3D 가치 지도(value map)를 즉석에서 합성하는 혁신적인 제어 프레임워크예요. 학습 없이도 새로운 명령을 수행하는 원리를 깊이 있게 살펴봐요.
Code as Policies는 LLM이 자연어 명령을 받아 즉석에서 로봇 제어 파이썬 코드를 생성하는 인터페이스예요. 작동 원리, 사례, 한계, 후속 VLA 흐름까지 한 번에 정리했어요.
Physical Intelligence가 공개한 Pi-Zero 정책 모델의 구조와 학습 방법, 그리고 로봇 파운데이션 모델 분야에 미치는 영향을 깊이 있게 분석해요. 데이터·아키텍처·평가 결과를 한눈에 정리합니다.
OpenVLA와 RT-2는 로봇 분야 비전-언어-행동(VLA) 정책 모델의 대표 주자예요. 두 모델의 구조, 학습 방식, 성능, 활용성을 한눈에 비교 정리해 드릴게요.
Action Chunking Transformer(ACT)의 동작 원리, CVAE 기반 트랜스포머 구조, 액션 청킹과 Temporal Ensembling, 학습 절차와 한계까지 ACT 모방학습 정책 모델을 깊이 분석해요.
BC-Z 모방학습 베이스라인은 멀티태스크 정책 학습과 제로샷 작업 일반화의 출발점입니다. 구조, 학습 방식, 한계, 후속 연구까지 한 번에 정리해요.
Behavior Cloning(행동 복제 학습)은 전문가의 시연 데이터를 직접 모방해 정책을 학습하는 가장 단순하면서도 강력한 모방학습 기법이에요. 원리, 한계, 최신 사례까지 살펴봐요.
Model Predictive Path Integral(MPPI)는 GPU 위에서 수천 개의 궤적을 동시에 시뮬레이션해 최적 제어를 찾는 샘플링 기반 알고리즘이에요. Physical AI 시대에 자율주행, 4족 로봇, 드론 제어의 핵심 도구로 자리 잡고 있죠.
모델 예측 제어(MPC)의 원리와 로봇 적용 방법을 한 번에 정리해요. 비선형 MPC, 실시간 최적화, 자율주행·드론·매니퓰레이터 사례까지 핵심을 짚어드려요.