AI 에이전트용 범용 샌드박스 'OpenSandbox' 오픈소스로 공개
코딩 에이전트, GUI 에이전트, 에이전트 평가, AI 코드 실행, RL 트레이닝 등 다양한 AI 에이전트 워크로드를 위한 통합 샌드박스 플랫폼 'OpenSandbox'가 GitHub에 Apache-2.0 라이선스로 공개됐다. 다중 언어 SDK와 통합 API, Docker·Kubernetes 런타임을 함께 제공해 그동안 목적별로 흩어져 있던 에이전트 실행 환경을 하나의 인터페이스로 묶으려는 시도로 보인다.
무엇이 바뀌었나
OpenSandbox는 AI 에이전트가 코드를 실행하거나 화면을 조작하고, 평가·강화학습 과정을 돌리는 데 필요한 격리 환경을 표준화된 API로 제공하는 오픈소스 플랫폼이다. GitHub 조직 opensandbox-group을 통해 공개됐으며 Apache-2.0 라이선스가 적용된다[1]. 대표 이미지인 opensandbox/code-interpreter는 v1.1.0 버전이 확인됐고, Python 3.10 이상을 요구하며 예제에서는 PYTHON_VERSION 3.11 환경변수로 3.11.14 버전이 실행되는 것이 나타난다[1]. 실행 환경은 osb CLI로 관리하며, 예제에서는 sandbox create 시 30분, code-interpreter 샌드박스에는 10분의 타임아웃 값이 각각 설정된 모습을 볼 수 있다[1].
지원 범위는 단일 기능에 그치지 않는다. Claude Code, Gemini CLI, OpenAI Codex CLI, OpenCode, Qwen Code, Kimi CLI 같은 코딩 에이전트 CLI부터 LangGraph, Google ADK 같은 에이전트 프레임워크, Chrome/Chromium과 Playwright, VNC, VS Code(code-server)를 활용한 GUI·브라우저 에이전트 환경까지 폭넓게 아우른다[1]. 격리 기술 계층에서는 gVisor, Kata Containers, Firecracker microVM 등 서로 다른 강도의 샌드박싱 방식을 선택적으로 쓸 수 있도록 설계된 점도 확인된다[1]. 이미지 배포는 Docker Hub, GitHub Container Registry, Alibaba Cloud Container Registry를 통해 이뤄지고 Cosign으로 서명이 적용되며, 패키지 네임스페이스에는 com.alibaba.opensandbox와 @alibaba-group이 쓰이고 있어 알리바바가 프로젝트에 관여하고 있음을 시사한다[1].
왜 중요한가
지금까지 AI 에이전트를 실행하는 샌드박스 환경은 코드 인터프리터, 브라우저 자동화, RL 트레이닝, 벤치마크 평가 등 목적별로 각각 다른 도구와 API를 써야 하는 경우가 많았다. OpenSandbox는 이런 서로 다른 워크로드를 하나의 SDK와 API로 묶고, 격리 강도도 gVisor부터 Firecracker microVM까지 상황에 맞게 고를 수 있게 한다[1]. Harbor, Cursor, OpenClaw Gateway 등 이미 존재하는 에이전트 생태계 도구들과의 연동도 함께 언급돼 있어, 신규 프로젝트라기보다는 기존 에이전트 인프라 사이의 빈틈을 메우려는 성격이 강하다[1]. 다만 프로젝트의 정확한 공개 시점이나 발표 배경은 확인되지 않은 상태라, 아직 초기 단계의 오픈소스 릴리스로 보는 편이 안전하다.
기업 실무 영향
AI 코딩 에이전트를 사내 도구로 도입 중인 개발팀이라면 Claude Code, Gemini CLI, Codex CLI 등 여러 CLI 도구를 동일한 샌드박스 API 위에서 굴려볼 수 있다는 점이 우선 눈에 띈다. 이는 Claude Code의 출력 스타일 기능처럼 개별 도구의 동작 방식을 조정하는 작업과는 별개로, 여러 에이전트 CLI를 한 인프라 위에서 운용해야 하는 팀에게 도구 간 파편화를 줄이는 선택지가 될 수 있다. 인프라·플랫폼 엔지니어링팀 입장에서는 Docker와 Kubernetes 런타임을 모두 지원한다는 점에서 기존 컨테이너 오케스트레이션 체계에 큰 변경 없이 도입을 검토해볼 여지가 있으며, gVisor·Kata Containers·Firecracker 같은 격리 기술 선택지가 이미 마련돼 있다는 점은 보안팀이 요구하는 격리 수준에 맞춰 구성을 조율하는 데 참고가 될 만하다. 이는 최근 NVIDIA가 제기한 에이전트 보안 통제 논의에서 강조된, 보안 통제를 하니스가 아니라 런타임·인프라 계층에 둬야 한다는 문제의식과도 맞닿아 있다.
또한 VS Code(code-server), VNC, Chrome/Chromium과 Playwright 지원을 통해 GUI 에이전트나 브라우저 자동화 워크로드를 시험하려는 팀에게도 참고할 만한 구성이며, OSWorld 벤치마크에서 성능이 빠르게 오르고 있는 컴퓨터 사용 에이전트 도입을 검토 중인 조직이라면 실행 환경 구축 비용을 줄이는 선택지로 살펴볼 수 있다. RL 트레이닝 워크로드까지 지원한다고 밝힌 점은 자체 에이전트를 강화학습으로 튜닝하려는 ML 엔지니어링팀에게도 의미가 있지만, 구체적인 트레이닝 파이프라인 연동 방식이나 성능 지표는 공개된 정보만으로는 확인되지 않는다.
확인이 필요한 부분
프로젝트의 정확한 출시일이나 발표 시점은 명시돼 있지 않으며, GitHub 리포지토리 콘텐츠만 확인된 상태다. 패키지 네임스페이스에 알리바바 계열 표기가 쓰이고 있지만, 이것이 알리바바의 공식 프로젝트인지 아니면 커뮤니티 기여자 소속에 따른 표기인지는 별도로 확인되지 않았다. 실무 도입을 검토한다면 프로덕션 환경에서의 안정성, 각 격리 기술별 성능 오버헤드, 그리고 실제 지원 CLI·프레임워크 목록이 문서화된 내용과 일치하는지를 직접 검증하는 절차가 필요하다.

