spacetime terminal benchmark
a benchmark for evaluating ai agents on interactive terminal tasks

spacetime evaluates ai agents inside isolated docker containers on real terminal challenges like fixing broken nginx servers, resolving git conflicts, parsing logs, and repairing port clashes. solutions are tested against strict test assertions to verify what actually works.

$ curl -fsSL https://spacetime.trydecember.com | bash
harness lifecycle
01spin fresh, isolated docker sandbox per task
02spawn agent cli & stream interactive bash session
03run automated test.sh ground-truth validation
04calculate pass rates, latency & telemetry
05purge container & export evaluation scorecard
leaderboard top 10 • 20 tasks • pass@1
# model pass solved time