▎ Fleet-evaluation harness for security-agent benchmarks (CyberGym-E2E, ExploitGym, ExploitBench), run in real disposable Daytona sandboxes per trial — with Modal-based KVM-capable sandboxes planned for kernel-exploit tasks. Measures agent capability and infra reliability, not simulated.
docker binaries modal fuzzing patch cve qemu-kvm net-snmp futex arvo otel msan libdwarf ubsan cybergym audit-loop libxml2-uaf exploit-gym asan-global-buffer-overflow aslr-entropy
-
Updated
Sep 23, 2026 - Python