DeepYardDeepYard
I

IssueTrojanBench

Security benchmark testing AI coding agents against malicious issue requests and backdoors

Open SourceFree

About

Research benchmark suite evaluating AI coding agents' resilience to security threats including adversarial prompts, poisoned training data, backdoor triggers, and API misuse. Provides standardized tests for autonomous coding agents that process GitHub issues and pull requests. Essential for developers building or deploying coding agents in production environments where malicious inputs are a real risk.

Details

Type
Integrations
Language

Tags

evaluationcoding-agentautonomousopen-sourceframework