Benchmark tests AI coding agents against malicious requests
New paper IssueTrojanBench benchmarks LLM-powered AI coding agents against malicious issue requests in real-world software development scenarios. Research evaluates agent vulnerability to manipulation through crafted problem statements and code requests.