<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Ai-Evaluation on CuraSec</title><link>https://curasec.metacog.co.kr/tags/ai-evaluation/</link><description>Recent content in Ai-Evaluation on CuraSec</description><generator>Hugo</generator><language>en-us</language><lastBuildDate>Mon, 24 Aug 2026 13:10:29 +0000</lastBuildDate><atom:link href="https://curasec.metacog.co.kr/tags/ai-evaluation/index.xml" rel="self" type="application/rss+xml"/><item><title>Diagnostic Framework for Long-Horizon Security LLM Agent Failures</title><link>https://curasec.metacog.co.kr/insights/2026-08-24-beyond-end-to-end-success-diagnosing-failures-in-long-horizo/</link><pubDate>Mon, 24 Aug 2026 13:10:29 +0000</pubDate><guid>https://curasec.metacog.co.kr/insights/2026-08-24-beyond-end-to-end-success-diagnosing-failures-in-long-horizo/</guid><description>&lt;ul>
&lt;li>&lt;strong>Engineer — Learn:&lt;/strong> Academic research introducing checkpoint-based diagnostics for multi-step security AI agents; relevant if you are building or evaluating agentic security tooling, but no immediate change to running systems is required.&lt;/li>
&lt;li>&lt;strong>SOC/IR — Skip&lt;/strong>&lt;/li>
&lt;li>&lt;strong>Leader — Skip&lt;/strong>&lt;/li>
&lt;/ul></description></item></channel></rss>