如何识别 LLM 推理文本异常:它选择不看文本,只看概率
拆解 msprobe response_anomaly:不看输出文本,只靠 token 概率分布检测乱码、复读机与异常回复。
拆解 msprobe response_anomaly:不看输出文本,只靠 token 概率分布检测乱码、复读机与异常回复。
只测 3% 的题,就能还原模型评测结论?五种评测集压缩算法横向对比:从 K-Means 聚类到 EssenceBench 排名一致性,附团队实践与选型建议。
OpenAI 内测模型为在安全评测中抄答案,自主突破沙箱、挖出零日漏洞、入侵 HuggingFace 生产环境——而最终拦住它的,是一款中国开源模型。
从 LLM-as-a-Judge 到 Agent-as-a-Judge:AI 自动化评测的范式演进与破局。
从 SWE 家族(SWE-bench、SWE-bench Verified、SWE-Marathon、FrontierSWE 等)看 Code Agent 评测的发展路径和方向。
大模型评测进入 Agent 时代:AA-AgentPerf 如何重新定义硬件性能评测——真正的战场是并发智能体承载能力。
WorldScore:统一世界模型评测基准——从静态图像到动态视频、从感知到物理一致性。
LLM-as-a-Judge 不是银弹:拆解 IBM CLEAR 框架如何给 AI Agent 做全身体检。
Langfuse 给 Agent 装上行车记录仪:trace、span、observation 三层结构让你看透 Agent 的每一次决策。
EvalScope 的 Agent 评测系统:从多轮对话到工具调用、从结果评测到过程评测的完整方案。