技术笔记 12
- 如何识别 LLM 推理文本异常:它选择不看文本,只看概率
- 只测 3% 的题,就能还原模型评测结论?——评测集压缩的几种玩法
- AI的肖申克救赎:OpenAI模型自主越狱攻破HuggingFace,GLM临危救场
- 从 LLM-as-a-Judge 到 Agent-as-a-Judge:AI 自动化评测的范式演进与破局
- 从SWE家族看CodeAgent评测发展路径和方向
- 大模型评测进入 Agent 时代:AA-AgentPerf 如何重新定义硬件性能评测
- WorldScore:统一世界模型评测基准
- LLM-as-a-Judge 不是银弹:拆解 IBM CLEAR 如何给 AI Agent 做全身体检
- Langfuse:给你的 Agent 装上行车记录仪
- EvalScope的Agent评测系统
- Agent 评测:从测模型到测系统的范式跃迁
- Agent‐Evaluation‐Harness 系统化的评估基础设施