9月3日
12:18
12:18官方账号arXiv cs.AI@Hao Zhou, Mandar Kulkarni, Hao Chen, Yan Xin, Charlie, Zhang
精选73°
该研究提出了一种针对电信网络根因分析的结构化推理框架,在TeleLogs和TelecomTS两个5G数据集上测试。该框架将异构网络遥测数据组织为规范上下文,强制执行决策路径推理,并生成基于证据的解释。实验结果表明,与基线技术相比,该框架能持续提高诊断准确性和决策一致性。
推荐理由:电信专家团队用LLM解决5G/6G网络故障诊断,通过结构化推理减少幻觉,比传统方法更准更可靠。
12:13
8月8日
7月31日
12:51
12:51官方账号arXiv cs.AI@Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
ORCA-bench用一套运行六天的OpenTelemetry微服务系统,通过Prometheus、Jaeger和OpenSearch/Grafana接口暴露指标、日志和链路,共构造1079个值班根因分析任务。五个前沿智能体在Medium难度任务上最佳RCA准确率仅25.3%,Hard难度为10.0%。最弱模型在40%的故障报告中给出不合理根因;去掉源代码访问后所有指标下降。专家SRE对真值症状做了复核,LLM评判与人类评分加权kappa为0.90。
推荐理由:想看看编程Agent在真实值班场景有多靠谱?ORCA-bench给了1079个线上故障任务,最强模型也只答对四分之一。
6月26日
11:34
11:34官方账号arXiv cs.AI@Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He
OpenRCA 2.0 引入了 PAVE 协议,通过故障注入重建因果传播路径,标注了 500 个跨系统实例的步骤级因果链。在 11 个前沿 LLM 上测试,完全恢复根因集的成功率平均仅 20.7%。放宽条件后发现,模型在 76.0% 的案例中能识别至少一个正确根因服务,但只有 61.5% 能将服务与观察到的症状通过验证的因果路径关联起来。该基准揭露了仅靠结果标签评估时隐藏的未接地诊断失败模式。
推荐理由:这篇论文搞了个新基准 OpenRCA 2.0,用 PAVE 协议给每一步因果关系打标签,发现 LLM 猜对根因容易,但连对因果路径很难——这比只看结果靠谱多了。