Software Engineering Empirical Research Radar

AI-Native SE Catch-up Tutorial

从 testing、fault localization、TCP、diagnosis、repair 和产业实践重新进入 first-tier 软件工程研究。

用途。 这份教程写给已经懂软件测试、fault localization、CI 或软件质量,但需要重新追上 AI-for-SE 节奏的研究者。

主判断。 最适合重启的不是泛泛的代码生成,而是面向持续演化软件系统的 AI-native testing、diagnosis 和 repair。

最适合先开始的方向

LLM 修复中的诊断建议

研究 patch-free 的诊断证据,是否能让同一个 LLM 比 vanilla 和 Ochiai-guided baseline 修得更准、更快、更少 overfit。

Agentic repair 中的测试预算调度

把 TCP 升级到 AI repair loop:每个候选补丁之后,agent 应该优先跑哪些测试?

运行时证据压缩

把 trace、值变化、失败/通过行为差异和 statement neighborhood 压缩成人和模型都能读的 diagnostic card。

AI-native CI 失败诊断

把 build log、test history、change diff、trace 和开发者动作连成可靠的持续演化软件诊断流程。

四周 Catch-up 路线

第 0 周

先重建领域地图

不要先死读论文,先恢复对当前软工 field shape 的感知。

第 1 周

恢复测试与诊断直觉

把已有的 FL/TCP 能力翻译成 AI-for-SE 时代的问题。

第 2 周

理解现代 LLM repair

在提出新方法之前,先看懂当前 repair pipeline。

第 3 周

学习 benchmark 与评价陷阱

repair/testing paper 的可信度主要取决于评价协议。

第 4 周

设计第一篇 paper sprint

把 catch-up 变成一个范围可控、能投稿的实验。

值得看的 Scholar Signals

学者 / 方向线信号应该学什么
Yang Liusecurity、testing、analysis、AI 和 systems-facing SE 等多线高产。高产通常来自可复用的 benchmark/tool pipeline,而不是单个点子。
Hongyu Zhangempirical SE、reliability、AI/software analytics、performance 和产业问题。长期研究程序可以跨主题移动,但保持稳定的软件质量/经验研究视角。
Xin Xia / David Lofault localization、MSR、software analytics、developer support。谨慎的 empirical framing 能把工具想法变成更宽的软件工程 claim。
Lingming Zhangtesting、patch validation、fault localization、program analysis。强基础设施能连续支撑多篇 testing/repair 论文。

阅读队列

怎么读论文

方法

Pipeline-first reading

每读一篇论文,先写下它的输入、oracle 假设、模型/工具动作、validation budget、benchmark universe 和失败案例,再判断结果是否真的强。

发表指南

Venue 类型通常适合什么风险
ICSE / FSE / ASE / ISSTA强方法、强 benchmark、仔细 baseline、清晰 threat model。弱 baseline 或不公平比较会很快暴露。
SANER / ICSMEanalysis、evolution、reengineering、repair、diagnosis、maintenance workflow。仍然需要一个清楚的技术或经验贡献。
ICST / ISSREtesting、validation、reliability、flakiness、cost-effective test execution。只有 AI 包装不够,testing insight 必须是中心。
Workshop / ERA / Short快速信号、新 protocol、负结果、新兴 agentic workflow。不要把 pilot-scale evidence 夸大成 full result。