Internetware 2026
Sat 18 - Mon 20 July 2026 Gold Coast, Australia

While code summaries are critical for software comprehension and maintenance, evaluating the quality of automatically generated summaries remains a significant challenge. Conventional metrics rely heavily on rigid lexical or semantic similarities. Conversely, emerging LLM-as-a-judge methods improve flexibility but often exhibit systematic stylistic biases and fail to reflect developers’ practical needs. To address this, we propose MultiDRECS, a multi-dimensional, requirement-aligned framework for automated code summarization evaluation. By employing a collaborative multi-agent architecture, MultiDRECS successfully mitigates the redundancy biases typical of single-LLM judges. Within this design, it performs statement-level scoring across three developer-centric criteria—\emph{adequacy}, \emph{conciseness}, and \emph{faithfulness}—integrated with an information value ranking mechanism that assigns priority-based weights to different summary types. Consequently, MultiDRECS achieves strong agreement with human judgments while requiring only lightweight backbone models. To rigorously validate such evaluation capabilities, we further introduce DiscrimEval, a novel benchmark comprising real-world methods with rich contexts and systematically synthesized variants (\emph{stylistic} and \emph{error-injected}) designed to stress-test metric discriminability. Experiments on DiscrimEval using Qwen2.5-Coder-7B-Instruct demonstrate that MultiDRECS outperforms traditional metrics and larger LLM judges (e.g., Qwen-Plus and DeepSeek-R1) in evaluation accuracy. Crucially, it achieves this at a lower deployment cost and facilitates practical adoption in automated software engineering workflows.

Sun 19 Jul

Displayed time zone: Brisbane change

11:40 - 12:45
Session 7: AI for Code Understanding and Developer SupportTool Demonstration / Research Track / New Idea at Ballroom
Chair(s): Xinyu Gao Nanjing University
11:40
15m
Talk
MultiDRECS: A Multi-Dimensional Requirement-Aligned Automated Evaluation Framework for Code Summarization
Research Track
xianwei wu Nanjing University, Haifeng Shen Southern Cross University, Guoping Rong Nanjing University
File Attached
11:55
15m
Talk
Benchmarking Large Language Model Benchmarks: Standardized Scores vs. Perceived Utility
Research Track
Lecheng Wang Peking University, Xin Yan Peking University, Yihong Dong Peking University, Ruohan Xu Peking University, Yiyang Liu Peking University, Huanyu Liu , Hao Zhu Peking University, Fang Zheng Peking University, Ge Li Peking University, Wenpin Jiao Peking University
12:10
10m
Talk
iReDev: An Interactive Human-Agent Collaborative Platform for Requirements Development
Tool Demonstration
Dongming Jin Peking University, China, Zhi Jin Peking University, Wuhan University, Yaotian Yang Beijing Forestry University, Jia Li Wuhan University, Xiaohong Chen East China Normal University
12:20
10m
Talk
Developing Software Accessibility Features and Enhancing Developer Knowledge Through a Self-Healing Agentic Framework
New Idea
Ciaron Fitzpatrick Queen's University Belfast, Thai Son Mai Queen's University Belfast, Javid Taheri Queen's University Belfast, Zheng Li Queen's University Belfast, UK
12:30
15m
Talk
CodeCoR: Enhancing LLM Code Generation via Self-Reflective Multi-Agent Collaboration
Research Track
Ruwei Pan Chongqing University, Hongyu Zhang Chongqing University, Chao Liu Chongqing University