ICSE 2026
Sun 12 - Sat 18 April 2026 Rio de Janeiro, Brazil
Fri 17 Apr 2026 16:45 - 17:00 at Oceania VII - Software Engineering for AI 8 Chair(s): Sheila Reinehr

As large language models (LLMs) are increasingly integrated into intelligent software systems that range from educational assistants to legal advisory tools, ensuring their alignment with diverse cultural values becomes a critical software engineering challenge. Traditional software engineering methods such as unit testing and formal verification fall short in specifying or validating complex normative expectations such as fairness, cultural sensitivity, and moral appropriateness. Addressing this gap, we introduce VADA, a value-aware development and evaluation framework for systematically testing and benchmarking LLMs under multiple cultural value systems. VADA incorporates a modular scenario-question generation pipeline that constructs culturally grounded test cases spanning 25 value dimensions across Chinese, European, and Islamic ethical frameworks. It further includes a Bayesian ensemble evaluation framework that aggregates alignment judgments from multiple diverse LLM-based evaluators, assigning dimension-specific trust weights based on their observed reliability. We also develop a lightweight supervised evaluator fine-tuned on VADA-generated data, providing a scalable and deployable alternative to multi-model ensemble evaluation. We construct a large-scale benchmark containing 11,865 automatically annotated cases, along with a human-labeled subset of 1000 instances for validation and evaluation.

Empirical results demonstrate that VADA substantially outperforms existing prompting-based evaluators, achieving over 93.6 percent accuracy and high agreement with human annotations. Ablation studies confirm the complementary benefits of evaluator diversity and reliability-aware aggregation. Furthermore, VADA enables comparative audits of state-of-the-art LLMs, uncovering alignment inconsistencies across cultural dimensions. Results highlight VADA’s effectiveness as a foundation for robust value-aware evaluation and development of LLMs.

Fri 17 Apr

Displayed time zone: Brasilia, Distrito Federal, Brazil change

16:00 - 17:30
Software Engineering for AI 8Research Track / New Ideas and Emerging Results (NIER) at Oceania VII
Chair(s): Sheila Reinehr Pontifícia Universidade Católica do Paraná (PUCPR)
16:00
15m
Talk
TaskEval: Synthesised Evaluation for Foundation-Model Tasks
New Ideas and Emerging Results (NIER)
Dilani Widanapathiranage Applied Artificial Intelligence Initiative, Deakin University, Scott Barnett Applied Artificial Intelligence Initiative, Deakin University, Stefanus Kurniawan Deakin University, Wannita Takerngsaksiri Applied Artificial Intelligence Initiative, Deakin University
16:15
15m
Talk
SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments
Research Track
Syed Yusuf Ahmed Purdue University, Shiwei Feng Purdue University, Chanwoo Bae Purdue University, Calix Barrus University of Texas at San Antonio, Xiangyu Zhang Purdue University
16:30
15m
Talk
Revisiting "Revisiting Neuron Coverage for DNN Testing: A Layer-Wise and Distribution-Aware Criterion": A Critical Review and Implications on DNN Coverage Testing
Research Track
Jinhan Kim Università della Svizzera italiana, Nargiz Humbatova Università della Svizzera italiana, Gunel Jahangirova King's College London, Shin Yoo KAIST, Paolo Tonella USI Lugano
Pre-print
16:45
15m
Talk
VADA: A Multicultural Benchmark for Value-Aware Data Generation and Alignment Evaluation in LLMs
Research Track
Zhenlun Zhang Nanjing University, Yang Feng Nanjing University, Shihao Weng Nanjing University, Yining Yin Nanjing University, Jincheng Li Nanjing University, Jia Liu Nanjing University
17:00
15m
Talk
Evaluating the effectiveness of LLM-based interoperability
Research Track
Rodrigo Falcão Fraunhofer IESE, Stefan Schweitzer Fraunhofer Institute for Experimental Software Engineering, Julien Siebert Fraunhofer IESE, Emily Calvet Fraunhofer Institute for Experimental Software Engineering, Frank Elberzhager Fraunhofer Institute for Experimental Software Engineering
17:15
15m
Talk
Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving
Research Track
Xinyi Zheng Huazhong University of Science and Technology, Ningke Li National University of Singapore, Xiaokun Luan Peking University, Kailong Wang Huazhong University of Science and Technology, Ling Shi Nanyang Technological University, Meng Sun Peking University, Haoyu Wang Huazhong University of Science and Technology