VADA: A Multicultural Benchmark for Value-Aware Data Generation and Alignment Evaluation in LLMs
As large language models (LLMs) are increasingly integrated into intelligent software systems that range from educational assistants to legal advisory tools, ensuring their alignment with diverse cultural values becomes a critical software engineering challenge. Traditional software engineering methods such as unit testing and formal verification fall short in specifying or validating complex normative expectations such as fairness, cultural sensitivity, and moral appropriateness. Addressing this gap, we introduce VADA, a value-aware development and evaluation framework for systematically testing and benchmarking LLMs under multiple cultural value systems. VADA incorporates a modular scenario-question generation pipeline that constructs culturally grounded test cases spanning 25 value dimensions across Chinese, European, and Islamic ethical frameworks. It further includes a Bayesian ensemble evaluation framework that aggregates alignment judgments from multiple diverse LLM-based evaluators, assigning dimension-specific trust weights based on their observed reliability. We also develop a lightweight supervised evaluator fine-tuned on VADA-generated data, providing a scalable and deployable alternative to multi-model ensemble evaluation. We construct a large-scale benchmark containing 11,865 automatically annotated cases, along with a human-labeled subset of 1000 instances for validation and evaluation.
Empirical results demonstrate that VADA substantially outperforms existing prompting-based evaluators, achieving over 93.6 percent accuracy and high agreement with human annotations. Ablation studies confirm the complementary benefits of evaluator diversity and reliability-aware aggregation. Furthermore, VADA enables comparative audits of state-of-the-art LLMs, uncovering alignment inconsistencies across cultural dimensions. Results highlight VADA’s effectiveness as a foundation for robust value-aware evaluation and development of LLMs.
Fri 17 AprDisplayed time zone: Brasilia, Distrito Federal, Brazil change
16:00 - 17:30 | Software Engineering for AI 8Research Track / New Ideas and Emerging Results (NIER) at Oceania VII Chair(s): Sheila Reinehr Pontifícia Universidade Católica do Paraná (PUCPR) | ||
16:00 15mTalk | TaskEval: Synthesised Evaluation for Foundation-Model Tasks New Ideas and Emerging Results (NIER) Dilani Widanapathiranage Applied Artificial Intelligence Initiative, Deakin University, Scott Barnett Applied Artificial Intelligence Initiative, Deakin University, Stefanus Kurniawan Deakin University, Wannita Takerngsaksiri Applied Artificial Intelligence Initiative, Deakin University | ||
16:15 15mTalk | SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments Research Track Syed Yusuf Ahmed Purdue University, Shiwei Feng Purdue University, Chanwoo Bae Purdue University, Calix Barrus University of Texas at San Antonio, Xiangyu Zhang Purdue University | ||
16:30 15mTalk | Revisiting "Revisiting Neuron Coverage for DNN Testing: A Layer-Wise and Distribution-Aware Criterion": A Critical Review and Implications on DNN Coverage Testing Research Track Jinhan Kim Università della Svizzera italiana, Nargiz Humbatova Università della Svizzera italiana, Gunel Jahangirova King's College London, Shin Yoo KAIST, Paolo Tonella USI Lugano Pre-print | ||
16:45 15mTalk | VADA: A Multicultural Benchmark for Value-Aware Data Generation and Alignment Evaluation in LLMs Research Track Zhenlun Zhang Nanjing University, Yang Feng Nanjing University, Shihao Weng Nanjing University, Yining Yin Nanjing University, Jincheng Li Nanjing University, Jia Liu Nanjing University | ||
17:00 15mTalk | Evaluating the effectiveness of LLM-based interoperability Research Track Rodrigo Falcão Fraunhofer IESE, Stefan Schweitzer Fraunhofer Institute for Experimental Software Engineering, Julien Siebert Fraunhofer IESE, Emily Calvet Fraunhofer Institute for Experimental Software Engineering, Frank Elberzhager Fraunhofer Institute for Experimental Software Engineering | ||
17:15 15mTalk | Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving Research Track Xinyi Zheng Huazhong University of Science and Technology, Ningke Li National University of Singapore, Xiaokun Luan Peking University, Kailong Wang Huazhong University of Science and Technology, Ling Shi Nanyang Technological University, Meng Sun Peking University, Haoyu Wang Huazhong University of Science and Technology | ||