Publications
Publications from LaSAI members in multilingual NLP, large language models, interpretability, and language science.
LaSAI's initial publication record reflects the work of founder Ercong Nie. As the group grows, this page will expand to include work led by all lab members.
Selected publications
Parsing Middle High German: Exploring Cross-lingual NLP for Treebank Construction in Low-resource Historical Languages
Ercong Nie, Siyao Peng, Helmut Schmid, and Hinrich Schütze
Digital Scholarship in the HumanitiesMechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
Ercong Nie, Helmut Schmid, and Hinrich Schütze
Findings of EMNLPBMIKE-53: Investigating Cross-Lingual Knowledge Editing with In-Context Learning
Ercong Nie*, Bo Shao*, Zifeng Ding, Mingyang Wang, Helmut Schmid, and Hinrich Schütze
Proceedings of ACLCross-Lingual Retrieval Augmented Prompt for Low-Resource Languages
Ercong Nie*, Sheng Liang*, Helmut Schmid, and Hinrich Schütze
Findings of ACLComplete publication record
2026Journals, conferences & preprints
- Ercong Nie, Siyao Peng, Helmut Schmid, and Hinrich Schütze. Parsing Middle High German: Exploring Cross-lingual NLP for Treebank Construction in Low-resource Historical Languages. Digital Scholarship in the Humanities, 2026.
- Minghan Li, Xinxuan Lv, Junjie Zou, Tongna Chen, Chao Zhang, Suchao An, Ercong Nie, and Guodong Zhou. Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey. ACM Transactions on Information Systems, 2026.
- Hengyuan Zhang, Zhihao Zhang, Mingyang Wang, Zunhai Su, Yiwei Wang, Qianli Wang, Shuzhou Yuan, Ercong Nie, et al. Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models. Computer Science Review, 2026.
- Minghan Li, Ercong Nie, Huiping Huang, Xinxuan Lv, and Guodong Zhou. Dual-Layer Prompt Ensembles: Leveraging System- and User-Level Instructions for Robust LLM-Based Query Expansion and Rank Fusion. Information Fusion, 2026.
- Linyang He*, Ercong Nie*, Jonathan Brennan, Helmut Schmid, Hinrich Schütze, and Nima Mesgarani. Investigating Multilingual Conceptual Understanding of Large Language Models with Minimal Pair Probing. ACM Transactions on Asian and Low-Resource Language Information Processing, 2026.
- YongKang Liu, Jiayang Yu, Mingyang Wang, Yiqun Zhang, Ercong Nie, Shi Feng, Daling Wang, Kaisong Song, and Hinrich Schütze. SAD: A Large-Scale Strategic Argumentative Dialogue Dataset. ACL, 2026.
- Sikuan Yan*, Xiufeng Yang*, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, and Yunpu Ma. Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning. ACL, 2026.
- YongKang Liu, Xingle Xu, Ercong Nie, Zijing Wang, Shi Feng, Daling Wang, Qian Li, and Hinrich Schütze. Look Within or Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning. ACL, 2026.
- Chunkit Chan, Yauwai Yim, Hongchuan Zeng, Zhiying Zou, Xinyuan Cheng, Zhifan Sun, Zheye Deng, Kawai Chung, Yuzhuo Ao, Yixiang Fan, Cheng Jiayang, Ercong Nie, et al. XToM: Exploring the Multilingual Theory of Mind for Large Language Models. ACL, 2026.
- Zijing Wang, YongKang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, and Hinrich Schütze. PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs. Findings of ACL, 2026.
- Hengyuan Zhang, Zhihao Zhang, Ercong Nie, Mingyang Wang, Zunhai Su, Yiwei Wang, Qianli Wang, Shuzhou Yuan, et al. Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models. Findings of ACL, 2026.
- Shuzhou Yuan, William LaCroix, Hardik Ghoshal, Ercong Nie, and Michael Färber. CoDAE: Adapting Large Language Models for Education via Chain-of-Thought Data Augmentation. LREC, 2026.
- Minghan Li, Ercong Nie, Siqi Zhao, Tongna Chen, Huiping Huang, and Guodong Zhou. Automatic In-Domain Exemplar Construction and LLM-Based Refinement of Multi-LLM Expansions for Query Expansion. Preprint, 2026.
- Zijing Wang, Mingyang Wang, Ercong Nie, Yongkang Liu, Shi Feng, Mengjie Zhao, Daling Wang, Xiaocui Yang, and Hinrich Schütze. DiM³: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging. Preprint, 2026.
- Sikuan Yan, Sicheng Dong, Haotong Wang, Ercong Nie, Yilun Liu, Jinhe Bi, Yingjie Xu, Susanna Schwarzmann, Riccardo Trivisonno, Volker Tresp, and Yunpu Ma. PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning. Preprint, 2026.
- Yongkang Liu, Zijing Wang, Mengjie Zhao, Ercong Nie, Mingyang Wang, Qian Li, Feiliang Ren, Shi Feng, Daling Wang, and Hinrich Schütze. ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning. Preprint, 2026.
- Sikuan Yan, Ahmed Bahloul, Ercong Nie, Susanna Schwarzmann, Riccardo Trivisonno, Volker Tresp, and Yunpu Ma. Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents. Preprint, 2026.
2025Journals, conferences & workshops
- Shuzhou Yuan*, Ercong Nie*, Lukas Kouba, Ashish Yashwanth Kangen, Helmut Schmid, Hinrich Schütze, and Michael Färber. LLM in the Loop: Creating the ParaDeHate Dataset for Hate Speech Detoxification. Findings of IJCNLP-AACL, 2025.
- Ercong Nie, Shuzhou Yuan, Bolei Ma, Helmut Schmid, Michael Färber, Frauke Kreuter, and Hinrich Schütze. Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models. Findings of IJCNLP-AACL, 2025.
- Ercong Nie, Helmut Schmid, and Hinrich Schütze. Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models. Findings of EMNLP, 2025. Code
- Yihong Liu, Mingyang Wang, Amir Hossein Kargaran, Felicia Körner, Ercong Nie, Barbara Plank, François Yvon, and Hinrich Schütze. Tracing Multilingual Factual Knowledge Acquisition in Pretraining. Findings of EMNLP, 2025.
- Ercong Nie*, Bo Shao*, Zifeng Ding, Mingyang Wang, Helmut Schmid, and Hinrich Schütze. BMIKE-53: Investigating Cross-Lingual Knowledge Editing with In-Context Learning. ACL (oral), 2025. Code
- Linyang He, Ercong Nie, Helmut Schmid, Hinrich Schütze, Nima Mesgarani, and Jonathan Brennan. Large Language Models as Neurolinguistic Subjects: Discrepancy between Performance and Competence. Findings of ACL, 2025.
- Mingyang Wang, Heike Adel, Lukas Lange, Yihong Liu, Ercong Nie, Jannik Strötgen, and Hinrich Schütze. Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language Models. ACL, 2025.
- Shuzhou Yuan*, Ercong Nie*, Bolei Ma, and Michael Färber. Why Lift so Heavy? Slimming Large Language Models by Cutting Off the Layers. IJCNN, 2025.
- Shuzhou Yuan*, Ercong Nie*, Mario Tawfelis, Helmut Schmid, Hinrich Schütze, and Michael Färber. Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models. PALS at EMNLP, 2025.
- Linyang He*, Ercong Nie*, Sukru Samet Dindar, Arsalan Firoozi, Adrian Florea, Van Nguyen, Corentin Puffay, Riki Shimizu, Haotian Ye, Jonathan Brennan, Helmut Schmid, Hinrich Schütze, and Nima Mesgarani. XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs. SIGTYP at ACL, 2025.
- Lovisa Hagström, Ercong Nie, Ruben Halifa, Helmut Schmid, Richard Johansson, and Alexander Junge. Language Model Re-rankers are Fooled by Lexical Similarities. FEVER at ACL, 2025.
- Wenhan Feng, Anqi Zhu, Thanh Phuoc Ho, Ercong Nie, Beiduo Chen, Shijia Zhou, Hao Su, and Liang Emlyn Yang. Generative Agent-Based Modeling for Climate Adaptation Policy: A Flood Resilience Perspective. ESSA Social Simulation Conference, 2025.
- Shuzhou Yuan, Ercong Nie, Yinuo Sun, Chenxuan Zhao, William LaCroix, and Michael Färber. Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs. LREC, 2026.
- Minghan Li, Miyang Luo, Tianrui Lv, Yishuai Zhang, Siqi Zhao, Ercong Nie, and Guodong Zhou. A Survey of Long-Document Retrieval in the PLM and LLM Era. Preprint, 2025.
2024Conferences & workshops
- Shuzhou Yuan, Ercong Nie, Michael Färber, Helmut Schmid, and Hinrich Schütze. GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural Network. Findings of ACL, 2024. Code
- Linyang He, Peili Chen, Ercong Nie, Yuanning Li, and Jonathan R. Brennan. Decoding Probing: Revealing Internal Linguistic Structures in Neural Language Models Using Minimal Pairs. LREC-COLING, 2024.
- Yongkang Liu*, Ercong Nie*, Shi Feng, Zheng Hua, Zifeng Ding, Daling Wang, Yifei Zhang, and Hinrich Schütze. A Unified Data Augmentation Framework for Low-Resource Multi-domain Dialogue Generation. ECML-PKDD, 2024.
- Bolei Ma*, Ercong Nie*, Shuzhou Yuan, Helmut Schmid, Michael Färber, Frauke Kreuter, and Hinrich Schütze. ToPro: Token-Level Prompt Decomposition for Cross-Lingual Sequence Labeling Tasks. EACL (oral), 2024. Code
- Huixin Chen, Jan Büssing, David Rügamer, and Ercong Nie†. Team MGTD4ADL at SemEval-2024 Task 8: Leveraging (Sentence) Transformer Models with Contrastive Learning for Identifying Machine-Generated Text. SemEval at NAACL, 2024.
2023Conferences & workshops
- Ercong Nie, Helmut Schmid, and Hinrich Schütze. Unleashing the Multilingual Encoder Potential: Boosting Zero-Shot Performance via Probability Calibration. Findings of EMNLP, 2023. Code
- Ercong Nie*, Sheng Liang*, Helmut Schmid, and Hinrich Schütze. Cross-Lingual Retrieval Augmented Prompt for Low-Resource Languages. Findings of ACL, 2023. Code
- Bolei Ma*, Ercong Nie*, Helmut Schmid, and Hinrich Schütze. Is Prompt-Based Finetuning Always Better than Vanilla Finetuning? Insights from Cross-Lingual Language Understanding. KONVENS (oral), 2023.
- Xiaoqian Li, Ercong Nie, and Sheng Liang. From Classification to Generation: Insights into Crosslingual Retrieval Augmented ICL. Instruction Workshop at NeurIPS, 2023.
- Zheyu Zhang*, Han Yang*, Bolei Ma*, David Rügamer, and Ercong Nie†. Baby’s CoThought: Leveraging Large Language Models for Enhanced Reasoning in Compact Models. BabyLM at CoNLL, 2023.
- Xiaoqian Li, Ercong Nie, and Sheng Liang. Crosslingual Retrieval Augmented In-context Learning for Bangla. BanglaLP at EMNLP, 2023.
- Ercong Nie, Helmut Schmid, and Hinrich Schütze. Cross-Lingual Constituency Parsing for Middle High German: A Delexicalized Approach. Ancient Language Processing Workshop at RANLP, 2023.
Earlier work & resources2022–2025
- Ingo Ziegler, Bolei Ma, Ercong Nie, Bernd Bischl, David Rügamer, Benjamin Schubert, and Emilio Dorigatti. What Cleaves? Is Proteasomal Cleavage Prediction Reaching a Ceiling?. Learning Meaningful Representations of Life at NeurIPS, 2022.
- Ercong Nie. Fine-Tuned Sentence Transformer Model for Question Answering Task. StuTS, 2022.
- Jürg Fleischer, Lena Haden, Martin Klotz, Ercong Nie, Helmut Schmid, Gohar Schnelle, Lilian Slawski, and Lars Erik Zeige. Korpus zur Erforschung von Registerphänomenen bei Martin Luther (ReGiL). Dataset, 2025.
- Ercong Nie. Efficient and Human-inspired Natural Language Processing Methods for Multilingual and Low-resource Settings. PhD dissertation, LMU Munich, 2025.
- Ercong Nie. Zero-Shot Learning on Low-Resource Languages by Cross-Lingual Retrieval. Master’s thesis, LMU Munich, 2022.
* Equal contribution. † Corresponding author. The list is maintained from the author's publication record and public indexes.