I am a final-year PhD student in the Language Technology Lab at the University of Cambridge, working under the supervision of Prof. Nigel Collier. I’m a fan of the Great Automation—the idea that increasingly capable systems can learn, evolve, and improve with minimal human intervention. My interests span the entire lifecycle of self-evolving agents, from data acquisition and autonomous interaction to memory, tool use, feedback-driven optimization, and continual adaptation.
If you are interested in discussing research or potential collaborations, feel free to reach out via email.
「人生到處知何似,應似飛鴻踏雪泥。」
Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias [Code]
Yinhong Liu, Zhili Tan, Zilin Wang, Zhijiang Guo.
Under Review.
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models [Website]
Yinhong Liu, Zhijiang Guo, Tianya Liang, Ehsan Shareghi, Ivan Vuli´c and Nigel Collier.
ICML, Spotlight, 2025.
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
Yinhong Liu*, Han Zhou*, Zhijiang Guo, Ehsan Shareghi, Ivan Vuli´c, Anna Korhonen and Nigel Collier. [code]
COLM, 2024.
From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning
Chao Chen, Chengzu Li, Zhiwei Li, Yinhong Liu, Zhijiang Guo
Under Review.
Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning
Jiayu Yang, Chao Chen, Shengen Wu, Yinhong Liu, Yuxuan Fan, Lujundong Li, Songning Lai, Chengwei Qin, Zhijiang Guo
EMNLP 2026.
Operadic consistency: a label-free signal for compositional reasoning failures in LLMs
Nathaniel Bottman, Yinhong Liu, Kyle Richardson
NeurIPS 2026w.
From Chains to Graphs: Self-Structured Reasoning for General-Domain LLMs
Yingjian Chen, Haoran Liu, Yinhong Liu, et al., Irene Li
AACL-IJCNLP 2026.
Improving Preference Extraction In LLMs By Identifying Latent Knowledge Through Classifying Probes
Sharan Maiya, Yinhong Liu, Ramit Debnath and Anna Korhonen
ACL 2025, main.
GraphCheck: Breaking Long-Term Text Barriers with Extracted Knowledge Graph-Powered Fact-Checking
Yingjian Chen, Haoran Liu, Yinhong Liu, Rui Yang, Han Yuan, Yanran Fu, Pengyuan Zhou, Qingyu Chen, James Caverlee and Irene Li
ACL 2025, main.
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization.Images link
Yinhong Liu, Jianfeng He, et al, Hang Su and Saab Mansour
EMNLP 2025.
Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking
Songbo Hu*, Yinhong Liu*, Yijie Zhou*, et al, Ivan Vulić** and Anna Korhonen**.
ACL 2026.
When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning
Yijiang River Dong, Tiancheng Hu, Yinhong Liu, Ahmet Üstün and Nigel Collier
EMNLP 2025.
FASTFACT: Faster, Stronger Long-Form Factuality Evaluations in LLMs
Yingjia Wan, Haochen Tan, $\cdots$, Yinhong Liu* and Zhijiang Guo*
EMNLP 2025.
TOAD: Task-Oriented Automatic Dialogs with Diverse Response Styles [Apple website] [Poster]
Yinhong Liu, Yimai Fang, David Vandyke and Nigel Collier. [code]
ACL, findings, 2024.
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
Han Zhou, Xingchen Wan, Yinhong Liu, Nigel Collier, Ivan Vulić, Anna Korhonen [code]
EMNLP, main, 2024.
MR-BEN: A Comprehensive Meta-Reasoning Benchmark for Large Language Models
Zhongshen Zeng, Yinhong Liu, Yingjia Wan, Jingyao Li, et al. [code]
NIPS, 2024.
Unlocking Structure Measuring: Introducing PDD, an Automatic Metric for Positional Discourse Coherence
Yinhong Liu, Yixuan Su, Ehsan Shareghi and Nigel Collier. [code]
NAACL, main conference, 2024.
Prompt Compression for Large Language Models: A Survey
Zongqian Li*, Yinhong Liu*, Yixuan Su and Nigel Collier.
NAACL, main, 2025.
Instruct-SCTG: Guiding Sequential Controlled Text Generation through Instructions
Yinhong Liu, Yixuan Su, Ehsan Shareghi and Nigel Collier. [code]
Plug-and-play Recipe Generation with Content Planning
Yinhong Liu, Yixuan Su, Ehsan Shareghi and Nigel Collier. [code]
EMNLP, Generation, Evaluation & Metrics (GEM) Workshop, 2022.
Learning Functional Distributional Semantics with Visual Data[slides]
Yinhong Liu and Guy Emerson. [code]
ACL, main conference. 2022.
Multi-channel audio statistical restoration
Yinhong Liu and Simon Godsill.
IEEE International Conference on Signal Processing, Communications and Computing (IEEE-ICSPCC), 2020.