← All conferences

ACL 2025 Accepted Papers

The full list of 3,086 papers accepted at ACL 2025 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Long: 1,602finding: 1,387Short: 97
  1. (RSA)²: A Rhetorical-Strategy-Aware Rational Speech Act Framework for Figurative Language UnderstandingLong
  2. 100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?finding
  3. 2M-BELEBELE: Highly Multilingual Speech and American Sign Language Comprehension Dataset Download PDFfinding
  4. 3DM: Distill, Dynamic Drop, and Merge for Debiasing Multi-modal Large Language Modelsfinding
  5. 500xCompressor: Generalized Prompt Compression for Large Language ModelsLong
  6. 7 Points to Tsinghua but 10 Points to ? Assessing Large Language Models in Agentic Multilingual National Biasfinding
  7. A Bounding Box is Worth One Token - Interleaving Layout and Text in a Large Language Model for Document Understandingfinding
  8. A Case Study of Cross-Lingual Zero-Shot Generalization for Classical Languages in LLMsfinding
  9. A Character-Centric Creative Story Generation via Imaginationfinding
  10. A Classifier of Word-Level Variants in Witnesses of Biblical Hebrew Manuscriptsfinding
  11. A Cognitive Writing Perspective for Constrained Long-Form Text Generationfinding
  12. A Comprehensive Graph Framework for Question Answering with Mode-Seeking Preference Alignmentfinding
  13. A Conformal Risk Control Framework for Granular Word Assessment and Uncertainty Calibration of CLIPScore Quality Estimatesfinding
  14. A Constrained Text Revision Agent via Iterative Planning and Searchingfinding
  15. A Couch Potato is not a Potato on a Couch: Prompting Strategies, Image Generation, and Compositionality Prediction for Noun Compoundsfinding
  16. A Drop-In Solution for On-the-Fly Adaptation of Speculative Decoding in Large Language ModelsLong
  17. A Dual-Mind Framework for Strategic and Expressive Negotiation AgentLong
  18. A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better InterpretabilityLong
  19. A Fully Automated Pipeline for Conversational Discourse Annotation: Tree Scheme Generation and Labeling with Large Language Modelsfinding
  20. A Fully Generative Motivational Interviewing Counsellor Chatbot for Moving Smokers Towards the Decision to Quitfinding
  21. A General Framework to Enhance Fine-tuning-based LLM Unlearningfinding
  22. A General Knowledge Injection Framework for ICD Codingfinding
  23. A Generative Adaptive Replay Continual Learning Model for Temporal Knowledge Graph ReasoningLong
  24. A Joint Optimization Framework for Enhancing Efficiency of Tool Utilization in LLM Agentsfinding
  25. A Large and Balanced Corpus for Fine-grained Arabic Readability Assessmentfinding
  26. A Law Reasoning Benchmark for LLM with Tree-Organized Structures including Factum Probandum, Evidence and Experiencesfinding
  27. A Little Human Data Goes A Long WayShort
  28. A MISMATCHED Benchmark for Scientific Natural Language Inferencefinding
  29. A Measure of the System Dependence of Automated MetricsShort
  30. A Modular Approach for Clinical SLMs Driven by Synthetic Data with Pre-Instruction Tuning, Model Merging, and Clinical-Tasks AlignmentLong
  31. A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaosfinding
  32. A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering SystemsLong
  33. A Multi-Expert Structural-Semantic Hybrid Framework for Unveiling Historical Patterns in Temporal Knowledge Graphsfinding
  34. A Multi-Labeled Dataset for Indonesian Discourse: Examining Toxicity, Polarization, and Demographics Informationfinding
  35. A Multi-persona Framework for Argument Quality AssessmentLong
  36. A Mutual Information Perspective on Knowledge Graph EmbeddingLong
  37. A New Formulation of Zipf’s Meaning-Frequency Law through Contextual DiversityLong
  38. A Parameter-Efficient and Fine-Grained Prompt Learning for Vision-Language ModelsLong
  39. A Persona-Aware LLM-Enhanced Framework for Multi-Session Personalized Dialogue Generationfinding
  40. A Query-Response Framework for Whole-Page Complex-Layout Document Image Translation with Relevant Regional Concentrationfinding
  41. A Reality Check on Context Utilisation for Retrieval-Augmented GenerationLong
  42. A Reinforcement Learning Framework for Cross-Lingual Stance Detection Using Chain-of-Thought Alignmentfinding
  43. A Representation Level Analysis of NMT Model Robustness to Grammatical Errorsfinding
  44. A Rose by Any Other Name: LLM-Generated Explanations Are Good Proxies for Human Explanations to Collect Label Distributions on NLIfinding
  45. A Self-Denoising Model for Robust Few-Shot Relation ExtractionLong
  46. A Self-Distillation Recipe for Neural Machine Translationfinding
  47. A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Modelsfinding
  48. A Silver Bullet or a Compromise for Full Attention? A Comprehensive Study of Gist Token-based Context CompressionLong
  49. A Spatio-Temporal Point Process for Fine-Grained Modeling of Reading BehaviorLong
  50. A Statistical and Multi-Perspective Revisiting of the Membership Inference Attack in Large Language ModelsLong
  51. A Strategic Coordination Framework of Small LMs Matches Large LMs in Data SynthesisLong
  52. A Study into Investigating Temporal Robustness of LLMsfinding
  53. A Survey of LLM-based Agents in Medicine: How far are we from Baymax?finding
  54. A Survey of Large Language Models in Psychotherapy: Current Landscape and Future Directionsfinding
  55. A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challengesfinding
  56. A Survey of Post-Training Scaling in Large Language ModelsLong
  57. A Survey of Uncertainty Estimation Methods on Large Language Modelsfinding
  58. A Survey on Efficient Large Language Model Training: From Data-centric PerspectivesLong
  59. A Survey on Foundation Language Models for Single-cell BiologyLong
  60. A Survey on Patent Analysis: From NLP to Multimodal AILong
  61. A Survey on Personalized Alignment—The Missing Piece for Large Language Models in Real-World Applicationsfinding
  62. A Survey on Proactive Defense Strategies Against Misinformation in Large Language Modelsfinding
  63. A Systematic Study of Compositional Syntactic Transformer Language ModelsLong
  64. A Tale of Evaluating Factual Consistency: Case Study on Long Document Summarization Evaluationfinding
  65. A Text is Worth Several Tokens: Text Embedding from LLMs Secretly Aligns Well with The Key TokensLong
  66. A Theory of Response Sampling in LLMs: Part Descriptive and Part PrescriptiveLong
  67. A Training-free LLM-based Approach to General Chinese Character Error CorrectionLong
  68. A Triple-View Framework for Fine-Grained Emotion Classification with Clustering-Guided Contrastive LearningLong
  69. A Troublemaker with Contagious Jailbreak Makes Chaos in Honest TownsLong
  70. A Unified Agentic Framework for Evaluating Conditional Image GenerationLong
  71. A Unified Taxonomy-Guided Instruction Tuning Framework for Entity Set Expansion and Taxonomy Expansionfinding
  72. A Variational Approach for Mitigating Entity Bias in Relation ExtractionShort
  73. A rebuttal of two common deflationary stances against LLM cognitionfinding
  74. A-TASC: Asian TED-Based Automatic Subtitling CorpusLong
  75. A2ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantizationfinding
  76. AAD-LLM: Neural Attention-Driven Auditory Scene UnderstandingLong
  77. ACCESS DENIED INC: The First Benchmark Environment for Sensitivity Awarenessfinding
  78. ACECODER: Acing Coder RL via Automated Test-Case SynthesisLong
  79. ACORD: An Expert-Annotated Retrieval Dataset for Legal Contract DraftingLong
  80. ACT: Knowledgeable Agents to Design and Perform Complex TasksLong
  81. AD-LLM: Benchmarking Large Language Models for Anomaly Detectionfinding
  82. ADO: Automatic Data Optimization for Inputs in LLM Promptsfinding
  83. AGD: Adversarial Game Defense Against Jailbreak Attacks in Large Language ModelsLong
  84. AGRec: Adapting Autoregressive Decoders with Graph Reasoning for LLM-based Sequential Recommendationfinding
  85. AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety DetectionLong
  86. AIGuard: A Benchmark and Lightweight Detection for E-commerce AIGC Risksfinding
  87. AIMSCheck: Leveraging LLMs for AI-Assisted Review of Modern Slavery Statements Across JurisdictionsLong
  88. AIR-Bench: Automated Heterogeneous Information Retrieval BenchmarkLong
  89. AL-QASIDA: Analyzing LLM Quality and Accuracy Systematically in Dialectal Arabicfinding
  90. ALGEN: Few-shot Inversion Attacks on Textual Embeddings via Cross-Model Alignment and GenerationLong
  91. ALPS: Attention Localization and Pruning Strategy for Efficient Adaptation of Large Language Modelsfinding
  92. ALW: Adaptive Layer-Wise contrastive decoding enhancing reasoning ability in Large Language Modelsfinding
  93. AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agentsfinding
  94. AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inferencefinding
  95. AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Modelsfinding
  96. APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUsLong
  97. APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model PromptsLong
  98. APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Trainingfinding
  99. AQuAECHR: Attributed Question Answering for European Court of Human Rightsfinding
  100. ARC ‘Challenge’ Is Not That Challengingfinding
  101. ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive SearchLong
  102. ASPERA: A Simulated Environment to Evaluate Planning for Complex Action ExecutionLong
  103. ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoningfinding
  104. ASTRID - An Automated and Scalable TRIaD for the Evaluation of RAG-based Clinical Question Answering Systemsfinding
  105. ASTRO: Automatic Strategy Optimization For Non-Cooperative Dialoguesfinding
  106. ATLANTIS: Weak-to-Strong Learning via Importance SamplingLong
  107. ATLAS: Agent Tuning via Learning Critical Stepsfinding
  108. ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution ErrorsLong
  109. AUTALIC: A Dataset for Anti-AUTistic Ableist Language In ContextLong
  110. AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularityfinding
  111. AXIS: Efficient Human-Agent-Computer Interaction with API-First LLM-Based AgentsLong
  112. AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific ResearchLong
  113. Accelerating Adaptive Retrieval Augmented Generation via Instruction-Driven Representation Reduction of Retrieval Overlapsfinding
  114. Accelerating Dense LLMs via L0-regularized Mixture-of-ExpertsShort
  115. Accurate KV Cache Quantization with Outlier Tokens TracingLong
  116. AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modelingfinding
  117. Achieving binary weight and activation for LLMs using Post-Training Quantizationfinding
  118. Acoustic Individual Identification of White-Faced Capuchin Monkeys Using Joint Multi-Species EmbeddingsShort
  119. Acquisition and Application of Novel Knowledge in Large Language ModelsLong
  120. Act2P: LLM-Driven Online Dialogue Act Classification for Power Analysisfinding
  121. ActiView: Evaluating Active Perception Ability for Multimodal Large Language ModelsLong
  122. Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and InferenceLong
  123. Activation Steering Decoding: Mitigating Hallucination in Large Vision-Language Models through Bidirectional Hidden State InterventionLong
  124. AdParaphrase v2.0: Generating Attractive Ad Texts Using a Preference-Annotated Paraphrase Datasetfinding
  125. AdaDHP: Fine-Grained Fine-Tuning via Dual Hadamard Product and Adaptive Parameter SelectionLong
  126. AdaEdit: Advancing Continuous Knowledge Editing For Large Language ModelsLong
  127. AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understandingfinding
  128. AdaV: Adaptive Text-visual Redirection for Vision-Language Modelsfinding
  129. AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on HarmfulnessLong
  130. Adapt Once, Thrive with Updates: Transferable Parameter-Efficient Fine-Tuning on Evolving Base ModelsLong
  131. AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human DemonstrationsLong
  132. Adapting General-Purpose Embedding Models to Private Datasets Using Keyword-based Retrievalfinding
  133. Adaptive Detoxification: Safeguarding General Capabilities of LLMs through Toxicity-Aware Knowledge Editingfinding
  134. Adaptive LoRA Merge with Parameter Pruning for Low-Resource Generationfinding
  135. Adaptive Retrieval Without Self-Knowledge? Bringing Uncertainty Back HomeLong
  136. Adaptive Tool Use in Large Language Models with Meta-Cognition TriggerLong
  137. Adaptive and Robust Translation from Natural Language to Multi-model Query LanguagesLong
  138. Adaptive-VP: A Framework for LLM-Based Virtual Patients that Adapts to Trainees’ Dialogue to Facilitate Nurse Communication Trainingfinding
  139. Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language ModelsLong
  140. Advancing Collaborative Debates with Role Differentiation through Multi-Agent Reinforcement LearningLong
  141. Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encodingfinding
  142. Advancing SMoE for Continuous Domain Adaptation of MLLMs: Adaptive Router and Domain-Specific LossLong
  143. Advancing Sequential Numerical Prediction in Autoregressive ModelsShort
  144. Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference AlignmentLong
  145. Adversarial Alignment with Anchor Dragging Drift (A3D2): Multimodal Domain Adaptation with Partially Shifted ModalitiesLong
  146. Adversarial Preference Learning for Robust LLM Alignmentfinding
  147. Adversarial TokenizationLong
  148. Adverse Event Extraction from Discharge Summaries: A New Dataset, Annotation Scheme, and Initial FindingsLong
  149. AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark DatasetLong
  150. AfroBench: How Good are Large Language Models on African Languages?finding
  151. AfroCS-xs: Creating a Compact, High-Quality, Human-Validated Code-Switched Dataset for African LanguagesLong
  152. Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal AgentsLong
  153. AgentCourt: Simulating Court with Adversarial Evolvable Lawyer Agentsfinding
  154. AgentDropout: Dynamic Agent Elimination for Token-Efficient and High-Performance LLM-Based Multi-Agent CollaborationLong
  155. AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse EnvironmentsLong
  156. AgentRM: Enhancing Agent Generalization with Reward ModelingLong
  157. AgentStore: Scalable Integration of Heterogeneous Agents As Specialized Generalist Computer Assistantfinding
  158. Agentic Knowledgeable Self-awarenessLong
  159. Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic ToolsLong
  160. Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward SystemsLong
  161. Agents Under Siege: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt AttacksLong
  162. Agents generalize to novel levels of abstraction by using adaptive linguistic strategiesfinding
  163. Agri-CM3: A Chinese Massive Multi-modal, Multi-level Benchmark for Agricultural Understanding and ReasoningLong
  164. Akan Cinematic Emotions (ACE): A Multimodal Multi-party Dataset for Emotion Recognition in Movie Dialoguesfinding
  165. Algorithmic Fidelity of Large Language Models in Generating Synthetic German Public Opinions: A Case StudyLong
  166. Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI FeedbackLong
  167. Align2LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curationfinding
  168. AlignDistil: Token-Level Language Model Alignment as Adaptive Policy DistillationLong
  169. AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language ModelsLong
  170. Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of RaceLong
  171. Aligning AI Research with the Needs of Clinical Coding Workflows: Eight Recommendations Based on US Data Analysis and Critical ReviewLong
  172. Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data FilteringLong
  173. Aligning Large Language Models with Implicit Preferences from User-Generated ContentLong
  174. Aligning VLM Assistants with Personalized Situated CognitionLong
  175. All That Glitters is Not Gold: Improving Robust Retrieval-Augmented Language Models with Fact-Centric Preference Alignmentfinding
  176. All That Glitters is Not Novel: Plagiarism in AI Generated ResearchLong
  177. Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality EstimationLong
  178. Alleviating Hallucinations from Knowledge Misalignment in Large Language Models via Selective Abstention LearningLong
  179. Alleviating Hallucinations in Large Language Models via Truthfulness-driven Rank-adaptive LoRAfinding
  180. Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writingfinding
  181. AmbiK: Dataset of Ambiguous Tasks in Kitchen EnvironmentLong
  182. Amplifying Trans and Nonbinary Voices: A Community-Centred Harm Taxonomy for LLMsLong
  183. An Adaptive Multi-Threshold Loss and a General Framework for Collaborating Losses in Document-Level Relation Extractionfinding
  184. An Effective Incorporating Heterogeneous Knowledge Curriculum Learning for Sequence LabelingShort
  185. An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite IndividualsLong
  186. An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical ReasoningLong
  187. An Empirical Study of Group Conformity in Multi-Agent Systemsfinding
  188. An Empirical Study of Iterative Refinements for Non-autoregressive TranslationLong
  189. An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4finding
  190. An Empirical Study of Many-to-Many Summarization with Large Language ModelsLong
  191. An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)Long
  192. AnCast++: Document-Level Evaluation of Graph-based Meaning Representationsfinding
  193. AnRe: Analogical Replay for Temporal Knowledge Graph ForecastingLong
  194. AnalyticKWS: Towards Exemplar-Free Analytic Class Incremental Learning for Small-footprint Keyword Spottingfinding
  195. Analyzing LLMs’ Knowledge Boundary Cognition Across Languages Through the Lens of Internal RepresentationsLong
  196. Analyzing Political Bias in LLMs via Target-Oriented Sentiment Classificationfinding
  197. Analyzing and Mitigating Inconsistency in Discrete Speech Tokens for Neural Codec Language ModelsLong
  198. Analyzing the Effect of Linguistic Similarity on Cross-Lingual Transfer: Tasks and Experimental Setups Matterfinding
  199. Analyzing the Rapid Generalization of SFT via the Perspective of Attention Head Activation PatternsLong
  200. AnchorCoT: Anchors Pave the Way for Multi-hop Reasoningfinding
  201. Anchored Answers: Unravelling Positional Bias in GPT-2’s Multiple-Choice Questionsfinding
  202. AndroidGen: Building an Android Language Agent under Data ScarcityLong
  203. AndroidLab: Training and Systematic Benchmarking of Android Autonomous AgentsLong
  204. AnnaAgent: Dynamic Evolution Agent System with Multi-Session Memory for Realistic Seeker Simulationfinding
  205. Annotating the Annotators: Analysis, Insights and Modelling from an Annotation Campaign on Persuasion Techniques Detectionfinding
  206. Answer When Needed, Forget When Not: Language Models Pretend to Forget via In-Context Knowledge Unlearningfinding
  207. Answering Complex Geographic Questions by Adaptive Reasoning with Visual Context and External Commonsense KnowledgeLong
  208. AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World KnowledgeLong
  209. Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information RetrievalLong
  210. Anything Goes? A Crosslinguistic Study of (Im)possible Language Learning in LMsLong
  211. Arbiters of Ambivalence: Challenges of using LLMs in No-Consensus tasksfinding
  212. Are Any-to-Any Models More Consistent Across Modality Transfers Than Specialists?Long
  213. Are Dialects Better Prompters? A Case Study on Arabic Subjective Text Classificationfinding
  214. Are LLMs Rational Investors? A Study on the Financial Bias in LLMsfinding
  215. Are LLMs effective psychological assessors? Leveraging adaptive RAG for interpretable mental health screening through psychometric practiceLong
  216. Are Multimodal Large Language Models Pragmatically Competent Listeners in Simple Reference Resolution Tasks?finding
  217. Are Optimal Algorithms Still Optimal? Rethinking Sorting in LLM-Based Pairwise Ranking with Batching and CachingShort
  218. Are Rules Meant to be Broken? Understanding Multilingual Moral Reasoning as a Computational Pipeline with UniMoralLong
  219. Are We in the AI-Generated Text World Already? Quantifying and Monitoring AIGT on Social MediaLong
  220. Are Your LLMs Capable of Stable Reasoning?finding
  221. Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMsLong
  222. Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspectivefinding
  223. ArgInstruct: Specialized Instruction Fine-Tuning for Computational Argumentationfinding
  224. Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generationfinding
  225. Aria-UI: Visual Grounding for GUI Instructionsfinding
  226. Aristotle: Mastering Logical Reasoning with A Logic-Complete Decompose-Search-Resolve FrameworkLong
  227. Around the World in 24 Hours: Probing LLM Knowledge of Time and PlaceLong
  228. Asclepius: A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language ModelsLong
  229. Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generationfinding
  230. Ask-Before-Detection: Identifying and Mitigating Conformity Bias in LLM-Powered Error Detector for Math Word Problem SolutionsLong
  231. AskQE: Question Answering as Automatic Evaluation for Machine Translationfinding
  232. Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning TasksLong
  233. Assessing Reliability and Political Bias In LLMs’ Judgements of Formal and Material Inferences With Partisan ConclusionsLong
  234. Assessing the Reasoning Capabilities of LLMs in the context of Evidence-based Claim Verificationfinding
  235. Assessment and manipulation of latent constructs in pre-trained language models using psychometric scalesLong
  236. Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decompositionfinding
  237. Assimilation and Accommodation: Task-Adaptive Hierarchical Abstraction for Solving Web Tasksfinding
  238. Astute RAG: Overcoming Imperfect Retrieval Augmentation and Knowledge Conflicts for Large Language ModelsLong
  239. Asymmetric Conflict and Synergy in Post-training for LLM-based Multilingual Machine Translationfinding
  240. Attacking Vision-Language Computer Agents via Pop-upsLong
  241. Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language ModelsLong
  242. Attention Speaks Volumes: Localizing and Mitigating Bias in Language ModelsLong
  243. Attention with Dependency Parsing Augmentation for Fine-Grained Attributionfinding
  244. Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee DiscussionsLong
  245. AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMsLong
  246. AutoMedEval: Harnessing Language Models for Automatic Medical Capability EvaluationLong
  247. AutoMixAlign: Adaptive Data Mixing for Multi-Task Preference Optimization in LLMsLong
  248. AutoMixer: Checkpoint Artifacts as Automatic Data MixersLong
  249. Automated CAD Modeling Sequence Generation from Text Descriptions via Transformer-Based Large Language ModelsLong
  250. Automated Fine-Grained Mixture-of-Experts Quantizationfinding
  251. Automated Structured Radiology Report GenerationLong
  252. Automated main concept generation for narrative discourse assessment in aphasiafinding
  253. Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation BenchmarkLong
  254. Automatic Expert Discovery in LLM Upcycling via Sparse Interpolated Mixture-of-ExpertsLong
  255. Automatic Transmission for LLM Tiers: Optimizing Cost and Accuracy in Large Language Modelsfinding
  256. Automatic detection of dyslexia based on eye movements during reading in RussianShort
  257. Automating Legal Interpretation with LLMs: Retrieval, Generation, and EvaluationLong
  258. Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical Textsfinding
  259. Autoregressive Speech Synthesis without Vector QuantizationLong
  260. Awes, Laws, and Flaws From Today’s LLM Researchfinding
  261. BAR: A Backward Reasoning based Agent for Complex Minecraft Tasksfinding
  262. BEDAA: Bayesian Enhanced DeBERTa for Uncertainty-Aware Authorship Attributionfinding
  263. BELLE: A Bi-Level Multi-Agent Reasoning Framework for Multi-Hop Question AnsweringLong
  264. BERT-like Models for Slavic Morpheme SegmentationLong
  265. BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of Englishfinding
  266. BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem ProvingLong
  267. BIG-Bench Extra HardLong
  268. BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded DataLong
  269. BIPro: Zero-shot Chinese Poem Generation via Block Inverse Prompting Constrained Generation FrameworkLong
  270. BMIKE-53: Investigating Cross-Lingual Knowledge Editing with In-Context LearningLong
  271. BOOKCOREF: Coreference Resolution at Book ScaleLong
  272. BOOKWORLD: From Novels to Interactive Agent Societies for Story CreationLong
  273. BOSE: A Systematic Evaluation Method Optimized for Base Modelsfinding
  274. BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem SolvingLong
  275. BQA: Body Language Question Answering Dataset for Video Large Language ModelsShort
  276. BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 LanguagesLong
  277. BabelEdits: A Benchmark and a Modular Approach for Robust Cross-lingual Knowledge Editing of Large Language Modelsfinding
  278. BadWindtunnel: Defending Backdoor in High-noise Simulated Training with Confidence Variancefinding
  279. Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text GenerationLong
  280. Balancing the Budget: Understanding Trade-offs Between Supervised and Preference-Based FinetuningLong
  281. BanStereoSet: A Dataset to Measure Stereotypical Social Biases in LLMs for Banglafinding
  282. Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizersfinding
  283. Basic Reading DistillationLong
  284. Batayan: A Filipino NLP benchmark for evaluating Large Language ModelsLong
  285. Battling against Tough Resister: Strategy Planning with Adversarial Game for Non-collaborative DialoguesLong
  286. BayesKD: Bayesian Knowledge Distillation for Compact LLMs in Constrained Fine-tuning Scenariosfinding
  287. Bayesian Optimization for Controlled Image Editing via LLMsfinding
  288. Be Cautious When Merging Unfamiliar LLMs: A Phishing Model Capable of Stealing Privacyfinding
  289. BeamLoRA: Beam-Constraint Low-Rank AdaptationLong
  290. BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language ModelsLong
  291. Behavioral Analysis of Information Salience in Large Language Modelsfinding
  292. Behavioural vs. Representational Systematicity in End-to-End Models: An Opinionated SurveyLong
  293. Behind Closed Words: Creating and Investigating the forePLay Annotated Dataset for Polish Erotic DiscourseLong
  294. BelarusianGLUE: Towards a Natural Language Understanding Benchmark for BelarusianLong
  295. BenNumEval: A Benchmark to Assess LLMs’ Numerical Reasoning Capabilities in Bengalifinding
  296. Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code RepositoriesLong
  297. Benchmarking Long-Context Language Models on Long Code UnderstandingLong
  298. Benchmarking Multi-National Value Alignment for Large Language Modelsfinding
  299. Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language ModelsLong
  300. Benchmarking Query-Conditioned Natural Language Inferencefinding
  301. Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and ReasoningLong
  302. Benchmarking the Benchmarks: Reproducing Climate-Related NLP Tasksfinding
  303. Better Embeddings with Coupled AdamLong
  304. Better Process Supervision with Bi-directional Rewarding Signalsfinding
  305. Better Red Teaming via Searching with Large Language Modelfinding
  306. Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic BiasesLong
  307. Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMsLong
  308. Beyond Browsing: API-Based Web Agentsfinding
  309. Beyond Completion: A Foundation Model for General Knowledge Graph Reasoningfinding
  310. Beyond Context to Cognitive Appraisal: Emotion Reasoning as a Theory of Mind Benchmark for Large Language Modelsfinding
  311. Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translationfinding
  312. Beyond Demographics: Fine-tuning Large Language Models to Predict Individuals’ Subjective Text PerceptionsLong
  313. Beyond Dialogue: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language ModelLong
  314. Beyond Facts: Evaluating Intent Hallucination in Large Language ModelsLong
  315. Beyond Factual Accuracy: Evaluating Coverage of Diverse Factual Information in Long-form Text Generationfinding
  316. Beyond Frameworks: Unpacking Collaboration Strategies in Multi-Agent SystemsLong
  317. Beyond Generation: Leveraging LLM Creativity to Overcome Label Bias in Classificationfinding
  318. Beyond In-Context Learning: Aligning Long-form Generation of Large Language Models via Task-Inherent Attribute Guidelinesfinding
  319. Beyond Logits: Aligning Feature Dynamics for Effective Knowledge DistillationLong
  320. Beyond N-Grams: Rethinking Evaluation Metrics and Strategies for Multilingual Abstractive SummarizationLong
  321. Beyond Negative Stereotypes – Non-Negative Abusive Utterances about Identity Groups and Their Semantic VariantsLong
  322. Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agentsfinding
  323. Beyond One-Size-Fits-All: Tailored Benchmarks for Efficient EvaluationLong
  324. Beyond Output Matching: Bidirectional Alignment for Enhanced In-Context LearningLong
  325. Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Taskfinding
  326. Beyond Position: the emergence of wavelet-like properties in TransformersLong
  327. Beyond Profile: From Surface-Level Facts to Deep Persona Simulation in LLMsfinding
  328. Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target AtomsLong
  329. Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question AnsweringLong
  330. Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulationfinding
  331. Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarityfinding
  332. Beyond Sequences: Two-dimensional Representation and Dependency Encoding for Code GenerationLong
  333. Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data SelectionLong
  334. Beyond Single Labels: Improving Conversational Recommendation through LLM-Powered Data AugmentationLong
  335. Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosisfinding
  336. Beyond Surface Simplicity: Revealing Hidden Reasoning Attributes for Precise Commonsense DiagnosisLong
  337. Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMsfinding
  338. Beyond Text Compression: Evaluating Tokenizers Across ScalesLong
  339. Beyond Text: Characterizing Domain Expert Needs in Document Researchfinding
  340. Beyond True or False: Retrieval-Augmented Hierarchical Analysis of Nuanced ClaimsLong
  341. Beyond Verbal Cues: Emotional Contagion Graph Network for Causal Emotion Entailmentfinding
  342. Beyond Words: Integrating Theory of Mind into Conversational Agents for Human-Like Belief, Desire, and Intention Alignmentfinding
  343. Beyond instruction-conditioning, MoTE: Mixture of Task Experts for Multi-task Embedding Modelsfinding
  344. Beyond the Answer: Advancing Multi-Hop QA with Fine-Grained Graph Reasoning and EvaluationLong
  345. Beyond the Average Reader: the Reader Embedding Approachfinding
  346. Beyond the Spelling Miracle: Investigating Substring Awareness in Character-Blind Language Modelsfinding
  347. Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Modelsfinding
  348. Bi-Tuning with Collaborative Information for Controllable LLM-based Sequential RecommendationLong
  349. Bias in Language Models: Beyond Trick Tests and Towards RUTEd EvaluationLong
  350. Bias in the Mirror : Are LLMs opinions robust to their own adversarial attacksLong
  351. BiasGuard: A Reasoning-Enhanced Bias Detection Tool for Large Language Modelsfinding
  352. Biased LLMs can Influence Political Decision-MakingLong
  353. Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomesfinding
  354. Bilingual Zero-Shot Stance DetectionLong
  355. Binary Classifier Optimization for Large Language Model AlignmentLong
  356. BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domainfinding
  357. Bitnet.cpp: Efficient Edge Inference for Ternary LLMsLong
  358. Blessing of Multilinguality: A Systematic Analysis of Multilingual In-Context Learningfinding
  359. Blinded by Context: Unveiling the Halo Effect of MLLM in AI Hiringfinding
  360. BlockPruner: Fine-grained Pruning for Large Language Modelsfinding
  361. Bone Soups: A Seek-and-Soup Model Merging Approach for Controllable Multi-Objective GenerationLong
  362. Boost, Disentangle, and Customize: A Robust System2-to-System1 Pipeline for Code Generationfinding
  363. Boosting LLM Translation Skills without General Ability Loss via Rationale Distillationfinding
  364. Boosting LLM’s Molecular Structure Elucidation with Knowledge Enhanced Tree Search ReasoningLong
  365. Boosting Long-Context Information Seeking via Query-Guided Activation RefillingLong
  366. Boosting Policy and Process Reward Models with Monte Carlo Tree Search in Open-Domain QAfinding
  367. Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Datafinding
  368. BottleHumor: Self-Informed Humor Explanation using the Information Bottleneck Principlefinding
  369. BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generationfinding
  370. Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Spacefinding
  371. Breaking the Reasoning Barrier A Survey on LLM Complex Reasoning through the Lens of Self-Evolutionfinding
  372. Bregman Conditional Random Fields: Sequence Labeling with Parallelizable Inference AlgorithmsLong
  373. Brevity is the soul of sustainability: Characterizing LLM response lengthsfinding
  374. BridG MT: Enhancing LLMs’ Machine Translation Capabilities with Sentence Bridging and Gradual MTfinding
  375. Bridge-Coder: Transferring Model Capabilities from High-Resource to Low-Resource Programming Languagefinding
  376. Bridging Intuitive Associations and Deliberate Recall: Empowering LLM Personal Assistant with Graph-Structured Long-term Memoryfinding
  377. Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generationfinding
  378. Bridging Robustness and Generalization Against Word Substitution Attacks in NLP via the Growth Bound Matrix Approachfinding
  379. Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual InterventionLong
  380. BriefMe: A Legal NLP Benchmark for Assisting with Legal Briefsfinding
  381. Browsing Like Human: A Multimodal Web Agent with Experiential Fast-and-Slow ThinkingLong
  382. Browsing Lost Unformed Recollections: A Benchmark for Tip-of-the-Tongue Search and ReasoningLong
  383. Building A Proof-Oriented Programmer That Is 64% Better Than GPT-4o Under Data Scarcityfinding
  384. Building Better: Avoiding Pitfalls in Developing Language Resources when Data is ScarceLong
  385. Building a Long Text Privacy Policy Corpus with Multi-Class LabelsLong
  386. Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?finding
  387. Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy GradientLong
  388. Byte Latent Transformer: Patches Scale Better Than TokensLong
  389. C2KD: Cross-layer and Cross-head Knowledge Distillation for Small Language Model-based Recommendationfinding
  390. C2LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluationfinding
  391. CA-GAR: Context-Aware Alignment of LLM Generation for Document Retrievalfinding
  392. CADReview: Automatically Reviewing CAD Programs with Error Detection and CorrectionLong
  393. CAMI: A Counselor Agent Supporting Motivational Interviewing through State Inference and Topic ExplorationLong
  394. CARE-STaR: Constraint-aware Self-taught Reasonerfinding
  395. CARMO: Dynamic Criteria Generation for Context Aware Reward Modellingfinding
  396. CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic ModelingLong
  397. CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representationsfinding
  398. CC-Tuning: A Cross-Lingual Connection Mechanism for Improving Joint Multilingual Supervised Fine-TuningLong
  399. CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language ModelsLong
  400. CDS: Data Synthesis Method Guided by Cognitive Diagnosis Theoryfinding
  401. CEAES: Bidirectional Reinforcement Learning Optimization for Consistent and Explainable Essay AssessmentLong
  402. CENTAUR: Bridging the Impossible Trinity of Privacy, Efficiency, and Performance in Privacy-Preserving Transformer InferenceLong
  403. CER: Confidence Enhanced Reasoning in LLMsLong
  404. CFBench: A Comprehensive Constraints-Following Benchmark for LLMsLong
  405. CHARPEVAL: Benchmarking Large Language Models’ Contextual Reasoning in Knowledge-Grounded Dialoguefinding
  406. CHEER-Ekman: Fine-grained Embodied Emotion ClassificationShort
  407. CKnowEdit: A New Chinese Knowledge Editing Dataset for Linguistics, Facts, and Logic Error Correction in LLMsLong
  408. CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention InterventionLong
  409. CLEAR: Character Unlearning in Textual and Visual Modalitiesfinding
  410. CLEME2.0: Towards Interpretable Evaluation by Disentangling Edits for Grammatical Error CorrectionLong
  411. CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIPLong
  412. CLIX: Cross-Lingual Explanations of Idiomatic Expressionsfinding
  413. CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languagesfinding
  414. CLaSp: In-Context Layer Skip for Self-Speculative DecodingLong
  415. CLeVeR: Multi-modal Contrastive Learning for Vulnerability Code Representationfinding
  416. CMHKF: Cross-Modality Heterogeneous Knowledge Fusion for Weakly Supervised Video Anomaly DetectionLong
  417. CMIE: Combining MLLM Insights with External Evidence for Explainable Out-of-Context Misinformation Detectionfinding
  418. CMQCIC-Bench: A Chinese Benchmark for Evaluating Large Language Models in Medical Quality Control Indicator Calculationfinding
  419. CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novelsfinding
  420. CODEMENV: Benchmarking Large Language Models on Code Migrationfinding
  421. COMPKE: Complex Question Answering under Knowledge Editingfinding
  422. CONFETTI: Conversational Function-Calling Evaluation Through Turn-Level InteractionsLong
  423. CONSENSAGENT: Towards Efficient and Effective Consensus in Multi-Agent LLM Interactions Through Sycophancy Mitigationfinding
  424. COPR: Continual Human Preference Learning via Optimal Policy Regularizationfinding
  425. CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative DrafterLong
  426. CORDIAL: Can Multimodal Large Language Models Effectively Understand Coherence Relationships?Long
  427. COSMIC: Generalized Refusal Direction Identification in LLM Activationsfinding
  428. COSMMIC: Comment-Sensitive Multimodal Multilingual Indian Corpus for Summarization and Headline GenerationLong
  429. COVER: Context-Driven Over-Refusal Verification in LLMsfinding
  430. CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agentsfinding
  431. CROSSAGENTIE: Cross-Type and Cross-Task Multi-Agent LLM Collaboration for Zero-Shot Information Extractionfinding
  432. CRPO: Confidence-Reward Driven Preference Optimization for Machine Translationfinding
  433. CRUXEVAL-X: A Benchmark for Multilingual Code Reasoning, Understanding and ExecutionLong
  434. CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language ModelsLong
  435. CSTRL: Context-Driven Sequential Transfer Learning for Abstractive Radiology Report Summarizationfinding
  436. CSTree-SRI: Introspection-Driven Cognitive Semantic Tree for Multi-Turn Question Answering over Extra-Long ContextsLong
  437. CTPD: Cross-Modal Temporal Pattern Discovery for Enhanced Multimodal Electronic Health Records Analysisfinding
  438. CU-MAM: Coherence-Driven Unified Macro-Structures for Argument MiningLong
  439. CULEMO: Cultural Lenses on Emotion - Benchmarking LLMs for Cross-Cultural Emotion UnderstandingLong
  440. CaLMQA: Exploring culturally specific long-form question answering across 23 languagesLong
  441. CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-JudgesLong
  442. Call for Rigor in Reporting Quality of Instruction Tuning DataShort
  443. Can Community Notes Replace Professional Fact-Checkers?Short
  444. Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?Long
  445. Can Graph Descriptive Order Affect Solving Graph Problems with LLMs?Long
  446. Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision?Long
  447. Can Hallucination Correction Improve Video-Language Alignment?finding
  448. Can Indirect Prompt Injection Attacks Be Detected and Removed?Long
  449. Can Input Attributions Explain Inductive Reasoning in In-Context Learning?finding
  450. Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question AnsweringLong
  451. Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?Long
  452. Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text UpdatesLong
  453. Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge GraphsLong
  454. Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and ExposureShort
  455. Can LLMs Ground when they (Don’t) Know: A Study on Direct and Loaded Political QuestionsLong
  456. Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMsLong
  457. Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research PapersLong
  458. Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification InferenceLong
  459. Can LLMs Simulate L2-English Dialogue? An Information-Theoretic Analysis of L1-Dependent BiasesLong
  460. Can LLMs Understand Unvoiced Speech? Exploring EMG-to-Text Conversion with LLMsShort
  461. Can Language Models Capture Human Writing Preferences for Domain-Specific Text Summarization?finding
  462. Can Language Models Reason about Individualistic Human Values and Preferences?Long
  463. Can Language Models Replace Programmers for Coding? REPOCOD Says ‘Not Yet’Long
  464. Can Language Models Serve as Analogy Annotators?finding
  465. Can Large Language Models Accurately Generate Answer Keys for Health-related Questions?Short
  466. Can Large Language Models Address Open-Target Stance Detection?finding
  467. Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?Long
  468. Can Large Language Models Understand Argument Schemes?finding
  469. Can Large Language Models Understand Internet Buzzwords Through User-Generated ContentLong
  470. Can MLLMs Understand the Deep Implication Behind Chinese Images?Long
  471. Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?finding
  472. Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papersfinding
  473. Can Multimodal Large Language Models Understand Spatial Relations?Long
  474. Can Third Parties Read Our Emotions?Long
  475. Can Uniform Meaning Representation Help GPT-4 Translate from Indigenous Languages?Short
  476. Can VLMs Actually See and Read? A Survey on Modality Collapse in Vision-Language Modelsfinding
  477. Can Vision Language Models Understand Mimed Actions?finding
  478. Can Vision-Language Models Evaluate Handwritten Math?Long
  479. Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging TasksLong
  480. Can We Trust AI Doctors? A Survey of Medical Hallucination in Large Language and Large Vision-Language Modelsfinding
  481. Can You Really Trust Code Copilot? Evaluating Large Language Models from a Code Security PerspectiveLong
  482. Can You Share Your Story? Modeling Clients’ Metacognition and Openness for LLM Therapist Evaluationfinding
  483. Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language ModelLong
  484. Can we Retrieve Everything All at Once? ARM: An Alignment-Oriented LLM-based Retrieval MethodLong
  485. Can’t See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMsLong
  486. CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Erafinding
  487. Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling LawLong
  488. Capture the Key in Reasoning to Enhance CoT Distillation GeneralizationLong
  489. Capturing Author Self Beliefs in Social Media LanguageLong
  490. Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Modelsfinding
  491. Causal Denoising Prototypical Network for Few-Shot Multi-label Aspect Category Detectionfinding
  492. Causal Estimation of Tokenisation BiasLong
  493. Causal Graph based Event Reasoning using Semantic Relation ExpertsLong
  494. CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstentionfinding
  495. CausalLink: An Interactive Evaluation Framework for Causal Reasoningfinding
  496. CausalRAG: Integrating Causal Graphs into Retrieval-Augmented Generationfinding
  497. Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental DistractionsLong
  498. Cautious Next Token Predictionfinding
  499. Centurio: On Drivers of Multilingual Ability of Large Vision-Language ModelLong
  500. Chain of Attack: Hide Your Intention through Multi-Turn Interrogationfinding
  501. Chain of Methodologies: Scaling Test Time Computation without Trainingfinding
  502. Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesisfinding
  503. Chain-of-Jailbreak Attack for Image Generation Models via Step by Step Editingfinding
  504. Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm PerspectiveLong
  505. Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Modelsfinding
  506. ChainEdit: Propagating Ripple Effects in LLM Knowledge Editing through Logical Rule-Guided ChainsLong
  507. Change Entity-guided Heterogeneous Representation Disentangling for Change Captioningfinding
  508. ChartCoder: Advancing Multimodal Large Language Model for Chart-to-Code GenerationLong
  509. ChartEdit: How Far Are MLLMs From Automating Chart Analysis? Evaluating MLLMs’ Capability via Chart Editingfinding
  510. ChartLens: Fine-grained Visual Attribution in ChartsLong
  511. ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answeringfinding
  512. ChatBench: From Static Benchmarks to Human-AI EvaluationLong
  513. ChatMap: Mining Human Thought Processes for Customer Service Chatbots via Multi-Agent Collaborationfinding
  514. ChatSOP: An SOP-Guided MCTS Planning Framework for Controllable LLM Dialogue AgentsLong
  515. CheXalign: Preference fine-tuning in chest X-ray interpretation models without human feedbackLong
  516. Cheap Character Noise for OCR-Robust Multilingual Embeddingsfinding
  517. Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from ScratchLong
  518. ChemActor: Enhancing Automated Extraction of Chemical Synthesis Actions with LLM-Generated DataLong
  519. ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5Long
  520. Chinese Inertial GAN for Handwriting Signal Generation and RecognitionLong
  521. Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language ModelsLong
  522. Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language ModelsLong
  523. ChronoSense: Exploring Temporal Understanding in Large Language Models with Time Intervals of EventsShort
  524. ChuLo: Chunk-Level Key Information Representation for Long Document Understandingfinding
  525. Chumor 2.0: Towards Better Benchmarking Chinese Humor Understanding from (Ruo Zhi Ba)finding
  526. CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challengefinding
  527. Circuit Compositions: Exploring Modular Structures in Transformer-Based Language ModelsLong
  528. Circuit Stability Characterizes Language Model GeneralizationLong
  529. CitaLaw: Enhancing LLM with Citations in Legal Domainfinding
  530. CiteEval: Principle-Driven Citation Evaluation for Source AttributionLong
  531. CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global MemoryLong
  532. ClaimPKG: Enhancing Claim Verification via Pseudo-Subgraph Generation with Lightweight Specialized LLMfinding
  533. Clarifying Underspecified Discourse Relations in Instructional Textsfinding
  534. Class Distillation with Mahalanobis Contrast: An Efficient Training Paradigm for Pragmatic Language Understanding TasksLong
  535. Classifying Unreliable Narrators with Large Language ModelsLong
  536. CliniDial: A Naturally Occurring Multimodal Dialogue Dataset for Team Reflection in Action During Clinical Operationfinding
  537. ClozeMath: Improving Mathematical Reasoning in Language Models by Learning to Fill Equationsfinding
  538. ClusComp: A Simple Paradigm for Model Compression and Efficient Finetuningfinding
  539. ClusterAttn: KV Cache Compression under Intrinsic Attention ClusteringLong
  540. CoAM: Corpus of All-Type Multiword ExpressionsLong
  541. CoCoLex: Confidence-guided Copy-based Decoding for Grounded Legal Text GenerationLong
  542. CoD, Towards an Interpretable Medical Agent using Chain of Diagnosisfinding
  543. CoDet-M4: Detecting Machine-Generated Code in Multi-Lingual, Multi-Generator and Multi-Domain Settingsfinding
  544. CoE: A Clue of Emotion Framework for Emotion Recognition in ConversationsLong
  545. CoIR: A Comprehensive Benchmark for Code Information Retrieval ModelsLong
  546. CoLA: Collaborative Low-Rank Adaptationfinding
  547. CoMet: Metaphor-Driven Covert Communication for Multi-Agent Language GamesLong
  548. CoMuMDR: Code-mixed Multi-modal Multi-domain corpus for Discourse paRsing in conversationsfinding
  549. CoRE: Condition-based Reasoning for Identifying Outcome Variance in Complex Eventsfinding
  550. CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAGLong
  551. CoRet: Improved Retriever for Code EditingShort
  552. CoT-ICL Lab: A Synthetic Framework for Studying Chain-of-Thought Learning from In-Context DemonstrationsLong
  553. CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thoughtfinding
  554. CoT-VTM: Visual-to-Music Generation with Chain-of-Thought Reasoningfinding
  555. CoT-Valve: Length-Compressible Chain-of-Thought TuningLong
  556. CoT-based Synthesizer: Enhancing LLM Performance through Answer SynthesisLong
  557. CoVE: Compressed Vocabulary Expansion Makes Better LLM-based Recommender Systemsfinding
  558. CoachMe: Decoding Sport Elements with a Reference-Based Coaching Instruction Generation ModelLong
  559. Code-SPA: Style Preference Alignment to Large Language Models for Effective and Robust Code Debuggingfinding
  560. Code-Switching Curriculum Learning for Multilingual Transfer in LLMsfinding
  561. Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual UnderstandingLong
  562. Code-Switching and Syntax: A Large-Scale Experimentfinding
  563. CodeDPO: Aligning Code Models with Self Generated and Verified Source CodeLong
  564. CodePRM: Execution Feedback-enhanced Process Reward Model for Code Generationfinding
  565. CodeReviewQA: The Code Review Comprehension Assessment for Large Language Modelsfinding
  566. CodeScientist: End-to-End Semi-Automated Scientific Discovery with Code-based Experimentationfinding
  567. CodeTaxo: Enhancing Taxonomy Expansion with Limited Examples via Code Language Promptsfinding
  568. CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process SupervisionLong
  569. CodeV: Issue Resolving with Visual Datafinding
  570. CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Modelsfinding
  571. CogniBench: A Legal-inspired Framework and Dataset for Assessing Cognitive Faithfulness of Large Language ModelsLong
  572. CoinMath: Harnessing the Power of Coding Instruction for Math LLMfinding
  573. Collapse of Dense Retrievers: Short, Early, and Literal Biases Outranking Factual EvidenceLong
  574. Colloquial Singaporean English Style Transfer with Fine-Grained Explainable ControlLong
  575. Com2 : A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language ModelsLong
  576. Combining Domain and Alignment Vectors Provides Better Knowledge-Safety Trade-offs in LLMsShort
  577. Combining the Best of Both Worlds: A Method for Hybrid NMT and LLM Translationfinding
  578. Commonsense Reasoning in Arab CultureLong
  579. Communication-Efficient and Tensorized Federated Fine-Tuning of Large Language Modelsfinding
  580. Comparing Bad Apples to Good Oranges Aligning Large Language Models via Joint Preference Optimizationfinding
  581. Comparing LLM-generated and human-authored news text using formal syntactic theoryLong
  582. Comparing Moral Values in Western English-speaking societies and LLMs with Word AssociationsLong
  583. Comparison-based Active Preference Learning for Multi-dimensional PersonalizationLong
  584. ComparisonQA: Evaluating Factuality Robustness of LLMs Through Knowledge Frequency Control and Uncertaintyfinding
  585. CompileAgent: Automated Real-World Repo-Level Compilation with Tool-Integrated LLM-based Agent SystemLong
  586. Completing A Systematic Review in Hours instead of Months with Interactive AI AgentsLong
  587. Compositional Syntactico-SemBanking for English as a Second or Foreign Languagefinding
  588. Computation Mechanism Behind LLM Position GeneralizationLong
  589. Compute Optimal Scaling of Skills: Knowledge vs Reasoningfinding
  590. Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual ModalitiesLong
  591. ConECT Dataset: Overcoming Data Scarcity in Context-Aware E-Commerce MTShort
  592. ConFit v2: Improving Resume-Job Matching using Hypothetical Resume Embedding and Runner-Up Hard-Negative Miningfinding
  593. ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoningfinding
  594. ConLoan: A Contrastive Multilingual Dataset for Evaluating LoanwordsLong
  595. ConSim: Measuring Concept-Based Explanations’ Effectiveness with Automated SimulatabilityLong
  596. ConceptCarve: Dynamic Realization of EvidenceLong
  597. Conditional Dichotomy Quantification via Geometric EmbeddingLong
  598. Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and RefinementLong
  599. Confidence Improves Self-Consistency in LLMsfinding
  600. Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMsLong
  601. Conformity in Large Language ModelsLong
  602. Conservative Bias in Large Language Models: Measuring Relation Predictionsfinding
  603. ConsistencyChecker: Tree-based Evaluation of LLM Generalization CapabilitiesLong
  604. Consistent Client Simulation for Motivational Interviewing-based CounselingLong
  605. Conspiracy Theories and Where to Find Them on TikTokLong
  606. Consultant Decoding: Yet Another Synergistic Mechanismfinding
  607. Context-Aware Hierarchical Merging for Long Document Summarizationfinding
  608. Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing AgentsLong
  609. Context-DPO: Aligning Language Models for Context-Faithfulnessfinding
  610. Context-Robust Knowledge Editing for Language Modelsfinding
  611. Contextual Experience Replay for Self-Improvement of Language AgentsLong
  612. Continual Gradient Low-Rank Projection Fine-Tuning for LLMsLong
  613. Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?finding
  614. Continued Pretraining and Interpretability-Based Evaluation for Low-Resource Languages: A Galician Case Studyfinding
  615. Contrastive Learning for Task-Independent SpeechLLM-Pretrainingfinding
  616. Contrastive Learning on LLM Back Generation Treebank for Cross-domain Constituency ParsingLong
  617. Contrastive Perplexity for Controlled Generation: An Application in Detoxifying Large Language ModelsLong
  618. Contrastive Prompting Enhances Sentence Embeddings in LLMs through Inference-Time SteeringLong
  619. ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style ControlLong
  620. Controllable Style Arithmetic with Language ModelsLong
  621. Controllable and Reliable Knowledge-Intensive Task-Oriented Conversational Agents with Declarative Genie WorksheetsLong
  622. Controlled Low-Rank Adaptation with Subspace Regularization for Continued Training on Large Language ModelsLong
  623. Cool-Fusion: Fuse Large Language Models without TrainingLong
  624. Cooperative or Competitive? Understanding the Interaction between Attention Heads From A Game Theory PerspectiveLong
  625. Coordinating Chaos: A Structured Review of Linguistic Coordination MethodologiesLong
  626. Core: Robust Factual Precision with Informative Sub-Claim Identificationfinding
  627. CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM EvaluationLong
  628. Corpus Poisoning via Approximate Greedy Gradient Descentfinding
  629. Correcting on Graph: Faithful Semantic Parsing over Knowledge Graphs with Large Language Modelsfinding
  630. CortexDebate: Debating Sparsely and Equally for Multi-Agent Debatefinding
  631. Counterfactual-Consistency Prompting for Relative Temporal Understanding in Large Language ModelsShort
  632. Counterspeech the ultimate shield! Multi-Conditioned Counterspeech Generation through Attributed Prefix LearningLong
  633. CourtEval: A Courtroom-Based Multi-Agent Evaluation Frameworkfinding
  634. Crab: A Novel Configurable Role-Playing LLM with Assessing BenchmarkLong
  635. Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settingsfinding
  636. Cracking Factual Knowledge: A Comprehensive Analysis of Degenerate Knowledge Neurons in Large Language ModelsLong
  637. Cracking the Code of Hallucination in LVLMs with Vision-aware Head DivergenceLong
  638. CrafText Benchmark: Advancing Instruction Following in Complex Multimodal Open-Ended WorldLong
  639. Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space CapacityLong
  640. Craw4LLM: Efficient Web Crawling for LLM Pretrainingfinding
  641. Creating a Lens of Chinese Culture: A Multimodal Dataset for Chinese Pun Rebus Art Understandingfinding
  642. CrisisTS: Coupling Social Media Textual Data and Meteorological Time Series for Urgency ClassificationLong
  643. CritiQ: Mining Data Quality Criteria from Human PreferencesLong
  644. Critic-CoT: Boosting the Reasoning Abilities of Large Language Model via Chain-of-Thought Criticfinding
  645. Croppable Knowledge Graph EmbeddingLong
  646. Cross-Lingual Auto Evaluation for Assessing Multilingual LLMsLong
  647. Cross-Lingual Generalization and Compression: From Language-Specific to Shared NeuronsLong
  648. Cross-Lingual Optimization for Language Transfer in Large Language ModelsLong
  649. Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language ModelsLong
  650. Cross-Lingual Representation Alignment Through Contrastive Image-Caption TuningShort
  651. Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric PhenomenonShort
  652. Cross-Lingual Transfer of Debiasing and Detoxification in Multilingual LLMs: An Extensive Investigationfinding
  653. Cross-lingual Multimodal Sentiment Analysis for Low-Resource Languages via Language Family Disentanglement and Rethinking Transferfinding
  654. Cross-model Transferability among Large Language Models on the Platonic Representations of ConceptsLong
  655. Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-JudgeLong
  656. Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast AsiaLong
  657. CtrlA: Adaptive Retrieval-Augmented Generation via Inherent Controlfinding
  658. Cuckoo: An IE Free Rider Hatched by Massive Nutrition in LLM’s NestLong
  659. CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data SynthesisLong
  660. Cultivating Gaming Sense for Yourself: Making VLMs Gaming ExpertsLong
  661. Cultural Bias Matters: A Cross-Cultural Benchmark Dataset and Sentiment-Enriched Model for Understanding Multimodal MetaphorsLong
  662. Cultural Learning-Based Culture Adaptation of Language ModelsLong
  663. CulturalBench: A Robust, Diverse and Challenging Benchmark for Measuring LMs’ Cultural Knowledge Through Human-AI Red-TeamingLong
  664. Culture Matters in Toxic Language Detection in PersianLong
  665. Culture is Not Trivia: Sociocultural Theory for Cultural NLPLong
  666. Curiosity-Driven Reinforcement Learning from Human FeedbackLong
  667. Curriculum Debiasing: Toward Robust Parameter-Efficient Fine-Tuning Against Dataset BiasesLong
  668. Customizing In-context Learning for Dynamic Interest Adaption in LLM-based Recommendationfinding
  669. CxGGEC: Construction-Guided Grammatical Error CorrectionLong
  670. CypherBench: Towards Precise Retrieval over Full-scale Modern Knowledge Graphs in the LLM EraLong
  671. C²RBench: A Chinese Complex Reasoning Benchmark for Large Language Modelsfinding
  672. D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Modelsfinding
  673. D.Va: Validate Your Demonstration First Before You Use ItLong
  674. DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt CompressionLong
  675. DAGS: A Dependency-Based Dual-Attention and Global Semantic Improvement Framework for Metaphor Recognitionfinding
  676. DALR: Dual-level Alignment Learning for Multimodal Sentence Representation Learningfinding
  677. DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Accelerationfinding
  678. DAPE V2: Process Attention Score as Feature Map for Length ExtrapolationLong
  679. DAPI: Domain Adaptive Toxicity Probe Vector Intervention, for Fine-Grained Detoxificationfinding
  680. DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree TraversalLong
  681. DAST: Context-Aware Compression in LLMs via Dynamic Allocation of Soft Tokensfinding
  682. DCG-SQL: Enhancing In-Context Learning for Text-to-SQL with Deep Contextual Schema Link GraphLong
  683. DDxTutor: Clinical Reasoning Tutoring System with Differential Diagnosis-Based Structured ReasoningLong
  684. DEEPER Insight into Your User: Directed Persona Refinement for Dynamic Persona ModelingLong
  685. DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editingfinding
  686. DEMO: Reframing Dialogue Interaction with Fine-grained Element Modelingfinding
  687. DI-BENCH: Benchmarking Large Language Models on Dependency Inference with Testable Repositories at Scalefinding
  688. DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialoguesfinding
  689. DIESEL: A Lightweight Inference-Time Safety Enhancement for Language Modelsfinding
  690. DISC: Plug-and-Play Decoding Intervention with Similarity of Characters for Chinese Spelling CheckLong
  691. DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-ExpertsLong
  692. DNASpeech: A Contextualized and Situated Text-to-Speech Dataset with Dialogues, Narratives and ActionsLong
  693. DNCASR: End-to-End Training for Speaker-Attributed ASRLong
  694. DOVE: A Large-Scale Multi-Dimensional Predictions Dataset Towards Meaningful LLM Evaluationfinding
  695. DPGA-TextSyn: Differentially Private Genetic Algorithm for Synthetic Text Generationfinding
  696. DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimizationfinding
  697. DRAE: Dynamic Retrieval-Augmented Expert Networks for Lifelong Learning and Task Adaptation in RoboticsLong
  698. DRAG: Distilling RAG for SLMs from LLMs to Transfer Knowledge and Mitigate Hallucination via Evidence and Graph-based DistillationLong
  699. DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense RetrieversLong
  700. DREsS: Dataset for Rubric-based Essay Scoring on EFL WritingLong
  701. DRPruning: Efficient Large Language Model Pruning through Distributionally Robust OptimizationLong
  702. DRS: Deep Question Reformulation With Structured Outputfinding
  703. DRT: Deep Reasoning Translation via Long Chain-of-Thoughtfinding
  704. DReSD: Dense Retrieval for Speculative Decodingfinding
  705. DS2-ABSA: Dual-Stream Data Synthesis with Label Refinement for Few-Shot Aspect-Based Sentiment AnalysisLong
  706. DTCRS: Dynamic Tree Construction for Recursive SummarizationLong
  707. DYNTEXT: Semantic-Aware Dynamic Text Sanitization for Privacy-Preserving LLM Inferencefinding
  708. DaNet: Dual-Aware Enhanced Alignment Network for Multimodal Aspect-Based Sentiment Analysisfinding
  709. Data Caricatures: On the Representation of African American Language in Pretraining CorporaLong
  710. Data Interpreter: An LLM Agent for Data Sciencefinding
  711. Data Laundering: Artificially Boosting Benchmark Results through Knowledge DistillationLong
  712. Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language PlanningLong
  713. Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context LearningLong
  714. Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modelingfinding
  715. Data-Constrained Synthesis of Training Data for De-IdentificationLong
  716. DavIR: Data Selection via Implicit Reward for Large Language ModelsLong
  717. DeAL: Decoding-time Alignment for Large Language ModelsLong
  718. DeFine: Decision-Making with Analogical Reasoning over Factor Profilesfinding
  719. DeRAGEC: Denoising Named Entity Candidates with Synthetic Rationale for ASR Error Correctionfinding
  720. DeTAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modificationfinding
  721. Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancementfinding
  722. Debate4MATH: Multi-Agent Debate for Fine-Grained Reasoning in Mathfinding
  723. DebateCoder: Towards Collective Intelligence of LLMs via Test Case Driven LLM Debate for Code GenerationLong
  724. Debiasing Online Preference Learning via Preference Feature Preservationfinding
  725. Debiasing the Fine-Grained Classification Task in LLMs with Bias-Aware PEFTLong
  726. Debt Collection Negotiations with Large Language Models: An Evaluation System and Optimizing Decision Making with Multi-Agentfinding
  727. Decoder-Only LLMs can be Masked Auto-EncodersShort
  728. Decoding Knowledge Attribution in Mixture-of-Experts: A Framework of Basic-Refinement Collaboration and Efficiency AnalysisLong
  729. Decoding LLM Personality Measurement: Forced-Choice vs. Likertfinding
  730. Decoding Reading Goals from Eye MovementsLong
  731. Decoding by Contrasting Knowledge: Enhancing Large Language Model Confidence on Edited FactsLong
  732. Decoding on Graphs: Faithful and Sound Reasoning on Knowledge Graphs through Generation of Well-Formed ChainsLong
  733. DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenariosfinding
  734. Decomposed Opinion Summarization with Verified Aspect-Aware Modulesfinding
  735. Decoupling Memories, Muting Neurons: Towards Practical Machine Unlearning for Large Language Modelsfinding
  736. Decoupling Reasoning and Knowledge Injection for In-Context Knowledge Editingfinding
  737. Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect TimesLong
  738. DeepRTL2: A Versatile Model for RTL-Related Tasksfinding
  739. DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking ProcessLong
  740. DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingLong
  741. Def-DTS: Deductive Reasoning for Open-domain Dialogue Topic Segmentationfinding
  742. Defense Against Prompt Injection Attack by Leveraging Attack TechniquesLong
  743. Defensive Prompt Patch: A Robust and Generalizable Defense of Large Language Models against Jailbreak Attacksfinding
  744. Defining and Evaluating Visual Language Models’ Basic Spatial Abilities: A Perspective from PsychometricsLong
  745. Dehumanizing Machines: Mitigating Anthropomorphic Behaviors in Text Generation SystemsLong
  746. Deliberate Reasoning in Language Models as Structure-Aware Planning with an Accurate World ModelLong
  747. Delta-KNN: Improving Demonstration Selection in In-Context Learning for Alzheimer’s Disease DetectionLong
  748. Delving into Multilingual Ethical Bias: The MSQAD with Statistical Hypothesis Tests for Large Language ModelsLong
  749. Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert ModelsLong
  750. Demystifying Small Language Models for Edge DeploymentLong
  751. Dense Retrieval with Quantity Comparison Intentfinding
  752. DenseLoRA: Dense Low-Rank Adaptation of Large Language ModelsLong
  753. Deontological Keyword Bias: The Impact of Modal Expressions on Normative Judgments of Language ModelsLong
  754. DependEval: Benchmarking LLMs for Repository Dependency Understandingfinding
  755. Derailer-Rerailer: Adaptive Verification for Efficient and Reliable Language Model Reasoningfinding
  756. Design Choices for Extending the Context Length of Visual Language ModelsLong
  757. Detecting Sockpuppetry on Wikipedia Using Meta-LearningLong
  758. Detecting and Mitigating Challenges in Zero-Shot Video Summarization with Video LLMsfinding
  759. Detection of Human and Machine-Authored Fake News in UrduLong
  760. Developmentally-plausible Working Memory Shapes a Critical Period for Language AcquisitionLong
  761. DiSCo: Device-Server Collaborative LLM-based Text Streaming Servicesfinding
  762. DiaLLMs: EHR-Enhanced Clinical Conversational System for Clinical Test Recommendation and Diagnosis Predictionfinding
  763. Diagnosing Failures in Large Language Models’ Answers: Integrating Error Attribution into Evaluation Frameworkfinding
  764. DialUp! Modeling the Language Continuum by Adapting Models to Dialects and Dialects to ModelsLong
  765. Dialect Normalization using Large Language Models and Morphological Rulesfinding
  766. Dialectal Coverage And Generalization in Arabic Speech RecognitionLong
  767. Dialogue Systems for Emotional Support via Value ReinforcementLong
  768. Dialogue-RAG: Enhancing Retrieval for LLMs via Node-Linking Utterance RewritingLong
  769. Dictionaries to the Rescue: Cross-Lingual Vocabulary Transfer for Low-Resource Languages Using Bilingual Dictionariesfinding
  770. Did Translation Models Get More Robust Without Anyone Even Noticing?Long
  771. DiffLM: Controllable Synthetic Data Generation via Diffusion Language Modelsfinding
  772. DiffPO: Diffusion-styled Preference Optimization for Inference Time Alignment of Large Language ModelsLong
  773. DiffSkip: Differential Layer Skipping in Large Language Modelsfinding
  774. Different Speech Translation Models Encode and Translate Speaker Gender DifferentlyShort
  775. DiffuseDef: Improved Robustness to Adversarial Attacks via Iterative DenoisingLong
  776. Diffusion Directed Acyclic Transformer for Non-Autoregressive Machine TranslationShort
  777. Diffusion Models Through a Global Lens: Are They Culturally Inclusive?Long
  778. Digest the Knowledge: Large Language Models empowered Message Passing for Knowledge Graph Question AnsweringLong
  779. Digital Gatekeepers: Google’s Role in Curating Hashtags and SubredditsLong
  780. DioR: Adaptive Cognitive Detection and Contextual Retrieval Optimization for Dynamic Retrieval-Augmented GenerationLong
  781. Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMsfinding
  782. Direct Prompt Optimization with Continuous RepresentationsLong
  783. Disambiguate First, Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsingfinding
  784. Disambiguating Reference in Visually Grounded Dialogues through Joint Modeling of Textual and Multimodal Semantic StructuresLong
  785. Discourse Relation-Enhanced Neural Coherence ModelingLong
  786. Disentangled Multi-span Evolutionary Network against Temporal Knowledge Graph Reasoningfinding
  787. Disentangling Biased Knowledge from Reasoning in Large Language Models via Machine UnlearningLong
  788. Disentangling Language and Culture for Evaluating Multilingual Large Language ModelsLong
  789. Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilitiesfinding
  790. Disentangling Memory and Reasoning Ability in Large Language ModelsLong
  791. Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuningfinding
  792. Disentangling Text and Math in Word Problems: Evidence for the Bidimensional Structure of Large Language Models’ Reasoningfinding
  793. Disentangling the Roles of Representation and Selection in Data PruningLong
  794. Distance between Relevant Information Pieces Causes Bias in Long-Context LLMsfinding
  795. Distilling an End-to-End Voice Assistant Without Instruction Training DataLong
  796. Diversification Catalyzes Language Models’ Instruction Generalization To Unseen Semanticsfinding
  797. Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Expertsfinding
  798. Diversity Explains Inference Scaling Laws: Through a Case Study of Minimum Bayes Risk DecodingLong
  799. Diversity-oriented Data Augmentation with Large Language ModelsLong
  800. Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool InvocationLong
  801. Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAGLong
  802. Divide-Verify-Refine: Can LLMs Self-align with Complex Instructions?finding
  803. Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checksfinding
  804. Do LLMs Understand Dialogues? A Case Study on Dialogue ActsLong
  805. Do Language Models Have Semantics? On the Five Standard PositionsLong
  806. Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMsfinding
  807. Do Language Models Understand Honorific Systems in Javanese?Long
  808. Do Language Models Understand the Cognitive Tasks Given to Them? Investigations with the N-Back Paradigmfinding
  809. Do Large Language Models Have “Emotion Neurons”? Investigating the Existence and Rolefinding
  810. Do Large Language Models Know Folktales? A Case Study of Yokai in Japanese Folktalesfinding
  811. Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?finding
  812. Do Large Language Models have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMsLong
  813. Do Multimodal Large Language Models Truly See What We Point At? Investigating Indexical, Iconic, and Symbolic Gesture ComprehensionShort
  814. Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucinationfinding
  815. Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluationfinding
  816. Do not Abstain! Identify and Solve the UncertaintyLong
  817. DoCIA: An Online Document-Level Context Incorporation Agent for Speech Translationfinding
  818. DoMIX: An Efficient Framework for Exploiting Domain Knowledge in Fine-TuningLong
  819. Doc-React: Multi-page Heterogeneous Document Question-answeringShort
  820. DocFusion: A Unified Framework for Document Parsing Tasksfinding
  821. DocMEdit: Towards Document-Level Model Editingfinding
  822. Document Segmentation Matters for Retrieval-Augmented Generationfinding
  823. Document-Level Event-Argument Data Augmentation for Challenging Role TypesLong
  824. Document-Level Relation Extraction with Global Relations and Entity Pair Reasoningfinding
  825. Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal TransportLong
  826. Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?finding
  827. Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual SettingsLong
  828. Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning Distillationfinding
  829. Does Time Have Its Place? Temporal Heads: Where Language Models Recall Time-specific InformationLong
  830. Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Modelsfinding
  831. Does the Emotional Understanding of LVLMs Vary Under High-Stress Environments and Across Different Demographic Attributes?Long
  832. Dolphin: Document Image Parsing via Heterogeneous Anchor Promptingfinding
  833. Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and FeedbackLong
  834. Domain Regeneration: How well do LLMs match syntactic properties of text domains?finding
  835. Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes Domainsfinding
  836. Donate or Create? Comparing Data Collection Strategies for Emotion-labeled Multimodal Social Media PostsLong
  837. Don’t Erase, Inform! Detecting and Contextualizing Harmful Language in Cultural Heritage CollectionsLong
  838. Don’t Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration PitfallsLong
  839. Don’t Half-listen: Capturing Key-part Information in Continual Instruction TuningLong
  840. Don’t Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Modelsfinding
  841. Don’t Reinvent the Wheel: Efficient Instruction-Following Text Embedding based on Guided Space TransformationLong
  842. Don’t Say No: Jailbreaking LLM by Suppressing Refusalfinding
  843. Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusionfinding
  844. Drift: Enhancing LLM Faithfulness in Rationale Generation via Dual-Reward Probabilistic InferenceLong
  845. Drop Dropout on Single Epoch Language Model Pretrainingfinding
  846. Dual Debiasing for Noisy In-Context Learning for Text Generationfinding
  847. DualGuard: A Parameter Space Transformation Approach for Bidirectional Defense in Split-Based LLM Fine-TuningLong
  848. DualRAG: A Dual-Process Approach to Integrate Reasoning and Retrieval for Multi-Hop Question AnsweringLong
  849. Dually Self-Improved Counterfactual Data Augmentation Using Large Language ModelLong
  850. DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generationfinding
  851. DynaQuest: A Dynamic Question Answering Dataset Reflecting Real-World Knowledge Updatesfinding
  852. Dynamic Attention-Guided Context Decoding for Mitigating Context Faithfulness Hallucinations in Large Language Modelsfinding
  853. Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language ModelsLong
  854. Dynamic Evaluation with Cognitive Reasoning for Multi-turn Safety of Large Language ModelsLong
  855. Dynamic Evil Score-Guided Decoding: An Efficient Decoding Framework For Red-Team Modelfinding
  856. Dynamic Head Selection for Neural Lexicalized Constituency ParsingLong
  857. Dynamic Knowledge Integration for Evidence-Driven Counter-Argument Generation with Large Language Modelsfinding
  858. Dynamic Label Name Refinement for Few-Shot Dialogue Intent ClassificationShort
  859. Dynamic Order Template Prediction for Generative Aspect-Based Sentiment AnalysisShort
  860. Dynamic Parallel Tree Search for Efficient LLM ReasoningLong
  861. Dynamic Personality in LLM Agents: A Framework for Evolutionary Modeling and Behavioral Analysis in the Prisoner’s Dilemmafinding
  862. Dynamic Prefix as Instructor for Incremental Named Entity Recognition: A Unified Seq2Seq Generation Frameworkfinding
  863. Dynamic Scaling of Unit Tests for Code Reward ModelingLong
  864. Dynamic Steering With Episodic Memory For Large Language Modelsfinding
  865. Dynamic Task Vector Grouping for Efficient Multi-Task Prompt Tuningfinding
  866. Dynamic and Generalizable Process Reward ModelingLong
  867. Déjà Vu? Decoding Repeated Reading from Eye MovementsLong
  868. EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language ModelsLong
  869. EAGLE: Expert-Guided Self-Enhancement for Preference Alignment in Pathology Large Vision-Language ModelLong
  870. EC-RAFT: Automated Generation of Clinical Trial Eligibility Criteria through Retrieval-Augmented Fine-Tuningfinding
  871. ECERC: Evidence-Cause Attention Network for Multi-Modal Emotion Recognition in ConversationLong
  872. ECLM: Entity Level Language Model for Spoken Language Understanding with Chain of IntentLong
  873. ECoRAG: Evidentiality-guided Compression for Long Context RAGfinding
  874. ELABORATION: A Comprehensive Benchmark on Human-LLM Competitive ProgrammingLong
  875. ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language ModelsLong
  876. ELI-Why: Evaluating the Pedagogical Utility of Language Model Explanationsfinding
  877. EMGLLM: Data-to-Text Alignment for Electromyogram Diagnosis Generation with Medical Numerical Data Encodingfinding
  878. EMPEC: A Comprehensive Benchmark for Evaluating Large Language Models Across Diverse Healthcare Professionsfinding
  879. EMRs2CSP : Mining Clinical Status Pathway from Electronic Medical Recordsfinding
  880. EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement LearningLong
  881. ERU-KG: Efficient Reference-aligned Unsupervised Keyphrase GenerationLong
  882. ESF: Efficient Sensitive Fingerprinting for Black-Box Tamper Detection of Large Language Modelsfinding
  883. ETF: An Entity Tracing Framework for Hallucination Detection in Code SummariesLong
  884. ETRQA: A Comprehensive Benchmark for Evaluating Event Temporal Reasoning Abilities of Large Language Modelsfinding
  885. EXECUTE: A Multilingual Benchmark for LLM Token Understandingfinding
  886. EXIT: Context-Aware Extractive Compression for Enhancing Retrieval-Augmented Generationfinding
  887. EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanationsfinding
  888. Each graph is a new language: Graph Learning with LLMsfinding
  889. EasyEA: Large Language Model is All You Need in Entity Alignment Between Knowledge Graphsfinding
  890. EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product AssociationLong
  891. EdiText: Controllable Coarse-to-Fine Text Editing with Diffusion Language ModelsLong
  892. Edit Once, Update Everywhere: A Simple Framework for Cross-Lingual Knowledge Synchronization in LLMsfinding
  893. EditInspector: A Benchmark for Evaluation of Text-Guided Image EditsLong
  894. EducationQ: Evaluating LLMs’ Teaching Capabilities Through Multi-Agent Dialogue FrameworkLong
  895. Eeyore: Realistic Depression Simulation via Expert-in-the-Loop Supervised and Preference Optimizationfinding
  896. EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language ModelsLong
  897. Efficient Domain Continual pretraining by Mitigating the Stability GapLong
  898. Efficient Ensemble for Fine-tuning Language Models on Multiple DatasetsLong
  899. Efficient Knowledge Editing via Minimal PrecomputationShort
  900. Efficient Long Context Language Model Retrieval with CompressionLong
  901. Efficient Many-Shot In-Context Learning with Dynamic Block-Sparse AttentionLong
  902. Efficient OpAmp Adaptation for Zoom Attention to Golden ContextsLong
  903. Efficient Pretraining Data Selection for Language Models via Multi-Actor CollaborationLong
  904. Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward ModelingLong
  905. Efficient Universal Goal Hijacking with Semantics-guided Prompt OrganizationLong
  906. Efficient and Accurate Prompt Optimization: the Benefit of Memory in Exemplar-Guided ReflectionLong
  907. Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attackfinding
  908. EfficientQAT: Efficient Quantization-Aware Training for Large Language ModelsLong
  909. Efficiently Identifying Watermarked Segments in Mixed-Source TextsLong
  910. EgoNormia: Benchmarking Physical-Social Norm Understandingfinding
  911. Eliciting In-context Retrieval and Reasoning for Long-context Large Language Modelsfinding
  912. Eliciting Textual Descriptions from Representations of Continuous Promptsfinding
  913. Embedding-Converter: A Unified Framework for Cross-Model Embedding TransformationLong
  914. Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based AgentsLong
  915. Embracing Large Language Models in Traffic Flow Forecastingfinding
  916. Emergent Abilities of Large Language Models under Continued Pre-training for Language AdaptationLong
  917. Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial ReasoningLong
  918. Emo Pillars: Knowledge Distillation to Support Fine-Grained Context-Aware and Context-Less Emotion Classificationfinding
  919. Empathy Prediction from Diverse PerspectivesLong
  920. Employing Discourse Coherence Enhancement to Improve Cross-Document Event and Entity Coreference ResolutionLong
  921. EnSToM: Enhancing Dialogue Systems with Entropy-Scaled Steering Vectors for Topic Maintenancefinding
  922. Enabling Chatbots with Eyes and Ears: An Immersive Multimodal Conversation System for Dynamic InteractionsLong
  923. Enabling LLM Knowledge Analysis via Extensive MaterializationLong
  924. Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correctionfinding
  925. EnerGIZAr: Leveraging GIZA++ for Effective Tokenizer Initializationfinding
  926. Energy Considerations of Large Language Model Inference and Efficiency OptimizationsLong
  927. English-based acoustic models perform well in the forced alignment of two English-based Pacific CreolesLong
  928. Enhance Multimodal Consistency and Coherence for Text-Image Plan Generationfinding
  929. Enhanced Data Synthesis for LLM through Reasoning Structures Generated by Hierarchical GFlowNetfinding
  930. Enhancing Automated Interpretability with Output-Centric Feature DescriptionsLong
  931. Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrievalfinding
  932. Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuningLong
  933. Enhancing Character-Level Understanding in LLMs through Token Internal Structure LearningLong
  934. Enhancing Complex Reasoning in Knowledge Graph Question Answering through Query Graph Approximationfinding
  935. Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource LanguagesLong
  936. Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mappingfinding
  937. Enhancing Event-centric News Cluster Summarization via Data Sharpening and Localization InsightsLong
  938. Enhancing Goal-oriented Proactive Dialogue Systems via Consistency Reflection and CorrectionLong
  939. Enhancing Human Evaluation in Machine Translation with Comparative JudgementLong
  940. Enhancing Hyperbole and Metaphor Detection with Their Bidirectional Dynamic Interaction and Emotion KnowledgeLong
  941. Enhancing Input-Label Mapping in In-Context Learning with Contrastive DecodingShort
  942. Enhancing Interpretable Image Classification Through LLM Agents and Conditional Concept Bottleneck ModelsLong
  943. Enhancing LLM Agent Safety via Causal Influence Promptingfinding
  944. Enhancing LLM-based Hatred and Toxicity Detection with Meta-Toxic Knowledge Graphfinding
  945. Enhancing Lexicon-Based Text Embeddings with Large Language ModelsLong
  946. Enhancing Machine Translation with Self-Supervised Preference DataLong
  947. Enhancing Mathematical Reasoning in LLMs by Stepwise CorrectionLong
  948. Enhancing Medical Dialogue Generation through Knowledge Refinement and Dynamic Prompt Adjustmentfinding
  949. Enhancing Multimodal Continual Instruction Tuning with BranchLoRALong
  950. Enhancing Multimodal Retrieval via Complementary Information Extraction and AlignmentLong
  951. Enhancing Multimodal Unified Representations for Cross Modal Generalizationfinding
  952. Enhancing NER by Harnessing Multiple Datasets with Conditional Variational AutoencodersShort
  953. Enhancing Neural Machine Translation Through Target Language Data: A kNN-LM Approach for Domain AdaptationLong
  954. Enhancing Open-Domain Task-Solving Capability of LLMs via Autonomous Tool Integration from GitHubLong
  955. Enhancing Persona Consistency for LLMs’ Role-Playing using Persona-Aware Contrastive Learningfinding
  956. Enhancing Retrieval Systems with Inference-Time Logical ReasoningShort
  957. Enhancing Retrieval-Augmented Generation via Evidence Tree SearchLong
  958. Enhancing Safe and Controllable Protein Generation via Knowledge Preference OptimizationLong
  959. Enhancing Spoken Discourse Modeling in Language Models Using Gestural CuesLong
  960. Enhancing Text Editing for Grammatical Error Correction: Arabic as a Case StudyLong
  961. Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklistsfinding
  962. Enhancing Transformation from Natural Language to Signal Temporal Logic Using LLMs with Diverse External Knowledgefinding
  963. Enhancing Transformers for Generalizable First-Order Logical EntailmentLong
  964. Enhancing Unsupervised Sentence Embeddings via Knowledge-Driven Data Augmentation and Gaussian-Decayed Contrastive LearningLong
  965. Enhancing the Comprehensibility of Text Explanations via Unsupervised Concept Discoveryfinding
  966. EnigmaToM: Improve LLMs’ Theory-of-Mind Reasoning Capabilities with Neural Knowledge Base of Entity Statesfinding
  967. Enough Coin Flips Can Make LLMs Act BayesianLong
  968. Ensemble Watermarks for Large Language ModelsLong
  969. Entailed Between the Lines: Incorporating Implication into NLILong
  970. Entailment-Preserving First-order Logic Representations in Natural Language EntailmentLong
  971. Entity Framing and Role Portrayal in the Newsfinding
  972. Entriever: Energy-based Retriever for Knowledge-Grounded Dialog Systemsfinding
  973. Entropy-based Exploration Conduction for Multi-step Reasoningfinding
  974. Entrospect: Information-Theoretic Self-Reflection Elicits Better Response Refinement of Small Language Modelsfinding
  975. EpMAN: Episodic Memory AttentioN for Generalizing to Longer ContextsLong
  976. EpiCoDe: Boosting Model Performance Beyond Training with Extrapolation and Contrastive Decodingfinding
  977. Error Comparison Optimization for Large Language Models on Aspect-Based Sentiment AnalysisLong
  978. Error-driven Data-efficient Large Multimodal Model TuningLong
  979. EscapeBench: Towards Advancing Creative Intelligence of Language Model AgentsLong
  980. EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Modelsfinding
  981. Establishing Trustworthy LLM Evaluation via Shortcut Neuron AnalysisLong
  982. Estimating Privacy Leakage of Augmented Contextual Knowledge in Language ModelsLong
  983. Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equationfinding
  984. EtiCor++: Towards Understanding Etiquettical Bias in LLMsfinding
  985. EuroVerdict: A Multilingual Dataset for Verdict Generation Against Misinformationfinding
  986. Evaluating Design Decisions for Dual Encoder-based Entity DisambiguationLong
  987. Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspectivefinding
  988. Evaluating Instructively Generated Statement by Large Language Models for Directional Event Causality Identificationfinding
  989. Evaluating LLMs for Portuguese Sentence Simplification with Linguistic InsightsLong
  990. Evaluating LLMs’ Assessment of Mixed-Context Hallucination Through the Lens of Summarizationfinding
  991. Evaluating LLMs’ Mathematical and Coding Competency through Ontology-guided Interventionsfinding
  992. Evaluating Language Models as Synthetic Data GeneratorsLong
  993. Evaluating Large Language Models for Confidence-based Check Set Selectionfinding
  994. Evaluating Lexical Proficiency in Neural Language ModelsLong
  995. Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired UsersLong
  996. Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree SearchLong
  997. Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and ProactivityLong
  998. Evaluating Pretrained Causal Language Models for Synonymyfinding
  999. Evaluating Sequence Labeling on the basis of Information TheoryLong
  1000. Evaluating Theory of (an uncertain) Mind: Predicting the Uncertain Beliefs of Others from Conversational CuesLong

Looking for submission deadlines instead? See the conference deadline calendar.

ACL 2025 Accepted Papers · Full List of 3,086 Papers