← All conferences

ACL 2025 Accepted Papers

The full list of 3,086 papers accepted at ACL 2025 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Long: 1,602finding: 1,387Short: 97
  1. Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM CollaborationLong
  2. Evaluating the Evaluation of Diversity in Commonsense GenerationLong
  3. Evaluating the Long-Term Memory of Large Language Modelsfinding
  4. Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative ModelsLong
  5. Evaluation of Attribution Bias in Generator-Aware Retrieval-Augmented Large Language Modelsfinding
  6. Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation GenerationLong
  7. Evaluation of LLMs in Medical Text Summarization: The Role of Vocabulary Adaptation in High OOV Settingsfinding
  8. Event Pattern-Instance Graph: A Multi-Round Role Representation Learning Strategy for Document-Level Event Argument Extractionfinding
  9. EventRAG: Enhancing LLM Generation with Event Knowledge GraphsLong
  10. EvoBench: Towards Real-world LLM-Generated Text Detection Benchmarking for Evolving Large Language Modelsfinding
  11. EvoWiki: Evaluating LLMs on Evolving KnowledgeLong
  12. EvolveBench: A Comprehensive Benchmark for Assessing Temporal Awareness in LLMs on Evolving KnowledgeLong
  13. ExPerT: Effective and Explainable Evaluation of Personalized Long-Form Text Generationfinding
  14. Exclusion of Thought: Mitigating Cognitive Load in Large Language Models for Enhanced Reasoning in Multiple-Choice TasksLong
  15. Exp4Fuse: A Rank Fusion Framework for Enhanced Sparse Retrieval using Large Language Model-based Query Expansionfinding
  16. ExpeTrans: LLMs Are Experiential Transfer LearnersLong
  17. Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agentfinding
  18. Explain then Rank: Scale Calibration of Neural Rankers Using Natural Language Explanations from LLMsfinding
  19. Explain-then-Process: Using Grammar Prompting to Enhance Grammatical Acceptability Judgmentsfinding
  20. Explainable Depression Detection in Clinical Interviews with Personalized Retrieval-Augmented Generationfinding
  21. Explainable Hallucination through Natural Language Inference Mappingfinding
  22. Explaining Matters: Leveraging Definitions and Semantic Expansion for Sexism DetectionLong
  23. Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudokufinding
  24. ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Modelsfinding
  25. Explicit Bayesian Inference to Uncover the Latent Themes of Large Language Modelsfinding
  26. Explicit and Implicit Data Augmentation for Social Event DetectionLong
  27. Explicit vs. Implicit: Investigating Social Bias in Large Language Models through Self-Reflectionfinding
  28. Exploiting Contextual Knowledge in LLMs through 𝒱-usable Information based Layer EnhancementLong
  29. Exploiting Instruction-Following Retrievers for Malicious Information Retrievalfinding
  30. Exploiting Phonetics and Glyph Representation at Radical-level for Classical Chinese Understandingfinding
  31. Exploiting the Shadows: Unveiling Privacy Leaks through Lower-Ranked Tokens in Large Language ModelsLong
  32. ExploraCoder: Advancing Code Generation for Multiple Unseen APIs via Planning and Chained ExplorationLong
  33. Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agentsfinding
  34. Exploring Compositional Generalization of Multimodal LLMs for Medical ImagingLong
  35. Exploring Explanations Improves the Robustness of In-Context LearningLong
  36. Exploring Forgetting in Large Language Model Pre-TrainingLong
  37. Exploring Graph Representations of Logical Forms for Language Modelingfinding
  38. Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision EncoderLong
  39. Exploring In-Image Machine Translation with Real-World Backgroundfinding
  40. Exploring In-context Example Generation for Machine Translationfinding
  41. Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversionfinding
  42. Exploring Knowledge Filtering for Retrieval-Augmented Discriminative Tasksfinding
  43. Exploring LLM Annotation for Adaptation of Clinical Information Extraction Models under Data-sharing Restrictionsfinding
  44. Exploring LLMs’ Ability to Spontaneously and Conditionally Modify Moral Expressions through Text ManipulationLong
  45. Exploring Layer-wise Representations of English and Chinese Homonymy in Pre-trained Language Modelsfinding
  46. Exploring Multi-Modal Data with Tool-Augmented LLM Agents for Precise Causal Discoveryfinding
  47. Exploring Multimodal Challenges in Toxic Chinese Detection: Taxonomy, Benchmark, and Findingsfinding
  48. Exploring Multimodal Relation Extraction of Hierarchical Tabular Data with Multi-task LearningLong
  49. Exploring Persona Sentiment Sensitivity in Personalized Dialogue GenerationLong
  50. Exploring Supervised Approaches to the Detection of Anthropomorphic Language in the Reporting of NLP Venuesfinding
  51. Exploring the Choice Behavior of Large Language Modelsfinding
  52. Exploring the Impact of Instruction-Tuning on LLM’s Susceptibility to MisinformationLong
  53. Exploring the Potential of LLMs as Personalized Assistants: Dataset, Evaluation, and AnalysisLong
  54. Exploring the Role of Mental Health Conversational Agents in Training Medical Students and Professionals: A Systematic Literature Reviewfinding
  55. Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Modelsfinding
  56. Exposing the Achilles’ Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical ReasoningLong
  57. Express What You See: Can Multimodal LLMs Decode Visual Ciphers with Intuitive Semiosis Comprehension?finding
  58. Extending Complex Logical Queries on Uncertain Knowledge GraphsLong
  59. Extending LLM Context Window with Adaptive Grouped Positional Encoding: A Training-Free MethodLong
  60. F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow MatchingLong
  61. FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language ModelsLong
  62. FADE: Why Bad Descriptions Happen to Good Featuresfinding
  63. FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Onlyfinding
  64. FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop ReasoningLong
  65. FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature ImplementationLong
  66. FEAT: A Preference Feedback Dataset through a Cost-Effective Auto-Generation and Labeling Framework for English AI TutoringShort
  67. FGDGNN: Fine-Grained Dynamic Graph Neural Network for Rumor Detection on Social Mediafinding
  68. FIHA: Automated Fine-grained Hallucinations Evaluations in Large Vision Language Models with Davidson Scene Graphsfinding
  69. FLAG-TRADER: Fusion LLM-Agent with Gradient-based Reinforcement Learning for Financial Tradingfinding
  70. FOCUS: Evaluating Pre-trained Vision-Language Models on Underspecification ReasoningLong
  71. FPE2M2: Approaching Lossless and Efficient Quantization with Native Floating Pointfinding
  72. FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative SamplingLong
  73. FRACTAL: Fine-Grained Scoring from Aggregate Text LabelsLong
  74. FRAG: A Flexible Modular Framework for Retrieval-Augmented Generation based on Knowledge Graphsfinding
  75. FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategyfinding
  76. FRAME: Feedback-Refined Agent Methodology for Enhancing Medical Research Insightsfinding
  77. FREE: Fast and Robust Vision Language Models with Early Exitsfinding
  78. FaVe: Factored and Verified Search Rationale for Long-form Answerfinding
  79. Fact Recall, Heuristics or Pure Guesswork? Precise Interpretations of Language Models for Fact Completionfinding
  80. FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality EvaluationLong
  81. FactLens: Benchmarking Fine-Grained Fact Verificationfinding
  82. Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentationfinding
  83. FairI Tales: Evaluation of Fairness in Indian Contexts with a Focus on Bias and StereotypesLong
  84. FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steeringfinding
  85. Fairness Beyond Performance: Revealing Reliability Disparities Across Groups in Legal NLPLong
  86. Fairness through Difference Awareness: Measuring Desired Group Discrimination in LLMsLong
  87. Faithful and Robust LLM-Driven Theorem Proving for NLI ExplanationsLong
  88. FaithfulRAG: Fact-Level Conflict Modeling for Context-Faithful Retrieval-Augmented GenerationLong
  89. FanChuan: A Multilingual and Graph-Structured Benchmark For Parody Detection and Analysisfinding
  90. Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question AnsweringShort
  91. Fast-and-Frugal Text-Graph Transformers are Effective Link Predictorsfinding
  92. FastDraft: How to Train Your Draftfinding
  93. FastMCTS: A Simple Sampling Strategy for Data SynthesisLong
  94. Faster Speculative Decoding via Effective Draft Decoder with Pruned Candidate TreeLong
  95. Feature-Level Insights into Artificial Text Detection with Sparse Autoencodersfinding
  96. FedDQC: Data Quality Control in Federated Instruction-tuning of Large Language Modelsfinding
  97. FedEx-LoRA: Exact Aggregation for Federated and Efficient Fine-Tuning of Large Language ModelsLong
  98. FedLEKE: Federated Locate-then-Edit Knowledge Editing for Multi-Client Collaborationfinding
  99. Federated Data-Efficient Instruction Tuning for Large Language Modelsfinding
  100. FiDeLiS: Faithful Reasoning in Large Language Models for Knowledge Graph Question Answeringfinding
  101. Filling the Temporal Void: Recovering Missing Publication Years in the Project Gutenberg Corpus Using LLMsfinding
  102. FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning EvaluationLong
  103. FinRipple: Aligning Large Language Models with Financial Market for Event Ripple Effect Awarenessfinding
  104. FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and ChallengingLong
  105. Financial Language Model Evaluation (FLaME)finding
  106. Finding A Voice: Exploring the Potential of African American Dialect and Voice Generation for ChatbotsLong
  107. Finding Needles in Images: Can Multi-modal LLMs Locate Fine Details?Long
  108. Finding the Sweet Spot: Preference Data Construction for Scaling Preference OptimizationLong
  109. Fine-Tuning on Diverse Reasoning Chains Drives Within-Inference CoT Refinement in LLMsLong
  110. Fine-grained Knowledge Enhancement for Retrieval-Augmented Generationfinding
  111. Fine-grained Video Dubbing Duration Alignment with Segment Supervised Preference OptimizationLong
  112. FineCite: A Novel Approach For Fine-Grained Citation Context Analysisfinding
  113. FineReason: Evaluating and Improving LLMs’ Deliberate Reasoning through Reflective Puzzle SolvingLong
  114. Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State TrackingLong
  115. Firm or Fickle? Evaluating Large Language Models Consistency in Sequential Interactionsfinding
  116. First-Step Advantage: Importance of Starting Right in Multi-Step Math Reasoningfinding
  117. FitCF: A Framework for Automatic Feature Importance-guided Counterfactual Example Generationfinding
  118. Fixing Distribution Shifts of LLM Self-Critique via On-Policy Self-Play TrainingLong
  119. FlashAudio: Rectified Flow for Fast and High-Fidelity Text-to-Audio GenerationLong
  120. FlashBack: Efficient Retrieval-Augmented Language Modeling for Fast Inferencefinding
  121. Flexora: Flexible Low-Rank Adaptation for Large Language ModelsLong
  122. Flipping Knowledge Distillation: Leveraging Small Models’ Expertise to Enhance LLMs in Text MatchingLong
  123. FloorPlan-LLaMa: Aligning Architects’ Feedback and Domain Knowledge in Architectural Floor Plan GenerationLong
  124. Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capabilityfinding
  125. Flowchart-Based Decision Making with Large Language Modelsfinding
  126. FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference RankingsShort
  127. Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment TuningLong
  128. FocusLLM: Precise Understanding of Long Context by Dynamic CondensingLong
  129. Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Pointsfinding
  130. FoldMoE: Efficient Long Sequence MoE Training via Attention-MoE PipeliningLong
  131. Follow-up Question Generation For Enhanced Patient-Provider ConversationsLong
  132. Forget the Token and Pixel: Rethinking Gradient Ascent for Concept Unlearning in Multimodal Generative Modelsfinding
  133. Forgotten Polygons: Multimodal Large Language Models are Shape-Blindfinding
  134. Forward Knows Efficient Backward Path: Saliency-Guided Memory-Efficient Fine-tuning of Large Language ModelsLong
  135. Fraud-R1 : A Multi-Round Benchmark for Assessing the Robustness of LLM Against Augmented Fraud and Phishing Inducementsfinding
  136. Frequency matters: Modeling irregular morphological patterns in Spanish with Transformersfinding
  137. Frictional Agent Alignment Framework: Slow Down and Don’t Break ThingsLong
  138. From Awareness to Adaptability: Enhancing Tool Utilization for Scientific Reasoningfinding
  139. From Citations to Criticality: Predicting Legal Decision Influence in the Multilingual Swiss JurisprudenceShort
  140. From Complexity to Clarity: AI/NLP’s Role in Regulatory Compliancefinding
  141. From Conversation to Automation: Leveraging LLMs for Problem-Solving Therapy Analysisfinding
  142. From English to Second Language Mastery: Enhancing LLMs with Cross-Lingual Continued Instruction TuningLong
  143. From Evasion to Concealment: Stealthy Knowledge Unlearning for LLMsfinding
  144. From Heart to Words: Generating Empathetic Responses via Integrated Figurative Language and Semantic Context Signalsfinding
  145. From Human Reading to NLM Understanding: Evaluating the Role of Eye-Tracking Data in Encoder-Based ModelsLong
  146. From Imitation to Introspection: Probing Self-Consciousness in Language Modelsfinding
  147. From Informal to Formal – Incorporating and Evaluating LLMs on Natural Language Requirements to Verifiable Formal ProofsLong
  148. From Information to Insight: Leveraging LLMs for Open Aspect-Based Educational SummarizationLong
  149. From Isolates to Families: Using Neural Networks for Automated Language AffiliationLong
  150. From Lists to Emojis: How Format Bias Affects Model AlignmentLong
  151. From Misleading Queries to Accurate Answers: A Three-Stage Fine-Tuning Method for LLMsfinding
  152. From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons AlignmentLong
  153. From Objectives to Questions: A Planning-based Framework for Educational Mathematical Question GenerationLong
  154. From Observation to Understanding: Front-Door Adjustments with Uncertainty Calibration for Enhancing Egocentric Reasoning in LVLMsfinding
  155. From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time AlignmentLong
  156. From Perception to Reasoning: Enhancing Vision-Language Models for Mobile UI Understandingfinding
  157. From Perceptions to Decisions: Wildfire Evacuation Decision Prediction with Behavioral Theory-informed LLMsLong
  158. From Phrases to Subgraphs: Fine-Grained Semantic Parsing for Knowledge Graph Question Answeringfinding
  159. From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed GroundingLong
  160. From Selection to Generation: A Survey of LLM-based Active LearningLong
  161. From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalitiesfinding
  162. From Sub-Ability Diagnosis to Human-Aligned Generation: Bridging the Gap for Text Length Control via MarkerGenLong
  163. From Tools to Teammates: Evaluating LLMs in Multi-Session Coding InteractionsLong
  164. From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language ModelsLong
  165. Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoningfinding
  166. Fusing Highly Specialized Language Models for Comprehensive ExpertiseLong
  167. Fuzzy Speculative Decoding for a Tunable Accuracy-Runtime Tradeofffinding
  168. G-Safeguard: A Topology-Guided Security Lens and Treatment on LLM-based Multi-agent SystemsLong
  169. G2S: A General-to-Specific Learning Framework for Temporal Knowledge Graph Forecasting with Large Language Modelsfinding
  170. GA-S3: Comprehensive Social Network Simulation with Group Agentsfinding
  171. GALLa: Graph Aligned Large Language Models for Improved Source Code UnderstandingLong
  172. GAMEBoT: Transparent Assessment of LLM Reasoning in GamesLong
  173. GAPO: Learning Preferential Prompt through Generative Adversarial Policy OptimizationLong
  174. GEMS: Generation-Based Event Argument Extraction via Multi-perspective Prompts and Ontology Steeringfinding
  175. GETReason: Enhancing Image Context Extraction through Hierarchical Multi-Agent ReasoningLong
  176. GIFT-SW: Gaussian noise Injected Fine-Tuning of Salient Weights for LLMsLong
  177. GIMMICK: Globally Inclusive Multimodal Multitask Cultural Knowledge Benchmarkingfinding
  178. GLTW: Joint Improved Graph Transformer and LLM via Three-Word Language for Knowledge Graph Completionfinding
  179. GLiM: Integrating Graph Transformer and LLM for Document-Level Biomedical Relation Extraction with Incomplete Labelingfinding
  180. GNN-RAG: Graph Neural Retrieval for Efficient Large Language Model Reasoning on Knowledge Graphsfinding
  181. GODBench: A Benchmark for Multimodal Large Language Models in Video Comment ArtLong
  182. GOLFer: Smaller LMs-Generated Documents Hallucination Filter & Combiner for Query Expansion in Information Retrievalfinding
  183. GOODLIAR: A Reinforcement Learning-Based Deceptive Agent for Disrupting LLM Beliefs on Foundational Principlesfinding
  184. GPT-4 as a Homework Tutor Can Improve Student Engagement and Learning OutcomesLong
  185. GRACE: A Granular Benchmark for Evaluating Model Calibration against Human CalibrationLong
  186. GRAF: Graph Retrieval Augmented by Facts for Romanian Legal Multi-Choice Question Answeringfinding
  187. GRAM: Generative Recommendation via Semantic-aware Multi-granular Late FusionLong
  188. GRAMMAR-LLM: Grammar-Constrained Natural Language Generationfinding
  189. GRAT: Guiding Retrieval-Augmented Reasoning through Process Rewards Tree SearchLong
  190. GRI-QA: a Comprehensive Benchmark for Table Question Answering over Environmental Datafinding
  191. GRNFormer: A Biologically-Guided Framework for Integrating Gene Regulatory Networks into RNA Foundation Modelsfinding
  192. GRaMPa: Subword Regularisation by Skewing Uniform Segmentation Distributions with an Efficient Path-counting Markov ModelLong
  193. GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuningfinding
  194. GUI Agents: A Surveyfinding
  195. GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI AgentLong
  196. GUICourse: From General Vision Language Model to Versatile GUI AgentLong
  197. GUIDEX: Guided Synthetic Data Generation for Zero-Shot Information Extractionfinding
  198. GUM-SAGE: A Novel Dataset and Approach for Graded Entity Salience Predictionfinding
  199. GaRAGe: A Benchmark with Grounding Annotations for RAG Evaluationfinding
  200. GainRAG: Preference Alignment in Retrieval-Augmented Generation through Gain Signal SynthesisLong
  201. Game Development as Human-LLM InteractionLong
  202. GeAR: Generation Augmented Retrievalfinding
  203. GeAR: Graph-enhanced Agent for Retrieval-augmented Generationfinding
  204. GeLLM³O: Generalizing Large Language Models for Multi-property Molecule OptimizationLong
  205. GeNRe: A French Gender-Neutral Rewriting System Using Collective Nounsfinding
  206. GenKnowSub: Improving Modularity and Reusability of LLMs through General Knowledge SubtractionShort
  207. GenTool: Enhancing Tool Generalization in Language Models through Zero-to-One and Weak-to-Strong Simulationfinding
  208. Gender Inclusivity Fairness Index (GIFI): A Multilevel Framework for Evaluating Gender Diversity in Large Language ModelsLong
  209. GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language ModelsLong
  210. Generalizable Cross-Lingual Cognitive Distortion Detection with Standardized Annotations and Multi-Task Learningfinding
  211. Generalized Attention Flow: Feature Attribution for Transformer Models via Maximum FlowLong
  212. Generate First, Then Sample: Enhancing Fake News Detection with LLM-Augmented Reinforced SamplingLong
  213. Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolutionfinding
  214. Generating Diverse Training Samples for Relation Extraction with Large Language ModelsLong
  215. Generating Domain-Specific Knowledge Graphs from Large Language Modelsfinding
  216. Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Modelsfinding
  217. Generating Plausible Distractors for Multiple-Choice Questions via Student Choice PredictionLong
  218. Generating Questions, Answers, and Distractors for Videos: Exploring Semantic Uncertainty of Object Motionsfinding
  219. Generative Error Correction for Emotion-aware Speech-to-text Translationfinding
  220. Generative Frame Sampler for Long Video Understandingfinding
  221. Generative Music Models’ Alignment with Professional and Amateur Users’ Expectationsfinding
  222. Generative Psycho-Lexical Approach for Constructing Value Systems in Large Language ModelsLong
  223. Generative Reward Modeling via Synthetic Criteria Preference LearningLong
  224. Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced ReasoningLong
  225. Geometric Signatures of Compositionality Across a Language Model’s LifetimeLong
  226. GiFT: Gibbs Fine-Tuning for Code GenerationLong
  227. GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and RefinementLong
  228. Global Eye: Breaking the “Fixed Thinking Pattern” during the Instruction Expansion ProcessLong
  229. Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual EvaluationLong
  230. GlyphPattern: An Abstract Pattern Recognition for Vision-Language Modelsfinding
  231. Going Beyond Your Expectations in Latency Metrics for Simultaneous Speech Translationfinding
  232. GradOT: Training-free Gradient-preserving Offsite-tuning for Large Language ModelsLong
  233. Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language ModelsLong
  234. GrammaMT: Improving Machine Translation with Grammar-Informed In-Context LearningLong
  235. Grammar-Based Code Representation: Is It a Worthy Pursuit for LLMs?finding
  236. Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM ReasoningLong
  237. Graph of Records: Boosting Retrieval Augmented Generation for Long-context Summarization with GraphsLong
  238. Graph-Assisted Culturally Adaptable Idiomatic Translation for Indic languagesfinding
  239. Graph-Structured Trajectory Extraction from TraveloguesLong
  240. Graph-guided Cross-composition Feature Disentanglement for Compositional Zero-shot Learningfinding
  241. GraphCheck: Breaking Long-Term Text Barriers with Extracted Knowledge Graph-Powered Fact-CheckingLong
  242. GraphInsight: Unlocking Insights in Large Language Models for Graph Structure UnderstandingLong
  243. GraphNarrator: Generating Textual Explanations for Graph Neural NetworksLong
  244. Graphically Speaking: Unmasking Abuse in Social Media with Conversation InsightsLong
  245. Grounded, or a Good Guesser? A Per-Question Balanced Dataset to Separate Blind from Grounded Models for Embodied Question AnsweringShort
  246. Grounding Task Assistance with Multimodal Cues from a Single Demonstrationfinding
  247. Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Modelfinding
  248. Growing Through Experience: Scaling Episodic Grounding in Language ModelsLong
  249. GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and ReasoningLong
  250. GuideBench: Benchmarking Domain-Oriented Guideline Following for LLM AgentsLong
  251. Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous ConstraintsLong
  252. Gumbel Reranking: Differentiable End-to-End Reranker OptimizationLong
  253. Gödel Agent: A Self-Referential Agent Framework for Recursively Self-ImprovementLong
  254. HACo-Det: A Study Towards Fine-Grained Machine-Generated Text Detection under Human-AI CoauthoringLong
  255. HAF-RM: A Hybrid Alignment Framework for Reward Model TrainingLong
  256. HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language ModelsLong
  257. HALoGEN: Fantastic LLM Hallucinations and Where to Find ThemLong
  258. HASH-RAG: Bridging Deep Hashing with Retriever for Efficient, Fine Retrieval and Augmented Generationfinding
  259. HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inferencefinding
  260. HD-NDEs: Neural Differential Equations for Hallucination Detection in LLMsLong
  261. HELIOS: Harmonizing Early Fusion, Late Fusion, and LLM Reasoning for Multi-Granular Table-Text RetrievalLong
  262. HFT: Half Fine-Tuning for Large Language ModelsLong
  263. HG-InsightLog: Context Prioritization and Reduction for Question Answering with Non-Natural Language Construct Log Datafinding
  264. HICD: Hallucination-Inducing via Attention Dispersion for Contrastive Decoding to Mitigate Hallucinations in Large Language Modelsfinding
  265. HPSS: Heuristic Prompting Strategy Search for LLM Evaluatorsfinding
  266. HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language ModelsLong
  267. HTML: Hierarchical Topology Multi-task Learning for Semantic Parsing in Knowledge Base Question Answeringfinding
  268. HalluLens: LLM Hallucination BenchmarkLong
  269. Hallucination Detox: Sensitivity Dropout (SenD) for Large Language Model TrainingLong
  270. HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Assistant Scenariosfinding
  271. Hanging in the Balance: Pivotal Moments in Crisis Counseling ConversationsLong
  272. Harnessing Large Language Models for Disaster Management: A Surveyfinding
  273. Harnessing PDF Data for Improving Japanese Large Multimodal Modelsfinding
  274. Harnessing Whisper for Prosodic Stress Analysisfinding
  275. Has Machine Translation Evaluation Achieved Human Parity? The Human Reference and the Limits of ProgressShort
  276. HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on TwitterLong
  277. HatePRISM: Policies, Platforms, and Research Integration. Advancing NLP for Hate Speech Proactive Mitigationfinding
  278. Hatevolution: What Static Benchmarks Don’t Tell Usfinding
  279. Have We Designed Generalizable Structural Knowledge Promptings? Systematic Evaluation and RethinkingLong
  280. HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoningfinding
  281. Help Me Write a Story: Evaluating LLMs’ Ability to Generate Writing FeedbackLong
  282. HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain TasksLong
  283. Heuristic-based Search Algorithm in Automatic Instruction-focused Prompt Optimization: A Surveyfinding
  284. HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language ModelLong
  285. HiCOT: Improving Neural Topic Models via Optimal Transport and Contrastive Learningfinding
  286. HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language ModelLong
  287. Hidden in Plain Sight: Evaluation of the Deception Detection Capabilities of LLMs in Multimodal SettingsLong
  288. HiddenDetect: Detecting Jailbreak Attacks against Multimodal Large Language Models via Monitoring Hidden StatesLong
  289. Hierarchical Attention Generates Better ProofsLong
  290. Hierarchical Bracketing Encodings for Dependency Parsing as TaggingLong
  291. Hierarchical Document Refinement for Long-context Retrieval-augmented GenerationLong
  292. Hierarchical Level-Wise News Article Clustering via Multilingual Matryoshka EmbeddingsLong
  293. Hierarchical Memory Organization for Wikipedia GenerationLong
  294. Hierarchical Retrieval with Evidence Curation for Open-Domain Financial Question Answering on Standardized Documentsfinding
  295. Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Modelsfinding
  296. Hierarchical-Task-Aware Multi-modal Mixture of Incremental LoRA Experts for Embodied Continual LearningLong
  297. HintsOfTruth: A Multimodal Checkworthiness Detection Dataset with Real and Synthetic ClaimsLong
  298. HoH: A Dynamic Benchmark for Evaluating the Impact of Outdated Information on Retrieval-Augmented GenerationLong
  299. HoPE: A Novel Positional Encoding Without Long-Term Decay for Enhanced Context Awareness and ExtrapolationLong
  300. HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple DevicesLong
  301. HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generationfinding
  302. HotelMatch-LLM: Joint Multi-Task Training of Small and Large Language Models for Efficient Multimodal Hotel RetrievalLong
  303. How Do LLMs Acquire New Knowledge? A Knowledge Circuits Perspective on Continual Pre-Trainingfinding
  304. How Do Multilingual Language Models Remember Facts?finding
  305. How Does Response Length Affect Long-Form Factualityfinding
  306. How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulationfinding
  307. How Humans and LLMs Organize Conceptual Knowledge: Exploring Subordinate Categories in ItalianLong
  308. How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMsLong
  309. How Much Do Encoder Models Know About Word Senses?Long
  310. How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMsfinding
  311. How Personality Traits Shape LLM Risk-Taking Behaviourfinding
  312. How Programming Concepts and Neurons Are Shared in Code Language Modelsfinding
  313. How do LLMs’ Preferences Affect Event Argument Extraction? CAT: Addressing Preference Traps in Unsupervised EAEfinding
  314. How do Transformer Embeddings Represent Compositions? A Functional Analysisfinding
  315. How does Misinformation Affect Large Language Model Behaviors and Preferences?Long
  316. How to Compare Things Properly? A Study of Argument Relevance in Comparative Question AnsweringLong
  317. How to Enable Effective Cooperation Between Humans and NLP Models: A Survey of Principles, Formalizations, and BeyondLong
  318. How to Mitigate Overfitting in Weak-to-strong Generalization?Long
  319. How to Train Long-Context Language Models (Effectively)Long
  320. HumT DumT: Measuring and controlling human-like language in LLMsLong
  321. Human Alignment: How Much Do We Adapt to LLMs?Short
  322. Human Bias in the Face of AI: Examining Human Judgment Against Text Labeled as AI Generatedfinding
  323. Human-LLM Coevolution: Evidence from Academic Writingfinding
  324. HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation Taskfinding
  325. HyGenar: An LLM-Driven Hybrid Genetic Algorithm for Few-Shot Grammar Generationfinding
  326. HyKGE: A Hypothesis Knowledge Graph Enhanced RAG Framework for Accurate and Reliable Medical LLMs ResponsesLong
  327. HybGRAG: Hybrid Retrieval-Augmented Generation on Textual and Relational Knowledge BasesLong
  328. Hybrid Preferences: Learning to Route Instances for Human vs. AI FeedbackLong
  329. HyperCRS: Hypergraph-Aware Multi-Grained Preference Learning to Burst Filter Bubbles in Conversational Recommendation Systemfinding
  330. HyperFM: Fact-Centric Multimodal Fusion for Link Prediction over Hyper-Relational Knowledge GraphsLong
  331. Hypothetical Documents or Knowledge Leakage? Rethinking LLM-based Query Expansionfinding
  332. I see what you mean: Co-Speech Gestures for Reference Resolution in Multimodal Dialoguefinding
  333. I0T: Embedding Standardization Method Towards Zero Modality GapLong
  334. IAM: Efficient Inference through Attention Mapping between Different-scale LLMsLong
  335. ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMsLong
  336. IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abductionfinding
  337. IMOL: Incomplete-Modality-Tolerant Learning for Multi-Domain Fake News Video DetectionLong
  338. IMPARA-GED: Grammatical Error Detection is Boosting Reference-free Grammatical Error Quality Estimatorfinding
  339. INJONGO: A Multicultural Intent Detection and Slot-filling Dataset for 16 African LanguagesLong
  340. INT: Establishing Information Transfer for Multilingual Intent Detection and Slot Fillingfinding
  341. INTERACT: Enabling Interactive, Question-Driven Learning in Large Language ModelsLong
  342. INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based AgentLong
  343. IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference OptimizationLong
  344. IPO: Your Language Model is Secretly a Preference ClassifierLong
  345. IRIS: An Iterative and Integrated Framework for Verifiable Causal Discovery in the Absence of Tabular DataLong
  346. IRIS: Interpretable Retrieval-Augmented Classification for Long Interspersed Document SequencesLong
  347. IRT-Router: Effective and Interpretable Multi-LLM Routing via Item Response TheoryLong
  348. ISR: Self-Refining Referring Expressions for Entity GroundingLong
  349. IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Webfinding
  350. Identifying Cellular Niches in Spatial Transcriptomics: An Investigation into the Capabilities of Large Language ModelsLong
  351. Identifying Open Challenges in Language IdentificationLong
  352. Identifying Reliable Evaluation Metrics for Scientific Text RevisionLong
  353. If Attention Serves as a Cognitive Model of Human Memory Retrieval, What is the Plausible Memory Representation?Long
  354. If Eleanor Rigby Had Met ChatGPT: A Study on Loneliness in a Post-LLM WorldLong
  355. ImPart: Importance-Aware Delta-Sparsification for Improved Model Compression and Merging in LLMsLong
  356. Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Modelsfinding
  357. Impartial Multi-task Representation Learning via Variance-invariant Probabilistic DecodingLong
  358. ImpliHateVid: A Benchmark Dataset and Two-stage Contrastive Learning Framework for Implicit Hate Speech Detection in VideosLong
  359. Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignmentfinding
  360. Implicit Reasoning in Transformers is Reasoning through Shortcutsfinding
  361. Improve Language Model and Brain Alignment via Associative Memoryfinding
  362. Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimatefinding
  363. Improve Safety Training of Large Language Models with Safety-Critical Singular Vectors LocalizationLong
  364. Improve Vision Language Model Chain-of-thought ReasoningLong
  365. Improved Unbiased Watermark for Large Language ModelsLong
  366. Improving Automatic Evaluation of Large Language Models (LLMs) in Biomedical Relation Extraction via LLMs-as-the-JudgeLong
  367. Improving Causal Interventions in Amnesic Probing with Mean Projection or LEACEfinding
  368. Improving Chain-of-Thought Reasoning via Quasi-Symbolic AbstractionsLong
  369. Improving Contextual Faithfulness of Large Language Models via Retrieval Heads-Induced OptimizationLong
  370. Improving Continual Pre-training Through Seamless Data Packingfinding
  371. Improving Dialogue Discourse Parsing through Discourse-aware Utterance ClarificationLong
  372. Improving Dialogue State Tracking through Combinatorial Search for In-Context ExamplesLong
  373. Improving Efficiency in Large Language Models via Extendable Block Floating Point Representationfinding
  374. Improving Factuality with Explicit Working MemoryLong
  375. Improving Fairness of Large Language Models in Multi-document SummarizationShort
  376. Improving Language and Modality Transfer in Translation by Character-level ModelingLong
  377. Improving Low-Resource Morphological Inflection via Self-Supervised ObjectivesLong
  378. Improving MLLM’s Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiencyfinding
  379. Improving Medical Large Vision-Language Models with Abnormal-Aware FeedbackLong
  380. Improving Model Factuality with Fine-grained Critique-based EvaluatorLong
  381. Improving Occupational ISCO Classification of Multilingual Swiss Job Postings with LLM-Refined Training Datafinding
  382. Improving Parallel Sentence Mining for Low-Resource and Endangered LanguagesShort
  383. Improving Preference Extraction In LLMs By Identifying Latent Knowledge Through Classifying ProbesLong
  384. Improving Word Alignment Using Semi-Supervised Learningfinding
  385. Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution’s CharacteristicsShort
  386. In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue AgentsLong
  387. In Search of the Lost Arch in Dialogue: A Dependency Dialogue Acts Corpus for Multi-Party Dialoguesfinding
  388. In the LLM era, Word Sense Induction remains unsolvedfinding
  389. In-the-wild Audio Spatialization with Flexible Text-guided LocalizationLong
  390. InImageTrans: Multimodal LLM-based Text Image Machine Translationfinding
  391. InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-trainingLong
  392. Incongruity-aware Tension Field Network for Multi-modal Sarcasm DetectionLong
  393. Inconsistent Tokenizations Cause Language Models to be Perplexed by Japanese GrammarShort
  394. Incorporating Domain Knowledge into Materials TokenizationLong
  395. IndicSynth: A Large-Scale Multilingual Synthetic Speech Dataset for Low-Resource Indian LanguagesLong
  396. Inducing lexicons of in-group language with socio-temporal contextLong
  397. InductionBench: LLMs Fail in the Simplest Complexity ClassLong
  398. Inductive Linguistic Reasoning with Large Language Modelsfinding
  399. Inference Compute-Optimal Video Vision Language ModelsLong
  400. Inferring Functionality of Attention Heads from their ParametersLong
  401. Inferring from Logits: Exploring Best Practices for Decoding-Free Generative Candidate SelectionLong
  402. InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Modelfinding
  403. InfiniteICL: Breaking the Limit of Context Window Size via Long Short-term Memory Transformationfinding
  404. Influences on LLM Calibration: A Study of Response Agreement, Loss Functions, and Prompt StylesLong
  405. Infogen: Generating Complex Statistical Infographics from DocumentsLong
  406. Information Extraction from Visually Rich Documents using LLM-based Organization of Documents into Independent Textual SegmentsLong
  407. Information Locality as an Inductive Bias for Neural Language ModelsLong
  408. Initializing and Retrofitting Key-Value Adaptors for Traceable Model Editingfinding
  409. Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal ThinkingLong
  410. Innovative Image Fraud Detection with Cross-Sample Anomaly Analysis: The Power of LLMsLong
  411. Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMsLong
  412. InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for DebatingLong
  413. Instance-Selection-Inspired Undersampling Strategies for Bias Reduction in Small and Large Language Models for Binary Text ClassificationLong
  414. InstructPart: Task-Oriented Part Segmentation with Instruction ReasoningLong
  415. Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in KazakhLong
  416. Instruction-Tuning Data Synthesis from Scratch via Web Reconstructionfinding
  417. Instruction-Tuning LLMs for Event Extraction with Annotation Guidelinesfinding
  418. Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization on Multi-party ConversationLong
  419. IntelliCockpitBench: A Comprehensive Benchmark to Evaluate VLMs for Intelligent Cockpitfinding
  420. IntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systemsfinding
  421. Inter-Passage Verification for Multi-evidence Multi-answer QAfinding
  422. Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language ModelsLong
  423. Interactive and Expressive Code-Augmented Planning with Large Language ModelsLong
  424. Interlocking-free Selective Rationalization Through Genetic-based LearningLong
  425. InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Modelfinding
  426. Internal Value Alignment in Large Language Models through Controlled Value Vector ActivationLong
  427. Internal and External Impacts of Natural Language Processing PapersShort
  428. Interpret and Improve In-Context Learning via the Lens of Input-Label MappingsLong
  429. Introducing Graph Context into Language Models through Parameter-Efficient Fine-Tuning for Lexical Relation MiningLong
  430. Introducing Verification Task of Set Consistency with Set-Consistency Energy NetworksLong
  431. Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single ProcessLong
  432. InvestAlign: Overcoming Data Scarcity in Aligning Large Language Models with Investor Decision-Making Processes Under Herd BehaviorLong
  433. Investigating Context Faithfulness in Large Language Models: The Roles of Memory Strength and Evidence Stylefinding
  434. Investigating Inference-time Scaling for Chain of Multi-modal Thought: A Preliminary Studyfinding
  435. Investigating Language Preference of Multilingual RAG Systemsfinding
  436. Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attributionfinding
  437. Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Modelsfinding
  438. Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal InconsistencyLong
  439. Investigating and Extending Homans’ Social Exchange Theory with Large Language Model based AgentsLong
  440. Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Trainingfinding
  441. Iron Sharpens Iron: Defending Against Attacks in Machine-Generated Text Detection with Adversarial TrainingLong
  442. Is External Information Useful for Stance Detection with LLMs?finding
  443. Is It JUST Semantics? A Case Study of Discourse Particle Understanding in LLMsfinding
  444. Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreementfinding
  445. Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?finding
  446. Is That Your Final Answer? Test-Time Scaling Improves Selective Question AnsweringShort
  447. Is a cute puyfred cute? Context-dependent form-meaning systematicity in LLMsfinding
  448. Is linguistically-motivated data augmentation worth it?Long
  449. Iterative Repair with Weak Verifiers for Few-shot Transfer in KBQA with Unanswerabilityfinding
  450. It’s Not Bragging If You Can Back It Up: Can LLMs Understand Braggings?Long
  451. It’s Not a Walk in the Park! Challenges of Idiom Translation in Speech-to-text SystemsLong
  452. JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mousefinding
  453. JEBS: A Fine-grained Biomedical Lexical Simplification Taskfinding
  454. Jailbreak Large Vision-Language Models Through Multi-Modal LinkageLong
  455. JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMsLong
  456. Jailbreaking? One Step Is Enough!Long
  457. JoPA: Explaining Large Language Model’s Generation via Joint Prompt AttributionLong
  458. JsonTuning: Towards Generalizable, Robust, and Controllable Instruction Tuningfinding
  459. JuStRank: Benchmarking LLM Judges for System RankingLong
  460. Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Modelsfinding
  461. Just Go Parallel: Improving the Multilingual Capabilities of Large Language ModelsLong
  462. Just KIDDIN’ : Knowledge Infusion and Distillation for Detection of INdecent Memesfinding
  463. Just Put a Human in the Loop? Investigating LLM-Assisted Annotation for Subjective Tasksfinding
  464. Just a Scratch: Enhancing LLM Capabilities for Self-harm Detection through Intent Differentiation and Emoji InterpretationLong
  465. K-order Ranking Preference Optimization for Large Language Modelsfinding
  466. K/DA: Automated Data Generation Pipeline for Detoxifying Implicitly Offensive Language in KoreanLong
  467. KAPA: A Deliberative Agent Framework with Tree-Structured Knowledge Base for Multi-Domain User Intent Understandingfinding
  468. KARPA: A Training-free Method of Adapting Knowledge Graph as References for Large Language Model’s Reasoning Path Aggregationfinding
  469. KE-MHISTO: Towards a Multilingual Historical Knowledge Extraction Benchmark for Addressing the Long-Tail Problemfinding
  470. KERL: Knowledge-Enhanced Personalized Recipe Recommendation using Large Language ModelsLong
  471. KG-Agent: An Efficient Autonomous Agent Framework for Complex Reasoning over Knowledge GraphLong
  472. KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understandingfinding
  473. KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive ReasoningLong
  474. KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional EmbeddingLong
  475. KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputationfinding
  476. KaFT: Knowledge-aware Fine-tuning for Boosting LLMs’ Domain-specific Question-Answering Performancefinding
  477. KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature AnalysisLong
  478. KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of KazakhstanLong
  479. Keys to Robust Edits: From Theoretical Insights to Practical AdvancesLong
  480. KiRAG: Knowledge-Driven Iterative Retriever for Enhancing Retrieval-Augmented GenerationLong
  481. Know You First and Be You Better: Modeling Human-Like User Simulators via Implicit ProfilesLong
  482. Know Your Mistakes: Towards Preventing Overreliance on Task-Oriented Conversational AI Through Accountability ModelingLong
  483. Know the Unknown: An Uncertainty-Sensitive Method for LLM Instruction Tuningfinding
  484. KnowCoder-X: Boosting Multilingual Information Extraction via Codefinding
  485. KnowShiftQA: How Robust are RAG Systems when Textbook Knowledge Shifts in K-12 Education?Short
  486. Knowing Before Saying: LLM Representations Encode Information About Chain-of-Thought Success Before Completionfinding
  487. Knowledge Base Construction for Knowledge-Augmented Text-to-SQLfinding
  488. Knowledge Boundary of Large Language Models: A SurveyLong
  489. Knowledge Decoupling via Orthogonal Projection for Lifelong Editing of Large Language ModelsLong
  490. Knowledge Graph Retrieval-Augmented Generation for LLM-based RecommendationLong
  491. Knowledge Image Matters: Improving Knowledge-Based Visual Reasoning with Multi-Image Large Language ModelsLong
  492. Knowledge Tracing in Programming Education Integrating Students’ QuestionsLong
  493. Knowledge-Augmented Multimodal Clinical Rationale Generation for Disease Diagnosis with Small Language ModelsLong
  494. KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Codingfinding
  495. KokoroChat: A Japanese Psychological Counseling Dialogue Dataset Collected via Role-Playing by Trained CounselorsLong
  496. Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognitionfinding
  497. L-CiteEval: A Suite for Evaluating Fidelity of Long-context ModelsLong
  498. L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language ModelsLong
  499. LACA: Improving Cross-lingual Aspect-Based Sentiment Analysis with LLM Data AugmentationLong
  500. LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiersfinding
  501. LADM: Long-context Training Data Selection with Attention-based Dependency Measurement for LLMsLong
  502. LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedbackfinding
  503. LAMB: A Training-Free Method to Enhance the Long-Context Understanding of SSMs via Attention-Guided Token FilteringShort
  504. LAQuer: Localized Attribution Queries in Content-grounded GenerationLong
  505. LCFO: Long Context and Long Form Output Dataset and Benchmarkingfinding
  506. LCHAIM - Investigating Long Context Reasoning in Hebrewfinding
  507. LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representationsfinding
  508. LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language ModelsLong
  509. LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-DisjointLong
  510. LEMMA: Learning from Errors for MatheMatical Advancement in LLMsfinding
  511. LEMONADE: A Large Multilingual Expert-Annotated Abstractive Event Dataset for the Real Worldfinding
  512. LESA: Learnable LLM Layer Scaling-UpLong
  513. LETS-C: Leveraging Text Embedding for Time Series ClassificationLong
  514. LGAR: Zero-Shot LLM-Guided Neural Ranking for Abstract Screening in Systematic Literature Reviewsfinding
  515. LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context ScenariosLong
  516. LIME: Less Is More for MLLM Evaluationfinding
  517. LIST: Linearly Incremental SQL Translator for Single-Hop Reasoning, Generation and Verificationfinding
  518. LLM Agents Making Agent ToolsLong
  519. LLM Agents for Coordinating Multi-User Information Gatheringfinding
  520. LLM Braces: Straightening Out LLM Predictions with Relevant Sub-UpdatesLong
  521. LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedbackfinding
  522. LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical StudyLong
  523. LLM as Effective Streaming Processor: Bridging Streaming-Batch Mismatches with Group Position Encodingfinding
  524. LLM as Entity Disambiguator for Biomedical Entity-LinkingShort
  525. LLM as a Broken Telephone: Iterative Generation Distorts InformationLong
  526. LLM-Based Multi-Agent Systems are Scalable Graph Generative Modelsfinding
  527. LLM-Empowered Class Imbalanced Graph Prompt Learning for Online Drug Trafficking Detectionfinding
  528. LLM-Enhanced Query Generation and Retrieval Preservation for Task-Oriented Dialoguefinding
  529. LLM-Forest: Ensemble Learning of LLMs with Graph-Augmented Prompts for Data Imputationfinding
  530. LLM-Guided Semantic-Aware Clustering for Topic ModelingLong
  531. LLM-Powered Test Case Generation for Detecting Bugs in Plausible ProgramsLong
  532. LLM-Symbolic Integration for Robust Temporal Tabular Reasoningfinding
  533. LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluationfinding
  534. LLM-based Rumor Detection via Influence Guided Sample Selection and Game-based Perspective AnalysisLong
  535. LLM-based Translation Inference with Iterative Bilingual Understandingfinding
  536. LLMTaxo: Leveraging Large Language Models for Constructing Taxonomy of Factual Claims from Social Mediafinding
  537. LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLMfinding
  538. LLMs + Persona-Plug = Personalized LLMsLong
  539. LLMs Can Achieve High-quality Simultaneous Machine Translation as Efficiently as Offlinefinding
  540. LLMs Can Also Do Well! Breaking Barriers in Semantic Role Labeling via Large Language Modelsfinding
  541. LLMs Can Simulate Standardized Patients via Agent CoevolutionLong
  542. LLMs Caught in the Crossfire: Malware Requests and Jailbreak ChallengesLong
  543. LLMs Trust Humans More, That’s a Problem! Unveiling and Mitigating the Authority Bias in Retrieval-Augmented GenerationLong
  544. LLMs are Biased Evaluators But Not Biased for Fact-Centric Retrieval Augmented Generationfinding
  545. LLMs as Planning Formalizers: A Survey for Leveraging Large Language Models to Construct Automated Planning Modelsfinding
  546. LLMs can Perform Multi-Dimensional Analytic Writing Assessments: A Case Study of L2 Graduate-Level Academic English WritingLong
  547. LLMs can be easily Confused by Instructional DistractionsLong
  548. LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation TasksShort
  549. LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution ShiftsLong
  550. LLMs syntactically adapt their language use to their conversational partnerShort
  551. LLM×MapReduce: Simplified Long-Sequence Processing using Large Language ModelsLong
  552. LLaMA-Omni 2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech SynthesisLong
  553. LLaMAs Have Feelings Too: Unveiling Sentiment and Emotion Representations in LLaMA Models Through ProbingLong
  554. LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech EnhancementLong
  555. LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-SteeringLong
  556. LLäMmlein: Transparent, Compact and Competitive German-Only Language Models from ScratchLong
  557. LPOI: Listwise Preference Optimization for Vision Language ModelsLong
  558. LR²Bench: Evaluating Long-chain Reflective Reasoning Capabilities of Large Language Models via Constraint Satisfaction Problemsfinding
  559. LSC-Eval: A General Framework to Evaluate Methods for Assessing Dimensions of Lexical Semantic Change Using LLM-Generated Synthetic Datafinding
  560. LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace FusionLong
  561. LTRAG: Enhancing Autoformalization and Self-refinement for Logical Reasoning with Thought-Guided RAGfinding
  562. La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin AmericaLong
  563. LaTIM: Measuring Latent Token-to-Token Interactions in Mamba ModelsLong
  564. Label-semantics Aware Generative Approach for Domain-Agnostic Multilabel Classificationfinding
  565. LangMark: A Multilingual Dataset for Automatic Post-EditingLong
  566. LangSAMP: Language-Script Aware Multilingual PretrainingLong
  567. Language Constrained Multimodal Hyper Adapter For Many-to-Many Multimodal SummarizationLong
  568. Language Fusion for Parameter-Efficient Cross-lingual TransferLong
  569. Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public OpinionsLong
  570. Language Model Probabilities are Not Calibrated in Numeric ContextsLong
  571. Language Models Grow Less Humanlike beyond Phase TransitionLong
  572. Language Models Lack Temporal Generalization and Bigger is Not Betterfinding
  573. Language Models Resist Alignment: Evidence From Data CompressionLong
  574. Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in LegislationLong
  575. Language Models, Graph Searching, and Supervision Adulteration: When More Supervision is Less and How to Make More MoreLong
  576. Language Repository for Long Video Understandingfinding
  577. Language-Codec: Bridging Discrete Codec Representations and Speech Language ModelsLong
  578. Large Language Models Are Natural Video Popularity Predictorsfinding
  579. Large Language Models Still Exhibit Bias in Long Textfinding
  580. Large Language Models Struggle to Describe the Haystack without Human Help: A Social Science-Inspired Evaluation of Topic ModelsLong
  581. Large Language Models are Good Relational LearnersLong
  582. Large Language Models are Miscalibrated In-Context Learnersfinding
  583. Large Language Models as Neurolinguistic Subjects: Discrepancy between Performance and Competencefinding
  584. Large Language Models for Predictive Analysis: How Far Are They?finding
  585. Large Language Models in Bioinformatics: A Surveyfinding
  586. Large Language and Protein Assistant for Protein-Protein Interactions PredictionLong
  587. Large Language and Reasoning Models are Shallow Disjunctive ReasonersLong
  588. Large Margin Representation Learning for Robust Cross-lingual Named Entity RecognitionLong
  589. Large Vocabulary Size Improves Large Language Modelsfinding
  590. Latent Distribution Decouple for Uncertain-Aware Multimodal Multi-label Emotion Recognitionfinding
  591. LazyReview: A Dataset for Uncovering Lazy Thinking in NLP Peer ReviewsLong
  592. Learn to Memorize: Scalable Continual Learning in Semiparametric Models with Mixture-of-Neighbors Induction MemoryLong
  593. Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form GenerationShort
  594. Learning First-Order Logic Rules for Argumentation MiningLong
  595. Learning Sparsity for Effective and Efficient Music Performance Question AnsweringShort
  596. Learning Task Representations from In-Context Learningfinding
  597. Learning Together to Perform Better: Teaching Small-Scale LLMs to Collaborate via Preferential Rationale TuningLong
  598. Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Reviewfinding
  599. Learning from Negative Samples in Biomedical Generative Entity Linkingfinding
  600. Learning to Align Multi-Faceted Evaluation: A Unified and Robust Frameworkfinding
  601. Learning to Generate Structured Output with Schema Reinforcement LearningLong
  602. Learning to Insert [PAUSE] Tokens for Better Reasoningfinding
  603. Learning to Look at the Other Side: A Semantic Probing Study of Word Embeddings in LLMs with Enabled Bidirectional AttentionLong
  604. Learning to Play Like Humans: A Framework for LLM Adaptation in Interactive Fiction Gamesfinding
  605. Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language ModelsLong
  606. Learning to Reason from Feedback at Test-TimeLong
  607. Learning to Rewrite: Generalized LLM-Generated Text DetectionLong
  608. Learning to Select In-Context Demonstration Preferred by Large Language Modelfinding
  609. LegalAgentBench: Evaluating LLM Agents in Legal DomainLong
  610. LegalCore: A Dataset for Event Coreference Resolution in Legal Documentsfinding
  611. LegalReasoner: Step-wised Verification-Correction for Legal Judgment ReasoningLong
  612. LegoMT2: Selective Asynchronous Sharded Data Parallel Training for Massive Neural Machine Translationfinding
  613. Lemmas Matter, But Not Like That: Predictors of Lemma-Based Generalization in Morphological Inflectionfinding
  614. Lemmatisation & Morphological Analysis of Unedited Greek: Do Simple Tasks Need Complex Solutions?finding
  615. Length Controlled Generation for Black-box LLMsLong
  616. Length-Induced Embedding Collapse in PLM-based ModelsLong
  617. Less Mature is More Adaptable for Sentence-level Language ModelingLong
  618. Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI EvaluationLong
  619. Less is More: Explainable and Efficient ICD Code Prediction with Clinical EntitiesLong
  620. Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-ExpertsLong
  621. Let The Jury Decide: Fair Demonstration Selection for In-Context Learning through Incremental Greedy Evaluationfinding
  622. Let’s Be Self-generated via Step by Step: A Curriculum Learning Approach to Automated Reasoning with Large Language Modelsfinding
  623. Let’s Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCRfinding
  624. Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI CollaborationLong
  625. Leveraging Human Production-Interpretation Asymmetries to Test LLM Cognitive PlausibilityShort
  626. Leveraging In-Context Learning for Political Bias Testing of LLMsLong
  627. Leveraging LLMs for Bangla Grammar Error Correction: Error Categorization, Synthetic Data, and Model Evaluationfinding
  628. Leveraging Large Language Models for Conversational Multi-Doc Question Answering: The First Place of WSDM Cup 2024finding
  629. Leveraging Self-Attention for Input-Dependent Soft Prompting in LLMsShort
  630. Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translationfinding
  631. Leveraging Variation Theory in Counterfactual Data Augmentation for Optimized Active Learningfinding
  632. LexCLiPR: Cross-Lingual Paragraph Retrieval from Legal JudgmentsLong
  633. LexGen: Domain-aware Multilingual Lexicon GenerationLong
  634. LexKeyPlan: Planning with Keyphrases and Retrieval Augmentation for Legal Text Generation: A Case Study on European Court of Human Rights CasesShort
  635. LexTempus: Enhancing Temporal Generalizability of Legal Language Models Through Dynamic Mixture of ExpertsLong
  636. Lexical Diversity-aware Relevance Assessment for Retrieval-Augmented GenerationLong
  637. Lexical Recall or Logical Reasoning: Probing the Limits of Reasoning Abilities in Large Language ModelsLong
  638. Libra: Leveraging Temporal Images for Biomedical Radiology Analysisfinding
  639. Library-Like Behavior In Language Models is Enhanced by Self-Referencing Causal CyclesLong
  640. Lifelong Model Editing with Graph-Based External Memoryfinding
  641. Lightweight Query Checkpoint: Classifying Faulty User Queries to Mitigate Hallucinations in Large Language Model Question Answeringfinding
  642. Limited Generalizability in Argument Mining: State-Of-The-Art Models Learn Datasets, Not ArgumentsLong
  643. Limited-Resource Adapters Are Regularizers, Not LinguistsShort
  644. Linguistic Generalizability of Test-Time Scaling in Mathematical ReasoningLong
  645. Listen, Watch, and Learn to Feel: Retrieval-Augmented Emotion Reasoning for Compound Emotion Generationfinding
  646. Listening to Patients: Detecting and Mitigating Patient Misreport in Medical Dialogue Systemfinding
  647. Literary Evidence Retrieval via Long-Context Language ModelsShort
  648. Literature Meets Data: A Synergistic Approach to Hypothesis GenerationLong
  649. Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMsLong
  650. LlamaDuo: LLMOps Pipeline for Seamless Migration from Service LLMs to Small-Scale Local LLMsLong
  651. LlamaPIE: Proactive In-Ear Conversation Assistantsfinding
  652. LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMsfinding
  653. LoFTI: Localization and Factuality Transfer to Indian Localesfinding
  654. LoGU: Long-form Generation with Uncertainty ExpressionsLong
  655. LoRMA: Low-Rank Multiplicative Adaptation for LLMsfinding
  656. LocAgent: Graph-Guided LLM Agents for Code LocalizationLong
  657. Local Look-Ahead Guidance via Verifier-in-the-Loop for Automated Theorem Provingfinding
  658. Localizing and Mitigating Errors in Long-form Question Answeringfinding
  659. Locate-and-Focus: Enhancing Terminology Translation in Speech Language ModelsLong
  660. Logic-Regularized Verifier Elicits Reasoning from LLMsLong
  661. LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Modelsfinding
  662. LogicPro: Improving Complex Logical Reasoning via Program-Guided LearningLong
  663. Logical Consistency is Vital: Neural-Symbolic Information Retrieval for Negative-Constraint Queriesfinding
  664. Logical DA: Enhancing Data Augmentation for Logical Reasoning via a Multi-Agent Systemfinding
  665. Logical forms complement probability in understanding language model (and human) performanceLong
  666. Long-form Hallucination Detection with Self-elicitationfinding
  667. LongAttn: Selecting Long-context Training Data via Token-level Attentionfinding
  668. LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context MultitasksLong
  669. LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-Context QAfinding
  670. LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Informationfinding
  671. LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and LocatingLong
  672. LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Datafinding
  673. LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration DistillationLong
  674. LongRecipe: Recipe for Efficient Long Context Generalization in Large Language ModelsLong
  675. LongReward: Improving Long-context Large Language Models with AI FeedbackLong
  676. LongSafety: Evaluating Long-Context Safety of Large Language ModelsLong
  677. Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generationfinding
  678. Look Both Ways and No Sink: Converting LLMs into Text Encoders without TrainingLong
  679. Lost in Literalism: How Supervised Training Shapes Translationese in LLMsLong
  680. Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language ModelsLong
  681. Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Modelsfinding
  682. Lost in Translation: Benchmarking Commercial Machine Translation Models for Dyslexic-Style Textfinding
  683. Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference ModelingLong
  684. Low-Bit Quantization Favors Undertrained LLMsLong
  685. Low-Entropy Watermark Detection via Bayes’ Rule Derived Detectorfinding
  686. Low-Rank Interconnected Adaptation across Layersfinding
  687. Low-Resource Grammatical Error Correction: Selective Data Augmentation with Round-Trip Machine Translationfinding
  688. Lunar Twins: We Choose to Go to the Moon with Large Language Modelsfinding
  689. M-MAD: Multidimensional Multi-Agent Debate for Advanced Machine Translation EvaluationLong
  690. M-RangeDetector: Enhancing Generalization in Machine-Generated Text Detection through Multi-Range Attention Masksfinding
  691. M-RewardBench: Evaluating Reward Models in Multilingual SettingsLong
  692. M2-TabFact: Multi-Document Multi-Modal Fact Verification with Visual and Textual Representations of Tabular Datafinding
  693. M2PA: A Multi-Memory Planning Agent for Open Worlds Inspired by Cognitive Theoryfinding
  694. M2RC-EVAL: Massively Multilingual Repository-level Code Completion EvaluationLong
  695. M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMsLong
  696. M3HG: Multimodal, Multi-scale, and Multi-type Node Heterogeneous Graph for Emotion Cause Triplet Extraction in Conversationsfinding
  697. MAGI: Multi-Agent Guided Interview for Psychiatric Assessmentfinding
  698. MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answeringfinding
  699. MAGNET: Augmenting Generative Decoders with Representation Learning and Infilling CapabilitiesLong
  700. MAIN-RAG: Multi-Agent Filtering Retrieval-Augmented GenerationLong
  701. MALAMUTE: A Multilingual, Highly-granular, Template-free, Education-based Probing Datasetfinding
  702. MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaborationfinding
  703. MANBench: Is Your Multimodal Model Smarter than Human?finding
  704. MAPLE: Enhancing Review Generation with Multi-Aspect Prompt LEarning in Explainable RecommendationLong
  705. MAPS: Motivation-Aware Personalized Search via LLM-Driven Consultation AlignmentLong
  706. MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement LearningLong
  707. MARK: Multi-agent Collaboration with Ranking Guidance for Text-attributed Graph Clusteringfinding
  708. MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation DatasetLong
  709. MATCHED: Multimodal Authorship-Attribution To Combat Human Trafficking in Escort-Advertisement Datafinding
  710. MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at ScaleLong
  711. MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistencyfinding
  712. MCS-Bench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in Chinese Classical StudiesLong
  713. MDBench: A Synthetic Multi-Document Reasoning Benchmark Generated with Knowledge Guidancefinding
  714. MDCure: A Scalable Pipeline for Multi-Document Instruction-FollowingLong
  715. MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Modelsfinding
  716. MECoT: Markov Emotional Chain-of-Thought for Personality-Consistent Role-Playingfinding
  717. MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential DiagnosisLong
  718. MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notesfinding
  719. MEGen: Generative Backdoor into Large Language Models via Model Editingfinding
  720. MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generationfinding
  721. MELABenchv1: Benchmarking Large Language Models against Smaller Fine-Tuned Models for Low-Resource Maltese NLPfinding
  722. MEMERAG: A Multilingual End-to-End Meta-Evaluation Benchmark for Retrieval Augmented GenerationLong
  723. MEMIT-Merge: Addressing MEMIT’s Key-Value Conflicts in Same-Subject Batch Editing for LLMsfinding
  724. MERIT: Multi-Agent Collaboration for Unsupervised Time Series Representation Learningfinding
  725. METAL: A Multi-Agent Framework for Chart Generation with Test-Time ScalingLong
  726. MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignmentfinding
  727. MEXMA: Token-level objectives improve sentence representationsLong
  728. MEraser: An Effective Fingerprint Erasure Approach for Large Language ModelsLong
  729. MFinMeeting: A Multilingual, Multi-Sector, and Multi-Task Financial Meeting Understanding Evaluation Datasetfinding
  730. MHALO: Evaluating MLLMs as Fine-grained Hallucination Detectorsfinding
  731. MIG: Automatic Data Selection for Instruction Tuning by Maximizing Information Gain in Semantic Spacefinding
  732. MIND: A Multi-agent Framework for Zero-shot Harmful Meme DetectionLong
  733. MIR: Methodology Inspiration Retrieval for Scientific Research ProblemsLong
  734. MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive EnvironmentsShort
  735. MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrievalfinding
  736. MISP-Meeting: A Real-World Dataset with Multimodal Cues for Long-form Meeting Transcription and SummarizationLong
  737. MLAS-LoRA: Language-Aware Parameters Detection and LoRA-Based Knowledge Transfer for Multilingual Machine TranslationLong
  738. MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenariosfinding
  739. MM-R3: On (In-)Consistency of Vision-Language Models (VLMs)finding
  740. MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought VerificationLong
  741. MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence CalibrationLong
  742. MMDEND: Dendrite-Inspired Multi-Branch Multi-Compartment Parallel Spiking Neuron for Sequence ModelingLong
  743. MMEvol: Empowering Multimodal Large Language Models with Evol-Instructfinding
  744. MMInA: Benchmarking Multihop Multimodal Internet Agentsfinding
  745. MMLU-CF: A Contamination-free Multi-task Language Understanding BenchmarkLong
  746. MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding BenchmarkLong
  747. MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World ConversationLong
  748. MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Modelsfinding
  749. MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokensfinding
  750. MMSciBench: Benchmarking Language Models on Chinese Multimodal Scientific Problemsfinding
  751. MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Modelsfinding
  752. MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progressionfinding
  753. MONTROSE: LLM-driven Monte Carlo Tree Search Self-Refinement for Cross-Domain Rumor Detectionfinding
  754. MOSAIC: Multiple Observers Spotting AI Contentfinding
  755. MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identificationfinding
  756. MPL: Multiple Programming Languages with Large Language Models for Information Extractionfinding
  757. MPO: Multilingual Safety Alignment via Reward Gap OptimizationLong
  758. MPVStance: Mitigating Hallucinations in Stance Detection with Multi-Perspective VerificationLong
  759. MT-RAIG: Novel Benchmark and Evaluation Framework for Retrieval-Augmented Insight Generation over Multiple TablesLong
  760. MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teamingLong
  761. MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answeringfinding
  762. MUSE: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profilesfinding
  763. MUSTS: MUltilingual Semantic Textual Similarity BenchmarkShort
  764. MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matchingfinding
  765. MVTamperBench: Evaluating Robustness of Vision-Language Modelsfinding
  766. MWPO: Enhancing LLMs Performance through Multi-Weight Preference Strength and Length Optimizationfinding
  767. MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine ProjectionLong
  768. MaXIFE: Multilingual and Cross-lingual Instruction Following EvaluationLong
  769. Machine Theory of Mind Needs Machine Validationfinding
  770. Machine Translation Models are Zero-Shot Detectors of Translation Directionfinding
  771. MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context InferenceLong
  772. Magnet: Multi-turn Tool-use Data Synthesis and Distillation via Graph TranslationLong
  773. Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine TranslationLong
  774. Making FETCH! Happen: Finding Emergent Dog Whistles Through Common HabitatsLong
  775. Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum LearningLong
  776. Making RALM Robust to Irrelevant Contexts via Layer Knowledge Guided Attentionfinding
  777. Mamba Knockout for Unraveling Factual Information FlowLong
  778. Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent SystemLong
  779. Map&Make: Schema Guided Text to Table GenerationLong
  780. MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-based Vision-and-Language NavigationLong
  781. Mapping 1,000+ Language Models via the Log-Likelihood VectorLong
  782. Mapping the Podcast Ecosystem with the Structured Podcast Research CorpusLong
  783. Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large LanguageLong
  784. Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning ModelsLong
  785. MasRouter: Learning to Route LLMs for Multi-Agent SystemsLong
  786. Masking in Multi-hop QA: An Analysis of How Language Models Perform with Context PermutationLong
  787. Masks Can be Learned as an Alternative to ExpertsLong
  788. Massively Multilingual Instruction-Following Information Extractionfinding
  789. Math Neurosurgery: Isolating Language Models’ Math Reasoning Abilities Using Only Forward PassesLong
  790. MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoningfinding
  791. MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction FusionLong
  792. Matina: A Culturally-Aligned Persian Language Model Using Multiple LoRA Expertsfinding
  793. Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal RetrievalLong
  794. Maximizing the Effectiveness of Larger BERT Models for CompressionLong
  795. Maximum Score Routing For Mixture-of-Expertsfinding
  796. McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Modelsfinding
  797. MeMoTune: A Measure and Moment-Driven Fine-Tuning Framework for Quantized Large Language Modelsfinding
  798. Meaning Beyond Truth Conditions: Evaluating Discourse Level Understanding via Anaphora AccessibilityLong
  799. Meaning Variation and Data Quality in the Corpus of Founding Era American EnglishShort
  800. Measuring Bias and Agreement in Large Language Model Presupposition Judgmentsfinding
  801. Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable MetricLong
  802. Measuring Social Biases in Masked Language Models by Proxy of Prediction QualityLong
  803. Measuring What Makes You Unique: Difference-Aware User Modeling for Enhancing LLM Personalizationfinding
  804. Measuring What Matters: Evaluating Ensemble LLMs with Label Refinement in Inductive Codingfinding
  805. Measuring the Effect of Transcription Noise on Downstream Language Understanding TasksLong
  806. Mechanistic Interpretability of Emotion Inference in Large Language Modelsfinding
  807. MedCite: Can Language Models Generate Verifiable Text for Medicine?finding
  808. Medical Graph RAG: Evidence-based Medical Large Language Model via Graph Retrieval-Augmented GenerationLong
  809. MegaAgent: A Large-Scale Autonomous LLM-based Multi-Agent System Without Predefined SOPsfinding
  810. MegaPairs: Massive Data Synthesis for Universal Multimodal RetrievalLong
  811. MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agentsfinding
  812. MemeDetoxNet: Balancing Toxicity Reduction and Context Preservationfinding
  813. MemeQA: Holistic Evaluation for Meme UnderstandingLong
  814. Memorization Inheritance in Sequence-Level Knowledge Distillation for Neural Machine TranslationShort
  815. Memorization vs. Reasoning: Updating LLMs with New Knowledgefinding
  816. Memorizing is Not Enough: Deep Knowledge Injection Through ReasoningLong
  817. Memory or Reasoning? Explore How LLMs Compute Mixed Arithmetic Expressionsfinding
  818. Memory-augmented Query Reconstruction for LLM-based Knowledge Graph Reasoningfinding
  819. Merge Hijacking: Backdoor Attacks to Model Merging of Large Language ModelsLong
  820. MergePrint: Merge-Resistant Fingerprints for Robust Black-box Ownership Verification of Large Language ModelsLong
  821. Meta-Learning Neural Mechanisms rather than Bayesian PriorsLong
  822. Meta-Reflection: A Feedback-Free Reflection Learning FrameworkLong
  823. Meta-Tool: Unleash Open-World Function Calling Capabilities of General-Purpose Large Language ModelsLong
  824. Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language ModelsLong
  825. MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generationfinding
  826. Metagent-P: A Neuro-Symbolic Planning Agent with Metacognition for Open Worldsfinding
  827. Metaphor and Large Language Models: When Surface Features Matter More than Deep Understandingfinding
  828. MiLiC-Eval: Benchmarking Multilingual LLMs for China’s Minority Languagesfinding
  829. Micro-Act: Mitigate Knowledge Conflict in Question Answering via Actionable Self-ReasoningLong
  830. Middle-Layer Representation Alignment for Cross-Lingual Transfer in Fine-Tuned LLMsLong
  831. Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Modelsfinding
  832. Mimicking the Familiar: Dynamic Command Generation for Information Theft Attacks in LLM Tool-Learning SystemLong
  833. Mind Your Theory: Theory of Mind Goes Deeper Than Reasoningfinding
  834. Mind the (Belief) Gap: Group Identity in the World of LLMsfinding
  835. Mind the Gap: Static and Interactive Evaluations of Large Audio ModelsLong
  836. Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal GesturesLong
  837. MindBridge: Scalable and Cross-Model Knowledge Editing via Memory-Augmented Modalityfinding
  838. MindRef: Mimicking Human Memory for Hierarchical Reference Retrieval with Fine-Grained Location AwarenessShort
  839. MiniELM: A Lightweight and Adaptive Query Rewriting Framework for E-Commerce Search Optimizationfinding
  840. MiniKV: Pushing the Limits of 2-Bit KV Cache via Compression and System Co-Design for Efficient Long Context Inferencefinding
  841. MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language ModelsLong
  842. Minimal Pair-Based Evaluation of Code-SwitchingLong
  843. Mining Complex Patterns of Argumentative Reasoning in Natural Language DialogueLong
  844. Mining the uncertainty patterns of humans and models in the annotation of moral foundations and human valuesLong
  845. MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMsfinding
  846. Mis-prompt: Benchmarking Large Language Models for Proactive Error HandlingLong
  847. Missing the Margins: A Systematic Literature Review on the Demographic Representativeness of LLMsfinding
  848. Mitigate Position Bias in LLMs via Scaling a Single Hidden States Channelfinding
  849. Mitigating Bias in RAG: Controlling the Embedderfinding
  850. Mitigating Confounding in Speech-Based Dementia Detection through Weight MaskingLong
  851. Mitigating Demonstration Bias through Global Coevolutionary Reasoningfinding
  852. Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimizationfinding
  853. Mitigating Lost-in-Retrieval Problems in Retrieval Augmented Multi-Hop Question AnsweringLong
  854. Mitigating Negative Interference in Multilingual Knowledge Editing through Null-Space Constraintsfinding
  855. Mitigating Non-Representative Prototypes and Representation Bias in Few-Shot Continual Relation ExtractionLong
  856. Mitigating Paraphrase Attacks on Machine-Text Detection via Paraphrase Inversionfinding
  857. Mitigating Posterior Salience Attenuation in Long-Context LLMs with Positional Contrastive DecodingShort
  858. Mitigating Selection Bias with Node Pruning and Auxiliary OptionsLong
  859. Mitigating Shortcut Learning with InterpoLated LearningLong
  860. Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT ReasoningLong
  861. Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Modelsfinding
  862. Mixture of Ordered Scoring Experts for Cross-prompt Essay Trait ScoringLong
  863. Mixture of Small and Large Models for Chinese Spelling CheckLong
  864. Mixture of Structural-and-Textual Retrieval over Text-rich Graph Knowledge Basesfinding
  865. Mixture of insighTful Experts (MoTE): The Synergy of Reasoning Chains and Expert Mixtures in Self-AlignmentLong
  866. Mixture-of-Personas Language Models for Population Simulationfinding
  867. Mixtures of In-Context LearnersLong
  868. MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Modelsfinding
  869. MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation SystemLong
  870. MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware ExpertsLong
  871. MoRE: A Mixture of Low-Rank Experts for Adaptive Multi-Task Learningfinding
  872. MobiLoRA: Accelerating LoRA-based LLM Inference on Mobile Devices via Context-aware KV Cache OptimizationLong
  873. MockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and BaselinesLong
  874. Modal Dependency Parsing via Biaffine Attention with Self-Loopfinding
  875. Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language ModelsLong
  876. Model Extrapolation Expedites AlignmentLong
  877. Model Performance-Guided Evaluation Data Selection for Effective Prompt Optimizationfinding
  878. Model-Dependent Moderation: Inconsistencies in Hate Speech Detection Across LLM-based Systemsfinding
  879. Modeling Complex Semantics Relation with Contrastively Fine-Tuned Relational EncodersLong
  880. Modeling Uncertainty in Composed Image Retrieval via Probabilistic EmbeddingsLong
  881. Modeling the Evolution of English Noun Compounds with Feature-Rich Diachronic Compositionality PredictionLong
  882. Moderation Matters: Measuring Conversational Moderation Impact in English as a Second Language Group Discussionfinding
  883. Modular Sentence Encoders: Separating Language Specialization from Cross-Lingual AlignmentLong
  884. MolRAG: Unlocking the Power of Large Language Models for Molecular Property PredictionLong
  885. Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generationfinding
  886. More is not always better? Enhancing Many-Shot In-Context Learning with Differentiated and Reweighting ObjectivesLong
  887. MorphMark: Flexible Adaptive Watermarking for Large Language ModelsLong
  888. Mosaic-IT: Cost-Free Compositional Data Synthesis for Instruction Tuningfinding
  889. MotiveBench: How Far Are We From Human-Like Motivational Reasoning in Large Language Models?finding
  890. Movie101v2: Improved Movie Narration BenchmarkLong
  891. MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive TrainingLong
  892. Multi-Agent Collaboration via Cross-Team Orchestrationfinding
  893. Multi-Attribute Steering of Language Models via Targeted InterventionLong
  894. Multi-Facet Blending for Faceted Query-by-Example RetrievalLong
  895. Multi-Hop Question Generation via Dual-Perspective Keyword Guidancefinding
  896. Multi-Hop Reasoning for Question Answering with Hyperbolic Representationsfinding
  897. Multi-Level Explanations for Generative Language ModelsLong
  898. Multi-Modality Expansion and Retention for LLMs through Parameter Merging and DecouplingLong
  899. Multi-Prompting Decoder Helps Better Language Understandingfinding
  900. Multi-Sense Embeddings for Language Models and Knowledge Distillationfinding
  901. Multi-document Summarization through Multi-document Event Relation Graph Reasoning in LLMs: a case study in Framing Bias MitigationLong
  902. Multi-level Association Refinement Network for Dialogue Aspect-based Sentiment Quadruple AnalysisLong
  903. Multi-level Relevance Document Identifier Learning for Generative RetrievalLong
  904. Multi-matrix Factorization Attentionfinding
  905. Multi-perspective Alignment for Increasing Naturalness in Neural Machine TranslationLong
  906. Multi-task Adversarial Attacks against Black-box Model with Few-shot QueriesLong
  907. Multi-word Measures: Modeling Semantic Change in Compound Nounsfinding
  908. MultiAgentBench : Evaluating the Collaboration and Competition of LLM agentsLong
  909. MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMsfinding
  910. MultiHoax: A Dataset of Multi-hop False-premise questionsfinding
  911. MultiMSD: A Corpus for Multilingual Medical Text Simplification from Online Medical Referencesfinding
  912. MultiSocial: Multilingual Benchmark of Machine-Generated Text Detection of Social-Media TextsLong
  913. MultiTEND: A Multilingual Benchmark for Natural Language to NoSQL Query Translationfinding
  914. Multilingual Arbitration: Optimizing Data Pools to Accelerate Multilingual ProgressLong
  915. Multilingual Definition Modelingfinding
  916. Multilingual Encoder Knows more than You Realize: Shared Weights Pretraining for Extremely Low-Resource LanguagesLong
  917. Multilingual Gloss-free Sign Language Translation: Towards Building a Sign Language Foundation ModelShort
  918. Multilingual Retrieval Augmented Generation for Culturally-Sensitive Tasks: A Benchmark for Cross-lingual Robustnessfinding
  919. Multilingual Text-to-Image Generation Magnifies Gender StereotypesLong
  920. Multimodal Causal Reasoning Benchmark: Challenging Multimodal Large Language Models to Discern Causal Links Across Modalitiesfinding
  921. Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark ApproachLong
  922. Multimodal Fusion and Coherence Modeling for Video Topic Segmentationfinding
  923. Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Modelsfinding
  924. Multimodal Invariant Sentiment Representation Learningfinding
  925. Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Reviewfinding
  926. Multimodal Machine Translation with Text-Image In-depth Questioningfinding
  927. Multimodal Pragmatic Jailbreak on Text-to-image ModelsLong
  928. Multimodal Transformers are Hierarchical Modal-wise Heterogeneous GraphsLong
  929. Multiple LLM Agents Debate for Equitable Cultural AlignmentLong
  930. MutantPrompt: Prompt Optimization via Mutation Under a Budget on Modest-sized LMsfinding
  931. Mutual-Taught for Co-adapting Policy and Reward ModelsLong
  932. My Words Imply Your Opinion: Reader Agent-Based Propagation Enhancement for Personalized Implicit Emotion AnalysisLong
  933. M³GQA: A Multi-Entity Multi-Hop Multi-Setting Graph Question Answering BenchmarkLong
  934. NBDESCRIB: A Dataset for Text Description Generation from Tables and Code in Jupyter Notebooks with Guidelinesfinding
  935. NGQA: A Nutritional Graph Question Answering Benchmark for Personalized Health-aware Nutritional ReasoningLong
  936. NOVA: An Iterative Planning Framework for Enhancing Scientific Innovation with Large Language Modelsfinding
  937. NarGINA: Towards Accurate and Interpretable Children’s Narrative Ability Assessment via Narrative Graphsfinding
  938. Narrative Media Framing in Political Discoursefinding
  939. NativQA: Multilingual Culturally-Aligned Natural Query for LLMsfinding
  940. Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse AttentionLong
  941. Natural Language Processing in Support of Evidence-based Medicine: A Scoping Reviewfinding
  942. Natural Language Reasoning in Large Language Models: Analysis and Evaluationfinding
  943. Natural Logic at the Core: Dynamic Rewards for Entailment Tree Generationfinding
  944. NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLMfinding
  945. Navigating Rifts in Human-LLM Grounding: Study and BenchmarkLong
  946. Navigating the Political Compass: Evaluating Multilingual LLMs across Languages and Nationalitiesfinding
  947. NegVQA: Can Vision Language Models Understand Negation?finding
  948. Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text EmbeddingsLong
  949. Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining DatasetLong
  950. NeoQA: Evidence-based Question Answering with Generated News Eventsfinding
  951. Nested-Refinement Metamorphosis: Reflective Evolution for Efficient Optimization of Networking Problemsfinding
  952. NetSafe: Exploring the Topological Safety of Multi-agent Systemfinding
  953. NeuSym-RAG: Hybrid Neural Symbolic Retrieval with Multiview Structuring for PDF Question AnsweringLong
  954. Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language ModelsLong
  955. Neural Parameter Search for Slimmer Fine-Tuned Models and Better TransferLong
  956. Neural Topic Modeling with Large Language Models in the LoopLong
  957. Neuro-Symbolic Query Compilerfinding
  958. Neuron Activation Modulation for Text Style Transfer: Guiding Large Language Modelsfinding
  959. Neuron Empirical Gradient: Discovering and Quantifying Neurons’ Global Linear ControllabilityLong
  960. Neuron-Level Sequential Editing for Large Language ModelsLong
  961. NeuronMerge: Merging Models via Functional Neuron Groupsfinding
  962. Neutralizing Bias in LLM Reasoning using Entailment Graphsfinding
  963. NewsInterview: a Dataset and a Playground to Evaluate LLMs’ Grounding Gap via Informational InterviewsLong
  964. NexusSum: Hierarchical LLM Agents for Long-Form Narrative SummarizationLong
  965. No Questions are Stupid, but some are Poorly Posed: Understanding Poorly-Posed Information-Seeking QuestionsLong
  966. None of the Above, Less of the Right Parallel Patterns in Human and LLM Performance on Multi-Choice Questions Answeringfinding
  967. NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmarkfinding
  968. Normalized AOPC: Fixing Misleading Faithfulness Metrics for Feature Attributions ExplainabilityLong
  969. Not All Terms Matter: Recall-Oriented Adaptive Learning for PLM-aided Query Expansion in Open-Domain Question AnsweringLong
  970. Not quite Sherlock Holmes: Language model predictions do not reliably differentiate impossible from improbable eventsfinding
  971. NovelCR: A Large-Scale Bilingual Dataset Tailored for Long-Span Coreference Resolutionfinding
  972. Nuclear Deployed!: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agentsfinding
  973. Nudging: Inference-time Alignment of LLMs via Guided DecodingLong
  974. Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstitionfinding
  975. NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous ScriptsLong
  976. OASIS: Order-Augmented Strategy for Improved Code SearchLong
  977. ODDA: An OODA-Driven Diverse Data Augmentation Framework for Low-Resource Relation Extractionfinding
  978. OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal RetrievalLong
  979. ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended CapabilitiesLong
  980. ORBIT: Cost-Effective Dataset Curation for Large Language Model Domain Adaptation with an Astronomy Case Studyfinding
  981. OS Agents: A Survey on MLLM-based Agents for Computer, Phone and Browser UseLong
  982. OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task SynthesisLong
  983. OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agentsfinding
  984. OZSpeech: One-step Zero-shot Speech Synthesis with Learned-Prior-Conditioned Flow MatchingLong
  985. ObfusLM: Privacy-preserving Language Model Service against Embedding Inversion AttacksLong
  986. Odysseus Navigates the Sirens’ Song: Dynamic Focus Decoding for Factual and Diverse Open-Ended Text GenerationLong
  987. Offline Reinforcement Learning for LLM Multi-step Reasoningfinding
  988. OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human PreferenceLong
  989. OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality InteractionLong
  990. OmniFlatten: An End-to-end GPT Model for Seamless Voice ConversationLong
  991. On Entity Identification in Language Modelsfinding
  992. On Generalization across Measurement Systems: LLMs Entail More Test-Time Compute for Underrepresented CulturesLong
  993. On Many-Shot In-Context Learning for Long-Context EvaluationLong
  994. On Support Samples of Next Word PredictionLong
  995. On Synthesizing Data for Context Attribution in Question AnsweringLong
  996. On Synthetic Data Strategies for Domain-Specific Generative RetrievalLong
  997. On the Acquisition of Shared Grammatical Representations in Bilingual Language ModelsLong
  998. On the Consistency of Commonsense in Large Language Modelsfinding
  999. On the Generalization vs Fidelity Paradox in Knowledge Distillationfinding
  1000. On the Limit of Language Models as Planning FormalizersLong

Looking for submission deadlines instead? See the conference deadline calendar.