ACL 2025 Accepted Papers
The full list of 3,086 papers accepted at ACL 2025 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Long: 1,602finding: 1,387Short: 97
- Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM CollaborationLong
- Evaluating the Evaluation of Diversity in Commonsense GenerationLong
- Evaluating the Long-Term Memory of Large Language Modelsfinding
- Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative ModelsLong
- Evaluation of Attribution Bias in Generator-Aware Retrieval-Augmented Large Language Modelsfinding
- Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation GenerationLong
- Evaluation of LLMs in Medical Text Summarization: The Role of Vocabulary Adaptation in High OOV Settingsfinding
- Event Pattern-Instance Graph: A Multi-Round Role Representation Learning Strategy for Document-Level Event Argument Extractionfinding
- EventRAG: Enhancing LLM Generation with Event Knowledge GraphsLong
- EvoBench: Towards Real-world LLM-Generated Text Detection Benchmarking for Evolving Large Language Modelsfinding
- EvoWiki: Evaluating LLMs on Evolving KnowledgeLong
- EvolveBench: A Comprehensive Benchmark for Assessing Temporal Awareness in LLMs on Evolving KnowledgeLong
- ExPerT: Effective and Explainable Evaluation of Personalized Long-Form Text Generationfinding
- Exclusion of Thought: Mitigating Cognitive Load in Large Language Models for Enhanced Reasoning in Multiple-Choice TasksLong
- Exp4Fuse: A Rank Fusion Framework for Enhanced Sparse Retrieval using Large Language Model-based Query Expansionfinding
- ExpeTrans: LLMs Are Experiential Transfer LearnersLong
- Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agentfinding
- Explain then Rank: Scale Calibration of Neural Rankers Using Natural Language Explanations from LLMsfinding
- Explain-then-Process: Using Grammar Prompting to Enhance Grammatical Acceptability Judgmentsfinding
- Explainable Depression Detection in Clinical Interviews with Personalized Retrieval-Augmented Generationfinding
- Explainable Hallucination through Natural Language Inference Mappingfinding
- Explaining Matters: Leveraging Definitions and Semantic Expansion for Sexism DetectionLong
- Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudokufinding
- ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Modelsfinding
- Explicit Bayesian Inference to Uncover the Latent Themes of Large Language Modelsfinding
- Explicit and Implicit Data Augmentation for Social Event DetectionLong
- Explicit vs. Implicit: Investigating Social Bias in Large Language Models through Self-Reflectionfinding
- Exploiting Contextual Knowledge in LLMs through 𝒱-usable Information based Layer EnhancementLong
- Exploiting Instruction-Following Retrievers for Malicious Information Retrievalfinding
- Exploiting Phonetics and Glyph Representation at Radical-level for Classical Chinese Understandingfinding
- Exploiting the Shadows: Unveiling Privacy Leaks through Lower-Ranked Tokens in Large Language ModelsLong
- ExploraCoder: Advancing Code Generation for Multiple Unseen APIs via Planning and Chained ExplorationLong
- Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agentsfinding
- Exploring Compositional Generalization of Multimodal LLMs for Medical ImagingLong
- Exploring Explanations Improves the Robustness of In-Context LearningLong
- Exploring Forgetting in Large Language Model Pre-TrainingLong
- Exploring Graph Representations of Logical Forms for Language Modelingfinding
- Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision EncoderLong
- Exploring In-Image Machine Translation with Real-World Backgroundfinding
- Exploring In-context Example Generation for Machine Translationfinding
- Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversionfinding
- Exploring Knowledge Filtering for Retrieval-Augmented Discriminative Tasksfinding
- Exploring LLM Annotation for Adaptation of Clinical Information Extraction Models under Data-sharing Restrictionsfinding
- Exploring LLMs’ Ability to Spontaneously and Conditionally Modify Moral Expressions through Text ManipulationLong
- Exploring Layer-wise Representations of English and Chinese Homonymy in Pre-trained Language Modelsfinding
- Exploring Multi-Modal Data with Tool-Augmented LLM Agents for Precise Causal Discoveryfinding
- Exploring Multimodal Challenges in Toxic Chinese Detection: Taxonomy, Benchmark, and Findingsfinding
- Exploring Multimodal Relation Extraction of Hierarchical Tabular Data with Multi-task LearningLong
- Exploring Persona Sentiment Sensitivity in Personalized Dialogue GenerationLong
- Exploring Supervised Approaches to the Detection of Anthropomorphic Language in the Reporting of NLP Venuesfinding
- Exploring the Choice Behavior of Large Language Modelsfinding
- Exploring the Impact of Instruction-Tuning on LLM’s Susceptibility to MisinformationLong
- Exploring the Potential of LLMs as Personalized Assistants: Dataset, Evaluation, and AnalysisLong
- Exploring the Role of Mental Health Conversational Agents in Training Medical Students and Professionals: A Systematic Literature Reviewfinding
- Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Modelsfinding
- Exposing the Achilles’ Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical ReasoningLong
- Express What You See: Can Multimodal LLMs Decode Visual Ciphers with Intuitive Semiosis Comprehension?finding
- Extending Complex Logical Queries on Uncertain Knowledge GraphsLong
- Extending LLM Context Window with Adaptive Grouped Positional Encoding: A Training-Free MethodLong
- F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow MatchingLong
- FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language ModelsLong
- FADE: Why Bad Descriptions Happen to Good Featuresfinding
- FANNO: Augmenting High-Quality Instruction Data with Open-Sourced LLMs Onlyfinding
- FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop ReasoningLong
- FEA-Bench: A Benchmark for Evaluating Repository-Level Code Generation for Feature ImplementationLong
- FEAT: A Preference Feedback Dataset through a Cost-Effective Auto-Generation and Labeling Framework for English AI TutoringShort
- FGDGNN: Fine-Grained Dynamic Graph Neural Network for Rumor Detection on Social Mediafinding
- FIHA: Automated Fine-grained Hallucinations Evaluations in Large Vision Language Models with Davidson Scene Graphsfinding
- FLAG-TRADER: Fusion LLM-Agent with Gradient-based Reinforcement Learning for Financial Tradingfinding
- FOCUS: Evaluating Pre-trained Vision-Language Models on Underspecification ReasoningLong
- FPE2M2: Approaching Lossless and Efficient Quantization with Native Floating Pointfinding
- FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative SamplingLong
- FRACTAL: Fine-Grained Scoring from Aggregate Text LabelsLong
- FRAG: A Flexible Modular Framework for Retrieval-Augmented Generation based on Knowledge Graphsfinding
- FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategyfinding
- FRAME: Feedback-Refined Agent Methodology for Enhancing Medical Research Insightsfinding
- FREE: Fast and Robust Vision Language Models with Early Exitsfinding
- FaVe: Factored and Verified Search Rationale for Long-form Answerfinding
- Fact Recall, Heuristics or Pure Guesswork? Precise Interpretations of Language Models for Fact Completionfinding
- FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality EvaluationLong
- FactLens: Benchmarking Fine-Grained Fact Verificationfinding
- Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentationfinding
- FairI Tales: Evaluation of Fairness in Indian Contexts with a Focus on Bias and StereotypesLong
- FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steeringfinding
- Fairness Beyond Performance: Revealing Reliability Disparities Across Groups in Legal NLPLong
- Fairness through Difference Awareness: Measuring Desired Group Discrimination in LLMsLong
- Faithful and Robust LLM-Driven Theorem Proving for NLI ExplanationsLong
- FaithfulRAG: Fact-Level Conflict Modeling for Context-Faithful Retrieval-Augmented GenerationLong
- FanChuan: A Multilingual and Graph-Structured Benchmark For Parody Detection and Analysisfinding
- Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question AnsweringShort
- Fast-and-Frugal Text-Graph Transformers are Effective Link Predictorsfinding
- FastDraft: How to Train Your Draftfinding
- FastMCTS: A Simple Sampling Strategy for Data SynthesisLong
- Faster Speculative Decoding via Effective Draft Decoder with Pruned Candidate TreeLong
- Feature-Level Insights into Artificial Text Detection with Sparse Autoencodersfinding
- FedDQC: Data Quality Control in Federated Instruction-tuning of Large Language Modelsfinding
- FedEx-LoRA: Exact Aggregation for Federated and Efficient Fine-Tuning of Large Language ModelsLong
- FedLEKE: Federated Locate-then-Edit Knowledge Editing for Multi-Client Collaborationfinding
- Federated Data-Efficient Instruction Tuning for Large Language Modelsfinding
- FiDeLiS: Faithful Reasoning in Large Language Models for Knowledge Graph Question Answeringfinding
- Filling the Temporal Void: Recovering Missing Publication Years in the Project Gutenberg Corpus Using LLMsfinding
- FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning EvaluationLong
- FinRipple: Aligning Large Language Models with Financial Market for Event Ripple Effect Awarenessfinding
- FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and ChallengingLong
- Financial Language Model Evaluation (FLaME)finding
- Finding A Voice: Exploring the Potential of African American Dialect and Voice Generation for ChatbotsLong
- Finding Needles in Images: Can Multi-modal LLMs Locate Fine Details?Long
- Finding the Sweet Spot: Preference Data Construction for Scaling Preference OptimizationLong
- Fine-Tuning on Diverse Reasoning Chains Drives Within-Inference CoT Refinement in LLMsLong
- Fine-grained Knowledge Enhancement for Retrieval-Augmented Generationfinding
- Fine-grained Video Dubbing Duration Alignment with Segment Supervised Preference OptimizationLong
- FineCite: A Novel Approach For Fine-Grained Citation Context Analysisfinding
- FineReason: Evaluating and Improving LLMs’ Deliberate Reasoning through Reflective Puzzle SolvingLong
- Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State TrackingLong
- Firm or Fickle? Evaluating Large Language Models Consistency in Sequential Interactionsfinding
- First-Step Advantage: Importance of Starting Right in Multi-Step Math Reasoningfinding
- FitCF: A Framework for Automatic Feature Importance-guided Counterfactual Example Generationfinding
- Fixing Distribution Shifts of LLM Self-Critique via On-Policy Self-Play TrainingLong
- FlashAudio: Rectified Flow for Fast and High-Fidelity Text-to-Audio GenerationLong
- FlashBack: Efficient Retrieval-Augmented Language Modeling for Fast Inferencefinding
- Flexora: Flexible Low-Rank Adaptation for Large Language ModelsLong
- Flipping Knowledge Distillation: Leveraging Small Models’ Expertise to Enhance LLMs in Text MatchingLong
- FloorPlan-LLaMa: Aligning Architects’ Feedback and Domain Knowledge in Architectural Floor Plan GenerationLong
- Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capabilityfinding
- Flowchart-Based Decision Making with Large Language Modelsfinding
- FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference RankingsShort
- Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment TuningLong
- FocusLLM: Precise Understanding of Long Context by Dynamic CondensingLong
- Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Pointsfinding
- FoldMoE: Efficient Long Sequence MoE Training via Attention-MoE PipeliningLong
- Follow-up Question Generation For Enhanced Patient-Provider ConversationsLong
- Forget the Token and Pixel: Rethinking Gradient Ascent for Concept Unlearning in Multimodal Generative Modelsfinding
- Forgotten Polygons: Multimodal Large Language Models are Shape-Blindfinding
- Forward Knows Efficient Backward Path: Saliency-Guided Memory-Efficient Fine-tuning of Large Language ModelsLong
- Fraud-R1 : A Multi-Round Benchmark for Assessing the Robustness of LLM Against Augmented Fraud and Phishing Inducementsfinding
- Frequency matters: Modeling irregular morphological patterns in Spanish with Transformersfinding
- Frictional Agent Alignment Framework: Slow Down and Don’t Break ThingsLong
- From Awareness to Adaptability: Enhancing Tool Utilization for Scientific Reasoningfinding
- From Citations to Criticality: Predicting Legal Decision Influence in the Multilingual Swiss JurisprudenceShort
- From Complexity to Clarity: AI/NLP’s Role in Regulatory Compliancefinding
- From Conversation to Automation: Leveraging LLMs for Problem-Solving Therapy Analysisfinding
- From English to Second Language Mastery: Enhancing LLMs with Cross-Lingual Continued Instruction TuningLong
- From Evasion to Concealment: Stealthy Knowledge Unlearning for LLMsfinding
- From Heart to Words: Generating Empathetic Responses via Integrated Figurative Language and Semantic Context Signalsfinding
- From Human Reading to NLM Understanding: Evaluating the Role of Eye-Tracking Data in Encoder-Based ModelsLong
- From Imitation to Introspection: Probing Self-Consciousness in Language Modelsfinding
- From Informal to Formal – Incorporating and Evaluating LLMs on Natural Language Requirements to Verifiable Formal ProofsLong
- From Information to Insight: Leveraging LLMs for Open Aspect-Based Educational SummarizationLong
- From Isolates to Families: Using Neural Networks for Automated Language AffiliationLong
- From Lists to Emojis: How Format Bias Affects Model AlignmentLong
- From Misleading Queries to Accurate Answers: A Three-Stage Fine-Tuning Method for LLMsfinding
- From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language Models via Neurons AlignmentLong
- From Objectives to Questions: A Planning-based Framework for Educational Mathematical Question GenerationLong
- From Observation to Understanding: Front-Door Adjustments with Uncertainty Calibration for Enhancing Egocentric Reasoning in LVLMsfinding
- From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time AlignmentLong
- From Perception to Reasoning: Enhancing Vision-Language Models for Mobile UI Understandingfinding
- From Perceptions to Decisions: Wildfire Evacuation Decision Prediction with Behavioral Theory-informed LLMsLong
- From Phrases to Subgraphs: Fine-Grained Semantic Parsing for Knowledge Graph Question Answeringfinding
- From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed GroundingLong
- From Selection to Generation: A Survey of LLM-based Active LearningLong
- From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalitiesfinding
- From Sub-Ability Diagnosis to Human-Aligned Generation: Bridging the Gap for Text Length Control via MarkerGenLong
- From Tools to Teammates: Evaluating LLMs in Multi-Session Coding InteractionsLong
- From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language ModelsLong
- Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoningfinding
- Fusing Highly Specialized Language Models for Comprehensive ExpertiseLong
- Fuzzy Speculative Decoding for a Tunable Accuracy-Runtime Tradeofffinding
- G-Safeguard: A Topology-Guided Security Lens and Treatment on LLM-based Multi-agent SystemsLong
- G2S: A General-to-Specific Learning Framework for Temporal Knowledge Graph Forecasting with Large Language Modelsfinding
- GA-S3: Comprehensive Social Network Simulation with Group Agentsfinding
- GALLa: Graph Aligned Large Language Models for Improved Source Code UnderstandingLong
- GAMEBoT: Transparent Assessment of LLM Reasoning in GamesLong
- GAPO: Learning Preferential Prompt through Generative Adversarial Policy OptimizationLong
- GEMS: Generation-Based Event Argument Extraction via Multi-perspective Prompts and Ontology Steeringfinding
- GETReason: Enhancing Image Context Extraction through Hierarchical Multi-Agent ReasoningLong
- GIFT-SW: Gaussian noise Injected Fine-Tuning of Salient Weights for LLMsLong
- GIMMICK: Globally Inclusive Multimodal Multitask Cultural Knowledge Benchmarkingfinding
- GLTW: Joint Improved Graph Transformer and LLM via Three-Word Language for Knowledge Graph Completionfinding
- GLiM: Integrating Graph Transformer and LLM for Document-Level Biomedical Relation Extraction with Incomplete Labelingfinding
- GNN-RAG: Graph Neural Retrieval for Efficient Large Language Model Reasoning on Knowledge Graphsfinding
- GODBench: A Benchmark for Multimodal Large Language Models in Video Comment ArtLong
- GOLFer: Smaller LMs-Generated Documents Hallucination Filter & Combiner for Query Expansion in Information Retrievalfinding
- GOODLIAR: A Reinforcement Learning-Based Deceptive Agent for Disrupting LLM Beliefs on Foundational Principlesfinding
- GPT-4 as a Homework Tutor Can Improve Student Engagement and Learning OutcomesLong
- GRACE: A Granular Benchmark for Evaluating Model Calibration against Human CalibrationLong
- GRAF: Graph Retrieval Augmented by Facts for Romanian Legal Multi-Choice Question Answeringfinding
- GRAM: Generative Recommendation via Semantic-aware Multi-granular Late FusionLong
- GRAMMAR-LLM: Grammar-Constrained Natural Language Generationfinding
- GRAT: Guiding Retrieval-Augmented Reasoning through Process Rewards Tree SearchLong
- GRI-QA: a Comprehensive Benchmark for Table Question Answering over Environmental Datafinding
- GRNFormer: A Biologically-Guided Framework for Integrating Gene Regulatory Networks into RNA Foundation Modelsfinding
- GRaMPa: Subword Regularisation by Skewing Uniform Segmentation Distributions with an Efficient Path-counting Markov ModelLong
- GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuningfinding
- GUI Agents: A Surveyfinding
- GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI AgentLong
- GUICourse: From General Vision Language Model to Versatile GUI AgentLong
- GUIDEX: Guided Synthetic Data Generation for Zero-Shot Information Extractionfinding
- GUM-SAGE: A Novel Dataset and Approach for Graded Entity Salience Predictionfinding
- GaRAGe: A Benchmark with Grounding Annotations for RAG Evaluationfinding
- GainRAG: Preference Alignment in Retrieval-Augmented Generation through Gain Signal SynthesisLong
- Game Development as Human-LLM InteractionLong
- GeAR: Generation Augmented Retrievalfinding
- GeAR: Graph-enhanced Agent for Retrieval-augmented Generationfinding
- GeLLM³O: Generalizing Large Language Models for Multi-property Molecule OptimizationLong
- GeNRe: A French Gender-Neutral Rewriting System Using Collective Nounsfinding
- GenKnowSub: Improving Modularity and Reusability of LLMs through General Knowledge SubtractionShort
- GenTool: Enhancing Tool Generalization in Language Models through Zero-to-One and Weak-to-Strong Simulationfinding
- Gender Inclusivity Fairness Index (GIFI): A Multilevel Framework for Evaluating Gender Diversity in Large Language ModelsLong
- GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language ModelsLong
- Generalizable Cross-Lingual Cognitive Distortion Detection with Standardized Annotations and Multi-Task Learningfinding
- Generalized Attention Flow: Feature Attribution for Transformer Models via Maximum FlowLong
- Generate First, Then Sample: Enhancing Fake News Detection with LLM-Augmented Reinforced SamplingLong
- Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolutionfinding
- Generating Diverse Training Samples for Relation Extraction with Large Language ModelsLong
- Generating Domain-Specific Knowledge Graphs from Large Language Modelsfinding
- Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Modelsfinding
- Generating Plausible Distractors for Multiple-Choice Questions via Student Choice PredictionLong
- Generating Questions, Answers, and Distractors for Videos: Exploring Semantic Uncertainty of Object Motionsfinding
- Generative Error Correction for Emotion-aware Speech-to-text Translationfinding
- Generative Frame Sampler for Long Video Understandingfinding
- Generative Music Models’ Alignment with Professional and Amateur Users’ Expectationsfinding
- Generative Psycho-Lexical Approach for Constructing Value Systems in Large Language ModelsLong
- Generative Reward Modeling via Synthetic Criteria Preference LearningLong
- Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced ReasoningLong
- Geometric Signatures of Compositionality Across a Language Model’s LifetimeLong
- GiFT: Gibbs Fine-Tuning for Code GenerationLong
- GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and RefinementLong
- Global Eye: Breaking the “Fixed Thinking Pattern” during the Instruction Expansion ProcessLong
- Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual EvaluationLong
- GlyphPattern: An Abstract Pattern Recognition for Vision-Language Modelsfinding
- Going Beyond Your Expectations in Latency Metrics for Simultaneous Speech Translationfinding
- GradOT: Training-free Gradient-preserving Offsite-tuning for Large Language ModelsLong
- Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language ModelsLong
- GrammaMT: Improving Machine Translation with Grammar-Informed In-Context LearningLong
- Grammar-Based Code Representation: Is It a Worthy Pursuit for LLMs?finding
- Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM ReasoningLong
- Graph of Records: Boosting Retrieval Augmented Generation for Long-context Summarization with GraphsLong
- Graph-Assisted Culturally Adaptable Idiomatic Translation for Indic languagesfinding
- Graph-Structured Trajectory Extraction from TraveloguesLong
- Graph-guided Cross-composition Feature Disentanglement for Compositional Zero-shot Learningfinding
- GraphCheck: Breaking Long-Term Text Barriers with Extracted Knowledge Graph-Powered Fact-CheckingLong
- GraphInsight: Unlocking Insights in Large Language Models for Graph Structure UnderstandingLong
- GraphNarrator: Generating Textual Explanations for Graph Neural NetworksLong
- Graphically Speaking: Unmasking Abuse in Social Media with Conversation InsightsLong
- Grounded, or a Good Guesser? A Per-Question Balanced Dataset to Separate Blind from Grounded Models for Embodied Question AnsweringShort
- Grounding Task Assistance with Multimodal Cues from a Single Demonstrationfinding
- Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Modelfinding
- Growing Through Experience: Scaling Episodic Grounding in Language ModelsLong
- GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and ReasoningLong
- GuideBench: Benchmarking Domain-Oriented Guideline Following for LLM AgentsLong
- Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous ConstraintsLong
- Gumbel Reranking: Differentiable End-to-End Reranker OptimizationLong
- Gödel Agent: A Self-Referential Agent Framework for Recursively Self-ImprovementLong
- HACo-Det: A Study Towards Fine-Grained Machine-Generated Text Detection under Human-AI CoauthoringLong
- HAF-RM: A Hybrid Alignment Framework for Reward Model TrainingLong
- HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language ModelsLong
- HALoGEN: Fantastic LLM Hallucinations and Where to Find ThemLong
- HASH-RAG: Bridging Deep Hashing with Retriever for Efficient, Fine Retrieval and Augmented Generationfinding
- HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inferencefinding
- HD-NDEs: Neural Differential Equations for Hallucination Detection in LLMsLong
- HELIOS: Harmonizing Early Fusion, Late Fusion, and LLM Reasoning for Multi-Granular Table-Text RetrievalLong
- HFT: Half Fine-Tuning for Large Language ModelsLong
- HG-InsightLog: Context Prioritization and Reduction for Question Answering with Non-Natural Language Construct Log Datafinding
- HICD: Hallucination-Inducing via Attention Dispersion for Contrastive Decoding to Mitigate Hallucinations in Large Language Modelsfinding
- HPSS: Heuristic Prompting Strategy Search for LLM Evaluatorsfinding
- HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language ModelsLong
- HTML: Hierarchical Topology Multi-task Learning for Semantic Parsing in Knowledge Base Question Answeringfinding
- HalluLens: LLM Hallucination BenchmarkLong
- Hallucination Detox: Sensitivity Dropout (SenD) for Large Language Model TrainingLong
- HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Assistant Scenariosfinding
- Hanging in the Balance: Pivotal Moments in Crisis Counseling ConversationsLong
- Harnessing Large Language Models for Disaster Management: A Surveyfinding
- Harnessing PDF Data for Improving Japanese Large Multimodal Modelsfinding
- Harnessing Whisper for Prosodic Stress Analysisfinding
- Has Machine Translation Evaluation Achieved Human Parity? The Human Reference and the Limits of ProgressShort
- HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on TwitterLong
- HatePRISM: Policies, Platforms, and Research Integration. Advancing NLP for Hate Speech Proactive Mitigationfinding
- Hatevolution: What Static Benchmarks Don’t Tell Usfinding
- Have We Designed Generalizable Structural Knowledge Promptings? Systematic Evaluation and RethinkingLong
- HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoningfinding
- Help Me Write a Story: Evaluating LLMs’ Ability to Generate Writing FeedbackLong
- HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain TasksLong
- Heuristic-based Search Algorithm in Automatic Instruction-focused Prompt Optimization: A Surveyfinding
- HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language ModelLong
- HiCOT: Improving Neural Topic Models via Optimal Transport and Contrastive Learningfinding
- HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language ModelLong
- Hidden in Plain Sight: Evaluation of the Deception Detection Capabilities of LLMs in Multimodal SettingsLong
- HiddenDetect: Detecting Jailbreak Attacks against Multimodal Large Language Models via Monitoring Hidden StatesLong
- Hierarchical Attention Generates Better ProofsLong
- Hierarchical Bracketing Encodings for Dependency Parsing as TaggingLong
- Hierarchical Document Refinement for Long-context Retrieval-augmented GenerationLong
- Hierarchical Level-Wise News Article Clustering via Multilingual Matryoshka EmbeddingsLong
- Hierarchical Memory Organization for Wikipedia GenerationLong
- Hierarchical Retrieval with Evidence Curation for Open-Domain Financial Question Answering on Standardized Documentsfinding
- Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Modelsfinding
- Hierarchical-Task-Aware Multi-modal Mixture of Incremental LoRA Experts for Embodied Continual LearningLong
- HintsOfTruth: A Multimodal Checkworthiness Detection Dataset with Real and Synthetic ClaimsLong
- HoH: A Dynamic Benchmark for Evaluating the Impact of Outdated Information on Retrieval-Augmented GenerationLong
- HoPE: A Novel Positional Encoding Without Long-Term Decay for Enhanced Context Awareness and ExtrapolationLong
- HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple DevicesLong
- HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generationfinding
- HotelMatch-LLM: Joint Multi-Task Training of Small and Large Language Models for Efficient Multimodal Hotel RetrievalLong
- How Do LLMs Acquire New Knowledge? A Knowledge Circuits Perspective on Continual Pre-Trainingfinding
- How Do Multilingual Language Models Remember Facts?finding
- How Does Response Length Affect Long-Form Factualityfinding
- How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulationfinding
- How Humans and LLMs Organize Conceptual Knowledge: Exploring Subordinate Categories in ItalianLong
- How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMsLong
- How Much Do Encoder Models Know About Word Senses?Long
- How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMsfinding
- How Personality Traits Shape LLM Risk-Taking Behaviourfinding
- How Programming Concepts and Neurons Are Shared in Code Language Modelsfinding
- How do LLMs’ Preferences Affect Event Argument Extraction? CAT: Addressing Preference Traps in Unsupervised EAEfinding
- How do Transformer Embeddings Represent Compositions? A Functional Analysisfinding
- How does Misinformation Affect Large Language Model Behaviors and Preferences?Long
- How to Compare Things Properly? A Study of Argument Relevance in Comparative Question AnsweringLong
- How to Enable Effective Cooperation Between Humans and NLP Models: A Survey of Principles, Formalizations, and BeyondLong
- How to Mitigate Overfitting in Weak-to-strong Generalization?Long
- How to Train Long-Context Language Models (Effectively)Long
- HumT DumT: Measuring and controlling human-like language in LLMsLong
- Human Alignment: How Much Do We Adapt to LLMs?Short
- Human Bias in the Face of AI: Examining Human Judgment Against Text Labeled as AI Generatedfinding
- Human-LLM Coevolution: Evidence from Academic Writingfinding
- HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation Taskfinding
- HyGenar: An LLM-Driven Hybrid Genetic Algorithm for Few-Shot Grammar Generationfinding
- HyKGE: A Hypothesis Knowledge Graph Enhanced RAG Framework for Accurate and Reliable Medical LLMs ResponsesLong
- HybGRAG: Hybrid Retrieval-Augmented Generation on Textual and Relational Knowledge BasesLong
- Hybrid Preferences: Learning to Route Instances for Human vs. AI FeedbackLong
- HyperCRS: Hypergraph-Aware Multi-Grained Preference Learning to Burst Filter Bubbles in Conversational Recommendation Systemfinding
- HyperFM: Fact-Centric Multimodal Fusion for Link Prediction over Hyper-Relational Knowledge GraphsLong
- Hypothetical Documents or Knowledge Leakage? Rethinking LLM-based Query Expansionfinding
- I see what you mean: Co-Speech Gestures for Reference Resolution in Multimodal Dialoguefinding
- I0T: Embedding Standardization Method Towards Zero Modality GapLong
- IAM: Efficient Inference through Attention Mapping between Different-scale LLMsLong
- ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMsLong
- IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abductionfinding
- IMOL: Incomplete-Modality-Tolerant Learning for Multi-Domain Fake News Video DetectionLong
- IMPARA-GED: Grammatical Error Detection is Boosting Reference-free Grammatical Error Quality Estimatorfinding
- INJONGO: A Multicultural Intent Detection and Slot-filling Dataset for 16 African LanguagesLong
- INT: Establishing Information Transfer for Multilingual Intent Detection and Slot Fillingfinding
- INTERACT: Enabling Interactive, Question-Driven Learning in Large Language ModelsLong
- INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based AgentLong
- IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference OptimizationLong
- IPO: Your Language Model is Secretly a Preference ClassifierLong
- IRIS: An Iterative and Integrated Framework for Verifiable Causal Discovery in the Absence of Tabular DataLong
- IRIS: Interpretable Retrieval-Augmented Classification for Long Interspersed Document SequencesLong
- IRT-Router: Effective and Interpretable Multi-LLM Routing via Item Response TheoryLong
- ISR: Self-Refining Referring Expressions for Entity GroundingLong
- IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Webfinding
- Identifying Cellular Niches in Spatial Transcriptomics: An Investigation into the Capabilities of Large Language ModelsLong
- Identifying Open Challenges in Language IdentificationLong
- Identifying Reliable Evaluation Metrics for Scientific Text RevisionLong
- If Attention Serves as a Cognitive Model of Human Memory Retrieval, What is the Plausible Memory Representation?Long
- If Eleanor Rigby Had Met ChatGPT: A Study on Loneliness in a Post-LLM WorldLong
- ImPart: Importance-Aware Delta-Sparsification for Improved Model Compression and Merging in LLMsLong
- Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Modelsfinding
- Impartial Multi-task Representation Learning via Variance-invariant Probabilistic DecodingLong
- ImpliHateVid: A Benchmark Dataset and Two-stage Contrastive Learning Framework for Implicit Hate Speech Detection in VideosLong
- Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignmentfinding
- Implicit Reasoning in Transformers is Reasoning through Shortcutsfinding
- Improve Language Model and Brain Alignment via Associative Memoryfinding
- Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimatefinding
- Improve Safety Training of Large Language Models with Safety-Critical Singular Vectors LocalizationLong
- Improve Vision Language Model Chain-of-thought ReasoningLong
- Improved Unbiased Watermark for Large Language ModelsLong
- Improving Automatic Evaluation of Large Language Models (LLMs) in Biomedical Relation Extraction via LLMs-as-the-JudgeLong
- Improving Causal Interventions in Amnesic Probing with Mean Projection or LEACEfinding
- Improving Chain-of-Thought Reasoning via Quasi-Symbolic AbstractionsLong
- Improving Contextual Faithfulness of Large Language Models via Retrieval Heads-Induced OptimizationLong
- Improving Continual Pre-training Through Seamless Data Packingfinding
- Improving Dialogue Discourse Parsing through Discourse-aware Utterance ClarificationLong
- Improving Dialogue State Tracking through Combinatorial Search for In-Context ExamplesLong
- Improving Efficiency in Large Language Models via Extendable Block Floating Point Representationfinding
- Improving Factuality with Explicit Working MemoryLong
- Improving Fairness of Large Language Models in Multi-document SummarizationShort
- Improving Language and Modality Transfer in Translation by Character-level ModelingLong
- Improving Low-Resource Morphological Inflection via Self-Supervised ObjectivesLong
- Improving MLLM’s Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiencyfinding
- Improving Medical Large Vision-Language Models with Abnormal-Aware FeedbackLong
- Improving Model Factuality with Fine-grained Critique-based EvaluatorLong
- Improving Occupational ISCO Classification of Multilingual Swiss Job Postings with LLM-Refined Training Datafinding
- Improving Parallel Sentence Mining for Low-Resource and Endangered LanguagesShort
- Improving Preference Extraction In LLMs By Identifying Latent Knowledge Through Classifying ProbesLong
- Improving Word Alignment Using Semi-Supervised Learningfinding
- Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution’s CharacteristicsShort
- In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue AgentsLong
- In Search of the Lost Arch in Dialogue: A Dependency Dialogue Acts Corpus for Multi-Party Dialoguesfinding
- In the LLM era, Word Sense Induction remains unsolvedfinding
- In-the-wild Audio Spatialization with Flexible Text-guided LocalizationLong
- InImageTrans: Multimodal LLM-based Text Image Machine Translationfinding
- InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-trainingLong
- Incongruity-aware Tension Field Network for Multi-modal Sarcasm DetectionLong
- Inconsistent Tokenizations Cause Language Models to be Perplexed by Japanese GrammarShort
- Incorporating Domain Knowledge into Materials TokenizationLong
- IndicSynth: A Large-Scale Multilingual Synthetic Speech Dataset for Low-Resource Indian LanguagesLong
- Inducing lexicons of in-group language with socio-temporal contextLong
- InductionBench: LLMs Fail in the Simplest Complexity ClassLong
- Inductive Linguistic Reasoning with Large Language Modelsfinding
- Inference Compute-Optimal Video Vision Language ModelsLong
- Inferring Functionality of Attention Heads from their ParametersLong
- Inferring from Logits: Exploring Best Practices for Decoding-Free Generative Candidate SelectionLong
- InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Modelfinding
- InfiniteICL: Breaking the Limit of Context Window Size via Long Short-term Memory Transformationfinding
- Influences on LLM Calibration: A Study of Response Agreement, Loss Functions, and Prompt StylesLong
- Infogen: Generating Complex Statistical Infographics from DocumentsLong
- Information Extraction from Visually Rich Documents using LLM-based Organization of Documents into Independent Textual SegmentsLong
- Information Locality as an Inductive Bias for Neural Language ModelsLong
- Initializing and Retrofitting Key-Value Adaptors for Traceable Model Editingfinding
- Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal ThinkingLong
- Innovative Image Fraud Detection with Cross-Sample Anomaly Analysis: The Power of LLMsLong
- Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMsLong
- InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for DebatingLong
- Instance-Selection-Inspired Undersampling Strategies for Bias Reduction in Small and Large Language Models for Binary Text ClassificationLong
- InstructPart: Task-Oriented Part Segmentation with Instruction ReasoningLong
- Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in KazakhLong
- Instruction-Tuning Data Synthesis from Scratch via Web Reconstructionfinding
- Instruction-Tuning LLMs for Event Extraction with Annotation Guidelinesfinding
- Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization on Multi-party ConversationLong
- IntelliCockpitBench: A Comprehensive Benchmark to Evaluate VLMs for Intelligent Cockpitfinding
- IntentionESC: An Intention-Centered Framework for Enhancing Emotional Support in Dialogue Systemsfinding
- Inter-Passage Verification for Multi-evidence Multi-answer QAfinding
- Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language ModelsLong
- Interactive and Expressive Code-Augmented Planning with Large Language ModelsLong
- Interlocking-free Selective Rationalization Through Genetic-based LearningLong
- InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Modelfinding
- Internal Value Alignment in Large Language Models through Controlled Value Vector ActivationLong
- Internal and External Impacts of Natural Language Processing PapersShort
- Interpret and Improve In-Context Learning via the Lens of Input-Label MappingsLong
- Introducing Graph Context into Language Models through Parameter-Efficient Fine-Tuning for Lexical Relation MiningLong
- Introducing Verification Task of Set Consistency with Set-Consistency Energy NetworksLong
- Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single ProcessLong
- InvestAlign: Overcoming Data Scarcity in Aligning Large Language Models with Investor Decision-Making Processes Under Herd BehaviorLong
- Investigating Context Faithfulness in Large Language Models: The Roles of Memory Strength and Evidence Stylefinding
- Investigating Inference-time Scaling for Chain of Multi-modal Thought: A Preliminary Studyfinding
- Investigating Language Preference of Multilingual RAG Systemsfinding
- Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attributionfinding
- Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Modelsfinding
- Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal InconsistencyLong
- Investigating and Extending Homans’ Social Exchange Theory with Large Language Model based AgentsLong
- Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Trainingfinding
- Iron Sharpens Iron: Defending Against Attacks in Machine-Generated Text Detection with Adversarial TrainingLong
- Is External Information Useful for Stance Detection with LLMs?finding
- Is It JUST Semantics? A Case Study of Discourse Particle Understanding in LLMsfinding
- Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreementfinding
- Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?finding
- Is That Your Final Answer? Test-Time Scaling Improves Selective Question AnsweringShort
- Is a cute puyfred cute? Context-dependent form-meaning systematicity in LLMsfinding
- Is linguistically-motivated data augmentation worth it?Long
- Iterative Repair with Weak Verifiers for Few-shot Transfer in KBQA with Unanswerabilityfinding
- It’s Not Bragging If You Can Back It Up: Can LLMs Understand Braggings?Long
- It’s Not a Walk in the Park! Challenges of Idiom Translation in Speech-to-text SystemsLong
- JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mousefinding
- JEBS: A Fine-grained Biomedical Lexical Simplification Taskfinding
- Jailbreak Large Vision-Language Models Through Multi-Modal LinkageLong
- JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMsLong
- Jailbreaking? One Step Is Enough!Long
- JoPA: Explaining Large Language Model’s Generation via Joint Prompt AttributionLong
- JsonTuning: Towards Generalizable, Robust, and Controllable Instruction Tuningfinding
- JuStRank: Benchmarking LLM Judges for System RankingLong
- Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Modelsfinding
- Just Go Parallel: Improving the Multilingual Capabilities of Large Language ModelsLong
- Just KIDDIN’ : Knowledge Infusion and Distillation for Detection of INdecent Memesfinding
- Just Put a Human in the Loop? Investigating LLM-Assisted Annotation for Subjective Tasksfinding
- Just a Scratch: Enhancing LLM Capabilities for Self-harm Detection through Intent Differentiation and Emoji InterpretationLong
- K-order Ranking Preference Optimization for Large Language Modelsfinding
- K/DA: Automated Data Generation Pipeline for Detoxifying Implicitly Offensive Language in KoreanLong
- KAPA: A Deliberative Agent Framework with Tree-Structured Knowledge Base for Multi-Domain User Intent Understandingfinding
- KARPA: A Training-free Method of Adapting Knowledge Graph as References for Large Language Model’s Reasoning Path Aggregationfinding
- KE-MHISTO: Towards a Multilingual Historical Knowledge Extraction Benchmark for Addressing the Long-Tail Problemfinding
- KERL: Knowledge-Enhanced Personalized Recipe Recommendation using Large Language ModelsLong
- KG-Agent: An Efficient Autonomous Agent Framework for Complex Reasoning over Knowledge GraphLong
- KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understandingfinding
- KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive ReasoningLong
- KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional EmbeddingLong
- KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputationfinding
- KaFT: Knowledge-aware Fine-tuning for Boosting LLMs’ Domain-specific Question-Answering Performancefinding
- KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature AnalysisLong
- KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of KazakhstanLong
- Keys to Robust Edits: From Theoretical Insights to Practical AdvancesLong
- KiRAG: Knowledge-Driven Iterative Retriever for Enhancing Retrieval-Augmented GenerationLong
- Know You First and Be You Better: Modeling Human-Like User Simulators via Implicit ProfilesLong
- Know Your Mistakes: Towards Preventing Overreliance on Task-Oriented Conversational AI Through Accountability ModelingLong
- Know the Unknown: An Uncertainty-Sensitive Method for LLM Instruction Tuningfinding
- KnowCoder-X: Boosting Multilingual Information Extraction via Codefinding
- KnowShiftQA: How Robust are RAG Systems when Textbook Knowledge Shifts in K-12 Education?Short
- Knowing Before Saying: LLM Representations Encode Information About Chain-of-Thought Success Before Completionfinding
- Knowledge Base Construction for Knowledge-Augmented Text-to-SQLfinding
- Knowledge Boundary of Large Language Models: A SurveyLong
- Knowledge Decoupling via Orthogonal Projection for Lifelong Editing of Large Language ModelsLong
- Knowledge Graph Retrieval-Augmented Generation for LLM-based RecommendationLong
- Knowledge Image Matters: Improving Knowledge-Based Visual Reasoning with Multi-Image Large Language ModelsLong
- Knowledge Tracing in Programming Education Integrating Students’ QuestionsLong
- Knowledge-Augmented Multimodal Clinical Rationale Generation for Disease Diagnosis with Small Language ModelsLong
- KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Codingfinding
- KokoroChat: A Japanese Psychological Counseling Dialogue Dataset Collected via Role-Playing by Trained CounselorsLong
- Konooz: Multi-domain Multi-dialect Corpus for Named Entity Recognitionfinding
- L-CiteEval: A Suite for Evaluating Fidelity of Long-context ModelsLong
- L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language ModelsLong
- LACA: Improving Cross-lingual Aspect-Based Sentiment Analysis with LLM Data AugmentationLong
- LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiersfinding
- LADM: Long-context Training Data Selection with Attention-based Dependency Measurement for LLMsLong
- LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedbackfinding
- LAMB: A Training-Free Method to Enhance the Long-Context Understanding of SSMs via Attention-Guided Token FilteringShort
- LAQuer: Localized Attribution Queries in Content-grounded GenerationLong
- LCFO: Long Context and Long Form Output Dataset and Benchmarkingfinding
- LCHAIM - Investigating Long Context Reasoning in Hebrewfinding
- LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representationsfinding
- LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language ModelsLong
- LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-DisjointLong
- LEMMA: Learning from Errors for MatheMatical Advancement in LLMsfinding
- LEMONADE: A Large Multilingual Expert-Annotated Abstractive Event Dataset for the Real Worldfinding
- LESA: Learnable LLM Layer Scaling-UpLong
- LETS-C: Leveraging Text Embedding for Time Series ClassificationLong
- LGAR: Zero-Shot LLM-Guided Neural Ranking for Abstract Screening in Systematic Literature Reviewsfinding
- LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context ScenariosLong
- LIME: Less Is More for MLLM Evaluationfinding
- LIST: Linearly Incremental SQL Translator for Single-Hop Reasoning, Generation and Verificationfinding
- LLM Agents Making Agent ToolsLong
- LLM Agents for Coordinating Multi-User Information Gatheringfinding
- LLM Braces: Straightening Out LLM Predictions with Relevant Sub-UpdatesLong
- LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedbackfinding
- LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical StudyLong
- LLM as Effective Streaming Processor: Bridging Streaming-Batch Mismatches with Group Position Encodingfinding
- LLM as Entity Disambiguator for Biomedical Entity-LinkingShort
- LLM as a Broken Telephone: Iterative Generation Distorts InformationLong
- LLM-Based Multi-Agent Systems are Scalable Graph Generative Modelsfinding
- LLM-Empowered Class Imbalanced Graph Prompt Learning for Online Drug Trafficking Detectionfinding
- LLM-Enhanced Query Generation and Retrieval Preservation for Task-Oriented Dialoguefinding
- LLM-Forest: Ensemble Learning of LLMs with Graph-Augmented Prompts for Data Imputationfinding
- LLM-Guided Semantic-Aware Clustering for Topic ModelingLong
- LLM-Powered Test Case Generation for Detecting Bugs in Plausible ProgramsLong
- LLM-Symbolic Integration for Robust Temporal Tabular Reasoningfinding
- LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluationfinding
- LLM-based Rumor Detection via Influence Guided Sample Selection and Game-based Perspective AnalysisLong
- LLM-based Translation Inference with Iterative Bilingual Understandingfinding
- LLMTaxo: Leveraging Large Language Models for Constructing Taxonomy of Factual Claims from Social Mediafinding
- LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLMfinding
- LLMs + Persona-Plug = Personalized LLMsLong
- LLMs Can Achieve High-quality Simultaneous Machine Translation as Efficiently as Offlinefinding
- LLMs Can Also Do Well! Breaking Barriers in Semantic Role Labeling via Large Language Modelsfinding
- LLMs Can Simulate Standardized Patients via Agent CoevolutionLong
- LLMs Caught in the Crossfire: Malware Requests and Jailbreak ChallengesLong
- LLMs Trust Humans More, That’s a Problem! Unveiling and Mitigating the Authority Bias in Retrieval-Augmented GenerationLong
- LLMs are Biased Evaluators But Not Biased for Fact-Centric Retrieval Augmented Generationfinding
- LLMs as Planning Formalizers: A Survey for Leveraging Large Language Models to Construct Automated Planning Modelsfinding
- LLMs can Perform Multi-Dimensional Analytic Writing Assessments: A Case Study of L2 Graduate-Level Academic English WritingLong
- LLMs can be easily Confused by Instructional DistractionsLong
- LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation TasksShort
- LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution ShiftsLong
- LLMs syntactically adapt their language use to their conversational partnerShort
- LLM×MapReduce: Simplified Long-Sequence Processing using Large Language ModelsLong
- LLaMA-Omni 2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech SynthesisLong
- LLaMAs Have Feelings Too: Unveiling Sentiment and Emotion Representations in LLaMA Models Through ProbingLong
- LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech EnhancementLong
- LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-SteeringLong
- LLäMmlein: Transparent, Compact and Competitive German-Only Language Models from ScratchLong
- LPOI: Listwise Preference Optimization for Vision Language ModelsLong
- LR²Bench: Evaluating Long-chain Reflective Reasoning Capabilities of Large Language Models via Constraint Satisfaction Problemsfinding
- LSC-Eval: A General Framework to Evaluate Methods for Assessing Dimensions of Lexical Semantic Change Using LLM-Generated Synthetic Datafinding
- LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace FusionLong
- LTRAG: Enhancing Autoformalization and Self-refinement for Logical Reasoning with Thought-Guided RAGfinding
- La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin AmericaLong
- LaTIM: Measuring Latent Token-to-Token Interactions in Mamba ModelsLong
- Label-semantics Aware Generative Approach for Domain-Agnostic Multilabel Classificationfinding
- LangMark: A Multilingual Dataset for Automatic Post-EditingLong
- LangSAMP: Language-Script Aware Multilingual PretrainingLong
- Language Constrained Multimodal Hyper Adapter For Many-to-Many Multimodal SummarizationLong
- Language Fusion for Parameter-Efficient Cross-lingual TransferLong
- Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public OpinionsLong
- Language Model Probabilities are Not Calibrated in Numeric ContextsLong
- Language Models Grow Less Humanlike beyond Phase TransitionLong
- Language Models Lack Temporal Generalization and Bigger is Not Betterfinding
- Language Models Resist Alignment: Evidence From Data CompressionLong
- Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in LegislationLong
- Language Models, Graph Searching, and Supervision Adulteration: When More Supervision is Less and How to Make More MoreLong
- Language Repository for Long Video Understandingfinding
- Language-Codec: Bridging Discrete Codec Representations and Speech Language ModelsLong
- Large Language Models Are Natural Video Popularity Predictorsfinding
- Large Language Models Still Exhibit Bias in Long Textfinding
- Large Language Models Struggle to Describe the Haystack without Human Help: A Social Science-Inspired Evaluation of Topic ModelsLong
- Large Language Models are Good Relational LearnersLong
- Large Language Models are Miscalibrated In-Context Learnersfinding
- Large Language Models as Neurolinguistic Subjects: Discrepancy between Performance and Competencefinding
- Large Language Models for Predictive Analysis: How Far Are They?finding
- Large Language Models in Bioinformatics: A Surveyfinding
- Large Language and Protein Assistant for Protein-Protein Interactions PredictionLong
- Large Language and Reasoning Models are Shallow Disjunctive ReasonersLong
- Large Margin Representation Learning for Robust Cross-lingual Named Entity RecognitionLong
- Large Vocabulary Size Improves Large Language Modelsfinding
- Latent Distribution Decouple for Uncertain-Aware Multimodal Multi-label Emotion Recognitionfinding
- LazyReview: A Dataset for Uncovering Lazy Thinking in NLP Peer ReviewsLong
- Learn to Memorize: Scalable Continual Learning in Semiparametric Models with Mixture-of-Neighbors Induction MemoryLong
- Learning Auxiliary Tasks Improves Reference-Free Hallucination Detection in Open-Domain Long-Form GenerationShort
- Learning First-Order Logic Rules for Argumentation MiningLong
- Learning Sparsity for Effective and Efficient Music Performance Question AnsweringShort
- Learning Task Representations from In-Context Learningfinding
- Learning Together to Perform Better: Teaching Small-Scale LLMs to Collaborate via Preferential Rationale TuningLong
- Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Reviewfinding
- Learning from Negative Samples in Biomedical Generative Entity Linkingfinding
- Learning to Align Multi-Faceted Evaluation: A Unified and Robust Frameworkfinding
- Learning to Generate Structured Output with Schema Reinforcement LearningLong
- Learning to Insert [PAUSE] Tokens for Better Reasoningfinding
- Learning to Look at the Other Side: A Semantic Probing Study of Word Embeddings in LLMs with Enabled Bidirectional AttentionLong
- Learning to Play Like Humans: A Framework for LLM Adaptation in Interactive Fiction Gamesfinding
- Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language ModelsLong
- Learning to Reason from Feedback at Test-TimeLong
- Learning to Rewrite: Generalized LLM-Generated Text DetectionLong
- Learning to Select In-Context Demonstration Preferred by Large Language Modelfinding
- LegalAgentBench: Evaluating LLM Agents in Legal DomainLong
- LegalCore: A Dataset for Event Coreference Resolution in Legal Documentsfinding
- LegalReasoner: Step-wised Verification-Correction for Legal Judgment ReasoningLong
- LegoMT2: Selective Asynchronous Sharded Data Parallel Training for Massive Neural Machine Translationfinding
- Lemmas Matter, But Not Like That: Predictors of Lemma-Based Generalization in Morphological Inflectionfinding
- Lemmatisation & Morphological Analysis of Unedited Greek: Do Simple Tasks Need Complex Solutions?finding
- Length Controlled Generation for Black-box LLMsLong
- Length-Induced Embedding Collapse in PLM-based ModelsLong
- Less Mature is More Adaptable for Sentence-level Language ModelingLong
- Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI EvaluationLong
- Less is More: Explainable and Efficient ICD Code Prediction with Clinical EntitiesLong
- Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-ExpertsLong
- Let The Jury Decide: Fair Demonstration Selection for In-Context Learning through Incremental Greedy Evaluationfinding
- Let’s Be Self-generated via Step by Step: A Curriculum Learning Approach to Automated Reasoning with Large Language Modelsfinding
- Let’s Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCRfinding
- Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI CollaborationLong
- Leveraging Human Production-Interpretation Asymmetries to Test LLM Cognitive PlausibilityShort
- Leveraging In-Context Learning for Political Bias Testing of LLMsLong
- Leveraging LLMs for Bangla Grammar Error Correction: Error Categorization, Synthetic Data, and Model Evaluationfinding
- Leveraging Large Language Models for Conversational Multi-Doc Question Answering: The First Place of WSDM Cup 2024finding
- Leveraging Self-Attention for Input-Dependent Soft Prompting in LLMsShort
- Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translationfinding
- Leveraging Variation Theory in Counterfactual Data Augmentation for Optimized Active Learningfinding
- LexCLiPR: Cross-Lingual Paragraph Retrieval from Legal JudgmentsLong
- LexGen: Domain-aware Multilingual Lexicon GenerationLong
- LexKeyPlan: Planning with Keyphrases and Retrieval Augmentation for Legal Text Generation: A Case Study on European Court of Human Rights CasesShort
- LexTempus: Enhancing Temporal Generalizability of Legal Language Models Through Dynamic Mixture of ExpertsLong
- Lexical Diversity-aware Relevance Assessment for Retrieval-Augmented GenerationLong
- Lexical Recall or Logical Reasoning: Probing the Limits of Reasoning Abilities in Large Language ModelsLong
- Libra: Leveraging Temporal Images for Biomedical Radiology Analysisfinding
- Library-Like Behavior In Language Models is Enhanced by Self-Referencing Causal CyclesLong
- Lifelong Model Editing with Graph-Based External Memoryfinding
- Lightweight Query Checkpoint: Classifying Faulty User Queries to Mitigate Hallucinations in Large Language Model Question Answeringfinding
- Limited Generalizability in Argument Mining: State-Of-The-Art Models Learn Datasets, Not ArgumentsLong
- Limited-Resource Adapters Are Regularizers, Not LinguistsShort
- Linguistic Generalizability of Test-Time Scaling in Mathematical ReasoningLong
- Listen, Watch, and Learn to Feel: Retrieval-Augmented Emotion Reasoning for Compound Emotion Generationfinding
- Listening to Patients: Detecting and Mitigating Patient Misreport in Medical Dialogue Systemfinding
- Literary Evidence Retrieval via Long-Context Language ModelsShort
- Literature Meets Data: A Synergistic Approach to Hypothesis GenerationLong
- Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMsLong
- LlamaDuo: LLMOps Pipeline for Seamless Migration from Service LLMs to Small-Scale Local LLMsLong
- LlamaPIE: Proactive In-Ear Conversation Assistantsfinding
- LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMsfinding
- LoFTI: Localization and Factuality Transfer to Indian Localesfinding
- LoGU: Long-form Generation with Uncertainty ExpressionsLong
- LoRMA: Low-Rank Multiplicative Adaptation for LLMsfinding
- LocAgent: Graph-Guided LLM Agents for Code LocalizationLong
- Local Look-Ahead Guidance via Verifier-in-the-Loop for Automated Theorem Provingfinding
- Localizing and Mitigating Errors in Long-form Question Answeringfinding
- Locate-and-Focus: Enhancing Terminology Translation in Speech Language ModelsLong
- Logic-Regularized Verifier Elicits Reasoning from LLMsLong
- LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Modelsfinding
- LogicPro: Improving Complex Logical Reasoning via Program-Guided LearningLong
- Logical Consistency is Vital: Neural-Symbolic Information Retrieval for Negative-Constraint Queriesfinding
- Logical DA: Enhancing Data Augmentation for Logical Reasoning via a Multi-Agent Systemfinding
- Logical forms complement probability in understanding language model (and human) performanceLong
- Long-form Hallucination Detection with Self-elicitationfinding
- LongAttn: Selecting Long-context Training Data via Token-level Attentionfinding
- LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context MultitasksLong
- LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-Context QAfinding
- LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Informationfinding
- LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and LocatingLong
- LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Datafinding
- LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration DistillationLong
- LongRecipe: Recipe for Efficient Long Context Generalization in Large Language ModelsLong
- LongReward: Improving Long-context Large Language Models with AI FeedbackLong
- LongSafety: Evaluating Long-Context Safety of Large Language ModelsLong
- Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generationfinding
- Look Both Ways and No Sink: Converting LLMs into Text Encoders without TrainingLong
- Lost in Literalism: How Supervised Training Shapes Translationese in LLMsLong
- Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language ModelsLong
- Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Modelsfinding
- Lost in Translation: Benchmarking Commercial Machine Translation Models for Dyslexic-Style Textfinding
- Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference ModelingLong
- Low-Bit Quantization Favors Undertrained LLMsLong
- Low-Entropy Watermark Detection via Bayes’ Rule Derived Detectorfinding
- Low-Rank Interconnected Adaptation across Layersfinding
- Low-Resource Grammatical Error Correction: Selective Data Augmentation with Round-Trip Machine Translationfinding
- Lunar Twins: We Choose to Go to the Moon with Large Language Modelsfinding
- M-MAD: Multidimensional Multi-Agent Debate for Advanced Machine Translation EvaluationLong
- M-RangeDetector: Enhancing Generalization in Machine-Generated Text Detection through Multi-Range Attention Masksfinding
- M-RewardBench: Evaluating Reward Models in Multilingual SettingsLong
- M2-TabFact: Multi-Document Multi-Modal Fact Verification with Visual and Textual Representations of Tabular Datafinding
- M2PA: A Multi-Memory Planning Agent for Open Worlds Inspired by Cognitive Theoryfinding
- M2RC-EVAL: Massively Multilingual Repository-level Code Completion EvaluationLong
- M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMsLong
- M3HG: Multimodal, Multi-scale, and Multi-type Node Heterogeneous Graph for Emotion Cause Triplet Extraction in Conversationsfinding
- MAGI: Multi-Agent Guided Interview for Psychiatric Assessmentfinding
- MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answeringfinding
- MAGNET: Augmenting Generative Decoders with Representation Learning and Infilling CapabilitiesLong
- MAIN-RAG: Multi-Agent Filtering Retrieval-Augmented GenerationLong
- MALAMUTE: A Multilingual, Highly-granular, Template-free, Education-based Probing Datasetfinding
- MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaborationfinding
- MANBench: Is Your Multimodal Model Smarter than Human?finding
- MAPLE: Enhancing Review Generation with Multi-Aspect Prompt LEarning in Explainable RecommendationLong
- MAPS: Motivation-Aware Personalized Search via LLM-Driven Consultation AlignmentLong
- MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement LearningLong
- MARK: Multi-agent Collaboration with Ranking Guidance for Text-attributed Graph Clusteringfinding
- MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation DatasetLong
- MATCHED: Multimodal Authorship-Attribution To Combat Human Trafficking in Escort-Advertisement Datafinding
- MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at ScaleLong
- MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistencyfinding
- MCS-Bench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in Chinese Classical StudiesLong
- MDBench: A Synthetic Multi-Document Reasoning Benchmark Generated with Knowledge Guidancefinding
- MDCure: A Scalable Pipeline for Multi-Document Instruction-FollowingLong
- MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Modelsfinding
- MECoT: Markov Emotional Chain-of-Thought for Personality-Consistent Role-Playingfinding
- MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential DiagnosisLong
- MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notesfinding
- MEGen: Generative Backdoor into Large Language Models via Model Editingfinding
- MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generationfinding
- MELABenchv1: Benchmarking Large Language Models against Smaller Fine-Tuned Models for Low-Resource Maltese NLPfinding
- MEMERAG: A Multilingual End-to-End Meta-Evaluation Benchmark for Retrieval Augmented GenerationLong
- MEMIT-Merge: Addressing MEMIT’s Key-Value Conflicts in Same-Subject Batch Editing for LLMsfinding
- MERIT: Multi-Agent Collaboration for Unsupervised Time Series Representation Learningfinding
- METAL: A Multi-Agent Framework for Chart Generation with Test-Time ScalingLong
- MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignmentfinding
- MEXMA: Token-level objectives improve sentence representationsLong
- MEraser: An Effective Fingerprint Erasure Approach for Large Language ModelsLong
- MFinMeeting: A Multilingual, Multi-Sector, and Multi-Task Financial Meeting Understanding Evaluation Datasetfinding
- MHALO: Evaluating MLLMs as Fine-grained Hallucination Detectorsfinding
- MIG: Automatic Data Selection for Instruction Tuning by Maximizing Information Gain in Semantic Spacefinding
- MIND: A Multi-agent Framework for Zero-shot Harmful Meme DetectionLong
- MIR: Methodology Inspiration Retrieval for Scientific Research ProblemsLong
- MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive EnvironmentsShort
- MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrievalfinding
- MISP-Meeting: A Real-World Dataset with Multimodal Cues for Long-form Meeting Transcription and SummarizationLong
- MLAS-LoRA: Language-Aware Parameters Detection and LoRA-Based Knowledge Transfer for Multilingual Machine TranslationLong
- MLDebugging: Towards Benchmarking Code Debugging Across Multi-Library Scenariosfinding
- MM-R3: On (In-)Consistency of Vision-Language Models (VLMs)finding
- MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought VerificationLong
- MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence CalibrationLong
- MMDEND: Dendrite-Inspired Multi-Branch Multi-Compartment Parallel Spiking Neuron for Sequence ModelingLong
- MMEvol: Empowering Multimodal Large Language Models with Evol-Instructfinding
- MMInA: Benchmarking Multihop Multimodal Internet Agentsfinding
- MMLU-CF: A Contamination-free Multi-task Language Understanding BenchmarkLong
- MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding BenchmarkLong
- MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World ConversationLong
- MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Modelsfinding
- MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokensfinding
- MMSciBench: Benchmarking Language Models on Chinese Multimodal Scientific Problemsfinding
- MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Modelsfinding
- MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progressionfinding
- MONTROSE: LLM-driven Monte Carlo Tree Search Self-Refinement for Cross-Domain Rumor Detectionfinding
- MOSAIC: Multiple Observers Spotting AI Contentfinding
- MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identificationfinding
- MPL: Multiple Programming Languages with Large Language Models for Information Extractionfinding
- MPO: Multilingual Safety Alignment via Reward Gap OptimizationLong
- MPVStance: Mitigating Hallucinations in Stance Detection with Multi-Perspective VerificationLong
- MT-RAIG: Novel Benchmark and Evaluation Framework for Retrieval-Augmented Insight Generation over Multiple TablesLong
- MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teamingLong
- MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answeringfinding
- MUSE: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profilesfinding
- MUSTS: MUltilingual Semantic Textual Similarity BenchmarkShort
- MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matchingfinding
- MVTamperBench: Evaluating Robustness of Vision-Language Modelsfinding
- MWPO: Enhancing LLMs Performance through Multi-Weight Preference Strength and Length Optimizationfinding
- MaCP: Minimal yet Mighty Adaptation via Hierarchical Cosine ProjectionLong
- MaXIFE: Multilingual and Cross-lingual Instruction Following EvaluationLong
- Machine Theory of Mind Needs Machine Validationfinding
- Machine Translation Models are Zero-Shot Detectors of Translation Directionfinding
- MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context InferenceLong
- Magnet: Multi-turn Tool-use Data Synthesis and Distillation via Graph TranslationLong
- Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine TranslationLong
- Making FETCH! Happen: Finding Emergent Dog Whistles Through Common HabitatsLong
- Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum LearningLong
- Making RALM Robust to Irrelevant Contexts via Layer Knowledge Guided Attentionfinding
- Mamba Knockout for Unraveling Factual Information FlowLong
- Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent SystemLong
- Map&Make: Schema Guided Text to Table GenerationLong
- MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-based Vision-and-Language NavigationLong
- Mapping 1,000+ Language Models via the Log-Likelihood VectorLong
- Mapping the Podcast Ecosystem with the Structured Podcast Research CorpusLong
- Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large LanguageLong
- Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning ModelsLong
- MasRouter: Learning to Route LLMs for Multi-Agent SystemsLong
- Masking in Multi-hop QA: An Analysis of How Language Models Perform with Context PermutationLong
- Masks Can be Learned as an Alternative to ExpertsLong
- Massively Multilingual Instruction-Following Information Extractionfinding
- Math Neurosurgery: Isolating Language Models’ Math Reasoning Abilities Using Only Forward PassesLong
- MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoningfinding
- MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction FusionLong
- Matina: A Culturally-Aligned Persian Language Model Using Multiple LoRA Expertsfinding
- Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal RetrievalLong
- Maximizing the Effectiveness of Larger BERT Models for CompressionLong
- Maximum Score Routing For Mixture-of-Expertsfinding
- McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Modelsfinding
- MeMoTune: A Measure and Moment-Driven Fine-Tuning Framework for Quantized Large Language Modelsfinding
- Meaning Beyond Truth Conditions: Evaluating Discourse Level Understanding via Anaphora AccessibilityLong
- Meaning Variation and Data Quality in the Corpus of Founding Era American EnglishShort
- Measuring Bias and Agreement in Large Language Model Presupposition Judgmentsfinding
- Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable MetricLong
- Measuring Social Biases in Masked Language Models by Proxy of Prediction QualityLong
- Measuring What Makes You Unique: Difference-Aware User Modeling for Enhancing LLM Personalizationfinding
- Measuring What Matters: Evaluating Ensemble LLMs with Label Refinement in Inductive Codingfinding
- Measuring the Effect of Transcription Noise on Downstream Language Understanding TasksLong
- Mechanistic Interpretability of Emotion Inference in Large Language Modelsfinding
- MedCite: Can Language Models Generate Verifiable Text for Medicine?finding
- Medical Graph RAG: Evidence-based Medical Large Language Model via Graph Retrieval-Augmented GenerationLong
- MegaAgent: A Large-Scale Autonomous LLM-based Multi-Agent System Without Predefined SOPsfinding
- MegaPairs: Massive Data Synthesis for Universal Multimodal RetrievalLong
- MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agentsfinding
- MemeDetoxNet: Balancing Toxicity Reduction and Context Preservationfinding
- MemeQA: Holistic Evaluation for Meme UnderstandingLong
- Memorization Inheritance in Sequence-Level Knowledge Distillation for Neural Machine TranslationShort
- Memorization vs. Reasoning: Updating LLMs with New Knowledgefinding
- Memorizing is Not Enough: Deep Knowledge Injection Through ReasoningLong
- Memory or Reasoning? Explore How LLMs Compute Mixed Arithmetic Expressionsfinding
- Memory-augmented Query Reconstruction for LLM-based Knowledge Graph Reasoningfinding
- Merge Hijacking: Backdoor Attacks to Model Merging of Large Language ModelsLong
- MergePrint: Merge-Resistant Fingerprints for Robust Black-box Ownership Verification of Large Language ModelsLong
- Meta-Learning Neural Mechanisms rather than Bayesian PriorsLong
- Meta-Reflection: A Feedback-Free Reflection Learning FrameworkLong
- Meta-Tool: Unleash Open-World Function Calling Capabilities of General-Purpose Large Language ModelsLong
- Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language ModelsLong
- MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generationfinding
- Metagent-P: A Neuro-Symbolic Planning Agent with Metacognition for Open Worldsfinding
- Metaphor and Large Language Models: When Surface Features Matter More than Deep Understandingfinding
- MiLiC-Eval: Benchmarking Multilingual LLMs for China’s Minority Languagesfinding
- Micro-Act: Mitigate Knowledge Conflict in Question Answering via Actionable Self-ReasoningLong
- Middle-Layer Representation Alignment for Cross-Lingual Transfer in Fine-Tuned LLMsLong
- Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Modelsfinding
- Mimicking the Familiar: Dynamic Command Generation for Information Theft Attacks in LLM Tool-Learning SystemLong
- Mind Your Theory: Theory of Mind Goes Deeper Than Reasoningfinding
- Mind the (Belief) Gap: Group Identity in the World of LLMsfinding
- Mind the Gap: Static and Interactive Evaluations of Large Audio ModelsLong
- Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal GesturesLong
- MindBridge: Scalable and Cross-Model Knowledge Editing via Memory-Augmented Modalityfinding
- MindRef: Mimicking Human Memory for Hierarchical Reference Retrieval with Fine-Grained Location AwarenessShort
- MiniELM: A Lightweight and Adaptive Query Rewriting Framework for E-Commerce Search Optimizationfinding
- MiniKV: Pushing the Limits of 2-Bit KV Cache via Compression and System Co-Design for Efficient Long Context Inferencefinding
- MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language ModelsLong
- Minimal Pair-Based Evaluation of Code-SwitchingLong
- Mining Complex Patterns of Argumentative Reasoning in Natural Language DialogueLong
- Mining the uncertainty patterns of humans and models in the annotation of moral foundations and human valuesLong
- MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMsfinding
- Mis-prompt: Benchmarking Large Language Models for Proactive Error HandlingLong
- Missing the Margins: A Systematic Literature Review on the Demographic Representativeness of LLMsfinding
- Mitigate Position Bias in LLMs via Scaling a Single Hidden States Channelfinding
- Mitigating Bias in RAG: Controlling the Embedderfinding
- Mitigating Confounding in Speech-Based Dementia Detection through Weight MaskingLong
- Mitigating Demonstration Bias through Global Coevolutionary Reasoningfinding
- Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimizationfinding
- Mitigating Lost-in-Retrieval Problems in Retrieval Augmented Multi-Hop Question AnsweringLong
- Mitigating Negative Interference in Multilingual Knowledge Editing through Null-Space Constraintsfinding
- Mitigating Non-Representative Prototypes and Representation Bias in Few-Shot Continual Relation ExtractionLong
- Mitigating Paraphrase Attacks on Machine-Text Detection via Paraphrase Inversionfinding
- Mitigating Posterior Salience Attenuation in Long-Context LLMs with Positional Contrastive DecodingShort
- Mitigating Selection Bias with Node Pruning and Auxiliary OptionsLong
- Mitigating Shortcut Learning with InterpoLated LearningLong
- Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT ReasoningLong
- Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Modelsfinding
- Mixture of Ordered Scoring Experts for Cross-prompt Essay Trait ScoringLong
- Mixture of Small and Large Models for Chinese Spelling CheckLong
- Mixture of Structural-and-Textual Retrieval over Text-rich Graph Knowledge Basesfinding
- Mixture of insighTful Experts (MoTE): The Synergy of Reasoning Chains and Expert Mixtures in Self-AlignmentLong
- Mixture-of-Personas Language Models for Population Simulationfinding
- Mixtures of In-Context LearnersLong
- MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Modelsfinding
- MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation SystemLong
- MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware ExpertsLong
- MoRE: A Mixture of Low-Rank Experts for Adaptive Multi-Task Learningfinding
- MobiLoRA: Accelerating LoRA-based LLM Inference on Mobile Devices via Context-aware KV Cache OptimizationLong
- MockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and BaselinesLong
- Modal Dependency Parsing via Biaffine Attention with Self-Loopfinding
- Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language ModelsLong
- Model Extrapolation Expedites AlignmentLong
- Model Performance-Guided Evaluation Data Selection for Effective Prompt Optimizationfinding
- Model-Dependent Moderation: Inconsistencies in Hate Speech Detection Across LLM-based Systemsfinding
- Modeling Complex Semantics Relation with Contrastively Fine-Tuned Relational EncodersLong
- Modeling Uncertainty in Composed Image Retrieval via Probabilistic EmbeddingsLong
- Modeling the Evolution of English Noun Compounds with Feature-Rich Diachronic Compositionality PredictionLong
- Moderation Matters: Measuring Conversational Moderation Impact in English as a Second Language Group Discussionfinding
- Modular Sentence Encoders: Separating Language Specialization from Cross-Lingual AlignmentLong
- MolRAG: Unlocking the Power of Large Language Models for Molecular Property PredictionLong
- Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generationfinding
- More is not always better? Enhancing Many-Shot In-Context Learning with Differentiated and Reweighting ObjectivesLong
- MorphMark: Flexible Adaptive Watermarking for Large Language ModelsLong
- Mosaic-IT: Cost-Free Compositional Data Synthesis for Instruction Tuningfinding
- MotiveBench: How Far Are We From Human-Like Motivational Reasoning in Large Language Models?finding
- Movie101v2: Improved Movie Narration BenchmarkLong
- MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive TrainingLong
- Multi-Agent Collaboration via Cross-Team Orchestrationfinding
- Multi-Attribute Steering of Language Models via Targeted InterventionLong
- Multi-Facet Blending for Faceted Query-by-Example RetrievalLong
- Multi-Hop Question Generation via Dual-Perspective Keyword Guidancefinding
- Multi-Hop Reasoning for Question Answering with Hyperbolic Representationsfinding
- Multi-Level Explanations for Generative Language ModelsLong
- Multi-Modality Expansion and Retention for LLMs through Parameter Merging and DecouplingLong
- Multi-Prompting Decoder Helps Better Language Understandingfinding
- Multi-Sense Embeddings for Language Models and Knowledge Distillationfinding
- Multi-document Summarization through Multi-document Event Relation Graph Reasoning in LLMs: a case study in Framing Bias MitigationLong
- Multi-level Association Refinement Network for Dialogue Aspect-based Sentiment Quadruple AnalysisLong
- Multi-level Relevance Document Identifier Learning for Generative RetrievalLong
- Multi-matrix Factorization Attentionfinding
- Multi-perspective Alignment for Increasing Naturalness in Neural Machine TranslationLong
- Multi-task Adversarial Attacks against Black-box Model with Few-shot QueriesLong
- Multi-word Measures: Modeling Semantic Change in Compound Nounsfinding
- MultiAgentBench : Evaluating the Collaboration and Competition of LLM agentsLong
- MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMsfinding
- MultiHoax: A Dataset of Multi-hop False-premise questionsfinding
- MultiMSD: A Corpus for Multilingual Medical Text Simplification from Online Medical Referencesfinding
- MultiSocial: Multilingual Benchmark of Machine-Generated Text Detection of Social-Media TextsLong
- MultiTEND: A Multilingual Benchmark for Natural Language to NoSQL Query Translationfinding
- Multilingual Arbitration: Optimizing Data Pools to Accelerate Multilingual ProgressLong
- Multilingual Definition Modelingfinding
- Multilingual Encoder Knows more than You Realize: Shared Weights Pretraining for Extremely Low-Resource LanguagesLong
- Multilingual Gloss-free Sign Language Translation: Towards Building a Sign Language Foundation ModelShort
- Multilingual Retrieval Augmented Generation for Culturally-Sensitive Tasks: A Benchmark for Cross-lingual Robustnessfinding
- Multilingual Text-to-Image Generation Magnifies Gender StereotypesLong
- Multimodal Causal Reasoning Benchmark: Challenging Multimodal Large Language Models to Discern Causal Links Across Modalitiesfinding
- Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark ApproachLong
- Multimodal Fusion and Coherence Modeling for Video Topic Segmentationfinding
- Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Modelsfinding
- Multimodal Invariant Sentiment Representation Learningfinding
- Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Reviewfinding
- Multimodal Machine Translation with Text-Image In-depth Questioningfinding
- Multimodal Pragmatic Jailbreak on Text-to-image ModelsLong
- Multimodal Transformers are Hierarchical Modal-wise Heterogeneous GraphsLong
- Multiple LLM Agents Debate for Equitable Cultural AlignmentLong
- MutantPrompt: Prompt Optimization via Mutation Under a Budget on Modest-sized LMsfinding
- Mutual-Taught for Co-adapting Policy and Reward ModelsLong
- My Words Imply Your Opinion: Reader Agent-Based Propagation Enhancement for Personalized Implicit Emotion AnalysisLong
- M³GQA: A Multi-Entity Multi-Hop Multi-Setting Graph Question Answering BenchmarkLong
- NBDESCRIB: A Dataset for Text Description Generation from Tables and Code in Jupyter Notebooks with Guidelinesfinding
- NGQA: A Nutritional Graph Question Answering Benchmark for Personalized Health-aware Nutritional ReasoningLong
- NOVA: An Iterative Planning Framework for Enhancing Scientific Innovation with Large Language Modelsfinding
- NarGINA: Towards Accurate and Interpretable Children’s Narrative Ability Assessment via Narrative Graphsfinding
- Narrative Media Framing in Political Discoursefinding
- NativQA: Multilingual Culturally-Aligned Natural Query for LLMsfinding
- Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse AttentionLong
- Natural Language Processing in Support of Evidence-based Medicine: A Scoping Reviewfinding
- Natural Language Reasoning in Large Language Models: Analysis and Evaluationfinding
- Natural Logic at the Core: Dynamic Rewards for Entailment Tree Generationfinding
- NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLMfinding
- Navigating Rifts in Human-LLM Grounding: Study and BenchmarkLong
- Navigating the Political Compass: Evaluating Multilingual LLMs across Languages and Nationalitiesfinding
- NegVQA: Can Vision Language Models Understand Negation?finding
- Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text EmbeddingsLong
- Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining DatasetLong
- NeoQA: Evidence-based Question Answering with Generated News Eventsfinding
- Nested-Refinement Metamorphosis: Reflective Evolution for Efficient Optimization of Networking Problemsfinding
- NetSafe: Exploring the Topological Safety of Multi-agent Systemfinding
- NeuSym-RAG: Hybrid Neural Symbolic Retrieval with Multiview Structuring for PDF Question AnsweringLong
- Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language ModelsLong
- Neural Parameter Search for Slimmer Fine-Tuned Models and Better TransferLong
- Neural Topic Modeling with Large Language Models in the LoopLong
- Neuro-Symbolic Query Compilerfinding
- Neuron Activation Modulation for Text Style Transfer: Guiding Large Language Modelsfinding
- Neuron Empirical Gradient: Discovering and Quantifying Neurons’ Global Linear ControllabilityLong
- Neuron-Level Sequential Editing for Large Language ModelsLong
- NeuronMerge: Merging Models via Functional Neuron Groupsfinding
- Neutralizing Bias in LLM Reasoning using Entailment Graphsfinding
- NewsInterview: a Dataset and a Playground to Evaluate LLMs’ Grounding Gap via Informational InterviewsLong
- NexusSum: Hierarchical LLM Agents for Long-Form Narrative SummarizationLong
- No Questions are Stupid, but some are Poorly Posed: Understanding Poorly-Posed Information-Seeking QuestionsLong
- None of the Above, Less of the Right Parallel Patterns in Human and LLM Performance on Multi-Choice Questions Answeringfinding
- NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmarkfinding
- Normalized AOPC: Fixing Misleading Faithfulness Metrics for Feature Attributions ExplainabilityLong
- Not All Terms Matter: Recall-Oriented Adaptive Learning for PLM-aided Query Expansion in Open-Domain Question AnsweringLong
- Not quite Sherlock Holmes: Language model predictions do not reliably differentiate impossible from improbable eventsfinding
- NovelCR: A Large-Scale Bilingual Dataset Tailored for Long-Span Coreference Resolutionfinding
- Nuclear Deployed!: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agentsfinding
- Nudging: Inference-time Alignment of LLMs via Guided DecodingLong
- Nunchi-Bench: Benchmarking Language Models on Cultural Reasoning with a Focus on Korean Superstitionfinding
- NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous ScriptsLong
- OASIS: Order-Augmented Strategy for Improved Code SearchLong
- ODDA: An OODA-Driven Diverse Data Augmentation Framework for Low-Resource Relation Extractionfinding
- OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal RetrievalLong
- ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended CapabilitiesLong
- ORBIT: Cost-Effective Dataset Curation for Large Language Model Domain Adaptation with an Astronomy Case Studyfinding
- OS Agents: A Survey on MLLM-based Agents for Computer, Phone and Browser UseLong
- OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task SynthesisLong
- OS-Kairos: Adaptive Interaction for MLLM-Powered GUI Agentsfinding
- OZSpeech: One-step Zero-shot Speech Synthesis with Learned-Prior-Conditioned Flow MatchingLong
- ObfusLM: Privacy-preserving Language Model Service against Embedding Inversion AttacksLong
- Odysseus Navigates the Sirens’ Song: Dynamic Focus Decoding for Factual and Diverse Open-Ended Text GenerationLong
- Offline Reinforcement Learning for LLM Multi-step Reasoningfinding
- OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human PreferenceLong
- OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality InteractionLong
- OmniFlatten: An End-to-end GPT Model for Seamless Voice ConversationLong
- On Entity Identification in Language Modelsfinding
- On Generalization across Measurement Systems: LLMs Entail More Test-Time Compute for Underrepresented CulturesLong
- On Many-Shot In-Context Learning for Long-Context EvaluationLong
- On Support Samples of Next Word PredictionLong
- On Synthesizing Data for Context Attribution in Question AnsweringLong
- On Synthetic Data Strategies for Domain-Specific Generative RetrievalLong
- On the Acquisition of Shared Grammatical Representations in Bilingual Language ModelsLong
- On the Consistency of Commonsense in Large Language Modelsfinding
- On the Generalization vs Fidelity Paradox in Knowledge Distillationfinding
- On the Limit of Language Models as Planning FormalizersLong
ACL accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.