ACL 2025 Accepted Papers
The full list of 3,086 papers accepted at ACL 2025 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Long: 1,602finding: 1,387Short: 97
- (RSA)²: A Rhetorical-Strategy-Aware Rational Speech Act Framework for Figurative Language UnderstandingLong
- 100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?finding
- 2M-BELEBELE: Highly Multilingual Speech and American Sign Language Comprehension Dataset Download PDFfinding
- 3DM: Distill, Dynamic Drop, and Merge for Debiasing Multi-modal Large Language Modelsfinding
- 500xCompressor: Generalized Prompt Compression for Large Language ModelsLong
- 7 Points to Tsinghua but 10 Points to ? Assessing Large Language Models in Agentic Multilingual National Biasfinding
- A Bounding Box is Worth One Token - Interleaving Layout and Text in a Large Language Model for Document Understandingfinding
- A Case Study of Cross-Lingual Zero-Shot Generalization for Classical Languages in LLMsfinding
- A Character-Centric Creative Story Generation via Imaginationfinding
- A Classifier of Word-Level Variants in Witnesses of Biblical Hebrew Manuscriptsfinding
- A Cognitive Writing Perspective for Constrained Long-Form Text Generationfinding
- A Comprehensive Graph Framework for Question Answering with Mode-Seeking Preference Alignmentfinding
- A Conformal Risk Control Framework for Granular Word Assessment and Uncertainty Calibration of CLIPScore Quality Estimatesfinding
- A Constrained Text Revision Agent via Iterative Planning and Searchingfinding
- A Couch Potato is not a Potato on a Couch: Prompting Strategies, Image Generation, and Compositionality Prediction for Noun Compoundsfinding
- A Drop-In Solution for On-the-Fly Adaptation of Speculative Decoding in Large Language ModelsLong
- A Dual-Mind Framework for Strategic and Expressive Negotiation AgentLong
- A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better InterpretabilityLong
- A Fully Automated Pipeline for Conversational Discourse Annotation: Tree Scheme Generation and Labeling with Large Language Modelsfinding
- A Fully Generative Motivational Interviewing Counsellor Chatbot for Moving Smokers Towards the Decision to Quitfinding
- A General Framework to Enhance Fine-tuning-based LLM Unlearningfinding
- A General Knowledge Injection Framework for ICD Codingfinding
- A Generative Adaptive Replay Continual Learning Model for Temporal Knowledge Graph ReasoningLong
- A Joint Optimization Framework for Enhancing Efficiency of Tool Utilization in LLM Agentsfinding
- A Large and Balanced Corpus for Fine-grained Arabic Readability Assessmentfinding
- A Law Reasoning Benchmark for LLM with Tree-Organized Structures including Factum Probandum, Evidence and Experiencesfinding
- A Little Human Data Goes A Long WayShort
- A MISMATCHED Benchmark for Scientific Natural Language Inferencefinding
- A Measure of the System Dependence of Automated MetricsShort
- A Modular Approach for Clinical SLMs Driven by Synthetic Data with Pre-Instruction Tuning, Model Merging, and Clinical-Tasks AlignmentLong
- A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaosfinding
- A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering SystemsLong
- A Multi-Expert Structural-Semantic Hybrid Framework for Unveiling Historical Patterns in Temporal Knowledge Graphsfinding
- A Multi-Labeled Dataset for Indonesian Discourse: Examining Toxicity, Polarization, and Demographics Informationfinding
- A Multi-persona Framework for Argument Quality AssessmentLong
- A Mutual Information Perspective on Knowledge Graph EmbeddingLong
- A New Formulation of Zipf’s Meaning-Frequency Law through Contextual DiversityLong
- A Parameter-Efficient and Fine-Grained Prompt Learning for Vision-Language ModelsLong
- A Persona-Aware LLM-Enhanced Framework for Multi-Session Personalized Dialogue Generationfinding
- A Query-Response Framework for Whole-Page Complex-Layout Document Image Translation with Relevant Regional Concentrationfinding
- A Reality Check on Context Utilisation for Retrieval-Augmented GenerationLong
- A Reinforcement Learning Framework for Cross-Lingual Stance Detection Using Chain-of-Thought Alignmentfinding
- A Representation Level Analysis of NMT Model Robustness to Grammatical Errorsfinding
- A Rose by Any Other Name: LLM-Generated Explanations Are Good Proxies for Human Explanations to Collect Label Distributions on NLIfinding
- A Self-Denoising Model for Robust Few-Shot Relation ExtractionLong
- A Self-Distillation Recipe for Neural Machine Translationfinding
- A Semantic-Aware Layer-Freezing Approach to Computation-Efficient Fine-Tuning of Language Modelsfinding
- A Silver Bullet or a Compromise for Full Attention? A Comprehensive Study of Gist Token-based Context CompressionLong
- A Spatio-Temporal Point Process for Fine-Grained Modeling of Reading BehaviorLong
- A Statistical and Multi-Perspective Revisiting of the Membership Inference Attack in Large Language ModelsLong
- A Strategic Coordination Framework of Small LMs Matches Large LMs in Data SynthesisLong
- A Study into Investigating Temporal Robustness of LLMsfinding
- A Survey of LLM-based Agents in Medicine: How far are we from Baymax?finding
- A Survey of Large Language Models in Psychotherapy: Current Landscape and Future Directionsfinding
- A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challengesfinding
- A Survey of Post-Training Scaling in Large Language ModelsLong
- A Survey of Uncertainty Estimation Methods on Large Language Modelsfinding
- A Survey on Efficient Large Language Model Training: From Data-centric PerspectivesLong
- A Survey on Foundation Language Models for Single-cell BiologyLong
- A Survey on Patent Analysis: From NLP to Multimodal AILong
- A Survey on Personalized Alignment—The Missing Piece for Large Language Models in Real-World Applicationsfinding
- A Survey on Proactive Defense Strategies Against Misinformation in Large Language Modelsfinding
- A Systematic Study of Compositional Syntactic Transformer Language ModelsLong
- A Tale of Evaluating Factual Consistency: Case Study on Long Document Summarization Evaluationfinding
- A Text is Worth Several Tokens: Text Embedding from LLMs Secretly Aligns Well with The Key TokensLong
- A Theory of Response Sampling in LLMs: Part Descriptive and Part PrescriptiveLong
- A Training-free LLM-based Approach to General Chinese Character Error CorrectionLong
- A Triple-View Framework for Fine-Grained Emotion Classification with Clustering-Guided Contrastive LearningLong
- A Troublemaker with Contagious Jailbreak Makes Chaos in Honest TownsLong
- A Unified Agentic Framework for Evaluating Conditional Image GenerationLong
- A Unified Taxonomy-Guided Instruction Tuning Framework for Entity Set Expansion and Taxonomy Expansionfinding
- A Variational Approach for Mitigating Entity Bias in Relation ExtractionShort
- A rebuttal of two common deflationary stances against LLM cognitionfinding
- A-TASC: Asian TED-Based Automatic Subtitling CorpusLong
- A2ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantizationfinding
- AAD-LLM: Neural Attention-Driven Auditory Scene UnderstandingLong
- ACCESS DENIED INC: The First Benchmark Environment for Sensitivity Awarenessfinding
- ACECODER: Acing Coder RL via Automated Test-Case SynthesisLong
- ACORD: An Expert-Annotated Retrieval Dataset for Legal Contract DraftingLong
- ACT: Knowledgeable Agents to Design and Perform Complex TasksLong
- AD-LLM: Benchmarking Large Language Models for Anomaly Detectionfinding
- ADO: Automatic Data Optimization for Inputs in LLM Promptsfinding
- AGD: Adversarial Game Defense Against Jailbreak Attacks in Large Language ModelsLong
- AGRec: Adapting Autoregressive Decoders with Graph Reasoning for LLM-based Sequential Recommendationfinding
- AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety DetectionLong
- AIGuard: A Benchmark and Lightweight Detection for E-commerce AIGC Risksfinding
- AIMSCheck: Leveraging LLMs for AI-Assisted Review of Modern Slavery Statements Across JurisdictionsLong
- AIR-Bench: Automated Heterogeneous Information Retrieval BenchmarkLong
- AL-QASIDA: Analyzing LLM Quality and Accuracy Systematically in Dialectal Arabicfinding
- ALGEN: Few-shot Inversion Attacks on Textual Embeddings via Cross-Model Alignment and GenerationLong
- ALPS: Attention Localization and Pruning Strategy for Efficient Adaptation of Large Language Modelsfinding
- ALW: Adaptive Layer-Wise contrastive decoding enhancing reasoning ability in Large Language Modelsfinding
- AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agentsfinding
- AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inferencefinding
- AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Modelsfinding
- APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUsLong
- APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model PromptsLong
- APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Trainingfinding
- AQuAECHR: Attributed Question Answering for European Court of Human Rightsfinding
- ARC ‘Challenge’ Is Not That Challengingfinding
- ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive SearchLong
- ASPERA: A Simulated Environment to Evaluate Planning for Complex Action ExecutionLong
- ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoningfinding
- ASTRID - An Automated and Scalable TRIaD for the Evaluation of RAG-based Clinical Question Answering Systemsfinding
- ASTRO: Automatic Strategy Optimization For Non-Cooperative Dialoguesfinding
- ATLANTIS: Weak-to-Strong Learning via Importance SamplingLong
- ATLAS: Agent Tuning via Learning Critical Stepsfinding
- ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution ErrorsLong
- AUTALIC: A Dataset for Anti-AUTistic Ableist Language In ContextLong
- AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularityfinding
- AXIS: Efficient Human-Agent-Computer Interaction with API-First LLM-Based AgentsLong
- AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific ResearchLong
- Accelerating Adaptive Retrieval Augmented Generation via Instruction-Driven Representation Reduction of Retrieval Overlapsfinding
- Accelerating Dense LLMs via L0-regularized Mixture-of-ExpertsShort
- Accurate KV Cache Quantization with Outlier Tokens TracingLong
- AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modelingfinding
- Achieving binary weight and activation for LLMs using Post-Training Quantizationfinding
- Acoustic Individual Identification of White-Faced Capuchin Monkeys Using Joint Multi-Species EmbeddingsShort
- Acquisition and Application of Novel Knowledge in Large Language ModelsLong
- Act2P: LLM-Driven Online Dialogue Act Classification for Power Analysisfinding
- ActiView: Evaluating Active Perception Ability for Multimodal Large Language ModelsLong
- Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and InferenceLong
- Activation Steering Decoding: Mitigating Hallucination in Large Vision-Language Models through Bidirectional Hidden State InterventionLong
- AdParaphrase v2.0: Generating Attractive Ad Texts Using a Preference-Annotated Paraphrase Datasetfinding
- AdaDHP: Fine-Grained Fine-Tuning via Dual Hadamard Product and Adaptive Parameter SelectionLong
- AdaEdit: Advancing Continuous Knowledge Editing For Large Language ModelsLong
- AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understandingfinding
- AdaV: Adaptive Text-visual Redirection for Vision-Language Modelsfinding
- AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on HarmfulnessLong
- Adapt Once, Thrive with Updates: Transferable Parameter-Efficient Fine-Tuning on Evolving Base ModelsLong
- AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human DemonstrationsLong
- Adapting General-Purpose Embedding Models to Private Datasets Using Keyword-based Retrievalfinding
- Adaptive Detoxification: Safeguarding General Capabilities of LLMs through Toxicity-Aware Knowledge Editingfinding
- Adaptive LoRA Merge with Parameter Pruning for Low-Resource Generationfinding
- Adaptive Retrieval Without Self-Knowledge? Bringing Uncertainty Back HomeLong
- Adaptive Tool Use in Large Language Models with Meta-Cognition TriggerLong
- Adaptive and Robust Translation from Natural Language to Multi-model Query LanguagesLong
- Adaptive-VP: A Framework for LLM-Based Virtual Patients that Adapts to Trainees’ Dialogue to Facilitate Nurse Communication Trainingfinding
- Addressing Blind Guessing: Calibration of Selection Bias in Multiple-Choice Question Answering by Video Language ModelsLong
- Advancing Collaborative Debates with Role Differentiation through Multi-Agent Reinforcement LearningLong
- Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encodingfinding
- Advancing SMoE for Continuous Domain Adaptation of MLLMs: Adaptive Router and Domain-Specific LossLong
- Advancing Sequential Numerical Prediction in Autoregressive ModelsShort
- Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference AlignmentLong
- Adversarial Alignment with Anchor Dragging Drift (A3D2): Multimodal Domain Adaptation with Partially Shifted ModalitiesLong
- Adversarial Preference Learning for Robust LLM Alignmentfinding
- Adversarial TokenizationLong
- Adverse Event Extraction from Discharge Summaries: A New Dataset, Annotation Scheme, and Initial FindingsLong
- AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark DatasetLong
- AfroBench: How Good are Large Language Models on African Languages?finding
- AfroCS-xs: Creating a Compact, High-Quality, Human-Validated Code-Switched Dataset for African LanguagesLong
- Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal AgentsLong
- AgentCourt: Simulating Court with Adversarial Evolvable Lawyer Agentsfinding
- AgentDropout: Dynamic Agent Elimination for Token-Efficient and High-Performance LLM-Based Multi-Agent CollaborationLong
- AgentGym: Evaluating and Training Large Language Model-based Agents across Diverse EnvironmentsLong
- AgentRM: Enhancing Agent Generalization with Reward ModelingLong
- AgentStore: Scalable Integration of Heterogeneous Agents As Specialized Generalist Computer Assistantfinding
- Agentic Knowledgeable Self-awarenessLong
- Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic ToolsLong
- Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward SystemsLong
- Agents Under Siege: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt AttacksLong
- Agents generalize to novel levels of abstraction by using adaptive linguistic strategiesfinding
- Agri-CM3: A Chinese Massive Multi-modal, Multi-level Benchmark for Agricultural Understanding and ReasoningLong
- Akan Cinematic Emotions (ACE): A Multimodal Multi-party Dataset for Emotion Recognition in Movie Dialoguesfinding
- Algorithmic Fidelity of Large Language Models in Generating Synthetic German Public Opinions: A Case StudyLong
- Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI FeedbackLong
- Align2LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curationfinding
- AlignDistil: Token-Level Language Model Alignment as Adaptive Policy DistillationLong
- AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language ModelsLong
- Aligned but Blind: Alignment Increases Implicit Bias by Reducing Awareness of RaceLong
- Aligning AI Research with the Needs of Clinical Coding Workflows: Eight Recommendations Based on US Data Analysis and Critical ReviewLong
- Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data FilteringLong
- Aligning Large Language Models with Implicit Preferences from User-Generated ContentLong
- Aligning VLM Assistants with Personalized Situated CognitionLong
- All That Glitters is Not Gold: Improving Robust Retrieval-Augmented Language Models with Fact-Centric Preference Alignmentfinding
- All That Glitters is Not Novel: Plagiarism in AI Generated ResearchLong
- Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality EstimationLong
- Alleviating Hallucinations from Knowledge Misalignment in Large Language Models via Selective Abstention LearningLong
- Alleviating Hallucinations in Large Language Models via Truthfulness-driven Rank-adaptive LoRAfinding
- Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writingfinding
- AmbiK: Dataset of Ambiguous Tasks in Kitchen EnvironmentLong
- Amplifying Trans and Nonbinary Voices: A Community-Centred Harm Taxonomy for LLMsLong
- An Adaptive Multi-Threshold Loss and a General Framework for Collaborating Losses in Document-Level Relation Extractionfinding
- An Effective Incorporating Heterogeneous Knowledge Curriculum Learning for Sequence LabelingShort
- An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite IndividualsLong
- An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical ReasoningLong
- An Empirical Study of Group Conformity in Multi-Agent Systemsfinding
- An Empirical Study of Iterative Refinements for Non-autoregressive TranslationLong
- An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4finding
- An Empirical Study of Many-to-Many Summarization with Large Language ModelsLong
- An Expanded Massive Multilingual Dataset for High-Performance Language Technologies (HPLT)Long
- AnCast++: Document-Level Evaluation of Graph-based Meaning Representationsfinding
- AnRe: Analogical Replay for Temporal Knowledge Graph ForecastingLong
- AnalyticKWS: Towards Exemplar-Free Analytic Class Incremental Learning for Small-footprint Keyword Spottingfinding
- Analyzing LLMs’ Knowledge Boundary Cognition Across Languages Through the Lens of Internal RepresentationsLong
- Analyzing Political Bias in LLMs via Target-Oriented Sentiment Classificationfinding
- Analyzing and Mitigating Inconsistency in Discrete Speech Tokens for Neural Codec Language ModelsLong
- Analyzing the Effect of Linguistic Similarity on Cross-Lingual Transfer: Tasks and Experimental Setups Matterfinding
- Analyzing the Rapid Generalization of SFT via the Perspective of Attention Head Activation PatternsLong
- AnchorCoT: Anchors Pave the Way for Multi-hop Reasoningfinding
- Anchored Answers: Unravelling Positional Bias in GPT-2’s Multiple-Choice Questionsfinding
- AndroidGen: Building an Android Language Agent under Data ScarcityLong
- AndroidLab: Training and Systematic Benchmarking of Android Autonomous AgentsLong
- AnnaAgent: Dynamic Evolution Agent System with Multi-Session Memory for Realistic Seeker Simulationfinding
- Annotating the Annotators: Analysis, Insights and Modelling from an Annotation Campaign on Persuasion Techniques Detectionfinding
- Answer When Needed, Forget When Not: Language Models Pretend to Forget via In-Context Knowledge Unlearningfinding
- Answering Complex Geographic Questions by Adaptive Reasoning with Visual Context and External Commonsense KnowledgeLong
- AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World KnowledgeLong
- Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information RetrievalLong
- Anything Goes? A Crosslinguistic Study of (Im)possible Language Learning in LMsLong
- Arbiters of Ambivalence: Challenges of using LLMs in No-Consensus tasksfinding
- Are Any-to-Any Models More Consistent Across Modality Transfers Than Specialists?Long
- Are Dialects Better Prompters? A Case Study on Arabic Subjective Text Classificationfinding
- Are LLMs Rational Investors? A Study on the Financial Bias in LLMsfinding
- Are LLMs effective psychological assessors? Leveraging adaptive RAG for interpretable mental health screening through psychometric practiceLong
- Are Multimodal Large Language Models Pragmatically Competent Listeners in Simple Reference Resolution Tasks?finding
- Are Optimal Algorithms Still Optimal? Rethinking Sorting in LLM-Based Pairwise Ranking with Batching and CachingShort
- Are Rules Meant to be Broken? Understanding Multilingual Moral Reasoning as a Computational Pipeline with UniMoralLong
- Are We in the AI-Generated Text World Already? Quantifying and Monitoring AIGT on Social MediaLong
- Are Your LLMs Capable of Stable Reasoning?finding
- Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMsLong
- Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspectivefinding
- ArgInstruct: Specialized Instruction Fine-Tuning for Computational Argumentationfinding
- Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generationfinding
- Aria-UI: Visual Grounding for GUI Instructionsfinding
- Aristotle: Mastering Logical Reasoning with A Logic-Complete Decompose-Search-Resolve FrameworkLong
- Around the World in 24 Hours: Probing LLM Knowledge of Time and PlaceLong
- Asclepius: A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language ModelsLong
- Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generationfinding
- Ask-Before-Detection: Identifying and Mitigating Conformity Bias in LLM-Powered Error Detector for Math Word Problem SolutionsLong
- AskQE: Question Answering as Automatic Evaluation for Machine Translationfinding
- Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning TasksLong
- Assessing Reliability and Political Bias In LLMs’ Judgements of Formal and Material Inferences With Partisan ConclusionsLong
- Assessing the Reasoning Capabilities of LLMs in the context of Evidence-based Claim Verificationfinding
- Assessment and manipulation of latent constructs in pre-trained language models using psychometric scalesLong
- Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decompositionfinding
- Assimilation and Accommodation: Task-Adaptive Hierarchical Abstraction for Solving Web Tasksfinding
- Astute RAG: Overcoming Imperfect Retrieval Augmentation and Knowledge Conflicts for Large Language ModelsLong
- Asymmetric Conflict and Synergy in Post-training for LLM-based Multilingual Machine Translationfinding
- Attacking Vision-Language Computer Agents via Pop-upsLong
- Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language ModelsLong
- Attention Speaks Volumes: Localizing and Mitigating Bias in Language ModelsLong
- Attention with Dependency Parsing Augmentation for Fine-Grained Attributionfinding
- Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee DiscussionsLong
- AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMsLong
- AutoMedEval: Harnessing Language Models for Automatic Medical Capability EvaluationLong
- AutoMixAlign: Adaptive Data Mixing for Multi-Task Preference Optimization in LLMsLong
- AutoMixer: Checkpoint Artifacts as Automatic Data MixersLong
- Automated CAD Modeling Sequence Generation from Text Descriptions via Transformer-Based Large Language ModelsLong
- Automated Fine-Grained Mixture-of-Experts Quantizationfinding
- Automated Structured Radiology Report GenerationLong
- Automated main concept generation for narrative discourse assessment in aphasiafinding
- Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation BenchmarkLong
- Automatic Expert Discovery in LLM Upcycling via Sparse Interpolated Mixture-of-ExpertsLong
- Automatic Transmission for LLM Tiers: Optimizing Cost and Accuracy in Large Language Modelsfinding
- Automatic detection of dyslexia based on eye movements during reading in RussianShort
- Automating Legal Interpretation with LLMs: Retrieval, Generation, and EvaluationLong
- Autonomous Data Selection with Zero-shot Generative Classifiers for Mathematical Textsfinding
- Autoregressive Speech Synthesis without Vector QuantizationLong
- Awes, Laws, and Flaws From Today’s LLM Researchfinding
- BAR: A Backward Reasoning based Agent for Complex Minecraft Tasksfinding
- BEDAA: Bayesian Enhanced DeBERTa for Uncertainty-Aware Authorship Attributionfinding
- BELLE: A Bi-Level Multi-Agent Reasoning Framework for Multi-Hop Question AnsweringLong
- BERT-like Models for Slavic Morpheme SegmentationLong
- BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of Englishfinding
- BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem ProvingLong
- BIG-Bench Extra HardLong
- BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded DataLong
- BIPro: Zero-shot Chinese Poem Generation via Block Inverse Prompting Constrained Generation FrameworkLong
- BMIKE-53: Investigating Cross-Lingual Knowledge Editing with In-Context LearningLong
- BOOKCOREF: Coreference Resolution at Book ScaleLong
- BOOKWORLD: From Novels to Interactive Agent Societies for Story CreationLong
- BOSE: A Systematic Evaluation Method Optimized for Base Modelsfinding
- BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem SolvingLong
- BQA: Body Language Question Answering Dataset for Video Large Language ModelsShort
- BRIGHTER: BRIdging the Gap in Human-Annotated Textual Emotion Recognition Datasets for 28 LanguagesLong
- BabelEdits: A Benchmark and a Modular Approach for Robust Cross-lingual Knowledge Editing of Large Language Modelsfinding
- BadWindtunnel: Defending Backdoor in High-noise Simulated Training with Confidence Variancefinding
- Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text GenerationLong
- Balancing the Budget: Understanding Trade-offs Between Supervised and Preference-Based FinetuningLong
- BanStereoSet: A Dataset to Measure Stereotypical Social Biases in LLMs for Banglafinding
- Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizersfinding
- Basic Reading DistillationLong
- Batayan: A Filipino NLP benchmark for evaluating Large Language ModelsLong
- Battling against Tough Resister: Strategy Planning with Adversarial Game for Non-collaborative DialoguesLong
- BayesKD: Bayesian Knowledge Distillation for Compact LLMs in Constrained Fine-tuning Scenariosfinding
- Bayesian Optimization for Controlled Image Editing via LLMsfinding
- Be Cautious When Merging Unfamiliar LLMs: A Phishing Model Capable of Stealing Privacyfinding
- BeamLoRA: Beam-Constraint Low-Rank AdaptationLong
- BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language ModelsLong
- Behavioral Analysis of Information Salience in Large Language Modelsfinding
- Behavioural vs. Representational Systematicity in End-to-End Models: An Opinionated SurveyLong
- Behind Closed Words: Creating and Investigating the forePLay Annotated Dataset for Polish Erotic DiscourseLong
- BelarusianGLUE: Towards a Natural Language Understanding Benchmark for BelarusianLong
- BenNumEval: A Benchmark to Assess LLMs’ Numerical Reasoning Capabilities in Bengalifinding
- Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code RepositoriesLong
- Benchmarking Long-Context Language Models on Long Code UnderstandingLong
- Benchmarking Multi-National Value Alignment for Large Language Modelsfinding
- Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language ModelsLong
- Benchmarking Query-Conditioned Natural Language Inferencefinding
- Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and ReasoningLong
- Benchmarking the Benchmarks: Reproducing Climate-Related NLP Tasksfinding
- Better Embeddings with Coupled AdamLong
- Better Process Supervision with Bi-directional Rewarding Signalsfinding
- Better Red Teaming via Searching with Large Language Modelfinding
- Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic BiasesLong
- Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMsLong
- Beyond Browsing: API-Based Web Agentsfinding
- Beyond Completion: A Foundation Model for General Knowledge Graph Reasoningfinding
- Beyond Context to Cognitive Appraisal: Emotion Reasoning as a Theory of Mind Benchmark for Large Language Modelsfinding
- Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translationfinding
- Beyond Demographics: Fine-tuning Large Language Models to Predict Individuals’ Subjective Text PerceptionsLong
- Beyond Dialogue: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language ModelLong
- Beyond Facts: Evaluating Intent Hallucination in Large Language ModelsLong
- Beyond Factual Accuracy: Evaluating Coverage of Diverse Factual Information in Long-form Text Generationfinding
- Beyond Frameworks: Unpacking Collaboration Strategies in Multi-Agent SystemsLong
- Beyond Generation: Leveraging LLM Creativity to Overcome Label Bias in Classificationfinding
- Beyond In-Context Learning: Aligning Long-form Generation of Large Language Models via Task-Inherent Attribute Guidelinesfinding
- Beyond Logits: Aligning Feature Dynamics for Effective Knowledge DistillationLong
- Beyond N-Grams: Rethinking Evaluation Metrics and Strategies for Multilingual Abstractive SummarizationLong
- Beyond Negative Stereotypes – Non-Negative Abusive Utterances about Identity Groups and Their Semantic VariantsLong
- Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agentsfinding
- Beyond One-Size-Fits-All: Tailored Benchmarks for Efficient EvaluationLong
- Beyond Output Matching: Bidirectional Alignment for Enhanced In-Context LearningLong
- Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Taskfinding
- Beyond Position: the emergence of wavelet-like properties in TransformersLong
- Beyond Profile: From Surface-Level Facts to Deep Persona Simulation in LLMsfinding
- Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target AtomsLong
- Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question AnsweringLong
- Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulationfinding
- Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarityfinding
- Beyond Sequences: Two-dimensional Representation and Dependency Encoding for Code GenerationLong
- Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data SelectionLong
- Beyond Single Labels: Improving Conversational Recommendation through LLM-Powered Data AugmentationLong
- Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosisfinding
- Beyond Surface Simplicity: Revealing Hidden Reasoning Attributes for Precise Commonsense DiagnosisLong
- Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMsfinding
- Beyond Text Compression: Evaluating Tokenizers Across ScalesLong
- Beyond Text: Characterizing Domain Expert Needs in Document Researchfinding
- Beyond True or False: Retrieval-Augmented Hierarchical Analysis of Nuanced ClaimsLong
- Beyond Verbal Cues: Emotional Contagion Graph Network for Causal Emotion Entailmentfinding
- Beyond Words: Integrating Theory of Mind into Conversational Agents for Human-Like Belief, Desire, and Intention Alignmentfinding
- Beyond instruction-conditioning, MoTE: Mixture of Task Experts for Multi-task Embedding Modelsfinding
- Beyond the Answer: Advancing Multi-Hop QA with Fine-Grained Graph Reasoning and EvaluationLong
- Beyond the Average Reader: the Reader Embedding Approachfinding
- Beyond the Spelling Miracle: Investigating Substring Awareness in Character-Blind Language Modelsfinding
- Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Modelsfinding
- Bi-Tuning with Collaborative Information for Controllable LLM-based Sequential RecommendationLong
- Bias in Language Models: Beyond Trick Tests and Towards RUTEd EvaluationLong
- Bias in the Mirror : Are LLMs opinions robust to their own adversarial attacksLong
- BiasGuard: A Reasoning-Enhanced Bias Detection Tool for Large Language Modelsfinding
- Biased LLMs can Influence Political Decision-MakingLong
- Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomesfinding
- Bilingual Zero-Shot Stance DetectionLong
- Binary Classifier Optimization for Large Language Model AlignmentLong
- BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domainfinding
- Bitnet.cpp: Efficient Edge Inference for Ternary LLMsLong
- Blessing of Multilinguality: A Systematic Analysis of Multilingual In-Context Learningfinding
- Blinded by Context: Unveiling the Halo Effect of MLLM in AI Hiringfinding
- BlockPruner: Fine-grained Pruning for Large Language Modelsfinding
- Bone Soups: A Seek-and-Soup Model Merging Approach for Controllable Multi-Objective GenerationLong
- Boost, Disentangle, and Customize: A Robust System2-to-System1 Pipeline for Code Generationfinding
- Boosting LLM Translation Skills without General Ability Loss via Rationale Distillationfinding
- Boosting LLM’s Molecular Structure Elucidation with Knowledge Enhanced Tree Search ReasoningLong
- Boosting Long-Context Information Seeking via Query-Guided Activation RefillingLong
- Boosting Policy and Process Reward Models with Monte Carlo Tree Search in Open-Domain QAfinding
- Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Datafinding
- BottleHumor: Self-Informed Humor Explanation using the Information Bottleneck Principlefinding
- BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generationfinding
- Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Spacefinding
- Breaking the Reasoning Barrier A Survey on LLM Complex Reasoning through the Lens of Self-Evolutionfinding
- Bregman Conditional Random Fields: Sequence Labeling with Parallelizable Inference AlgorithmsLong
- Brevity is the soul of sustainability: Characterizing LLM response lengthsfinding
- BridG MT: Enhancing LLMs’ Machine Translation Capabilities with Sentence Bridging and Gradual MTfinding
- Bridge-Coder: Transferring Model Capabilities from High-Resource to Low-Resource Programming Languagefinding
- Bridging Intuitive Associations and Deliberate Recall: Empowering LLM Personal Assistant with Graph-Structured Long-term Memoryfinding
- Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generationfinding
- Bridging Robustness and Generalization Against Word Substitution Attacks in NLP via the Growth Bound Matrix Approachfinding
- Bridging the Language Gaps in Large Language Models with Inference-Time Cross-Lingual InterventionLong
- BriefMe: A Legal NLP Benchmark for Assisting with Legal Briefsfinding
- Browsing Like Human: A Multimodal Web Agent with Experiential Fast-and-Slow ThinkingLong
- Browsing Lost Unformed Recollections: A Benchmark for Tip-of-the-Tongue Search and ReasoningLong
- Building A Proof-Oriented Programmer That Is 64% Better Than GPT-4o Under Data Scarcityfinding
- Building Better: Avoiding Pitfalls in Developing Language Resources when Data is ScarceLong
- Building a Long Text Privacy Policy Corpus with Multi-Class LabelsLong
- Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?finding
- Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy GradientLong
- Byte Latent Transformer: Patches Scale Better Than TokensLong
- C2KD: Cross-layer and Cross-head Knowledge Distillation for Small Language Model-based Recommendationfinding
- C2LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluationfinding
- CA-GAR: Context-Aware Alignment of LLM Generation for Document Retrievalfinding
- CADReview: Automatically Reviewing CAD Programs with Error Detection and CorrectionLong
- CAMI: A Counselor Agent Supporting Motivational Interviewing through State Inference and Topic ExplorationLong
- CARE-STaR: Constraint-aware Self-taught Reasonerfinding
- CARMO: Dynamic Criteria Generation for Context Aware Reward Modellingfinding
- CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic ModelingLong
- CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representationsfinding
- CC-Tuning: A Cross-Lingual Connection Mechanism for Improving Joint Multilingual Supervised Fine-TuningLong
- CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language ModelsLong
- CDS: Data Synthesis Method Guided by Cognitive Diagnosis Theoryfinding
- CEAES: Bidirectional Reinforcement Learning Optimization for Consistent and Explainable Essay AssessmentLong
- CENTAUR: Bridging the Impossible Trinity of Privacy, Efficiency, and Performance in Privacy-Preserving Transformer InferenceLong
- CER: Confidence Enhanced Reasoning in LLMsLong
- CFBench: A Comprehensive Constraints-Following Benchmark for LLMsLong
- CHARPEVAL: Benchmarking Large Language Models’ Contextual Reasoning in Knowledge-Grounded Dialoguefinding
- CHEER-Ekman: Fine-grained Embodied Emotion ClassificationShort
- CKnowEdit: A New Chinese Knowledge Editing Dataset for Linguistics, Facts, and Logic Error Correction in LLMsLong
- CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention InterventionLong
- CLEAR: Character Unlearning in Textual and Visual Modalitiesfinding
- CLEME2.0: Towards Interpretable Evaluation by Disentangling Edits for Grammatical Error CorrectionLong
- CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIPLong
- CLIX: Cross-Lingual Explanations of Idiomatic Expressionsfinding
- CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languagesfinding
- CLaSp: In-Context Layer Skip for Self-Speculative DecodingLong
- CLeVeR: Multi-modal Contrastive Learning for Vulnerability Code Representationfinding
- CMHKF: Cross-Modality Heterogeneous Knowledge Fusion for Weakly Supervised Video Anomaly DetectionLong
- CMIE: Combining MLLM Insights with External Evidence for Explainable Out-of-Context Misinformation Detectionfinding
- CMQCIC-Bench: A Chinese Benchmark for Evaluating Large Language Models in Medical Quality Control Indicator Calculationfinding
- CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novelsfinding
- CODEMENV: Benchmarking Large Language Models on Code Migrationfinding
- COMPKE: Complex Question Answering under Knowledge Editingfinding
- CONFETTI: Conversational Function-Calling Evaluation Through Turn-Level InteractionsLong
- CONSENSAGENT: Towards Efficient and Effective Consensus in Multi-Agent LLM Interactions Through Sycophancy Mitigationfinding
- COPR: Continual Human Preference Learning via Optimal Policy Regularizationfinding
- CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative DrafterLong
- CORDIAL: Can Multimodal Large Language Models Effectively Understand Coherence Relationships?Long
- COSMIC: Generalized Refusal Direction Identification in LLM Activationsfinding
- COSMMIC: Comment-Sensitive Multimodal Multilingual Indian Corpus for Summarization and Headline GenerationLong
- COVER: Context-Driven Over-Refusal Verification in LLMsfinding
- CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agentsfinding
- CROSSAGENTIE: Cross-Type and Cross-Task Multi-Agent LLM Collaboration for Zero-Shot Information Extractionfinding
- CRPO: Confidence-Reward Driven Preference Optimization for Machine Translationfinding
- CRUXEVAL-X: A Benchmark for Multilingual Code Reasoning, Understanding and ExecutionLong
- CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language ModelsLong
- CSTRL: Context-Driven Sequential Transfer Learning for Abstractive Radiology Report Summarizationfinding
- CSTree-SRI: Introspection-Driven Cognitive Semantic Tree for Multi-Turn Question Answering over Extra-Long ContextsLong
- CTPD: Cross-Modal Temporal Pattern Discovery for Enhanced Multimodal Electronic Health Records Analysisfinding
- CU-MAM: Coherence-Driven Unified Macro-Structures for Argument MiningLong
- CULEMO: Cultural Lenses on Emotion - Benchmarking LLMs for Cross-Cultural Emotion UnderstandingLong
- CaLMQA: Exploring culturally specific long-form question answering across 23 languagesLong
- CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-JudgesLong
- Call for Rigor in Reporting Quality of Instruction Tuning DataShort
- Can Community Notes Replace Professional Fact-Checkers?Short
- Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?Long
- Can Graph Descriptive Order Affect Solving Graph Problems with LLMs?Long
- Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision?Long
- Can Hallucination Correction Improve Video-Language Alignment?finding
- Can Indirect Prompt Injection Attacks Be Detected and Removed?Long
- Can Input Attributions Explain Inductive Reasoning in In-Context Learning?finding
- Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question AnsweringLong
- Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?Long
- Can LLMs Deceive CLIP? Benchmarking Adversarial Compositionality of Pre-trained Multimodal Representation via Text UpdatesLong
- Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge GraphsLong
- Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and ExposureShort
- Can LLMs Ground when they (Don’t) Know: A Study on Direct and Loaded Political QuestionsLong
- Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMsLong
- Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research PapersLong
- Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification InferenceLong
- Can LLMs Simulate L2-English Dialogue? An Information-Theoretic Analysis of L1-Dependent BiasesLong
- Can LLMs Understand Unvoiced Speech? Exploring EMG-to-Text Conversion with LLMsShort
- Can Language Models Capture Human Writing Preferences for Domain-Specific Text Summarization?finding
- Can Language Models Reason about Individualistic Human Values and Preferences?Long
- Can Language Models Replace Programmers for Coding? REPOCOD Says ‘Not Yet’Long
- Can Language Models Serve as Analogy Annotators?finding
- Can Large Language Models Accurately Generate Answer Keys for Health-related Questions?Short
- Can Large Language Models Address Open-Target Stance Detection?finding
- Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?Long
- Can Large Language Models Understand Argument Schemes?finding
- Can Large Language Models Understand Internet Buzzwords Through User-Generated ContentLong
- Can MLLMs Understand the Deep Implication Behind Chinese Images?Long
- Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?finding
- Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papersfinding
- Can Multimodal Large Language Models Understand Spatial Relations?Long
- Can Third Parties Read Our Emotions?Long
- Can Uniform Meaning Representation Help GPT-4 Translate from Indigenous Languages?Short
- Can VLMs Actually See and Read? A Survey on Modality Collapse in Vision-Language Modelsfinding
- Can Vision Language Models Understand Mimed Actions?finding
- Can Vision-Language Models Evaluate Handwritten Math?Long
- Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging TasksLong
- Can We Trust AI Doctors? A Survey of Medical Hallucination in Large Language and Large Vision-Language Modelsfinding
- Can You Really Trust Code Copilot? Evaluating Large Language Models from a Code Security PerspectiveLong
- Can You Share Your Story? Modeling Clients’ Metacognition and Openness for LLM Therapist Evaluationfinding
- Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language ModelLong
- Can we Retrieve Everything All at Once? ARM: An Alignment-Oriented LLM-based Retrieval MethodLong
- Can’t See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMsLong
- CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Erafinding
- Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling LawLong
- Capture the Key in Reasoning to Enhance CoT Distillation GeneralizationLong
- Capturing Author Self Beliefs in Social Media LanguageLong
- Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Modelsfinding
- Causal Denoising Prototypical Network for Few-Shot Multi-label Aspect Category Detectionfinding
- Causal Estimation of Tokenisation BiasLong
- Causal Graph based Event Reasoning using Semantic Relation ExpertsLong
- CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstentionfinding
- CausalLink: An Interactive Evaluation Framework for Causal Reasoningfinding
- CausalRAG: Integrating Causal Graphs into Retrieval-Augmented Generationfinding
- Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental DistractionsLong
- Cautious Next Token Predictionfinding
- Centurio: On Drivers of Multilingual Ability of Large Vision-Language ModelLong
- Chain of Attack: Hide Your Intention through Multi-Turn Interrogationfinding
- Chain of Methodologies: Scaling Test Time Computation without Trainingfinding
- Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesisfinding
- Chain-of-Jailbreak Attack for Image Generation Models via Step by Step Editingfinding
- Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm PerspectiveLong
- Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Modelsfinding
- ChainEdit: Propagating Ripple Effects in LLM Knowledge Editing through Logical Rule-Guided ChainsLong
- Change Entity-guided Heterogeneous Representation Disentangling for Change Captioningfinding
- ChartCoder: Advancing Multimodal Large Language Model for Chart-to-Code GenerationLong
- ChartEdit: How Far Are MLLMs From Automating Chart Analysis? Evaluating MLLMs’ Capability via Chart Editingfinding
- ChartLens: Fine-grained Visual Attribution in ChartsLong
- ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answeringfinding
- ChatBench: From Static Benchmarks to Human-AI EvaluationLong
- ChatMap: Mining Human Thought Processes for Customer Service Chatbots via Multi-Agent Collaborationfinding
- ChatSOP: An SOP-Guided MCTS Planning Framework for Controllable LLM Dialogue AgentsLong
- CheXalign: Preference fine-tuning in chest X-ray interpretation models without human feedbackLong
- Cheap Character Noise for OCR-Robust Multilingual Embeddingsfinding
- Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from ScratchLong
- ChemActor: Enhancing Automated Extraction of Chemical Synthesis Actions with LLM-Generated DataLong
- ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5Long
- Chinese Inertial GAN for Handwriting Signal Generation and RecognitionLong
- Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language ModelsLong
- Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language ModelsLong
- ChronoSense: Exploring Temporal Understanding in Large Language Models with Time Intervals of EventsShort
- ChuLo: Chunk-Level Key Information Representation for Long Document Understandingfinding
- Chumor 2.0: Towards Better Benchmarking Chinese Humor Understanding from (Ruo Zhi Ba)finding
- CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challengefinding
- Circuit Compositions: Exploring Modular Structures in Transformer-Based Language ModelsLong
- Circuit Stability Characterizes Language Model GeneralizationLong
- CitaLaw: Enhancing LLM with Citations in Legal Domainfinding
- CiteEval: Principle-Driven Citation Evaluation for Source AttributionLong
- CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global MemoryLong
- ClaimPKG: Enhancing Claim Verification via Pseudo-Subgraph Generation with Lightweight Specialized LLMfinding
- Clarifying Underspecified Discourse Relations in Instructional Textsfinding
- Class Distillation with Mahalanobis Contrast: An Efficient Training Paradigm for Pragmatic Language Understanding TasksLong
- Classifying Unreliable Narrators with Large Language ModelsLong
- CliniDial: A Naturally Occurring Multimodal Dialogue Dataset for Team Reflection in Action During Clinical Operationfinding
- ClozeMath: Improving Mathematical Reasoning in Language Models by Learning to Fill Equationsfinding
- ClusComp: A Simple Paradigm for Model Compression and Efficient Finetuningfinding
- ClusterAttn: KV Cache Compression under Intrinsic Attention ClusteringLong
- CoAM: Corpus of All-Type Multiword ExpressionsLong
- CoCoLex: Confidence-guided Copy-based Decoding for Grounded Legal Text GenerationLong
- CoD, Towards an Interpretable Medical Agent using Chain of Diagnosisfinding
- CoDet-M4: Detecting Machine-Generated Code in Multi-Lingual, Multi-Generator and Multi-Domain Settingsfinding
- CoE: A Clue of Emotion Framework for Emotion Recognition in ConversationsLong
- CoIR: A Comprehensive Benchmark for Code Information Retrieval ModelsLong
- CoLA: Collaborative Low-Rank Adaptationfinding
- CoMet: Metaphor-Driven Covert Communication for Multi-Agent Language GamesLong
- CoMuMDR: Code-mixed Multi-modal Multi-domain corpus for Discourse paRsing in conversationsfinding
- CoRE: Condition-based Reasoning for Identifying Outcome Variance in Complex Eventsfinding
- CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAGLong
- CoRet: Improved Retriever for Code EditingShort
- CoT-ICL Lab: A Synthetic Framework for Studying Chain-of-Thought Learning from In-Context DemonstrationsLong
- CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thoughtfinding
- CoT-VTM: Visual-to-Music Generation with Chain-of-Thought Reasoningfinding
- CoT-Valve: Length-Compressible Chain-of-Thought TuningLong
- CoT-based Synthesizer: Enhancing LLM Performance through Answer SynthesisLong
- CoVE: Compressed Vocabulary Expansion Makes Better LLM-based Recommender Systemsfinding
- CoachMe: Decoding Sport Elements with a Reference-Based Coaching Instruction Generation ModelLong
- Code-SPA: Style Preference Alignment to Large Language Models for Effective and Robust Code Debuggingfinding
- Code-Switching Curriculum Learning for Multilingual Transfer in LLMsfinding
- Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual UnderstandingLong
- Code-Switching and Syntax: A Large-Scale Experimentfinding
- CodeDPO: Aligning Code Models with Self Generated and Verified Source CodeLong
- CodePRM: Execution Feedback-enhanced Process Reward Model for Code Generationfinding
- CodeReviewQA: The Code Review Comprehension Assessment for Large Language Modelsfinding
- CodeScientist: End-to-End Semi-Automated Scientific Discovery with Code-based Experimentationfinding
- CodeTaxo: Enhancing Taxonomy Expansion with Limited Examples via Code Language Promptsfinding
- CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process SupervisionLong
- CodeV: Issue Resolving with Visual Datafinding
- CogSteer: Cognition-Inspired Selective Layer Intervention for Efficiently Steering Large Language Modelsfinding
- CogniBench: A Legal-inspired Framework and Dataset for Assessing Cognitive Faithfulness of Large Language ModelsLong
- CoinMath: Harnessing the Power of Coding Instruction for Math LLMfinding
- Collapse of Dense Retrievers: Short, Early, and Literal Biases Outranking Factual EvidenceLong
- Colloquial Singaporean English Style Transfer with Fine-Grained Explainable ControlLong
- Com2 : A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language ModelsLong
- Combining Domain and Alignment Vectors Provides Better Knowledge-Safety Trade-offs in LLMsShort
- Combining the Best of Both Worlds: A Method for Hybrid NMT and LLM Translationfinding
- Commonsense Reasoning in Arab CultureLong
- Communication-Efficient and Tensorized Federated Fine-Tuning of Large Language Modelsfinding
- Comparing Bad Apples to Good Oranges Aligning Large Language Models via Joint Preference Optimizationfinding
- Comparing LLM-generated and human-authored news text using formal syntactic theoryLong
- Comparing Moral Values in Western English-speaking societies and LLMs with Word AssociationsLong
- Comparison-based Active Preference Learning for Multi-dimensional PersonalizationLong
- ComparisonQA: Evaluating Factuality Robustness of LLMs Through Knowledge Frequency Control and Uncertaintyfinding
- CompileAgent: Automated Real-World Repo-Level Compilation with Tool-Integrated LLM-based Agent SystemLong
- Completing A Systematic Review in Hours instead of Months with Interactive AI AgentsLong
- Compositional Syntactico-SemBanking for English as a Second or Foreign Languagefinding
- Computation Mechanism Behind LLM Position GeneralizationLong
- Compute Optimal Scaling of Skills: Knowledge vs Reasoningfinding
- Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual ModalitiesLong
- ConECT Dataset: Overcoming Data Scarcity in Context-Aware E-Commerce MTShort
- ConFit v2: Improving Resume-Job Matching using Hypothetical Resume Embedding and Runner-Up Hard-Negative Miningfinding
- ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoningfinding
- ConLoan: A Contrastive Multilingual Dataset for Evaluating LoanwordsLong
- ConSim: Measuring Concept-Based Explanations’ Effectiveness with Automated SimulatabilityLong
- ConceptCarve: Dynamic Realization of EvidenceLong
- Conditional Dichotomy Quantification via Geometric EmbeddingLong
- Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and RefinementLong
- Confidence Improves Self-Consistency in LLMsfinding
- Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMsLong
- Conformity in Large Language ModelsLong
- Conservative Bias in Large Language Models: Measuring Relation Predictionsfinding
- ConsistencyChecker: Tree-based Evaluation of LLM Generalization CapabilitiesLong
- Consistent Client Simulation for Motivational Interviewing-based CounselingLong
- Conspiracy Theories and Where to Find Them on TikTokLong
- Consultant Decoding: Yet Another Synergistic Mechanismfinding
- Context-Aware Hierarchical Merging for Long Document Summarizationfinding
- Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing AgentsLong
- Context-DPO: Aligning Language Models for Context-Faithfulnessfinding
- Context-Robust Knowledge Editing for Language Modelsfinding
- Contextual Experience Replay for Self-Improvement of Language AgentsLong
- Continual Gradient Low-Rank Projection Fine-Tuning for LLMsLong
- Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?finding
- Continued Pretraining and Interpretability-Based Evaluation for Low-Resource Languages: A Galician Case Studyfinding
- Contrastive Learning for Task-Independent SpeechLLM-Pretrainingfinding
- Contrastive Learning on LLM Back Generation Treebank for Cross-domain Constituency ParsingLong
- Contrastive Perplexity for Controlled Generation: An Application in Detoxifying Large Language ModelsLong
- Contrastive Prompting Enhances Sentence Embeddings in LLMs through Inference-Time SteeringLong
- ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style ControlLong
- Controllable Style Arithmetic with Language ModelsLong
- Controllable and Reliable Knowledge-Intensive Task-Oriented Conversational Agents with Declarative Genie WorksheetsLong
- Controlled Low-Rank Adaptation with Subspace Regularization for Continued Training on Large Language ModelsLong
- Cool-Fusion: Fuse Large Language Models without TrainingLong
- Cooperative or Competitive? Understanding the Interaction between Attention Heads From A Game Theory PerspectiveLong
- Coordinating Chaos: A Structured Review of Linguistic Coordination MethodologiesLong
- Core: Robust Factual Precision with Informative Sub-Claim Identificationfinding
- CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM EvaluationLong
- Corpus Poisoning via Approximate Greedy Gradient Descentfinding
- Correcting on Graph: Faithful Semantic Parsing over Knowledge Graphs with Large Language Modelsfinding
- CortexDebate: Debating Sparsely and Equally for Multi-Agent Debatefinding
- Counterfactual-Consistency Prompting for Relative Temporal Understanding in Large Language ModelsShort
- Counterspeech the ultimate shield! Multi-Conditioned Counterspeech Generation through Attributed Prefix LearningLong
- CourtEval: A Courtroom-Based Multi-Agent Evaluation Frameworkfinding
- Crab: A Novel Configurable Role-Playing LLM with Assessing BenchmarkLong
- Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settingsfinding
- Cracking Factual Knowledge: A Comprehensive Analysis of Degenerate Knowledge Neurons in Large Language ModelsLong
- Cracking the Code of Hallucination in LVLMs with Vision-aware Head DivergenceLong
- CrafText Benchmark: Advancing Instruction Following in Complex Multimodal Open-Ended WorldLong
- Cramming 1568 Tokens into a Single Vector and Back Again: Exploring the Limits of Embedding Space CapacityLong
- Craw4LLM: Efficient Web Crawling for LLM Pretrainingfinding
- Creating a Lens of Chinese Culture: A Multimodal Dataset for Chinese Pun Rebus Art Understandingfinding
- CrisisTS: Coupling Social Media Textual Data and Meteorological Time Series for Urgency ClassificationLong
- CritiQ: Mining Data Quality Criteria from Human PreferencesLong
- Critic-CoT: Boosting the Reasoning Abilities of Large Language Model via Chain-of-Thought Criticfinding
- Croppable Knowledge Graph EmbeddingLong
- Cross-Lingual Auto Evaluation for Assessing Multilingual LLMsLong
- Cross-Lingual Generalization and Compression: From Language-Specific to Shared NeuronsLong
- Cross-Lingual Optimization for Language Transfer in Large Language ModelsLong
- Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language ModelsLong
- Cross-Lingual Representation Alignment Through Contrastive Image-Caption TuningShort
- Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric PhenomenonShort
- Cross-Lingual Transfer of Debiasing and Detoxification in Multilingual LLMs: An Extensive Investigationfinding
- Cross-lingual Multimodal Sentiment Analysis for Low-Resource Languages via Language Family Disentanglement and Rethinking Transferfinding
- Cross-model Transferability among Large Language Models on the Platonic Representations of ConceptsLong
- Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-JudgeLong
- Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast AsiaLong
- CtrlA: Adaptive Retrieval-Augmented Generation via Inherent Controlfinding
- Cuckoo: An IE Free Rider Hatched by Massive Nutrition in LLM’s NestLong
- CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data SynthesisLong
- Cultivating Gaming Sense for Yourself: Making VLMs Gaming ExpertsLong
- Cultural Bias Matters: A Cross-Cultural Benchmark Dataset and Sentiment-Enriched Model for Understanding Multimodal MetaphorsLong
- Cultural Learning-Based Culture Adaptation of Language ModelsLong
- CulturalBench: A Robust, Diverse and Challenging Benchmark for Measuring LMs’ Cultural Knowledge Through Human-AI Red-TeamingLong
- Culture Matters in Toxic Language Detection in PersianLong
- Culture is Not Trivia: Sociocultural Theory for Cultural NLPLong
- Curiosity-Driven Reinforcement Learning from Human FeedbackLong
- Curriculum Debiasing: Toward Robust Parameter-Efficient Fine-Tuning Against Dataset BiasesLong
- Customizing In-context Learning for Dynamic Interest Adaption in LLM-based Recommendationfinding
- CxGGEC: Construction-Guided Grammatical Error CorrectionLong
- CypherBench: Towards Precise Retrieval over Full-scale Modern Knowledge Graphs in the LLM EraLong
- C²RBench: A Chinese Complex Reasoning Benchmark for Large Language Modelsfinding
- D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Modelsfinding
- D.Va: Validate Your Demonstration First Before You Use ItLong
- DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt CompressionLong
- DAGS: A Dependency-Based Dual-Attention and Global Semantic Improvement Framework for Metaphor Recognitionfinding
- DALR: Dual-level Alignment Learning for Multimodal Sentence Representation Learningfinding
- DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Accelerationfinding
- DAPE V2: Process Attention Score as Feature Map for Length ExtrapolationLong
- DAPI: Domain Adaptive Toxicity Probe Vector Intervention, for Fine-Grained Detoxificationfinding
- DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree TraversalLong
- DAST: Context-Aware Compression in LLMs via Dynamic Allocation of Soft Tokensfinding
- DCG-SQL: Enhancing In-Context Learning for Text-to-SQL with Deep Contextual Schema Link GraphLong
- DDxTutor: Clinical Reasoning Tutoring System with Differential Diagnosis-Based Structured ReasoningLong
- DEEPER Insight into Your User: Directed Persona Refinement for Dynamic Persona ModelingLong
- DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editingfinding
- DEMO: Reframing Dialogue Interaction with Fine-grained Element Modelingfinding
- DI-BENCH: Benchmarking Large Language Models on Dependency Inference with Testable Repositories at Scalefinding
- DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialoguesfinding
- DIESEL: A Lightweight Inference-Time Safety Enhancement for Language Modelsfinding
- DISC: Plug-and-Play Decoding Intervention with Similarity of Characters for Chinese Spelling CheckLong
- DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-ExpertsLong
- DNASpeech: A Contextualized and Situated Text-to-Speech Dataset with Dialogues, Narratives and ActionsLong
- DNCASR: End-to-End Training for Speaker-Attributed ASRLong
- DOVE: A Large-Scale Multi-Dimensional Predictions Dataset Towards Meaningful LLM Evaluationfinding
- DPGA-TextSyn: Differentially Private Genetic Algorithm for Synthetic Text Generationfinding
- DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimizationfinding
- DRAE: Dynamic Retrieval-Augmented Expert Networks for Lifelong Learning and Task Adaptation in RoboticsLong
- DRAG: Distilling RAG for SLMs from LLMs to Transfer Knowledge and Mitigate Hallucination via Evidence and Graph-based DistillationLong
- DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense RetrieversLong
- DREsS: Dataset for Rubric-based Essay Scoring on EFL WritingLong
- DRPruning: Efficient Large Language Model Pruning through Distributionally Robust OptimizationLong
- DRS: Deep Question Reformulation With Structured Outputfinding
- DRT: Deep Reasoning Translation via Long Chain-of-Thoughtfinding
- DReSD: Dense Retrieval for Speculative Decodingfinding
- DS2-ABSA: Dual-Stream Data Synthesis with Label Refinement for Few-Shot Aspect-Based Sentiment AnalysisLong
- DTCRS: Dynamic Tree Construction for Recursive SummarizationLong
- DYNTEXT: Semantic-Aware Dynamic Text Sanitization for Privacy-Preserving LLM Inferencefinding
- DaNet: Dual-Aware Enhanced Alignment Network for Multimodal Aspect-Based Sentiment Analysisfinding
- Data Caricatures: On the Representation of African American Language in Pretraining CorporaLong
- Data Interpreter: An LLM Agent for Data Sciencefinding
- Data Laundering: Artificially Boosting Benchmark Results through Knowledge DistillationLong
- Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language PlanningLong
- Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context LearningLong
- Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modelingfinding
- Data-Constrained Synthesis of Training Data for De-IdentificationLong
- DavIR: Data Selection via Implicit Reward for Large Language ModelsLong
- DeAL: Decoding-time Alignment for Large Language ModelsLong
- DeFine: Decision-Making with Analogical Reasoning over Factor Profilesfinding
- DeRAGEC: Denoising Named Entity Candidates with Synthetic Rationale for ASR Error Correctionfinding
- DeTAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modificationfinding
- Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancementfinding
- Debate4MATH: Multi-Agent Debate for Fine-Grained Reasoning in Mathfinding
- DebateCoder: Towards Collective Intelligence of LLMs via Test Case Driven LLM Debate for Code GenerationLong
- Debiasing Online Preference Learning via Preference Feature Preservationfinding
- Debiasing the Fine-Grained Classification Task in LLMs with Bias-Aware PEFTLong
- Debt Collection Negotiations with Large Language Models: An Evaluation System and Optimizing Decision Making with Multi-Agentfinding
- Decoder-Only LLMs can be Masked Auto-EncodersShort
- Decoding Knowledge Attribution in Mixture-of-Experts: A Framework of Basic-Refinement Collaboration and Efficiency AnalysisLong
- Decoding LLM Personality Measurement: Forced-Choice vs. Likertfinding
- Decoding Reading Goals from Eye MovementsLong
- Decoding by Contrasting Knowledge: Enhancing Large Language Model Confidence on Edited FactsLong
- Decoding on Graphs: Faithful and Sound Reasoning on Knowledge Graphs through Generation of Well-Formed ChainsLong
- DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenariosfinding
- Decomposed Opinion Summarization with Verified Aspect-Aware Modulesfinding
- Decoupling Memories, Muting Neurons: Towards Practical Machine Unlearning for Large Language Modelsfinding
- Decoupling Reasoning and Knowledge Injection for In-Context Knowledge Editingfinding
- Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect TimesLong
- DeepRTL2: A Versatile Model for RTL-Related Tasksfinding
- DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking ProcessLong
- DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point ThinkingLong
- Def-DTS: Deductive Reasoning for Open-domain Dialogue Topic Segmentationfinding
- Defense Against Prompt Injection Attack by Leveraging Attack TechniquesLong
- Defensive Prompt Patch: A Robust and Generalizable Defense of Large Language Models against Jailbreak Attacksfinding
- Defining and Evaluating Visual Language Models’ Basic Spatial Abilities: A Perspective from PsychometricsLong
- Dehumanizing Machines: Mitigating Anthropomorphic Behaviors in Text Generation SystemsLong
- Deliberate Reasoning in Language Models as Structure-Aware Planning with an Accurate World ModelLong
- Delta-KNN: Improving Demonstration Selection in In-Context Learning for Alzheimer’s Disease DetectionLong
- Delving into Multilingual Ethical Bias: The MSQAD with Statistical Hypothesis Tests for Large Language ModelsLong
- Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert ModelsLong
- Demystifying Small Language Models for Edge DeploymentLong
- Dense Retrieval with Quantity Comparison Intentfinding
- DenseLoRA: Dense Low-Rank Adaptation of Large Language ModelsLong
- Deontological Keyword Bias: The Impact of Modal Expressions on Normative Judgments of Language ModelsLong
- DependEval: Benchmarking LLMs for Repository Dependency Understandingfinding
- Derailer-Rerailer: Adaptive Verification for Efficient and Reliable Language Model Reasoningfinding
- Design Choices for Extending the Context Length of Visual Language ModelsLong
- Detecting Sockpuppetry on Wikipedia Using Meta-LearningLong
- Detecting and Mitigating Challenges in Zero-Shot Video Summarization with Video LLMsfinding
- Detection of Human and Machine-Authored Fake News in UrduLong
- Developmentally-plausible Working Memory Shapes a Critical Period for Language AcquisitionLong
- DiSCo: Device-Server Collaborative LLM-based Text Streaming Servicesfinding
- DiaLLMs: EHR-Enhanced Clinical Conversational System for Clinical Test Recommendation and Diagnosis Predictionfinding
- Diagnosing Failures in Large Language Models’ Answers: Integrating Error Attribution into Evaluation Frameworkfinding
- DialUp! Modeling the Language Continuum by Adapting Models to Dialects and Dialects to ModelsLong
- Dialect Normalization using Large Language Models and Morphological Rulesfinding
- Dialectal Coverage And Generalization in Arabic Speech RecognitionLong
- Dialogue Systems for Emotional Support via Value ReinforcementLong
- Dialogue-RAG: Enhancing Retrieval for LLMs via Node-Linking Utterance RewritingLong
- Dictionaries to the Rescue: Cross-Lingual Vocabulary Transfer for Low-Resource Languages Using Bilingual Dictionariesfinding
- Did Translation Models Get More Robust Without Anyone Even Noticing?Long
- DiffLM: Controllable Synthetic Data Generation via Diffusion Language Modelsfinding
- DiffPO: Diffusion-styled Preference Optimization for Inference Time Alignment of Large Language ModelsLong
- DiffSkip: Differential Layer Skipping in Large Language Modelsfinding
- Different Speech Translation Models Encode and Translate Speaker Gender DifferentlyShort
- DiffuseDef: Improved Robustness to Adversarial Attacks via Iterative DenoisingLong
- Diffusion Directed Acyclic Transformer for Non-Autoregressive Machine TranslationShort
- Diffusion Models Through a Global Lens: Are They Culturally Inclusive?Long
- Digest the Knowledge: Large Language Models empowered Message Passing for Knowledge Graph Question AnsweringLong
- Digital Gatekeepers: Google’s Role in Curating Hashtags and SubredditsLong
- DioR: Adaptive Cognitive Detection and Contextual Retrieval Optimization for Dynamic Retrieval-Augmented GenerationLong
- Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMsfinding
- Direct Prompt Optimization with Continuous RepresentationsLong
- Disambiguate First, Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsingfinding
- Disambiguating Reference in Visually Grounded Dialogues through Joint Modeling of Textual and Multimodal Semantic StructuresLong
- Discourse Relation-Enhanced Neural Coherence ModelingLong
- Disentangled Multi-span Evolutionary Network against Temporal Knowledge Graph Reasoningfinding
- Disentangling Biased Knowledge from Reasoning in Large Language Models via Machine UnlearningLong
- Disentangling Language and Culture for Evaluating Multilingual Large Language ModelsLong
- Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilitiesfinding
- Disentangling Memory and Reasoning Ability in Large Language ModelsLong
- Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuningfinding
- Disentangling Text and Math in Word Problems: Evidence for the Bidimensional Structure of Large Language Models’ Reasoningfinding
- Disentangling the Roles of Representation and Selection in Data PruningLong
- Distance between Relevant Information Pieces Causes Bias in Long-Context LLMsfinding
- Distilling an End-to-End Voice Assistant Without Instruction Training DataLong
- Diversification Catalyzes Language Models’ Instruction Generalization To Unseen Semanticsfinding
- Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Expertsfinding
- Diversity Explains Inference Scaling Laws: Through a Case Study of Minimum Bayes Risk DecodingLong
- Diversity-oriented Data Augmentation with Large Language ModelsLong
- Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool InvocationLong
- Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAGLong
- Divide-Verify-Refine: Can LLMs Self-align with Complex Instructions?finding
- Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checksfinding
- Do LLMs Understand Dialogues? A Case Study on Dialogue ActsLong
- Do Language Models Have Semantics? On the Five Standard PositionsLong
- Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMsfinding
- Do Language Models Understand Honorific Systems in Javanese?Long
- Do Language Models Understand the Cognitive Tasks Given to Them? Investigations with the N-Back Paradigmfinding
- Do Large Language Models Have “Emotion Neurons”? Investigating the Existence and Rolefinding
- Do Large Language Models Know Folktales? A Case Study of Yokai in Japanese Folktalesfinding
- Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?finding
- Do Large Language Models have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMsLong
- Do Multimodal Large Language Models Truly See What We Point At? Investigating Indexical, Iconic, and Symbolic Gesture ComprehensionShort
- Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucinationfinding
- Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluationfinding
- Do not Abstain! Identify and Solve the UncertaintyLong
- DoCIA: An Online Document-Level Context Incorporation Agent for Speech Translationfinding
- DoMIX: An Efficient Framework for Exploiting Domain Knowledge in Fine-TuningLong
- Doc-React: Multi-page Heterogeneous Document Question-answeringShort
- DocFusion: A Unified Framework for Document Parsing Tasksfinding
- DocMEdit: Towards Document-Level Model Editingfinding
- Document Segmentation Matters for Retrieval-Augmented Generationfinding
- Document-Level Event-Argument Data Augmentation for Challenging Role TypesLong
- Document-Level Relation Extraction with Global Relations and Entity Pair Reasoningfinding
- Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal TransportLong
- Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?finding
- Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual SettingsLong
- Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning Distillationfinding
- Does Time Have Its Place? Temporal Heads: Where Language Models Recall Time-specific InformationLong
- Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Modelsfinding
- Does the Emotional Understanding of LVLMs Vary Under High-Stress Environments and Across Different Demographic Attributes?Long
- Dolphin: Document Image Parsing via Heterogeneous Anchor Promptingfinding
- Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and FeedbackLong
- Domain Regeneration: How well do LLMs match syntactic properties of text domains?finding
- Domaino1s: Guiding LLM Reasoning for Explainable Answers in High-Stakes Domainsfinding
- Donate or Create? Comparing Data Collection Strategies for Emotion-labeled Multimodal Social Media PostsLong
- Don’t Erase, Inform! Detecting and Contextualizing Harmful Language in Cultural Heritage CollectionsLong
- Don’t Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration PitfallsLong
- Don’t Half-listen: Capturing Key-part Information in Continual Instruction TuningLong
- Don’t Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Modelsfinding
- Don’t Reinvent the Wheel: Efficient Instruction-Following Text Embedding based on Guided Space TransformationLong
- Don’t Say No: Jailbreaking LLM by Suppressing Refusalfinding
- Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusionfinding
- Drift: Enhancing LLM Faithfulness in Rationale Generation via Dual-Reward Probabilistic InferenceLong
- Drop Dropout on Single Epoch Language Model Pretrainingfinding
- Dual Debiasing for Noisy In-Context Learning for Text Generationfinding
- DualGuard: A Parameter Space Transformation Approach for Bidirectional Defense in Split-Based LLM Fine-TuningLong
- DualRAG: A Dual-Process Approach to Integrate Reasoning and Retrieval for Multi-Hop Question AnsweringLong
- Dually Self-Improved Counterfactual Data Augmentation Using Large Language ModelLong
- DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generationfinding
- DynaQuest: A Dynamic Question Answering Dataset Reflecting Real-World Knowledge Updatesfinding
- Dynamic Attention-Guided Context Decoding for Mitigating Context Faithfulness Hallucinations in Large Language Modelsfinding
- Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language ModelsLong
- Dynamic Evaluation with Cognitive Reasoning for Multi-turn Safety of Large Language ModelsLong
- Dynamic Evil Score-Guided Decoding: An Efficient Decoding Framework For Red-Team Modelfinding
- Dynamic Head Selection for Neural Lexicalized Constituency ParsingLong
- Dynamic Knowledge Integration for Evidence-Driven Counter-Argument Generation with Large Language Modelsfinding
- Dynamic Label Name Refinement for Few-Shot Dialogue Intent ClassificationShort
- Dynamic Order Template Prediction for Generative Aspect-Based Sentiment AnalysisShort
- Dynamic Parallel Tree Search for Efficient LLM ReasoningLong
- Dynamic Personality in LLM Agents: A Framework for Evolutionary Modeling and Behavioral Analysis in the Prisoner’s Dilemmafinding
- Dynamic Prefix as Instructor for Incremental Named Entity Recognition: A Unified Seq2Seq Generation Frameworkfinding
- Dynamic Scaling of Unit Tests for Code Reward ModelingLong
- Dynamic Steering With Episodic Memory For Large Language Modelsfinding
- Dynamic Task Vector Grouping for Efficient Multi-Task Prompt Tuningfinding
- Dynamic and Generalizable Process Reward ModelingLong
- Déjà Vu? Decoding Repeated Reading from Eye MovementsLong
- EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language ModelsLong
- EAGLE: Expert-Guided Self-Enhancement for Preference Alignment in Pathology Large Vision-Language ModelLong
- EC-RAFT: Automated Generation of Clinical Trial Eligibility Criteria through Retrieval-Augmented Fine-Tuningfinding
- ECERC: Evidence-Cause Attention Network for Multi-Modal Emotion Recognition in ConversationLong
- ECLM: Entity Level Language Model for Spoken Language Understanding with Chain of IntentLong
- ECoRAG: Evidentiality-guided Compression for Long Context RAGfinding
- ELABORATION: A Comprehensive Benchmark on Human-LLM Competitive ProgrammingLong
- ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language ModelsLong
- ELI-Why: Evaluating the Pedagogical Utility of Language Model Explanationsfinding
- EMGLLM: Data-to-Text Alignment for Electromyogram Diagnosis Generation with Medical Numerical Data Encodingfinding
- EMPEC: A Comprehensive Benchmark for Evaluating Large Language Models Across Diverse Healthcare Professionsfinding
- EMRs2CSP : Mining Clinical Status Pathway from Electronic Medical Recordsfinding
- EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement LearningLong
- ERU-KG: Efficient Reference-aligned Unsupervised Keyphrase GenerationLong
- ESF: Efficient Sensitive Fingerprinting for Black-Box Tamper Detection of Large Language Modelsfinding
- ETF: An Entity Tracing Framework for Hallucination Detection in Code SummariesLong
- ETRQA: A Comprehensive Benchmark for Evaluating Event Temporal Reasoning Abilities of Large Language Modelsfinding
- EXECUTE: A Multilingual Benchmark for LLM Token Understandingfinding
- EXIT: Context-Aware Extractive Compression for Enhancing Retrieval-Augmented Generationfinding
- EXPERT: An Explainable Image Captioning Evaluation Metric with Structured Explanationsfinding
- Each graph is a new language: Graph Learning with LLMsfinding
- EasyEA: Large Language Model is All You Need in Entity Alignment Between Knowledge Graphsfinding
- EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product AssociationLong
- EdiText: Controllable Coarse-to-Fine Text Editing with Diffusion Language ModelsLong
- Edit Once, Update Everywhere: A Simple Framework for Cross-Lingual Knowledge Synchronization in LLMsfinding
- EditInspector: A Benchmark for Evaluation of Text-Guided Image EditsLong
- EducationQ: Evaluating LLMs’ Teaching Capabilities Through Multi-Agent Dialogue FrameworkLong
- Eeyore: Realistic Depression Simulation via Expert-in-the-Loop Supervised and Preference Optimizationfinding
- EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language ModelsLong
- Efficient Domain Continual pretraining by Mitigating the Stability GapLong
- Efficient Ensemble for Fine-tuning Language Models on Multiple DatasetsLong
- Efficient Knowledge Editing via Minimal PrecomputationShort
- Efficient Long Context Language Model Retrieval with CompressionLong
- Efficient Many-Shot In-Context Learning with Dynamic Block-Sparse AttentionLong
- Efficient OpAmp Adaptation for Zoom Attention to Golden ContextsLong
- Efficient Pretraining Data Selection for Language Models via Multi-Actor CollaborationLong
- Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward ModelingLong
- Efficient Universal Goal Hijacking with Semantics-guided Prompt OrganizationLong
- Efficient and Accurate Prompt Optimization: the Benefit of Memory in Exemplar-Guided ReflectionLong
- Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attackfinding
- EfficientQAT: Efficient Quantization-Aware Training for Large Language ModelsLong
- Efficiently Identifying Watermarked Segments in Mixed-Source TextsLong
- EgoNormia: Benchmarking Physical-Social Norm Understandingfinding
- Eliciting In-context Retrieval and Reasoning for Long-context Large Language Modelsfinding
- Eliciting Textual Descriptions from Representations of Continuous Promptsfinding
- Embedding-Converter: A Unified Framework for Cross-Model Embedding TransformationLong
- Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based AgentsLong
- Embracing Large Language Models in Traffic Flow Forecastingfinding
- Emergent Abilities of Large Language Models under Continued Pre-training for Language AdaptationLong
- Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial ReasoningLong
- Emo Pillars: Knowledge Distillation to Support Fine-Grained Context-Aware and Context-Less Emotion Classificationfinding
- Empathy Prediction from Diverse PerspectivesLong
- Employing Discourse Coherence Enhancement to Improve Cross-Document Event and Entity Coreference ResolutionLong
- EnSToM: Enhancing Dialogue Systems with Entropy-Scaled Steering Vectors for Topic Maintenancefinding
- Enabling Chatbots with Eyes and Ears: An Immersive Multimodal Conversation System for Dynamic InteractionsLong
- Enabling LLM Knowledge Analysis via Extensive MaterializationLong
- Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correctionfinding
- EnerGIZAr: Leveraging GIZA++ for Effective Tokenizer Initializationfinding
- Energy Considerations of Large Language Model Inference and Efficiency OptimizationsLong
- English-based acoustic models perform well in the forced alignment of two English-based Pacific CreolesLong
- Enhance Multimodal Consistency and Coherence for Text-Image Plan Generationfinding
- Enhanced Data Synthesis for LLM through Reasoning Structures Generated by Hierarchical GFlowNetfinding
- Enhancing Automated Interpretability with Output-Centric Feature DescriptionsLong
- Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrievalfinding
- Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuningLong
- Enhancing Character-Level Understanding in LLMs through Token Internal Structure LearningLong
- Enhancing Complex Reasoning in Knowledge Graph Question Answering through Query Graph Approximationfinding
- Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource LanguagesLong
- Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mappingfinding
- Enhancing Event-centric News Cluster Summarization via Data Sharpening and Localization InsightsLong
- Enhancing Goal-oriented Proactive Dialogue Systems via Consistency Reflection and CorrectionLong
- Enhancing Human Evaluation in Machine Translation with Comparative JudgementLong
- Enhancing Hyperbole and Metaphor Detection with Their Bidirectional Dynamic Interaction and Emotion KnowledgeLong
- Enhancing Input-Label Mapping in In-Context Learning with Contrastive DecodingShort
- Enhancing Interpretable Image Classification Through LLM Agents and Conditional Concept Bottleneck ModelsLong
- Enhancing LLM Agent Safety via Causal Influence Promptingfinding
- Enhancing LLM-based Hatred and Toxicity Detection with Meta-Toxic Knowledge Graphfinding
- Enhancing Lexicon-Based Text Embeddings with Large Language ModelsLong
- Enhancing Machine Translation with Self-Supervised Preference DataLong
- Enhancing Mathematical Reasoning in LLMs by Stepwise CorrectionLong
- Enhancing Medical Dialogue Generation through Knowledge Refinement and Dynamic Prompt Adjustmentfinding
- Enhancing Multimodal Continual Instruction Tuning with BranchLoRALong
- Enhancing Multimodal Retrieval via Complementary Information Extraction and AlignmentLong
- Enhancing Multimodal Unified Representations for Cross Modal Generalizationfinding
- Enhancing NER by Harnessing Multiple Datasets with Conditional Variational AutoencodersShort
- Enhancing Neural Machine Translation Through Target Language Data: A kNN-LM Approach for Domain AdaptationLong
- Enhancing Open-Domain Task-Solving Capability of LLMs via Autonomous Tool Integration from GitHubLong
- Enhancing Persona Consistency for LLMs’ Role-Playing using Persona-Aware Contrastive Learningfinding
- Enhancing Retrieval Systems with Inference-Time Logical ReasoningShort
- Enhancing Retrieval-Augmented Generation via Evidence Tree SearchLong
- Enhancing Safe and Controllable Protein Generation via Knowledge Preference OptimizationLong
- Enhancing Spoken Discourse Modeling in Language Models Using Gestural CuesLong
- Enhancing Text Editing for Grammatical Error Correction: Arabic as a Case StudyLong
- Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklistsfinding
- Enhancing Transformation from Natural Language to Signal Temporal Logic Using LLMs with Diverse External Knowledgefinding
- Enhancing Transformers for Generalizable First-Order Logical EntailmentLong
- Enhancing Unsupervised Sentence Embeddings via Knowledge-Driven Data Augmentation and Gaussian-Decayed Contrastive LearningLong
- Enhancing the Comprehensibility of Text Explanations via Unsupervised Concept Discoveryfinding
- EnigmaToM: Improve LLMs’ Theory-of-Mind Reasoning Capabilities with Neural Knowledge Base of Entity Statesfinding
- Enough Coin Flips Can Make LLMs Act BayesianLong
- Ensemble Watermarks for Large Language ModelsLong
- Entailed Between the Lines: Incorporating Implication into NLILong
- Entailment-Preserving First-order Logic Representations in Natural Language EntailmentLong
- Entity Framing and Role Portrayal in the Newsfinding
- Entriever: Energy-based Retriever for Knowledge-Grounded Dialog Systemsfinding
- Entropy-based Exploration Conduction for Multi-step Reasoningfinding
- Entrospect: Information-Theoretic Self-Reflection Elicits Better Response Refinement of Small Language Modelsfinding
- EpMAN: Episodic Memory AttentioN for Generalizing to Longer ContextsLong
- EpiCoDe: Boosting Model Performance Beyond Training with Extrapolation and Contrastive Decodingfinding
- Error Comparison Optimization for Large Language Models on Aspect-Based Sentiment AnalysisLong
- Error-driven Data-efficient Large Multimodal Model TuningLong
- EscapeBench: Towards Advancing Creative Intelligence of Language Model AgentsLong
- EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Modelsfinding
- Establishing Trustworthy LLM Evaluation via Shortcut Neuron AnalysisLong
- Estimating Privacy Leakage of Augmented Contextual Knowledge in Language ModelsLong
- Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equationfinding
- EtiCor++: Towards Understanding Etiquettical Bias in LLMsfinding
- EuroVerdict: A Multilingual Dataset for Verdict Generation Against Misinformationfinding
- Evaluating Design Decisions for Dual Encoder-based Entity DisambiguationLong
- Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspectivefinding
- Evaluating Instructively Generated Statement by Large Language Models for Directional Event Causality Identificationfinding
- Evaluating LLMs for Portuguese Sentence Simplification with Linguistic InsightsLong
- Evaluating LLMs’ Assessment of Mixed-Context Hallucination Through the Lens of Summarizationfinding
- Evaluating LLMs’ Mathematical and Coding Competency through Ontology-guided Interventionsfinding
- Evaluating Language Models as Synthetic Data GeneratorsLong
- Evaluating Large Language Models for Confidence-based Check Set Selectionfinding
- Evaluating Lexical Proficiency in Neural Language ModelsLong
- Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired UsersLong
- Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree SearchLong
- Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and ProactivityLong
- Evaluating Pretrained Causal Language Models for Synonymyfinding
- Evaluating Sequence Labeling on the basis of Information TheoryLong
- Evaluating Theory of (an uncertain) Mind: Predicting the Uncertain Beliefs of Others from Conversational CuesLong
ACL accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.