ACL 2025 Accepted Papers
The full list of 3,086 papers accepted at ACL 2025 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Long: 1,602finding: 1,387Short: 97
- On the Mutual Influence of Gender and Occupation in LLM RepresentationsLong
- On the Relation Between Fine-Tuning, Topological Properties, and Task Performance in Sense-Enhanced EmbeddingsLong
- On the Reliability of Large Language Models for Causal DiscoveryLong
- On the Risk of Evidence Pollution for Malicious Social Text Detection in the Era of LLMsLong
- On the Robust Approximation of ASR Metricsfinding
- On the Role of Semantic Proto-roles in Semantic Analysis: What do LLMs know about agency?finding
- On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigationfinding
- One QuantLLM for ALL: Fine-tuning Quantized LLMs Once for Efficient DeploymentsLong
- One for All: Update Parameterized Knowledge Across Multiple Models with Once EditLong
- One-Dimensional Object Detection for Streaming Text Segmentation of Meeting Dialoguefinding
- One-for-All Pruning: A Universal Model for Customized Compression of Large Language Modelsfinding
- Online Iterative Self-Alignment for Radiology Report GenerationLong
- Only a Little to the Left: A Theory-grounded Measure of Political Bias in Large Language ModelsLong
- Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question AnsweringLong
- Open-Set Living Need Prediction with Large Language Modelsfinding
- Open-World Attribute Mining for E-Commerce Products with Multimodal Self-Correction Instruction TuningLong
- Open-World Authorship Attributionfinding
- Open-World Planning via Lifted Regression with LLM-Inferred Affordances for Embodied AgentsLong
- OpenCoder: The Open Cookbook for Top-Tier Code Large Language ModelsLong
- OpenHuEval: Evaluating Large Language Model on Hungarian Specificsfinding
- OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and OptimizationLong
- Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal TransportLong
- Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent Systemfinding
- Optimal Transport-Based Token Weighting scheme for Enhanced Preference OptimizationLong
- Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrievalfinding
- Optimizing Decomposition for Optimal Claim VerificationLong
- Optimizing Multi-Hop Document Retrieval Through Intermediate Representationsfinding
- Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert ModelsLong
- Optimizing Question Semantic Space for Dynamic Retrieval-Augmented Multi-hop Question AnsweringLong
- Optimizing Reasoning for Text-to-SQL with Execution Feedbackfinding
- Order Matters: Investigate the Position Bias in Multi-constraint Instruction Followingfinding
- Out-of-Distribution Detection via LLM-Guided Outlier Generation for Text-attributed Graphfinding
- Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language ModelsLong
- Outlier-weighed Layerwise Sampling for LLM Fine-tuningfinding
- P-CoT: A Pedagogically-motivated Participatory Chain-of-Thought Prompting for Phonological Reasoning in LLMsfinding
- P-React: Synthesizing Topic-Adaptive Reactions of Personality Traits via Mixture of Specialized LoRA Expertsfinding
- P2 Law: Scaling Law for Post-Training After Model PruningLong
- P3: Prompts Promote Promptingfinding
- PAM: Paraphrase AMR-Centric Evaluation Metricfinding
- PAP2PAT: Benchmarking Outline-Guided Long-Text Patent Generation with Patent-Paper Pairsfinding
- PARME: Parallel Corpora for Low-Resourced Middle Eastern LanguagesLong
- PARSQL: Enhancing Text-to-SQL through SQL Parsing and Reasoningfinding
- PASTEL : Polarity-Aware Sentiment Triplet Extraction with LLM-as-a-Judgefinding
- PCoT: Persuasion-Augmented Chain of Thought for Detecting Fake News and Social Media DisinformationLong
- PECAN: LLM-Guided Dynamic Progress Control with Attention-Guided Hierarchical Weighted Graph for Long-Document QAfinding
- PEToolLLM: Towards Personalized Tool Learning in Large Language Modelsfinding
- PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowchartsfinding
- PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimizationfinding
- PIC: Unlocking Long-Form Text Generation Capabilities of Large Language Models via Position ID CompressionLong
- PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context OptimizationLong
- PIGuard: Prompt Injection Guardrail via Mitigating Overdefense for FreeLong
- PIPER: Benchmarking and Prompting Event Reasoning Boundary of LLMs via Debiasing-Distillation Enhanced TuningLong
- PISCO: Pretty Simple Compression for Retrieval-Augmented Generationfinding
- PKAG-DDI: Pairwise Knowledge-Augmented Language Model for Drug-Drug Interaction Event Text GenerationLong
- PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human PreferenceLong
- PLAY2PROMPT: Zero-shot Tool Instruction Optimization for LLM Agents via Tool Playfinding
- PM3-KIE: A Probabilistic Multi-Task Meta-Model for Document Key Information Extractionfinding
- PPT: A Minor Language News Recommendation Model via Cross-Lingual Preference Pattern TransferLong
- PQR: Improving Dense Retrieval via Potential Query ModelingLong
- PRISM: A Framework for Producing Interpretable Political Bias Embeddings with Political-Aware Cross-EncoderLong
- PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward ModelsLong
- PROMTEC: Fast LLM Inference Decoding using Prompt Multi-Lookup with Template Database and Common Sequencesfinding
- PROPER: A Progressive Learning Framework for Personalized Large Language Models with Group-Level AdaptationLong
- PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language ModelsLong
- PVP: An Image Dataset for Personalized Visual Persuasion with Persuasion Strategies, Viewer Characteristics, and Persuasiveness RatingsLong
- PaSa: An LLM Agent for Comprehensive Academic Paper SearchLong
- Packing Analysis: Packing Is More Appropriate for Large Models or Datasets in Supervised Fine-tuningfinding
- Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMsLong
- Pandora’s Box or Aladdin’s Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language ModelsLong
- Parameter-Aware Contrastive Knowledge Editing: Tracing and Rectifying based on Critical Transmission PathsLong
- Parameter-Efficient Fine-Tuning via Circular Convolutionfinding
- Parenting: Optimizing Knowledge Selection of Retrieval-Augmented Language Models with Parameter Decoupling and Tailored TuningLong
- Partial Colexifications Improve Concept EmbeddingsLong
- Past Meets Present: Creating Historical Analogy with Large Language ModelsLong
- Pattern Recognition or Medical Knowledge? The Problem with Multiple-Choice Questions in MedicineLong
- Patterns Over Principles: The Fragility of Inductive Reasoning in LLMs under Noisy Observationsfinding
- People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated textLong
- PerSphere: A Comprehensive Framework for Multi-Faceted Perspective Retrieval and SummarizationLong
- Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language ModelsLong
- Persistent Homology of Topic Networks for the Prediction of Reader CuriosityLong
- Persona Dynamics: Unveiling the Impact of Persona Traits on Agents in Text-Based GamesLong
- Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgmentfinding
- PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Datafinding
- PersonaLens: A Benchmark for Personalization Evaluation in Conversational AI Assistantsfinding
- PersonaX: A Recommendation Agent-Oriented User Modeling Framework for Long Behavior Sequencefinding
- Personal Travel Solver: A Preference-Driven LLM-Solver System for Travel PlanningLong
- Personality-Guided Code Generation Using Large Language ModelsLong
- Personalized Generation In Large Model Era: A SurveyLong
- Personalized Text Generation with Contrastive Activation SteeringLong
- Perspective Transition of Large Language Models for Solving Subjective Tasksfinding
- Phonotomizer: A Compact, Unsupervised, Online Training Approach to Real-Time, Multilingual Phonetic SegmentationLong
- PhysReason: A Comprehensive Benchmark towards Physics-Based ReasoningLong
- Physics: Benchmarking Foundation Models on University-Level Physics Problem Solvingfinding
- PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decodingfinding
- Pitfalls of Scale: Investigating the Inverse Task of Redefinition in Large Language Modelsfinding
- Pixel-Level Reasoning Segmentation via Multi-turn ConversationsLong
- PlanGenLLMs: A Modern Survey of LLM Planning CapabilitiesLong
- Planning with Diffusion Models for Target-Oriented Dialogue SystemsLong
- Planning-Driven Programming: A Large Language Model Programming WorkflowLong
- PlanningArena: A Modular Benchmark for Multidimensional Evaluation of Planning and Tool LearningLong
- Plug-in and Fine-tuning: Bridging the Gap between Small Language Models and Large Language ModelsLong
- PodAgent: A Comprehensive Framework for Podcast Generationfinding
- Polishing Every Facet of the GEM: Testing Linguistic Competence of LLMs and Humans in KoreanLong
- PolyNarrative: A Multilingual, Multilabel, Multi-domain Dataset for Narrative Extraction from News ArticlesLong
- Ponder & Press: Advancing Visual GUI Agent towards General Computer Controlfinding
- PopAlign: Diversifying Contrasting Patterns for a More Comprehensive AlignmentLong
- Position Paper: MeMo: Towards Language Models with Associative Memory Mechanismsfinding
- Position-Aware Depth Decay Decoding (D3): Boosting Large Language Model Inference Efficiencyfinding
- Position-aware Automatic Circuit DiscoveryLong
- Positional Overload: Positional Debiasing and Context Window Extension for Large Language Models using Set EncodingLong
- Powerformer: Efficient and High-Accuracy Privacy-Preserving Language Model with Homomorphic EncryptionLong
- Praetor: A Fine-Grained Generative LLM Evaluator with Instance-Level Customizable Evaluation CriteriaLong
- Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and ChallengesLong
- Pre-Training Curriculum for Multi-Token Prediction in Language ModelsLong
- Pre-training Distillation for Large Language Models: A Design Space ExplorationLong
- Pre3: Enabling Deterministic Pushdown Automata for Faster Structured LLM GenerationLong
- PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR AccuracyLong
- PreSumm: Predicting Summarization Performance Without Summarizingfinding
- Predicate-Conditional Conformalized Answer Sets for Knowledge Graph Embeddingsfinding
- PredictaBoard: Benchmarking LLM Score Predictabilityfinding
- Predicting Depression in Screening Interviews from Interactive Multi-Theme Collaborationfinding
- Predicting Implicit Arguments in Procedural Video InstructionsLong
- Predicting Through Generation: Why Generation Is Better for PredictionLong
- Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual SignalsLong
- Prediction Hubs are Context-Informed Frequent Tokens in LLMsLong
- Prediction-Augmented Generation for Automatic Diagnosis Tasksfinding
- Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Datafinding
- Pretraining Context Compressor for Large Language Models with Embedding-Based MemoryLong
- Principled Content Selection to Generate Diverse and Personalized Multi-Document SummariesLong
- Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning TasksLong
- PrivaCI-Bench: Evaluating Privacy with Contextual Integrity and Legal ComplianceLong
- Privacy Ripple Effects from Adding or Removing Personal Information in Language Model Trainingfinding
- PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and RestorationLong
- Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language ModelsLong
- ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasksfinding
- ProMALex: Progressive Modular Adapters for Multi-Jurisdictional Legal Language ModelingLong
- ProMedTS: A Self-Supervised, Prompt-Guided Multimodal Approach for Integrating Medical Text and Time Seriesfinding
- ProMind-LLM: Proactive Mental Health Care via Causal Reasoning with Sensor Datafinding
- Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Modelsfinding
- Probability-Consistent Preference Optimization for Enhanced LLM Reasoningfinding
- Probing LLMs for Multilingual Discourse Generalization Through a Unified Label SetLong
- Probing Relative Interaction and Dynamic Calibration in Multi-modal Entity AlignmentLong
- Probing Subphonemes in Morphology Modelsfinding
- Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasksfinding
- Problem-Solving Logic Guided Curriculum In-Context Learning for LLMs Complex Reasoningfinding
- Process-based Self-Rewarding Language Modelsfinding
- ProcessBench: Identifying Process Errors in Mathematical ReasoningLong
- ProcrustesGPT: Compressing LLMs with Structured Matrices and Orthogonal Transformationsfinding
- Profiling News Media for Factuality and Bias Using LLMs and the Fact-Checking Methodology of Human Expertsfinding
- ProgCo: Program Helps Self-Correction of Large Language ModelsShort
- Program Synthesis Benchmark for Visual Programming in XLogoOnline EnvironmentLong
- Programming by Example meets Historical Linguistics: A Large Language Model Based Approach to Sound Law InductionLong
- Progressive LoRA for Multimodal Continual Instruction Tuningfinding
- Progressive Multimodal Reasoning via Active RetrievalLong
- ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generationfinding
- Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data AnnotationLong
- Prompt-Guided Internal States for Hallucination Detection of Large Language ModelsLong
- PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Modelsfinding
- PromptWizard: Optimizing Prompts via Task-Aware, Feedback-Driven Self-Evolutionfinding
- Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agentsfinding
- ProtoLens: Advancing Prototype Learning for Fine-Grained Interpretability in Text ClassificationLong
- ProvBench: A Benchmark of Legal Provision Recommendation for Contract Auto-ReviewingLong
- Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Modelfinding
- ProxAnn: Use-Oriented Evaluations of Topic Models and Document ClusteringLong
- Proxy-Driven Robust Multimodal Sentiment Analysis with Incomplete DataLong
- PruneVid: Visual Token Pruning for Efficient Video Large Language Modelsfinding
- Pruning General Large Language Models into Customized Expert Modelsfinding
- PsyAdvisor: A Plug-and-Play Strategy Advice Planner with Proactive Questioning in Psychological ConversationsLong
- PsyDT: Using LLMs to Construct the Digital Twin of Psychological Counselor with Personalized Counseling Style for Psychological CounselingLong
- PsyDial: A Large-scale Long-term Conversational Dataset for Mental Health SupportLong
- PunchBench: Benchmarking MLLMs in Multimodal Punchline ComprehensionLong
- PwnGPT: Automatic Exploit Generation Based on Large Language ModelsLong
- P²Net: Parallel Pointer-based Network for Key Information Extraction with Complex Layoutsfinding
- Q-Mamba: Towards more efficient Mamba models via post-training quantizationfinding
- Q-STRUM Debate: Query-Driven Contrastive Summarization for Recommendation Comparisonfinding
- QAEncoder: Towards Aligned Representation Learning in Question Answering SystemsLong
- QAEval: Mixture of Evaluators for Question-Answering Task EvaluationLong
- QDTSynth: Quality-Driven Formal Theorem Synthesis for Enhancing Proving Performance of LLMsLong
- QG-SMS: Enhancing Test Item Analysis via Student Modeling and SimulationLong
- QQSUM: A Novel Task and Model of Quantitative Query-Focused Summarization for Review-based Product Question AnsweringLong
- QiMeng-Attention: SOTA Attention Operator is generated by SOTA Attention Algorithmfinding
- Qorǵau: Evaluating Safety in Kazakh-Russian Bilingual Contextsfinding
- QuASAR: A Question-Driven Structure-Aware Approach for Table-to-Text GenerationLong
- Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability HypothesisLong
- QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and DescriptionsLong
- Quantification of Large Language Model DistillationLong
- Quantifying Lexical Semantic Shift via Unbalanced Optimal TransportLong
- Quantifying Misattribution Unfairness in Authorship AttributionShort
- Quantifying Semantic Emergence in Language ModelsLong
- Quantile Regression with Large Language Models for Price Predictionfinding
- Quantized Can Still Be Calibrated: A Unified Framework to Calibration in Quantized Large Language ModelsLong
- Query-Driven Multimodal GraphRAG: Dynamic Local Knowledge Graph Construction for Online Reasoningfinding
- Query-driven Document-level Scientific Evidence Extraction from Biomedical StudiesLong
- QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Languagefinding
- Question Answering in Climate Adaptation for Agriculture: Model Development and Evaluation with Expert Feedbackfinding
- Question-Aware Knowledge Graph Prompting for Enhancing Large Language Modelsfinding
- Qwen2.5-xCoder: Multi-Agent Collaboration for Multilingual Code Instruction TuningLong
- R-Fairness: Assessing Fairness of Ranking in Subjective DataLong
- R-VLM: Region-Aware Vision Language Model for Precise GUI Groundingfinding
- R.R.: Unveiling LLM Training Privacy through Recollection and Rankingfinding
- R2-MultiOmnia: Leading Multilingual Multimodal Reasoning via Self-TrainingLong
- R2D2: Remembering, Replaying and Dynamic Decision Making with a Reflective Agentic MemoryLong
- R3Mem: Bridging Memory Retention and Retrieval via Reversible Compressionfinding
- RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge InjectionLong
- RAEmoLLM: Retrieval Augmented LLMs for Cross-Domain Misinformation Detection Using In-Context Learning Based on Emotional InformationLong
- RAG-Critic: Leveraging Automated Critic-Guided Agentic Workflow for Retrieval Augmented GenerationLong
- RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignmentfinding
- RAGEval: Scenario Specific RAG Evaluation Dataset Generation FrameworkLong
- RAPID: Efficient Retrieval-Augmented Long Text Generation with Writing Planning and Information Discoveryfinding
- RARE: Retrieval-Augmented Reasoning Enhancement for Large Language ModelsLong
- RASD: Retrieval-Augmented Speculative Decodingfinding
- RASPberry: Retrieval-Augmented Monte Carlo Tree Self-Play with Reasoning Consistency for Multi-Hop Question Answeringfinding
- RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Modelsfinding
- RATIONALYST: Pre-training Process-Supervision for Improving ReasoningLong
- READoc: A Unified Benchmark for Realistic Document Structured Extractionfinding
- REAL-MM-RAG: A Real-World Multi-Modal Retrieval BenchmarkLong
- REALM: A Dataset of Real-World LLM Use Casesfinding
- REPRO-Bench: Can Agentic AI Systems Assess the Reproducibility of Social Science Research?finding
- REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Spacefinding
- RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answeringfinding
- RL-Guider: Leveraging Historical Decisions and Feedback for Drug Editing with Large Language Modelsfinding
- RLKGF: Reinforcement Learning from Knowledge Graph Feedback Without Human Annotationsfinding
- RMoA: Optimizing Mixture-of-Agents through Diversity Maximization and Residual Compensationfinding
- RPO: Retrieval Preference Optimization for Robust Retrieval-Augmented GenerationLong
- RQT: Hierarchical Residual Quantization for Multi-Model Compressionfinding
- RSCF: Relation-Semantics Consistent Filter for Entity Embedding of Knowledge GraphLong
- RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-ThoughtLong
- RTADev: Intention Aligned Multi-Agent Framework for Software Developmentfinding
- RUBY: An Effective Framework for Multi-Constraint Multi-Hop Question GenerationLong
- RaaS: Reasoning-Aware Attention Sparsity for Efficient LLM Reasoningfinding
- Random Splitting Negatively Impacts NER Evaluation: Quantifying and Eliminating the Overestimation of NER Performancefinding
- Rank, Chunk and Expand: Lineage-Oriented Reasoning for Taxonomy Expansionfinding
- RankCoT: Refining Knowledge for Retrieval-Augmented Generation through Ranking Chain-of-ThoughtsLong
- Ranked Voting based Self-Consistency of Large Language Modelsfinding
- Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI CombatLong
- Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliabilityfinding
- Rationalize and Align: Enhancing Writing Assistance with Rationale via Self-Training for Improved Alignmentfinding
- Re-TASK: Revisiting LLM Tasks from Capability, Skill, and Knowledge Perspectivesfinding
- Re-identification of De-identified Documents with Autoregressive InfillingLong
- Re-ranking Using Large Language Models for Mitigating Exposure to Harmful Content on Social Media PlatformsLong
- Re3Syn: A Dependency-Based Data Synthesis Framework for Long-Context Post-trainingLong
- ReKG-MCTS: Reinforcing LLM Reasoning on Knowledge Graphs via Training-Free Monte Carlo Tree Searchfinding
- ReLearn: Unlearning via Learning for Large Language ModelsLong
- RePanda: Pandas-powered Tabular Verification and ReasoningLong
- ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency SupervisionLong
- Read it in Two Steps: Translating Extremely Low-Resource Languages with Code-Augmented Grammar BooksLong
- Real-time Factuality Assessment from Adversarial FeedbackLong
- RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysisfinding
- Reason from Future: Reverse Thought Chain Enhances LLM Reasoningfinding
- ReasonerRank: Redefining Language Model Evaluation with Ground-Truth-Free Ranking Frameworksfinding
- Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inferencefinding
- Reasoning Does Not Necessarily Improve Role-Playing Abilityfinding
- Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluationfinding
- Reasoning with Graphs: Structuring Implicit Knowledge to Enhance LLMs Reasoningfinding
- RecLM: Recommendation Instruction TuningLong
- Recent Advances in Speech Language Models: A SurveyLong
- Reconsidering LLM Uncertainty Estimation Methods in the WildLong
- RecordTwin: Towards Creating Safe Synthetic Clinical Corporafinding
- Rectifying Belief Space via Unlearning to Harness LLMs’ Reasoningfinding
- Recurrent Knowledge Identification and Fusion for Language Model Continual LearningLong
- Recursive Question Understanding for Complex Question Answering over Heterogeneous Personal Datafinding
- Red Queen: Exposing Latent Multi-Turn Risks in Large Language Modelsfinding
- Red-Teaming LLM Multi-Agent Systems via Communication Attacksfinding
- Redundancy Principles for MLLMs BenchmarksLong
- Redundancy, Isotropy, and Intrinsic Dimensionality of Prompt-based Text Embeddingsfinding
- RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMsfinding
- Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Modelsfinding
- Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language ModelsLong
- Refining Salience-Aware Sparse Fine-Tuning Strategies for Language ModelsLong
- Refining Sentence Embedding Model through Ranking Sentences Generation with Large Language Modelsfinding
- ReflecTool: Towards Reflection-Aware Tool-Augmented Clinical AgentsLong
- ReflectDiffu: Reflect between Emotion-intent Contagion and Mimicry for Empathetic Response Generation via a RL-Diffusion FrameworkLong
- ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflectionfinding
- Reflection on Knowledge Graph for Large Language Models Reasoningfinding
- ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code GenerationLong
- RefreshKV: Updating Small KV Cache During Long-form GenerationLong
- Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal TrainingLong
- Registering Source Tokens to Target Language Spaces in Multilingual Neural Machine TranslationLong
- Rehearse With User: Personalized Opinion Summarization via Role-Playing based on Large Language Modelsfinding
- Reinforced IR: A Self-Boosting Framework For Domain-Adapted Information RetrievalLong
- Reinforcing Compositional Retrieval: Retrieving Step-by-Step for Composing Informative Contextsfinding
- RelEdit: Evaluating Conceptual Knowledge Editing in Language Models via Relational Reasoningfinding
- RelationalCoder: Rethinking Complex Tables via Programmatic Relational TransformationLong
- Relevance Scores Calibration for Ranked List Truncation via TMP Adapterfinding
- Relevant or Random: Can LLMs Truly Perform Analogical Reasoning?finding
- Reliably Bounding False Positives: A Zero-Shot Machine-Generated Text Detection Framework via Multiscaled Conformal PredictionLong
- RemoteRAG: A Privacy-Preserving LLM Cloud RAG Servicefinding
- Removal of Hallucination on Hallucination: Debate-Augmented RAGLong
- Removing Prompt-template Bias in Reinforcement Learning from Human Feedbackfinding
- Representation Bending for Large Language Model SafetyLong
- Representations of Fact, Fiction and Forecast in Large Language Models: Epistemics and AttitudesLong
- Reranking-based Generation for Unbiased Perspective Summarizationfinding
- Research Borderlands: Analysing Writing Across Research CulturesLong
- Research Community Perspectives on “Intelligence” and Large Language Modelsfinding
- Resource-Friendly Dynamic Enhancement Chain for Multi-Hop Question Answeringfinding
- Response Wide Shut? Surprising Observations in Basic Vision Language Model CapabilitiesLong
- Rethinking Diverse Human Preference Learning through Principal Component Analysisfinding
- Rethinking Evaluation Metrics for Grammatical Error Correction: Why Use a Different Evaluation Process than Human?Short
- Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web CorporaShort
- Rethinking Prompt-based Debiasing in Large Language Modelfinding
- Rethinking Repetition Problems of LLMs in Code GenerationLong
- Rethinking Reward Model Evaluation Through the Lens of Reward OveroptimizationLong
- Rethinking Semantic Parsing for Large Language Models: Enhancing LLM Performance with Semantic HintsShort
- Rethinking Stateful Tool Use in Multi-Turn Dialogues: Benchmarks and Challengesfinding
- Rethinking Table Instruction Tuningfinding
- Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability TheoryLong
- Retrieval Models Aren’t Tool-Savvy: Benchmarking Tool Retrieval for Large Language Modelsfinding
- Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Modelsfinding
- Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program GenerationLong
- Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoningfinding
- Retrieve to Explain: Evidence-driven Predictions for Explainable Drug Target IdentificationLong
- RetroLLM: Empowering Large Language Models to Retrieve Fine-grained Evidence within GenerationLong
- Retrofitting Large Language Models with Dynamic TokenizationLong
- Retrospective Learning from InteractionsLong
- Revealing Hidden Mechanisms of Cross-Country Content Moderation with Natural Language Processingfinding
- Revealing and Mitigating the Local Pattern Shortcuts of Mambafinding
- Revealing the Deceptiveness of Knowledge Editing: A Mechanistic Analysis of Superficial EditingLong
- Reversal of Thought: Enhancing Large Language Models with Preference-Guided Reverse Reasoning Warm-upLong
- Reverse Preference Optimization for Complex Instruction Followingfinding
- Review-Instruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Modelsfinding
- Revisit Self-Debugging with Self-Generated Tests for Code GenerationLong
- Revisiting 3D LLM Benchmarks: Are We Really Testing 3D Capabilities?finding
- Revisiting Classical Chinese Event Extraction with Ancient Literature InformationLong
- Revisiting Common Assumptions about Arabic Dialects in NLPLong
- Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following AbilityLong
- Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models’ Uncertainty?Short
- Revisiting In-Context Learning with Long Context Language Modelsfinding
- Revisiting LLMs as Zero-Shot Time Series Forecasters: Small Noise Can Break Large ModelsShort
- Revisiting LoRA through the Lens of Parameter Redundancy: Spectral Encoding Helpsfinding
- Revisiting Scaling Laws for Language Models: The Role of Data Quality and Training StrategiesLong
- Revisiting Self-Consistency from Dynamic Distributional Alignment Perspective on Answer Aggregationfinding
- Revisiting Uncertainty Quantification Evaluation in Language Models: Spurious Interactions with Response Length Bias ResultsShort
- Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KLfinding
- Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?Long
- Reviving Cultural Heritage: A Novel Approach for Comprehensive Historical Document RestorationLong
- Reward Generalization in RLHF: A Topological Perspectivefinding
- Rewrite to Jailbreak: Discover Learnable and Transferable Implicit Harmfulness Instructionfinding
- Rhetorical Device-Aware Sarcasm Detection with Counterfactual Data Augmentationfinding
- Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow MatchingLong
- RiOT: Efficient Prompt Refinement with Residual Optimization TreeLong
- Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answeringfinding
- RoCoFT: Efficient Finetuning of Large Language Models with Row-Column UpdatesLong
- RoToR: Towards More Reliable Responses for Order-Invariant InputsLong
- Robust Data Watermarking in Language Models by Injecting Fictitious Knowledgefinding
- Robust Estimation of Population-Level Effects in Repeated-Measures NLP Experimental DesignsLong
- Robust Preference Optimization via Dynamic Target Marginsfinding
- Robust Utility-Preserving Text Anonymization Based on Large Language ModelsLong
- Robust and Minimally Invasive Watermarking for EaaSfinding
- Robustness and Confounders in the Demographic Alignment of LLMs with Human Perceptions of Offensivenessfinding
- RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Followingfinding
- RolePlot: A Systematic Framework for Evaluating and Enhancing the Plot-Progression Capabilities of Role-Playing AgentsLong
- Rolling the DICE on Idiomaticity: How LLMs Fail to Grasp ContextLong
- RomanLens: The Role Of Latent Romanization In Multilinguality In LLMsfinding
- Root Defense Strategies: Ensuring Safety of LLM at the Decoding LevelLong
- RoseRAG: Robust Retrieval-augmented Generation with Small-scale LLMs via Margin-aware Preference Optimizationfinding
- Rubrik’s Cube: Testing a New Rubric for Evaluating Explanations on the CUBE datasetLong
- RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World ScenariosLong
- RuleEdit: Towards Rule-Level Knowledge Generalization to Mitigate Over-Editing in Large Language Modelsfinding
- S-RAG: A Novel Audit Framework for Detecting Unauthorized Use of Personal Data in RAG SystemsLong
- S2R: Teaching LLMs to Self-verify and Self-correct via Reinforcement LearningLong
- S2WTM: Spherical Sliced-Wasserstein Autoencoder for Topic ModelingLong
- S3 - Semantic Signal SeparationLong
- SAKE: Steering Activations for Knowledge EditingLong
- SAM Decoding: Speculative Decoding via Suffix AutomatonLong
- SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models’ Knowledge of Indian Culturefinding
- SARA: Salience-Aware Reinforced Adaptive Decoding for Large Language Models in Abstractive SummarizationLong
- SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkagefinding
- SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human InterventionLong
- SCAR: Data Selection via Style Consistency-Aware Response Ranking for Efficient Instruction-Tuning of Large Language ModelsLong
- SCITAT: A Question Answering Benchmark for Scientific Tables and Text Covering Diverse Reasoning Typesfinding
- SCOP: Evaluating the Comprehension Process of Large Language Models from a Cognitive ViewLong
- SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotationfinding
- SCOPE: Optimizing Key-Value Cache Compression in Long-context GenerationLong
- SCULPT: Systematic Tuning of Long PromptsLong
- SConU: Selective Conformal Uncertainty in Large Language ModelsLong
- SDBench: A Survey-based Domain-specific LLM Benchmarking and Optimization FrameworkLong
- SDD: Self-Degraded Defense against Malicious Fine-tuningLong
- SDPO: Segment-Level Direct Preference Optimization for Social AgentsLong
- SEA-HELM: Southeast Asian Holistic Evaluation of Language Modelsfinding
- SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic EmbeddingsLong
- SEAL: Scaling to Emphasize Attention for Long-Context RetrievalLong
- SECRET: Semi-supervised Clinical Trial Document Similarity SearchLong
- SEE: Continual Fine-tuning with Sequential Ensemble of Expertsfinding
- SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt OptimizationLong
- SEK: Self-Explained Keywords Empower Large Language Models for Code Generationfinding
- SELF-PERCEPT: Introspection Improves Large Language Models’ Detection of Multi-Person Mental Manipulation in ConversationsShort
- SEOE: A Scalable and Reliable Semantic Evaluation Framework for Open Domain Event DetectionLong
- SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?Long
- SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignmentfinding
- SGIC: A Self-Guided Iterative Calibration Framework for RAGLong
- SHARE: An SLM-based Hierarchical Action CorREction Assistant for Text-to-SQLLong
- SHARE: Shared Memory-Aware Open-Domain Long-Term Dialogue Dataset Constructed from Movie ScriptLong
- SHARP: Unlocking Interactive Hallucination via Stance Transfer in Role-Playing LLMsfinding
- SHuBERT: Self-Supervised Sign Language Representation Learning via Multi-Stream Cluster PredictionLong
- SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-TuningLong
- SIKeD: Self-guided Iterative Knowledge Distillation for Mathematical Reasoningfinding
- SINCon: Mitigate LLM-Generated Malicious Message Injection Attack for Rumor DetectionLong
- SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Trainingfinding
- SMART: Self-Aware Agent for Tool Overuse Mitigationfinding
- SOTOPIA-Ω: Dynamic Strategy Injection Learning and Social Instruction Following Evaluation for Social AgentsLong
- SPECTRA: Faster Large Language Model Inference with Optimized Internal and External SpeculationLong
- SPHERE: An Evaluation Card for Human-AI Systemsfinding
- SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical EvaluationLong
- SPICA: Retrieving Scenarios for Pluralistic In-Context Alignmentfinding
- SPILL: Domain-Adaptive Intent Clustering based on Selection and Pooling with Large Language Modelsfinding
- SPOT: Zero-Shot Semantic Parsing Over Property Graphsfinding
- SQL Injection Jailbreak: A Structural Disaster of Large Language Modelsfinding
- SQLForge: Synthesizing Reliable and Diverse Data to Enhance Text-to-SQL Reasoning in LLMsfinding
- SR-LLM: Rethinking the Structured Representation in Large Language ModelLong
- STARS: A Unified Framework for Singing Transcription, Alignment, and Refined Style Annotationfinding
- STATE ToxiCN: A Benchmark for Span-level Target-Aware Toxicity Extraction in Chinese Hate Speech Detectionfinding
- STEM-POM: Evaluating Language Models Math-Symbol Reasoning in Document Parsingfinding
- STORM-BORN: A Challenging Mathematical Derivations Dataset Curated via a Human-in-the-Loop Multi-Agent Frameworkfinding
- STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story Generationfinding
- STRICTA: Structured Reasoning in Critical Text Assessment for Peer Review and BeyondLong
- STUN: Structured-Then-Unstructured Pruning for Scalable MoE PruningLong
- STaR-SQL: Self-Taught Reasoner for Text-to-SQLLong
- STeCa: Step-level Trajectory Calibration for LLM Agent Learningfinding
- SURVEYFORGE : On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey WritingLong
- SWE-Dev: Building Software Engineering Agents with Training and Inference Scalingfinding
- SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolutionfinding
- SYNTHIA: Novel Concept Design with Affordance CompositionLong
- SYNTHVERIFY: Enhancing Zero-Shot Claim Verification through Step-by-Step Synthetic Data Generationfinding
- Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal VerificationLong
- SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilitiesfinding
- SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearningfinding
- SafeLawBench: Towards Safe Alignment of Large Language Modelsfinding
- SafeRAG: Benchmarking Security in Retrieval-Augmented Generation of Large Language ModelLong
- SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Modelsfinding
- Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detectionfinding
- Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to ArtifactsLong
- Safety Alignment via Constrained Knowledge UnlearningLong
- Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safetyfinding
- Same Company, Same Signal: The Role of Identity in Earnings Call Transcriptsfinding
- Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy CompetitionLong
- Sampling-based Pseudo-Likelihood for Membership Inference Attacksfinding
- Sandcastles in the Storm: Revisiting the (Im)possibility of Strong WatermarkingLong
- ScEdit: Script-based Assessment of Knowledge Editingfinding
- Scalable Vision Language Model Training via High Quality Data CurationLong
- ScaleBiO: Scalable Bilevel Optimization for LLM Data ReweightingLong
- Scaling LLMs’ Social Reasoning: Sprinkle Cognitive “Aha Moment” into Fundamental Long-thought Logical Capabilitiesfinding
- Scaling Laws and Efficient Inference for Ternary Language ModelsLong
- Scaling Laws for Multilingual Language Modelsfinding
- Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data GenerationLong
- Scaling up the State Size of RNN LLMs for Long-Context ScenariosLong
- ScanEZ: Integrating Cognitive Models with Self-Supervised Learning for Spatiotemporal Scanpath PredictionShort
- SceneGenAgent: Precise Industrial Scene Generation with Coding AgentLong
- SceneGram: Conceptualizing and Describing Tangrams in Scene Contextfinding
- Sci-LoRA: Mixture of Scientific LoRAs for Cross-Domain Lay Paraphrasingfinding
- SciVer: Evaluating Foundation Models for Multimodal Scientific Claim VerificationLong
- SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problemsfinding
- SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented GenerationLong
- Search-in-Context: Efficient Multi-Hop QA over Long Contexts via Monte Carlo Tree Search with Dynamic KV Retrievalfinding
- Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary ExpansionLong
- See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Modelsfinding
- SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed ScienceLong
- Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Erafinding
- Seeking Rational Demonstrations for Large Language Models: A Domain Generalization Approach to Unsupervised Cross-Domain Keyphrase GenerationShort
- Segment First or Comprehend First? Explore the Limit of Unsupervised Word Segmentation with Large Language ModelsLong
- Segment-Based Attention Masking for GPTsLong
- Segment-Level Diffusion: A Framework for Controllable Long-Form Generation with Diffusion Language ModelsLong
- Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generationfinding
- SelectLLM: Query-Aware Efficient Selection Algorithm for Large Language Modelsfinding
- Selecting Demonstrations for Many-Shot In-Context Learning via Gradient Matchingfinding
- Selecting and Merging: Towards Adaptable and Scalable Named Entity Recognition with Large Language ModelsLong
- Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasksfinding
- Self-Critique Guided Iterative Reasoning for Multi-hop Question Answeringfinding
- Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical ReasoningLong
- Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveationfinding
- Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignmentfinding
- Self-Instructed Derived Prompt Generation Meets In-Context Learning: Unlocking New Potential of Black-Box LLMsLong
- Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalystfinding
- Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generationfinding
- Self-Steering Optimization: Autonomous Preference Optimization for Large Language Modelsfinding
- Self-Taught Agentic Long Context UnderstandingLong
- Self-Training Elicits Concise Reasoning in Large Language Modelsfinding
- Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teachingfinding
- Self-attention-based Graph-of-Thought for Math Problem Solvingfinding
- Self-play through Computational Runtimes improves Chart Reasoningfinding
- Self-supervised Quantized Representation for Seamlessly Integrating Knowledge Graphs with Large Language ModelsLong
- SelfElicit: Your Language Model Secretly Knows Where is the Relevant EvidenceLong
- Semantic Aware Linear Transfer by Recycling Pre-trained Language Models for Cross-lingual Transferfinding
- Semantic Evaluation of Multilingual Data-to-Text Generation via NLI Fine-Tuning: Precision, Recall and F1 scoresfinding
- Semantic Exploration with Adaptive Gating for Efficient Problem Solving with Language ModelsLong
- Semantic Topology: a New Perspective for Communication Style Characterizationfinding
- Semantic-Eval : A Semantic Comprehension Evaluation Framework for Large Language Models Generation without TrainingLong
- SemanticCamo: Jailbreaking Large Language Models through Semantic Camouflagefinding
- Semantics-aware prompting for translating NOtices To AirMenfinding
- Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Modelsfinding
- Sentimental Image Generation for Aspect-based Sentiment Analysisfinding
- Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Modelsfinding
- Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in TransformersLong
- SeqMMR: Sequential Model Merging and LLM Routing for Enhanced Batched Sequential Knowledge Editingfinding
- SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translationfinding
- Serial Lifelong Editing via Mixture of Knowledge ExpertsLong
- Serial Position Effects of Large Language Modelsfinding
- Shadow-Activated Backdoor Attacks on Multimodal Large Language Modelsfinding
- Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language ModelsLong
- Sharper and Faster mean Better: Towards More Efficient Vision-Language Model for Hour-scale Long Video UnderstandingLong
- Sheep’s Skin, Wolf’s Deeds: Are LLMs Ready for Metaphorical Implicit Hate Speech?Long
- ShieldHead: Decoding-time Safeguard for Large Language Modelsfinding
- ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive FrameworkLong
- Shifting from Ranking to Set Selection for Retrieval Augmented GenerationLong
- ShortGPT: Layers in Large Language Models are More Redundant Than You Expectfinding
- Should I Believe in What Medical AI Says? A Chinese Benchmark for Medication Based on Knowledge and ReasoningShort
- Should I Trust You? Detecting Deception in Negotiations using Counterfactual RLfinding
- Sightation Counts: Leveraging Sighted User Feedback in Building a BLV-aligned Dataset of Diagram DescriptionsLong
- Sign2Vis: Automated Data Visualization from Sign Languagefinding
- SignAlignLM: Integrating Multimodal Sign Language Processing into Large Language Modelsfinding
- SignMusketeers: An Efficient Multi-Stream Approach for Sign Language Translation at Scalefinding
- Silencing Empowerment, Allowing Bigotry: Auditing the Moderation of Hate Speech on TwitchLong
- SimGRAG: Leveraging Similar Subgraphs for Knowledge Graphs Driven Retrieval-Augmented Generationfinding
- SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech TranslationLong
- Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine TranslationLong
- Sinhala Encoder-only Language Models and EvaluationLong
- SkillAggregation: Reference-free LLM-Dependent AggregationLong
- SkillVerse : Assessing and Enhancing LLMs with Tree EvaluationLong
- SkyLLM: Cross-LLM-APIs Federation for Cost-effective Query Processingfinding
- Slamming: Training a Speech Language Model on One GPU in a Dayfinding
- Sleepless Nights, Sugary Days: Creating Synthetic Users with Health Conditions for Realistic Coaching Agent Interactionsfinding
- Sliding Windows Are Not the End: Exploring Full Ranking with Long-Context Large Language ModelsLong
- Small Changes, Big Impact: How Manipulating a Few Neurons Can Drastically Alter LLM AggressionLong
- Small Encoders Can Rival Large Decoders in Detecting Groundednessfinding
- Small Models Struggle to Learn from Strong Reasonersfinding
- Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and InferenceLong
- Smarter, Not Harder: Training-Free Adaptive Computation for Transformersfinding
- Smotrom tvoja på ander drogoj verden! Resurrecting Dead Pidgin with Generative Models: Russenorsk Case Studyfinding
- SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-TuningLong
- Social Bias Benchmark for Generation: A Comparison of Generation and QA-Based Evaluationsfinding
- SocialCC: Interactive Evaluation for Cultural Competence in Language AgentsLong
- SocialEval: Evaluating Social Intelligence of Large Language ModelsLong
- Socratic Style Chain-of-Thoughts Help LLMs to be a Better Reasonerfinding
- SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMsLong
- SongComposer: A Large Language Model for Lyric and Melody Generation in Song CompositionLong
- Soundwave: Less is More for Speech-Text Alignment in LLMsLong
- SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic DataLong
- Span-based Semantic Role Labeling as Lexicalized Constituency Tree Parsingfinding
- Sparse Latents Steer Retrieval-Augmented GenerationLong
- Sparse Logit Sampling: Accelerating Knowledge Distillation in LLMsLong
- Sparse Rewards Can Self-Train Dialogue Agentsfinding
- Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMsShort
- Spatial Coordinates as a Cell Language: A Multi-Sentence Framework for Imaging Mass Cytometry Analysisfinding
- Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded DialoguesLong
- Spectral Insights into Data-Oblivious Critical Layers in Large Language Modelsfinding
- Speculative Sampling via Exponential Racesfinding
- Speech Act Patterns for Improving Generalizability of Explainable Politeness Detection Modelsfinding
- SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation MethodsLong
- SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language ModelsLong
- SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Informationfinding
- Speed Up Your Code: Progressive Code Acceleration Through Bidirectional Tree EditingLong
- SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep LayersLong
- Splintering Nonconcatenative Languages for Better Tokenizationfinding
- Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generationfinding
- Spurious Correlations and Beyond: Understanding and Mitigating Shortcut Learning in SDOH Extraction with Large Language ModelsShort
- Squeezed Attention: Accelerating Long Context Length LLM InferenceLong
- StableToolBench-MirrorAPI: Modeling Tool Environments as Mirrors of 7,000+ Real-World APIsfinding
- Standard Quality Criteria Derived from Current NLP Evaluations for Guiding Evaluation Design and Grounding Comparability and AI Compliance Assessmentsfinding
- State-offset Tuning: State-based Parameter-Efficient Fine-Tuning for State Space ModelsShort
- Statement-Tuning Enables Efficient Cross-lingual Generalization in Encoder-only Modelsfinding
- Statistical Deficiency for Task Inclusion EstimationLong
- Statistical inference on black-box generative models in the data kernel perspective spacefinding
- Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion AttackLong
- Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language ModelsLong
- Steering off Course: Reliability Challenges in Steering Language ModelsLong
- Step-by-Step Mastery: Enhancing Soft Constraint Following Ability of Large Language Modelsfinding
- Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Modelsfinding
- Stepwise Reasoning Disruption Attack of LLMsLong
- Stereotype Detection as a Catalyst for Enhanced Bias Detection: A Multi-Task Learning Approachfinding
- Stereotype or Personalization? User Identity Biases Chatbot Recommendationsfinding
- Sticking to the Mean: Detecting Sticky Tokens in Text Embedding ModelsLong
- StitchLLM: Serving LLMs, One Block at a TimeLong
- Stochastic Chameleons: Irrelevant Context Hallucinations Reveal Class-Based (Mis)Generalization in LLMsLong
- Stories that (are) Move(d by) Markets: A Causal Exploration of Market Shocks and Semantic Shifts across Different Partisan Groupsfinding
- Streamlining the Collaborative Chain of Models into A Single Forward Pass in Generation-Based Tasksfinding
- Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectorsfinding
- StrucText-Eval: Evaluating Large Language Model’s Reasoning Ability in Structure-Rich TextLong
- StructFact: Reasoning Factual Knowledge from Structured Data with Large Language Modelsfinding
- StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Followingfinding
- Structural Deep Encoding for Table Question Answeringfinding
- Structural Reasoning Improves Molecular Understanding of LLMLong
- Structure-adaptive Adversarial Contrastive Learning for Multi-Domain Fake News Detectionfinding
- Structure-aware Domain Knowledge Injection for Large Language ModelsLong
- Structured Discourse Representation for Factual Consistency Verificationfinding
- Structured Pruning for Diverse Best-of-N Reasoning Optimizationfinding
- SuLoRA: Subspace Low-Rank Adaptation for Parameter-Efficient Fine-Tuningfinding
- SubLIME: Subset Selection via Rank Correlation Prediction for Data-Efficient LLM EvaluationLong
- Substance over Style: Evaluating Proactive Conversational Coaching AgentsLong
- Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editingLong
- Subword models struggle with word learning, but surprisal hides itShort
- SudoLM: Learning Access Control of Parametric Knowledge with Authorization AlignmentLong
- Summary Factual Inconsistency Detection Based on LLMs Enhanced by Universal Information Extractionfinding
- Supervised Optimism Correction: Be Confident When LLMs Are Surefinding
- Supervised and Unsupervised Probing of Shortcut Learning: Case Study on the Emergence and Evolution of Syntactic Heuristics in BERTfinding
- SurveyPilot: an Agentic Framework for Automated Human Opinion Collection from Social MediaLong
- SwiLTra-Bench: The Swiss Legal Translation BenchmarkLong
- Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive ImagesLong
- SynFix: Dependency-Aware Program Repair via RelationGraph Analysisfinding
- SynGraph: A Dynamic Graph-LLM Synthesis Framework for Sparse Streaming User Sentiment Modelingfinding
- SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge RefinementShort
- SynapticRAG: Enhancing Temporal Memory Retrieval in Large Language Models through Synaptic Mechanismsfinding
- Synergistic Augmentation: Enhancing Cross-Domain Zero-Shot Slot Filling with Small Model-Assisted Large Language Modelsfinding
- Synergistic Weak-Strong Collaboration by Aligning PreferencesLong
- Synergizing LLMs with Global Label Propagation for Multimodal Fake News DetectionLong
- Synergizing Unsupervised Episode Detection with LLMs for Large-Scale News EventsLong
- Syntactic Control of Language Models by Posterior Inferencefinding
- SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMsLong
- Synthesizing Post-Training Data for LLMs through Multi-Agent SimulationLong
- System Prompt Hijacking via Permutation Triggers in LLM Supply Chainsfinding
- Systematic Evaluation of Auto-Encoding and Large Language Model Representations for Capturing Author States and Traitsfinding
- Systematic Generalization in Language Models Scales with Information Entropyfinding
- T-REG: Preference Optimization with Token-Level Reward RegularizationLong
- T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI FeedbackLong
- T2DR: A Two-Tier Deficiency-Resistant Framework for Incomplete Multimodal Learningfinding
- T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive ConceptsLong
- T5Score: A Methodology for Automatically Assessing the Quality of LLM Generated Multi-Document Topic Setsfinding
- TABGEN-ICL: Residual-Aware In-Context Example Selection for Tabular Data Generationfinding
- TACLR: A Scalable and Efficient Retrieval-based Method for Industrial Product Attribute Value IdentificationLong
- TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learningfinding
- TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Modelsfinding
- TARGA: Targeted Synthetic Data Generation for Practical Reasoning over Structured DataLong
- TC-Bench: Benchmarking Temporal Compositionality in Conditional Video Generationfinding
- TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesisfinding
- TC–RAG: Turing–Complete RAG’s Case study on Medical LLM SystemsLong
- TDCSA: LLM-Guided Top-Down Approach for Robust Citation Sentiment Analysisfinding
- TEACH: A Contrastive Knowledge Adaptive Distillation Framework for Classical Chinese UnderstandingLong
- TESS 2: A Large-Scale Generalist Diffusion Language ModelLong
- TETRIS: Optimal Draft Token Selection for Batch Speculative DecodingLong
- THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine TranslationLong
- TRACT: Regression-Aware Fine-tuning Meets Chain-of-Thought Reasoning for LLM-as-a-JudgeLong
- TRANS-ZERO: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Datafinding
- TRATES: Trait-Specific Rubric-Assisted Cross-Prompt Essay Scoringfinding
- TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data SynthesisLong
- TROVE: A Challenge for Fine-Grained Text Provenance via Source Sentence Tracing and Relationship ClassificationLong
- TReMu: Towards Neuro-Symbolic Temporal Reasoning for LLM-Agents with Memory in Multi-Session Dialoguesfinding
- TST: A Schema-Based Top-Down and Dynamic-Aware Agent of Text-to-Table TasksLong
- TUBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuningfinding
- TUMLU: A Unified and Native Language Understanding Benchmark for Turkic LanguagesLong
- TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic VideosLong
- TWIST: Text-encoder Weight-editing for Inserting Secret Trojans in Text-to-Image ModelsLong
- TabXEval: Why this is a Bad Table? An eXhaustive Rubric for Table Evaluationfinding
- Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table ReasoningLong
- TableDreamer: Progressive and Weakness-guided Data Synthesis from Scratch for Table Instruction Tuningfinding
- TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenariosfinding
- TableLoRA: Low-rank Adaptation on Table Structure Understanding for Large Language ModelsLong
- Tag-Evol: Achieving Efficient Instruction Evolving via Tag Injectionfinding
- Tag-Instruct: Controlled Instruction Complexity Enhancement through Structure-based Augmentationfinding
- TagRouter: Learning Route to LLMs through Tags for Open-Domain Text Generation Tasksfinding
- TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimizationfinding
- Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre ModelingLong
- Talking Point based Ideological Discourse Analysis in News Eventsfinding
- Taming LLMs with Gradient GroupingLong
- Taming Language Models for Text-attributed Graph Learning with Decoupled AggregationLong
- Targeted Syntactic Evaluation for Grammatical Error CorrectionLong
- Task Calibration: Calibrating Large Language Models on Inference Tasksfinding
- Task Facet Learning: A Structured Approach To Prompt Optimizationfinding
- Task Knowledge Injection via Interpolations and Reinstatement for Large Language Model Generalizationfinding
- Task-Informed Anti-Curriculum by Masking Improves Downstream Performance on Textfinding
- Task-Oriented Automatic Fact-Checking with Frame-Semanticsfinding
- Task-Specific Information Decomposition for End-to-End Dense Video CaptioningLong
- TaxoAdapt: Aligning LLM-Based Multidimensional Taxonomy Construction to Evolving Research CorporaLong
- Taxonomizing Representational Harms using Speech Act Theoryfinding
- Taxonomy-Driven Knowledge Graph Construction for Domain-Specific Scientific Applicationsfinding
- TeRDy: Temporal Relation Dynamics through Frequency Decomposition for Temporal Knowledge Graph CompletionLong
- Teaching Text Agents to Learn Sequential Decision Making from FailureLong
- Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual QuestionsLong
- Teaching an Old LLM Secure Coding: Localized Preference Optimization on Distilled PreferencesLong
- TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and CompetitionLong
- TechniqueRAG: Retrieval Augmented Generation for Adversarial Technique Annotation in Cyber Threat Intelligence Textfinding
- Tell Me What You Don’t Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editingfinding
- Tell, Don’t Show: Leveraging Language Models’ Abstractive Retellings to Model Literary Themesfinding
- Temporal Relation Extraction in Clinical Texts: A Span-based Graph Transformer ApproachLong
- Temporal reasoning for timeline summarisation in social mediaLong
- TestAgent: An Adaptive and Intelligent Expert for Human Assessmentfinding
- TestNUC: Enhancing Test-Time Computing Approaches and Scaling through Neighboring Unlabeled Data ConsistencyLong
- Text is All You Need: LLM-enhanced Incremental Social Event DetectionLong
- Text-to-ES Bench: A Comprehensive Benchmark for Converting Natural Language to Elasticsearch QueryLong
- Text2World: Benchmarking Large Language Models for Symbolic World Model Generationfinding
- Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answeringfinding
- That doesn’t sound right: Evaluating speech transcription quality in field linguistics corporaShort
- That is Unacceptable: the Moral Foundations of CancelingLong
- The AI Gap: How Socioeconomic Status Affects Language Technology InteractionsLong
- The Alternative Annotator Test for LLM-as-a-Judge: How to Statistically Justify Replacing Human Annotators with LLMsLong
- The Anatomy of Evidence: An Investigation Into Explainable ICD Codingfinding
- The Behavior Gap: Evaluating Zero-shot LLM Agents in Complex Task-Oriented Dialogsfinding
- The Cross-linguistic Role of Animacy in Grammar StructuresLong
- The Devil Is in the Word Alignment Details: On Translation-Based Cross-Lingual Transfer for Token Classification Tasksfinding
- The Distracting Effect: Understanding Irrelevant Passages in RAGLong
- The Effectiveness of Uncased Tokeniziaion for Clinical Notesfinding
- The Efficiency vs. Accuracy Trade-off: Optimizing RAG-Enhanced LLM Recommender Systems Using Multi-Head Early ExitLong
- The Elephant in the Room: Exploring the Role of Neutral Words in Language Model Group-Agnostic Debiasingfinding
- The Esethu Framework: Reimagining Sustainable Dataset Governance and Curation for Low-Resource LanguagesLong
- The Essence of Contextual Understanding in Theory of Mind: A Study on Question Answering with Story CharactersLong
- The Harmonic Structure of Information ContoursLong
- The Hidden Attention of Mamba ModelsLong
- The Impact of Auxiliary Patient Data on Automated Chest X-Ray Report Generation and How to Incorporate ItLong
- The Impact of Large Language Models in Academia: from Writing to Speakingfinding
- The Impact of Name Age Perception on Job Recommendations in LLMsfinding
- The Impact of Token Granularity on the Predictive Power of Language Model SurprisalLong
- The Impossibility of Fair LLMsLong
- The Inverse Scaling Effect of Pre-Trained Language Model Surprisal Is Not Due to Data Leakagefinding
- The Invisible Hand: Unveiling Provider Bias in Large Language Models for Code GenerationLong
- The Knowledge Microscope: Features as Better Analytical Lenses than NeuronsLong
- The Law of Knowledge Overshadowing: Towards Understanding, Predicting and Preventing LLM Hallucinationfinding
- The Lawyer That Never Thinks: Consistency and Fairness as Keys to Reliable AILong
- The Lessons of Developing Process Reward Models in Mathematical Reasoningfinding
- The Lies Characters Tell: Utilizing Large Language Models to Normalize Adversarial Unicode Perturbationsfinding
- The Linguistic Connectivities Within Large Language Modelsfinding
- The Male CEO and the Female Assistant: Evaluation and Mitigation of Gender Biases in Text-To-Image Generation of Dual SubjectsLong
- The Million Authors Corpus: A Cross-Lingual and Cross-Domain Wikipedia Dataset for Authorship Verificationfinding
- The Mirage of Model Editing: Revisiting Evaluation in the WildLong
- The Nature of NLP: Analyzing Contributions in NLP PapersLong
- The Noisy Path from Source to Citation: Measuring How Scholars Engage with Past ResearchLong
- The Reader is the Metric: How Textual Features and Reader Profiles Explain Conflicting Evaluations of AI Creative Writingfinding
- The Reasoning-Memorization Interplay in Language Models Is Mediated by a Single Directionfinding
- The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuningfinding
- The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agentsfinding
- The Role of Abstract Representations and Observed Preferences in the Ordering of Binomials in Large Language ModelsShort
- The Role of Deductive and Inductive Reasoning in Large Language ModelsLong
- The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and InsightsLong
- The Rotary Position Embedding May Cause Dimension Inefficiency in Attention Heads for Long-Distance Retrievalfinding
- The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?finding
- The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systemsfinding
- The Structural Safety Generalization Problemfinding
- The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMsLong
- The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM AgentsLong
- The Threat of PROMPTS in Large Language Models: A System and User Prompt Perspectivefinding
- The Tug of War Within: Mitigating the Fairness-Privacy Conflicts in Large Language ModelsLong
- The Two Paradigms of LLM Detection: Authorship Attribution vs. Authorship Verificationfinding
- The UD-NewsCrawl Treebank: Reflections and Challenges from a Large-scale Tagalog Syntactic Annotation ProjectLong
- The time scale of redundancy between prosody and linguistic contextLong
- Theorem Prover as a Judge for Synthetic Data GenerationLong
- TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem UnderstandingLong
- Theoretical Analysis of Hierarchical Language Recognition and Generation by Transformers without Positional EncodingLong
- Theoretical Guarantees for Minimum Bayes Risk DecodingLong
- Theory of Mind in Large Language Models: Assessment and EnhancementLong
- There’s No Such Thing as Simple Reasoning for LLMsfinding
- They want to pretend not to understand: The Limits of Current LLMs in Interpreting Implicit Content of Political Discoursefinding
- Think Both Ways: Teacher-Student Bidirectional Reasoning Enhances MCQ Generation and Distractor Qualityfinding
- Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinkingfinding
- Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward ModelingLong
- ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrailsfinding
- Thinking Before Running! Efficient Code Generation with Thorough Exploration and Optimal Refinementfinding
- TiC-LM: A Web-Scale Benchmark for Time-Continual LLM PretrainingLong
- TicTac: Time-aware Supervised Fine-tuning for Automatic Text Datingfinding
- TigerLLM - A Family of Bangla Large Language ModelsShort
- Time Course MechInterp: Analyzing the Evolution of Components and Knowledge in Large Language Modelsfinding
- Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifactsfinding
- Time-MQA: Time Series Multi-Task Question Answering with Context EnhancementLong
- TituLLMs: A Family of Bangla LLMs with Comprehensive Benchmarkingfinding
- To Code or not to Code? Adaptive Tool Integration for Math Language Models via Expectation-Maximizationfinding
- TokAlign: Efficient Vocabulary Adaptation via Token AlignmentLong
- Token Prepending: A Training-Free Approach for Eliciting Better Sentence Embeddings from LLMsLong
- Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?finding
- Token-Budget-Aware LLM Reasoningfinding
- Token-level Preference Self-Alignment Optimization for Multi-style Outline Controllable Generationfinding
- TokenShapley: Token Level Context Attribution with Shapley Valuefinding
- Tokenisation is NP-CompleteLong
- Tokenization is Sensitive to Language Variationfinding
- Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Trainingfinding
- Tool learning via Inference-time Scaling and Cycle Verifierfinding
- ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language ModelsLong
- ToolExpNet: Optimizing Multi-Tool Selection in LLMs with Similarity and Dependency-Aware Experience Networksfinding
- ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool UseLong
- ToolSpectrum: Towards Personalized Tool Utilization for Large Language Modelsfinding
- Top-n𝜎: Eliminating Noise in Logit Space for Robust Token Sampling of LLMLong
- Topic Modeling for Short Texts via Optimal Transport-Based Clusteringfinding
- Toward Automatic Discovery of a Canine Phonetic AlphabetLong
- Toward Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)finding
- Toward Structured Knowledge Reasoning: Contrastive Retrieval-Augmented Generation on Experiencefinding
- Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learningfinding
- Towards A “Novel” Benchmark: Evaluating Literary Fiction with Large Language Modelsfinding
- Towards Adapting Open-Source Large Language Models for Expert-Level Clinical Note Generationfinding
- Towards Adaptive Memory-Based Optimization for Enhanced Retrieval-Augmented Generationfinding
- Towards Better Chain-of-Thought: A Reflection on Effectiveness and Faithfulnessfinding
- Towards Better Evaluation for Generated Patent ClaimsLong
- Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environmentsfinding
- Towards Better Value Principles for Large Language Model Alignment: A Systematic Evaluation and EnhancementLong
- Towards Building Large Scale Datasets and State-of-the-Art Automatic Speech Translation Systems for 14 Indian LanguagesLong
- Towards Comprehensive Argument Analysis in Education: Dataset, Tasks, and MethodLong
- Towards Conditioning Clinical Text Generation for User Controlfinding
- Towards Context-Robust LLMs: A Gated Representation Fine-tuning ApproachLong
- Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human StatesLong
- Towards Economical Inference: Enabling DeepSeek’s Multi-Head Latent Attention in Any Transformer-based LLMsLong
- Towards Effective Extraction and Evaluation of Factual ClaimsLong
- Towards Effective and Efficient Continual Pre-training of Large Language ModelsLong
- Towards Efficient LLM Grounding for Embodied Multi-Agent Collaborationfinding
- Towards Enhanced Immersion and Agency for LLM-based Interactive DramaLong
- Towards Explainable Hate Speech Detectionfinding
- Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Frameworkfinding
- Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary PerceptionLong
- Towards Geo-Culturally Grounded LLM GenerationsShort
- Towards Harmonized Uncertainty Estimation for Large Language ModelsLong
- Towards LLM-powered Attentive Listener: A Pragmatic Approach through Quantity Self-RepairShort
- Towards Medical Complex Reasoning with LLMs through Medical Verifiable Problemsfinding
- Towards Multi-dimensional Evaluation of LLM Summarization across Domains and LanguagesLong
- Towards Objective Fine-tuning: How LLMs’ Prior Knowledge Causes Potential Poor Calibration?Long
- Towards Omni-RAG: Comprehensive Retrieval-Augmented Generation for Large Language Models in Medical ApplicationsLong
- Towards Reliable Large Audio Language Modelfinding
- Towards Reward Fairness in RLHF: From a Resource Allocation PerspectiveLong
- Towards Robust ESG Analysis Against Greenwashing Risks: Aspect-Action Analysis with Cross-Category GeneralizationLong
- Towards Robust Universal Information Extraction: Dataset, Evaluation, and SolutionLong
- Towards Robust and Efficient Federated Low-Rank Adaptation with Heterogeneous ClientsLong
- Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creationfinding
- Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddingsfinding
- Towards Style Alignment in Cross-Cultural TranslationLong
- Towards Text-Image Interleaved RetrievalLong
- Towards a Design Guideline for RPA Evaluation: A Survey of Large Language Model-Based Role-Playing Agentsfinding
- Towards a More Generalized Approach in Open Relation ExtractionLong
- Towards the Law of Capacity Gap in Distilling Language ModelsLong
- Towards the Pedagogical Steering of Large Language Models for Tutoring: A Case Study with Modeling Productive Failurefinding
- Tracing and Dissecting How LLMs Recall Factual Knowledge for Real World QuestionsLong
- Tracking Life’s Ups and Downs: Mining Life Events from Social Media Posts for Mental Health AnalysisLong
- Tracr-Injection: Distilling Algorithms into Pre-trained Language Modelsfinding
- Training Bilingual LMs with Data Constraints in the Targeted Languagefinding
- Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum LearningLong
- Training Language Model to Critique for Better Refinementfinding
- Training Long-Context LLMs Efficiently via Chunk-wise Optimizationfinding
- Training Multi-Modal LLMs through Dialogue Planning for HRIfinding
- Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutorsfinding
- Training-free LLM Merging for Multi-task LearningLong
- TransBench: Breaking Barriers for Transferable Graphical User Interface Agents in Dynamic Digital Environmentsfinding
- Transferring Textual Preferences to Vision-Language Understanding through Model MergingShort
- Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translationsfinding
- Translation and Fusion Improves Cross-lingual Information ExtractionLong
- Transparentize the Internal and External Knowledge Utilization in LLMs with Trustworthy Citationfinding
- Tree-KG: An Expandable Knowledge Graph Construction Framework for Knowledge-intensive DomainsLong
- Tree-of-Code: A Self-Growing Tree Framework for End-to-End Code Generation and Execution in Complex Tasksfinding
- Tree-of-Debate: Multi-Persona Debate Trees Elicit Critical Thinking for Scientific Comparative AnalysisLong
- Tree-of-Evolution: Tree-Structured Instruction Evolution for Code Generation in Large Language ModelsLong
- Tree-of-Prompts: Abstracting Control-Flow for Prompt Optimizationfinding
- TreeCut: A Synthetic Unanswerable Math Word Problem Dataset for LLM Hallucination EvaluationShort
- TreeRAG: Unleashing the Power of Hierarchical Storage for Enhanced Knowledge Retrieval in Long Documentsfinding
- TreeRL: LLM Reinforcement Learning with On-Policy Tree SearchLong
- TriEmbed: Bridge the Gap between Text and Token Indices with Embedding Reparameterizationfinding
- Trick or Neat: Adversarial Ambiguity and Language Model Evaluationfinding
- TrimLLM: Progressive Layer Dropping for Domain-Specific LLMsLong
- TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel PlanningLong
- TripTailor: A Real-World Benchmark for Personalized Travel Planningfinding
- TripleFact: Defending Data Contamination in the Evaluation of LLM-driven Fake News DetectionLong
- TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operatorsfinding
- Truth Knows No Language: Evaluating Truthfulness Beyond EnglishLong
- Tunable LLM-based Proactive Recommendation AgentLong
- Turbocharging Web Automation: The Impact of Compressed History Statesfinding
- Turning Conversations into Workflows: A Framework to Extract and Evaluate Dialog Workflows for Service AI Agentsfinding
- Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token RecyclingLong
- Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation RefinementLong
- Typology-Guided Adaptation in Multilingual ModelsLong
- UAQFact: Evaluating Factual Knowledge Utilization of LLMs on Unanswerable Questionsfinding
- UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language ModelsLong
- UBench: Benchmarking Uncertainty in Large Language Models with Multiple Choice Questionsfinding
- UCS-SQL: Uniting Content and Structure for Enhanced Semantic Bridging In Text-to-SQLfinding
- UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesisfinding
- UORA: Uniform Orthogonal Reinitialization Adaptation in Parameter Efficient Fine-Tuning of Large ModelsLong
- UQ-Merge: Uncertainty Guided Multimodal Large Language Model Mergingfinding
- USDC: A Dataset of ̲User ̲Stance and ̲Dogmatism in Long ̲Conversationsfinding
- UTBoost: Rigorous Evaluation of Coding Agents on SWE-BenchLong
- Un-considering Contextual Information: Assessing LLMs’ Understanding of Indexical Elementsfinding
- UnSeenTimeQA: Time-Sensitive Question-Answering Beyond LLMs’ MemorizationLong
- Unanswerability Evaluation for Retrieval Augmented GenerationLong
- Uncertainty Propagation on LLM AgentLong
- Uncertainty Unveiled: Can Exposure to More In-context Examples Mitigate Uncertainty for Large Language Models?finding
- Uncertainty in Causality: A New FrontierLong
- Uncertainty-Aware Contrastive Decodingfinding
- Uncertainty-Aware Iterative Preference Optimization for Enhanced LLM ReasoningLong
- Uncovering Visual-Semantic Psycholinguistic Properties from the Distributional Structure of Text Embedding SpaceLong
- Uncovering the Impact of Chain-of-Thought Reasoning for Direct Preference Optimization: Lessons from Text-to-SQLLong
- Understand User Opinions of Large Language Models via LLM-Powered In-the-Moment User Experience Interviewsfinding
- Understand the Implication: Learning to Think for Pragmatic Understandingfinding
- Understanding Common Ground Misalignment in Goal-Oriented Dialog: A Case-Study with Ubuntu Chat LogsLong
- Understanding Cross-Domain Adaptation in Low-Resource Topic ModelingLong
- Understanding Impact of Human Feedback via Influence FunctionsLong
- Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on ManchuLong
- Understanding Large Language Model Vulnerabilities to Social Bias AttacksLong
- Understanding Silent Data Corruption in LLM TrainingLong
- Understanding and Meeting Practitioner Needs When Measuring Representational Harms Caused by LLM-Based Systemsfinding
- Understanding the Dark Side of LLMs’ Intrinsic Self-CorrectionLong
- Understanding the Gap: an Analysis of Research Collaborations in NLP and Language Documentationfinding
- Understanding the Influence of Synthetic Data for Text Embeddersfinding
- Understanding the Repeat Curse in Large Language Models from a Feature Perspectivefinding
- Uni-Retrieval: A Multi-Style Retrieval Framework for STEM’s EducationLong
- UniCodec: Unified Audio Codec with Single Domain-Adaptive CodebookLong
- UniConv: Unifying Retrieval and Response Generation for Large Language Models in ConversationsLong
- UniICL: An Efficient ICL Framework Unifying Compression, Selection, and GenerationLong
- UniLR: Unleashing the Power of LLMs on Multiple Legal Tasks with a Unified Legal RetrieverLong
- UniRAG: Unified Query Understanding Method for Retrieval Augmented GenerationLong
- UniT: One Document, Many Revisions, Too Many Edit Intention Taxonomiesfinding
- Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion ProcessesLong
- Unifying Uniform and Binary-coding Quantization for Accurate Compression of Large Language ModelsLong
- Unilogit: Robust Machine Unlearning for LLMs Using Uniform-Target Self-Distillationfinding
- Unintended Harms of Value-Aligned LLMs: Psychological and Empirical InsightsLong
- Unique Hard Attention: A Tale of Two SidesShort
- Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillationfinding
- Unleashing LLM Reasoning Capability via Scalable Question Synthesis from ScratchLong
- Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation EngineeringLong
- Unlocking LLMs’ Self-Improvement Capacity with Autonomous Learning for Domain Adaptationfinding
- Unlocking Recursive Thinking of LLMs: Alignment via Refinementfinding
- Unlocking Speech Instruction Data Potential with Query Rewritingfinding
- Unmasking Style Sensitivity: A Causal Analysis of Bias Evaluation Instability in Large Language ModelsLong
- Unraveling LoRA Interference: Orthogonal Subspaces for Robust Model MergingLong
- Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Modelsfinding
- Unraveling the Mechanics of Learning-Based Demonstration Selection for In-Context LearningLong
- Unravelling the Logic: Investigating the Generalisation of Transformers in Numerical Satisfiability ProblemsLong
- UnrealLLM: Towards Highly Controllable and Interactable 3D Scene Generation by LLM-powered Procedural Content Generationfinding
- Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal ModelsLong
- Unsupervised Morphological Tree Tokenizerfinding
- Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language ModelsLong
- Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document RetrievalLong
- Unveiling Attractor Cycles in Large Language Models: A Dynamical Systems View of Successive ParaphrasingLong
- Unveiling Confirmation Bias in Chain-of-Thought Reasoningfinding
- Unveiling Cultural Blind Spots: Analyzing the Limitations of mLLMs in Procedural Text ComprehensionLong
- Unveiling Environmental Impacts of Large Language Model Serving: A Functional Unit ViewLong
- Unveiling Language-Specific Features in Large Language Models via Sparse AutoencodersLong
- Unveiling Privacy Risks in LLM Agent MemoryLong
- Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challengesfinding
- Unveiling and Addressing Pseudo Forgetting in Large Language Modelsfinding
- Unveiling the Key Factors for Distilling Chain-of-Thought Reasoningfinding
- Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forwardfinding
- Unveiling the Potential of BERT-family: A New Recipe for Building Scalable, General and Competitive Large Language ModelsLong
- Unveiling the Power of Source: Source-based Minimum Bayes Risk Decoding for Neural Machine TranslationLong
- Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter MergingLong
- UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban SpacesLong
- User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMsfinding
- User-side Model Consistency Monitoring for Open Source Large Language Models Inference ServicesLong
- Using Information Theory to Characterize Prosodic Typology: The Case of Tone, Pitch-Accent and Stress-AccentLong
- Using Shapley interactions to understand how models use structureLong
- Using Subtext to Enhance Generative IDRRShort
- Utilizing Semantic Textual Similarity for Clinical Survey Data Feature Selectionfinding
- V-ALPHASOCIAL: Benchmark and Self-Reflective Chain-of-Thought Generation for Visual Social Commonsense Reasoningfinding
- V-Oracle: Making Progressive Reasoning in Deciphering Oracle Bones for You and MeLong
- VADE: Visual Attention Guided Hallucination Detection and Eliminationfinding
- VAQUUM: Are Vague Quantifiers Grounded in Visual Data?finding
- VCD: A Dataset for Visual Commonsense Discovery in Imagesfinding
- VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC VideosLong
- VISA: Retrieval Augmented Generation with Visual Source AttributionLong
- VISIAR: Empower MLLM for Visual Story Ideationfinding
- VITAL: A New Dataset for Benchmarking Pluralistic Alignment in HealthcareLong
- VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual CuesLong
- VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a ServiceLong
- VLSBench: Unveiling Visual Leakage in Multimodal SafetyLong
- VMLU Benchmarks: A comprehensive benchmark toolkit for Vietnamese LLMsLong
- VP-MEL: Visual Prompts Guided Multimodal Entity Linkingfinding
- VQAGuider: Guiding Multimodal Large Language Models to Answer Complex Video QuestionsLong
- VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward MechanismLong
- VSCBench: Bridging the Gap in Vision-Language Model Safety Calibrationfinding
- Value Portrait: Assessing Language Models’ Values through Psychometrically and Ecologically Valid ItemsLong
- Value Residual LearningLong
- Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media ContextsLong
- Variable Layerwise Quantization: A Simple and Effective Approach to Quantize LLMsfinding
- Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-trainingLong
- Veracity Bias and Beyond: Uncovering LLMs’ Hidden Beliefs in Problem-Solving ReasoningLong
- Verbosity-Aware Rationale Reduction: Sentence-Level Rationale Reduction for Efficient and Effective Reasoningfinding
- Verify with Caution: The Pitfalls of Relying on Imperfect Factuality Metricsfinding
- Verifying the Steps of Deductive Reasoning Chainsfinding
- ViGiL3D: A Linguistically Diverse Dataset for 3D Visual GroundingLong
- VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generationfinding
- VideoRAG: Retrieval-Augmented Generation over Video Corpusfinding
- VideoVista-CulturalLingo: 360° Horizons-Bridging Cultures, Languages, and Domains in Video ComprehensionLong
- Visibility as Survival: Generalizing NLP for Native Alaskan Language Identificationfinding
- Vision Language Model Helps Private Information De-Identification in Vision Datafinding
- Vision-Language Models Struggle to Align Entities across Modalitiesfinding
- Vision-aided Unsupervised Constituency Parsing with Multi-MLLM Debatingfinding
- Visual Cues Enhance Predictive Turn-Taking for Two-Party Human Interactionfinding
- Visual Evidence Prompting Mitigates Hallucinations in Large Vision-Language ModelsLong
- Visualising Policy-Reward Interplay to Inform Zeroth-Order Preference Optimisation of Large Language Modelsfinding
- VisuoThink: Empowering LVLM Reasoning with Multimodal Tree SearchLong
- Voting or Consensus? Decision-Making in Multi-Agent Debatefinding
- VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language ModelsLong
- Vulnerability of LLMs to Vertically Aligned Text ManipulationsLong
- Vulnerability of Text-to-Image Models to Prompt Template Stealing: A Differential Evolution Approachfinding
- WAFFLE: Fine-tuning Multi-Modal Model for Automated Front-End DevelopmentLong
- WASA: WAtermark-based Source Attribution for Large Language Model-Generated Datafinding
- WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation WatermarksLong
- WMT24++: Expanding the Language Coverage of WMT24 to 55 Languages & Dialectsfinding
- WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Modelsfinding
- Wait, that’s not an option: LLMs Robustness with Incorrect Multiple-Choice OptionsLong
- Walk in Others’ Shoes with a Single Glance: Human-Centric Visual Grounding with Top-View Perspective TransformationLong
- Wanda++: Pruning Large Language Models via Regional Gradientsfinding
- War of Thoughts: Competition Stimulates Stronger Reasoning in Large Language Modelsfinding
- Warmup Generations: A Task-Agnostic Approach for Guiding Sequence-to-Sequence Learning with Unsupervised Initial State GenerationLong
- WarriorCoder: Learning from Expert Battles to Augment Code Large Language ModelsLong
- Watching the Watchers: Exposing Gender Disparities in Machine Translation Quality EstimationLong
- Watermarking Large Language Models: An Unbiased and Low-risk MethodLong
- WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue ModelsLong
- We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?Long
- Weak-to-Strong Honesty Alignment via Learning-to-Rank Supervisionfinding
- Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual ChainsLong
- WebNLG-IT: Construction of an aligned RDF-Italian corpus through Machine Translation techniquesfinding
- WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Codefinding
- WebWalker: Benchmarking LLMs in Web TraversalLong
- Weed Out, Then Harvest: Dual Low-Rank Adaptation is an Effective Noisy Label Detector for Noise-Robust Learningfinding
- Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decodingfinding
- What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient PerspectiveLong
- What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific PresentationsLong
- What Language Do Non-English-Centric Large Language Models Think in?finding
- What Makes a Good Natural Language Prompt?Long
- What Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story EvaluationLong
- What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMsLong
- What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best PracticesLong
- What is Stigma Attributed to? A Theory-Grounded, Expert-Annotated Interview Corpus for Demystifying Mental-Health StigmaLong
- What is in a name? Mitigating Name Bias in Text Embedding Similarity via Anonymizationfinding
ACL accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.