EMNLP 2025 Accepted Papers
The full list of 3,211 papers accepted at EMNLP 2025 (Conference on Empirical Methods in Natural Language Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
accepted: 3,211
- Non-Existent Relationship: Fact-Aware Multi-Level Machine-Generated Text Detectionaccepted
- NormAL LoRA: What is the perfect size?accepted
- NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recoveryaccepted
- NormXLogit: The Head-on-Top Never Liesaccepted
- Not All Features Deserve Attention: Graph-Guided Dependency Learning for Tabular Data Generation with Language Modelsaccepted
- Not All Options Are Created Equal: Textual Option Weighting for Token-Efficient LLM-Based Knowledge Tracingaccepted
- Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performanceaccepted
- Not All Voices Are Rewarded Equally: Probing and Repairing Reward Models across Human Diversityaccepted
- Not Every Token Needs Forgetting: Selective Unlearning Balancing Forgetting and Utility in Large Language Modelsaccepted
- Not Lost After All: How Cross-Encoder Attribution Challenges Position Bias Assumptions in LLM Summarizationaccepted
- Not What the Doctor Ordered: Surveying LLM-based De-identification and Quantifying Clinical Information Lossaccepted
- Not Your Typical Government Tipline: LLM-Assisted Routing of Environmental Protection Agency Citizen Tipsaccepted
- Not-Just-Scaling Laws: Towards a Better Understanding of the Downstream Impact of Language Model Design Decisionsaccepted
- NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contextsaccepted
- Nullspace Disentanglement for Red Teaming Language Modelsaccepted
- OAgents: An Empirical Study of Building Effective Agentsaccepted
- OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Modelsaccepted
- OG-RAG: Ontology-grounded retrieval-augmented generation for large language modelsaccepted
- OMS: On-the-fly, Multi-Objective, Self-Reflective Ad Keyword Generation via LLM Agentaccepted
- ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusionaccepted
- ORPP: Self-Optimizing Role-playing Prompts to Enhance Language Model Capabilitiesaccepted
- OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaborationaccepted
- OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Modelsaccepted
- OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literatureaccepted
- O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversionaccepted
- Offloaded Reasoning: Efficient Inference for Large Language Models via Modular Reasoning and Refinementaccepted
- OkraLong: A Flexible Retrieval-Augmented Framework for Long-Text Question Answeringaccepted
- OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domainaccepted
- OmniThink: Expanding Knowledge Boundaries in Machine Writing through Thinkingaccepted
- On Collaborating Small and Large Models For Few-shot Intent Detectionaccepted
- On Domain-Adaptive Post-Training for Multimodal Large Language Modelsaccepted
- On Guardrail Models’ Robustness to Mutations and Adversarial Attacksaccepted
- On LLM-Based Scientific Inductive Reasoning Beyond Equationsaccepted
- On Pruning State-Space LLMsaccepted
- On Relation-Specific Neurons in Large Language Modelsaccepted
- On the Correspondence between the Squared Norm and Information Content in Text Embeddingsaccepted
- On the Effectiveness of Prompt-Moderated LLMs for Math Tutoring at the Tertiary Levelaccepted
- On the Fine-Grained Planning Abilities of VLM Web Agentsaccepted
- On the Perception Bottleneck of VLMs for Chart Understandingaccepted
- On the Role of Entity and Event Level Conceptualization in Generalizable Reasoning: A Survey of Tasks, Methods, Applications, and Future Directionsaccepted
- On the Role of Model Prior in Real-World Inductive Reasoningaccepted
- On the Same Wavelength? Evaluating Pragmatic Reasoning in Language Models across Broad Conceptsaccepted
- On the Versatility of Sparse Autoencoders for In-Context Learningaccepted
- One More Modality: Does Abstract Meaning Representation Benefit Visual Question Answering?accepted
- One More Question is Enough, Expert Question Decomposition (EQD) Model for Domain Quantitative Reasoningaccepted
- One Planner To Guide Them All ! Learning Adaptive Conversational Planners for Goal-oriented Dialoguesaccepted
- One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systemsaccepted
- OntologyRAG-Q: Resource Development and Benchmarking for Retrieval-Augmented Question Answering in Qur’anic Tafsiraccepted
- Open-DeBias: Toward Mitigating Open-Set Bias in Language Modelsaccepted
- OpenNER 1.0: Standardized Open-Access Named Entity Recognition Datasets in 50+ Languagesaccepted
- OpenTuringBench: An Open-Model-based Benchmark and Framework for Machine-Generated Text Detection and Attributionaccepted
- OptiSeq: Ordering Examples On-The-Fly for In-Context Learningaccepted
- Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metricsaccepted
- Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Modelsaccepted
- Orchestrating Audio: Multi-Agent Framework for Long-Video Audio Synthesisaccepted
- Order Doesn’t Matter, But Reasoning Does: Training LLMs with Order-Centric Augmentationaccepted
- Orthogonal Finetuning Made Scalableaccepted
- Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Framesaccepted
- Out-of-Context Reasoning in Large Language Modelsaccepted
- Over-Generation and Compaction: A Prompting Strategy for Procedural Text Adaptation with Large Language Modelsaccepted
- Overcoming Black-box Attack Inefficiency with Hybrid and Dynamic Select Algorithmsaccepted
- P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMsaccepted
- PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogueaccepted
- PAFT: Prompt-Agnostic Fine-Tuningaccepted
- PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreementsaccepted
- PAMN: Multi-phase Correlation Modeling for Contrast-Enhanced 3D Medical Image Retrievalaccepted
- PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Modelsaccepted
- PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximizationaccepted
- PD3F: A Pluggable and Dynamic DoS-Defense Framework against resource consumption attacks targeting Large Language Modelsaccepted
- PEPE: Long-context Extension for Large Language Models via Periodic Extrapolation Positional Encodingsaccepted
- PERSEVAL: A Framework for Perspectivist Classification Evaluationaccepted
- PICD-Instruct: A Generative Instruction Learning Framework for Few-Shot Multi-Intent Spoken Language Understandingaccepted
- PIIvot: A Lightweight NLP Anonymization Framework for Question-Anchored Tutoring Dialoguesaccepted
- PIP: Perturbation-based Iterative Pruning for Large Language Modelsaccepted
- PLAN-TUNING: Post-Training Language Models to Learn Step-by-Step Planning for Complex Problem Solvingaccepted
- PLLuM-Align: Polish Preference Dataset for Large Language Model Alignmentaccepted
- PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Modelsaccepted
- POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversionaccepted
- PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Modelsaccepted
- POSITION BIAS MITIGATES POSITION BIAS: Mitigate Position Bias Through Inter-Position Knowledge Distillationaccepted
- POW: Political Overton Windows of Large Language Modelsaccepted
- PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillationaccepted
- PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slidesaccepted
- PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancementaccepted
- PRIM: Towards Practical In-Image Multilingual Machine Translationaccepted
- PRIME: Large Language Model Personalization with Cognitive Dual-Memory and Personalized Thought Processaccepted
- PRINCIPLES: Synthetic Strategy Memory for Proactive Dialogue Agentsaccepted
- PRISM: Efficient Long-Range Reasoning With Short-Context LLMsaccepted
- PROOD: A Simple LLM Out-of-Distribution Guardrail Leveraging Response Semanticsaccepted
- PSET: a Phonetics-Semantics Evaluation Testbedaccepted
- PUER: Boosting Few-shot Positive-Unlabeled Entity Resolution with Reinforcement Learningaccepted
- PVTNL: Prompting Vision Transformers with Natural Language for Generalizable Person Re-identificationaccepted
- Paired by the Teacher: Turning Unpaired Data into High-Fidelity Pairs for Low-Resource Text Generationaccepted
- PakBBQ: A Culturally Adapted Bias Benchmark for QAaccepted
- PanicToCalm: A Proactive Counseling Agent for Panic Attacksaccepted
- Parallel Communities Across the Surface Web and the Dark Webaccepted
- Parallel Continuous Chain-of-Thought with Jacobi Iterationaccepted
- ParetoRAG: Leveraging Sentence-Context Attention for Robust and Efficient Retrieval-Augmented Generationaccepted
- Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoningaccepted
- Parsing the Switch: LLM-Based UD Annotation for Complex Code-Switched and Low-Resource Languagesaccepted
- PatentScore: Multi-dimensional Evaluation of LLM-Generated Patent Claimsaccepted
- Path Drift in Large Reasoning Models: How First-Person Commitments Override Safetyaccepted
- Path-enhanced Pre-trained Language Model for Knowledge Graph Completionaccepted
- PathoHR: Hierarchical Reasoning for Vision-Language Models in Pathologyaccepted
- Paths Not Taken: Understanding and Mending the Multilingual Factual Recall Pipelineaccepted
- Pathway to Relevance: How Cross-Encoders Implement a Semantic Variant of BM25accepted
- PathwiseRAG: Multi-Dimensional Exploration and Integration Frameworkaccepted
- Pearl: A Multimodal Culturally-Aware Arabic Instruction Datasetaccepted
- Permitted Knowledge Boundary: Evaluating the Knowledge-Constrained Responsiveness of Large Language Modelsaccepted
- Permutative Preference Alignment from Listwise Ranking of Human Judgmentsaccepted
- Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Researchaccepted
- PersLLM: A Personified Training Approach for Large Language Modelsaccepted
- Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Stylesaccepted
- PersonaGym: Evaluating Persona Agents and LLMsaccepted
- Personality Matters: User Traits Predict LLM Preferences in Multi-Turn Collaborative Tasksaccepted
- Personality Vector: Modulating Personality of Large Language Models by Model Mergingaccepted
- Personalization up to a Point: Why Personalized Content Moderation Needs Boundaries, and How We Can Enforce Themaccepted
- Personalized LLM Decoding via Contrasting Personal Preferenceaccepted
- Personalized Language Models via Privacy-Preserving Evolutionary Model Mergingaccepted
- Personalized Question Answering with User Profile Generation and Compressionaccepted
- Personalized open world plan generation for safety-critical human centered autonomous systems: A case study on Artificial Pancreasaccepted
- Perspective-driven Preference Optimization with Entropy Maximization for Diverse Argument Generationaccepted
- PerspectiveMod: A Perspectivist Resource for Deliberative Moderationaccepted
- Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PDaccepted
- Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Timeaccepted
- PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairsaccepted
- PhonoThink: Improving Large Language Models’ Reasoning on Chinese Phonological Ambiguitiesaccepted
- PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensionsaccepted
- Pi-SQL: Enhancing Text-to-SQL with Fine-Grained Guidance from Pivot Programming Languagesaccepted
- Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit Analysisaccepted
- Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfactsaccepted
- Plan Dynamically, Express Rhetorically: A Debate-Driven Rhetorical Framework for Argumentative Writingaccepted
- PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solvingaccepted
- Planning-Aware Code Infilling via Horizon-Length Predictionaccepted
- Playpen: An Environment for Exploring Learning From Dialogue Game Feedbackaccepted
- Please Translate Again: Two Simple Experiments on Whether Human-Like Reasoning Helps Translationaccepted
- Plugging Schema Graph into Multi-Table QA: A Human-Guided Framework for Reducing LLM Relianceaccepted
- Pluralistic Alignment for Healthcare: A Role-Driven Frameworkaccepted
- Plutus: Benchmarking Large Language Models in Low-Resource Greek Financeaccepted
- PoSum-Bench: Benchmarking Position Bias in LLM-based Conversational Summarizationaccepted
- Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Modelsaccepted
- PolBiX: Detecting LLMs’ Political Bias in Fact-Checking through X-phemismsaccepted
- Polish-English medical knowledge transfer: A new benchmark and resultsaccepted
- PolitiSky24: U.S. Political Bluesky Dataset with User Stance Labelsaccepted
- Polysemantic Dropout: Conformal OOD Detection for Specialized LLMsaccepted
- PoseStitch-SLT: Linguistically Inspired Pose-Stitching for End-to-End Sign Language Translationaccepted
- Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Modelsaccepted
- Position: LLMs Can be Good Tutors in English Educationaccepted
- Post Persona Alignment for Multi-Session Dialogue Generationaccepted
- Post-hoc Study of Climate Microtargeting on Social Media Ads with LLMs: Thematic Insights and Fairness Evaluationaccepted
- Power doesn’t reside in size: A Low Parameter Hybrid Language Model (HLM) for Sentiment Analysis in Code-mixed dataaccepted
- PrAd: Prompt Adaptive Tuning for Decoder-only Language Modelsaccepted
- Pragmatic Inference Chain (PIC) Improving LLMs’ Reasoning of Authentic Implicit Toxic Languageaccepted
- Pre-Storage Reasoning for Episodic Memory: Shifting Inference Burden to Memory for Personalized Dialogueaccepted
- Pre-trained Language Models Learn Remarkably Accurate Representations of Numbersaccepted
- Pre-trained Models Perform the Best When Token Distributions Follow Zipf’s Lawaccepted
- Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignmentaccepted
- PreGenie: An Agentic Framework for High-quality Visual Presentation Generationaccepted
- Precise In-Parameter Concept Erasure in Large Language Modelsaccepted
- Predicate-Guided Generation for Mathematical Reasoningaccepted
- Predicting Language Models’ Success at Zero-Shot Probabilistic Predictionaccepted
- Predicting Prosodic Boundaries for Children’s Textsaccepted
- Preemptive Detection and Correction of Misaligned Actions in LLM Agentsaccepted
- Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoningaccepted
- Presumed Cultural Identity: How Names Shape LLM Responsesaccepted
- PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasksaccepted
- PrimeX: A Dataset of Worldview, Opinion, and Explanationaccepted
- Primus: A Pioneering Collection of Open-Source Datasets for Cybersecurity LLM Trainingaccepted
- Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performanceaccepted
- Prior Prompt Engineering for Reinforcement Fine-Tuningaccepted
- Priority on High-Quality: Selecting Instruction Data via Consistency Verification of Noise Injectionaccepted
- Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agentsaccepted
- ProLongVid: A Simple but Strong Baseline for Long-context Video Instruction Tuningaccepted
- ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrievalaccepted
- ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdomaccepted
- Proactive Assistant Dialogue Generation from Streaming Egocentric Videosaccepted
- Proactive Hearing Assistants that Isolate Egocentric Conversationsaccepted
- Proactive User Information Acquisition via Chats on User-Favored Topicsaccepted
- Probabilistic Soundness Guarantees in LLM Reasoning Chainsaccepted
- Probability Distribution Collapse: A Critical Bottleneck to Compact Unsupervised Neural Grammar Inductionaccepted
- Probing LLM World Models: Enhancing Guesstimation with Wisdom of Crowds Decodingaccepted
- Probing Logical Reasoning of MLLMs in Scientific Diagramsaccepted
- Probing Narrative Morals: A New Character-Focused MFT Framework for Use with Large Language Modelsaccepted
- Probing Political Ideology in Large Language Models: How Latent Political Representations Generalize Across Tasksaccepted
- Probing Semantic Routing in Large Mixture-of-Expert Modelsaccepted
- Probing and Boosting Large Language Models Capabilities via Attention Headsaccepted
- Probing for Arithmetic Errors in Language Modelsaccepted
- Problem Solved? Information Extraction Design Space for Layout-Rich Documents using LLMsaccepted
- ProcVQA: Benchmarking the Effects of Structural Properties in Mined Process Visualizations on Vision–Language Model Performanceaccepted
- ProcWorld: Benchmarking Large Model Planning in Reachability-Constrained Environmentsaccepted
- Procedural Environment Generation for Tool-Use Agentsaccepted
- Process-Supervised Reinforcement Learning for Code Generationaccepted
- Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertiseaccepted
- Profiler: Black-box AI-generated Text Origin Detection via Context-aware Inference Pattern Analysisaccepted
- Profiling LLM’s Copyright Infringement Risks under Adversarial Persuasive Promptingaccepted
- Program of Thoughts for Financial Reasoning: Leveraging Dynamic In-Context Examples and Generative Retrievalaccepted
- Progressive Facial Granularity Aggregation with Bilateral Attribute-based Enhancement for Face-to-Speech Synthesisaccepted
- Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queriesaccepted
- PromptKeeper: Safeguarding System Prompts for LLMsaccepted
- Promptception: How Sensitive Are Large Multimodal Models to Prompts?accepted
- PropRAG: Guiding Retrieval with Beam Search over Proposition Pathsaccepted
- PropXplain: Can LLMs Enable Explainable Propaganda Detection?accepted
- Protein Large Language Models: A Comprehensive Surveyaccepted
- ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answeringaccepted
- ProtoXTM: Cross-Lingual Topic Modeling with Document-Level Prototype-based Contrastive Learningaccepted
- Prototypical Human-AI Collaboration Behaviors from LLM-Assisted Writing in the Wildaccepted
- Proxy Barrier: A Hidden Repeater Layer Defense Against System Prompt Leakage and Jailbreakingaccepted
- PruneCD: Contrasting Pruned Self Model to Improve Decoding Factualityaccepted
- Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMsaccepted
- Pruning the Paradox: How CLIP’s Most Informative Heads Enhance Performance While Amplifying Biasaccepted
- PsyScam: A Benchmark for Psychological Techniques in Real-World Scamsaccepted
- Public Data Assisted Differentially Private In-Context Learningaccepted
- Pun Unintended: LLMs and the Illusion of Humor Understandingaccepted
- PunMemeCN: A Benchmark to Explore Vision-Language Models’ Understanding of Chinese Pun Memesaccepted
- Puzzled by Puzzles: When Vision-Language Models Can’t Take a Hintaccepted
- PychoAgent: Psychology-driven LLM Agents for Explainable Panic Prediction on Social Media during Sudden Disaster Eventsaccepted
- Q-PRM: Adaptive Query Rewriting for Retrieval-Augmented Generation via Step-level Process Supervisionaccepted
- QA‐LIGN: Aligning LLMs through Constitutionally Decomposed QAaccepted
- QCRD: Quality-guided Contrastive Rationale Distillation for Large Language Modelsaccepted
- QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answeringaccepted
- QFrCoLA: a Quebec-French Corpus of Linguistic Acceptability Judgmentsaccepted
- QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Modelsaccepted
- QSpec: Speculative Decoding with Complementary Quantization Schemesaccepted
- QUARTZ: QA-based Unsupervised Abstractive Refinement for Task-oriented Dialogue Summarizationaccepted
- QUIDS: Query Intent Description for Exploratory Search via Dual Space Modelingaccepted
- QUITO-X: A New Perspective on Context Compression from the Information Bottleneck Theoryaccepted
- QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Modelsaccepted
- QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluationaccepted
- QuantAgents: Towards Multi-agent Financial System via Simulated Tradingaccepted
- Quantifying Compositionality of Classic and State-of-the-Art Embeddingsaccepted
- Quantifying Language Disparities in Multilingual Large Language Modelsaccepted
- Quantifying Logical Consistency in Transformers via Query-Key Alignmentaccepted
- Quantifying Uncertainty in Natural Language Explanations of Large Language Models for Question Answeringaccepted
- Quantifying the Risks of LLM- and Tool-assisted Rephrasing to Linguistic Diversityaccepted
- Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMsaccepted
- Query Optimization for Parametric Knowledge Refinement in Retrieval-Augmented Large Language Modelsaccepted
- Query-Focused Retrieval Heads Improve Long-Context Reasoning and Re-rankingaccepted
- R-BPE: Improving BPE-Tokenizers with Token Reuseaccepted
- R-Bind: Unified Enhancement of Attribute and Relation Binding in Text-to-Image Diffusion Modelsaccepted
- R-CHAR: A Metacognition-Driven Framework for Role-Playing in Large Language Modelsaccepted
- R-LoRA: Randomized Multi-Head LoRA for Efficient Multi-task Learningaccepted
- R-PRM: Reasoning-Driven Process Reward Modelingaccepted
- R-TOFU: Unlearning in Large Reasoning Modelsaccepted
- R2A-TLS: Reflective Retrieval-Augmented Timeline Summarization with Causal-Semantic Integrationaccepted
- R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generationaccepted
- R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learningaccepted
- RAC: Efficient LLM Factuality Correction with Retrieval Augmentationaccepted
- RACCooN: Versatile Instructional Video Editing with Auto-Generated Narrativesaccepted
- RACQC: Advanced Retrieval-Augmented Generation for Chinese Query Correctionaccepted
- RAED: Retrieval-Augmented Entity Description Generation for Emerging Entity Linking and Disambiguationaccepted
- RAG+: Enhancing Retrieval-Augmented Generation with Application-Aware Reasoningaccepted
- RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructionsaccepted
- RAG-Zeval: Enhancing RAG Responses Evaluator through End-to-End Reasoning and Ranking-Based Reinforcement Learningaccepted
- RAGferee: Building Contextual Reward Models for Retrieval-Augmented Generationaccepted
- RAISE: Reinforced Adaptive Instruction Selection For Large Language Modelsaccepted
- RALS: Resources and Baselines for Romanian Automatic Lexical Simplificationaccepted
- RAR2: Retrieval-Augmented Medical Reasoning via Thought-Driven Retrievalaccepted
- RAV: Retrieval-Augmented Voting for Tactile Descriptions Without Trainingaccepted
- RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Languageaccepted
- RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMsaccepted
- RBPtool: A Deep Language Model Framework for Multi-Resolution RBP-RNA Binding Prediction and RNA Molecule Designaccepted
- RCScore: Quantifying Response Consistency in Large Language Modelsaccepted
- RD-MCSA: A Multi-Class Sentiment Analysis Approach Integrating In-Context Classification Rationales and Demonstrationsaccepted
- REACT: Representation Extraction And Controllable Tuning to Overcome Overfitting in LLM Knowledge Editingaccepted
- REALM: Recursive Relevance Modeling for LLM-based Document Re-Rankingaccepted
- REAR: Reinforced Reasoning Optimization for Event Argument Extraction with Relation-Aware Supportaccepted
- REARANK: Reasoning Re-ranking Agent via Reinforcement Learningaccepted
- RECALL: REpresentation-aligned Catastrophic-forgetting ALLeviation via Hierarchical Model Mergingaccepted
- RECAST: Retrieval-Augmented Contextual ASR via Decoder-State Keyword Spottingaccepted
- RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistributionaccepted
- REGen: A Reliable Evaluation Framework for Generative Event Argument Extractionaccepted
- RELIC: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examplesaccepted
- RESF: Regularized-Entropy-Sensitive Fingerprinting for Black-Box Tamper Detection of Large Language Modelsaccepted
- RETAIL: Towards Real-world Travel Planning for Large Language Modelsaccepted
- REVIVING YOUR MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model Diffingaccepted
- RG-VQA: Leveraging Retriever-Generator Pipelines for Knowledge Intensive Visual Question Answeringaccepted
- RGAR: Recurrence Generation-augmented Retrieval for Factual-aware Medical Question Answeringaccepted
- RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstructionaccepted
- RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translationaccepted
- RJE: A Retrieval-Judgment-Exploration Framework for Efficient Knowledge Graph Question Answering with LLMsaccepted
- RLAE: Reinforcement Learning-Assisted Ensemble for LLMsaccepted
- RLMEval: Evaluating Research-Level Neural Theorem Provingaccepted
- RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playingaccepted
- ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuningaccepted
- RPDR: A Round-trip Prediction-Based Data Augmentation Framework for Long-Tail Question Answeringaccepted
- RRInf: Efficient Influence Function Estimation via Ridge Regression for Large Language Models and Text-to-Image Diffusion Modelsaccepted
- RTE-GMoE: A Model-agnostic Approach for Relation Triplet Extraction via Graph-based Mixture-of-Expert Mutual Learningaccepted
- RTQA : Recursive Thinking for Complex Temporal Knowledge Graph Question Answering with Large Language Modelsaccepted
- RTTC: Reward-Guided Collaborative Test-Time Computeaccepted
- RaDeR: Reasoning-aware Dense Retrieval Modelsaccepted
- RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routingaccepted
- Radical Allomorphy: Phonological Surface Forms without Phonologyaccepted
- Randomized Smoothing Meets Vision-Language Modelsaccepted
- Randomly Removing 50% of Dimensions in Text Embeddings has Minimal Impact on Retrieval and Classification Tasksaccepted
- Rank-Awareness and Angular Constraints: A New Perspective on Learning Sentence Embeddings from NLI Dataaccepted
- Rapid Word Learning Through Meta In-Context Learningaccepted
- RareSyn: Health Record Synthesis for Rare Disease Diagnosisaccepted
- Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworksaccepted
- Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimizationaccepted
- Re-FRAME the Meeting Summarization SCOPE: Fact-Based Summarization and Personalization via Questionsaccepted
- ReAL: How Can LLMs Simulate the Real Teacher? Retrieval-enhanced Agent for Adaptive Learningaccepted
- ReAgent: Reversible Multi-Agent Reasoning for Knowledge-Enhanced Multi-Hop QAaccepted
- ReAlign: Structured Revision for Small Language Model Alignmentaccepted
- ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimizationaccepted
- ReCoVeR the Target Language: Language Steering without Sacrificing Task Performanceaccepted
- ReDepress: A Cognitive Framework for Detecting Depression Relapse from Social Mediaaccepted
- ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgmentaccepted
- ReFLAIR: Enhancing Multimodal Reasoning via Structured Reflection and Reward-Guided Learningaccepted
- ReGraphRAG: Reorganizing Fragmented Knowledge Graphs for Multi-Perspective Retrieval-Augmented Generationaccepted
- ReLoop: “Seeing Twice and Thinking Backwards” via Closed-loop Training to Mitigate Hallucinations in Multimodal understandingaccepted
- ReMamba: Equip Mamba with Effective Long-Sequence Modelingaccepted
- ReMedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modelingaccepted
- ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuningaccepted
- ReSeeding Latent States for Sequential Language Understandingaccepted
- ReSo: A Reward-driven Self-organizing LLM-based Multi-Agent System for Reasoning Tasksaccepted
- ReTAG: Retrieval-Enhanced, Topic-Augmented Graph-Based Global Sensemakingaccepted
- Read to Hear: A Zero-Shot Pronunciation Assessment Using Textual Descriptions and LLMsaccepted
- Reading Between the Prompts: How Stereotypes Shape LLM’s Implicit Personalizationaccepted
- Real, Fake, or Manipulated? Detecting Machine-Influenced Textaccepted
- Real-World Summarization: When Evaluation Reaches Its Limitsaccepted
- Real-time Ad Retrieval via LLM-generative Commercial Intention for Sponsored Search Advertisingaccepted
- RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenariosaccepted
- Realistic Training Data Generation and Rule Enhanced Decoding in LLM for NameGuessaccepted
- Reason to Rote: Rethinking Memorization in Reasoningaccepted
- ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoningaccepted
- Reasoning Model Unlearning: Forgetting Traces, Not Just Answers, While Preserving Reasoning Skillsaccepted
- Reasoning under Uncertainty: Efficient LLM Inference via Unsupervised Confidence Dilution and Convergent Adaptive Samplingaccepted
- Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Modelsaccepted
- Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreakingaccepted
- RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendationaccepted
- RecGPT: A Foundation Model for Sequential Recommendationaccepted
- Recall with Reasoning: Chain-of-Thought Distillation for Mamba’s Long-Context Memory and Extrapolationaccepted
- Recipe2Plan: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actionsaccepted
- Recognizing Limits: Investigating Infeasibility in Large Language Modelsaccepted
- Recontextualizing Revitalization: A Mixed Media Approach to Reviving the Nüshu Languageaccepted
- Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?accepted
- RedHerring Attack: Testing the Reliability of Attack Detectionaccepted
- RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generationaccepted
- Refined Assessment for Translation Evaluation: Rethinking Machine Translation Evaluation in the Era of Human-Level Systemsaccepted
- Refining Attention for Explainable and Noise-Robust Fact-Checking with Transformersaccepted
- Refining Text Generation for Realistic Conversational Recommendation via Direct Preference Optimizationaccepted
- ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflectionaccepted
- Reflective Agreement: Combining Self-Mixture of Agents with a Sequence Tagger for Robust Event Extractionaccepted
- Reframe Your Life Story: Interactive Narrative Therapist and Innovative Moment Assessment with Large Language Modelsaccepted
- Refusal-Aware Red Teaming: Exposing Inconsistency in Safety Evaluationsaccepted
- Regularized Contrastive Decoding with Hard Negative Samples for LLM Hallucination Mitigationaccepted
- Reimagining Safety Alignment with An Imageaccepted
- Reinforced Query Reasoners for Reasoning-intensive Retrieval Tasksaccepted
- Reinforcement Learning for Large Language Models via Group Preference Reward Shapingaccepted
- Reinforcement Learning with Supervised Alignmentaccepted
- Reliability Crisis of Reference-free Metrics for Grammatical Error Correctionaccepted
- Reliable Evaluation and Benchmarks for Statement Autoformalizationaccepted
- Reliable and Cost-Effective Exploratory Data Analysis via Graph-Guided RAGaccepted
- ReliableEval: A Recipe for Stochastic LLM Evaluation via Method of Momentsaccepted
- RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Modelsaccepted
- Representation Potentials of Foundation Models for Multimodal Alignment: A Surveyaccepted
- Representation-based Broad Hallucination Detectors Fail to Generalize Out of Distributionaccepted
- Representing LLMs in Prompt Semantic Task Spaceaccepted
- ResFormer: All-Time Reservoir Memory for Long Sequence Classificationaccepted
- Rescorla-Wagner Steering of LLMs for Undesired Behaviors over Disproportionate Inappropriate Contextaccepted
- ResearchArena: Benchmarking Large Language Models’ Ability to Collect and Organize Information as Research Agentsaccepted
- Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Modelsaccepted
- Residualized Similarity for Faithfully Explainable Authorship Verificationaccepted
- Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editingaccepted
- Resource-Rational Noisy-Channel Language Processing: Testing the Effect of Algorithmic Constraints on Inferencesaccepted
- Rethink Rumor Detection in the Era of LLMs: A Reviewaccepted
- RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generationaccepted
- Rethinking Backdoor Detection Evaluation for Language Modelsaccepted
- Rethinking Cross-Subject Data Splitting for Brain-to-Text Decodingaccepted
- Rethinking DPO: The Role of Rejected Responses in Preference Misalignmentaccepted
- Rethinking Data Selection at Scale: Random Selection is Almost All You Needaccepted
- Rethinking LLM Uncertainty: A Multi-Agent Approach to Estimating Black-Box Model Uncertaintyaccepted
- Rethinking LLM-Based Recommendations: A Personalized Query-Driven Parallel Integrationaccepted
- Rethinking NLP for Chemistry: A Critical Look at the USPTO Benchmarkaccepted
- Rethinking Personality Assessment from Human-Agent Dialogues: Fewer Rounds May Be Better Than Moreaccepted
- Rethinking Sign Language Translation: The Impact of Signer Dependence on Model Evaluationaccepted
- Rethinking Text-based Protein Understanding: Retrieval or LLM?accepted
- Retracing the Past: LLMs Emit Training Data When They Get Lostaccepted
- Retrieval Augmented Generation based context discovery for ASRaccepted
- Retrieval Enhanced Feedback via In-context Neural Error-bookaccepted
- Retrieval over Classification: Integrating Relation Semantics for Multimodal Relation Extractionaccepted
- Retrieval-Augmented Generation with Estimation of Source Reliabilityaccepted
- Retrieval-Augmented Generation with Hierarchical Knowledgeaccepted
- Retrieval-Augmented Language Models are Mimetic Theorem Proversaccepted
- Retrieval-Augmented Machine Translation with Unstructured Knowledgeaccepted
- Retrieval-augmented GUI Agents with Generative Guidelinesaccepted
- Retrieving Support to Rank Answers in Open-Domain Question Answeringaccepted
- RevPRAG: Revealing Poisoning Attacks in Retrieval-Augmented Generation through LLM Activation Analysisaccepted
- Reveal and Release: Iterative LLM Unlearning with Self-generated Dataaccepted
- Revealing and Mitigating the Challenge of Detecting Character Knowledge Errors in LLM Role-Playingaccepted
- Revealing the Inherent Instructability of Pre-Trained Language Modelsaccepted
- Revealing the impact of synthetic native samples and multi-tasking strategies in Hindi-English code-mixed humour and sarcasm detectionaccepted
- Reverse Prompt Engineering: A Zero-Shot, Genetic Algorithm Approach to Language Model Inversionaccepted
- ReviewEval: An Evaluation Framework for AI-Generated Reviewsaccepted
- ReviewRL: Towards Automated Scientific Review with RLaccepted
- Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shotaccepted
- Revisiting LLM Value Probing Strategies: Are They Robust and Expressive?accepted
- Revisiting Pruning vs Quantization for Small Language Modelsaccepted
- Reward Mixology: Crafting Hybrid Signals for Reinforcement Learning Driven In-Context Learningaccepted
- Reward Model Perspectives: Whose Opinions Do Reward Models Reward?accepted
- Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligneraccepted
- Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMsaccepted
- RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesisaccepted
- Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpeningaccepted
- RiTTA: Modeling Event Relations in Text-to-Audio Generationaccepted
- Riemannian Optimization for LoRA on the Stiefel Manifoldaccepted
- RingFormer: Rethinking Recurrent Transformer with Adaptive Level Signalsaccepted
- RoDEval: A Robust Word Sense Disambiguation Evaluation Framework for Large Language Modelsaccepted
- RoT: Enhancing Table Reasoning with Iterative Row-Wise Traversalsaccepted
- Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detectionaccepted
- Robust Knowledge Editing via Explicit Reasoning Chains for Distractor-Resilient Multi-Hop QAaccepted
- Robust Native Language Identification through Agentic Decompositionaccepted
- Role-Guided Annotation and Prototype-Aligned Representation Learning for Historical Literature Sentiment Classificationaccepted
- Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizeraccepted
- Route Sparse Autoencoder to Interpret Large Language Modelsaccepted
- Router-Tuning: A Simple and Effective Approach for Dynamic Depthaccepted
- RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMsaccepted
- RuCCoD: Towards Automated ICD Coding in Russianaccepted
- Rule Discovery for Natural Language Inference Data Generation Using Out-of-Distribution Detectionaccepted
- Rule-Guided Extraction: A Hierarchical Rule Optimization Framework for Document-Level Event Argument Extractionaccepted
- Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environmentsaccepted
- Rust-doctor: Enhanced Feature for Rust Ownership and Lifetime Repair with Balanced Training Data Generationaccepted
- S*: Test Time Scaling for Code Generationaccepted
- S2LPP: Small-to-Large Prompt Prediction across LLMsaccepted
- SA-CLIP: Language Guided Image Spatial and Action Feature Learningaccepted
- SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connectionaccepted
- SACL: Understanding and Combating Textual Bias in Code Retrieval with Semantic-Augmented Reranking and Localizationaccepted
- SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Modelsaccepted
- SAEs Are Good for Steering – If You Select the Right Featuresaccepted
- SAFE-SQL: Self-Augmented In-Context Learning with Fine-grained Example Selection for Text-to-SQLaccepted
- SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMsaccepted
- SAFE: Schema-Driven Approximate Distance Join for Efficient Knowledge Graph Queryingaccepted
- SAFENUDGE: Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offsaccepted
- SAKI-RAG: Mitigating Context Fragmentation in Long-Document RAG via Sentence-level Attention Knowledge Integrationaccepted
- SAMULE: Self-Learning Agents Enhanced by Multi-level Reflectionaccepted
- SAND: Boosting LLM Agents with Self-Taught Action Deliberationaccepted
- SATBench: Benchmarking LLMs’ Logical Reasoning via Automated Puzzle Generation from SAT Formulasaccepted
- SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascadingaccepted
- SCDTour: Embedding Axis Ordering and Merging for Interpretable Semantic Change Detectionaccepted
- SCE: Semantic Consistency Enhanced Reinforcement Learning for Multi-Hop Knowledge Graph Reasoningaccepted
- SCRIBE: Structured Chain Reasoning for Interactive Behaviour Explanations using Tool Callingaccepted
- SCoder: Progressive Self-Distillation for Bootstrapping Small-Scale Data Synthesizers to Empower Code LLMsaccepted
- SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Modelsaccepted
- SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMsaccepted
- SEAL: Structure and Element Aware Learning Improves Long Structured Document Retrievalaccepted
- SEKE: Specialised Experts for Keyword Extractionaccepted
- SEMMA: A Semantic Aware Knowledge Graph Foundation Modelaccepted
- SENTRA: Selected-Next-Token Transformer for LLM Text Detectionaccepted
- SEPS: A Separability Measure for Robust Unlearning in LLMsaccepted
- SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Modelsaccepted
- SGCD: Subtask-Guided Causal-Debiasing Framework for Robust Cross-Utterance Sentiment Quadruple Extraction in Dialoguesaccepted
- SHARP: Steering Hallucination in LVLMs via Representation Engineeringaccepted
- SHIFT: Selected Helpful Informative Frame for Video-guided Machine Translationaccepted
- SIFT: Grounding LLM Reasoning in Contexts via Stickersaccepted
- SIMBA UQ: Similarity-Based Aggregation for Uncertainty Quantification in Large Language Modelsaccepted
- SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMsaccepted
- SKRAG: A Retrieval-Augmented Generation Framework Guided by Reasoning Skeletons over Knowledge Graphsaccepted
- SLIM: Subtrajectory-Level Elimination for More Effective Reasoningaccepted
- SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impactsaccepted
- SLiNT: Structure-aware Language Model with Injection and Contrastive Training for Knowledge Graph Completionaccepted
- SLlama: Parameter-Efficient Language Model Architecture for Enhanced Linguistic Competence Under Strict Data Constraintsaccepted
- SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Modelsaccepted
- SMART: Simulated Students Aligned with Item Response Theory for Question Difficulty Predictionaccepted
- SMARTMiner: Extracting and Evaluating SMART Goals from Low-Resource Health Coaching Notesaccepted
- SMEC:Rethinking Matryoshka Representation Learning for Retrieval Embedding Compressionaccepted
- SNaRe: Domain-aware Data Generation for Low-Resource Event Detectionaccepted
- SOCIAL SCAFFOLDS: A Generalization Framework for Social Understanding Tasksaccepted
- SOLAR: Serendipity Optimized Language Model Aligned for Recommendationaccepted
- SOLAR: Towards Characterizing Subjectivity of Individuals through Modeling Value Conflicts and Trade-offsaccepted
- SOPL: A Sequential Optimal Learning Approach to Automated Prompt Engineering in Large Language Modelsaccepted
- SPARK: Simulating the Co-evolution of Stance and Topic Dynamics in Online Discourse with LLM-based Agentsaccepted
- SPE Attention: Making Attention Equivariant to Semantic-Preserving Permutation for Code Processingaccepted
- SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluationaccepted
- SPFT-SQL: Enhancing Large Language Model for Text-to-SQL Parsing by Self-Play Fine-Tuningaccepted
- SPIRIT: Patching Speech Language Models against Jailbreak Attacksaccepted
- SPO: Self Preference Optimization with Self Regularizationaccepted
- SPPD: Self-training with Process Preference Learning Using Dynamic Value Marginaccepted
- SPaRC: A Spatial Pathfinding Reasoning Challengeaccepted
- SQLSpace: A Representation Space for Text-to-SQL to Discover and Mitigate Robustness Gapsaccepted
- SQLWOZ: A Realistic Task-Oriented Dialogue Dataset with SQL-Based Dialogue State Representation for Complex User Requirementsaccepted
- SQUAB: Evaluating LLM robustness to Ambiguous and Unanswerable Questions in Semantic Parsingaccepted
- SQUARE: Unsupervised Retrieval Adaptation via Synthetic Dataaccepted
- SQUiD: Synthesizing Relational Databases from Unstructured Textaccepted
- SRM-LLM: Semantic Relationship Mining with LLMs for Temporal Knowledge Graph Extrapolationaccepted
- SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?accepted
- SSA: Semantic Contamination of LLM-Driven Fake News Detectionaccepted
- STA-CoT: Structured Target-Centric Agentic Chain-of-Thought for Consistent Multi-Image Geological Reasoningaccepted
- STARE at the Structure: Steering ICL Exemplar Selection with Structural Alignmentaccepted
- STARQA: A Question Answering Dataset for Complex Analytical Reasoning over Structured Databasesaccepted
- START: Self-taught Reasoner with Toolsaccepted
- STEAM: A Semantic-Level Knowledge Editing Framework for Large Language Modelsaccepted
- STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Modelsaccepted
- STRICT: Stress-Test of Rendering Image Containing Textaccepted
- SUA: Stealthy Multimodal Large Language Model Unlearning Attackaccepted
- SUE: Sparsity-based Uncertainty Estimation via Sparse Dictionary Learningaccepted
- SURE: Safety Understanding and Reasoning Enhancement for Multimodal Large Language Modelsaccepted
- SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditionsaccepted
- SWAM: Adaptive Sliding Window and Memory-Augmented Attention Model for Rumor Detectionaccepted
- SWAN: An Efficient and Scalable Approach for Long-Context Language Modelingaccepted
- SYNC: A Synthetic Long-Context Understanding Benchmark for Controlled Comparisons of Model Capabilitiesaccepted
- SaCa: A Highly Compatible Reinforcing Framework for Knowledge Graph Embedding via Structural Pattern Contrastaccepted
- SafeConf: A Confidence-Calibrated Safety Self-Evaluation Method for Large Language Modelsaccepted
- SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Interventionaccepted
- SafeKey: Amplifying Aha-Moment Insights for Safety Reasoningaccepted
- SafeScientist: Enhancing AI Scientist Safety for Risk-Aware Scientific Discoveryaccepted
- SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signalsaccepted
- SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMsaccepted
- Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Mergingaccepted
- Safeguarding Privacy of Retrieval Data against Membership Inference Attacks: Is This Query Too Close to Home?accepted
- Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Modelsaccepted
- Safety in Large Reasoning Models: A Surveyaccepted
- SalaMAnder: Shapley-based Mathematical Expression Attribution and Metric for Chain-of-Thought Reasoningaccepted
- Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioningaccepted
- Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustnessaccepted
- Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Modelsaccepted
- Sample Efficient Alignment Learning With Episodic Controlaccepted
- SampleMix: A Sample-wise Pre-training Data Mixing Strategy by Coordinating Data Quality and Diversityaccepted
- Sarcasm-R1: Enhancing Sarcasm Detection through Focused Reasoningaccepted
- Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Modelsaccepted
- Scalable Data Synthesis through Human-like Cognitive Imitation and Data Recombinationaccepted
- Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaborationaccepted
- Scale Down to Speed Up: Dynamic Data Selection for Reinforcement Learningaccepted
- Scaling Laws Are Unreliable for Downstream Tasks: A Reality Checkaccepted
- Scaling Low-Resource MT via Synthetic Data Generation with LLMsaccepted
- Scaling Rich Style-Prompted Text-to-Speech Datasetsaccepted
- Scaling Up Temporal Domain Generalization via Temporal Experts Averagingaccepted
- Schema Generation for Large Knowledge Graphs Using Large Language Modelsaccepted
- ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contextsaccepted
- SciCompanion: Graph-Grounded Reasoning for Structured Evaluation of Scientific Argumentsaccepted
- SciEvent: Benchmarking Multi-domain Scientific Event Extractionaccepted
- SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLPaccepted
- SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literatureaccepted
- Scientific Paper Retrieval with LLM-Guided Semantic-Based Rankingaccepted
- SeMob: Semantic Synthesis for Dynamic Urban Mobility Predictionaccepted
- SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Modelsaccepted
- Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertaintyaccepted
- Search-o1: Agentic Search-Enhanced Large Reasoning Modelsaccepted
- Searching for the Most Human-like Emergent Languageaccepted
- SecDecoding: Steerable Decoding for Safer LLM Generationaccepted
- Section-Level Simplification of Biomedical Abstractsaccepted
- Seeing Culture: A Benchmark for Visual Reasoning and Groundingaccepted
- Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressorsaccepted
- Seeing Race, Feeling Bias: Emotion Stereotyping in Multimodal Language Modelsaccepted
- Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Modelsaccepted
- Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Modelsaccepted
- Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generationaccepted
- Seeing the Same Story Differently: Framing‐Divergent Event Coreference for Computational Framing Analysisaccepted
- Select to Know: An Internal-External Knowledge Self-Selection Framework for Domain-Specific Question Answeringaccepted
- Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Modelsaccepted
- Selective Preference Optimization via Token-Level Reward Function Estimationaccepted
- Self-Adjust Softmaxaccepted
- Self-Augmented Preference Alignment for Sycophancy Reduction in LLMsaccepted
- Self-Correcting Code Generation Using Small Language Modelsaccepted
- Self-Correction Makes LLMs Better Parsersaccepted
- Self-Critique and Refinement for Faithful Natural Language Explanationsaccepted
- Self-Ensemble: Mitigating Confidence Distortion for Large Language Modelsaccepted
- Self-Guided Function Calling in Large Language Models via Stepwise Experience Recallaccepted
- Self-Improvement in Multimodal Large Language Models: A Surveyaccepted
- Self-Supervised Prompt Optimizationaccepted
- Self-Training Large Language Models with Confident Reasoningaccepted
- Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenariosaccepted
- SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignmentaccepted
- SelfRACG: Enabling LLMs to Self-Express and Retrieve for Code Generationaccepted
- SemCSE: Semantic Contrastive Sentence Embeddings Using LLM-Generated Summaries For Scientific Abstractsaccepted
- SemVink: Advancing VLMs’ Semantic Understanding of Optical Illusions via Visual Global Thinkingaccepted
- Semantic Component Analysis: Introducing Multi-Topic Distributions to Clustering-Based Topic Modelingaccepted
- Semantic Contribution-Aware Adaptive Retrieval for Black-Box Modelsaccepted
- Semantic Geometry of Sentence Embeddingsaccepted
- Semantic Inversion, Identical Replies: Revisiting Negation Blindness in Large Language Modelsaccepted
- Semantic Networks Extracted from Students’ Think-Aloud Data are Correlated with Students’ Learning Performanceaccepted
- Semantic-Aware Action Space Compression via LLM-DRL Synergy for Efficient Task-oriented Dialogue Policy Explorationaccepted
- SenDetEX: Sentence-Level AI-Generated Text Detection for Human-AI Hybrid Content via Style and Context Fusionaccepted
- Sensitivity-LoRA : Low-Load Sensitivity-Based Fine-Tuning for Large Language Modelsaccepted
- SensorLLM: Aligning Large Language Models with Motion Sensors for Human Activity Recognitionaccepted
- Sentence Smith: Controllable Edits for Evaluating Text Embeddingsaccepted
- Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generationaccepted
- Sequence Structure Aware Retriever for Procedural Document Retrieval: A New Dataset and Baselineaccepted
- Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contextsaccepted
- Shallow Focus, Deep Fixes: Enhancing Shallow Layers Vision Attention Sinks to Alleviate Hallucination in LVLMsaccepted
- Shared Path: Unraveling Memorization in Multilingual LLMs through Language Similaritiesaccepted
- Sheaf Discovery with Joint Computation Graph Pruning and Flexible Granularityaccepted
- SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflectionaccepted
- Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translationaccepted
- Side Effects of Erasing Concepts from Diffusion Modelsaccepted
- SilVar: Speech-Driven Multimodal Model for Reasoning Visual Question Answering and Object Localizationaccepted
- SimBA: Simplifying Benchmark Analysis Using Performance Matrices Aloneaccepted
- SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Modelsaccepted
- SimVBG: Simulating Individual Values by Backstory Generationaccepted
- Similarity = Value? Consultation Value-Assessment and Alignment for Personalized Searchaccepted
- Simple Factuality Probes Detect Hallucinations in Long-Form Natural Language Generationaccepted
- Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantificationaccepted
- SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesisaccepted
- SimpleDoc: Multi‐Modal Document Understanding with Dual‐Cue Page Retrieval and Iterative Refinementaccepted
- Simulating Identity, Propagating Bias: Abstraction and Stereotypes in LLM-Generated Textaccepted
- SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?accepted
- Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimizationaccepted
- SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhalaaccepted
- Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluationaccepted
- Skeletons Matter: Dynamic Data Augmentation for Text-to-Queryaccepted
- Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketchingaccepted
- SkewRoute: Training-Free LLM Routing for Knowledge Graph Retrieval-Augmented Generation via Score Skewness of Retrieved Contextaccepted
- Skip-Thinking: Chunk-wise Chain-of-Thought Distillation Enable Smaller Language Models to Reason Better and Fasteraccepted
- SliceMoE: Routing Embedding Slices Instead of Tokens for Fine-Grained and Balanced Transformer Scalingaccepted
- SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Designaccepted
- Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistencyaccepted
- Small Models, Big Results: Achieving Superior Intent Extraction through Decompositionaccepted
- Smart-Searcher: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learningaccepted
- SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?accepted
- SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Modelsaccepted
- Social Bias Evaluation for Large Language Models Requires Prompt Variationsaccepted
- Social Bias in Multilingual Language Models: A Surveyaccepted
- Social Genome: Grounded Social Reasoning Abilities of Multimodal Modelsaccepted
- Social Good or Scientific Curiosity? Uncovering the Research Framing Behind NLP Artefactsaccepted
- SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Modelsaccepted
- Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questionsaccepted
- Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Modelsaccepted
- SolEval: Benchmarking Large Language Models for Repository-level Solidity Smart Contract Generationaccepted
- Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignmentaccepted
- SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Modelsaccepted
- Source-primed Multi-turn Conversation Helps Large Language Models Translate Documentsaccepted
- Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoningaccepted
- Sparse Activation Editing for Reliable Instruction Following in Narrativesaccepted
- Sparse Autoencoder Features for Classifications and Transferabilityaccepted
- Sparse Neurons Carry Strong Signals of Question Ambiguity in LLMsaccepted
- SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masksaccepted
- Sparsifying Mambaaccepted
- Sparsity May Be All You Need: Sparse Random Parameter Adaptationaccepted
- Spatial Layouts in News Homepages Capture Human Preferencesaccepted
- Speaking at the Right Level: Literacy-Controlled Counterspeech Generation with RAG-RLaccepted
- Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptanceaccepted
- SpecCoT: Accelerating Chain-of-Thought Reasoning through Speculative Explorationaccepted
- SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruningaccepted
- Spectral Scaling Laws in Language Models: emphHow Effectively Do Feed-Forward Networks Use Their Latent Space?accepted
- Speculating LLMs’ Chinese Training Data Pollution from Their Tokensaccepted
- Speculative Decoding for Multi-Sample Inferenceaccepted
- Speculative Safety-Aware Decodingaccepted
- Speculative Streaming: Efficient and Scalable Speculative Decoding with Multi-Stream Attentionaccepted
- Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMsaccepted
- Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documentsaccepted
- Spelling-out is not Straightforward: LLMs’ Capability of Tokenization from Token to Charactersaccepted
- Spiral of Silence in Large Language Model Agentsaccepted
- Split-Merge: Scalable and Memory-Efficient Merging of Expert LLMsaccepted
- Spoken Document Retrieval for an Unwritten Language: A Case Study on Gormatiaccepted
- Spontaneous Giving and Calculated Greed in Language Modelsaccepted
- SportReason: Evaluating Retrieval-Augmented Reasoning across Tables and Text for Sports Question Answeringaccepted
- Spotlighter: Revisiting Prompt Tuning from a Representative Mining Viewaccepted
- Staged Knowledge Distillation Through Least-to-Most Prompting: Optimizing Teacher Guidance via Difficulty-Aware Trainingaccepted
- Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experienceaccepted
- StandUp4AI: A New Multilingual Dataset for Humor Detection in Stand-up Comedy Videosaccepted
- Static Word Embeddings for Sentence Semantic Representationaccepted
- Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answeringaccepted
- Statistical and Neural Methods for Hawaiian Orthography Modernizationaccepted
- StatsChartMWP: A Dataset for Evaluating Multimodal Mathematical Reasoning Abilities on Math Word Problems with Statistical Chartsaccepted
- SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Modelsaccepted
- Steering LLM Reasoning Through Bias-Only Adaptationaccepted
- Steering LVLMs via Sparse Autoencoder for Hallucination Mitigationaccepted
- Steering Language Models in Multi-Token Generation: A Case Study on Tense and Aspectaccepted
- Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoningaccepted
- Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Modelsaccepted
- StepER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Modelsaccepted
- StepKE: Stepwise Knowledge Editing for Multi-Hop Question Answeringaccepted
- StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimizationaccepted
- Stepwise Informativeness Search for Improving LLM Reasoningaccepted
- Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs’ Reasoningaccepted
- StereoDetect: Detecting Stereotypes and Anti-stereotypes the Correct Way Using Social Psychological Underpinningsaccepted
- Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Frameworkaccepted
- Stimulate the Critical Thinking of LLMs via Debiasing Discussionaccepted
- Stop Looking for “Important Tokens” in Multimodal Language Models: Duplication Matters Moreaccepted
- Stop Playing the Guessing Game! Evaluating Conversational Recommender Systems via Target-free User Simulationaccepted
- Stratified Selective Sampling for Instruction Tuning with Dedicated Scoring Strategyaccepted
- Stress-Testing the Reasoning Competence of Language Models With Formal Proofsaccepted
- Stronger Baselines for Retrieval-Augmented Generation with Long-Context Language Modelsaccepted
- StructuThink: Reasoning with Task Transition Knowledge for Autonomous LLM-Based Agentsaccepted
- Structural Patent Classification Using Label Hierarchy Optimizationaccepted
- Structure Trumps Size: Rethinking Data Quality for LLM Reasoningaccepted
- Structure-Conditional Minimum Bayes Risk Decodingaccepted
- Structure-aware Propagation Generation with Large Language Models for Fake News Detectionaccepted
- Structured Moral Reasoning in Language Models: A Value-Grounded Evaluation Frameworkaccepted
- Structured Preference Optimization for Vision-Language Long-Horizon Task Planningaccepted
- Structuring Radiology Reports: Challenging LLMs with Lightweight Modelsaccepted
- Studying Rhetorically Ambiguous Questionsaccepted
- Studying the Role of Input-Neighbor Overlap in Retrieval-Augmented Language Models Training Efficiencyaccepted
- SuPreME: A Supervised Pre-training Framework for Multimodal ECG Representation Learningaccepted
- SubDocTrans: Enhancing Document-level Machine Translation with Plug-and-play Multi-granularity Knowledge Augmentationaccepted
- Subjective Behaviors and Preferences in LLM: Language of Browsingaccepted
- Subtle Risks, Critical Failures: A Framework for Diagnosing Physical Safety of LLMs for Embodied Decision Makingaccepted
- Sugar-Coated Poison: Benign Generation Unlocks Jailbreakingaccepted
- Summarize-Exemplify-Reflect: Data-driven Insight Distillation Empowers LLMs for Few-shot Tabular Classificationaccepted
- Summarizing Speech: A Comprehensive Surveyaccepted
- Superficial Self-Improved Reasoners Benefit from Model Mergingaccepted
- Superpose Task-specific Features for Model Mergingaccepted
- Supervised Attention Mechanism for Low-quality Multimodal Dataaccepted
- Surge: On the Potential of Large Language Models as General-Purpose Surrogate Code Executorsaccepted
- Surprise Calibration for Better In-Context Learningaccepted
- SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Modelsaccepted
- SwarmAgentic: Towards Fully Automated Agentic System Generation via Swarm Intelligenceaccepted
- SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformationaccepted
- SwiftPrune: Hessian-Free Weight Pruning for Large Language Modelsaccepted
- Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectoriesaccepted
- SynC-LLM: Generation of Large-Scale Synthetic Circuit Code with Hierarchical Language Modelsaccepted
- Synergizing Multimodal Temporal Knowledge Graphs and Large Language Models for Social Relation Recognitionaccepted
- Syntax-Aware Retrieval Augmentation for Neural Symbolic Regressionaccepted
- Synth-SBDH: A Synthetic Dataset of Social and Behavioral Determinants of Health for Clinical Textaccepted
- Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamicsaccepted
- T-MAD: Target-driven Multimodal Alignment for Stance Detectionaccepted
- T2: An Adaptive Test-Time Scaling Strategy for Contextual Question Answeringaccepted
- T2R-BENCH: A Benchmark for Real World Table-to-Report Taskaccepted
- TABARD: A Novel Benchmark for Tabular Anomaly Analysis, Reasoning and Detectionaccepted
- TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configurationaccepted
- TALON: A Multi-Agent Framework for Long-Table Exploration and Question Answeringaccepted
- TAPS: Tool-Augmented Personalisation via Structured Taggingaccepted
- TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptationaccepted
- TCP: a Benchmark for Temporal Constraint-Based Planningaccepted
- TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-makingaccepted
- TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysisaccepted
- TFDP: Token-Efficient Disparity Audits for Autoregressive LLMs via Single-Token Masked Evaluationaccepted
- THCM-CAL: Temporal-Hierarchical Causal Modelling with Conformal Calibration for Clinical Risk Predictionaccepted
- TIDES: Technical Information Discovery and Extraction Systemaccepted
- TIU-Bench: A Benchmark for Evaluating Large Multimodal Models on Text-rich Image Understandingaccepted
- TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Useaccepted
- TLUE: A Tibetan Language Understanding Evaluation Benchmarkaccepted
- TORSO: Template-Oriented Reasoning Towards General Tasksaccepted
- TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planningaccepted
- TR-MTEB: A Comprehensive Benchmark and Embedding Model Suite for Turkish Sentence Representationsaccepted
- TRIAL: Token Relations and Importance Aware Late-interaction for Accurate Text Retrievalaccepted
- TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?accepted
- TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detectionaccepted
- TS-CLIP: Time Series Understanding by CLIPaccepted
- TSVer: A Benchmark for Fact Verification Against Time-Series Evidenceaccepted
- TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluationaccepted
- TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Gamesaccepted
- TVQACML: Benchmarking Text-Centric Visual Question Answering in Multilingual Chinese Minority Languagesaccepted
- TabDSR: Decompose, Sanitize, and Reason for Complex Numerical Reasoning in Tabular Dataaccepted
- Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Fine-tuningaccepted
- Table-R1: Inference-Time Scaling for Table Reasoning Tasksaccepted
- Table-Text Alignment: Explaining Claim Verification Against Tables in Scientific Papersaccepted
- TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answeringaccepted
- TableRAG: A Retrieval Augmented Generation Framework for Heterogeneous Document Reasoningaccepted
- TactfulToM: Do LLMs have the Theory of Mind ability to understand White Lies?accepted
- Tag&Tab: Pretraining Data Detection in Large Language Models Using Keyword-Based Membership Inference Attackaccepted
- TailorRPA: A Retrieval-Based Framework for Eliciting Personalized and Coherent Role-Playing Agents in General Domainaccepted
- Tailoring Table Retrieval from a Field-aware Hybrid Matching Perspectiveaccepted
- Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learningaccepted
- Tales of Morality: Comparing Human- and LLM-Generated Moral Stories from Visual Cuesaccepted
- Taming Text-to-Image Synthesis for Novices: User-centric Prompt Generation via Multi-turn Guidanceaccepted
- Targeted Distillation for Sentiment Analysisaccepted
- Task-Aware Resolution Optimization for Visual Large Language Modelsaccepted
- Task-aware Contrastive Mixture of Experts for Quadruple Extraction in Conversations with Code-like Replies and Non-opinion Detectionaccepted
- TaxoAlign: Scholarly Taxonomy Generation Using Language Modelsaccepted
- Teach Small Models to Reason by Curriculum Distillationaccepted
- Teaching According to Talents! Instruction Tuning LLMs with Competence-Aware Curriculum Learningaccepted
- Teaching LLMs to Plan, Not Just Solve: Plan Learning Boosts LLMs Generalization in Reasoning Tasksaccepted
- Teaching Language Models To Gather Information Proactivelyaccepted
- Teaching Your Models to Understand Code via Focal Preference Alignmentaccepted
- TempParaphraser: “Heating Up” Text to Evade AI-Text Detection through Paraphrasingaccepted
- Temporal Alignment of Time Sensitive Facts with Activation Engineeringaccepted
- Temporal Consistency for LLM Reasoning Process Error Identificationaccepted
- Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?accepted
- Temporal Scaling Law for Large Language Modelsaccepted
- Test-Time Steering for Lossless Text Compression via Weighted Product of Expertsaccepted
- Text Anomaly Detection with Simplified Isolation Kernelaccepted
- Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalizationaccepted
- Text Meets Topology: Rethinking Out-of-distribution Detection in Text-Rich Networksaccepted
- Text Takes Over: A Study of Modality Bias in Multimodal Intent Detectionaccepted
- Text or Pixels? Evaluating Efficiency and Understanding of LLMs with Visual Text Inputsaccepted
- Text-centric Alignment for Bridging Test-time Unseen Modalityaccepted
- Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Textaccepted
- Textual Aesthetics in Large Language Modelsaccepted
- The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectnessaccepted
- The Effect of Language Diversity When Fine-Tuning Large Language Models for Translationaccepted
- The Emperor’s New Reasoning: Format Imitation Overshadows Genuine Mathematical Understanding in SFTaccepted
- The Enemy from Within: A Study of Political Delegitimization Discourse in Israeli Political Speechaccepted
- The Face of Persuasion: Analyzing Bias and Generating Culture-Aware Adsaccepted
- The Good, the Bad and the Constructive: Automatically Measuring Peer Review’s Utility for Authorsaccepted
- The Good, the Bad, and the Debatable: A Survey on the Impacts of Data for In-Context Learningaccepted
- The Green KNIGHT: Green Machine Translation with Knowledge-Distilled, Narrow, Inexpensive, Greedy, Hybrid Transformersaccepted
- The Hallucination Tax of Reinforcement Finetuningaccepted
- The Hidden Strength of Disagreement: Unraveling the Consensus-Diversity Tradeoff in Adaptive Multi-Agent Systemsaccepted
- The Illusion of Progress: Re-evaluating Hallucination Detection in LLMsaccepted
- The Illusion of Randomness: How LLMs Fail to Emulate Stochastic Decision-Making in Rock-Paper-Scissors Games?accepted
- The Impact of Language Mixing on Bilingual LLM Reasoningaccepted
- The Impact of Negated Text on Hallucination with Large Language Modelsaccepted
- The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representationsaccepted
- The Language of Interoception: Examining Embodiment and Emotion Through a Corpus of Body Part Mentionsaccepted
- The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasureaccepted
- The Missing Parts: Augmenting Fact Verification with Half Truth Detectionaccepted
- The More, The Better? A Critical Study of Multimodal Context in Radiology Report Summarizationaccepted
- The Power of Framing: How News Headlines Guide Search Behavioraccepted
- The Practical Impacts of Theoretical Constructs on Empathy Modelingaccepted
- The Price of Format: Diversity Collapse in LLMsaccepted
- The Progress Illusion: Revisiting meta-evaluation standards of LLM evaluatorsaccepted
- The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Modelsaccepted
- The Psychology of Falsehood: A Human-Centric Survey of Misinformation Detectionaccepted
- The Pursuit of Empathy: Evaluating Small Language Models for PTSD Dialogue Supportaccepted
- The RAG Paradox: A Black-Box Attack Exploiting Unintentional Vulnerabilities in Retrieval-Augmented Generation Systemsaccepted
- The Ranking Blind Spot: Decision Hijacking in LLM-based Text Rankingaccepted
- The Role of Model Confidence on Bias Effects in Measured Uncertainties for Vision-Language Modelsaccepted
- The Role of Outgoing Connection Heterogeneity in Feedforward Layers of Large Language Modelsaccepted
- The Search for Conflicts of Interest: Open Information Extraction in Scientific Publicationsaccepted
- The Security Threat of Compressed Projectors in Large Vision-Language Modelsaccepted
- The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathologyaccepted
- The Staircase of Ethics: Probing LLM Value Priorities through Multi-Step Induction to Complex Moral Dilemmasaccepted
- The State of Multilingual LLM Safety Research: From Measuring The Language Gap To Mitigating Itaccepted
- The Stepwise Deception: Simulating the Evolution from True News to Fake News with LLM Agentsaccepted
- The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Modelsaccepted
- The Transfer Neurons Hypothesis: An Underlying Mechanism for Language Latent Space Transitions in Multilingual LLMsaccepted
- The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate Itaccepted
- The discordance between embedded ethics and cultural inference in large language modelsaccepted
- The “r” in “woman” stands for rights. Auditing LLMs in Uncovering Social Dynamics in Implicit Misogynyaccepted
- Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoningaccepted
- Think Clearly: Improving Reasoning via Redundant Token Pruningaccepted
- Think Globally, Group Locally: Evaluating LLMs Using Multi-Lingual Word Grouping Gamesaccepted
- Think Right, Not More: Test-Time Scaling for Numerical Claim Verificationaccepted
- Think Twice, Generate Once: Safeguarding by Progressive Self-Reflectionaccepted
- Think Wider, Detect Sharper: Reinforced Reference Coverage for Document-Level Self-Contradiction Detectionaccepted
- Think and Recall: Layer-Level Prompting for Lifelong Model Editingaccepted
- Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Modelaccepted
- Think, Verbalize, then Speak: Bridging Complex Thoughts and Comprehensible Speechaccepted
- ThinkAnswer Loss: Balancing Semantic Similarity and Exact Matching for LLM Reasoning Enhancementaccepted
- ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Modelsaccepted
- ThinkQE: Query Expansion via an Evolving Thinking Processaccepted
- ThinkSLM: Towards Reasoning in Small Language Modelsaccepted
- ThinkSwitcher: When to Think Hard, When to Think Fastaccepted
- ThinkTuning: Instilling Cognitive Reflections without Distillationaccepted
- Thinking Before You Speak: A Proactive Test-time Scaling Approachaccepted
- Thinking Out Loud: Do Reasoning Models Know When They’re Right?accepted
- Third-Person Appraisal Agent: Simulating Human Emotional Reasoning in Text with Large Language Modelsaccepted
- This is not a Disimprovement: Improving Negation Reasoning in Large Language Models via Prompt Engineeringaccepted
- Thought calibration: Efficient and confident test-time scalingaccepted
- ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representationsaccepted
- Thread: A Logic-Based Data Organization Paradigm for How-To Question Answering with Retrieval Augmented Generationaccepted
- Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variationaccepted
- Through the Valley: Path to Effective Long CoT Training for Small Language Modelsaccepted
- Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgmentsaccepted
- Time to Revisit Exact Matchaccepted
- Time to Talk: LLM Agents for Asynchronous Group Communication in Mafia Gamesaccepted
- Tiny Budgets, Big Gains: Parameter Placement Strategy in Parameter Super-Efficient Fine-Tuningaccepted
- TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Researchaccepted
- To Answer or Not to Answer (TAONA): A Robust Textual Graph Understanding and Question Answering Approachaccepted
- To Mask or to Mirror: Human-AI Alignment in Collective Reasoningaccepted
- To See a World in a Spark of Neuron: Disentangling Multi-Task Interference for Training-Free Model Mergingaccepted
- ToDi: Token-wise Distillation via Fine-Grained Divergence Controlaccepted
- ToM-SSI: Evaluating Theory of Mind in Situated Social Interactionsaccepted
- ToM: Leveraging Tree-oriented MapReduce for Long-Context Reasoning in Large Language Modelsaccepted
- Token Knowledge: A New Perspective For Knowledge in Large Language Modelsaccepted
- Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigationaccepted
- Token-Aware Editing of Internal Activations for Large Language Model Alignmentaccepted
- Token-Level Metrics for Detecting Incorrect Gold Annotations in Named Entity Recognitionaccepted
- Token-level Proximal Policy Optimization for Query Generationaccepted
- TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selectionaccepted
- TokenSkip: Controllable Chain-of-Thought Compression in LLMsaccepted
- Tokenization and Representation Biases in Multilingual Models on Dialectal NLP Tasksaccepted
- TombRaider: Entering the Vault of History to Jailbreak Large Language Modelsaccepted
- ToneCraft: Cantonese Lyrics Generation with Harmony of Tones and Pitchesaccepted
- Too Consistent to Detect: A Study of Self-Consistent Errors in LLMsaccepted
- Too Helpful, Too Harmless, Too Honest or Just Right?accepted
- Tool Preferences in Agentic LLMs are Unreliableaccepted
- Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratchaccepted
- ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactionsaccepted
- ToolSafety: A Comprehensive Dataset for Enhancing Safety in LLM-Based Agent Tool Invocationsaccepted
- Toolscaler: Scalable Generative Tool Calling via Structure-Aware Semantic Tokenizationaccepted
- TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translationaccepted
- Topic Coverage-based Demonstration Retrieval for In-Context Learningaccepted
- Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarizationaccepted
- TopicAttack: An Indirect Prompt Injection Attack via Topic Transitionaccepted
- TounsiBench: Benchmarking Large Language Models for Tunisian Arabicaccepted
- Toward Efficient Sparse Autoencoder-Guided Steering for Improved In-Context Learning in Large Language Modelsaccepted
- Toward Inclusive Language Models: Sparsity-Driven Calibration for Systematic and Interpretable Mitigation of Social Biases in LLMsaccepted
- Toward Machine Interpreting: Lessons from Human Interpreting Studiesaccepted
- Toward Machine Translation Literacy: How Lay Users Perceive and Rely on Imperfect Translationsaccepted
- Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoningaccepted
- Toward Optimal LLM Alignments Using Two-Player Gamesaccepted
- Toward the Automatic Detection of Word Meaning Negotiation Indicators in Conversationaccepted
- Towards AI-Assisted Psychotherapy: Emotion-Guided Generative Interventionsaccepted
- Towards Achieving Concept Completeness for Textual Concept Bottleneck Modelsaccepted
- Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Provingaccepted
- Towards Author-informed NLP: Mind the Social Biasaccepted
- Towards Automated Error Discovery: A Study in Conversational AIaccepted
- Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Surveyaccepted
- Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationalesaccepted
- Towards Event Extraction with Massive Types: LLM-based Collaborative Annotation and Partitioning Extractionaccepted
- Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Modelsaccepted
- Towards General-Domain Word Sense Disambiguation: Distilling Large Language Model into Compact Disambiguatoraccepted
- Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Surveyaccepted
- Towards Infinite-Long Prefix in Transformeraccepted
- Towards Language-Agnostic STIPA: Universal Phonetic Transcription to Support Language Documentation at Scaleaccepted
- Towards Low-Resource Alignment to Diverse Perspectives with Sparse Feedbackaccepted
- Towards More Efficient Post-training via Fourier Domain Adapter Frameworkaccepted
- Towards Multi-Document Question Answering in Scientific Literature: Pipeline, Dataset, and Evaluationaccepted
- Towards Optimal Evaluation Efficiency for Large Language Modelsaccepted
- Towards Personalized Conversational Sales Agents: Contextual User Profiling for Strategic Actionaccepted
- Towards Reverse Engineering of Language Models: A Surveyaccepted
- Towards Robust Few-Shot Relation Classification: Incorporating Relation Description with Agreementaccepted
- Towards Robust Mathematical Reasoningaccepted
- Towards Statistical Factuality Guarantee for Large Vision-Language Modelsaccepted
- Towards Transferable Personality Representation Learning based on Triplet Comparisons and Its Applicationsaccepted
- Towards Universal Debiasing for Language Models-based Tabular Data Generationaccepted
- Towards a Holistic and Automated Evaluation Framework for Multi-Level Comprehension of LLMs in Book-Length Contextsaccepted
- Towards a Unified Paradigm of Concept Editing in Large Language Modelsaccepted
- Towards the Roots of the Negation Problem: A Multilingual NLI Dataset and Model Scaling Analysisaccepted
- Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore’s Low-Resource Languagesaccepted
- TrInk: Ink Generation with Transformer Networkaccepted
- TracSum: A New Benchmark for Aspect-Based Summarization with Sentence-Level Traceability in Medical Domainaccepted
- Tracing L1 Interference in English Learner Writing: A Longitudinal Corpus with Error Annotationsaccepted
- Tracing Multilingual Factual Knowledge Acquisition in Pretrainingaccepted
- Tracing Training Footprints: A Calibration Approach for Membership Inference Attacks Against Multimodal Large Language Modelsaccepted
- Train It and Forget It: Merge Lists are Unnecessary for BPE Inference in Language Modelsaccepted
- Train Once for All: A Transitional Approach for Efficient Aspect Sentiment Triplet Extractionaccepted
- Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracyaccepted
- Train a Unified Multimodal Data Quality Classifier with Synthetic Dataaccepted
- Training LLMs for Optimization Modeling via Iterative Data Synthesis and Structured Validationaccepted
- Training LLMs to be Better Text Embedders through Bidirectional Reconstructionaccepted
- Training Language Models to Critique With Multi-agent Feedbackaccepted
- Training Medical QA Models Based on Mixed Rewards from Multiple-Choice and Open-Ended Questionsaccepted
- Training Text-to-Molecule Models with Context-Aware Tokenizationaccepted
- Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Modelsaccepted
- Training compute-optimal transformer encoder modelsaccepted
- Training with Fewer Bits: Unlocking Edge LLMs Training with Stochastic Roundingaccepted
- TransAlign: Machine Translation Encoders are Strong Word Aligners, Tooaccepted
- TransBERT: A Framework for Synthetic Translation in Domain-Specific Language Modelingaccepted
- Transfer-Aware Data Selection for Domain Adaptation in Text Retrievalaccepted
- Transferable Direct Prompt Injection via Activation-Guided MCMC Samplingaccepted
- Transformer-Based Temporal Information Extraction and Application: A Reviewaccepted
- Transitive self-consistency evaluation of NLI models without gold labelsaccepted
- Translate Smart, not Hard: Cascaded Translation Systems with Quality-Aware Deferralaccepted
- Translating Domain-Specific Terminology in Typologically-Diverse Languages: A Study in Tax and Financial Educationaccepted
- Translation in the Hands of Many: Centering Lay Users in Machine Translation Interactionsaccepted
- Translationese-index: Using Likelihood Ratios for Graded and Generalizable Measurement of Translationeseaccepted
- Transparent and Coherent Procedural Mistake Detectionaccepted
- Transplant Then Regenerate: A New Paradigm for Text Data Augmentationaccepted
- TrapDoc: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documentsaccepted
- Treble Counterfactual VLMs: A Causal Approach to Hallucinationaccepted
- Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoningaccepted
- Tree-Structured Non-Autoregressive Decoding for Sequence-to-Sequence Text Generationaccepted
- Tree-of-Quote Prompting Improves Factuality and Attribution in Multi-Hop and Medical Reasoningaccepted
- TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Samplingaccepted
- TreeRare: Syntax Tree-Guided Retrieval and Reasoning for Knowledge-Intensive Question Answeringaccepted
- TreeReview: A Dynamic Tree of Questions Framework for Deep and Efficient LLM-based Scientific Peer Reviewaccepted
- TriSPrompt: A Hierarchical Soft Prompt Model for Multimodal Rumor Detection with Incomplete Modalitiesaccepted
- Triangulating LLM Progress through Benchmarks, Games, and Cognitive Testsaccepted
- TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agentaccepted
- TrojanWave: Exploiting Prompt Learning for Stealthy Backdoor Attacks on Large Audio-Language Modelsaccepted
- Trojsten Benchmark: Evaluating LLM Problem-Solving in Slovak STEM Competition Problemsaccepted
- Trust Me, I’m Wrong: LLMs Hallucinate with Certainty Despite Knowing the Answeraccepted
- Trustworthy Medical Question Answering: An Evaluation-Centric Surveyaccepted
- Tuning Less, Prompting More: In-Context Preference Learning Pipeline for Natural Language Transformationaccepted
- TurBLiMP: A Turkish Benchmark of Linguistic Minimal Pairsaccepted
- TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Textaccepted
- TurnBack: A Geospatial Route Cognition Benchmark for Large Language Models through Reverse Routeaccepted
- TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Modelsaccepted
- TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Gamesaccepted
- Turning Logic Against Itself: Probing Model Defenses Through Contrastive Questionsaccepted
- Turning the Tide: Repository-based Code Reflectionaccepted
- TwT: Thinking without Tokens by Habitual Reasoning Distillation with Multi-Teachers’ Guidanceaccepted
- Two Challenges, One Solution: Robust Multimodal Learning through Dynamic Modality Recognition and Enhancementaccepted
- Two Heads Are Better Than One: Dual-Model Verbal Reflection at Inference-Timeaccepted
- Two Steps from Hell: Compositionality on Chemical LMsaccepted
- Type-Less yet Type-Aware Inductive Link Prediction with Pretrained Language Modelsaccepted
- UI-Hawk: Unleashing the Screen Stream Understanding for Mobile GUI Agentsaccepted
- UICOMPASS: UI Map Guided Mobile Task Automation via Adaptive Action Generationaccepted
- UIOrchestra: Generating High-Fidelity Code from UI Designs with a Multi-agent Systemaccepted
- UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targetsaccepted
- ULTRABENCH: Benchmarking LLMs under Extreme Fine-grained Text Generationaccepted
- UNCERTAINTY-LINE: Length-Invariant Estimation of Uncertainty for Large Language Modelsaccepted
- UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generationaccepted
- UNComp: Can Matrix Entropy Uncover Sparsity? — A Compressor Design from an Uncertainty-Aware Perspectiveaccepted
- UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulationaccepted
- URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Modelsaccepted
- UTMath: A Benchmark for Math Evaluation with Unit Testaccepted
- UltraIF: Advancing Instruction Following from the Wildaccepted
- UnCo: Uncertainty-Driven Collaborative Framework of Large and Small Models for Grounded Multimodal NERaccepted
- Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systemsaccepted
- Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Modelsaccepted
- Uncovering Argumentative Flow: A Question-Focus Discourse Structuring Frameworkaccepted
- Uncovering Factor-Level Preference to Improve Human-Model Alignmentaccepted
- Uncovering Scaling Laws for Large Language Models via Inverse Problemsaccepted
- Uncovering the Bigger Picture: Comprehensive Event Understanding Via Diverse News Retrievalaccepted
- Under the Shadow of Babel: How Language Shapes Reasoning in LLMsaccepted
- Understanding GUI Agent Localization Biases through Logit Sharpnessaccepted
- Understanding How Value Neurons Shape the Generation of Specified Values in LLMsaccepted
- Understanding LLMs’ Cross-Lingual Context Retrieval: How Good It Is And Where It Comes Fromaccepted
- Understanding Refusal in Language Models with Sparse Autoencodersaccepted
- Understanding Subword Compositionality of Large Language Modelsaccepted
- Understanding and Improving Information Preservation in Prompt Compression for LLMsaccepted
- Understanding and Leveraging the Expert Specialization of Context Faithfulness in Mixture-of-Experts LLMsaccepted
- Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundaryaccepted
- Understanding the Information Propagation Effects of Communication Topologies in LLM-based Multi-Agent Systemsaccepted
- Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanismaccepted
- Understanding the Modality Gap: An Empirical Study on the Speech-Text Alignment Mechanism of Large Speech Language Modelsaccepted
- Understanding the Thinking Process of Reasoning Models: A Perspective from Schoenfeld’s Episode Theoryaccepted
- Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoningaccepted
- Unequal Scientific Recognition in the Age of LLMsaccepted
- UniCoM: A Universal Code-Switching Speech Generatoraccepted
- UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debuggingaccepted
- UniRAG: A Unified RAG Framework for Knowledge-Intensive Queries with Decomposition, Break-Down Reasoning, and Iterative Rewritingaccepted
- UniSpeaker: A Unified Approach for Multimodality-driven Speaker Generationaccepted
- UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasetsaccepted
- Uniform Information Density and Syntactic Reduction: Revisiting *that*-Mentioning in English Complement Clausesaccepted
- Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inferenceaccepted
- UnitCoder: Scalable Code Synthesis from Pre-training Corporaaccepted
EMNLP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.