← All conferences

EMNLP 2025 Accepted Papers

The full list of 3,211 papers accepted at EMNLP 2025 (Conference on Empirical Methods in Natural Language Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

accepted: 3,211
  1. Non-Existent Relationship: Fact-Aware Multi-Level Machine-Generated Text Detectionaccepted
  2. NormAL LoRA: What is the perfect size?accepted
  3. NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recoveryaccepted
  4. NormXLogit: The Head-on-Top Never Liesaccepted
  5. Not All Features Deserve Attention: Graph-Guided Dependency Learning for Tabular Data Generation with Language Modelsaccepted
  6. Not All Options Are Created Equal: Textual Option Weighting for Token-Efficient LLM-Based Knowledge Tracingaccepted
  7. Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performanceaccepted
  8. Not All Voices Are Rewarded Equally: Probing and Repairing Reward Models across Human Diversityaccepted
  9. Not Every Token Needs Forgetting: Selective Unlearning Balancing Forgetting and Utility in Large Language Modelsaccepted
  10. Not Lost After All: How Cross-Encoder Attribution Challenges Position Bias Assumptions in LLM Summarizationaccepted
  11. Not What the Doctor Ordered: Surveying LLM-based De-identification and Quantifying Clinical Information Lossaccepted
  12. Not Your Typical Government Tipline: LLM-Assisted Routing of Environmental Protection Agency Citizen Tipsaccepted
  13. Not-Just-Scaling Laws: Towards a Better Understanding of the Downstream Impact of Language Model Design Decisionsaccepted
  14. NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contextsaccepted
  15. Nullspace Disentanglement for Red Teaming Language Modelsaccepted
  16. OAgents: An Empirical Study of Building Effective Agentsaccepted
  17. OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Modelsaccepted
  18. OG-RAG: Ontology-grounded retrieval-augmented generation for large language modelsaccepted
  19. OMS: On-the-fly, Multi-Objective, Self-Reflective Ad Keyword Generation via LLM Agentaccepted
  20. ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusionaccepted
  21. ORPP: Self-Optimizing Role-playing Prompts to Enhance Language Model Capabilitiesaccepted
  22. OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaborationaccepted
  23. OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Modelsaccepted
  24. OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literatureaccepted
  25. O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversionaccepted
  26. Offloaded Reasoning: Efficient Inference for Large Language Models via Modular Reasoning and Refinementaccepted
  27. OkraLong: A Flexible Retrieval-Augmented Framework for Long-Text Question Answeringaccepted
  28. OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domainaccepted
  29. OmniThink: Expanding Knowledge Boundaries in Machine Writing through Thinkingaccepted
  30. On Collaborating Small and Large Models For Few-shot Intent Detectionaccepted
  31. On Domain-Adaptive Post-Training for Multimodal Large Language Modelsaccepted
  32. On Guardrail Models’ Robustness to Mutations and Adversarial Attacksaccepted
  33. On LLM-Based Scientific Inductive Reasoning Beyond Equationsaccepted
  34. On Pruning State-Space LLMsaccepted
  35. On Relation-Specific Neurons in Large Language Modelsaccepted
  36. On the Correspondence between the Squared Norm and Information Content in Text Embeddingsaccepted
  37. On the Effectiveness of Prompt-Moderated LLMs for Math Tutoring at the Tertiary Levelaccepted
  38. On the Fine-Grained Planning Abilities of VLM Web Agentsaccepted
  39. On the Perception Bottleneck of VLMs for Chart Understandingaccepted
  40. On the Role of Entity and Event Level Conceptualization in Generalizable Reasoning: A Survey of Tasks, Methods, Applications, and Future Directionsaccepted
  41. On the Role of Model Prior in Real-World Inductive Reasoningaccepted
  42. On the Same Wavelength? Evaluating Pragmatic Reasoning in Language Models across Broad Conceptsaccepted
  43. On the Versatility of Sparse Autoencoders for In-Context Learningaccepted
  44. One More Modality: Does Abstract Meaning Representation Benefit Visual Question Answering?accepted
  45. One More Question is Enough, Expert Question Decomposition (EQD) Model for Domain Quantitative Reasoningaccepted
  46. One Planner To Guide Them All ! Learning Adaptive Conversational Planners for Goal-oriented Dialoguesaccepted
  47. One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systemsaccepted
  48. OntologyRAG-Q: Resource Development and Benchmarking for Retrieval-Augmented Question Answering in Qur’anic Tafsiraccepted
  49. Open-DeBias: Toward Mitigating Open-Set Bias in Language Modelsaccepted
  50. OpenNER 1.0: Standardized Open-Access Named Entity Recognition Datasets in 50+ Languagesaccepted
  51. OpenTuringBench: An Open-Model-based Benchmark and Framework for Machine-Generated Text Detection and Attributionaccepted
  52. OptiSeq: Ordering Examples On-The-Fly for In-Context Learningaccepted
  53. Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metricsaccepted
  54. Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Modelsaccepted
  55. Orchestrating Audio: Multi-Agent Framework for Long-Video Audio Synthesisaccepted
  56. Order Doesn’t Matter, But Reasoning Does: Training LLMs with Order-Centric Augmentationaccepted
  57. Orthogonal Finetuning Made Scalableaccepted
  58. Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Framesaccepted
  59. Out-of-Context Reasoning in Large Language Modelsaccepted
  60. Over-Generation and Compaction: A Prompting Strategy for Procedural Text Adaptation with Large Language Modelsaccepted
  61. Overcoming Black-box Attack Inefficiency with Hybrid and Dynamic Select Algorithmsaccepted
  62. P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMsaccepted
  63. PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogueaccepted
  64. PAFT: Prompt-Agnostic Fine-Tuningaccepted
  65. PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreementsaccepted
  66. PAMN: Multi-phase Correlation Modeling for Contrast-Enhanced 3D Medical Image Retrievalaccepted
  67. PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Modelsaccepted
  68. PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximizationaccepted
  69. PD3F: A Pluggable and Dynamic DoS-Defense Framework against resource consumption attacks targeting Large Language Modelsaccepted
  70. PEPE: Long-context Extension for Large Language Models via Periodic Extrapolation Positional Encodingsaccepted
  71. PERSEVAL: A Framework for Perspectivist Classification Evaluationaccepted
  72. PICD-Instruct: A Generative Instruction Learning Framework for Few-Shot Multi-Intent Spoken Language Understandingaccepted
  73. PIIvot: A Lightweight NLP Anonymization Framework for Question-Anchored Tutoring Dialoguesaccepted
  74. PIP: Perturbation-based Iterative Pruning for Large Language Modelsaccepted
  75. PLAN-TUNING: Post-Training Language Models to Learn Step-by-Step Planning for Complex Problem Solvingaccepted
  76. PLLuM-Align: Polish Preference Dataset for Large Language Model Alignmentaccepted
  77. PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Modelsaccepted
  78. POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversionaccepted
  79. PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Modelsaccepted
  80. POSITION BIAS MITIGATES POSITION BIAS: Mitigate Position Bias Through Inter-Position Knowledge Distillationaccepted
  81. POW: Political Overton Windows of Large Language Modelsaccepted
  82. PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillationaccepted
  83. PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slidesaccepted
  84. PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancementaccepted
  85. PRIM: Towards Practical In-Image Multilingual Machine Translationaccepted
  86. PRIME: Large Language Model Personalization with Cognitive Dual-Memory and Personalized Thought Processaccepted
  87. PRINCIPLES: Synthetic Strategy Memory for Proactive Dialogue Agentsaccepted
  88. PRISM: Efficient Long-Range Reasoning With Short-Context LLMsaccepted
  89. PROOD: A Simple LLM Out-of-Distribution Guardrail Leveraging Response Semanticsaccepted
  90. PSET: a Phonetics-Semantics Evaluation Testbedaccepted
  91. PUER: Boosting Few-shot Positive-Unlabeled Entity Resolution with Reinforcement Learningaccepted
  92. PVTNL: Prompting Vision Transformers with Natural Language for Generalizable Person Re-identificationaccepted
  93. Paired by the Teacher: Turning Unpaired Data into High-Fidelity Pairs for Low-Resource Text Generationaccepted
  94. PakBBQ: A Culturally Adapted Bias Benchmark for QAaccepted
  95. PanicToCalm: A Proactive Counseling Agent for Panic Attacksaccepted
  96. Parallel Communities Across the Surface Web and the Dark Webaccepted
  97. Parallel Continuous Chain-of-Thought with Jacobi Iterationaccepted
  98. ParetoRAG: Leveraging Sentence-Context Attention for Robust and Efficient Retrieval-Augmented Generationaccepted
  99. Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoningaccepted
  100. Parsing the Switch: LLM-Based UD Annotation for Complex Code-Switched and Low-Resource Languagesaccepted
  101. PatentScore: Multi-dimensional Evaluation of LLM-Generated Patent Claimsaccepted
  102. Path Drift in Large Reasoning Models: How First-Person Commitments Override Safetyaccepted
  103. Path-enhanced Pre-trained Language Model for Knowledge Graph Completionaccepted
  104. PathoHR: Hierarchical Reasoning for Vision-Language Models in Pathologyaccepted
  105. Paths Not Taken: Understanding and Mending the Multilingual Factual Recall Pipelineaccepted
  106. Pathway to Relevance: How Cross-Encoders Implement a Semantic Variant of BM25accepted
  107. PathwiseRAG: Multi-Dimensional Exploration and Integration Frameworkaccepted
  108. Pearl: A Multimodal Culturally-Aware Arabic Instruction Datasetaccepted
  109. Permitted Knowledge Boundary: Evaluating the Knowledge-Constrained Responsiveness of Large Language Modelsaccepted
  110. Permutative Preference Alignment from Listwise Ranking of Human Judgmentsaccepted
  111. Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Researchaccepted
  112. PersLLM: A Personified Training Approach for Large Language Modelsaccepted
  113. Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Stylesaccepted
  114. PersonaGym: Evaluating Persona Agents and LLMsaccepted
  115. Personality Matters: User Traits Predict LLM Preferences in Multi-Turn Collaborative Tasksaccepted
  116. Personality Vector: Modulating Personality of Large Language Models by Model Mergingaccepted
  117. Personalization up to a Point: Why Personalized Content Moderation Needs Boundaries, and How We Can Enforce Themaccepted
  118. Personalized LLM Decoding via Contrasting Personal Preferenceaccepted
  119. Personalized Language Models via Privacy-Preserving Evolutionary Model Mergingaccepted
  120. Personalized Question Answering with User Profile Generation and Compressionaccepted
  121. Personalized open world plan generation for safety-critical human centered autonomous systems: A case study on Artificial Pancreasaccepted
  122. Perspective-driven Preference Optimization with Entropy Maximization for Diverse Argument Generationaccepted
  123. PerspectiveMod: A Perspectivist Resource for Deliberative Moderationaccepted
  124. Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PDaccepted
  125. Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Timeaccepted
  126. PhoniTale: Phonologically Grounded Mnemonic Generation for Typologically Distant Language Pairsaccepted
  127. PhonoThink: Improving Large Language Models’ Reasoning on Chinese Phonological Ambiguitiesaccepted
  128. PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensionsaccepted
  129. Pi-SQL: Enhancing Text-to-SQL with Fine-Grained Guidance from Pivot Programming Languagesaccepted
  130. Pierce the Mists, Greet the Sky: Decipher Knowledge Overshadowing via Knowledge Circuit Analysisaccepted
  131. Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfactsaccepted
  132. Plan Dynamically, Express Rhetorically: A Debate-Driven Rhetorical Framework for Argumentative Writingaccepted
  133. PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solvingaccepted
  134. Planning-Aware Code Infilling via Horizon-Length Predictionaccepted
  135. Playpen: An Environment for Exploring Learning From Dialogue Game Feedbackaccepted
  136. Please Translate Again: Two Simple Experiments on Whether Human-Like Reasoning Helps Translationaccepted
  137. Plugging Schema Graph into Multi-Table QA: A Human-Guided Framework for Reducing LLM Relianceaccepted
  138. Pluralistic Alignment for Healthcare: A Role-Driven Frameworkaccepted
  139. Plutus: Benchmarking Large Language Models in Low-Resource Greek Financeaccepted
  140. PoSum-Bench: Benchmarking Position Bias in LLM-based Conversational Summarizationaccepted
  141. Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Modelsaccepted
  142. PolBiX: Detecting LLMs’ Political Bias in Fact-Checking through X-phemismsaccepted
  143. Polish-English medical knowledge transfer: A new benchmark and resultsaccepted
  144. PolitiSky24: U.S. Political Bluesky Dataset with User Stance Labelsaccepted
  145. Polysemantic Dropout: Conformal OOD Detection for Specialized LLMsaccepted
  146. PoseStitch-SLT: Linguistically Inspired Pose-Stitching for End-to-End Sign Language Translationaccepted
  147. Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Modelsaccepted
  148. Position: LLMs Can be Good Tutors in English Educationaccepted
  149. Post Persona Alignment for Multi-Session Dialogue Generationaccepted
  150. Post-hoc Study of Climate Microtargeting on Social Media Ads with LLMs: Thematic Insights and Fairness Evaluationaccepted
  151. Power doesn’t reside in size: A Low Parameter Hybrid Language Model (HLM) for Sentiment Analysis in Code-mixed dataaccepted
  152. PrAd: Prompt Adaptive Tuning for Decoder-only Language Modelsaccepted
  153. Pragmatic Inference Chain (PIC) Improving LLMs’ Reasoning of Authentic Implicit Toxic Languageaccepted
  154. Pre-Storage Reasoning for Episodic Memory: Shifting Inference Burden to Memory for Personalized Dialogueaccepted
  155. Pre-trained Language Models Learn Remarkably Accurate Representations of Numbersaccepted
  156. Pre-trained Models Perform the Best When Token Distributions Follow Zipf’s Lawaccepted
  157. Pre-training CLIP against Data Poisoning with Optimal Transport-based Matching and Alignmentaccepted
  158. PreGenie: An Agentic Framework for High-quality Visual Presentation Generationaccepted
  159. Precise In-Parameter Concept Erasure in Large Language Modelsaccepted
  160. Predicate-Guided Generation for Mathematical Reasoningaccepted
  161. Predicting Language Models’ Success at Zero-Shot Probabilistic Predictionaccepted
  162. Predicting Prosodic Boundaries for Children’s Textsaccepted
  163. Preemptive Detection and Correction of Misaligned Actions in LLM Agentsaccepted
  164. Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoningaccepted
  165. Presumed Cultural Identity: How Names Shape LLM Responsesaccepted
  166. PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasksaccepted
  167. PrimeX: A Dataset of Worldview, Opinion, and Explanationaccepted
  168. Primus: A Pioneering Collection of Open-Source Datasets for Cybersecurity LLM Trainingaccepted
  169. Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performanceaccepted
  170. Prior Prompt Engineering for Reinforcement Fine-Tuningaccepted
  171. Priority on High-Quality: Selecting Instruction Data via Consistency Verification of Noise Injectionaccepted
  172. Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agentsaccepted
  173. ProLongVid: A Simple but Strong Baseline for Long-context Video Instruction Tuningaccepted
  174. ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrievalaccepted
  175. ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdomaccepted
  176. Proactive Assistant Dialogue Generation from Streaming Egocentric Videosaccepted
  177. Proactive Hearing Assistants that Isolate Egocentric Conversationsaccepted
  178. Proactive User Information Acquisition via Chats on User-Favored Topicsaccepted
  179. Probabilistic Soundness Guarantees in LLM Reasoning Chainsaccepted
  180. Probability Distribution Collapse: A Critical Bottleneck to Compact Unsupervised Neural Grammar Inductionaccepted
  181. Probing LLM World Models: Enhancing Guesstimation with Wisdom of Crowds Decodingaccepted
  182. Probing Logical Reasoning of MLLMs in Scientific Diagramsaccepted
  183. Probing Narrative Morals: A New Character-Focused MFT Framework for Use with Large Language Modelsaccepted
  184. Probing Political Ideology in Large Language Models: How Latent Political Representations Generalize Across Tasksaccepted
  185. Probing Semantic Routing in Large Mixture-of-Expert Modelsaccepted
  186. Probing and Boosting Large Language Models Capabilities via Attention Headsaccepted
  187. Probing for Arithmetic Errors in Language Modelsaccepted
  188. Problem Solved? Information Extraction Design Space for Layout-Rich Documents using LLMsaccepted
  189. ProcVQA: Benchmarking the Effects of Structural Properties in Mined Process Visualizations on Vision–Language Model Performanceaccepted
  190. ProcWorld: Benchmarking Large Model Planning in Reachability-Constrained Environmentsaccepted
  191. Procedural Environment Generation for Tool-Use Agentsaccepted
  192. Process-Supervised Reinforcement Learning for Code Generationaccepted
  193. Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertiseaccepted
  194. Profiler: Black-box AI-generated Text Origin Detection via Context-aware Inference Pattern Analysisaccepted
  195. Profiling LLM’s Copyright Infringement Risks under Adversarial Persuasive Promptingaccepted
  196. Program of Thoughts for Financial Reasoning: Leveraging Dynamic In-Context Examples and Generative Retrievalaccepted
  197. Progressive Facial Granularity Aggregation with Bilateral Attribute-based Enhancement for Face-to-Speech Synthesisaccepted
  198. Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queriesaccepted
  199. PromptKeeper: Safeguarding System Prompts for LLMsaccepted
  200. Promptception: How Sensitive Are Large Multimodal Models to Prompts?accepted
  201. PropRAG: Guiding Retrieval with Beam Search over Proposition Pathsaccepted
  202. PropXplain: Can LLMs Enable Explainable Propaganda Detection?accepted
  203. Protein Large Language Models: A Comprehensive Surveyaccepted
  204. ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answeringaccepted
  205. ProtoXTM: Cross-Lingual Topic Modeling with Document-Level Prototype-based Contrastive Learningaccepted
  206. Prototypical Human-AI Collaboration Behaviors from LLM-Assisted Writing in the Wildaccepted
  207. Proxy Barrier: A Hidden Repeater Layer Defense Against System Prompt Leakage and Jailbreakingaccepted
  208. PruneCD: Contrasting Pruned Self Model to Improve Decoding Factualityaccepted
  209. Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMsaccepted
  210. Pruning the Paradox: How CLIP’s Most Informative Heads Enhance Performance While Amplifying Biasaccepted
  211. PsyScam: A Benchmark for Psychological Techniques in Real-World Scamsaccepted
  212. Public Data Assisted Differentially Private In-Context Learningaccepted
  213. Pun Unintended: LLMs and the Illusion of Humor Understandingaccepted
  214. PunMemeCN: A Benchmark to Explore Vision-Language Models’ Understanding of Chinese Pun Memesaccepted
  215. Puzzled by Puzzles: When Vision-Language Models Can’t Take a Hintaccepted
  216. PychoAgent: Psychology-driven LLM Agents for Explainable Panic Prediction on Social Media during Sudden Disaster Eventsaccepted
  217. Q-PRM: Adaptive Query Rewriting for Retrieval-Augmented Generation via Step-level Process Supervisionaccepted
  218. QA‐LIGN: Aligning LLMs through Constitutionally Decomposed QAaccepted
  219. QCRD: Quality-guided Contrastive Rationale Distillation for Large Language Modelsaccepted
  220. QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answeringaccepted
  221. QFrCoLA: a Quebec-French Corpus of Linguistic Acceptability Judgmentsaccepted
  222. QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Modelsaccepted
  223. QSpec: Speculative Decoding with Complementary Quantization Schemesaccepted
  224. QUARTZ: QA-based Unsupervised Abstractive Refinement for Task-oriented Dialogue Summarizationaccepted
  225. QUIDS: Query Intent Description for Exploratory Search via Dual Space Modelingaccepted
  226. QUITO-X: A New Perspective on Context Compression from the Information Bottleneck Theoryaccepted
  227. QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Modelsaccepted
  228. QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluationaccepted
  229. QuantAgents: Towards Multi-agent Financial System via Simulated Tradingaccepted
  230. Quantifying Compositionality of Classic and State-of-the-Art Embeddingsaccepted
  231. Quantifying Language Disparities in Multilingual Large Language Modelsaccepted
  232. Quantifying Logical Consistency in Transformers via Query-Key Alignmentaccepted
  233. Quantifying Uncertainty in Natural Language Explanations of Large Language Models for Question Answeringaccepted
  234. Quantifying the Risks of LLM- and Tool-assisted Rephrasing to Linguistic Diversityaccepted
  235. Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMsaccepted
  236. Query Optimization for Parametric Knowledge Refinement in Retrieval-Augmented Large Language Modelsaccepted
  237. Query-Focused Retrieval Heads Improve Long-Context Reasoning and Re-rankingaccepted
  238. R-BPE: Improving BPE-Tokenizers with Token Reuseaccepted
  239. R-Bind: Unified Enhancement of Attribute and Relation Binding in Text-to-Image Diffusion Modelsaccepted
  240. R-CHAR: A Metacognition-Driven Framework for Role-Playing in Large Language Modelsaccepted
  241. R-LoRA: Randomized Multi-Head LoRA for Efficient Multi-task Learningaccepted
  242. R-PRM: Reasoning-Driven Process Reward Modelingaccepted
  243. R-TOFU: Unlearning in Large Reasoning Modelsaccepted
  244. R2A-TLS: Reflective Retrieval-Augmented Timeline Summarization with Causal-Semantic Integrationaccepted
  245. R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generationaccepted
  246. R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learningaccepted
  247. RAC: Efficient LLM Factuality Correction with Retrieval Augmentationaccepted
  248. RACCooN: Versatile Instructional Video Editing with Auto-Generated Narrativesaccepted
  249. RACQC: Advanced Retrieval-Augmented Generation for Chinese Query Correctionaccepted
  250. RAED: Retrieval-Augmented Entity Description Generation for Emerging Entity Linking and Disambiguationaccepted
  251. RAG+: Enhancing Retrieval-Augmented Generation with Application-Aware Reasoningaccepted
  252. RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructionsaccepted
  253. RAG-Zeval: Enhancing RAG Responses Evaluator through End-to-End Reasoning and Ranking-Based Reinforcement Learningaccepted
  254. RAGferee: Building Contextual Reward Models for Retrieval-Augmented Generationaccepted
  255. RAISE: Reinforced Adaptive Instruction Selection For Large Language Modelsaccepted
  256. RALS: Resources and Baselines for Romanian Automatic Lexical Simplificationaccepted
  257. RAR2: Retrieval-Augmented Medical Reasoning via Thought-Driven Retrievalaccepted
  258. RAV: Retrieval-Augmented Voting for Tactile Descriptions Without Trainingaccepted
  259. RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Languageaccepted
  260. RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMsaccepted
  261. RBPtool: A Deep Language Model Framework for Multi-Resolution RBP-RNA Binding Prediction and RNA Molecule Designaccepted
  262. RCScore: Quantifying Response Consistency in Large Language Modelsaccepted
  263. RD-MCSA: A Multi-Class Sentiment Analysis Approach Integrating In-Context Classification Rationales and Demonstrationsaccepted
  264. REACT: Representation Extraction And Controllable Tuning to Overcome Overfitting in LLM Knowledge Editingaccepted
  265. REALM: Recursive Relevance Modeling for LLM-based Document Re-Rankingaccepted
  266. REAR: Reinforced Reasoning Optimization for Event Argument Extraction with Relation-Aware Supportaccepted
  267. REARANK: Reasoning Re-ranking Agent via Reinforcement Learningaccepted
  268. RECALL: REpresentation-aligned Catastrophic-forgetting ALLeviation via Hierarchical Model Mergingaccepted
  269. RECAST: Retrieval-Augmented Contextual ASR via Decoder-State Keyword Spottingaccepted
  270. RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistributionaccepted
  271. REGen: A Reliable Evaluation Framework for Generative Event Argument Extractionaccepted
  272. RELIC: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examplesaccepted
  273. RESF: Regularized-Entropy-Sensitive Fingerprinting for Black-Box Tamper Detection of Large Language Modelsaccepted
  274. RETAIL: Towards Real-world Travel Planning for Large Language Modelsaccepted
  275. REVIVING YOUR MNEME: Predicting The Side Effects of LLM Unlearning and Fine-Tuning via Sparse Model Diffingaccepted
  276. RG-VQA: Leveraging Retriever-Generator Pipelines for Knowledge Intensive Visual Question Answeringaccepted
  277. RGAR: Recurrence Generation-augmented Retrieval for Factual-aware Medical Question Answeringaccepted
  278. RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstructionaccepted
  279. RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translationaccepted
  280. RJE: A Retrieval-Judgment-Exploration Framework for Efficient Knowledge Graph Question Answering with LLMsaccepted
  281. RLAE: Reinforcement Learning-Assisted Ensemble for LLMsaccepted
  282. RLMEval: Evaluating Research-Level Neural Theorem Provingaccepted
  283. RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playingaccepted
  284. ROSE: A Reward-Oriented Data Selection Framework for LLM Task-Specific Instruction Tuningaccepted
  285. RPDR: A Round-trip Prediction-Based Data Augmentation Framework for Long-Tail Question Answeringaccepted
  286. RRInf: Efficient Influence Function Estimation via Ridge Regression for Large Language Models and Text-to-Image Diffusion Modelsaccepted
  287. RTE-GMoE: A Model-agnostic Approach for Relation Triplet Extraction via Graph-based Mixture-of-Expert Mutual Learningaccepted
  288. RTQA : Recursive Thinking for Complex Temporal Knowledge Graph Question Answering with Large Language Modelsaccepted
  289. RTTC: Reward-Guided Collaborative Test-Time Computeaccepted
  290. RaDeR: Reasoning-aware Dense Retrieval Modelsaccepted
  291. RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routingaccepted
  292. Radical Allomorphy: Phonological Surface Forms without Phonologyaccepted
  293. Randomized Smoothing Meets Vision-Language Modelsaccepted
  294. Randomly Removing 50% of Dimensions in Text Embeddings has Minimal Impact on Retrieval and Classification Tasksaccepted
  295. Rank-Awareness and Angular Constraints: A New Perspective on Learning Sentence Embeddings from NLI Dataaccepted
  296. Rapid Word Learning Through Meta In-Context Learningaccepted
  297. RareSyn: Health Record Synthesis for Rare Disease Diagnosisaccepted
  298. Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworksaccepted
  299. Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimizationaccepted
  300. Re-FRAME the Meeting Summarization SCOPE: Fact-Based Summarization and Personalization via Questionsaccepted
  301. ReAL: How Can LLMs Simulate the Real Teacher? Retrieval-enhanced Agent for Adaptive Learningaccepted
  302. ReAgent: Reversible Multi-Agent Reasoning for Knowledge-Enhanced Multi-Hop QAaccepted
  303. ReAlign: Structured Revision for Small Language Model Alignmentaccepted
  304. ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimizationaccepted
  305. ReCoVeR the Target Language: Language Steering without Sacrificing Task Performanceaccepted
  306. ReDepress: A Cognitive Framework for Detecting Depression Relapse from Social Mediaaccepted
  307. ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgmentaccepted
  308. ReFLAIR: Enhancing Multimodal Reasoning via Structured Reflection and Reward-Guided Learningaccepted
  309. ReGraphRAG: Reorganizing Fragmented Knowledge Graphs for Multi-Perspective Retrieval-Augmented Generationaccepted
  310. ReLoop: “Seeing Twice and Thinking Backwards” via Closed-loop Training to Mitigate Hallucinations in Multimodal understandingaccepted
  311. ReMamba: Equip Mamba with Effective Long-Sequence Modelingaccepted
  312. ReMedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modelingaccepted
  313. ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuningaccepted
  314. ReSeeding Latent States for Sequential Language Understandingaccepted
  315. ReSo: A Reward-driven Self-organizing LLM-based Multi-Agent System for Reasoning Tasksaccepted
  316. ReTAG: Retrieval-Enhanced, Topic-Augmented Graph-Based Global Sensemakingaccepted
  317. Read to Hear: A Zero-Shot Pronunciation Assessment Using Textual Descriptions and LLMsaccepted
  318. Reading Between the Prompts: How Stereotypes Shape LLM’s Implicit Personalizationaccepted
  319. Real, Fake, or Manipulated? Detecting Machine-Influenced Textaccepted
  320. Real-World Summarization: When Evaluation Reaches Its Limitsaccepted
  321. Real-time Ad Retrieval via LLM-generative Commercial Intention for Sponsored Search Advertisingaccepted
  322. RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenariosaccepted
  323. Realistic Training Data Generation and Rule Enhanced Decoding in LLM for NameGuessaccepted
  324. Reason to Rote: Rethinking Memorization in Reasoningaccepted
  325. ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoningaccepted
  326. Reasoning Model Unlearning: Forgetting Traces, Not Just Answers, While Preserving Reasoning Skillsaccepted
  327. Reasoning under Uncertainty: Efficient LLM Inference via Unsupervised Confidence Dilution and Convergent Adaptive Samplingaccepted
  328. Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Modelsaccepted
  329. Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreakingaccepted
  330. RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendationaccepted
  331. RecGPT: A Foundation Model for Sequential Recommendationaccepted
  332. Recall with Reasoning: Chain-of-Thought Distillation for Mamba’s Long-Context Memory and Extrapolationaccepted
  333. Recipe2Plan: Evaluating Planning Abilities of LLMs for Efficient and Feasible Multitasking with Time Constraints Between Actionsaccepted
  334. Recognizing Limits: Investigating Infeasibility in Large Language Modelsaccepted
  335. Recontextualizing Revitalization: A Mixed Media Approach to Reviving the Nüshu Languageaccepted
  336. Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?accepted
  337. RedHerring Attack: Testing the Reliability of Attack Detectionaccepted
  338. RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generationaccepted
  339. Refined Assessment for Translation Evaluation: Rethinking Machine Translation Evaluation in the Era of Human-Level Systemsaccepted
  340. Refining Attention for Explainable and Noise-Robust Fact-Checking with Transformersaccepted
  341. Refining Text Generation for Realistic Conversational Recommendation via Direct Preference Optimizationaccepted
  342. ReflAct: World-Grounded Decision Making in LLM Agents via Goal-State Reflectionaccepted
  343. Reflective Agreement: Combining Self-Mixture of Agents with a Sequence Tagger for Robust Event Extractionaccepted
  344. Reframe Your Life Story: Interactive Narrative Therapist and Innovative Moment Assessment with Large Language Modelsaccepted
  345. Refusal-Aware Red Teaming: Exposing Inconsistency in Safety Evaluationsaccepted
  346. Regularized Contrastive Decoding with Hard Negative Samples for LLM Hallucination Mitigationaccepted
  347. Reimagining Safety Alignment with An Imageaccepted
  348. Reinforced Query Reasoners for Reasoning-intensive Retrieval Tasksaccepted
  349. Reinforcement Learning for Large Language Models via Group Preference Reward Shapingaccepted
  350. Reinforcement Learning with Supervised Alignmentaccepted
  351. Reliability Crisis of Reference-free Metrics for Grammatical Error Correctionaccepted
  352. Reliable Evaluation and Benchmarks for Statement Autoformalizationaccepted
  353. Reliable and Cost-Effective Exploratory Data Analysis via Graph-Guided RAGaccepted
  354. ReliableEval: A Recipe for Stochastic LLM Evaluation via Method of Momentsaccepted
  355. RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Modelsaccepted
  356. Representation Potentials of Foundation Models for Multimodal Alignment: A Surveyaccepted
  357. Representation-based Broad Hallucination Detectors Fail to Generalize Out of Distributionaccepted
  358. Representing LLMs in Prompt Semantic Task Spaceaccepted
  359. ResFormer: All-Time Reservoir Memory for Long Sequence Classificationaccepted
  360. Rescorla-Wagner Steering of LLMs for Undesired Behaviors over Disproportionate Inappropriate Contextaccepted
  361. ResearchArena: Benchmarking Large Language Models’ Ability to Collect and Organize Information as Research Agentsaccepted
  362. Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Modelsaccepted
  363. Residualized Similarity for Faithfully Explainable Authorship Verificationaccepted
  364. Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editingaccepted
  365. Resource-Rational Noisy-Channel Language Processing: Testing the Effect of Algorithmic Constraints on Inferencesaccepted
  366. Rethink Rumor Detection in the Era of LLMs: A Reviewaccepted
  367. RethinkMCTS: Refining Erroneous Thoughts in Monte Carlo Tree Search for Code Generationaccepted
  368. Rethinking Backdoor Detection Evaluation for Language Modelsaccepted
  369. Rethinking Cross-Subject Data Splitting for Brain-to-Text Decodingaccepted
  370. Rethinking DPO: The Role of Rejected Responses in Preference Misalignmentaccepted
  371. Rethinking Data Selection at Scale: Random Selection is Almost All You Needaccepted
  372. Rethinking LLM Uncertainty: A Multi-Agent Approach to Estimating Black-Box Model Uncertaintyaccepted
  373. Rethinking LLM-Based Recommendations: A Personalized Query-Driven Parallel Integrationaccepted
  374. Rethinking NLP for Chemistry: A Critical Look at the USPTO Benchmarkaccepted
  375. Rethinking Personality Assessment from Human-Agent Dialogues: Fewer Rounds May Be Better Than Moreaccepted
  376. Rethinking Sign Language Translation: The Impact of Signer Dependence on Model Evaluationaccepted
  377. Rethinking Text-based Protein Understanding: Retrieval or LLM?accepted
  378. Retracing the Past: LLMs Emit Training Data When They Get Lostaccepted
  379. Retrieval Augmented Generation based context discovery for ASRaccepted
  380. Retrieval Enhanced Feedback via In-context Neural Error-bookaccepted
  381. Retrieval over Classification: Integrating Relation Semantics for Multimodal Relation Extractionaccepted
  382. Retrieval-Augmented Generation with Estimation of Source Reliabilityaccepted
  383. Retrieval-Augmented Generation with Hierarchical Knowledgeaccepted
  384. Retrieval-Augmented Language Models are Mimetic Theorem Proversaccepted
  385. Retrieval-Augmented Machine Translation with Unstructured Knowledgeaccepted
  386. Retrieval-augmented GUI Agents with Generative Guidelinesaccepted
  387. Retrieving Support to Rank Answers in Open-Domain Question Answeringaccepted
  388. RevPRAG: Revealing Poisoning Attacks in Retrieval-Augmented Generation through LLM Activation Analysisaccepted
  389. Reveal and Release: Iterative LLM Unlearning with Self-generated Dataaccepted
  390. Revealing and Mitigating the Challenge of Detecting Character Knowledge Errors in LLM Role-Playingaccepted
  391. Revealing the Inherent Instructability of Pre-Trained Language Modelsaccepted
  392. Revealing the impact of synthetic native samples and multi-tasking strategies in Hindi-English code-mixed humour and sarcasm detectionaccepted
  393. Reverse Prompt Engineering: A Zero-Shot, Genetic Algorithm Approach to Language Model Inversionaccepted
  394. ReviewEval: An Evaluation Framework for AI-Generated Reviewsaccepted
  395. ReviewRL: Towards Automated Scientific Review with RLaccepted
  396. Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shotaccepted
  397. Revisiting LLM Value Probing Strategies: Are They Robust and Expressive?accepted
  398. Revisiting Pruning vs Quantization for Small Language Modelsaccepted
  399. Reward Mixology: Crafting Hybrid Signals for Reinforcement Learning Driven In-Context Learningaccepted
  400. Reward Model Perspectives: Whose Opinions Do Reward Models Reward?accepted
  401. Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligneraccepted
  402. Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMsaccepted
  403. RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesisaccepted
  404. Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpeningaccepted
  405. RiTTA: Modeling Event Relations in Text-to-Audio Generationaccepted
  406. Riemannian Optimization for LoRA on the Stiefel Manifoldaccepted
  407. RingFormer: Rethinking Recurrent Transformer with Adaptive Level Signalsaccepted
  408. RoDEval: A Robust Word Sense Disambiguation Evaluation Framework for Large Language Modelsaccepted
  409. RoT: Enhancing Table Reasoning with Iterative Row-Wise Traversalsaccepted
  410. Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detectionaccepted
  411. Robust Knowledge Editing via Explicit Reasoning Chains for Distractor-Resilient Multi-Hop QAaccepted
  412. Robust Native Language Identification through Agentic Decompositionaccepted
  413. Role-Guided Annotation and Prototype-Aligned Representation Learning for Historical Literature Sentiment Classificationaccepted
  414. Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizeraccepted
  415. Route Sparse Autoencoder to Interpret Large Language Modelsaccepted
  416. Router-Tuning: A Simple and Effective Approach for Dynamic Depthaccepted
  417. RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMsaccepted
  418. RuCCoD: Towards Automated ICD Coding in Russianaccepted
  419. Rule Discovery for Natural Language Inference Data Generation Using Out-of-Distribution Detectionaccepted
  420. Rule-Guided Extraction: A Hierarchical Rule Optimization Framework for Document-Level Event Argument Extractionaccepted
  421. Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environmentsaccepted
  422. Rust-doctor: Enhanced Feature for Rust Ownership and Lifetime Repair with Balanced Training Data Generationaccepted
  423. S*: Test Time Scaling for Code Generationaccepted
  424. S2LPP: Small-to-Large Prompt Prediction across LLMsaccepted
  425. SA-CLIP: Language Guided Image Spatial and Action Feature Learningaccepted
  426. SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connectionaccepted
  427. SACL: Understanding and Combating Textual Bias in Code Retrieval with Semantic-Augmented Reranking and Localizationaccepted
  428. SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Modelsaccepted
  429. SAEs Are Good for Steering – If You Select the Right Featuresaccepted
  430. SAFE-SQL: Self-Augmented In-Context Learning with Fine-grained Example Selection for Text-to-SQLaccepted
  431. SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMsaccepted
  432. SAFE: Schema-Driven Approximate Distance Join for Efficient Knowledge Graph Queryingaccepted
  433. SAFENUDGE: Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offsaccepted
  434. SAKI-RAG: Mitigating Context Fragmentation in Long-Document RAG via Sentence-level Attention Knowledge Integrationaccepted
  435. SAMULE: Self-Learning Agents Enhanced by Multi-level Reflectionaccepted
  436. SAND: Boosting LLM Agents with Self-Taught Action Deliberationaccepted
  437. SATBench: Benchmarking LLMs’ Logical Reasoning via Automated Puzzle Generation from SAT Formulasaccepted
  438. SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascadingaccepted
  439. SCDTour: Embedding Axis Ordering and Merging for Interpretable Semantic Change Detectionaccepted
  440. SCE: Semantic Consistency Enhanced Reinforcement Learning for Multi-Hop Knowledge Graph Reasoningaccepted
  441. SCRIBE: Structured Chain Reasoning for Interactive Behaviour Explanations using Tool Callingaccepted
  442. SCoder: Progressive Self-Distillation for Bootstrapping Small-Scale Data Synthesizers to Empower Code LLMsaccepted
  443. SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Modelsaccepted
  444. SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMsaccepted
  445. SEAL: Structure and Element Aware Learning Improves Long Structured Document Retrievalaccepted
  446. SEKE: Specialised Experts for Keyword Extractionaccepted
  447. SEMMA: A Semantic Aware Knowledge Graph Foundation Modelaccepted
  448. SENTRA: Selected-Next-Token Transformer for LLM Text Detectionaccepted
  449. SEPS: A Separability Measure for Robust Unlearning in LLMsaccepted
  450. SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Modelsaccepted
  451. SGCD: Subtask-Guided Causal-Debiasing Framework for Robust Cross-Utterance Sentiment Quadruple Extraction in Dialoguesaccepted
  452. SHARP: Steering Hallucination in LVLMs via Representation Engineeringaccepted
  453. SHIFT: Selected Helpful Informative Frame for Video-guided Machine Translationaccepted
  454. SIFT: Grounding LLM Reasoning in Contexts via Stickersaccepted
  455. SIMBA UQ: Similarity-Based Aggregation for Uncertainty Quantification in Large Language Modelsaccepted
  456. SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMsaccepted
  457. SKRAG: A Retrieval-Augmented Generation Framework Guided by Reasoning Skeletons over Knowledge Graphsaccepted
  458. SLIM: Subtrajectory-Level Elimination for More Effective Reasoningaccepted
  459. SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impactsaccepted
  460. SLiNT: Structure-aware Language Model with Injection and Contrastive Training for Knowledge Graph Completionaccepted
  461. SLlama: Parameter-Efficient Language Model Architecture for Enhanced Linguistic Competence Under Strict Data Constraintsaccepted
  462. SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Modelsaccepted
  463. SMART: Simulated Students Aligned with Item Response Theory for Question Difficulty Predictionaccepted
  464. SMARTMiner: Extracting and Evaluating SMART Goals from Low-Resource Health Coaching Notesaccepted
  465. SMEC:Rethinking Matryoshka Representation Learning for Retrieval Embedding Compressionaccepted
  466. SNaRe: Domain-aware Data Generation for Low-Resource Event Detectionaccepted
  467. SOCIAL SCAFFOLDS: A Generalization Framework for Social Understanding Tasksaccepted
  468. SOLAR: Serendipity Optimized Language Model Aligned for Recommendationaccepted
  469. SOLAR: Towards Characterizing Subjectivity of Individuals through Modeling Value Conflicts and Trade-offsaccepted
  470. SOPL: A Sequential Optimal Learning Approach to Automated Prompt Engineering in Large Language Modelsaccepted
  471. SPARK: Simulating the Co-evolution of Stance and Topic Dynamics in Online Discourse with LLM-based Agentsaccepted
  472. SPE Attention: Making Attention Equivariant to Semantic-Preserving Permutation for Code Processingaccepted
  473. SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluationaccepted
  474. SPFT-SQL: Enhancing Large Language Model for Text-to-SQL Parsing by Self-Play Fine-Tuningaccepted
  475. SPIRIT: Patching Speech Language Models against Jailbreak Attacksaccepted
  476. SPO: Self Preference Optimization with Self Regularizationaccepted
  477. SPPD: Self-training with Process Preference Learning Using Dynamic Value Marginaccepted
  478. SPaRC: A Spatial Pathfinding Reasoning Challengeaccepted
  479. SQLSpace: A Representation Space for Text-to-SQL to Discover and Mitigate Robustness Gapsaccepted
  480. SQLWOZ: A Realistic Task-Oriented Dialogue Dataset with SQL-Based Dialogue State Representation for Complex User Requirementsaccepted
  481. SQUAB: Evaluating LLM robustness to Ambiguous and Unanswerable Questions in Semantic Parsingaccepted
  482. SQUARE: Unsupervised Retrieval Adaptation via Synthetic Dataaccepted
  483. SQUiD: Synthesizing Relational Databases from Unstructured Textaccepted
  484. SRM-LLM: Semantic Relationship Mining with LLMs for Temporal Knowledge Graph Extrapolationaccepted
  485. SSA-COMET: Do LLMs Outperform Learned Metrics in Evaluating MT for Under-Resourced African Languages?accepted
  486. SSA: Semantic Contamination of LLM-Driven Fake News Detectionaccepted
  487. STA-CoT: Structured Target-Centric Agentic Chain-of-Thought for Consistent Multi-Image Geological Reasoningaccepted
  488. STARE at the Structure: Steering ICL Exemplar Selection with Structural Alignmentaccepted
  489. STARQA: A Question Answering Dataset for Complex Analytical Reasoning over Structured Databasesaccepted
  490. START: Self-taught Reasoner with Toolsaccepted
  491. STEAM: A Semantic-Level Knowledge Editing Framework for Large Language Modelsaccepted
  492. STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Modelsaccepted
  493. STRICT: Stress-Test of Rendering Image Containing Textaccepted
  494. SUA: Stealthy Multimodal Large Language Model Unlearning Attackaccepted
  495. SUE: Sparsity-based Uncertainty Estimation via Sparse Dictionary Learningaccepted
  496. SURE: Safety Understanding and Reasoning Enhancement for Multimodal Large Language Modelsaccepted
  497. SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditionsaccepted
  498. SWAM: Adaptive Sliding Window and Memory-Augmented Attention Model for Rumor Detectionaccepted
  499. SWAN: An Efficient and Scalable Approach for Long-Context Language Modelingaccepted
  500. SYNC: A Synthetic Long-Context Understanding Benchmark for Controlled Comparisons of Model Capabilitiesaccepted
  501. SaCa: A Highly Compatible Reinforcing Framework for Knowledge Graph Embedding via Structural Pattern Contrastaccepted
  502. SafeConf: A Confidence-Calibrated Safety Self-Evaluation Method for Large Language Modelsaccepted
  503. SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Interventionaccepted
  504. SafeKey: Amplifying Aha-Moment Insights for Safety Reasoningaccepted
  505. SafeScientist: Enhancing AI Scientist Safety for Risk-Aware Scientific Discoveryaccepted
  506. SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signalsaccepted
  507. SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMsaccepted
  508. Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Mergingaccepted
  509. Safeguarding Privacy of Retrieval Data against Membership Inference Attacks: Is This Query Too Close to Home?accepted
  510. Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Modelsaccepted
  511. Safety in Large Reasoning Models: A Surveyaccepted
  512. SalaMAnder: Shapley-based Mathematical Expression Attribution and Metric for Chain-of-Thought Reasoningaccepted
  513. Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioningaccepted
  514. Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustnessaccepted
  515. Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Modelsaccepted
  516. Sample Efficient Alignment Learning With Episodic Controlaccepted
  517. SampleMix: A Sample-wise Pre-training Data Mixing Strategy by Coordinating Data Quality and Diversityaccepted
  518. Sarcasm-R1: Enhancing Sarcasm Detection through Focused Reasoningaccepted
  519. Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Modelsaccepted
  520. Scalable Data Synthesis through Human-like Cognitive Imitation and Data Recombinationaccepted
  521. Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaborationaccepted
  522. Scale Down to Speed Up: Dynamic Data Selection for Reinforcement Learningaccepted
  523. Scaling Laws Are Unreliable for Downstream Tasks: A Reality Checkaccepted
  524. Scaling Low-Resource MT via Synthetic Data Generation with LLMsaccepted
  525. Scaling Rich Style-Prompted Text-to-Speech Datasetsaccepted
  526. Scaling Up Temporal Domain Generalization via Temporal Experts Averagingaccepted
  527. Schema Generation for Large Knowledge Graphs Using Large Language Modelsaccepted
  528. ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contextsaccepted
  529. SciCompanion: Graph-Grounded Reasoning for Structured Evaluation of Scientific Argumentsaccepted
  530. SciEvent: Benchmarking Multi-domain Scientific Event Extractionaccepted
  531. SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLPaccepted
  532. SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literatureaccepted
  533. Scientific Paper Retrieval with LLM-Guided Semantic-Based Rankingaccepted
  534. SeMob: Semantic Synthesis for Dynamic Urban Mobility Predictionaccepted
  535. SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Modelsaccepted
  536. Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertaintyaccepted
  537. Search-o1: Agentic Search-Enhanced Large Reasoning Modelsaccepted
  538. Searching for the Most Human-like Emergent Languageaccepted
  539. SecDecoding: Steerable Decoding for Safer LLM Generationaccepted
  540. Section-Level Simplification of Biomedical Abstractsaccepted
  541. Seeing Culture: A Benchmark for Visual Reasoning and Groundingaccepted
  542. Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressorsaccepted
  543. Seeing Race, Feeling Bias: Emotion Stereotyping in Multimodal Language Modelsaccepted
  544. Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Modelsaccepted
  545. Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Modelsaccepted
  546. Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generationaccepted
  547. Seeing the Same Story Differently: Framing‐Divergent Event Coreference for Computational Framing Analysisaccepted
  548. Select to Know: An Internal-External Knowledge Self-Selection Framework for Domain-Specific Question Answeringaccepted
  549. Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Modelsaccepted
  550. Selective Preference Optimization via Token-Level Reward Function Estimationaccepted
  551. Self-Adjust Softmaxaccepted
  552. Self-Augmented Preference Alignment for Sycophancy Reduction in LLMsaccepted
  553. Self-Correcting Code Generation Using Small Language Modelsaccepted
  554. Self-Correction Makes LLMs Better Parsersaccepted
  555. Self-Critique and Refinement for Faithful Natural Language Explanationsaccepted
  556. Self-Ensemble: Mitigating Confidence Distortion for Large Language Modelsaccepted
  557. Self-Guided Function Calling in Large Language Models via Stepwise Experience Recallaccepted
  558. Self-Improvement in Multimodal Large Language Models: A Surveyaccepted
  559. Self-Supervised Prompt Optimizationaccepted
  560. Self-Training Large Language Models with Confident Reasoningaccepted
  561. Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenariosaccepted
  562. SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignmentaccepted
  563. SelfRACG: Enabling LLMs to Self-Express and Retrieve for Code Generationaccepted
  564. SemCSE: Semantic Contrastive Sentence Embeddings Using LLM-Generated Summaries For Scientific Abstractsaccepted
  565. SemVink: Advancing VLMs’ Semantic Understanding of Optical Illusions via Visual Global Thinkingaccepted
  566. Semantic Component Analysis: Introducing Multi-Topic Distributions to Clustering-Based Topic Modelingaccepted
  567. Semantic Contribution-Aware Adaptive Retrieval for Black-Box Modelsaccepted
  568. Semantic Geometry of Sentence Embeddingsaccepted
  569. Semantic Inversion, Identical Replies: Revisiting Negation Blindness in Large Language Modelsaccepted
  570. Semantic Networks Extracted from Students’ Think-Aloud Data are Correlated with Students’ Learning Performanceaccepted
  571. Semantic-Aware Action Space Compression via LLM-DRL Synergy for Efficient Task-oriented Dialogue Policy Explorationaccepted
  572. SenDetEX: Sentence-Level AI-Generated Text Detection for Human-AI Hybrid Content via Style and Context Fusionaccepted
  573. Sensitivity-LoRA : Low-Load Sensitivity-Based Fine-Tuning for Large Language Modelsaccepted
  574. SensorLLM: Aligning Large Language Models with Motion Sensors for Human Activity Recognitionaccepted
  575. Sentence Smith: Controllable Edits for Evaluating Text Embeddingsaccepted
  576. Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generationaccepted
  577. Sequence Structure Aware Retriever for Procedural Document Retrieval: A New Dataset and Baselineaccepted
  578. Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contextsaccepted
  579. Shallow Focus, Deep Fixes: Enhancing Shallow Layers Vision Attention Sinks to Alleviate Hallucination in LVLMsaccepted
  580. Shared Path: Unraveling Memorization in Multilingual LLMs through Language Similaritiesaccepted
  581. Sheaf Discovery with Joint Computation Graph Pruning and Flexible Granularityaccepted
  582. SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflectionaccepted
  583. Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translationaccepted
  584. Side Effects of Erasing Concepts from Diffusion Modelsaccepted
  585. SilVar: Speech-Driven Multimodal Model for Reasoning Visual Question Answering and Object Localizationaccepted
  586. SimBA: Simplifying Benchmark Analysis Using Performance Matrices Aloneaccepted
  587. SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Modelsaccepted
  588. SimVBG: Simulating Individual Values by Backstory Generationaccepted
  589. Similarity = Value? Consultation Value-Assessment and Alignment for Personalized Searchaccepted
  590. Simple Factuality Probes Detect Hallucinations in Long-Form Natural Language Generationaccepted
  591. Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantificationaccepted
  592. SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesisaccepted
  593. SimpleDoc: Multi‐Modal Document Understanding with Dual‐Cue Page Retrieval and Iterative Refinementaccepted
  594. Simulating Identity, Propagating Bias: Abstraction and Stereotypes in LLM-Generated Textaccepted
  595. SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?accepted
  596. Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimizationaccepted
  597. SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhalaaccepted
  598. Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluationaccepted
  599. Skeletons Matter: Dynamic Data Augmentation for Text-to-Queryaccepted
  600. Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketchingaccepted
  601. SkewRoute: Training-Free LLM Routing for Knowledge Graph Retrieval-Augmented Generation via Score Skewness of Retrieved Contextaccepted
  602. Skip-Thinking: Chunk-wise Chain-of-Thought Distillation Enable Smaller Language Models to Reason Better and Fasteraccepted
  603. SliceMoE: Routing Embedding Slices Instead of Tokens for Fine-Grained and Balanced Transformer Scalingaccepted
  604. SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Designaccepted
  605. Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistencyaccepted
  606. Small Models, Big Results: Achieving Superior Intent Extraction through Decompositionaccepted
  607. Smart-Searcher: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learningaccepted
  608. SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?accepted
  609. SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Modelsaccepted
  610. Social Bias Evaluation for Large Language Models Requires Prompt Variationsaccepted
  611. Social Bias in Multilingual Language Models: A Surveyaccepted
  612. Social Genome: Grounded Social Reasoning Abilities of Multimodal Modelsaccepted
  613. Social Good or Scientific Curiosity? Uncovering the Research Framing Behind NLP Artefactsaccepted
  614. SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Modelsaccepted
  615. Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questionsaccepted
  616. Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Modelsaccepted
  617. SolEval: Benchmarking Large Language Models for Repository-level Solidity Smart Contract Generationaccepted
  618. Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignmentaccepted
  619. SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Modelsaccepted
  620. Source-primed Multi-turn Conversation Helps Large Language Models Translate Documentsaccepted
  621. Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoningaccepted
  622. Sparse Activation Editing for Reliable Instruction Following in Narrativesaccepted
  623. Sparse Autoencoder Features for Classifications and Transferabilityaccepted
  624. Sparse Neurons Carry Strong Signals of Question Ambiguity in LLMsaccepted
  625. SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masksaccepted
  626. Sparsifying Mambaaccepted
  627. Sparsity May Be All You Need: Sparse Random Parameter Adaptationaccepted
  628. Spatial Layouts in News Homepages Capture Human Preferencesaccepted
  629. Speaking at the Right Level: Literacy-Controlled Counterspeech Generation with RAG-RLaccepted
  630. Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptanceaccepted
  631. SpecCoT: Accelerating Chain-of-Thought Reasoning through Speculative Explorationaccepted
  632. SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruningaccepted
  633. Spectral Scaling Laws in Language Models: emphHow Effectively Do Feed-Forward Networks Use Their Latent Space?accepted
  634. Speculating LLMs’ Chinese Training Data Pollution from Their Tokensaccepted
  635. Speculative Decoding for Multi-Sample Inferenceaccepted
  636. Speculative Safety-Aware Decodingaccepted
  637. Speculative Streaming: Efficient and Scalable Speculative Decoding with Multi-Stream Attentionaccepted
  638. Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMsaccepted
  639. Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documentsaccepted
  640. Spelling-out is not Straightforward: LLMs’ Capability of Tokenization from Token to Charactersaccepted
  641. Spiral of Silence in Large Language Model Agentsaccepted
  642. Split-Merge: Scalable and Memory-Efficient Merging of Expert LLMsaccepted
  643. Spoken Document Retrieval for an Unwritten Language: A Case Study on Gormatiaccepted
  644. Spontaneous Giving and Calculated Greed in Language Modelsaccepted
  645. SportReason: Evaluating Retrieval-Augmented Reasoning across Tables and Text for Sports Question Answeringaccepted
  646. Spotlighter: Revisiting Prompt Tuning from a Representative Mining Viewaccepted
  647. Staged Knowledge Distillation Through Least-to-Most Prompting: Optimizing Teacher Guidance via Difficulty-Aware Trainingaccepted
  648. Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experienceaccepted
  649. StandUp4AI: A New Multilingual Dataset for Humor Detection in Stand-up Comedy Videosaccepted
  650. Static Word Embeddings for Sentence Semantic Representationaccepted
  651. Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answeringaccepted
  652. Statistical and Neural Methods for Hawaiian Orthography Modernizationaccepted
  653. StatsChartMWP: A Dataset for Evaluating Multimodal Mathematical Reasoning Abilities on Math Word Problems with Statistical Chartsaccepted
  654. SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Modelsaccepted
  655. Steering LLM Reasoning Through Bias-Only Adaptationaccepted
  656. Steering LVLMs via Sparse Autoencoder for Hallucination Mitigationaccepted
  657. Steering Language Models in Multi-Token Generation: A Case Study on Tense and Aspectaccepted
  658. Step Guided Reasoning: Improving Mathematical Reasoning using Guidance Generation and Step Reasoningaccepted
  659. Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Modelsaccepted
  660. StepER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Modelsaccepted
  661. StepKE: Stepwise Knowledge Editing for Multi-Hop Question Answeringaccepted
  662. StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimizationaccepted
  663. Stepwise Informativeness Search for Improving LLM Reasoningaccepted
  664. Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs’ Reasoningaccepted
  665. StereoDetect: Detecting Stereotypes and Anti-stereotypes the Correct Way Using Social Psychological Underpinningsaccepted
  666. Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Frameworkaccepted
  667. Stimulate the Critical Thinking of LLMs via Debiasing Discussionaccepted
  668. Stop Looking for “Important Tokens” in Multimodal Language Models: Duplication Matters Moreaccepted
  669. Stop Playing the Guessing Game! Evaluating Conversational Recommender Systems via Target-free User Simulationaccepted
  670. Stratified Selective Sampling for Instruction Tuning with Dedicated Scoring Strategyaccepted
  671. Stress-Testing the Reasoning Competence of Language Models With Formal Proofsaccepted
  672. Stronger Baselines for Retrieval-Augmented Generation with Long-Context Language Modelsaccepted
  673. StructuThink: Reasoning with Task Transition Knowledge for Autonomous LLM-Based Agentsaccepted
  674. Structural Patent Classification Using Label Hierarchy Optimizationaccepted
  675. Structure Trumps Size: Rethinking Data Quality for LLM Reasoningaccepted
  676. Structure-Conditional Minimum Bayes Risk Decodingaccepted
  677. Structure-aware Propagation Generation with Large Language Models for Fake News Detectionaccepted
  678. Structured Moral Reasoning in Language Models: A Value-Grounded Evaluation Frameworkaccepted
  679. Structured Preference Optimization for Vision-Language Long-Horizon Task Planningaccepted
  680. Structuring Radiology Reports: Challenging LLMs with Lightweight Modelsaccepted
  681. Studying Rhetorically Ambiguous Questionsaccepted
  682. Studying the Role of Input-Neighbor Overlap in Retrieval-Augmented Language Models Training Efficiencyaccepted
  683. SuPreME: A Supervised Pre-training Framework for Multimodal ECG Representation Learningaccepted
  684. SubDocTrans: Enhancing Document-level Machine Translation with Plug-and-play Multi-granularity Knowledge Augmentationaccepted
  685. Subjective Behaviors and Preferences in LLM: Language of Browsingaccepted
  686. Subtle Risks, Critical Failures: A Framework for Diagnosing Physical Safety of LLMs for Embodied Decision Makingaccepted
  687. Sugar-Coated Poison: Benign Generation Unlocks Jailbreakingaccepted
  688. Summarize-Exemplify-Reflect: Data-driven Insight Distillation Empowers LLMs for Few-shot Tabular Classificationaccepted
  689. Summarizing Speech: A Comprehensive Surveyaccepted
  690. Superficial Self-Improved Reasoners Benefit from Model Mergingaccepted
  691. Superpose Task-specific Features for Model Mergingaccepted
  692. Supervised Attention Mechanism for Low-quality Multimodal Dataaccepted
  693. Surge: On the Potential of Large Language Models as General-Purpose Surrogate Code Executorsaccepted
  694. Surprise Calibration for Better In-Context Learningaccepted
  695. SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Modelsaccepted
  696. SwarmAgentic: Towards Fully Automated Agentic System Generation via Swarm Intelligenceaccepted
  697. SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformationaccepted
  698. SwiftPrune: Hessian-Free Weight Pruning for Large Language Modelsaccepted
  699. Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectoriesaccepted
  700. SynC-LLM: Generation of Large-Scale Synthetic Circuit Code with Hierarchical Language Modelsaccepted
  701. Synergizing Multimodal Temporal Knowledge Graphs and Large Language Models for Social Relation Recognitionaccepted
  702. Syntax-Aware Retrieval Augmentation for Neural Symbolic Regressionaccepted
  703. Synth-SBDH: A Synthetic Dataset of Social and Behavioral Determinants of Health for Clinical Textaccepted
  704. Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamicsaccepted
  705. T-MAD: Target-driven Multimodal Alignment for Stance Detectionaccepted
  706. T2: An Adaptive Test-Time Scaling Strategy for Contextual Question Answeringaccepted
  707. T2R-BENCH: A Benchmark for Real World Table-to-Report Taskaccepted
  708. TABARD: A Novel Benchmark for Tabular Anomaly Analysis, Reasoning and Detectionaccepted
  709. TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configurationaccepted
  710. TALON: A Multi-Agent Framework for Long-Table Exploration and Question Answeringaccepted
  711. TAPS: Tool-Augmented Personalisation via Structured Taggingaccepted
  712. TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptationaccepted
  713. TCP: a Benchmark for Temporal Constraint-Based Planningaccepted
  714. TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-makingaccepted
  715. TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysisaccepted
  716. TFDP: Token-Efficient Disparity Audits for Autoregressive LLMs via Single-Token Masked Evaluationaccepted
  717. THCM-CAL: Temporal-Hierarchical Causal Modelling with Conformal Calibration for Clinical Risk Predictionaccepted
  718. TIDES: Technical Information Discovery and Extraction Systemaccepted
  719. TIU-Bench: A Benchmark for Evaluating Large Multimodal Models on Text-rich Image Understandingaccepted
  720. TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Useaccepted
  721. TLUE: A Tibetan Language Understanding Evaluation Benchmarkaccepted
  722. TORSO: Template-Oriented Reasoning Towards General Tasksaccepted
  723. TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planningaccepted
  724. TR-MTEB: A Comprehensive Benchmark and Embedding Model Suite for Turkish Sentence Representationsaccepted
  725. TRIAL: Token Relations and Importance Aware Late-interaction for Accurate Text Retrievalaccepted
  726. TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?accepted
  727. TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detectionaccepted
  728. TS-CLIP: Time Series Understanding by CLIPaccepted
  729. TSVer: A Benchmark for Fact Verification Against Time-Series Evidenceaccepted
  730. TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluationaccepted
  731. TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Gamesaccepted
  732. TVQACML: Benchmarking Text-Centric Visual Question Answering in Multilingual Chinese Minority Languagesaccepted
  733. TabDSR: Decompose, Sanitize, and Reason for Complex Numerical Reasoning in Tabular Dataaccepted
  734. Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Fine-tuningaccepted
  735. Table-R1: Inference-Time Scaling for Table Reasoning Tasksaccepted
  736. Table-Text Alignment: Explaining Claim Verification Against Tables in Scientific Papersaccepted
  737. TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answeringaccepted
  738. TableRAG: A Retrieval Augmented Generation Framework for Heterogeneous Document Reasoningaccepted
  739. TactfulToM: Do LLMs have the Theory of Mind ability to understand White Lies?accepted
  740. Tag&Tab: Pretraining Data Detection in Large Language Models Using Keyword-Based Membership Inference Attackaccepted
  741. TailorRPA: A Retrieval-Based Framework for Eliciting Personalized and Coherent Role-Playing Agents in General Domainaccepted
  742. Tailoring Table Retrieval from a Field-aware Hybrid Matching Perspectiveaccepted
  743. Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learningaccepted
  744. Tales of Morality: Comparing Human- and LLM-Generated Moral Stories from Visual Cuesaccepted
  745. Taming Text-to-Image Synthesis for Novices: User-centric Prompt Generation via Multi-turn Guidanceaccepted
  746. Targeted Distillation for Sentiment Analysisaccepted
  747. Task-Aware Resolution Optimization for Visual Large Language Modelsaccepted
  748. Task-aware Contrastive Mixture of Experts for Quadruple Extraction in Conversations with Code-like Replies and Non-opinion Detectionaccepted
  749. TaxoAlign: Scholarly Taxonomy Generation Using Language Modelsaccepted
  750. Teach Small Models to Reason by Curriculum Distillationaccepted
  751. Teaching According to Talents! Instruction Tuning LLMs with Competence-Aware Curriculum Learningaccepted
  752. Teaching LLMs to Plan, Not Just Solve: Plan Learning Boosts LLMs Generalization in Reasoning Tasksaccepted
  753. Teaching Language Models To Gather Information Proactivelyaccepted
  754. Teaching Your Models to Understand Code via Focal Preference Alignmentaccepted
  755. TempParaphraser: “Heating Up” Text to Evade AI-Text Detection through Paraphrasingaccepted
  756. Temporal Alignment of Time Sensitive Facts with Activation Engineeringaccepted
  757. Temporal Consistency for LLM Reasoning Process Error Identificationaccepted
  758. Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?accepted
  759. Temporal Scaling Law for Large Language Modelsaccepted
  760. Test-Time Steering for Lossless Text Compression via Weighted Product of Expertsaccepted
  761. Text Anomaly Detection with Simplified Isolation Kernelaccepted
  762. Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalizationaccepted
  763. Text Meets Topology: Rethinking Out-of-distribution Detection in Text-Rich Networksaccepted
  764. Text Takes Over: A Study of Modality Bias in Multimodal Intent Detectionaccepted
  765. Text or Pixels? Evaluating Efficiency and Understanding of LLMs with Visual Text Inputsaccepted
  766. Text-centric Alignment for Bridging Test-time Unseen Modalityaccepted
  767. Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Textaccepted
  768. Textual Aesthetics in Large Language Modelsaccepted
  769. The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectnessaccepted
  770. The Effect of Language Diversity When Fine-Tuning Large Language Models for Translationaccepted
  771. The Emperor’s New Reasoning: Format Imitation Overshadows Genuine Mathematical Understanding in SFTaccepted
  772. The Enemy from Within: A Study of Political Delegitimization Discourse in Israeli Political Speechaccepted
  773. The Face of Persuasion: Analyzing Bias and Generating Culture-Aware Adsaccepted
  774. The Good, the Bad and the Constructive: Automatically Measuring Peer Review’s Utility for Authorsaccepted
  775. The Good, the Bad, and the Debatable: A Survey on the Impacts of Data for In-Context Learningaccepted
  776. The Green KNIGHT: Green Machine Translation with Knowledge-Distilled, Narrow, Inexpensive, Greedy, Hybrid Transformersaccepted
  777. The Hallucination Tax of Reinforcement Finetuningaccepted
  778. The Hidden Strength of Disagreement: Unraveling the Consensus-Diversity Tradeoff in Adaptive Multi-Agent Systemsaccepted
  779. The Illusion of Progress: Re-evaluating Hallucination Detection in LLMsaccepted
  780. The Illusion of Randomness: How LLMs Fail to Emulate Stochastic Decision-Making in Rock-Paper-Scissors Games?accepted
  781. The Impact of Language Mixing on Bilingual LLM Reasoningaccepted
  782. The Impact of Negated Text on Hallucination with Large Language Modelsaccepted
  783. The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representationsaccepted
  784. The Language of Interoception: Examining Embodiment and Emotion Through a Corpus of Body Part Mentionsaccepted
  785. The Medium Is Not the Message: Deconfounding Document Embeddings via Linear Concept Erasureaccepted
  786. The Missing Parts: Augmenting Fact Verification with Half Truth Detectionaccepted
  787. The More, The Better? A Critical Study of Multimodal Context in Radiology Report Summarizationaccepted
  788. The Power of Framing: How News Headlines Guide Search Behavioraccepted
  789. The Practical Impacts of Theoretical Constructs on Empathy Modelingaccepted
  790. The Price of Format: Diversity Collapse in LLMsaccepted
  791. The Progress Illusion: Revisiting meta-evaluation standards of LLM evaluatorsaccepted
  792. The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Modelsaccepted
  793. The Psychology of Falsehood: A Human-Centric Survey of Misinformation Detectionaccepted
  794. The Pursuit of Empathy: Evaluating Small Language Models for PTSD Dialogue Supportaccepted
  795. The RAG Paradox: A Black-Box Attack Exploiting Unintentional Vulnerabilities in Retrieval-Augmented Generation Systemsaccepted
  796. The Ranking Blind Spot: Decision Hijacking in LLM-based Text Rankingaccepted
  797. The Role of Model Confidence on Bias Effects in Measured Uncertainties for Vision-Language Modelsaccepted
  798. The Role of Outgoing Connection Heterogeneity in Feedforward Layers of Large Language Modelsaccepted
  799. The Search for Conflicts of Interest: Open Information Extraction in Scientific Publicationsaccepted
  800. The Security Threat of Compressed Projectors in Large Vision-Language Modelsaccepted
  801. The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathologyaccepted
  802. The Staircase of Ethics: Probing LLM Value Priorities through Multi-Step Induction to Complex Moral Dilemmasaccepted
  803. The State of Multilingual LLM Safety Research: From Measuring The Language Gap To Mitigating Itaccepted
  804. The Stepwise Deception: Simulating the Evolution from True News to Fake News with LLM Agentsaccepted
  805. The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Modelsaccepted
  806. The Transfer Neurons Hypothesis: An Underlying Mechanism for Language Latent Space Transitions in Multilingual LLMsaccepted
  807. The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate Itaccepted
  808. The discordance between embedded ethics and cultural inference in large language modelsaccepted
  809. The “r” in “woman” stands for rights. Auditing LLMs in Uncovering Social Dynamics in Implicit Misogynyaccepted
  810. Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoningaccepted
  811. Think Clearly: Improving Reasoning via Redundant Token Pruningaccepted
  812. Think Globally, Group Locally: Evaluating LLMs Using Multi-Lingual Word Grouping Gamesaccepted
  813. Think Right, Not More: Test-Time Scaling for Numerical Claim Verificationaccepted
  814. Think Twice, Generate Once: Safeguarding by Progressive Self-Reflectionaccepted
  815. Think Wider, Detect Sharper: Reinforced Reference Coverage for Document-Level Self-Contradiction Detectionaccepted
  816. Think and Recall: Layer-Level Prompting for Lifelong Model Editingaccepted
  817. Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Modelaccepted
  818. Think, Verbalize, then Speak: Bridging Complex Thoughts and Comprehensible Speechaccepted
  819. ThinkAnswer Loss: Balancing Semantic Similarity and Exact Matching for LLM Reasoning Enhancementaccepted
  820. ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Modelsaccepted
  821. ThinkQE: Query Expansion via an Evolving Thinking Processaccepted
  822. ThinkSLM: Towards Reasoning in Small Language Modelsaccepted
  823. ThinkSwitcher: When to Think Hard, When to Think Fastaccepted
  824. ThinkTuning: Instilling Cognitive Reflections without Distillationaccepted
  825. Thinking Before You Speak: A Proactive Test-time Scaling Approachaccepted
  826. Thinking Out Loud: Do Reasoning Models Know When They’re Right?accepted
  827. Third-Person Appraisal Agent: Simulating Human Emotional Reasoning in Text with Large Language Modelsaccepted
  828. This is not a Disimprovement: Improving Negation Reasoning in Large Language Models via Prompt Engineeringaccepted
  829. Thought calibration: Efficient and confident test-time scalingaccepted
  830. ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representationsaccepted
  831. Thread: A Logic-Based Data Organization Paradigm for How-To Question Answering with Retrieval Augmented Generationaccepted
  832. Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variationaccepted
  833. Through the Valley: Path to Effective Long CoT Training for Small Language Modelsaccepted
  834. Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgmentsaccepted
  835. Time to Revisit Exact Matchaccepted
  836. Time to Talk: LLM Agents for Asynchronous Group Communication in Mafia Gamesaccepted
  837. Tiny Budgets, Big Gains: Parameter Placement Strategy in Parameter Super-Efficient Fine-Tuningaccepted
  838. TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Researchaccepted
  839. To Answer or Not to Answer (TAONA): A Robust Textual Graph Understanding and Question Answering Approachaccepted
  840. To Mask or to Mirror: Human-AI Alignment in Collective Reasoningaccepted
  841. To See a World in a Spark of Neuron: Disentangling Multi-Task Interference for Training-Free Model Mergingaccepted
  842. ToDi: Token-wise Distillation via Fine-Grained Divergence Controlaccepted
  843. ToM-SSI: Evaluating Theory of Mind in Situated Social Interactionsaccepted
  844. ToM: Leveraging Tree-oriented MapReduce for Long-Context Reasoning in Large Language Modelsaccepted
  845. Token Knowledge: A New Perspective For Knowledge in Large Language Modelsaccepted
  846. Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigationaccepted
  847. Token-Aware Editing of Internal Activations for Large Language Model Alignmentaccepted
  848. Token-Level Metrics for Detecting Incorrect Gold Annotations in Named Entity Recognitionaccepted
  849. Token-level Proximal Policy Optimization for Query Generationaccepted
  850. TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selectionaccepted
  851. TokenSkip: Controllable Chain-of-Thought Compression in LLMsaccepted
  852. Tokenization and Representation Biases in Multilingual Models on Dialectal NLP Tasksaccepted
  853. TombRaider: Entering the Vault of History to Jailbreak Large Language Modelsaccepted
  854. ToneCraft: Cantonese Lyrics Generation with Harmony of Tones and Pitchesaccepted
  855. Too Consistent to Detect: A Study of Self-Consistent Errors in LLMsaccepted
  856. Too Helpful, Too Harmless, Too Honest or Just Right?accepted
  857. Tool Preferences in Agentic LLMs are Unreliableaccepted
  858. Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratchaccepted
  859. ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactionsaccepted
  860. ToolSafety: A Comprehensive Dataset for Enhancing Safety in LLM-Based Agent Tool Invocationsaccepted
  861. Toolscaler: Scalable Generative Tool Calling via Structure-Aware Semantic Tokenizationaccepted
  862. TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translationaccepted
  863. Topic Coverage-based Demonstration Retrieval for In-Context Learningaccepted
  864. Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarizationaccepted
  865. TopicAttack: An Indirect Prompt Injection Attack via Topic Transitionaccepted
  866. TounsiBench: Benchmarking Large Language Models for Tunisian Arabicaccepted
  867. Toward Efficient Sparse Autoencoder-Guided Steering for Improved In-Context Learning in Large Language Modelsaccepted
  868. Toward Inclusive Language Models: Sparsity-Driven Calibration for Systematic and Interpretable Mitigation of Social Biases in LLMsaccepted
  869. Toward Machine Interpreting: Lessons from Human Interpreting Studiesaccepted
  870. Toward Machine Translation Literacy: How Lay Users Perceive and Rely on Imperfect Translationsaccepted
  871. Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoningaccepted
  872. Toward Optimal LLM Alignments Using Two-Player Gamesaccepted
  873. Toward the Automatic Detection of Word Meaning Negotiation Indicators in Conversationaccepted
  874. Towards AI-Assisted Psychotherapy: Emotion-Guided Generative Interventionsaccepted
  875. Towards Achieving Concept Completeness for Textual Concept Bottleneck Modelsaccepted
  876. Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Provingaccepted
  877. Towards Author-informed NLP: Mind the Social Biasaccepted
  878. Towards Automated Error Discovery: A Study in Conversational AIaccepted
  879. Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Surveyaccepted
  880. Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationalesaccepted
  881. Towards Event Extraction with Massive Types: LLM-based Collaborative Annotation and Partitioning Extractionaccepted
  882. Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Modelsaccepted
  883. Towards General-Domain Word Sense Disambiguation: Distilling Large Language Model into Compact Disambiguatoraccepted
  884. Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Surveyaccepted
  885. Towards Infinite-Long Prefix in Transformeraccepted
  886. Towards Language-Agnostic STIPA: Universal Phonetic Transcription to Support Language Documentation at Scaleaccepted
  887. Towards Low-Resource Alignment to Diverse Perspectives with Sparse Feedbackaccepted
  888. Towards More Efficient Post-training via Fourier Domain Adapter Frameworkaccepted
  889. Towards Multi-Document Question Answering in Scientific Literature: Pipeline, Dataset, and Evaluationaccepted
  890. Towards Optimal Evaluation Efficiency for Large Language Modelsaccepted
  891. Towards Personalized Conversational Sales Agents: Contextual User Profiling for Strategic Actionaccepted
  892. Towards Reverse Engineering of Language Models: A Surveyaccepted
  893. Towards Robust Few-Shot Relation Classification: Incorporating Relation Description with Agreementaccepted
  894. Towards Robust Mathematical Reasoningaccepted
  895. Towards Statistical Factuality Guarantee for Large Vision-Language Modelsaccepted
  896. Towards Transferable Personality Representation Learning based on Triplet Comparisons and Its Applicationsaccepted
  897. Towards Universal Debiasing for Language Models-based Tabular Data Generationaccepted
  898. Towards a Holistic and Automated Evaluation Framework for Multi-Level Comprehension of LLMs in Book-Length Contextsaccepted
  899. Towards a Unified Paradigm of Concept Editing in Large Language Modelsaccepted
  900. Towards the Roots of the Negation Problem: A Multilingual NLI Dataset and Model Scaling Analysisaccepted
  901. Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore’s Low-Resource Languagesaccepted
  902. TrInk: Ink Generation with Transformer Networkaccepted
  903. TracSum: A New Benchmark for Aspect-Based Summarization with Sentence-Level Traceability in Medical Domainaccepted
  904. Tracing L1 Interference in English Learner Writing: A Longitudinal Corpus with Error Annotationsaccepted
  905. Tracing Multilingual Factual Knowledge Acquisition in Pretrainingaccepted
  906. Tracing Training Footprints: A Calibration Approach for Membership Inference Attacks Against Multimodal Large Language Modelsaccepted
  907. Train It and Forget It: Merge Lists are Unnecessary for BPE Inference in Language Modelsaccepted
  908. Train Once for All: A Transitional Approach for Efficient Aspect Sentiment Triplet Extractionaccepted
  909. Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracyaccepted
  910. Train a Unified Multimodal Data Quality Classifier with Synthetic Dataaccepted
  911. Training LLMs for Optimization Modeling via Iterative Data Synthesis and Structured Validationaccepted
  912. Training LLMs to be Better Text Embedders through Bidirectional Reconstructionaccepted
  913. Training Language Models to Critique With Multi-agent Feedbackaccepted
  914. Training Medical QA Models Based on Mixed Rewards from Multiple-Choice and Open-Ended Questionsaccepted
  915. Training Text-to-Molecule Models with Context-Aware Tokenizationaccepted
  916. Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Modelsaccepted
  917. Training compute-optimal transformer encoder modelsaccepted
  918. Training with Fewer Bits: Unlocking Edge LLMs Training with Stochastic Roundingaccepted
  919. TransAlign: Machine Translation Encoders are Strong Word Aligners, Tooaccepted
  920. TransBERT: A Framework for Synthetic Translation in Domain-Specific Language Modelingaccepted
  921. Transfer-Aware Data Selection for Domain Adaptation in Text Retrievalaccepted
  922. Transferable Direct Prompt Injection via Activation-Guided MCMC Samplingaccepted
  923. Transformer-Based Temporal Information Extraction and Application: A Reviewaccepted
  924. Transitive self-consistency evaluation of NLI models without gold labelsaccepted
  925. Translate Smart, not Hard: Cascaded Translation Systems with Quality-Aware Deferralaccepted
  926. Translating Domain-Specific Terminology in Typologically-Diverse Languages: A Study in Tax and Financial Educationaccepted
  927. Translation in the Hands of Many: Centering Lay Users in Machine Translation Interactionsaccepted
  928. Translationese-index: Using Likelihood Ratios for Graded and Generalizable Measurement of Translationeseaccepted
  929. Transparent and Coherent Procedural Mistake Detectionaccepted
  930. Transplant Then Regenerate: A New Paradigm for Text Data Augmentationaccepted
  931. TrapDoc: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documentsaccepted
  932. Treble Counterfactual VLMs: A Causal Approach to Hallucinationaccepted
  933. Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoningaccepted
  934. Tree-Structured Non-Autoregressive Decoding for Sequence-to-Sequence Text Generationaccepted
  935. Tree-of-Quote Prompting Improves Factuality and Attribution in Multi-Hop and Medical Reasoningaccepted
  936. TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Samplingaccepted
  937. TreeRare: Syntax Tree-Guided Retrieval and Reasoning for Knowledge-Intensive Question Answeringaccepted
  938. TreeReview: A Dynamic Tree of Questions Framework for Deep and Efficient LLM-based Scientific Peer Reviewaccepted
  939. TriSPrompt: A Hierarchical Soft Prompt Model for Multimodal Rumor Detection with Incomplete Modalitiesaccepted
  940. Triangulating LLM Progress through Benchmarks, Games, and Cognitive Testsaccepted
  941. TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agentaccepted
  942. TrojanWave: Exploiting Prompt Learning for Stealthy Backdoor Attacks on Large Audio-Language Modelsaccepted
  943. Trojsten Benchmark: Evaluating LLM Problem-Solving in Slovak STEM Competition Problemsaccepted
  944. Trust Me, I’m Wrong: LLMs Hallucinate with Certainty Despite Knowing the Answeraccepted
  945. Trustworthy Medical Question Answering: An Evaluation-Centric Surveyaccepted
  946. Tuning Less, Prompting More: In-Context Preference Learning Pipeline for Natural Language Transformationaccepted
  947. TurBLiMP: A Turkish Benchmark of Linguistic Minimal Pairsaccepted
  948. TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Textaccepted
  949. TurnBack: A Geospatial Route Cognition Benchmark for Large Language Models through Reverse Routeaccepted
  950. TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Modelsaccepted
  951. TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Gamesaccepted
  952. Turning Logic Against Itself: Probing Model Defenses Through Contrastive Questionsaccepted
  953. Turning the Tide: Repository-based Code Reflectionaccepted
  954. TwT: Thinking without Tokens by Habitual Reasoning Distillation with Multi-Teachers’ Guidanceaccepted
  955. Two Challenges, One Solution: Robust Multimodal Learning through Dynamic Modality Recognition and Enhancementaccepted
  956. Two Heads Are Better Than One: Dual-Model Verbal Reflection at Inference-Timeaccepted
  957. Two Steps from Hell: Compositionality on Chemical LMsaccepted
  958. Type-Less yet Type-Aware Inductive Link Prediction with Pretrained Language Modelsaccepted
  959. UI-Hawk: Unleashing the Screen Stream Understanding for Mobile GUI Agentsaccepted
  960. UICOMPASS: UI Map Guided Mobile Task Automation via Adaptive Action Generationaccepted
  961. UIOrchestra: Generating High-Fidelity Code from UI Designs with a Multi-agent Systemaccepted
  962. UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targetsaccepted
  963. ULTRABENCH: Benchmarking LLMs under Extreme Fine-grained Text Generationaccepted
  964. UNCERTAINTY-LINE: Length-Invariant Estimation of Uncertainty for Large Language Modelsaccepted
  965. UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generationaccepted
  966. UNComp: Can Matrix Entropy Uncover Sparsity? — A Compressor Design from an Uncertainty-Aware Perspectiveaccepted
  967. UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulationaccepted
  968. URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Modelsaccepted
  969. UTMath: A Benchmark for Math Evaluation with Unit Testaccepted
  970. UltraIF: Advancing Instruction Following from the Wildaccepted
  971. UnCo: Uncertainty-Driven Collaborative Framework of Large and Small Models for Grounded Multimodal NERaccepted
  972. Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systemsaccepted
  973. Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Modelsaccepted
  974. Uncovering Argumentative Flow: A Question-Focus Discourse Structuring Frameworkaccepted
  975. Uncovering Factor-Level Preference to Improve Human-Model Alignmentaccepted
  976. Uncovering Scaling Laws for Large Language Models via Inverse Problemsaccepted
  977. Uncovering the Bigger Picture: Comprehensive Event Understanding Via Diverse News Retrievalaccepted
  978. Under the Shadow of Babel: How Language Shapes Reasoning in LLMsaccepted
  979. Understanding GUI Agent Localization Biases through Logit Sharpnessaccepted
  980. Understanding How Value Neurons Shape the Generation of Specified Values in LLMsaccepted
  981. Understanding LLMs’ Cross-Lingual Context Retrieval: How Good It Is And Where It Comes Fromaccepted
  982. Understanding Refusal in Language Models with Sparse Autoencodersaccepted
  983. Understanding Subword Compositionality of Large Language Modelsaccepted
  984. Understanding and Improving Information Preservation in Prompt Compression for LLMsaccepted
  985. Understanding and Leveraging the Expert Specialization of Context Faithfulness in Mixture-of-Experts LLMsaccepted
  986. Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundaryaccepted
  987. Understanding the Information Propagation Effects of Communication Topologies in LLM-based Multi-Agent Systemsaccepted
  988. Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanismaccepted
  989. Understanding the Modality Gap: An Empirical Study on the Speech-Text Alignment Mechanism of Large Speech Language Modelsaccepted
  990. Understanding the Thinking Process of Reasoning Models: A Perspective from Schoenfeld’s Episode Theoryaccepted
  991. Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoningaccepted
  992. Unequal Scientific Recognition in the Age of LLMsaccepted
  993. UniCoM: A Universal Code-Switching Speech Generatoraccepted
  994. UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debuggingaccepted
  995. UniRAG: A Unified RAG Framework for Knowledge-Intensive Queries with Decomposition, Break-Down Reasoning, and Iterative Rewritingaccepted
  996. UniSpeaker: A Unified Approach for Multimodality-driven Speaker Generationaccepted
  997. UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasetsaccepted
  998. Uniform Information Density and Syntactic Reduction: Revisiting *that*-Mentioning in English Complement Clausesaccepted
  999. Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inferenceaccepted
  1000. UnitCoder: Scalable Code Synthesis from Pre-training Corporaaccepted

Looking for submission deadlines instead? See the conference deadline calendar.