← All conferences

ACL 2025 Accepted Papers

The full list of 3,086 papers accepted at ACL 2025 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Long: 1,602finding: 1,387Short: 97
  1. On the Mutual Influence of Gender and Occupation in LLM RepresentationsLong
  2. On the Relation Between Fine-Tuning, Topological Properties, and Task Performance in Sense-Enhanced EmbeddingsLong
  3. On the Reliability of Large Language Models for Causal DiscoveryLong
  4. On the Risk of Evidence Pollution for Malicious Social Text Detection in the Era of LLMsLong
  5. On the Robust Approximation of ASR Metricsfinding
  6. On the Role of Semantic Proto-roles in Semantic Analysis: What do LLMs know about agency?finding
  7. On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigationfinding
  8. One QuantLLM for ALL: Fine-tuning Quantized LLMs Once for Efficient DeploymentsLong
  9. One for All: Update Parameterized Knowledge Across Multiple Models with Once EditLong
  10. One-Dimensional Object Detection for Streaming Text Segmentation of Meeting Dialoguefinding
  11. One-for-All Pruning: A Universal Model for Customized Compression of Large Language Modelsfinding
  12. Online Iterative Self-Alignment for Radiology Report GenerationLong
  13. Only a Little to the Left: A Theory-grounded Measure of Political Bias in Large Language ModelsLong
  14. Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question AnsweringLong
  15. Open-Set Living Need Prediction with Large Language Modelsfinding
  16. Open-World Attribute Mining for E-Commerce Products with Multimodal Self-Correction Instruction TuningLong
  17. Open-World Authorship Attributionfinding
  18. Open-World Planning via Lifted Regression with LLM-Inferred Affordances for Embodied AgentsLong
  19. OpenCoder: The Open Cookbook for Top-Tier Code Large Language ModelsLong
  20. OpenHuEval: Evaluating Large Language Model on Hungarian Specificsfinding
  21. OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and OptimizationLong
  22. Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal TransportLong
  23. Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent Systemfinding
  24. Optimal Transport-Based Token Weighting scheme for Enhanced Preference OptimizationLong
  25. Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrievalfinding
  26. Optimizing Decomposition for Optimal Claim VerificationLong
  27. Optimizing Multi-Hop Document Retrieval Through Intermediate Representationsfinding
  28. Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert ModelsLong
  29. Optimizing Question Semantic Space for Dynamic Retrieval-Augmented Multi-hop Question AnsweringLong
  30. Optimizing Reasoning for Text-to-SQL with Execution Feedbackfinding
  31. Order Matters: Investigate the Position Bias in Multi-constraint Instruction Followingfinding
  32. Out-of-Distribution Detection via LLM-Guided Outlier Generation for Text-attributed Graphfinding
  33. Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language ModelsLong
  34. Outlier-weighed Layerwise Sampling for LLM Fine-tuningfinding
  35. P-CoT: A Pedagogically-motivated Participatory Chain-of-Thought Prompting for Phonological Reasoning in LLMsfinding
  36. P-React: Synthesizing Topic-Adaptive Reactions of Personality Traits via Mixture of Specialized LoRA Expertsfinding
  37. P2 Law: Scaling Law for Post-Training After Model PruningLong
  38. P3: Prompts Promote Promptingfinding
  39. PAM: Paraphrase AMR-Centric Evaluation Metricfinding
  40. PAP2PAT: Benchmarking Outline-Guided Long-Text Patent Generation with Patent-Paper Pairsfinding
  41. PARME: Parallel Corpora for Low-Resourced Middle Eastern LanguagesLong
  42. PARSQL: Enhancing Text-to-SQL through SQL Parsing and Reasoningfinding
  43. PASTEL : Polarity-Aware Sentiment Triplet Extraction with LLM-as-a-Judgefinding
  44. PCoT: Persuasion-Augmented Chain of Thought for Detecting Fake News and Social Media DisinformationLong
  45. PECAN: LLM-Guided Dynamic Progress Control with Attention-Guided Hierarchical Weighted Graph for Long-Document QAfinding
  46. PEToolLLM: Towards Personalized Tool Learning in Large Language Modelsfinding
  47. PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowchartsfinding
  48. PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimizationfinding
  49. PIC: Unlocking Long-Form Text Generation Capabilities of Large Language Models via Position ID CompressionLong
  50. PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context OptimizationLong
  51. PIGuard: Prompt Injection Guardrail via Mitigating Overdefense for FreeLong
  52. PIPER: Benchmarking and Prompting Event Reasoning Boundary of LLMs via Debiasing-Distillation Enhanced TuningLong
  53. PISCO: Pretty Simple Compression for Retrieval-Augmented Generationfinding
  54. PKAG-DDI: Pairwise Knowledge-Augmented Language Model for Drug-Drug Interaction Event Text GenerationLong
  55. PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human PreferenceLong
  56. PLAY2PROMPT: Zero-shot Tool Instruction Optimization for LLM Agents via Tool Playfinding
  57. PM3-KIE: A Probabilistic Multi-Task Meta-Model for Document Key Information Extractionfinding
  58. PPT: A Minor Language News Recommendation Model via Cross-Lingual Preference Pattern TransferLong
  59. PQR: Improving Dense Retrieval via Potential Query ModelingLong
  60. PRISM: A Framework for Producing Interpretable Political Bias Embeddings with Political-Aware Cross-EncoderLong
  61. PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward ModelsLong
  62. PROMTEC: Fast LLM Inference Decoding using Prompt Multi-Lookup with Template Database and Common Sequencesfinding
  63. PROPER: A Progressive Learning Framework for Personalized Large Language Models with Group-Level AdaptationLong
  64. PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language ModelsLong
  65. PVP: An Image Dataset for Personalized Visual Persuasion with Persuasion Strategies, Viewer Characteristics, and Persuasiveness RatingsLong
  66. PaSa: An LLM Agent for Comprehensive Academic Paper SearchLong
  67. Packing Analysis: Packing Is More Appropriate for Large Models or Datasets in Supervised Fine-tuningfinding
  68. Palm: A Culturally Inclusive and Linguistically Diverse Dataset for Arabic LLMsLong
  69. Pandora’s Box or Aladdin’s Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language ModelsLong
  70. Parameter-Aware Contrastive Knowledge Editing: Tracing and Rectifying based on Critical Transmission PathsLong
  71. Parameter-Efficient Fine-Tuning via Circular Convolutionfinding
  72. Parenting: Optimizing Knowledge Selection of Retrieval-Augmented Language Models with Parameter Decoupling and Tailored TuningLong
  73. Partial Colexifications Improve Concept EmbeddingsLong
  74. Past Meets Present: Creating Historical Analogy with Large Language ModelsLong
  75. Pattern Recognition or Medical Knowledge? The Problem with Multiple-Choice Questions in MedicineLong
  76. Patterns Over Principles: The Fragility of Inductive Reasoning in LLMs under Noisy Observationsfinding
  77. People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated textLong
  78. PerSphere: A Comprehensive Framework for Multi-Faceted Perspective Retrieval and SummarizationLong
  79. Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language ModelsLong
  80. Persistent Homology of Topic Networks for the Prediction of Reader CuriosityLong
  81. Persona Dynamics: Unveiling the Impact of Persona Traits on Agents in Text-Based GamesLong
  82. Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgmentfinding
  83. PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Datafinding
  84. PersonaLens: A Benchmark for Personalization Evaluation in Conversational AI Assistantsfinding
  85. PersonaX: A Recommendation Agent-Oriented User Modeling Framework for Long Behavior Sequencefinding
  86. Personal Travel Solver: A Preference-Driven LLM-Solver System for Travel PlanningLong
  87. Personality-Guided Code Generation Using Large Language ModelsLong
  88. Personalized Generation In Large Model Era: A SurveyLong
  89. Personalized Text Generation with Contrastive Activation SteeringLong
  90. Perspective Transition of Large Language Models for Solving Subjective Tasksfinding
  91. Phonotomizer: A Compact, Unsupervised, Online Training Approach to Real-Time, Multilingual Phonetic SegmentationLong
  92. PhysReason: A Comprehensive Benchmark towards Physics-Based ReasoningLong
  93. Physics: Benchmarking Foundation Models on University-Level Physics Problem Solvingfinding
  94. PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decodingfinding
  95. Pitfalls of Scale: Investigating the Inverse Task of Redefinition in Large Language Modelsfinding
  96. Pixel-Level Reasoning Segmentation via Multi-turn ConversationsLong
  97. PlanGenLLMs: A Modern Survey of LLM Planning CapabilitiesLong
  98. Planning with Diffusion Models for Target-Oriented Dialogue SystemsLong
  99. Planning-Driven Programming: A Large Language Model Programming WorkflowLong
  100. PlanningArena: A Modular Benchmark for Multidimensional Evaluation of Planning and Tool LearningLong
  101. Plug-in and Fine-tuning: Bridging the Gap between Small Language Models and Large Language ModelsLong
  102. PodAgent: A Comprehensive Framework for Podcast Generationfinding
  103. Polishing Every Facet of the GEM: Testing Linguistic Competence of LLMs and Humans in KoreanLong
  104. PolyNarrative: A Multilingual, Multilabel, Multi-domain Dataset for Narrative Extraction from News ArticlesLong
  105. Ponder & Press: Advancing Visual GUI Agent towards General Computer Controlfinding
  106. PopAlign: Diversifying Contrasting Patterns for a More Comprehensive AlignmentLong
  107. Position Paper: MeMo: Towards Language Models with Associative Memory Mechanismsfinding
  108. Position-Aware Depth Decay Decoding (D3): Boosting Large Language Model Inference Efficiencyfinding
  109. Position-aware Automatic Circuit DiscoveryLong
  110. Positional Overload: Positional Debiasing and Context Window Extension for Large Language Models using Set EncodingLong
  111. Powerformer: Efficient and High-Accuracy Privacy-Preserving Language Model with Homomorphic EncryptionLong
  112. Praetor: A Fine-Grained Generative LLM Evaluator with Instance-Level Customizable Evaluation CriteriaLong
  113. Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and ChallengesLong
  114. Pre-Training Curriculum for Multi-Token Prediction in Language ModelsLong
  115. Pre-training Distillation for Large Language Models: A Design Space ExplorationLong
  116. Pre3: Enabling Deterministic Pushdown Automata for Faster Structured LLM GenerationLong
  117. PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR AccuracyLong
  118. PreSumm: Predicting Summarization Performance Without Summarizingfinding
  119. Predicate-Conditional Conformalized Answer Sets for Knowledge Graph Embeddingsfinding
  120. PredictaBoard: Benchmarking LLM Score Predictabilityfinding
  121. Predicting Depression in Screening Interviews from Interactive Multi-Theme Collaborationfinding
  122. Predicting Implicit Arguments in Procedural Video InstructionsLong
  123. Predicting Through Generation: Why Generation Is Better for PredictionLong
  124. Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual SignalsLong
  125. Prediction Hubs are Context-Informed Frequent Tokens in LLMsLong
  126. Prediction-Augmented Generation for Automatic Diagnosis Tasksfinding
  127. Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Datafinding
  128. Pretraining Context Compressor for Large Language Models with Embedding-Based MemoryLong
  129. Principled Content Selection to Generate Diverse and Personalized Multi-Document SummariesLong
  130. Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning TasksLong
  131. PrivaCI-Bench: Evaluating Privacy with Contextual Integrity and Legal ComplianceLong
  132. Privacy Ripple Effects from Adding or Removing Personal Information in Language Model Trainingfinding
  133. PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and RestorationLong
  134. Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language ModelsLong
  135. ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasksfinding
  136. ProMALex: Progressive Modular Adapters for Multi-Jurisdictional Legal Language ModelingLong
  137. ProMedTS: A Self-Supervised, Prompt-Guided Multimodal Approach for Integrating Medical Text and Time Seriesfinding
  138. ProMind-LLM: Proactive Mental Health Care via Causal Reasoning with Sensor Datafinding
  139. Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Modelsfinding
  140. Probability-Consistent Preference Optimization for Enhanced LLM Reasoningfinding
  141. Probing LLMs for Multilingual Discourse Generalization Through a Unified Label SetLong
  142. Probing Relative Interaction and Dynamic Calibration in Multi-modal Entity AlignmentLong
  143. Probing Subphonemes in Morphology Modelsfinding
  144. Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasksfinding
  145. Problem-Solving Logic Guided Curriculum In-Context Learning for LLMs Complex Reasoningfinding
  146. Process-based Self-Rewarding Language Modelsfinding
  147. ProcessBench: Identifying Process Errors in Mathematical ReasoningLong
  148. ProcrustesGPT: Compressing LLMs with Structured Matrices and Orthogonal Transformationsfinding
  149. Profiling News Media for Factuality and Bias Using LLMs and the Fact-Checking Methodology of Human Expertsfinding
  150. ProgCo: Program Helps Self-Correction of Large Language ModelsShort
  151. Program Synthesis Benchmark for Visual Programming in XLogoOnline EnvironmentLong
  152. Programming by Example meets Historical Linguistics: A Large Language Model Based Approach to Sound Law InductionLong
  153. Progressive LoRA for Multimodal Continual Instruction Tuningfinding
  154. Progressive Multimodal Reasoning via Active RetrievalLong
  155. ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generationfinding
  156. Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data AnnotationLong
  157. Prompt-Guided Internal States for Hallucination Detection of Large Language ModelsLong
  158. PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Modelsfinding
  159. PromptWizard: Optimizing Prompts via Task-Aware, Feedback-Driven Self-Evolutionfinding
  160. Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agentsfinding
  161. ProtoLens: Advancing Prototype Learning for Fine-Grained Interpretability in Text ClassificationLong
  162. ProvBench: A Benchmark of Legal Provision Recommendation for Contract Auto-ReviewingLong
  163. Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Modelfinding
  164. ProxAnn: Use-Oriented Evaluations of Topic Models and Document ClusteringLong
  165. Proxy-Driven Robust Multimodal Sentiment Analysis with Incomplete DataLong
  166. PruneVid: Visual Token Pruning for Efficient Video Large Language Modelsfinding
  167. Pruning General Large Language Models into Customized Expert Modelsfinding
  168. PsyAdvisor: A Plug-and-Play Strategy Advice Planner with Proactive Questioning in Psychological ConversationsLong
  169. PsyDT: Using LLMs to Construct the Digital Twin of Psychological Counselor with Personalized Counseling Style for Psychological CounselingLong
  170. PsyDial: A Large-scale Long-term Conversational Dataset for Mental Health SupportLong
  171. PunchBench: Benchmarking MLLMs in Multimodal Punchline ComprehensionLong
  172. PwnGPT: Automatic Exploit Generation Based on Large Language ModelsLong
  173. P²Net: Parallel Pointer-based Network for Key Information Extraction with Complex Layoutsfinding
  174. Q-Mamba: Towards more efficient Mamba models via post-training quantizationfinding
  175. Q-STRUM Debate: Query-Driven Contrastive Summarization for Recommendation Comparisonfinding
  176. QAEncoder: Towards Aligned Representation Learning in Question Answering SystemsLong
  177. QAEval: Mixture of Evaluators for Question-Answering Task EvaluationLong
  178. QDTSynth: Quality-Driven Formal Theorem Synthesis for Enhancing Proving Performance of LLMsLong
  179. QG-SMS: Enhancing Test Item Analysis via Student Modeling and SimulationLong
  180. QQSUM: A Novel Task and Model of Quantitative Query-Focused Summarization for Review-based Product Question AnsweringLong
  181. QiMeng-Attention: SOTA Attention Operator is generated by SOTA Attention Algorithmfinding
  182. Qorǵau: Evaluating Safety in Kazakh-Russian Bilingual Contextsfinding
  183. QuASAR: A Question-Driven Structure-Aware Approach for Table-to-Text GenerationLong
  184. Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability HypothesisLong
  185. QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and DescriptionsLong
  186. Quantification of Large Language Model DistillationLong
  187. Quantifying Lexical Semantic Shift via Unbalanced Optimal TransportLong
  188. Quantifying Misattribution Unfairness in Authorship AttributionShort
  189. Quantifying Semantic Emergence in Language ModelsLong
  190. Quantile Regression with Large Language Models for Price Predictionfinding
  191. Quantized Can Still Be Calibrated: A Unified Framework to Calibration in Quantized Large Language ModelsLong
  192. Query-Driven Multimodal GraphRAG: Dynamic Local Knowledge Graph Construction for Online Reasoningfinding
  193. Query-driven Document-level Scientific Evidence Extraction from Biomedical StudiesLong
  194. QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Languagefinding
  195. Question Answering in Climate Adaptation for Agriculture: Model Development and Evaluation with Expert Feedbackfinding
  196. Question-Aware Knowledge Graph Prompting for Enhancing Large Language Modelsfinding
  197. Qwen2.5-xCoder: Multi-Agent Collaboration for Multilingual Code Instruction TuningLong
  198. R-Fairness: Assessing Fairness of Ranking in Subjective DataLong
  199. R-VLM: Region-Aware Vision Language Model for Precise GUI Groundingfinding
  200. R.R.: Unveiling LLM Training Privacy through Recollection and Rankingfinding
  201. R2-MultiOmnia: Leading Multilingual Multimodal Reasoning via Self-TrainingLong
  202. R2D2: Remembering, Replaying and Dynamic Decision Making with a Reflective Agentic MemoryLong
  203. R3Mem: Bridging Memory Retention and Retrieval via Reversible Compressionfinding
  204. RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge InjectionLong
  205. RAEmoLLM: Retrieval Augmented LLMs for Cross-Domain Misinformation Detection Using In-Context Learning Based on Emotional InformationLong
  206. RAG-Critic: Leveraging Automated Critic-Guided Agentic Workflow for Retrieval Augmented GenerationLong
  207. RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignmentfinding
  208. RAGEval: Scenario Specific RAG Evaluation Dataset Generation FrameworkLong
  209. RAPID: Efficient Retrieval-Augmented Long Text Generation with Writing Planning and Information Discoveryfinding
  210. RARE: Retrieval-Augmented Reasoning Enhancement for Large Language ModelsLong
  211. RASD: Retrieval-Augmented Speculative Decodingfinding
  212. RASPberry: Retrieval-Augmented Monte Carlo Tree Self-Play with Reasoning Consistency for Multi-Hop Question Answeringfinding
  213. RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Modelsfinding
  214. RATIONALYST: Pre-training Process-Supervision for Improving ReasoningLong
  215. READoc: A Unified Benchmark for Realistic Document Structured Extractionfinding
  216. REAL-MM-RAG: A Real-World Multi-Modal Retrieval BenchmarkLong
  217. REALM: A Dataset of Real-World LLM Use Casesfinding
  218. REPRO-Bench: Can Agentic AI Systems Assess the Reproducibility of Social Science Research?finding
  219. REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Spacefinding
  220. RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answeringfinding
  221. RL-Guider: Leveraging Historical Decisions and Feedback for Drug Editing with Large Language Modelsfinding
  222. RLKGF: Reinforcement Learning from Knowledge Graph Feedback Without Human Annotationsfinding
  223. RMoA: Optimizing Mixture-of-Agents through Diversity Maximization and Residual Compensationfinding
  224. RPO: Retrieval Preference Optimization for Robust Retrieval-Augmented GenerationLong
  225. RQT: Hierarchical Residual Quantization for Multi-Model Compressionfinding
  226. RSCF: Relation-Semantics Consistent Filter for Entity Embedding of Knowledge GraphLong
  227. RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-ThoughtLong
  228. RTADev: Intention Aligned Multi-Agent Framework for Software Developmentfinding
  229. RUBY: An Effective Framework for Multi-Constraint Multi-Hop Question GenerationLong
  230. RaaS: Reasoning-Aware Attention Sparsity for Efficient LLM Reasoningfinding
  231. Random Splitting Negatively Impacts NER Evaluation: Quantifying and Eliminating the Overestimation of NER Performancefinding
  232. Rank, Chunk and Expand: Lineage-Oriented Reasoning for Taxonomy Expansionfinding
  233. RankCoT: Refining Knowledge for Retrieval-Augmented Generation through Ranking Chain-of-ThoughtsLong
  234. Ranked Voting based Self-Consistency of Large Language Modelsfinding
  235. Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI CombatLong
  236. Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliabilityfinding
  237. Rationalize and Align: Enhancing Writing Assistance with Rationale via Self-Training for Improved Alignmentfinding
  238. Re-TASK: Revisiting LLM Tasks from Capability, Skill, and Knowledge Perspectivesfinding
  239. Re-identification of De-identified Documents with Autoregressive InfillingLong
  240. Re-ranking Using Large Language Models for Mitigating Exposure to Harmful Content on Social Media PlatformsLong
  241. Re3Syn: A Dependency-Based Data Synthesis Framework for Long-Context Post-trainingLong
  242. ReKG-MCTS: Reinforcing LLM Reasoning on Knowledge Graphs via Training-Free Monte Carlo Tree Searchfinding
  243. ReLearn: Unlearning via Learning for Large Language ModelsLong
  244. RePanda: Pandas-powered Tabular Verification and ReasoningLong
  245. ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency SupervisionLong
  246. Read it in Two Steps: Translating Extremely Low-Resource Languages with Code-Augmented Grammar BooksLong
  247. Real-time Factuality Assessment from Adversarial FeedbackLong
  248. RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysisfinding
  249. Reason from Future: Reverse Thought Chain Enhances LLM Reasoningfinding
  250. ReasonerRank: Redefining Language Model Evaluation with Ground-Truth-Free Ranking Frameworksfinding
  251. Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inferencefinding
  252. Reasoning Does Not Necessarily Improve Role-Playing Abilityfinding
  253. Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluationfinding
  254. Reasoning with Graphs: Structuring Implicit Knowledge to Enhance LLMs Reasoningfinding
  255. RecLM: Recommendation Instruction TuningLong
  256. Recent Advances in Speech Language Models: A SurveyLong
  257. Reconsidering LLM Uncertainty Estimation Methods in the WildLong
  258. RecordTwin: Towards Creating Safe Synthetic Clinical Corporafinding
  259. Rectifying Belief Space via Unlearning to Harness LLMs’ Reasoningfinding
  260. Recurrent Knowledge Identification and Fusion for Language Model Continual LearningLong
  261. Recursive Question Understanding for Complex Question Answering over Heterogeneous Personal Datafinding
  262. Red Queen: Exposing Latent Multi-Turn Risks in Large Language Modelsfinding
  263. Red-Teaming LLM Multi-Agent Systems via Communication Attacksfinding
  264. Redundancy Principles for MLLMs BenchmarksLong
  265. Redundancy, Isotropy, and Intrinsic Dimensionality of Prompt-based Text Embeddingsfinding
  266. RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMsfinding
  267. Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Modelsfinding
  268. Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language ModelsLong
  269. Refining Salience-Aware Sparse Fine-Tuning Strategies for Language ModelsLong
  270. Refining Sentence Embedding Model through Ranking Sentences Generation with Large Language Modelsfinding
  271. ReflecTool: Towards Reflection-Aware Tool-Augmented Clinical AgentsLong
  272. ReflectDiffu: Reflect between Emotion-intent Contagion and Mimicry for Empathetic Response Generation via a RL-Diffusion FrameworkLong
  273. ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflectionfinding
  274. Reflection on Knowledge Graph for Large Language Models Reasoningfinding
  275. ReflectionCoder: Learning from Reflection Sequence for Enhanced One-off Code GenerationLong
  276. RefreshKV: Updating Small KV Cache During Long-form GenerationLong
  277. Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal TrainingLong
  278. Registering Source Tokens to Target Language Spaces in Multilingual Neural Machine TranslationLong
  279. Rehearse With User: Personalized Opinion Summarization via Role-Playing based on Large Language Modelsfinding
  280. Reinforced IR: A Self-Boosting Framework For Domain-Adapted Information RetrievalLong
  281. Reinforcing Compositional Retrieval: Retrieving Step-by-Step for Composing Informative Contextsfinding
  282. RelEdit: Evaluating Conceptual Knowledge Editing in Language Models via Relational Reasoningfinding
  283. RelationalCoder: Rethinking Complex Tables via Programmatic Relational TransformationLong
  284. Relevance Scores Calibration for Ranked List Truncation via TMP Adapterfinding
  285. Relevant or Random: Can LLMs Truly Perform Analogical Reasoning?finding
  286. Reliably Bounding False Positives: A Zero-Shot Machine-Generated Text Detection Framework via Multiscaled Conformal PredictionLong
  287. RemoteRAG: A Privacy-Preserving LLM Cloud RAG Servicefinding
  288. Removal of Hallucination on Hallucination: Debate-Augmented RAGLong
  289. Removing Prompt-template Bias in Reinforcement Learning from Human Feedbackfinding
  290. Representation Bending for Large Language Model SafetyLong
  291. Representations of Fact, Fiction and Forecast in Large Language Models: Epistemics and AttitudesLong
  292. Reranking-based Generation for Unbiased Perspective Summarizationfinding
  293. Research Borderlands: Analysing Writing Across Research CulturesLong
  294. Research Community Perspectives on “Intelligence” and Large Language Modelsfinding
  295. Resource-Friendly Dynamic Enhancement Chain for Multi-Hop Question Answeringfinding
  296. Response Wide Shut? Surprising Observations in Basic Vision Language Model CapabilitiesLong
  297. Rethinking Diverse Human Preference Learning through Principal Component Analysisfinding
  298. Rethinking Evaluation Metrics for Grammatical Error Correction: Why Use a Different Evaluation Process than Human?Short
  299. Rethinking KenLM: Good and Bad Model Ensembles for Efficient Text Quality Filtering in Large Web CorporaShort
  300. Rethinking Prompt-based Debiasing in Large Language Modelfinding
  301. Rethinking Repetition Problems of LLMs in Code GenerationLong
  302. Rethinking Reward Model Evaluation Through the Lens of Reward OveroptimizationLong
  303. Rethinking Semantic Parsing for Large Language Models: Enhancing LLM Performance with Semantic HintsShort
  304. Rethinking Stateful Tool Use in Multi-Turn Dialogues: Benchmarks and Challengesfinding
  305. Rethinking Table Instruction Tuningfinding
  306. Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability TheoryLong
  307. Retrieval Models Aren’t Tool-Savvy: Benchmarking Tool Retrieval for Large Language Modelsfinding
  308. Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Modelsfinding
  309. Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program GenerationLong
  310. Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoningfinding
  311. Retrieve to Explain: Evidence-driven Predictions for Explainable Drug Target IdentificationLong
  312. RetroLLM: Empowering Large Language Models to Retrieve Fine-grained Evidence within GenerationLong
  313. Retrofitting Large Language Models with Dynamic TokenizationLong
  314. Retrospective Learning from InteractionsLong
  315. Revealing Hidden Mechanisms of Cross-Country Content Moderation with Natural Language Processingfinding
  316. Revealing and Mitigating the Local Pattern Shortcuts of Mambafinding
  317. Revealing the Deceptiveness of Knowledge Editing: A Mechanistic Analysis of Superficial EditingLong
  318. Reversal of Thought: Enhancing Large Language Models with Preference-Guided Reverse Reasoning Warm-upLong
  319. Reverse Preference Optimization for Complex Instruction Followingfinding
  320. Review-Instruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Modelsfinding
  321. Revisit Self-Debugging with Self-Generated Tests for Code GenerationLong
  322. Revisiting 3D LLM Benchmarks: Are We Really Testing 3D Capabilities?finding
  323. Revisiting Classical Chinese Event Extraction with Ancient Literature InformationLong
  324. Revisiting Common Assumptions about Arabic Dialects in NLPLong
  325. Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following AbilityLong
  326. Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models’ Uncertainty?Short
  327. Revisiting In-Context Learning with Long Context Language Modelsfinding
  328. Revisiting LLMs as Zero-Shot Time Series Forecasters: Small Noise Can Break Large ModelsShort
  329. Revisiting LoRA through the Lens of Parameter Redundancy: Spectral Encoding Helpsfinding
  330. Revisiting Scaling Laws for Language Models: The Role of Data Quality and Training StrategiesLong
  331. Revisiting Self-Consistency from Dynamic Distributional Alignment Perspective on Answer Aggregationfinding
  332. Revisiting Uncertainty Quantification Evaluation in Language Models: Spurious Interactions with Response Length Bias ResultsShort
  333. Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KLfinding
  334. Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?Long
  335. Reviving Cultural Heritage: A Novel Approach for Comprehensive Historical Document RestorationLong
  336. Reward Generalization in RLHF: A Topological Perspectivefinding
  337. Rewrite to Jailbreak: Discover Learnable and Transferable Implicit Harmfulness Instructionfinding
  338. Rhetorical Device-Aware Sarcasm Detection with Counterfactual Data Augmentationfinding
  339. Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow MatchingLong
  340. RiOT: Efficient Prompt Refinement with Residual Optimization TreeLong
  341. Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answeringfinding
  342. RoCoFT: Efficient Finetuning of Large Language Models with Row-Column UpdatesLong
  343. RoToR: Towards More Reliable Responses for Order-Invariant InputsLong
  344. Robust Data Watermarking in Language Models by Injecting Fictitious Knowledgefinding
  345. Robust Estimation of Population-Level Effects in Repeated-Measures NLP Experimental DesignsLong
  346. Robust Preference Optimization via Dynamic Target Marginsfinding
  347. Robust Utility-Preserving Text Anonymization Based on Large Language ModelsLong
  348. Robust and Minimally Invasive Watermarking for EaaSfinding
  349. Robustness and Confounders in the Demographic Alignment of LLMs with Human Perceptions of Offensivenessfinding
  350. RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Followingfinding
  351. RolePlot: A Systematic Framework for Evaluating and Enhancing the Plot-Progression Capabilities of Role-Playing AgentsLong
  352. Rolling the DICE on Idiomaticity: How LLMs Fail to Grasp ContextLong
  353. RomanLens: The Role Of Latent Romanization In Multilinguality In LLMsfinding
  354. Root Defense Strategies: Ensuring Safety of LLM at the Decoding LevelLong
  355. RoseRAG: Robust Retrieval-augmented Generation with Small-scale LLMs via Margin-aware Preference Optimizationfinding
  356. Rubrik’s Cube: Testing a New Rubric for Evaluating Explanations on the CUBE datasetLong
  357. RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World ScenariosLong
  358. RuleEdit: Towards Rule-Level Knowledge Generalization to Mitigate Over-Editing in Large Language Modelsfinding
  359. S-RAG: A Novel Audit Framework for Detecting Unauthorized Use of Personal Data in RAG SystemsLong
  360. S2R: Teaching LLMs to Self-verify and Self-correct via Reinforcement LearningLong
  361. S2WTM: Spherical Sliced-Wasserstein Autoencoder for Topic ModelingLong
  362. S3 - Semantic Signal SeparationLong
  363. SAKE: Steering Activations for Knowledge EditingLong
  364. SAM Decoding: Speculative Decoding via Suffix AutomatonLong
  365. SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models’ Knowledge of Indian Culturefinding
  366. SARA: Salience-Aware Reinforced Adaptive Decoding for Large Language Models in Abstractive SummarizationLong
  367. SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkagefinding
  368. SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human InterventionLong
  369. SCAR: Data Selection via Style Consistency-Aware Response Ranking for Efficient Instruction-Tuning of Large Language ModelsLong
  370. SCITAT: A Question Answering Benchmark for Scientific Tables and Text Covering Diverse Reasoning Typesfinding
  371. SCOP: Evaluating the Comprehension Process of Large Language Models from a Cognitive ViewLong
  372. SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotationfinding
  373. SCOPE: Optimizing Key-Value Cache Compression in Long-context GenerationLong
  374. SCULPT: Systematic Tuning of Long PromptsLong
  375. SConU: Selective Conformal Uncertainty in Large Language ModelsLong
  376. SDBench: A Survey-based Domain-specific LLM Benchmarking and Optimization FrameworkLong
  377. SDD: Self-Degraded Defense against Malicious Fine-tuningLong
  378. SDPO: Segment-Level Direct Preference Optimization for Social AgentsLong
  379. SEA-HELM: Southeast Asian Holistic Evaluation of Language Modelsfinding
  380. SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic EmbeddingsLong
  381. SEAL: Scaling to Emphasize Attention for Long-Context RetrievalLong
  382. SECRET: Semi-supervised Clinical Trial Document Similarity SearchLong
  383. SEE: Continual Fine-tuning with Sequential Ensemble of Expertsfinding
  384. SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt OptimizationLong
  385. SEK: Self-Explained Keywords Empower Large Language Models for Code Generationfinding
  386. SELF-PERCEPT: Introspection Improves Large Language Models’ Detection of Multi-Person Mental Manipulation in ConversationsShort
  387. SEOE: A Scalable and Reliable Semantic Evaluation Framework for Open Domain Event DetectionLong
  388. SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?Long
  389. SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignmentfinding
  390. SGIC: A Self-Guided Iterative Calibration Framework for RAGLong
  391. SHARE: An SLM-based Hierarchical Action CorREction Assistant for Text-to-SQLLong
  392. SHARE: Shared Memory-Aware Open-Domain Long-Term Dialogue Dataset Constructed from Movie ScriptLong
  393. SHARP: Unlocking Interactive Hallucination via Stance Transfer in Role-Playing LLMsfinding
  394. SHuBERT: Self-Supervised Sign Language Representation Learning via Multi-Stream Cluster PredictionLong
  395. SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-TuningLong
  396. SIKeD: Self-guided Iterative Knowledge Distillation for Mathematical Reasoningfinding
  397. SINCon: Mitigate LLM-Generated Malicious Message Injection Attack for Rumor DetectionLong
  398. SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Trainingfinding
  399. SMART: Self-Aware Agent for Tool Overuse Mitigationfinding
  400. SOTOPIA-Ω: Dynamic Strategy Injection Learning and Social Instruction Following Evaluation for Social AgentsLong
  401. SPECTRA: Faster Large Language Model Inference with Optimized Internal and External SpeculationLong
  402. SPHERE: An Evaluation Card for Human-AI Systemsfinding
  403. SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical EvaluationLong
  404. SPICA: Retrieving Scenarios for Pluralistic In-Context Alignmentfinding
  405. SPILL: Domain-Adaptive Intent Clustering based on Selection and Pooling with Large Language Modelsfinding
  406. SPOT: Zero-Shot Semantic Parsing Over Property Graphsfinding
  407. SQL Injection Jailbreak: A Structural Disaster of Large Language Modelsfinding
  408. SQLForge: Synthesizing Reliable and Diverse Data to Enhance Text-to-SQL Reasoning in LLMsfinding
  409. SR-LLM: Rethinking the Structured Representation in Large Language ModelLong
  410. STARS: A Unified Framework for Singing Transcription, Alignment, and Refined Style Annotationfinding
  411. STATE ToxiCN: A Benchmark for Span-level Target-Aware Toxicity Extraction in Chinese Hate Speech Detectionfinding
  412. STEM-POM: Evaluating Language Models Math-Symbol Reasoning in Document Parsingfinding
  413. STORM-BORN: A Challenging Mathematical Derivations Dataset Curated via a Human-in-the-Loop Multi-Agent Frameworkfinding
  414. STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story Generationfinding
  415. STRICTA: Structured Reasoning in Critical Text Assessment for Peer Review and BeyondLong
  416. STUN: Structured-Then-Unstructured Pruning for Scalable MoE PruningLong
  417. STaR-SQL: Self-Taught Reasoner for Text-to-SQLLong
  418. STeCa: Step-level Trajectory Calibration for LLM Agent Learningfinding
  419. SURVEYFORGE : On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey WritingLong
  420. SWE-Dev: Building Software Engineering Agents with Training and Inference Scalingfinding
  421. SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolutionfinding
  422. SYNTHIA: Novel Concept Design with Affordance CompositionLong
  423. SYNTHVERIFY: Enhancing Zero-Shot Claim Verification through Step-by-Step Synthetic Data Generationfinding
  424. Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal VerificationLong
  425. SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilitiesfinding
  426. SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearningfinding
  427. SafeLawBench: Towards Safe Alignment of Large Language Modelsfinding
  428. SafeRAG: Benchmarking Security in Retrieval-Augmented Generation of Large Language ModelLong
  429. SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Modelsfinding
  430. Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detectionfinding
  431. Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to ArtifactsLong
  432. Safety Alignment via Constrained Knowledge UnlearningLong
  433. Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safetyfinding
  434. Same Company, Same Signal: The Role of Identity in Earnings Call Transcriptsfinding
  435. Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy CompetitionLong
  436. Sampling-based Pseudo-Likelihood for Membership Inference Attacksfinding
  437. Sandcastles in the Storm: Revisiting the (Im)possibility of Strong WatermarkingLong
  438. ScEdit: Script-based Assessment of Knowledge Editingfinding
  439. Scalable Vision Language Model Training via High Quality Data CurationLong
  440. ScaleBiO: Scalable Bilevel Optimization for LLM Data ReweightingLong
  441. Scaling LLMs’ Social Reasoning: Sprinkle Cognitive “Aha Moment” into Fundamental Long-thought Logical Capabilitiesfinding
  442. Scaling Laws and Efficient Inference for Ternary Language ModelsLong
  443. Scaling Laws for Multilingual Language Modelsfinding
  444. Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data GenerationLong
  445. Scaling up the State Size of RNN LLMs for Long-Context ScenariosLong
  446. ScanEZ: Integrating Cognitive Models with Self-Supervised Learning for Spatiotemporal Scanpath PredictionShort
  447. SceneGenAgent: Precise Industrial Scene Generation with Coding AgentLong
  448. SceneGram: Conceptualizing and Describing Tangrams in Scene Contextfinding
  449. Sci-LoRA: Mixture of Scientific LoRAs for Cross-Domain Lay Paraphrasingfinding
  450. SciVer: Evaluating Foundation Models for Multimodal Scientific Claim VerificationLong
  451. SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problemsfinding
  452. SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented GenerationLong
  453. Search-in-Context: Efficient Multi-Hop QA over Long Contexts via Monte Carlo Tree Search with Dynamic KV Retrievalfinding
  454. Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary ExpansionLong
  455. See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Modelsfinding
  456. SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed ScienceLong
  457. Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Erafinding
  458. Seeking Rational Demonstrations for Large Language Models: A Domain Generalization Approach to Unsupervised Cross-Domain Keyphrase GenerationShort
  459. Segment First or Comprehend First? Explore the Limit of Unsupervised Word Segmentation with Large Language ModelsLong
  460. Segment-Based Attention Masking for GPTsLong
  461. Segment-Level Diffusion: A Framework for Controllable Long-Form Generation with Diffusion Language ModelsLong
  462. Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generationfinding
  463. SelectLLM: Query-Aware Efficient Selection Algorithm for Large Language Modelsfinding
  464. Selecting Demonstrations for Many-Shot In-Context Learning via Gradient Matchingfinding
  465. Selecting and Merging: Towards Adaptable and Scalable Named Entity Recognition with Large Language ModelsLong
  466. Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasksfinding
  467. Self-Critique Guided Iterative Reasoning for Multi-hop Question Answeringfinding
  468. Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical ReasoningLong
  469. Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveationfinding
  470. Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignmentfinding
  471. Self-Instructed Derived Prompt Generation Meets In-Context Learning: Unlocking New Potential of Black-Box LLMsLong
  472. Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalystfinding
  473. Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generationfinding
  474. Self-Steering Optimization: Autonomous Preference Optimization for Large Language Modelsfinding
  475. Self-Taught Agentic Long Context UnderstandingLong
  476. Self-Training Elicits Concise Reasoning in Large Language Modelsfinding
  477. Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teachingfinding
  478. Self-attention-based Graph-of-Thought for Math Problem Solvingfinding
  479. Self-play through Computational Runtimes improves Chart Reasoningfinding
  480. Self-supervised Quantized Representation for Seamlessly Integrating Knowledge Graphs with Large Language ModelsLong
  481. SelfElicit: Your Language Model Secretly Knows Where is the Relevant EvidenceLong
  482. Semantic Aware Linear Transfer by Recycling Pre-trained Language Models for Cross-lingual Transferfinding
  483. Semantic Evaluation of Multilingual Data-to-Text Generation via NLI Fine-Tuning: Precision, Recall and F1 scoresfinding
  484. Semantic Exploration with Adaptive Gating for Efficient Problem Solving with Language ModelsLong
  485. Semantic Topology: a New Perspective for Communication Style Characterizationfinding
  486. Semantic-Eval : A Semantic Comprehension Evaluation Framework for Large Language Models Generation without TrainingLong
  487. SemanticCamo: Jailbreaking Large Language Models through Semantic Camouflagefinding
  488. Semantics-aware prompting for translating NOtices To AirMenfinding
  489. Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Modelsfinding
  490. Sentimental Image Generation for Aspect-based Sentiment Analysisfinding
  491. Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Modelsfinding
  492. Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in TransformersLong
  493. SeqMMR: Sequential Model Merging and LLM Routing for Enhanced Batched Sequential Knowledge Editingfinding
  494. SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translationfinding
  495. Serial Lifelong Editing via Mixture of Knowledge ExpertsLong
  496. Serial Position Effects of Large Language Modelsfinding
  497. Shadow-Activated Backdoor Attacks on Multimodal Large Language Modelsfinding
  498. Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language ModelsLong
  499. Sharper and Faster mean Better: Towards More Efficient Vision-Language Model for Hour-scale Long Video UnderstandingLong
  500. Sheep’s Skin, Wolf’s Deeds: Are LLMs Ready for Metaphorical Implicit Hate Speech?Long
  501. ShieldHead: Decoding-time Safeguard for Large Language Modelsfinding
  502. ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive FrameworkLong
  503. Shifting from Ranking to Set Selection for Retrieval Augmented GenerationLong
  504. ShortGPT: Layers in Large Language Models are More Redundant Than You Expectfinding
  505. Should I Believe in What Medical AI Says? A Chinese Benchmark for Medication Based on Knowledge and ReasoningShort
  506. Should I Trust You? Detecting Deception in Negotiations using Counterfactual RLfinding
  507. Sightation Counts: Leveraging Sighted User Feedback in Building a BLV-aligned Dataset of Diagram DescriptionsLong
  508. Sign2Vis: Automated Data Visualization from Sign Languagefinding
  509. SignAlignLM: Integrating Multimodal Sign Language Processing into Large Language Modelsfinding
  510. SignMusketeers: An Efficient Multi-Stream Approach for Sign Language Translation at Scalefinding
  511. Silencing Empowerment, Allowing Bigotry: Auditing the Moderation of Hate Speech on TwitchLong
  512. SimGRAG: Leveraging Similar Subgraphs for Knowledge Graphs Driven Retrieval-Augmented Generationfinding
  513. SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech TranslationLong
  514. Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine TranslationLong
  515. Sinhala Encoder-only Language Models and EvaluationLong
  516. SkillAggregation: Reference-free LLM-Dependent AggregationLong
  517. SkillVerse : Assessing and Enhancing LLMs with Tree EvaluationLong
  518. SkyLLM: Cross-LLM-APIs Federation for Cost-effective Query Processingfinding
  519. Slamming: Training a Speech Language Model on One GPU in a Dayfinding
  520. Sleepless Nights, Sugary Days: Creating Synthetic Users with Health Conditions for Realistic Coaching Agent Interactionsfinding
  521. Sliding Windows Are Not the End: Exploring Full Ranking with Long-Context Large Language ModelsLong
  522. Small Changes, Big Impact: How Manipulating a Few Neurons Can Drastically Alter LLM AggressionLong
  523. Small Encoders Can Rival Large Decoders in Detecting Groundednessfinding
  524. Small Models Struggle to Learn from Strong Reasonersfinding
  525. Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and InferenceLong
  526. Smarter, Not Harder: Training-Free Adaptive Computation for Transformersfinding
  527. Smotrom tvoja på ander drogoj verden! Resurrecting Dead Pidgin with Generative Models: Russenorsk Case Studyfinding
  528. SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-TuningLong
  529. Social Bias Benchmark for Generation: A Comparison of Generation and QA-Based Evaluationsfinding
  530. SocialCC: Interactive Evaluation for Cultural Competence in Language AgentsLong
  531. SocialEval: Evaluating Social Intelligence of Large Language ModelsLong
  532. Socratic Style Chain-of-Thoughts Help LLMs to be a Better Reasonerfinding
  533. SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMsLong
  534. SongComposer: A Large Language Model for Lyric and Melody Generation in Song CompositionLong
  535. Soundwave: Less is More for Speech-Text Alignment in LLMsLong
  536. SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic DataLong
  537. Span-based Semantic Role Labeling as Lexicalized Constituency Tree Parsingfinding
  538. Sparse Latents Steer Retrieval-Augmented GenerationLong
  539. Sparse Logit Sampling: Accelerating Knowledge Distillation in LLMsLong
  540. Sparse Rewards Can Self-Train Dialogue Agentsfinding
  541. Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMsShort
  542. Spatial Coordinates as a Cell Language: A Multi-Sentence Framework for Imaging Mass Cytometry Analysisfinding
  543. Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded DialoguesLong
  544. Spectral Insights into Data-Oblivious Critical Layers in Large Language Modelsfinding
  545. Speculative Sampling via Exponential Racesfinding
  546. Speech Act Patterns for Improving Generalizability of Explainable Politeness Detection Modelsfinding
  547. SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation MethodsLong
  548. SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language ModelsLong
  549. SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Informationfinding
  550. Speed Up Your Code: Progressive Code Acceleration Through Bidirectional Tree EditingLong
  551. SpindleKV: A Novel KV Cache Reduction Method Balancing Both Shallow and Deep LayersLong
  552. Splintering Nonconcatenative Languages for Better Tokenizationfinding
  553. Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generationfinding
  554. Spurious Correlations and Beyond: Understanding and Mitigating Shortcut Learning in SDOH Extraction with Large Language ModelsShort
  555. Squeezed Attention: Accelerating Long Context Length LLM InferenceLong
  556. StableToolBench-MirrorAPI: Modeling Tool Environments as Mirrors of 7,000+ Real-World APIsfinding
  557. Standard Quality Criteria Derived from Current NLP Evaluations for Guiding Evaluation Design and Grounding Comparability and AI Compliance Assessmentsfinding
  558. State-offset Tuning: State-based Parameter-Efficient Fine-Tuning for State Space ModelsShort
  559. Statement-Tuning Enables Efficient Cross-lingual Generalization in Encoder-only Modelsfinding
  560. Statistical Deficiency for Task Inclusion EstimationLong
  561. Statistical inference on black-box generative models in the data kernel perspective spacefinding
  562. Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion AttackLong
  563. Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language ModelsLong
  564. Steering off Course: Reliability Challenges in Steering Language ModelsLong
  565. Step-by-Step Mastery: Enhancing Soft Constraint Following Ability of Large Language Modelsfinding
  566. Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Modelsfinding
  567. Stepwise Reasoning Disruption Attack of LLMsLong
  568. Stereotype Detection as a Catalyst for Enhanced Bias Detection: A Multi-Task Learning Approachfinding
  569. Stereotype or Personalization? User Identity Biases Chatbot Recommendationsfinding
  570. Sticking to the Mean: Detecting Sticky Tokens in Text Embedding ModelsLong
  571. StitchLLM: Serving LLMs, One Block at a TimeLong
  572. Stochastic Chameleons: Irrelevant Context Hallucinations Reveal Class-Based (Mis)Generalization in LLMsLong
  573. Stories that (are) Move(d by) Markets: A Causal Exploration of Market Shocks and Semantic Shifts across Different Partisan Groupsfinding
  574. Streamlining the Collaborative Chain of Models into A Single Forward Pass in Generation-Based Tasksfinding
  575. Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectorsfinding
  576. StrucText-Eval: Evaluating Large Language Model’s Reasoning Ability in Structure-Rich TextLong
  577. StructFact: Reasoning Factual Knowledge from Structured Data with Large Language Modelsfinding
  578. StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Followingfinding
  579. Structural Deep Encoding for Table Question Answeringfinding
  580. Structural Reasoning Improves Molecular Understanding of LLMLong
  581. Structure-adaptive Adversarial Contrastive Learning for Multi-Domain Fake News Detectionfinding
  582. Structure-aware Domain Knowledge Injection for Large Language ModelsLong
  583. Structured Discourse Representation for Factual Consistency Verificationfinding
  584. Structured Pruning for Diverse Best-of-N Reasoning Optimizationfinding
  585. SuLoRA: Subspace Low-Rank Adaptation for Parameter-Efficient Fine-Tuningfinding
  586. SubLIME: Subset Selection via Rank Correlation Prediction for Data-Efficient LLM EvaluationLong
  587. Substance over Style: Evaluating Proactive Conversational Coaching AgentsLong
  588. Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editingLong
  589. Subword models struggle with word learning, but surprisal hides itShort
  590. SudoLM: Learning Access Control of Parametric Knowledge with Authorization AlignmentLong
  591. Summary Factual Inconsistency Detection Based on LLMs Enhanced by Universal Information Extractionfinding
  592. Supervised Optimism Correction: Be Confident When LLMs Are Surefinding
  593. Supervised and Unsupervised Probing of Shortcut Learning: Case Study on the Emergence and Evolution of Syntactic Heuristics in BERTfinding
  594. SurveyPilot: an Agentic Framework for Automated Human Opinion Collection from Social MediaLong
  595. SwiLTra-Bench: The Swiss Legal Translation BenchmarkLong
  596. Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive ImagesLong
  597. SynFix: Dependency-Aware Program Repair via RelationGraph Analysisfinding
  598. SynGraph: A Dynamic Graph-LLM Synthesis Framework for Sparse Streaming User Sentiment Modelingfinding
  599. SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge RefinementShort
  600. SynapticRAG: Enhancing Temporal Memory Retrieval in Large Language Models through Synaptic Mechanismsfinding
  601. Synergistic Augmentation: Enhancing Cross-Domain Zero-Shot Slot Filling with Small Model-Assisted Large Language Modelsfinding
  602. Synergistic Weak-Strong Collaboration by Aligning PreferencesLong
  603. Synergizing LLMs with Global Label Propagation for Multimodal Fake News DetectionLong
  604. Synergizing Unsupervised Episode Detection with LLMs for Large-Scale News EventsLong
  605. Syntactic Control of Language Models by Posterior Inferencefinding
  606. SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMsLong
  607. Synthesizing Post-Training Data for LLMs through Multi-Agent SimulationLong
  608. System Prompt Hijacking via Permutation Triggers in LLM Supply Chainsfinding
  609. Systematic Evaluation of Auto-Encoding and Large Language Model Representations for Capturing Author States and Traitsfinding
  610. Systematic Generalization in Language Models Scales with Information Entropyfinding
  611. T-REG: Preference Optimization with Token-Level Reward RegularizationLong
  612. T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI FeedbackLong
  613. T2DR: A Two-Tier Deficiency-Resistant Framework for Incomplete Multimodal Learningfinding
  614. T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive ConceptsLong
  615. T5Score: A Methodology for Automatically Assessing the Quality of LLM Generated Multi-Document Topic Setsfinding
  616. TABGEN-ICL: Residual-Aware In-Context Example Selection for Tabular Data Generationfinding
  617. TACLR: A Scalable and Efficient Retrieval-based Method for Industrial Product Attribute Value IdentificationLong
  618. TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learningfinding
  619. TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Modelsfinding
  620. TARGA: Targeted Synthetic Data Generation for Practical Reasoning over Structured DataLong
  621. TC-Bench: Benchmarking Temporal Compositionality in Conditional Video Generationfinding
  622. TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesisfinding
  623. TC–RAG: Turing–Complete RAG’s Case study on Medical LLM SystemsLong
  624. TDCSA: LLM-Guided Top-Down Approach for Robust Citation Sentiment Analysisfinding
  625. TEACH: A Contrastive Knowledge Adaptive Distillation Framework for Classical Chinese UnderstandingLong
  626. TESS 2: A Large-Scale Generalist Diffusion Language ModelLong
  627. TETRIS: Optimal Draft Token Selection for Batch Speculative DecodingLong
  628. THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine TranslationLong
  629. TRACT: Regression-Aware Fine-tuning Meets Chain-of-Thought Reasoning for LLM-as-a-JudgeLong
  630. TRANS-ZERO: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Datafinding
  631. TRATES: Trait-Specific Rubric-Assisted Cross-Prompt Essay Scoringfinding
  632. TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data SynthesisLong
  633. TROVE: A Challenge for Fine-Grained Text Provenance via Source Sentence Tracing and Relationship ClassificationLong
  634. TReMu: Towards Neuro-Symbolic Temporal Reasoning for LLM-Agents with Memory in Multi-Session Dialoguesfinding
  635. TST: A Schema-Based Top-Down and Dynamic-Aware Agent of Text-to-Table TasksLong
  636. TUBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuningfinding
  637. TUMLU: A Unified and Native Language Understanding Benchmark for Turkic LanguagesLong
  638. TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic VideosLong
  639. TWIST: Text-encoder Weight-editing for Inserting Secret Trojans in Text-to-Image ModelsLong
  640. TabXEval: Why this is a Bad Table? An eXhaustive Rubric for Table Evaluationfinding
  641. Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table ReasoningLong
  642. TableDreamer: Progressive and Weakness-guided Data Synthesis from Scratch for Table Instruction Tuningfinding
  643. TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenariosfinding
  644. TableLoRA: Low-rank Adaptation on Table Structure Understanding for Large Language ModelsLong
  645. Tag-Evol: Achieving Efficient Instruction Evolving via Tag Injectionfinding
  646. Tag-Instruct: Controlled Instruction Complexity Enhancement through Structure-based Augmentationfinding
  647. TagRouter: Learning Route to LLMs through Tags for Open-Domain Text Generation Tasksfinding
  648. TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimizationfinding
  649. Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre ModelingLong
  650. Talking Point based Ideological Discourse Analysis in News Eventsfinding
  651. Taming LLMs with Gradient GroupingLong
  652. Taming Language Models for Text-attributed Graph Learning with Decoupled AggregationLong
  653. Targeted Syntactic Evaluation for Grammatical Error CorrectionLong
  654. Task Calibration: Calibrating Large Language Models on Inference Tasksfinding
  655. Task Facet Learning: A Structured Approach To Prompt Optimizationfinding
  656. Task Knowledge Injection via Interpolations and Reinstatement for Large Language Model Generalizationfinding
  657. Task-Informed Anti-Curriculum by Masking Improves Downstream Performance on Textfinding
  658. Task-Oriented Automatic Fact-Checking with Frame-Semanticsfinding
  659. Task-Specific Information Decomposition for End-to-End Dense Video CaptioningLong
  660. TaxoAdapt: Aligning LLM-Based Multidimensional Taxonomy Construction to Evolving Research CorporaLong
  661. Taxonomizing Representational Harms using Speech Act Theoryfinding
  662. Taxonomy-Driven Knowledge Graph Construction for Domain-Specific Scientific Applicationsfinding
  663. TeRDy: Temporal Relation Dynamics through Frequency Decomposition for Temporal Knowledge Graph CompletionLong
  664. Teaching Text Agents to Learn Sequential Decision Making from FailureLong
  665. Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual QuestionsLong
  666. Teaching an Old LLM Secure Coding: Localized Preference Optimization on Distilled PreferencesLong
  667. TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and CompetitionLong
  668. TechniqueRAG: Retrieval Augmented Generation for Adversarial Technique Annotation in Cyber Threat Intelligence Textfinding
  669. Tell Me What You Don’t Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editingfinding
  670. Tell, Don’t Show: Leveraging Language Models’ Abstractive Retellings to Model Literary Themesfinding
  671. Temporal Relation Extraction in Clinical Texts: A Span-based Graph Transformer ApproachLong
  672. Temporal reasoning for timeline summarisation in social mediaLong
  673. TestAgent: An Adaptive and Intelligent Expert for Human Assessmentfinding
  674. TestNUC: Enhancing Test-Time Computing Approaches and Scaling through Neighboring Unlabeled Data ConsistencyLong
  675. Text is All You Need: LLM-enhanced Incremental Social Event DetectionLong
  676. Text-to-ES Bench: A Comprehensive Benchmark for Converting Natural Language to Elasticsearch QueryLong
  677. Text2World: Benchmarking Large Language Models for Symbolic World Model Generationfinding
  678. Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answeringfinding
  679. That doesn’t sound right: Evaluating speech transcription quality in field linguistics corporaShort
  680. That is Unacceptable: the Moral Foundations of CancelingLong
  681. The AI Gap: How Socioeconomic Status Affects Language Technology InteractionsLong
  682. The Alternative Annotator Test for LLM-as-a-Judge: How to Statistically Justify Replacing Human Annotators with LLMsLong
  683. The Anatomy of Evidence: An Investigation Into Explainable ICD Codingfinding
  684. The Behavior Gap: Evaluating Zero-shot LLM Agents in Complex Task-Oriented Dialogsfinding
  685. The Cross-linguistic Role of Animacy in Grammar StructuresLong
  686. The Devil Is in the Word Alignment Details: On Translation-Based Cross-Lingual Transfer for Token Classification Tasksfinding
  687. The Distracting Effect: Understanding Irrelevant Passages in RAGLong
  688. The Effectiveness of Uncased Tokeniziaion for Clinical Notesfinding
  689. The Efficiency vs. Accuracy Trade-off: Optimizing RAG-Enhanced LLM Recommender Systems Using Multi-Head Early ExitLong
  690. The Elephant in the Room: Exploring the Role of Neutral Words in Language Model Group-Agnostic Debiasingfinding
  691. The Esethu Framework: Reimagining Sustainable Dataset Governance and Curation for Low-Resource LanguagesLong
  692. The Essence of Contextual Understanding in Theory of Mind: A Study on Question Answering with Story CharactersLong
  693. The Harmonic Structure of Information ContoursLong
  694. The Hidden Attention of Mamba ModelsLong
  695. The Impact of Auxiliary Patient Data on Automated Chest X-Ray Report Generation and How to Incorporate ItLong
  696. The Impact of Large Language Models in Academia: from Writing to Speakingfinding
  697. The Impact of Name Age Perception on Job Recommendations in LLMsfinding
  698. The Impact of Token Granularity on the Predictive Power of Language Model SurprisalLong
  699. The Impossibility of Fair LLMsLong
  700. The Inverse Scaling Effect of Pre-Trained Language Model Surprisal Is Not Due to Data Leakagefinding
  701. The Invisible Hand: Unveiling Provider Bias in Large Language Models for Code GenerationLong
  702. The Knowledge Microscope: Features as Better Analytical Lenses than NeuronsLong
  703. The Law of Knowledge Overshadowing: Towards Understanding, Predicting and Preventing LLM Hallucinationfinding
  704. The Lawyer That Never Thinks: Consistency and Fairness as Keys to Reliable AILong
  705. The Lessons of Developing Process Reward Models in Mathematical Reasoningfinding
  706. The Lies Characters Tell: Utilizing Large Language Models to Normalize Adversarial Unicode Perturbationsfinding
  707. The Linguistic Connectivities Within Large Language Modelsfinding
  708. The Male CEO and the Female Assistant: Evaluation and Mitigation of Gender Biases in Text-To-Image Generation of Dual SubjectsLong
  709. The Million Authors Corpus: A Cross-Lingual and Cross-Domain Wikipedia Dataset for Authorship Verificationfinding
  710. The Mirage of Model Editing: Revisiting Evaluation in the WildLong
  711. The Nature of NLP: Analyzing Contributions in NLP PapersLong
  712. The Noisy Path from Source to Citation: Measuring How Scholars Engage with Past ResearchLong
  713. The Reader is the Metric: How Textual Features and Reader Profiles Explain Conflicting Evaluations of AI Creative Writingfinding
  714. The Reasoning-Memorization Interplay in Language Models Is Mediated by a Single Directionfinding
  715. The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuningfinding
  716. The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agentsfinding
  717. The Role of Abstract Representations and Observed Preferences in the Ordering of Binomials in Large Language ModelsShort
  718. The Role of Deductive and Inductive Reasoning in Large Language ModelsLong
  719. The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and InsightsLong
  720. The Rotary Position Embedding May Cause Dimension Inefficiency in Attention Heads for Long-Distance Retrievalfinding
  721. The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?finding
  722. The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systemsfinding
  723. The Structural Safety Generalization Problemfinding
  724. The TIP of the Iceberg: Revealing a Hidden Class of Task-in-Prompt Adversarial Attacks on LLMsLong
  725. The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM AgentsLong
  726. The Threat of PROMPTS in Large Language Models: A System and User Prompt Perspectivefinding
  727. The Tug of War Within: Mitigating the Fairness-Privacy Conflicts in Large Language ModelsLong
  728. The Two Paradigms of LLM Detection: Authorship Attribution vs. Authorship Verificationfinding
  729. The UD-NewsCrawl Treebank: Reflections and Challenges from a Large-scale Tagalog Syntactic Annotation ProjectLong
  730. The time scale of redundancy between prosody and linguistic contextLong
  731. Theorem Prover as a Judge for Synthetic Data GenerationLong
  732. TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem UnderstandingLong
  733. Theoretical Analysis of Hierarchical Language Recognition and Generation by Transformers without Positional EncodingLong
  734. Theoretical Guarantees for Minimum Bayes Risk DecodingLong
  735. Theory of Mind in Large Language Models: Assessment and EnhancementLong
  736. There’s No Such Thing as Simple Reasoning for LLMsfinding
  737. They want to pretend not to understand: The Limits of Current LLMs in Interpreting Implicit Content of Political Discoursefinding
  738. Think Both Ways: Teacher-Student Bidirectional Reasoning Enhances MCQ Generation and Distractor Qualityfinding
  739. Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinkingfinding
  740. Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward ModelingLong
  741. ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrailsfinding
  742. Thinking Before Running! Efficient Code Generation with Thorough Exploration and Optimal Refinementfinding
  743. TiC-LM: A Web-Scale Benchmark for Time-Continual LLM PretrainingLong
  744. TicTac: Time-aware Supervised Fine-tuning for Automatic Text Datingfinding
  745. TigerLLM - A Family of Bangla Large Language ModelsShort
  746. Time Course MechInterp: Analyzing the Evolution of Components and Knowledge in Large Language Modelsfinding
  747. Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifactsfinding
  748. Time-MQA: Time Series Multi-Task Question Answering with Context EnhancementLong
  749. TituLLMs: A Family of Bangla LLMs with Comprehensive Benchmarkingfinding
  750. To Code or not to Code? Adaptive Tool Integration for Math Language Models via Expectation-Maximizationfinding
  751. TokAlign: Efficient Vocabulary Adaptation via Token AlignmentLong
  752. Token Prepending: A Training-Free Approach for Eliciting Better Sentence Embeddings from LLMsLong
  753. Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?finding
  754. Token-Budget-Aware LLM Reasoningfinding
  755. Token-level Preference Self-Alignment Optimization for Multi-style Outline Controllable Generationfinding
  756. TokenShapley: Token Level Context Attribution with Shapley Valuefinding
  757. Tokenisation is NP-CompleteLong
  758. Tokenization is Sensitive to Language Variationfinding
  759. Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Trainingfinding
  760. Tool learning via Inference-time Scaling and Cycle Verifierfinding
  761. ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language ModelsLong
  762. ToolExpNet: Optimizing Multi-Tool Selection in LLMs with Similarity and Dependency-Aware Experience Networksfinding
  763. ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool UseLong
  764. ToolSpectrum: Towards Personalized Tool Utilization for Large Language Modelsfinding
  765. Top-n𝜎: Eliminating Noise in Logit Space for Robust Token Sampling of LLMLong
  766. Topic Modeling for Short Texts via Optimal Transport-Based Clusteringfinding
  767. Toward Automatic Discovery of a Canine Phonetic AlphabetLong
  768. Toward Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)finding
  769. Toward Structured Knowledge Reasoning: Contrastive Retrieval-Augmented Generation on Experiencefinding
  770. Towards A Better Initial Policy Model For Scalable Long-CoT Reinforcement Learningfinding
  771. Towards A “Novel” Benchmark: Evaluating Literary Fiction with Large Language Modelsfinding
  772. Towards Adapting Open-Source Large Language Models for Expert-Level Clinical Note Generationfinding
  773. Towards Adaptive Memory-Based Optimization for Enhanced Retrieval-Augmented Generationfinding
  774. Towards Better Chain-of-Thought: A Reflection on Effectiveness and Faithfulnessfinding
  775. Towards Better Evaluation for Generated Patent ClaimsLong
  776. Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environmentsfinding
  777. Towards Better Value Principles for Large Language Model Alignment: A Systematic Evaluation and EnhancementLong
  778. Towards Building Large Scale Datasets and State-of-the-Art Automatic Speech Translation Systems for 14 Indian LanguagesLong
  779. Towards Comprehensive Argument Analysis in Education: Dataset, Tasks, and MethodLong
  780. Towards Conditioning Clinical Text Generation for User Controlfinding
  781. Towards Context-Robust LLMs: A Gated Representation Fine-tuning ApproachLong
  782. Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human StatesLong
  783. Towards Economical Inference: Enabling DeepSeek’s Multi-Head Latent Attention in Any Transformer-based LLMsLong
  784. Towards Effective Extraction and Evaluation of Factual ClaimsLong
  785. Towards Effective and Efficient Continual Pre-training of Large Language ModelsLong
  786. Towards Efficient LLM Grounding for Embodied Multi-Agent Collaborationfinding
  787. Towards Enhanced Immersion and Agency for LLM-based Interactive DramaLong
  788. Towards Explainable Hate Speech Detectionfinding
  789. Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Frameworkfinding
  790. Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary PerceptionLong
  791. Towards Geo-Culturally Grounded LLM GenerationsShort
  792. Towards Harmonized Uncertainty Estimation for Large Language ModelsLong
  793. Towards LLM-powered Attentive Listener: A Pragmatic Approach through Quantity Self-RepairShort
  794. Towards Medical Complex Reasoning with LLMs through Medical Verifiable Problemsfinding
  795. Towards Multi-dimensional Evaluation of LLM Summarization across Domains and LanguagesLong
  796. Towards Objective Fine-tuning: How LLMs’ Prior Knowledge Causes Potential Poor Calibration?Long
  797. Towards Omni-RAG: Comprehensive Retrieval-Augmented Generation for Large Language Models in Medical ApplicationsLong
  798. Towards Reliable Large Audio Language Modelfinding
  799. Towards Reward Fairness in RLHF: From a Resource Allocation PerspectiveLong
  800. Towards Robust ESG Analysis Against Greenwashing Risks: Aspect-Action Analysis with Cross-Category GeneralizationLong
  801. Towards Robust Universal Information Extraction: Dataset, Evaluation, and SolutionLong
  802. Towards Robust and Efficient Federated Low-Rank Adaptation with Heterogeneous ClientsLong
  803. Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creationfinding
  804. Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddingsfinding
  805. Towards Style Alignment in Cross-Cultural TranslationLong
  806. Towards Text-Image Interleaved RetrievalLong
  807. Towards a Design Guideline for RPA Evaluation: A Survey of Large Language Model-Based Role-Playing Agentsfinding
  808. Towards a More Generalized Approach in Open Relation ExtractionLong
  809. Towards the Law of Capacity Gap in Distilling Language ModelsLong
  810. Towards the Pedagogical Steering of Large Language Models for Tutoring: A Case Study with Modeling Productive Failurefinding
  811. Tracing and Dissecting How LLMs Recall Factual Knowledge for Real World QuestionsLong
  812. Tracking Life’s Ups and Downs: Mining Life Events from Social Media Posts for Mental Health AnalysisLong
  813. Tracr-Injection: Distilling Algorithms into Pre-trained Language Modelsfinding
  814. Training Bilingual LMs with Data Constraints in the Targeted Languagefinding
  815. Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum LearningLong
  816. Training Language Model to Critique for Better Refinementfinding
  817. Training Long-Context LLMs Efficiently via Chunk-wise Optimizationfinding
  818. Training Multi-Modal LLMs through Dialogue Planning for HRIfinding
  819. Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutorsfinding
  820. Training-free LLM Merging for Multi-task LearningLong
  821. TransBench: Breaking Barriers for Transferable Graphical User Interface Agents in Dynamic Digital Environmentsfinding
  822. Transferring Textual Preferences to Vision-Language Understanding through Model MergingShort
  823. Translate With Care: Addressing Gender Bias, Neutrality, and Reasoning in Large Language Model Translationsfinding
  824. Translation and Fusion Improves Cross-lingual Information ExtractionLong
  825. Transparentize the Internal and External Knowledge Utilization in LLMs with Trustworthy Citationfinding
  826. Tree-KG: An Expandable Knowledge Graph Construction Framework for Knowledge-intensive DomainsLong
  827. Tree-of-Code: A Self-Growing Tree Framework for End-to-End Code Generation and Execution in Complex Tasksfinding
  828. Tree-of-Debate: Multi-Persona Debate Trees Elicit Critical Thinking for Scientific Comparative AnalysisLong
  829. Tree-of-Evolution: Tree-Structured Instruction Evolution for Code Generation in Large Language ModelsLong
  830. Tree-of-Prompts: Abstracting Control-Flow for Prompt Optimizationfinding
  831. TreeCut: A Synthetic Unanswerable Math Word Problem Dataset for LLM Hallucination EvaluationShort
  832. TreeRAG: Unleashing the Power of Hierarchical Storage for Enhanced Knowledge Retrieval in Long Documentsfinding
  833. TreeRL: LLM Reinforcement Learning with On-Policy Tree SearchLong
  834. TriEmbed: Bridge the Gap between Text and Token Indices with Embedding Reparameterizationfinding
  835. Trick or Neat: Adversarial Ambiguity and Language Model Evaluationfinding
  836. TrimLLM: Progressive Layer Dropping for Domain-Specific LLMsLong
  837. TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel PlanningLong
  838. TripTailor: A Real-World Benchmark for Personalized Travel Planningfinding
  839. TripleFact: Defending Data Contamination in the Evaluation of LLM-driven Fake News DetectionLong
  840. TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operatorsfinding
  841. Truth Knows No Language: Evaluating Truthfulness Beyond EnglishLong
  842. Tunable LLM-based Proactive Recommendation AgentLong
  843. Turbocharging Web Automation: The Impact of Compressed History Statesfinding
  844. Turning Conversations into Workflows: A Framework to Extract and Evaluate Dialog Workflows for Service AI Agentsfinding
  845. Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token RecyclingLong
  846. Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation RefinementLong
  847. Typology-Guided Adaptation in Multilingual ModelsLong
  848. UAQFact: Evaluating Factual Knowledge Utilization of LLMs on Unanswerable Questionsfinding
  849. UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language ModelsLong
  850. UBench: Benchmarking Uncertainty in Large Language Models with Multiple Choice Questionsfinding
  851. UCS-SQL: Uniting Content and Structure for Enhanced Semantic Bridging In Text-to-SQLfinding
  852. UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesisfinding
  853. UORA: Uniform Orthogonal Reinitialization Adaptation in Parameter Efficient Fine-Tuning of Large ModelsLong
  854. UQ-Merge: Uncertainty Guided Multimodal Large Language Model Mergingfinding
  855. USDC: A Dataset of  ̲User  ̲Stance and  ̲Dogmatism in Long  ̲Conversationsfinding
  856. UTBoost: Rigorous Evaluation of Coding Agents on SWE-BenchLong
  857. Un-considering Contextual Information: Assessing LLMs’ Understanding of Indexical Elementsfinding
  858. UnSeenTimeQA: Time-Sensitive Question-Answering Beyond LLMs’ MemorizationLong
  859. Unanswerability Evaluation for Retrieval Augmented GenerationLong
  860. Uncertainty Propagation on LLM AgentLong
  861. Uncertainty Unveiled: Can Exposure to More In-context Examples Mitigate Uncertainty for Large Language Models?finding
  862. Uncertainty in Causality: A New FrontierLong
  863. Uncertainty-Aware Contrastive Decodingfinding
  864. Uncertainty-Aware Iterative Preference Optimization for Enhanced LLM ReasoningLong
  865. Uncovering Visual-Semantic Psycholinguistic Properties from the Distributional Structure of Text Embedding SpaceLong
  866. Uncovering the Impact of Chain-of-Thought Reasoning for Direct Preference Optimization: Lessons from Text-to-SQLLong
  867. Understand User Opinions of Large Language Models via LLM-Powered In-the-Moment User Experience Interviewsfinding
  868. Understand the Implication: Learning to Think for Pragmatic Understandingfinding
  869. Understanding Common Ground Misalignment in Goal-Oriented Dialog: A Case-Study with Ubuntu Chat LogsLong
  870. Understanding Cross-Domain Adaptation in Low-Resource Topic ModelingLong
  871. Understanding Impact of Human Feedback via Influence FunctionsLong
  872. Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on ManchuLong
  873. Understanding Large Language Model Vulnerabilities to Social Bias AttacksLong
  874. Understanding Silent Data Corruption in LLM TrainingLong
  875. Understanding and Meeting Practitioner Needs When Measuring Representational Harms Caused by LLM-Based Systemsfinding
  876. Understanding the Dark Side of LLMs’ Intrinsic Self-CorrectionLong
  877. Understanding the Gap: an Analysis of Research Collaborations in NLP and Language Documentationfinding
  878. Understanding the Influence of Synthetic Data for Text Embeddersfinding
  879. Understanding the Repeat Curse in Large Language Models from a Feature Perspectivefinding
  880. Uni-Retrieval: A Multi-Style Retrieval Framework for STEM’s EducationLong
  881. UniCodec: Unified Audio Codec with Single Domain-Adaptive CodebookLong
  882. UniConv: Unifying Retrieval and Response Generation for Large Language Models in ConversationsLong
  883. UniICL: An Efficient ICL Framework Unifying Compression, Selection, and GenerationLong
  884. UniLR: Unleashing the Power of LLMs on Multiple Legal Tasks with a Unified Legal RetrieverLong
  885. UniRAG: Unified Query Understanding Method for Retrieval Augmented GenerationLong
  886. UniT: One Document, Many Revisions, Too Many Edit Intention Taxonomiesfinding
  887. Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion ProcessesLong
  888. Unifying Uniform and Binary-coding Quantization for Accurate Compression of Large Language ModelsLong
  889. Unilogit: Robust Machine Unlearning for LLMs Using Uniform-Target Self-Distillationfinding
  890. Unintended Harms of Value-Aligned LLMs: Psychological and Empirical InsightsLong
  891. Unique Hard Attention: A Tale of Two SidesShort
  892. Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillationfinding
  893. Unleashing LLM Reasoning Capability via Scalable Question Synthesis from ScratchLong
  894. Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation EngineeringLong
  895. Unlocking LLMs’ Self-Improvement Capacity with Autonomous Learning for Domain Adaptationfinding
  896. Unlocking Recursive Thinking of LLMs: Alignment via Refinementfinding
  897. Unlocking Speech Instruction Data Potential with Query Rewritingfinding
  898. Unmasking Style Sensitivity: A Causal Analysis of Bias Evaluation Instability in Large Language ModelsLong
  899. Unraveling LoRA Interference: Orthogonal Subspaces for Robust Model MergingLong
  900. Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Modelsfinding
  901. Unraveling the Mechanics of Learning-Based Demonstration Selection for In-Context LearningLong
  902. Unravelling the Logic: Investigating the Generalisation of Transformers in Numerical Satisfiability ProblemsLong
  903. UnrealLLM: Towards Highly Controllable and Interactable 3D Scene Generation by LLM-powered Procedural Content Generationfinding
  904. Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal ModelsLong
  905. Unsupervised Morphological Tree Tokenizerfinding
  906. Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language ModelsLong
  907. Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document RetrievalLong
  908. Unveiling Attractor Cycles in Large Language Models: A Dynamical Systems View of Successive ParaphrasingLong
  909. Unveiling Confirmation Bias in Chain-of-Thought Reasoningfinding
  910. Unveiling Cultural Blind Spots: Analyzing the Limitations of mLLMs in Procedural Text ComprehensionLong
  911. Unveiling Environmental Impacts of Large Language Model Serving: A Functional Unit ViewLong
  912. Unveiling Language-Specific Features in Large Language Models via Sparse AutoencodersLong
  913. Unveiling Privacy Risks in LLM Agent MemoryLong
  914. Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challengesfinding
  915. Unveiling and Addressing Pseudo Forgetting in Large Language Modelsfinding
  916. Unveiling the Key Factors for Distilling Chain-of-Thought Reasoningfinding
  917. Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forwardfinding
  918. Unveiling the Potential of BERT-family: A New Recipe for Building Scalable, General and Competitive Large Language ModelsLong
  919. Unveiling the Power of Source: Source-based Minimum Bayes Risk Decoding for Neural Machine TranslationLong
  920. Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter MergingLong
  921. UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban SpacesLong
  922. User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMsfinding
  923. User-side Model Consistency Monitoring for Open Source Large Language Models Inference ServicesLong
  924. Using Information Theory to Characterize Prosodic Typology: The Case of Tone, Pitch-Accent and Stress-AccentLong
  925. Using Shapley interactions to understand how models use structureLong
  926. Using Subtext to Enhance Generative IDRRShort
  927. Utilizing Semantic Textual Similarity for Clinical Survey Data Feature Selectionfinding
  928. V-ALPHASOCIAL: Benchmark and Self-Reflective Chain-of-Thought Generation for Visual Social Commonsense Reasoningfinding
  929. V-Oracle: Making Progressive Reasoning in Deciphering Oracle Bones for You and MeLong
  930. VADE: Visual Attention Guided Hallucination Detection and Eliminationfinding
  931. VAQUUM: Are Vague Quantifiers Grounded in Visual Data?finding
  932. VCD: A Dataset for Visual Commonsense Discovery in Imagesfinding
  933. VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC VideosLong
  934. VISA: Retrieval Augmented Generation with Visual Source AttributionLong
  935. VISIAR: Empower MLLM for Visual Story Ideationfinding
  936. VITAL: A New Dataset for Benchmarking Pluralistic Alignment in HealthcareLong
  937. VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual CuesLong
  938. VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a ServiceLong
  939. VLSBench: Unveiling Visual Leakage in Multimodal SafetyLong
  940. VMLU Benchmarks: A comprehensive benchmark toolkit for Vietnamese LLMsLong
  941. VP-MEL: Visual Prompts Guided Multimodal Entity Linkingfinding
  942. VQAGuider: Guiding Multimodal Large Language Models to Answer Complex Video QuestionsLong
  943. VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward MechanismLong
  944. VSCBench: Bridging the Gap in Vision-Language Model Safety Calibrationfinding
  945. Value Portrait: Assessing Language Models’ Values through Psychometrically and Ecologically Valid ItemsLong
  946. Value Residual LearningLong
  947. Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media ContextsLong
  948. Variable Layerwise Quantization: A Simple and Effective Approach to Quantize LLMsfinding
  949. Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-trainingLong
  950. Veracity Bias and Beyond: Uncovering LLMs’ Hidden Beliefs in Problem-Solving ReasoningLong
  951. Verbosity-Aware Rationale Reduction: Sentence-Level Rationale Reduction for Efficient and Effective Reasoningfinding
  952. Verify with Caution: The Pitfalls of Relying on Imperfect Factuality Metricsfinding
  953. Verifying the Steps of Deductive Reasoning Chainsfinding
  954. ViGiL3D: A Linguistically Diverse Dataset for 3D Visual GroundingLong
  955. VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generationfinding
  956. VideoRAG: Retrieval-Augmented Generation over Video Corpusfinding
  957. VideoVista-CulturalLingo: 360° Horizons-Bridging Cultures, Languages, and Domains in Video ComprehensionLong
  958. Visibility as Survival: Generalizing NLP for Native Alaskan Language Identificationfinding
  959. Vision Language Model Helps Private Information De-Identification in Vision Datafinding
  960. Vision-Language Models Struggle to Align Entities across Modalitiesfinding
  961. Vision-aided Unsupervised Constituency Parsing with Multi-MLLM Debatingfinding
  962. Visual Cues Enhance Predictive Turn-Taking for Two-Party Human Interactionfinding
  963. Visual Evidence Prompting Mitigates Hallucinations in Large Vision-Language ModelsLong
  964. Visualising Policy-Reward Interplay to Inform Zeroth-Order Preference Optimisation of Large Language Modelsfinding
  965. VisuoThink: Empowering LVLM Reasoning with Multimodal Tree SearchLong
  966. Voting or Consensus? Decision-Making in Multi-Agent Debatefinding
  967. VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language ModelsLong
  968. Vulnerability of LLMs to Vertically Aligned Text ManipulationsLong
  969. Vulnerability of Text-to-Image Models to Prompt Template Stealing: A Differential Evolution Approachfinding
  970. WAFFLE: Fine-tuning Multi-Modal Model for Automated Front-End DevelopmentLong
  971. WASA: WAtermark-based Source Attribution for Large Language Model-Generated Datafinding
  972. WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation WatermarksLong
  973. WMT24++: Expanding the Language Coverage of WMT24 to 55 Languages & Dialectsfinding
  974. WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Modelsfinding
  975. Wait, that’s not an option: LLMs Robustness with Incorrect Multiple-Choice OptionsLong
  976. Walk in Others’ Shoes with a Single Glance: Human-Centric Visual Grounding with Top-View Perspective TransformationLong
  977. Wanda++: Pruning Large Language Models via Regional Gradientsfinding
  978. War of Thoughts: Competition Stimulates Stronger Reasoning in Large Language Modelsfinding
  979. Warmup Generations: A Task-Agnostic Approach for Guiding Sequence-to-Sequence Learning with Unsupervised Initial State GenerationLong
  980. WarriorCoder: Learning from Expert Battles to Augment Code Large Language ModelsLong
  981. Watching the Watchers: Exposing Gender Disparities in Machine Translation Quality EstimationLong
  982. Watermarking Large Language Models: An Unbiased and Low-risk MethodLong
  983. WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue ModelsLong
  984. We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?Long
  985. Weak-to-Strong Honesty Alignment via Learning-to-Rank Supervisionfinding
  986. Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual ChainsLong
  987. WebNLG-IT: Construction of an aligned RDF-Italian corpus through Machine Translation techniquesfinding
  988. WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Codefinding
  989. WebWalker: Benchmarking LLMs in Web TraversalLong
  990. Weed Out, Then Harvest: Dual Low-Rank Adaptation is an Effective Noisy Label Detector for Noise-Robust Learningfinding
  991. Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decodingfinding
  992. What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient PerspectiveLong
  993. What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific PresentationsLong
  994. What Language Do Non-English-Centric Large Language Models Think in?finding
  995. What Makes a Good Natural Language Prompt?Long
  996. What Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story EvaluationLong
  997. What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMsLong
  998. What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best PracticesLong
  999. What is Stigma Attributed to? A Theory-Grounded, Expert-Annotated Interview Corpus for Demystifying Mental-Health StigmaLong
  1000. What is in a name? Mitigating Name Bias in Text Embedding Similarity via Anonymizationfinding

Looking for submission deadlines instead? See the conference deadline calendar.