← All conferences

NAACL 2025 Accepted Papers

The full list of 1,274 papers accepted at NAACL 2025 (North American Chapter of the Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Long: 614Findings: 457Short: 80Industry: 79System Demonstrations: 44
  1. GPT-NER: Named Entity Recognition via Large Language ModelsFindings421 citations
  2. RewardBench: Evaluating Reward Models for Language ModelingFindings254 citations
  3. ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language ModelsLong92 citations
  4. UFO: A UI-Focused Agent for Windows OS InteractionLong86 citations
  5. GRAG: Graph Retrieval-Augmented GenerationFindings73 citations
  6. Huatuo-26M, a Large-scale Chinese Medical QA DatasetFindings71 citations
  7. In-Context Learning with Long-Context Models: An In-Depth ExplorationLong65 citations
  8. Simulating Classroom Education with LLM-Empowered AgentsLong61 citations
  9. EASYTOOL: Enhancing LLM-based Agents with Concise Tool InstructionLong60 citations
  10. LMMs-Eval: Reality Check on the Evaluation of Large Multimodal ModelsFindings56 citations
  11. FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language ModelsLong52 citations
  12. DreamSync: Aligning Text-to-Image Generation with Image Understanding FeedbackLong47 citations
  13. KMMLU: Measuring Massive Multitask Language Understanding in KoreanLong46 citations
  14. AudioBench: A Universal Benchmark for Audio Large Language ModelsLong44 citations
  15. LiPO: Listwise Preference Optimization through Learning-to-RankLong44 citations
  16. Alleviating Hallucinations of Large Language Models through Induced HallucinationsFindings43 citations
  17. KnowAgent: Knowledge-Augmented Planning for LLM-Based AgentsFindings41 citations
  18. Unfamiliar Finetuning Examples Control How Language Models HallucinateLong41 citations
  19. Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-ImprovementFindings37 citations
  20. Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language ModelsLong37 citations
  21. Benchmarking Large Language Models on Answering and Explaining Challenging Medical QuestionsLong35 citations
  22. FollowIR: Evaluating and Teaching Information Retrieval Models to Follow InstructionsLong34 citations
  23. ScreenQA: Large-Scale Question-Answer Pairs Over Mobile App ScreenshotsLong34 citations
  24. xLAM: A Family of Large Action Models to Empower AI Agent SystemsLong34 citations
  25. The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-DeterminismLong33 citations
  26. Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion ModelsFindings31 citations
  27. Hello Again! LLM-powered Personalized Agent for Long-term DialogueLong29 citations
  28. ImgTrojan: Jailbreaking Vision-Language Models with ONE ImageLong28 citations
  29. SciAssess: Benchmarking LLM Proficiency in Scientific Literature AnalysisFindings28 citations
  30. Clarify When Necessary: Resolving Ambiguity Through Interaction with LMsFindings27 citations
  31. MiLoRA: Harnessing Minor Singular Components for Parameter-Efficient LLM FinetuningLong27 citations
  32. ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use CapabilitiesFindings27 citations
  33. What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt EngineeringLong26 citations
  34. Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language ModelsLong24 citations
  35. Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive DemonstrationsFindings24 citations
  36. Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific PlotsFindings23 citations
  37. Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of StereotypesShort23 citations
  38. ALPACA AGAINST VICUNA: Using LLMs to Uncover Memorization of LLMsLong21 citations
  39. EvoAgent: Towards Automatic Multi-Agent Generation via Evolutionary AlgorithmsLong21 citations
  40. Octopus: On-device language model for function calling of software APIsIndustry21 citations
  41. TESTEVAL: Benchmarking Large Language Models for Test Case GenerationFindings21 citations
  42. Self-Generated Critiques Boost Reward Modeling for Language ModelsLong20 citations
  43. COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuningFindings17 citations
  44. CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph DatabasesLong17 citations
  45. Improving Reward Models with Synthetic CritiquesFindings17 citations
  46. Induction Heads as an Essential Mechanism for Pattern Matching in In-context LearningFindings17 citations
  47. Vision-Language Models Can Self-Improve Reasoning via ReflectionLong17 citations
  48. CollabStory: Multi-LLM Collaborative Story Generation and Authorship AnalysisFindings15 citations
  49. Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented GenerationLong15 citations
  50. Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient ReasoningFindings15 citations
  51. RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and RefinementLong15 citations
  52. Fact-Aware Multimodal Retrieval Augmentation for Accurate Medical Radiology Report GenerationLong14 citations
  53. MASSW: A New Dataset and Benchmark Tasks for AI-Assisted Scientific WorkflowsFindings14 citations
  54. Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning LanguagesLong14 citations
  55. Are We Done with MMLU?Long13 citations
  56. Ask Optimal Questions: Aligning Large Language Models with Retriever’s Preference in ConversationFindings13 citations
  57. ChatCRS: Incorporating External Knowledge and Goal Guidance for LLM-based Conversational Recommender SystemsFindings13 citations
  58. Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with PsychometricsFindings13 citations
  59. MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer DecodingFindings13 citations
  60. OLMES: A Standard for Language Model EvaluationsFindings13 citations
  61. The Russian-focused embedders’ exploration: ruMTEB benchmark and Russian embedding model designLong13 citations
  62. Can Unconfident LLM Annotations Be Used for Confident Conclusions?Long12 citations
  63. Direct Preference Optimization of Video Large Multimodal Models from Language Model RewardLong12 citations
  64. Does Mapo Tofu Contain Coffee? Probing LLMs for Food-related Cultural KnowledgeLong12 citations
  65. Fine-Tuning Large Language Models with Sequential InstructionsLong12 citations
  66. Neuro-Symbolic Integration Brings Causal and Reliable Reasoning ProofsFindings12 citations
  67. SOLID: Self-seeding and Multi-intent Self-instructing LLMs for Generating Intent-aware Information-Seeking DialogsFindings12 citations
  68. A Closer Look into Mixture-of-Experts in Large Language ModelsFindings11 citations
  69. CLERC: A Dataset for U. S. Legal Case Retrieval and Retrieval-Augmented Analysis GenerationFindings11 citations
  70. Data Poisoning for In-context LearningFindings11 citations
  71. Infogent: An Agent-Based Framework for Web Information AggregationFindings11 citations
  72. L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional ObjectsSystem Demonstrations11 citations
  73. LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language ModelsFindings11 citations
  74. Soft Prompting for Unlearning in Large Language ModelsLong11 citations
  75. Speculative Diffusion Decoding: Accelerating Language Generation through DiffusionLong11 citations
  76. WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and ResponseFindings11 citations
  77. WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global CuisinesLong11 citations
  78. Can Large Language Models Generate High-quality Patent Claims?Findings10 citations
  79. Causal Inference with Large Language Model: A SurveyFindings10 citations
  80. Decoding Speculative DecodingLong10 citations
  81. DialogGen: Multi-modal Interactive Dialogue System with Multi-turn Text-Image GenerationFindings10 citations
  82. Few-shot Personalization of LLMs with Mis-aligned ResponsesLong10 citations
  83. Ground Every Sentence: Improving Retrieval-Augmented LLMs with Interleaved Reference-Claim GenerationFindings10 citations
  84. Protecting Privacy in Multimodal Large Language Models with MLLMU-BenchLong10 citations
  85. SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian LanguagesSystem Demonstrations10 citations
  86. TEaR: Improving LLM-based Machine Translation with Systematic Self-RefinementFindings10 citations
  87. VLind-Bench: Measuring Language Priors in Large Vision-Language ModelsFindings10 citations
  88. AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion GenerationFindings9 citations
  89. Attention Tracker: Detecting Prompt Injection Attacks in LLMsFindings9 citations
  90. CodeTree: Agent-guided Tree Search for Code Generation with Large Language ModelsLong9 citations
  91. Is Semantic Chunking Worth the Computational Cost?Findings9 citations
  92. Logic-of-Thought: Injecting Logic into Contexts for Full Reasoning in Large Language ModelsLong9 citations
  93. On Behalf of the Stakeholders: Trends in NLP Model Interpretability in the Era of LLMsLong9 citations
  94. QuaLLM: An LLM-based Framework to Extract Quantitative Insights from Online ForumsFindings9 citations
  95. Revealing the Barriers of Language Agents in PlanningLong9 citations
  96. SELFGOAL: Your Language Agents Already Know How to Achieve High-level GoalsLong9 citations
  97. AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive ScenariosLong8 citations
  98. Code-Optimise: Self-Generated Preference Data for Correctness and EfficiencyFindings8 citations
  99. Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-ExpertsLong8 citations
  100. Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex ReasoningLong8 citations
  101. Exploring Safety-Utility Trade-Offs in Personalized Language ModelsLong8 citations
  102. From Distributional to Overton Pluralism: Investigating Large Language Model AlignmentLong8 citations
  103. Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse LanguagesLong8 citations
  104. Large Language Models for Anomaly and Out-of-Distribution Detection: A SurveyFindings8 citations
  105. MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient EvaluationLong8 citations
  106. Model Surgery: Modulating LLM’s Behavior Via Simple Parameter EditingLong8 citations
  107. Navigating the Path of Writing: Outline-guided Text Generation with Large Language ModelsIndustry8 citations
  108. Repetition Neurons: How Do Language Models Produce Repetitions?Short8 citations
  109. The LLM Language Network: A Neuroscientific Approach for Identifying Causally Task-Relevant UnitsLong8 citations
  110. Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning AttacksFindings8 citations
  111. Uncovering Bias in Large Vision-Language Models at Scale with CounterfactualsLong8 citations
  112. UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language ModelFindings8 citations
  113. Verifiable by Design: Aligning Language Models to Quote from Pre-Training DataLong8 citations
  114. Are LLM-Judges Robust to Expressions of Uncertainty? Investigating the effect of Epistemic Markers on LLM-based EvaluationLong7 citations
  115. Audio Is the Achilles’ Heel: Red Teaming Audio Large Multimodal ModelsLong7 citations
  116. CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language ModelsLong7 citations
  117. Correcting Negative Bias in Large Language Models through Negative Attention Score AlignmentLong7 citations
  118. DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order OptimizationFindings7 citations
  119. Evaluating Cultural and Social Awareness of LLM Web AgentsFindings7 citations
  120. From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context LearningLong7 citations
  121. GenSim: A General Social Simulation Platform with Large Language Model based AgentsSystem Demonstrations7 citations
  122. High-Dimension Human Value Representation in Large Language ModelsLong7 citations
  123. IrokoBench: A New Benchmark for African Languages in the Age of Large Language ModelsLong7 citations
  124. Privacy Checklist: Privacy Violation Detection Grounding on Contextual Integrity TheoryLong7 citations
  125. Teaching Models to Balance Resisting and Accepting PersuasionLong7 citations
  126. TurkingBench: A Challenge Benchmark for Web AgentsLong7 citations
  127. UCFE: A User-Centric Financial Expertise Benchmark for Large Language ModelsFindings7 citations
  128. A Picture is Worth A Thousand Numbers: Enabling LLMs Reason about Time Series via VisualizationLong6 citations
  129. CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language ModelsFindings6 citations
  130. Can LLMs Convert Graphs to Text-Attributed Graphs?Long6 citations
  131. Can LLMs Learn Macroeconomic Narratives from Social Media?Findings6 citations
  132. DHP Benchmark: Are LLMs Good NLG Evaluators?Findings6 citations
  133. HIGGS: Pushing the Limits of Large Language Model Quantization via the Linearity TheoremLong6 citations
  134. Investigating Human Values in Online CommunitiesLong6 citations
  135. LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language ModelsFindings6 citations
  136. Language Models “Grok” to CopyShort6 citations
  137. Large Language Models Reflect Human Citation Patterns with a Heightened Citation BiasFindings6 citations
  138. MLLM-Bench: Evaluating Multimodal LLMs with Per-sample CriteriaLong6 citations
  139. MSc-SQL: Multi-Sample Critiquing Small Language Models For Text-To-SQL TranslationLong6 citations
  140. Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language ModelsLong6 citations
  141. On the Impact of Fine-Tuning on Chain-of-Thought ReasoningLong6 citations
  142. Prompt Compression for Large Language Models: A SurveyLong6 citations
  143. REL-A.I.: An Interaction-Centered Approach To Measuring Human-LM RelianceLong6 citations
  144. ReIFE: Re-evaluating Instruction-Following EvaluationLong6 citations
  145. Self-DC: When to Reason and When to Act? Self Divide-and-Conquer for Compositional Unknown QuestionsLong6 citations
  146. Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model TrainingLong6 citations
  147. Sketch2Code: Evaluating Vision-Language Models for Interactive Web Design PrototypingLong6 citations
  148. The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language ModelsLong6 citations
  149. ThoughtSculpt: Reasoning with Intermediate Revision and SearchFindings6 citations
  150. Understanding Reference Policies in Direct Preference OptimizationFindings6 citations
  151. Unlearning as multi-task optimization: A normalized gradient difference approach with an adaptive learning rateLong6 citations
  152. AEGIS2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM GuardrailsLong5 citations
  153. AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric KnowledgeLong5 citations
  154. Benchmarking Language Model Creativity: A Case Study on Code GenerationLong5 citations
  155. CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic EnvironmentsLong5 citations
  156. Do Large Language Models Align with Core Mental Health Counseling Competencies?Findings5 citations
  157. DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students’ Hand-Drawn Math ImagesLong5 citations
  158. FunnelRAG: A Coarse-to-Fine Progressive Retrieval Paradigm for RAGFindings5 citations
  159. HyPA-RAG: A Hybrid Parameter Adaptive Retrieval-Augmented Generation System for AI Legal and Policy ApplicationsIndustry5 citations
  160. Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational RetrievalLong5 citations
  161. Language Modeling with Editable External KnowledgeFindings5 citations
  162. Language Models are Crossword SolversLong5 citations
  163. Lived Experience Not Found: LLMs Struggle to Align with Experts on Addressing Adverse Drug Reactions from Psychiatric Medication UseLong5 citations
  164. M2Lingual: Enhancing Multilingual, Multi-Turn Instruction Alignment in Large Language ModelsLong5 citations
  165. MCQG-SRefine: Multiple Choice Question Generation and Evaluation with Iterative Self-Critique, Correction, and Comparison FeedbackLong5 citations
  166. MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation SystemsLong5 citations
  167. Measuring and Benchmarking Large Language Models’ Capabilities to Generate Persuasive LanguageLong5 citations
  168. Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided DecodingFindings5 citations
  169. Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning ParadigmFindings5 citations
  170. One fish, two fish, but not the whole sea: Alignment reduces language models’ conceptual diversityLong5 citations
  171. PAPILLON: Privacy Preservation from Internet-based and Local Language Model EnsemblesLong5 citations
  172. Patent-CR: A Dataset for Patent Claim RevisionLong5 citations
  173. PlagBench: Exploring the Duality of Large Language Models in Plagiarism Generation and DetectionLong5 citations
  174. Probing-RAG: Self-Probing to Guide Language Models in Selective Document RetrievalFindings5 citations
  175. ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy ModelsFindings5 citations
  176. SimulBench: Evaluating Language Models with Creative Simulation TasksFindings5 citations
  177. Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation EngineeringLong5 citations
  178. Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language ModelsLong5 citations
  179. The Promises and Pitfalls of LLM Annotations in Dataset Labeling: a Case Study on Media Bias DetectionFindings5 citations
  180. Tooling or Not Tooling? The Impact of Tools on Language Agents for Chemistry Problem SolvingFindings5 citations
  181. Towards Cross-Lingual Explanation of Artwork in Large-scale Vision Language ModelsFindings5 citations
  182. Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive PromptsLong5 citations
  183. VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and MusicSystem Demonstrations5 citations
  184. WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluationFindings5 citations
  185. mHumanEval - A Multilingual Benchmark to Evaluate Large Language Models for Code GenerationLong5 citations
  186. A Logical Fallacy-Informed Framework for Argument GenerationLong4 citations
  187. A Probabilistic Framework for LLM Hallucination Detection via Belief Tree PropagationLong4 citations
  188. A Template Is All You MemeLong4 citations
  189. Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM AgentsFindings4 citations
  190. Adaptive Retrieval-Augmented Generation for Conversational SystemsFindings4 citations
  191. AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization via Multi-LLMsFindings4 citations
  192. BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in AlignmentLong4 citations
  193. Beemo: Benchmark of Expert-edited Machine-generated OutputsLong4 citations
  194. Benchmarking Distributional Alignment of Large Language ModelsLong4 citations
  195. Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You InFindings4 citations
  196. CAVE: Controllable Authorship Verification ExplanationsLong4 citations
  197. CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior TherapyLong4 citations
  198. CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmented GenerationFindings4 citations
  199. Can’t Hide Behind the API: Stealing Black-Box Commercial Embedding ModelsFindings4 citations
  200. CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-ExpertsLong4 citations
  201. Challenges in Trustworthy Human Evaluation of ChatbotsFindings4 citations
  202. CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual WorldsLong4 citations
  203. Conformalized Answer Set Prediction for Knowledge Graph EmbeddingLong4 citations
  204. Cracking the Code: Multi-domain LLM Evaluation on Real-World Professional Exams in IndonesiaIndustry4 citations
  205. Cross-lingual Transfer of Reward Models in Multilingual AlignmentShort4 citations
  206. DAWN-ICL: Strategic Planning of Problem-solving Trajectories for Zero-Shot In-Context LearningLong4 citations
  207. Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End EngineeringLong4 citations
  208. Does Liking Yellow Imply Driving a School Bus? Semantic Leakage in Language ModelsLong4 citations
  209. Evaluating Morphological Compositional Generalization in Large Language ModelsLong4 citations
  210. Evaluating the Performance of Large Language Models via DebatesFindings4 citations
  211. FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMsShort4 citations
  212. FedSpaLLM: Federated Pruning of Large Language ModelsLong4 citations
  213. From Allies to Adversaries: Manipulating LLM Tool-Calling through Adversarial InjectionLong4 citations
  214. Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM AgentsFindings4 citations
  215. LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling MatricesLong4 citations
  216. Language Models Can Infer Action Semantics for Symbolic Planners from Environment FeedbackLong4 citations
  217. Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification ToolsLong4 citations
  218. Learning to Summarize from LLM-generated FeedbackLong4 citations
  219. Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and CapabilitySystem Demonstrations4 citations
  220. MILU: A Multi-task Indic Language Understanding BenchmarkLong4 citations
  221. MixLLM: Dynamic Routing in Mixed Large Language ModelsLong4 citations
  222. MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart ProblemsLong4 citations
  223. NormAd: A Framework for Measuring the Cultural Adaptability of Large Language ModelsLong4 citations
  224. On Positional Bias of Faithfulness for Long-form SummarizationLong4 citations
  225. RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language ModelsLong4 citations
  226. Rationale-Guided Retrieval Augmented Generation for Medical Question AnsweringLong4 citations
  227. Self-Pluralising Culture Alignment for Large Language ModelsLong4 citations
  228. Specializing Large Language Models to Simulate Survey Response Distributions for Global PopulationsLong4 citations
  229. StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style DiffusionLong4 citations
  230. Thought2Text: Text Generation from EEG Signal using Large Language Models (LLMs)Findings4 citations
  231. ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue SynthesisLong4 citations
  232. Towards Better Multi-task Learning: A Framework for Optimizing Dataset Combinations in Large Language ModelsFindings4 citations
  233. Towards Knowledge Checking in Retrieval-augmented Generation: A Representation PerspectiveLong4 citations
  234. Transformer-based Causal Language Models Perform ClusteringFindings4 citations
  235. VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-TuningLong4 citations
  236. A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language ModelsLong3 citations
  237. A Novel Computational Modeling Foundation for Automatic Coherence AssessmentLong3 citations
  238. A Systematic Study of Cross-Layer KV Sharing for Efficient LLM InferenceShort3 citations
  239. Advocating Character Error Rate for Multilingual ASR EvaluationFindings3 citations
  240. Analyzing and Evaluating Correlation Measures in NLG Meta-EvaluationLong3 citations
  241. Assessing LLMs for Zero-shot Abstractive Summarization Through the Lens of Relevance ParaphrasingFindings3 citations
  242. CAMEL-Bench: A Comprehensive Arabic LMM BenchmarkFindings3 citations
  243. Causally Testing Gender Bias in LLMs: A Case Study on Occupational BiasFindings3 citations
  244. Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-StepFindings3 citations
  245. ComPO: Community Preferences for Language Model PersonalizationLong3 citations
  246. Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via AbstractionShort3 citations
  247. Data-centric NLP Backdoor Defense from the Lens of MemorizationFindings3 citations
  248. Dataverse: Open-Source ETL (Extract, Transform, Load) Pipeline for Large Language ModelsSystem Demonstrations3 citations
  249. Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection AssumptionsFindings3 citations
  250. Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question AnsweringFindings3 citations
  251. Efficient Prompting for Continual Adaptation to Missing ModalitiesLong3 citations
  252. Enhancing Function-Calling Capabilities in LLMs: Strategies for Prompt Formats, Data Integration, and Multilingual TranslationIndustry3 citations
  253. Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language ModelsIndustry3 citations
  254. Enhancing Temporal Understanding in LLMs for Semi-structured TablesFindings3 citations
  255. Evaluating the Prompt Steerability of Large Language ModelsLong3 citations
  256. FIRE: Fact-checking with Iterative Retrieval and VerificationFindings3 citations
  257. Faux Polyglot: A Study on Information Disparity in Multilingual Large Language ModelsLong3 citations
  258. From Single to Multi: How LLMs Hallucinate in Multi-Document SummarizationFindings3 citations
  259. GPT-4V Cannot Generate Radiology Reports YetFindings3 citations
  260. GraphICL: Unlocking Graph Learning Potential in LLMs through Structured Prompt DesignFindings3 citations
  261. Grounding Fallacies Misrepresenting Scientific Publications in EvidenceLong3 citations
  262. H-STAR: LLM-driven Hybrid SQL-Text Adaptive Reasoning on TablesLong3 citations
  263. How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMsLong3 citations
  264. In-Context Example Selection via Similarity Search Improves Low-Resource Machine TranslationFindings3 citations
  265. Incremental Sentence Processing Mechanisms in Autoregressive Transformer Language ModelsLong3 citations
  266. Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta InstructionLong3 citations
  267. Knowledge Graph-Guided Retrieval Augmented GenerationLong3 citations
  268. LLM The Genius Paradox: A Linguistic and Math Expert’s Struggle with Simple Word-based Counting ProblemsLong3 citations
  269. LLMs Are Biased Towards Output Formats! Systematically Evaluating and Mitigating Output Format Bias of LLMsLong3 citations
  270. LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMsLong3 citations
  271. LLMs vs Established Text Augmentation Techniques for Classification: When do the Benefits Outweight the Costs?Long3 citations
  272. Language Models Encode Numbers Using Digit Representations in Base 10Short3 citations
  273. Large Language Models Are Cross-Lingual Knowledge-Free ReasonersLong3 citations
  274. LlamaLens: Specialized Multilingual LLM for Analyzing News and Social Media ContentFindings3 citations
  275. MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data UncertaintyFindings3 citations
  276. Multi3Hate: Multimodal, Multilingual, and Multicultural Hate Speech Detection with Vision–Language ModelsLong3 citations
  277. Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical StudyLong3 citations
  278. Navigating the Cultural Kaleidoscope: A Hitchhiker’s Guide to Sensitivity in Large Language ModelsLong3 citations
  279. Open Domain Question Answering with Conflicting ContextsFindings3 citations
  280. Rationale Behind Essay Scores: Enhancing S-LLM’s Multi-Trait Essay Scoring with Rationale Generated by LLMsFindings3 citations
  281. ReachAgent: Enhancing Mobile Agent via Page Reaching and OperationLong3 citations
  282. ReasoningRec: Bridging Personalized Recommendations and Human-Interpretable Explanations through LLM ReasoningFindings3 citations
  283. Reverse Thinking Makes LLMs Stronger ReasonersLong3 citations
  284. RuleR: Improving LLM Controllability by Rule-based Data RecyclingShort3 citations
  285. SG-FSM: A Self-Guiding Zero-Shot Prompting Paradigm for Multi-Hop Question Answering Based on Finite State MachineFindings3 citations
  286. SLIM: Let LLM Learn More and Forget Less with Soft LoRA and Identity MixtureLong3 citations
  287. Scaling Up Membership Inference: When and How Attacks Succeed on Large Language ModelsFindings3 citations
  288. Self-Harmonized Chain of ThoughtLong3 citations
  289. Style Transfer with Multi-iteration Preference OptimizationLong3 citations
  290. Substance Beats Style: Why Beginning Students Fail to Code with LLMsLong3 citations
  291. SwissADT: An Audio Description Translation System for Swiss LanguagesIndustry3 citations
  292. Token-based Decision Criteria Are Suboptimal in In-context LearningLong3 citations
  293. Towards Zero-Shot Multimodal Machine TranslationFindings3 citations
  294. UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language ModelsLong3 citations
  295. Uncovering Latent Arguments in Social Media Messaging by Employing LLMs-in-the-Loop StrategyFindings3 citations
  296. Unifying AI Tutor Evaluation: An Evaluation Taxonomy for Pedagogical Ability Assessment of LLM-Powered AI TutorsLong3 citations
  297. VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented GenerationLong3 citations
  298. VividMed: Vision Language Model with Versatile Visual Grounding for MedicineLong3 citations
  299. What Is Missing in Multilingual Visual Reasoning and How to Fix ItFindings3 citations
  300. 2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional SupervisionFindings2 citations
  301. A Distributional Perspective on Word Learning in Neural Language ModelsLong2 citations
  302. A Recipe of Parallel Corpora Exploitation for Multilingual Large Language ModelsFindings2 citations
  303. AI-LieDar : Examine the Trade-off Between Utility and Truthfulness in LLM AgentsLong2 citations
  304. ALiiCE: Evaluating Positional Fine-grained Citation GenerationLong2 citations
  305. AfriHate: A Multilingual Collection of Hate Speech and Abusive Language Datasets for African LanguagesLong2 citations
  306. AgentMove: A Large Language Model based Agentic Framework for Zero-shot Next Location PredictionLong2 citations
  307. An empirical study of validating synthetic data for formula generationFindings2 citations
  308. Analyzing (In)Abilities of SAEs via Formal LanguagesLong2 citations
  309. Audio Description Generation in the Era of LLMs and VLMs: A Review of Transferable Generative AI TechnologiesFindings2 citations
  310. Avoiding Copyright Infringement via Large Language Model UnlearningFindings2 citations
  311. Babysit A Language Model From Scratch: Interactive Language Learning by Trials and DemonstrationsLong2 citations
  312. Beyond English: The Impact of Prompt Translation Strategies across Languages and Tasks in Multilingual LLMsFindings2 citations
  313. Beyond Words: Exploring Cultural Value Sensitivity in Multimodal ModelsFindings2 citations
  314. CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question AnsweringFindings2 citations
  315. Cascading Large Language Models for Salient Event Graph GenerationLong2 citations
  316. Claim-Guided Textual Backdoor Attack for Practical ApplicationsFindings2 citations
  317. CoME: An Unlearning-based Approach to Conflict-free Model EditingLong2 citations
  318. CogLM: Tracking Cognitive Development of Large Language ModelsLong2 citations
  319. Computational Discovery of Chiasmus in Ancient Religious TextShort2 citations
  320. Concise and Organized Perception Facilitates Reasoning in Large Language ModelsFindings2 citations
  321. Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language ModelSystem Demonstrations2 citations
  322. DIRAS: Efficient LLM Annotation of Document Relevance for Retrieval Augmented GenerationLong2 citations
  323. Decoding Hate: Exploring Language Models’ Reactions to Hate SpeechLong2 citations
  324. Diversify-verify-adapt: Efficient and Robust Retrieval-Augmented Ambiguous Question AnsweringLong2 citations
  325. Diversity Helps Jailbreak Large Language ModelsLong2 citations
  326. DomainSum: A Hierarchical Benchmark for Fine-Grained Domain Shift in Abstractive Text SummarizationFindings2 citations
  327. Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language ModelsFindings2 citations
  328. ESPnet-SpeechLM: An Open Speech Language Model ToolkitSystem Demonstrations2 citations
  329. Efficient Continual Pre-training of LLMs for Low-resource LanguagesIndustry2 citations
  330. Enhancing Multimodal Entity Linking with Jaccard Distance-based Conditional Contrastive Learning and Contextual Visual AugmentationLong2 citations
  331. Entity Decomposition with Filtering: A Zero-Shot Clinical Named Entity Recognition FrameworkLong2 citations
  332. Entropy-Based Decoding for Retrieval-Augmented Large Language ModelsLong2 citations
  333. Exploring the Potential of Large Language Models for Heterophilic GraphsLong2 citations
  334. FLEURS-ASL: Including American Sign Language in Massively Multilingual Multitask EvaluationLong2 citations
  335. Flaming-hot Initiation with Regular Execution Sampling for Large Language ModelsFindings2 citations
  336. From Intentions to Techniques: A Comprehensive Taxonomy and Challenges in Text Watermarking for Large Language ModelsFindings2 citations
  337. From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning TasksLong2 citations
  338. From Text to Emoji: How PEFT-Driven Personality Manipulation Unleashes the Emoji Potential in LLMsFindings2 citations
  339. GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence EmbeddingsFindings2 citations
  340. Human and LLM-Based Resume Matching: An Observational StudyFindings2 citations
  341. Hybrid Graphs for Table-and-Text based Question Answering using LLMsLong2 citations
  342. INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic LanguagesFindings2 citations
  343. Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-TuningFindings2 citations
  344. Improving Model Evaluation using SMART Filtering of Benchmark DatasetsLong2 citations
  345. Improving and Assessing the Fidelity of Large Language Models Alignment to Online CommunitiesLong2 citations
  346. Inference Scaling for Bridging Retrieval and Augmented GenerationFindings2 citations
  347. InspectorRAGet: An Introspection Platform for RAG EvaluationSystem Demonstrations2 citations
  348. Investigating the Transferability of Code Repair for Low-Resource Programming LanguagesFindings2 citations
  349. Is It Navajo? Accurate Language Detection for Endangered Athabaskan LanguagesShort2 citations
  350. Iterative Self-Tuning LLMs for Enhanced Jailbreaking CapabilitiesLong2 citations
  351. LLM2: Let Large Language Models Harness System 2 ReasoningShort2 citations
  352. LLMs are Biased Teachers: Evaluating LLM Bias in Personalized EducationFindings2 citations
  353. LLMs as Meta-Reviewers’ Assistants: A Case StudyLong2 citations
  354. LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language ModelsFindings2 citations
  355. Language Models Predict Empathy Gaps Between Social In-groups and Out-groupsLong2 citations
  356. Large Language Models are Easily Confused: A Quantitative Metric, Security Implications and Typological AnalysisFindings2 citations
  357. Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack DefenseLong2 citations
  358. Learning vs Retrieval: The Role of In-Context Examples in Regression with Large Language ModelsLong2 citations
  359. LiteWebAgent: The Open-Source Suite for VLM-Based Web-Agent ApplicationsSystem Demonstrations2 citations
  360. MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context InferenceLong2 citations
  361. MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse DomainsFindings2 citations
  362. Mamba-Shedder: Post-Transformer Compression for Efficient Selective Structured State Space ModelsLong2 citations
  363. ManaTTS Persian: a recipe for creating TTS datasets for lower resource languagesLong2 citations
  364. MatViX: Multimodal Information Extraction from Visually Rich ArticlesLong2 citations
  365. Measuring memorization in language models via probabilistic extractionLong2 citations
  366. MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K TokensFindings2 citations
  367. Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference OptimizationLong2 citations
  368. MoDification: Mixture of Depths Made EasyLong2 citations
  369. MojoBench: Language Modeling and Benchmarks for MojoFindings2 citations
  370. NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language ModelsFindings2 citations
  371. Neuro-symbolic Training for Reasoning over Spatial LanguageFindings2 citations
  372. Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object IdentificationFindings2 citations
  373. On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic PhenomenaLong2 citations
  374. OpenReviewer: A Specialized Large Language Model for Generating Critical Scientific Paper ReviewsSystem Demonstrations2 citations
  375. PORT: Preference Optimization on Reasoning TracesLong2 citations
  376. Pretrained Image-Text Models are Secretly Video CaptionersShort2 citations
  377. Probe-Free Low-Rank Activation InterventionLong2 citations
  378. RATSD: Retrieval Augmented Truthfulness Stance Detection from Social Media Posts Toward Factual ClaimsFindings2 citations
  379. RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition ProcessFindings2 citations
  380. Rejected Dialects: Biases Against African American Language in Reward ModelsFindings2 citations
  381. Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can’t Answer?Short2 citations
  382. SLM-Mod: Small Language Models Surpass LLMs at Content ModerationLong2 citations
  383. STRUX: An LLM for Decision-Making with Structured ExplanationsShort2 citations
  384. SimRAG: Self-Improving Retrieval-Augmented Generation for Adapting Large Language Models to Specialized DomainsLong2 citations
  385. Stealthy Jailbreak Attacks on Large Language Models via Benign Data MirroringLong2 citations
  386. Stephanie: Step-by-Step Dialogues for Mimicking Human Interactions in Social ConversationsFindings2 citations
  387. StyleDistance: Stronger Content-Independent Style Embeddings with Synthetic Parallel ExamplesLong2 citations
  388. Supportiveness-based Knowledge Rewriting for Retrieval-augmented Language ModelingFindings2 citations
  389. Swan and ArabicMTEB: Dialect-Aware, Arabic-Centric, Cross-Lingual, and Cross-Cultural Embedding Models and BenchmarksFindings2 citations
  390. SylloBio-NLI: Evaluating Large Language Models on Biomedical Syllogistic ReasoningLong2 citations
  391. Synthetic Audio Helps for Cognitive State TasksFindings2 citations
  392. Syntriever: How to Train Your Retriever with Synthetic Data from LLMsFindings2 citations
  393. Systematic Knowledge Injection into Large Language Models via Diverse Augmentation for Domain-Specific RAGFindings2 citations
  394. TART: An Open-Source Tool-Augmented Framework for Explainable Table-based ReasoningFindings2 citations
  395. TRUSTEVAL: A Dynamic Evaluation Toolkit on Trustworthiness of Generative Foundation ModelsSystem Demonstrations2 citations
  396. Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal UnderstandingFindings2 citations
  397. Thank You, Stingray: Multilingual Large Language Models Can Not (Yet) Disambiguate Cross-Lingual Word SensesFindings2 citations
  398. The Power of Many: Multi-Agent Multimodal Models for Cultural Image CaptioningLong2 citations
  399. The Stochastic Parrot on LLM’s Shoulder: A Summative Assessment of Physical Concept UnderstandingLong2 citations
  400. Towards Federated Low-Rank Adaptation of Language Models with Rank HeterogeneityShort2 citations
  401. Towards Long Context Hallucination DetectionFindings2 citations
  402. Towards Robust Knowledge Representations in Multilingual LLMs for Equivalence and Inheritance based Consistent ReasoningLong2 citations
  403. TrendSim: Simulating Trending Topics in Social Media Under Poisoning Attacks with LLM-based Multi-agent SystemFindings2 citations
  404. UNLEARN Efficient Removal of Knowledge in Large Language ModelsFindings2 citations
  405. Understanding LLMs’ Fluid Intelligence Deficiency: An Analysis of the ARC TaskLong2 citations
  406. Unmasking Database Vulnerabilities: Zero-Knowledge Schema Inference Attacks in Text-to-SQL SystemsFindings2 citations
  407. Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation ClassifiersShort2 citations
  408. What Goes Into a LM Acceptability Judgment? Rethinking the Impact of Frequency and LengthLong2 citations
  409. What can Large Language Models Capture about Code Functional Equivalence?Findings2 citations
  410. World Models with Hints of Large Language Models for Goal AchievingLong2 citations
  411. XAMPLER: Learning to Retrieve Cross-Lingual In-Context ExamplesFindings2 citations
  412. Yeah, Un, Oh: Continuous and Real-time Backchannel Prediction with Fine-tuning of Voice Activity ProjectionLong2 citations
  413. A Practical Examination of AI-Generated Text Detectors for Large Language ModelsFindings1 citations
  414. A Survey to Recent Progress Towards Understanding In-Context LearningFindings1 citations
  415. A Zero-Shot Open-Vocabulary Pipeline for Dialogue UnderstandingLong1 citations
  416. ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Parity LLM Data ValuationLong1 citations
  417. ASRank: Zero-Shot Re-Ranking with Answer Scent for Document RetrievalFindings1 citations
  418. Accounting for Sycophancy in Language Model Uncertainty EstimationFindings1 citations
  419. AdParaphrase: Paraphrase Dataset for Analyzing Linguistic Features toward Generating Attractive Ad TextsFindings1 citations
  420. AdTEC: A Unified Benchmark for Evaluating Text Quality in Search Engine AdvertisingLong1 citations
  421. Adaptive Prompting: Ad-hoc Prompt Composition for Social Bias DetectionLong1 citations
  422. AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective IntelligenceLong1 citations
  423. Aligning to What? Limits to RLHF Based AlignmentFindings1 citations
  424. Alligators All Around: Mitigating Lexical Confusion in Low-resource Machine TranslationShort1 citations
  425. An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuningFindings1 citations
  426. An Interpretable and Crosslingual Method for Evaluating Second-Language DialoguesLong1 citations
  427. Arabic Dataset for LLM Safeguard EvaluationLong1 citations
  428. Assessing the State of the Art in Scene SegmentationLong1 citations
  429. Automatic Evaluation of Healthcare LLMs Beyond Question-AnsweringShort1 citations
  430. B4: A Black-Box Scrubbing Attack on LLM WatermarksLong1 citations
  431. Benchmarking Failures in Tool-Augmented Language ModelsLong1 citations
  432. Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMsLong1 citations
  433. Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and EvaluationLong1 citations
  434. CORD: Balancing COnsistency and Rank Distillation for Robust Retrieval-Augmented GenerationShort1 citations
  435. COVE: COntext and VEracity prediction for out-of-context imagesLong1 citations
  436. CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific ConceptsLong1 citations
  437. CSEval: Towards Automated, Multi-Dimensional, and Reference-Free Counterspeech Evaluation using Auto-Calibrated LLMsLong1 citations
  438. Can GPT-4 Sway Experts’ Investment Decisions?Findings1 citations
  439. CharacterGPT: A Persona Reconstruction Framework for Role-Playing AgentsIndustry1 citations
  440. Characterizing the Role of Similarity in the Property Inferences of Language ModelsLong1 citations
  441. CoPERLex: Content Planning with Event-based Representations for Legal Case SummarizationFindings1 citations
  442. CodeRAG-Bench: Can Retrieval Augment Code Generation?Findings1 citations
  443. CodeSCM: Causal Analysis for Multi-Modal Code GenerationLong1 citations
  444. Cognitive Kernel: An Open-source Agent System towards Generalist AutopilotsSystem Demonstrations1 citations
  445. Communication Makes Perfect: Persuasion Dataset Construction via Multi-LLM CommunicationLong1 citations
  446. Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake DetectionFindings1 citations
  447. Continuous Speech Tokenizer in Text To SpeechFindings1 citations
  448. Cross-Lingual Transfer Learning for Speech TranslationShort1 citations
  449. Cross-Lingual and Cross-Cultural Variation in Image DescriptionsLong1 citations
  450. CuriousLLM: Elevating Multi-Document Question Answering with LLM-Enhanced Knowledge Graph ReasoningIndustry1 citations
  451. DART: An AIGT Detector using AMR of Rephrased TextShort1 citations
  452. DCE-LLM: Dead Code Elimination with Large Language ModelsLong1 citations
  453. Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation ModelsFindings1 citations
  454. DiPT: Enhancing LLM Reasoning through Diversified Perspective-TakingFindings1 citations
  455. Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document SummarizationLong1 citations
  456. Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design AutomationLong1 citations
  457. Do Not Design, Learn: A Trainable Scoring Function for Uncertainty Estimation in Generative LLMsFindings1 citations
  458. Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question CoverageLong1 citations
  459. ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information CoverageLong1 citations
  460. Efficient Annotator Reliability Assessment and Sample Weighting for Knowledge-Based Misinformation Detection on Social MediaFindings1 citations
  461. Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-TuningFindings1 citations
  462. EqualizeIR: Mitigating Linguistic Biases in Retrieval ModelsShort1 citations
  463. Evaluating Small Language Models for News Summarization: Implications and Factors Influencing PerformanceLong1 citations
  464. Evaluating Vision-Language Models for Emotion RecognitionFindings1 citations
  465. Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?Findings1 citations
  466. EventFull: Complete and Consistent Event Relation AnnotationSystem Demonstrations1 citations
  467. Examining and Adapting Time for Multilingual Classification via Mixture of Temporal ExpertsLong1 citations
  468. Explore the Reasoning Capability of LLMs in the Chess TestbedShort1 citations
  469. Exploring Large Language Models for Hate Speech Detection in Rioplatense SpanishFindings1 citations
  470. FactCG: Enhancing Fact Checkers with Graph-Based Multi-Hop DataLong1 citations
  471. Faster Machine Translation Ensembling with Reinforcement Learning and Competitive CorrectionFindings1 citations
  472. FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference BenchmarkingFindings1 citations
  473. Fine-Tuned LLMs are “Time Capsules” for Tracking Societal Bias Through BooksLong1 citations
  474. Fingerspelling within Sign Language TranslationLong1 citations
  475. GLiREL - Generalist Model for Zero-Shot Relation ExtractionLong1 citations
  476. Generating Long-form Story Using Dynamic Hierarchical Outlining with Memory-EnhancementLong1 citations
  477. GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language ModelsFindings1 citations
  478. GloCOM: A Short Text Neural Topic Model via Global Clustering ContextLong1 citations
  479. GraPPI: A Retrieve-Divide-Solve GraphRAG Framework for Large-scale Protein-protein Interaction ExplorationFindings1 citations
  480. Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination MitigationFindings1 citations
  481. Grammar Control in Dialogue Response Generation for Language Learning ChatbotsLong1 citations
  482. Great Memory, Shallow Reasoning: Limits of kNN-LMsShort1 citations
  483. HALLUCANA: Fixing LLM Hallucination with A Canary LookaheadFindings1 citations
  484. HARP: Hesitation-Aware Reframing in Transformer Inference PassLong1 citations
  485. HMT: Hierarchical Memory Transformer for Efficient Long Context Language ProcessingLong1 citations
  486. Has this Fact been Edited? Detecting Knowledge Edits in Language ModelsLong1 citations
  487. Have LLMs Reopened the Pandora’s Box of AI-Generated Fake News?Long1 citations
  488. Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve AnomaliesLong1 citations
  489. Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-TrainingLong1 citations
  490. How Can We Diagnose and Treat Bias in Large Language Models for Clinical Decision-Making?Long1 citations
  491. How Do Large Language Models Perform in Dynamical System ModelingFindings1 citations
  492. How Inclusively do LMs Perceive Social and Moral Norms?Findings1 citations
  493. How Much Knowledge Can You Pack into a LoRA Adapter without Harming LLM?Findings1 citations
  494. How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal RepresentationsShort1 citations
  495. How to Make the Most of LLMs’ Grammatical Knowledge for Acceptability JudgmentsLong1 citations
  496. IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information RetrievalLong1 citations
  497. IHEval: Evaluating Language Models on Following the Instruction HierarchyLong1 citations
  498. Identifying and Mitigating Social Bias Knowledge in Language ModelsFindings1 citations
  499. Improved Near-Duplicate Detection for Aggregated and Paywalled News-FeedsIndustry1 citations
  500. Improving Retrospective Language Agents via Joint Policy Gradient OptimizationLong1 citations
  501. Information-Guided Identification of Training Data Imprint in (Proprietary) Large Language ModelsLong1 citations
  502. Is a Peeled Apple Still Red? Evaluating LLMs’ Ability for Conceptual Combination with Property TypeLong1 citations
  503. Jailbreaking with Universal Multi-PromptsFindings1 citations
  504. KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue CorpusFindings1 citations
  505. LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of TransformersFindings1 citations
  506. LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model CompressionFindings1 citations
  507. Language Model Council: Democratically Benchmarking Foundation Models on Highly Subjective TasksLong1 citations
  508. Large Language Models Are Better Logical Fallacy Reasoners with Counterargument, Explanation, and Goal-Aware Prompt FormulationFindings1 citations
  509. LawInstruct: A Resource for Studying Language Model Adaptation to the Legal DomainFindings1 citations
  510. LayAlign: Enhancing Multilingual Reasoning in Large Language Models via Layer-Wise Adaptive Fusion and Alignment StrategyFindings1 citations
  511. LeCoPCR: Legal Concept-guided Prior Case Retrieval for European Court of Human Rights casesFindings1 citations
  512. Learning to Search Effective Example Sequences for In-Context LearningFindings1 citations
  513. LibEvolutionEval: A Benchmark and Study for Version-Specific Code GenerationLong1 citations
  514. Lost in Inference: Rediscovering the Role of Natural Language Inference for Large Language ModelsLong1 citations
  515. MAD Speech: Measures of Acoustic Diversity of SpeechLong1 citations
  516. MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue GenerationLong1 citations
  517. MALoRA: Mixture of Asymmetric Low-Rank Adaptation for Enhanced Multi-Task LearningFindings1 citations
  518. MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent CollaborationLong1 citations
  519. MAPWise: Evaluating Vision-Language Models for Advanced Map QueriesLong1 citations
  520. MIDAS: Multi-level Intent, Domain, And Slot Knowledge Distillation for Multi-turn NLUFindings1 citations
  521. MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation EvaluationFindings1 citations
  522. MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational AgentsFindings1 citations
  523. MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool CallingLong1 citations
  524. Medical Spoken Named Entity RecognitionIndustry1 citations
  525. MetaAlign: Align Large Language Models with Diverse Preferences during Inference TimeFindings1 citations
  526. MiCEval: Unveiling Multimodal Chain of Thought’s Quality via Image Description and Reasoning StepsLong1 citations
  527. Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware PromptingFindings1 citations
  528. MoDE: Effective Multi-task Parameter Efficient Fine-Tuning with a Mixture of Dyadic ExpertsFindings1 citations
  529. Multi-Conditional Ranking with Large Language ModelsLong1 citations
  530. Multi-Stage LLM Fine-Tuning with a Continual Learning SettingFindings1 citations
  531. Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic ReasoningLong1 citations
  532. On Reference (In-)Determinacy in Natural Language InferenceFindings1 citations
  533. On the Impact of Noise in Differentially Private Text RewritingFindings1 citations
  534. On the Impacts of Contexts on Repository-Level Code GenerationFindings1 citations
  535. Open-World Evaluation for Retrieving Diverse PerspectivesLong1 citations
  536. PICLe: Pseudo-annotations for In-Context Learning in Low-Resource Named Entity DetectionLong1 citations
  537. PLD+: Accelerating LLM Inference by Leveraging Language Model ArtifactsFindings1 citations
  538. Padding Tone: A Mechanistic Analysis of Padding Tokens in T2I ModelsLong1 citations
  539. People will agree what I think: Investigating LLM’s False Consensus EffectFindings1 citations
  540. Perception Compressor: A Training-Free Prompt Compression Framework in Long Context ScenariosFindings1 citations
  541. PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language ModelsLong1 citations
  542. Predicting the Target Word of Game-playing Conversations using a Low-Rank Dialect Adapter for Decoder ModelsShort1 citations
  543. Preserving Multilingual Quality While Tuning Query Encoder on English OnlyShort1 citations
  544. PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation MetricsLong1 citations
  545. QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language ModelsFindings1 citations
  546. RELexED: Retrieval-Enhanced Legal Summarization with Exemplar DiversityFindings1 citations
  547. Re-evaluating Automatic LLM System Ranking for Alignment with Human PreferenceFindings1 citations
  548. Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model AlignmentLong1 citations
  549. Reinforcement Learning for Aligning Large Language Models Agents with Interactive Environments: Quantifying and Mitigating Prompt OverfittingFindings1 citations
  550. Reliability of Topic ModelingLong1 citations
  551. Representing Rule-based Chatbots with TransformersLong1 citations
  552. Retrieval, Reasoning, Re-ranking: A Context-Enriched Framework for Knowledge Graph CompletionLong1 citations
  553. RusCode: Russian Cultural Code Benchmark for Text-to-Image GenerationFindings1 citations
  554. S2-MAD: Breaking the Token Barrier to Enhance Multi-Agent Debate EfficiencyLong1 citations
  555. SAFR: Neuron Redistribution for InterpretabilityFindings1 citations
  556. SHADES: Towards a Multilingual Assessment of Stereotypes in Large Language ModelsLong1 citations
  557. SIMPLOT: Enhancing Chart Question Answering by Distilling EssentialsFindings1 citations
  558. SPeCtrum: A Grounded Framework for Multidimensional Identity Representation in LLM-Based AgentLong1 citations
  559. STAR: Spectral Truncation and Rescale for Model MergingShort1 citations
  560. Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language ModelsFindings1 citations
  561. SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast AsiaFindings1 citations
  562. Self-Training Meets Consistency: Improving LLMs’ Reasoning with Consistency-Driven Rationale EvaluationLong1 citations
  563. Semantic Consistency-Based Uncertainty Quantification for Factuality in Radiology Report GenerationFindings1 citations
  564. Semi-supervised Fine-tuning for Large Language ModelsFindings1 citations
  565. Sneaking Syntax into Transformer Language Models with Tree RegularizationLong1 citations
  566. Social Norms in Cinema: A Cross-Cultural Analysis of Shame, Pride and PrejudiceLong1 citations
  567. Sociodemographic Prompting is Not Yet an Effective Approach for Simulating Subjective Judgments with LLMsShort1 citations
  568. Soft Syntactic Reinforcement for Neural Event ExtractionLong1 citations
  569. Stronger Models are Not Always Stronger Teachers for Instruction TuningLong1 citations
  570. SusGen-GPT: A Data-Centric LLM for Financial NLP and Sustainability Report GenerationFindings1 citations
  571. SymBa: Symbolic Backward Chaining for Structured Natural Language ReasoningLong1 citations
  572. TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning DataFindings1 citations
  573. THREAD: Thinking Deeper with Recursive SpawningLong1 citations
  574. Teaching Large Language Models Number-Focused Headline Generation With Key Element RationalesFindings1 citations
  575. The Geometry of Numerical Reasoning: Language Models Compare Numeric Properties in Linear SubspacesShort1 citations
  576. The Geometry of Prompting: Unveiling Distinct Mechanisms of Task Adaptation in Language ModelsFindings1 citations
  577. The Impact of Visual Information in Chinese Characters: Evaluating Large Models’ Ability to Recognize and Utilize RadicalsLong1 citations
  578. Threshold Filtering Packing for Supervised Fine-Tuning: Training Related Samples within PacksLong1 citations
  579. ToW: Thoughts of Words Improve Reasoning in Large Language ModelsLong1 citations
  580. Token Weighting for Long-Range Language ModelingFindings1 citations
  581. Towards Automatic Evaluation for Image TranscreationLong1 citations
  582. Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation ModelsLong1 citations
  583. Towards Rationality in Language and Multimodal Agents: A SurveyLong1 citations
  584. Tuning-Free Personalized Alignment via Trial-Error-Explain In-Context LearningFindings1 citations
  585. TurtleBench: A Visual Programming Benchmark in Turtle GeometryLong1 citations
  586. Typographic Attacks in a Multi-Image SettingLong1 citations
  587. Uncertainty Quantification for Clinical Outcome Predictions with (Large) Language ModelsFindings1 citations
  588. Understanding Figurative Meaning through Explainable Visual EntailmentLong1 citations
  589. Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM LeaderboardIndustry1 citations
  590. Unfolding the Headline: Iterative Self-Questioning for News Retrieval and Timeline SummarizationFindings1 citations
  591. UniHGKR: Unified Instruction-aware Heterogeneous Knowledge RetrieversLong1 citations
  592. Unified Automated Essay Scoring and Grammatical Error CorrectionFindings1 citations
  593. Untangling Hate Speech Definitions: A Semantic Componential Analysis Across Cultures and DomainsFindings1 citations
  594. Uplifting Lower-Income Data: Strategies for Socioeconomic Perspective Shifts in Large Multi-modal ModelsLong1 citations
  595. VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMsFindings1 citations
  596. Visual Zero-Shot E-Commerce Product Attribute Value ExtractionIndustry1 citations
  597. VisualCoder: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought ReasoningFindings1 citations
  598. WHoW: A Cross-domain Approach for Analysing Conversation ModerationLong1 citations
  599. WaterSeeker: Pioneering Efficient Detection of Watermarked Segments in Large DocumentsFindings1 citations
  600. Wav2Prompt: End-to-End Speech Prompt Learning and Task-based Fine-tuning for Text-based LLMsLong1 citations
  601. Weight-based Analysis of Detokenization in Language Models: Understanding the First Stage of Inference Without InferenceFindings1 citations
  602. What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and EvaluationLong1 citations
  603. What We Talk About When We Talk About LMs: Implicit Paradigm Shifts and the Ship of Language ModelsLong1 citations
  604. Who Relies More on World Knowledge and Bias for Syntactic Ambiguity Resolution: Humans or LLMs?Long1 citations
  605. Zero-Shot Strategies for Length-Controllable SummarizationFindings1 citations
  606. eRevise+RF: A Writing Evaluation System for Assessing Student Essay Revisions and Providing Formative FeedbackSystem Demonstrations1 citations
  607. A Bayesian Optimization Approach to Machine Translation RerankingLong
  608. A Comprehensive Survey of Contemporary Arabic Sentiment Analysis: Methods, Challenges, and Future DirectionsFindings
  609. A Context-Aware Contrastive Learning Framework for Hateful Meme Detection and SegmentationFindings
  610. A Data-Driven Method for Analyzing and Quantifying Lyrics-Dance Motion RelationshipsLong
  611. A Diverse and Effective Retrieval-Based Debt Collection System with Expert KnowledgeIndustry
  612. A Fair Comparison without Translationese: English vs. Target-language Instructions for Multilingual LLMsShort
  613. A Federated Framework for LLM-based RecommendationFindings
  614. A Grounded Typology of Word ClassesLong
  615. A Guide To Effectively Leveraging LLMs for Low-Resource Text Summarization: Data Augmentation and Semi-supervised ApproachesFindings
  616. A Large-Scale Benchmark for Vietnamese Sentence ParaphrasesFindings
  617. A Layered Debating Multi-Agent System for Similar Disease DiagnosisShort
  618. A Learning-based Multi-Frame Visual Feature Framework for Real-Time Driver Fatigue DetectionSystem Demonstrations
  619. A Mixed-Language Multi-Document News Summarization Dataset and a Graphs-Based Extract-Generate ModelLong
  620. A Multi-modal Large Language Model with Graph-of-Thought for Effective RecommendationLong
  621. A Practical Analysis of Human Alignment with *POFindings
  622. A Practical Method for Generating String CounterfactualsFindings
  623. A Sentence-Level Visualization of Attention in Large Language ModelsSystem Demonstrations
  624. A Survey of NLP Progress in Sino-Tibetan Low-Resource LanguagesLong
  625. A Survey of QUD Models for Discourse ProcessingLong
  626. A Systematic Examination of Preference Learning through the Lens of Instruction-FollowingLong
  627. A Top-down Graph-based Tool for Modeling Classical Semantic Maps: A Case Study of Supplementary AdverbsLong
  628. A Unified Supervised and Unsupervised Dialogue Topic Segmentation Framework Based on Utterance Pair ModelingLong
  629. ACCORD: Closing the Commonsense Measurability GapLong
  630. AID: Adaptive Integration of Detectors for Safe AI with Language ModelsLong
  631. ALERT: An LLM-powered Benchmark for Automatic Evaluation of Recommendation ExplanationsLong
  632. ALOHA: Empowering Multilingual Agent for University Orientation with Hierarchical RetrievalSystem Demonstrations
  633. AMPS: ASR with Multimodal Paraphrase SupervisionShort
  634. ARISE: Iterative Rule Induction and Synthetic Data Generation for Text ClassificationFindings
  635. ATAIGI: An AI-Powered Multimodal Learning App Leveraging Generative Models for Low-Resource Taiwanese HokkienSystem Demonstrations
  636. AcrosticSleuth: Probabilistic Identification and Ranking of Acrostics in Multilingual CorporaFindings
  637. Active Few-Shot Learning for Text ClassificationLong
  638. Adapting LLM Agents with Universal Communication FeedbackFindings
  639. Adapting Sentence-level Automatic Metrics for Document-level Simplification EvaluationLong
  640. Advancing Persian LLM EvaluationFindings
  641. Afrispeech-Dialog: A Benchmark Dataset for Spontaneous English Conversations in Healthcare and BeyondLong
  642. Aggregation Artifacts in Subjective Tasks Collapse Large Language Models’ PosteriorsLong
  643. AlgoPuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Algorithmic Multimodal PuzzlesLong
  644. AlignFreeze: Navigating the Impact of Realignment on the Layers of Multilingual Models Across Diverse LanguagesShort
  645. Aligning Black-box Language Models with Human JudgmentsFindings
  646. Aligning Sentence Simplification with ESL Learner’s Proficiency for Language AcquisitionLong
  647. Aligning to Constraints for Data-Efficient Language Model CustomizationFindings
  648. Amphista: Bi-directional Multi-head Decoding for Accelerating LLM InferenceLong
  649. An Annotated Dataset of Errors in Premodern Greek and Baselines for Detecting ThemFindings
  650. An Efficient Context-Dependent Memory Framework for LLM-Centric AgentsIndustry
  651. An Efficient Gloss-Free Sign Language Translation Using Spatial Configurations and Motion Dynamics with LLMsLong
  652. An LLM-Based Approach for Insight Generation in Data AnalysisLong
  653. An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as OptimizerFindings
  654. AnaScore: Understanding Semantic Parallelism in Proportional AnalogiesLong
  655. Analysis of LLM as a grammatical feature tagger for African American EnglishFindings
  656. Analyzing Memorization in Large Language Models through the Lens of Model AttributionLong
  657. Analyzing and Improving Coherence of Large Language Models in Question AnsweringLong
  658. Analyzing the Inner Workings of Transformers in Compositional GeneralizationLong
  659. Anticipating Future with Large Language Model for Simultaneous Machine TranslationLong
  660. Are Language Models Agnostic to Linguistically Grounded Perturbations? A Case Study of Indic LanguagesFindings
  661. Are Multimodal LLMs Robust Against Adversarial Perturbations? RoMMath: A Systematic Evaluation on Multimodal Math ReasoningLong
  662. Are explicit belief representations necessary? A comparison between Large Language Models and Bayesian probabilistic modelsLong
  663. As easy as PIE: understanding when pruning causes language models to disagreeFindings
  664. Atoxia: Red-teaming Large Language Models with Target Toxic AnswersFindings
  665. Attention on Multiword Expressions: A Multilingual Study of BERT-based Models with Regard to Idiomaticity and MicrosyntaxFindings
  666. Augmented Adversarial Trigger LearningFindings
  667. Auto-Cypher: Improving LLMs on Cypher generation via LLM-supervised generation-verification frameworkShort
  668. AutoClean: LLMs Can Prepare Their Training CorpusSystem Demonstrations
  669. AutoEval-ToD: Automated Evaluation of Task-oriented Dialog SystemsLong
  670. AutoKB: Automated Creation of Structured Knowledge Bases for Domain-Specific SupportIndustry
  671. AutoParLLM: GNN-guided Context Generation for Zero-Shot Code Parallelization using LLMsLong
  672. Automatic Annotation Augmentation Boosts Translation between Molecules and Natural LanguageFindings
  673. Automatic Input Rewriting Improves Translation with Large Language ModelsLong
  674. Automatically Discovering How Misogyny is Framed on Social MediaLong
  675. BEMEAE: Moving Beyond Exact Span Match for Event Argument ExtractionLong
  676. BRIEF: Bridging Retrieval and Inference for Multi-hop Reasoning via CompressionFindings
  677. Balancing Forget Quality and Model Utility: A Reverse KL-Divergence Knowledge Distillation Approach for Better Unlearning in LLMsLong
  678. BanNERD: A Benchmark Dataset and Context-Driven Approach for Bangla Named Entity RecognitionFindings
  679. BanTH: A Multi-label Hate Speech Detection Dataset for Transliterated BanglaFindings
  680. Bayelemabaga: Creating Resources for Bambara NLPLong
  681. Behavior-SD: Behaviorally Aware Spoken Dialogue Generation with Large Language ModelsLong
  682. Benchmarking and Building Zero-Shot Hindi Retrieval Model with Hindi-BEIR and NLLB-E5Long
  683. Beyond Benchmarks: Building a Richer Cross-Document Event Coreference Dataset with DecontextualizationLong
  684. Beyond End-to-End VLMs: Leveraging Intermediate Text Representations for Superior Flowchart UnderstandingLong
  685. Beyond Excess and Deficiency: Adaptive Length Bias Mitigation in Reward Models for RLHFFindings
  686. Beyond Literal Token Overlap: Token Alignability for MultilingualityShort
  687. Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language ModelsFindings
  688. Beyond the Mode: Sequence-Level Distillation of Multilingual Translation Models for Low-Resource Language PairsFindings
  689. Beyond the Safety Bundle: Auditing the Helpful and Harmless DatasetLong
  690. Biases in Opinion Dynamics in Multi-Agent Systems of Large Language Models: A Case Study on Funding AllocationFindings
  691. BitAbuse: A Dataset of Visually Perturbed Texts for Defending Phishing AttacksFindings
  692. Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language ModelsShort
  693. BnTTS: Few-Shot Speaker Adaptation in Low-Resource SettingFindings
  694. Bottom-Up Synthesis of Knowledge-Grounded Task-Oriented Dialogues with Iteratively Self-Refined PromptsShort
  695. Break-Ideate-Generate (BrIdGe): Moving beyond Translations for Localization using LLMsIndustry
  696. Breaking Boundaries: Investigating the Effects of Model Editing on Cross-linguistic PerformanceIndustry
  697. Breaking Down Power Barriers in On-Device Streaming ASR: Insights and SolutionsIndustry
  698. Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted CaptionsLong
  699. CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech TranslationFindings
  700. CAMIEval: Enhancing NLG Evaluation through Multidimensional Comparative Instruction-Following AnalysisLong
  701. CAPE: A Chinese Dataset for Appraisal-based Emotional Generation in Large Language ModelsFindings
  702. CAST: Corpus-Aware Self-similarity Enhanced Topic modellingLong
  703. CDB: A Unified Framework for Hope Speech Detection Through Counterfactual, Desire and BeliefFindings
  704. CLEAR-Command: Coordinated Listening, Extraction, and Allocation for Emergency Response with Large Language ModelsSystem Demonstrations
  705. COAST: Enhancing the Code Debugging Ability of LLMs through Communicative Agent Based Data SynthesisFindings
  706. CONSTRUCTA: Automating Commercial Construction Schedules in Fabrication Facilities with Large Language ModelsIndustry
  707. CORG: Generating Answers from Complex, Interrelated ContextsLong
  708. CORRECT: Context- and Reference-Augmented Reasoning and Prompting for Fact-CheckingLong
  709. CPRM: A LLM-based Continual Pre-training Framework for Relevance Modeling in Commercial SearchIndustry
  710. CRScore: Grounding Automated Evaluation of Code Review Comments in Code Claims and SmellsLong
  711. CSR-Bench: Benchmarking LLM Agents in Deployment of Computer Science Research RepositoriesLong
  712. CVE-Bench: Benchmarking LLM-based Software Engineering Agent’s Ability to Repair Real-World CVE VulnerabilitiesLong
  713. Can I Introduce My Boyfriend to My Grandmother? Evaluating Large Language Models Capabilities on Iranian Social Norm ClassificationFindings
  714. Can Large Language Models Invent Algorithms to Improve Themselves?Long
  715. Can Post-Training Quantization Benefit from an Additional QLoRA Integration?Industry
  716. Capturing Human Cognitive Styles with Language: Towards an Experimental Evaluation ParadigmShort
  717. CaseSumm: A Large-Scale Dataset for Long-Context Summarization from U.S. Supreme Court OpinionsFindings
  718. CausalEval: Towards Better Causal Reasoning in Language ModelsLong
  719. CausalGraph2LLM: Evaluating LLMs for Causal QueriesFindings
  720. Causally Modeling the Linguistic and Social Factors that Predict Email ResponseLong
  721. Cerebrum (AIOS SDK): A Platform for Agent Development, Deployment, Distribution, and DiscoverySystem Demonstrations
  722. ChaI-TeA: A Benchmark for Evaluating Autocompletion of Interactions with LLM-based ChatbotsShort
  723. Chain-of-Rank: Enhancing Large Language Models for Domain-Specific RAG in Edge DeviceFindings
  724. Challenges and Remedies of Domain-Specific Classifiers as LLM Guardrails: Self-Harm as a Case StudyIndustry
  725. Characterizing the Effects of Translation on Intertextuality using Multilingual Embedding SpacesShort
  726. Chatbot Arena Estimate: towards a generalized performance benchmark for LLM capabilitiesIndustry
  727. Chinese Morph Resolution in E-commerce Live Streaming ScenariosIndustry
  728. Classic4Children: Adapting Chinese Literary Classics for Children with Large Language ModelFindings
  729. CluSanT: Differentially Private and Semantically Coherent Text SanitizationLong
  730. CoRAC: Integrating Selective API Document Retrieval with Question Semantic Intent for Code Question AnsweringLong
  731. CoRAG: Collaborative Retrieval-Augmented GenerationShort
  732. CodeGenWrangler: Data Wrangling task automation using Code-Generating ModelsIndustry
  733. Commonality and Individuality! Integrating Humor Commonality with Speaker Individuality for Humor RecognitionLong
  734. CompAct: Compressed Activations for Memory-Efficient LLM TrainingLong
  735. Complete Chess Games Enable LLM Become A Chess MasterShort
  736. ConMeC: A Dataset for Metonymy Resolution with Common NounsLong
  737. ConQRet: A New Benchmark for Fine-Grained Automatic Evaluation of Retrieval Augmented Computational ArgumentationLong
  738. ConShift: Sense-based Language Variation Analysis using Flexible AlignmentFindings
  739. Concept Distillation from Strong to Weak Models via Hypotheses-to-Theories PromptingIndustry
  740. Conflict and Overlap Classification in Construction Standards Using a Large Language ModelIndustry
  741. Considering Length Diversity in Retrieval-Augmented SummarizationFindings
  742. Constrained Decoding with Speculative LookaheadsLong
  743. Constraining Sequential Model Editing with Editing Anchor CompressionFindings
  744. Context-Efficient Retrieval with Factual DecompositionShort
  745. Contextual Metric Meta-Evaluation by Measuring Local Metric AccuracyFindings
  746. Continual Learning in Multilingual Sign Language TranslationLong
  747. Coverage-based Fairness in Multi-document SummarizationLong
  748. CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web NavigationSystem Demonstrations
  749. CultureInstruct: Curating Multi-Cultural Instructions at ScaleLong
  750. DDGIP: Radiology Report Generation Through Disease Description Graph and Informed PromptingFindings
  751. DETQUS: Decomposition-Enhanced Transformers for QUery-focused SummarizationLong
  752. DOLFIN - Document-Level Financial Test-Set for Machine TranslationFindings
  753. DPL: Diverse Preference Learning Without A Reference ModelLong
  754. DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language ModelsLong
  755. DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation ModelsLong
  756. DSQG-Syn: Synthesizing High-quality Data for Text-to-SQL Parsing by Domain Specific Question GenerationFindings
  757. DSRAG: A Double-Stream Retrieval-Augmented Generation Framework for Countless Intent DetectionIndustry
  758. Data-Efficiently Learn Large Language Model for Universal 3D Scene PerceptionFindings
  759. DeCAP: Context-Adaptive Prompt Generation for Debiasing Zero-shot Question Answering in Large Language ModelsLong
  760. Debate-Feedback: A Multi-Agent Framework for Efficient Legal Judgment PredictionShort
  761. Decoding Fatphobia: Examining Anti-Fat and Pro-Thin Bias in AI-Generated ImagesFindings
  762. Decomposition Dilemmas: Does Claim Decomposition Boost or Burden Fact-Checking Performance?Long
  763. Defense against Prompt Injection Attacks via Mixture of EncodingsShort
  764. Demystifying the Power of Large Language Models in Graph GenerationFindings
  765. DenseSSM: State Space Models with Dense Hidden Connection for Efficient Large Language ModelsLong
  766. Detect, Disambiguate, and Translate: On-Demand Visual Reasoning for Multimodal Machine Translation with Large Vision-Language ModelsLong
  767. Developing a Reliable, Fast, General-Purpose Hallucination Detection and Mitigation ServiceIndustry
  768. Developing multilingual speech synthesis system for Ojibwe, Mi’kmaq, and MaliseetShort
  769. DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And IntelligibilityFindings
  770. Dialetto, ma Quanto Dialetto? Transcribing and Evaluating Dialects on a ContinuumFindings
  771. Dialogue Language Model with Large-Scale Persona Data EngineeringIndustry
  772. Differentially Private Learning Needs Better Model Initialization and Self-DistillationLong
  773. Dis2Dis: Explaining Ambiguity in Fact-CheckingFindings
  774. DisComp: A Two-Stage Prompt Optimization Framework Combining Task-Agnostic and Task-Aware CompressionFindings
  775. DiscoGraMS: Enhancing Movie Screen-Play Summarization using Movie Character-Aware Discourse GraphShort
  776. DiscoverGPT: Multi-task Fine-tuning Large Language Model for Related Table DiscoveryFindings
  777. Discrete Diffusion Language Model for Efficient Text SummarizationFindings
  778. Disentangling language change: sparse autoencoders quantify the semantic evolution of indigeneity in FrenchLong
  779. Distill-C: Enhanced NL2SQL via Distilled Customization with LLMsIndustry
  780. Diverse In-Context Example Selection After Decomposing Programs and Aligned Utterances Improves Semantic ParsingLong
  781. Do Audio-Language Models Understand Linguistic Variations?Short
  782. Does Generative AI speak Nigerian-Pidgin?: Issues about Representativeness and Bias for Multilingualism in LLMsFindings
  783. Does Self-Attention Need Separate Weights in Transformers?Industry
  784. Don’t Touch My DiacriticsShort
  785. DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech RecognitionLong
  786. DynClean: Training Dynamics-based Label Cleaning for Distantly-Supervised Named Entity RecognitionFindings
  787. Dynamic Feature Fusion for Sign Language Translation Using HyperNetworksFindings
  788. Dynamic Fisher-weighted Model Merging via Bayesian OptimizationLong
  789. Dynamic Strategy Planning for Efficient Question Answering with Large Language ModelsFindings
  790. Dynamic Uncertainty Ranking: Enhancing Retrieval-Augmented In-Context Learning for Long-Tail Knowledge in LLMsLong
  791. E-Gen: Leveraging E-Graphs to Improve Continuous Representations of Symbolic ExpressionsLong
  792. EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language ModelsLong
  793. ERAS: Evaluating the Robustness of Chinese NLP Models to Morphological Garden Path ErrorsLong
  794. ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue SystemsSystem Demonstrations
  795. Echoes of Discord: Forecasting Hater Reactions to CounterspeechFindings
  796. Effective Self-Mining of In-Context Examples for Unsupervised Machine Translation with LLMsFindings
  797. Efficient Nearest Neighbor based Uncertainty Estimation for Natural Language Processing TasksFindings
  798. Efficient One-shot Compression via Low-Rank Local Feature DistillationLong
  799. Efficient and Effective Prompt Tuning via Prompt Decomposition and Compressed Outer ProductLong
  800. EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the WildFindings
  801. Elevating Legal LLM Responses: Harnessing Trainable Logical Structures and Semantic Knowledge with Legal ReasoningLong
  802. Eliciting Critical Reasoning in Retrieval-Augmented Generation via Contrastive ExplanationsLong
  803. Embedding derived animacy rankings offer insights into the sources of grammatical animacyLong
  804. Emergence of Episodic Memory in Transformers: Characterizing Changes in Temporal Structure of Attention Scores During TrainingLong
  805. Emo3D: Metric and Benchmarking Dataset for 3D Facial Expression Generation from Emotion DescriptionFindings
  806. EmoCharacter: Evaluating the Emotional Fidelity of Role-Playing Agents in DialoguesLong
  807. EmoDynamiX: Emotional Support Dialogue Strategy Prediction by Modelling MiXed Emotions and Discourse DynamicsLong
  808. EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMsLong
  809. Empowering Retrieval-based Conversational Recommendation with Contrasting User PreferencesLong
  810. Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based AttackFindings
  811. Enhancing Discriminative Representation in Similar Relation Clusters for Few-Shot Continual Relation ExtractionLong
  812. Enhancing Language Model Hypernetworks with Restart: A Study on OptimizationLong
  813. Enhancing Text-to-SQL with Question Classification and Multi-Agent CollaborationFindings
  814. Enhancing the Prototype Network with Local-to-Global Optimization for Few-Shot Relation ExtractionFindings
  815. Entangled Relations: Leveraging NLI and Meta-analysis to Enhance Biomedical Relation ExtractionLong
  816. Entity Pair-guided Relation Summarization and Retrieval in LLMs for Document-level Relation ExtractionFindings
  817. Ethical Concern Identification in NLP: A Corpus of ACL Anthology Ethics StatementsLong
  818. Evaluating Bias in LLMs for Job-Resume Matching: Gender, Race, and EducationIndustry
  819. Evaluating Contextualized Representations of (Spanish) Ambiguous Words: A New Lexical Resource and Empirical AnalysisLong
  820. Evaluating Evidence Attribution in Generated Fact Checking ExplanationsLong
  821. Evaluating Input Feature Explanations through a Unified Diagnostic Evaluation FrameworkLong
  822. Evaluating LLMs for Quotation Attribution in Literary Texts: A Case Study of LLaMa3Short
  823. Evaluating Large Language Models with Enterprise BenchmarksIndustry
  824. Evaluating Multimodal Generative AI with Korean Educational StandardsShort
  825. Evaluating Numeracy of Language Models as a Natural Language Inference TaskFindings
  826. Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language ModelsFindings
  827. Evaluating and Improving Graph to Text Generation with Large Language ModelsLong
  828. Evaluating and Mitigating Object Hallucination in Large Vision-Language Models: Can They Still See Removed Objects?Long
  829. Evaluating the Performance of RAG Methods for Conversational AI in the Airport DomainIndustry
  830. Evaluation of LLMs-based Hidden States as Author Representations for Psychological Human-Centered NLP TasksFindings
  831. Examining Spanish Counseling with MIDAS: a Motivational Interviewing Dataset in SpanishShort
  832. Explanation based In-Context Demonstrations Retrieval for Multilingual Grammatical Error CorrectionLong
  833. Exploiting Edited Large Language Models as General Scientific OptimizersLong
  834. Exploring Backward Reasoning in Large Language ModelsFindings
  835. Exploring Hybrid Sampling Inference for Aspect-based Sentiment AnalysisFindings
  836. Exploring Large Language Models for Effective Rumor Detection on Social MediaLong
  837. Exploring Straightforward Methods for Automatic Conversational Red-TeamingIndustry
  838. Exploring the Cost-Effectiveness of Perspective Taking in Crowdsourcing Subjective Assessment: A Case Study of Toxicity DetectionLong
  839. Extracting Military Event Temporal Relations via Relative Event Time Prediction and Virtual Adversarial TrainingFindings
  840. Extracting and Understanding the Superficial Knowledge in AlignmentLong
  841. FACT: Examining the Effectiveness of Iterative Context Rewriting for Multi-fact RetrievalFindings
  842. FACTS&EVIDENCE: An Interactive Tool for Transparent Fine-Grained Factual Verification of Machine-Generated TextSystem Demonstrations
  843. FIDELITY: Fine-grained Interpretable Distillation for Effective Language Insights and Topic YieldingFindings
  844. FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language ModelsFindings
  845. FLEX: Expert-level False-Less EXecution Metric for Text-to-SQL BenchmarkLong
  846. FLIQA-AD: a Fusion Model with Large Language Model for Better Diagnose and MMSE Prediction of Alzheimer’s DiseaseShort
  847. FactEval: Evaluating the Robustness of Fact Verification Systems in the Era of Large Language ModelsLong
  848. FactTrack: Time-Aware World State Tracking in Story OutlinesLong
  849. Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary EvaluationLong
  850. FaithfulPersona: Balancing Faithfulness and Personalization in Code Explanations through Self-CritiqueFindings
  851. Familiarity: Better Evaluation of Zero-Shot Named Entity Recognition by Quantifying Label Shifts in Synthetic Training DataLong
  852. Features that Make a Difference: Leveraging Gradients for Improved Dictionary LearningFindings
  853. Few-Shot Natural Language to First-Order Logic Translation via Code GenerationLong
  854. FiNE: Filtering and Improving Noisy Data Elaborately with Large Language ModelsLong
  855. Fighting Spurious Correlations in Text Classification via a Causal Learning PerspectiveLong
  856. FinLLM-B: When Large Language Models Meet Financial Breakout TradingIndustry
  857. Find the Intention of Instruction: Comprehensive Evaluation of Instruction Understanding for Large Language ModelsFindings
  858. Finding-Centric Structuring of Japanese Radiology Reports and Analysis of Performance Gaps for Multiple FacilitiesIndustry
  859. Fine-Grained Transfer Learning for Harmful Content Detection through Label-Specific Soft Prompt TuningLong
  860. Fine-grained Fallacy Detection with Human Label VariationLong
  861. FlexiGPT: Pruning and Extending Large Language Models with Low-Rank Weight SharingLong
  862. Follow the Beaten Path: The Role of Route Patterns on Vision-Language Navigation Agents Generalization AbilitiesLong
  863. Forest for the Trees: Overarching Prompting Evokes High-Level Reasoning in Large Language ModelsLong
  864. From Argumentation to Deliberation: Perspectivized Stance Vectors for Fine-grained (Dis)agreement AnalysisFindings
  865. From Curiosity to Clarity : Exploring the Impact of Consecutive Why-QuestionsFindings
  866. From Evidence to Belief: A Bayesian Epistemology Approach to Language ModelsLong
  867. From Generating Answers to Building Explanations: Integrating Multi-Round RAG and Causal Modeling for Scientific QAIndustry
  868. Functional Lexicon in Subword TokenizationLong
  869. GAIfE: Using GenAI to Improve Literacy in Low-resourced SettingsFindings
  870. GRAIT: Gradient-Driven Refusal-Aware Instruction Tuning for Effective Hallucination MitigationFindings
  871. GameTox: A Comprehensive Dataset and Analysis for Enhanced Toxicity Detection in Online Gaming CommunitiesShort
  872. Gender Bias in Instruction-Guided Speech Synthesis ModelsFindings
  873. Generating Complex Question Decompositions in the Face of Distribution ShiftsLong
  874. Generating Diverse Hypotheses for Inductive ReasoningLong
  875. Generative Prompt InternalizationLong
  876. Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra DataLong
  877. Giving the Old a Fresh Spin: Quality Estimation-Assisted Constrained Decoding for Automatic Post-EditingShort
  878. Goal-Conditioned DPO: Prioritizing Safety in Misaligned InstructionsLong
  879. Goal-Driven Data Story, Narrations and ExplanationsIndustry
  880. Granite Guardian: Comprehensive LLM SafeguardingIndustry
  881. Graph Neural Network Enhanced Retrieval for Question Answering of Large Language ModelsLong
  882. GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph DatasetsFindings
  883. GraphLSS: Integrating Lexical, Structural, and Semantic Features for Long Document Extractive SummarizationShort
  884. GroundCocoa: A Benchmark for Evaluating Compositional & Conditional Reasoning in Language ModelsLong
  885. GuideLLM: Exploring LLM-Guided Conversation with Applications in Autobiography InterviewingLong
  886. GuideQ: Framework for Guided Questioning for progressive informational collection and classificationFindings
  887. Guideline Compliance in Task-Oriented Dialogue: The Chained Prior ApproachFindings
  888. Guiding Medical Vision-Language Models with Diverse Visual Prompts: Framework Design and Comprehensive Exploration of Prompt VariationsLong
  889. Guiding Through Complexity: What Makes Good Supervision for Hard Reasoning Tasks?Long
  890. HEISIR: Hierarchical Expansion of Inverted Semantic Indexing for Training-free Retrieval of Conversational Data using LLMsFindings
  891. HISTOIRESMORALES: A French Dataset for Assessing Moral AlignmentLong
  892. Handling Missing Entities in Zero-Shot Named Entity Recognition: Integrated Recall and Retrieval AugmentationLong
  893. Hard Emotion Test Evaluation Sets for Language ModelsFindings
  894. Harnessing and Evaluating the Intrinsic Extrapolation Ability of Large Language Models for Vehicle Trajectory PredictionLong
  895. Hierarchical Speculative Decoding with Dynamic WindowFindings
  896. How LLMs React to Industrial Spatio-Temporal Data? Assessing Hallucination with a Novel Traffic Incident Benchmark DatasetIndustry
  897. How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language ModelsFindings
  898. How much do contextualized representations encode long-range context?Findings
  899. How to Align Multiple Signed Language Corpora for Better Sign-to-Sign Translations?Long
  900. How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine TranslationFindings
  901. How to Make LLMs Forget: On Reversing In-Context Knowledge EditsLong
  902. How to Talk to Language Models: Serialization Strategies for Structured Entity MatchingFindings
  903. IMRRF: Integrating Multi-Source Retrieval and Redundancy Filtering for LLM-based Fake News DetectionLong
  904. ITALIC: An Italian Culture-Aware Natural Language BenchmarkLong
  905. IdentifyMe: A Challenging Long-Context Mention Resolution Benchmark for LLMsShort
  906. Identifying Emerging Concepts in Large CorporaLong
  907. Identifying Power Relations in Conversations using Multi-Agent Social ReasoningShort
  908. Ihquin tlahtouah in Tetelahtzincocah: An annotated, multi-purpose audio and text corpus of Western Sierra Puebla NahuatlLong
  909. ImaRA: An Imaginative Frame Augmented Method for Low-Resource Multimodal Metaphor Detection and ExplanationFindings
  910. Implementing Retrieval Augmented Generation Technique on Unstructured and Structured Data Sources in a Call Center of a Large Financial InstitutionIndustry
  911. Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language ModelsFindings
  912. Improving Consistency in LLM Inference using Probabilistic TokenizationFindings
  913. Improving Data Annotation for Low-Resource Relation Extraction with Logical Rule-Augmented Collaborative Language ModelsLong
  914. Improving Pre-trained Language Models with Knowledge Enhancement and Filtering FrameworkFindings
  915. Improving Vietnamese-English Cross-Lingual Retrieval for Legal and General DomainsShort
  916. In-Context Learning (and Unlearning) of Length BiasesLong
  917. Inference-Time Selective Debiasing to Enhance Fairness in Text Classification ModelsShort
  918. InfoPO: On Mutual Information Maximization for Large Language Model AlignmentLong
  919. Instantly Learning Preference Alignment via In-context DPOLong
  920. InstructAny2Pix: Image Editing with Multi-Modal PromptsFindings
  921. Interpret and Control Dense Retrieval with Sparse Latent FeaturesShort
  922. Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language EncodersLong
  923. Intrinsic Model Weaknesses: How Priming Attacks Unveil Vulnerabilities in Large Language ModelsFindings
  924. Investigating Hallucinations in Simultaneous Machine Translation: Knowledge Distillation Solution and Components AnalysisLong
  925. Investigating the (De)Composition Capabilities of Large Language Models in Natural-to-Formal Language ConversionLong
  926. Investigating the Shortcomings of LLMs in Step-by-Step Legal ReasoningFindings
  927. Investigating the Zone of Proximal Development of Language Models for In-Context LearningFindings
  928. Is In-Context Learning a Type of Error-Driven Learning? Evidence from the Inverse Frequency Effect in Structural PrimingLong
  929. Is Your LLM Outdated? A Deep Look at Temporal GeneralizationLong
  930. Is your benchmark truly adversarial? AdvScore: Evaluating Human-Grounded AdversarialnessLong
  931. It Is Not Only the Negative that Deserves Attention! Understanding, Generation & Evaluation of (Positive) ModerationLong
  932. JAWAHER: A Multidialectal Dataset of Arabic Proverbs for LLM BenchmarkingLong
  933. JRE-L: Journalist, Reader, and Editor LLMs in the Loop for Science Journalism for the General AudienceLong
  934. Joint Learning Event-Specific Probe and Argument Library with Differential Optimization for Document-Level Multi-Event ExtractionFindings
  935. K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic ReasoningLong
  936. KMI: A Dataset of Korean Motivational Interviewing Dialogues for PsychotherapyLong
  937. KS-Lottery: Finding Certified Lottery Tickets for Multilingual Transfer in Large Language ModelsLong
  938. Keep Guessing? When Considering Inference Scaling, Mind the BaselinesFindings
  939. Kill two birds with one stone: generalized and robust AI-generated text detection via dynamic perturbationsLong
  940. Knowledge Graph Guided Evaluation of Abstention TechniquesLong
  941. LBC: Language-Based-Classifier for Out-Of-Variable GeneralizationLong
  942. LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMsLong
  943. LITERA: An LLM Based Approach to Latin-to-English TranslationFindings
  944. LLM Safety for ChildrenIndustry
  945. LLM-Based Explicit Models of Opponents for Multi-Agent GamesLong
  946. LLM-Generated Passphrases That Are Secure and Easy to RememberFindings
  947. LLM-Human Pipeline for Cultural Grounding of ConversationsLong
  948. LLM-Supported Natural Language to Bash TranslationLong
  949. LLM-guided Plan and Retrieval: A Strategic Alignment for Interpretable User Satisfaction Estimation in DialogueLong
  950. LLM4DistReconfig: A Fine-tuned Large Language Model for Power Distribution Network ReconfigurationLong
  951. LLMs for Extremely Low-Resource Finno-Ugric LanguagesFindings
  952. LLaMA-Berry: Pairwise Optimization for Olympiad-level Mathematical Reasoning via O1-like Monte Carlo Tree SearchLong
  953. LM-Pub-Quiz: A Comprehensive Framework for Zero-Shot Evaluation of Relational Knowledge in Language ModelsSystem Demonstrations
  954. LOFT: Scalable and More Realistic Long-Context EvaluationFindings
  955. LSDC: An Efficient and Effective Large-Scale Data Compression Method for Supervised Fine-tuning of Large Language ModelsFindings
  956. Label Drop for Multi-Aspect Relation Modeling in Universal Information ExtractionLong
  957. Language Models Largely Exhibit Human-like Constituent Ordering PreferencesLong
  958. Language Models can Categorize System Inputs for Performance AnalysisLong
  959. Language-based Valence and Arousal Expressions between the United States and China: a Cross-Cultural ExaminationFindings
  960. Large Language Models and Causal Inference in Collaboration: A Comprehensive SurveyFindings
  961. Large Language Models for Persian-English Idiom TranslationLong
  962. Large-Scale Corpus Construction and Retrieval-Augmented Generation for Ancient Chinese Poetry: New Method and Data InsightsFindings
  963. Latent Factor Models Meets Instructions: Goal-conditioned Latent Factor Discovery without Task SupervisionLong
  964. Learning LLM Preference over Intra-Dialogue Pairs: A Framework for Utterance-level UnderstandingsIndustry
  965. Learning Low-Resource Languages Through NLP-Driven Flashcards: A Case Study of Hokkien in Language Learning ApplicationsSystem Demonstrations
  966. Learning to Explore and Select for Coverage-Conditioned Retrieval-Augmented GenerationFindings
  967. Learning to Solve Domain-Specific Calculation Problems with Knowledge-Intensive Programs GeneratorLong
  968. Learning to Substitute Words with Model-based Score RankingLong
  969. Learning with Less: Knowledge Distillation from Large Language Models via Unlabeled DataFindings
  970. Legal Judgment Prediction based on Knowledge-enhanced Multi-Task and Multi-Label Text ClassificationLong
  971. LegalSeg: Unlocking the Structure of Indian Legal Judgments Through Rhetorical Role ClassificationFindings
  972. LegalViz: Legal Text Visualization by Text To Diagram GenerationLong
  973. Lessons from a User Experience Evaluation of NLP InterfacesFindings
  974. Let Modalities Teach Each Other: Modal-Collaborative Knowledge Extraction and Fusion for Multimodal Knowledge Graph CompletionFindings
  975. Leveraging Allophony in Self-Supervised Speech Models for Atypical Pronunciation AssessmentLong
  976. Leveraging LLM For Synchronizing Information Across Multilingual TablesLong
  977. Leveraging Moment Injection for Enhanced Semi-supervised Natural Language Inference with Large Language ModelsShort
  978. Lightweight Contenders: Navigating Semi-Supervised Text Mining through Peer Collaboration and Self TranscendenceFindings
  979. Linguistically Grounded Analysis of Language Models using Shapley Head ValuesFindings
  980. Little Giants: Synthesizing High-Quality Embedding Data at ScaleLong
  981. Local Prompt OptimizationShort
  982. LogRules: Enhancing Log Analysis Capability of Large Language Models through RulesFindings
  983. Logit Separability-Driven Samples and Multiple Class-Related Words Selection for Advancing In-Context LearningLong
  984. Long-Tail Crisis in Nearest Neighbor Language ModelsFindings
  985. LongLeader: A Comprehensive Leaderboard for Large Language Models in Long-context ScenariosLong
  986. Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative DecodingFindings
  987. Lost in Overlap: Exploring Logit-based Watermark Collision in LLMsFindings
  988. Lost in the Distance: Large Language Models Struggle to Capture Long-Distance Relational KnowledgeFindings
  989. M-IFEval: Multilingual Instruction-Following EvaluationFindings
  990. MASTER: A Multi-Agent System with LLM Specialized MCTSLong
  991. MATO: A Model-Agnostic Training Optimization for Aspect Sentiment Triplet ExtractionLong
  992. MAiDE-up: Multilingual Deception Detection of AI-generated Hotel ReviewsFindings
  993. MES-RAG: Bringing Multi-modal, Entity-Storage, and Secure Enhancements to RAGFindings
  994. METAPHORSHARE: A Dynamic Collaborative Repository of Open Metaphor DatasetsSystem Demonstrations
  995. MGM: Global Understanding of Audience Overlap Graphs for Predicting the Factuality and the Bias of News MediaLong
  996. MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with ToolsLong
  997. MMLF: Multi-query Multi-passage Late Fusion RetrievalFindings
  998. MRE-MI: A Multi-image Dataset for Multimodal Relation Extraction in Social Media PostsFindings
  999. MT-LENS: An all-in-one Toolkit for Better Machine Translation EvaluationSystem Demonstrations
  1000. Main Predicate and Their Arguments as Explanation Signals For Intent ClassificationLong

NAACL accepted papers in other years

Looking for submission deadlines instead? See the conference deadline calendar.