← All conferences

ACL 2024 Accepted Papers

The full list of 1,930 papers accepted at ACL 2024 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Findings: 953Long: 863Short: 76System Demonstrations: 38
  1. Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsLong766 citations
  2. Large Language Models are not Fair EvaluatorsLong442 citations
  3. LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language ModelsSystem Demonstrations440 citations
  4. Chain-of-Verification Reduces Hallucination in Large Language ModelsFindings390 citations
  5. Improving Text Embeddings with Large Language ModelsLong339 citations
  6. Aligning Large Multimodal Models with Factually Augmented RLHFFindings307 citations
  7. MM-LLMs: Recent Advances in MultiModal Large Language ModelsFindings287 citations
  8. LLM-QAT: Data-Free Quantization Aware Training for Large Language ModelsFindings278 citations
  9. How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMsLong260 citations
  10. DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language ModelsLong245 citations
  11. CMMLU: Measuring massive multitask language understanding in ChineseFindings244 citations
  12. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human AnnotationsLong242 citations
  13. LongBench: A Bilingual, Multitask Benchmark for Long Context UnderstandingLong221 citations
  14. BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical DomainsFindings217 citations
  15. Active Prompting with Chain-of-Thought for Large Language ModelsLong212 citations
  16. Navigate through Enigmatic Labyrinth A Survey of Chain of Thought Reasoning: Advances, Frontiers and FutureLong209 citations
  17. RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language ModelsFindings205 citations
  18. FreshLLMs: Refreshing Large Language Models with Search Engine AugmentationFindings202 citations
  19. LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt CompressionLong200 citations
  20. OLMo: Accelerating the Science of Language ModelsLong200 citations
  21. ChatDev: Communicative Agents for Software DevelopmentLong187 citations
  22. LaMP: When Large Language Models Meet PersonalizationLong185 citations
  23. Aya Model: An Instruction Finetuned Open-Access Multilingual Language ModelLong181 citations
  24. VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web TasksLong177 citations
  25. SafetyBench: Evaluating the Safety of Large Language ModelsLong176 citations
  26. Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMsLong174 citations
  27. Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language ModelsFindings169 citations
  28. Benchmarking Retrieval-Augmented Generation for MedicineFindings160 citations
  29. Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining ResearchLong156 citations
  30. AgentTuning: Enabling Generalized Agent Abilities for LLMsFindings145 citations
  31. Exploring Collaboration Mechanisms for LLM Agents: A Social Psychology ViewLong142 citations
  32. SeeClick: Harnessing GUI Grounding for Advanced Visual GUI AgentsLong141 citations
  33. Defending Against Alignment-Breaking Attacks via Robustly Aligned LLMLong140 citations
  34. Having Beer after Prayer? Measuring Cultural Bias in Large Language ModelsLong139 citations
  35. MedAgents: Large Language Models as Collaborators for Zero-shot Medical ReasoningFindings139 citations
  36. Full Parameter Fine-tuning for Large Language Models with Limited ResourcesLong138 citations
  37. Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language ModelsLong134 citations
  38. AnyGPT: Unified Multimodal LLM with Discrete Sequence ModelingLong132 citations
  39. Steering Llama 2 via Contrastive Activation AdditionLong132 citations
  40. OpenCodeInterpreter: Integrating Code Generation with Execution and RefinementFindings127 citations
  41. MindMap: Knowledge Graph Prompting Sparks Graph of Thoughts in Large Language ModelsLong125 citations
  42. OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific ProblemsLong123 citations
  43. How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data CompositionLong118 citations
  44. emotion2vec: Self-Supervised Pre-Training for Speech Emotion RepresentationFindings115 citations
  45. LLM in a flash: Efficient Large Language Model Inference with Limited MemoryLong113 citations
  46. LooGLE: Can Long-Context Language Models Understand Long Contexts?Long112 citations
  47. SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language ModelsFindings112 citations
  48. SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware DecodingLong108 citations
  49. WebVoyager: Building an End-to-End Web Agent with Large Multimodal ModelsLong108 citations
  50. Visual In-Context Learning for Large Vision-Language ModelsFindings106 citations
  51. Are Emergent Abilities in Large Language Models just In-Context Learning?Long105 citations
  52. Disentangling Length from Quality in Direct Preference OptimizationFindings104 citations
  53. ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMsLong103 citations
  54. The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language ModelsLong103 citations
  55. Benchmarking Cognitive Biases in Large Language Models as EvaluatorsFindings102 citations
  56. Defending Large Language Models Against Jailbreaking Attacks Through Goal PrioritizationLong102 citations
  57. EconAgent: Large Language Model-Empowered Agents for Simulating Macroeconomic ActivitiesLong100 citations
  58. ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMsLong98 citations
  59. You Only Look at Screens: Multimodal Chain-of-Action AgentsFindings98 citations
  60. Aya Dataset: An Open-Access Collection for Multilingual Instruction TuningLong94 citations
  61. Data Augmentation using LLMs: Data Perspectives, Learning Paradigms and ChallengesFindings94 citations
  62. On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A SurveyFindings94 citations
  63. LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt CompressionFindings93 citations
  64. LLMs cannot find reasoning errors, but can correct them given the error locationFindings93 citations
  65. TempCompass: Do Video LLMs Really Understand Videos?Findings93 citations
  66. Do Llamas Work in English? On the Latent Language of Multilingual TransformersLong92 citations
  67. Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative DecodingFindings92 citations
  68. Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative DecodingLong91 citations
  69. The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language VariantsLong89 citations
  70. RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language ModelsLong87 citations
  71. ChatKBQA: A Generate-then-Retrieve Framework for Knowledge Base Question Answering with Fine-tuned Large Language ModelsFindings85 citations
  72. LayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingLong85 citations
  73. The Impact of Reasoning Step Length on Large Language ModelsFindings85 citations
  74. InFoBench: Evaluating Instruction Following Ability in Large Language ModelsFindings82 citations
  75. Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step by StepFindings80 citations
  76. Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language ModelsLong80 citations
  77. Who Wrote this Code? Watermarking for Code GenerationLong80 citations
  78. ∞Bench: Extending Long Context Evaluation Beyond 100K TokensLong80 citations
  79. CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding ChallengesLong79 citations
  80. Don’t Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM CollaborationLong79 citations
  81. Prompt Engineering a Prompt EngineerFindings79 citations
  82. Towards Safer Large Language Models through Machine UnlearningFindings79 citations
  83. Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image SequencesLong78 citations
  84. The Good and The Bad: Exploring Privacy Issues in Retrieval-Augmented Generation (RAG)Findings78 citations
  85. Do Large Language Models Latently Perform Multi-Hop Reasoning?Long77 citations
  86. Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective RewardsLong76 citations
  87. Black-Box Prompt Optimization: Aligning Large Language Models without Model TrainingLong74 citations
  88. Faithful Logical Reasoning via Symbolic Chain-of-ThoughtLong73 citations
  89. Large Language Models Can Learn Temporal ReasoningLong73 citations
  90. AutoAct: Automatic Agent Learning from Scratch for QA via Self-PlanningLong72 citations
  91. InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological InterviewsLong71 citations
  92. Investigating Cultural Alignment of Large Language ModelsLong71 citations
  93. MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn DialoguesLong71 citations
  94. Penetrative AI: Making LLMs Comprehend the Physical WorldFindings71 citations
  95. VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the WildLong71 citations
  96. AlignBench: Benchmarking Chinese Alignment of Large Language ModelsLong69 citations
  97. When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model LeaderboardsLong69 citations
  98. Everything of Thoughts: Defying the Law of Penrose Triangle for Thought GenerationFindings68 citations
  99. Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language ModelsFindings68 citations
  100. InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model AgentsFindings68 citations
  101. LLaMA Pro: Progressive LLaMA with Block ExpansionLong68 citations
  102. SeaLLMs - Large Language Models for Southeast AsiaSystem Demonstrations68 citations
  103. The Revolution of Multimodal Large Language Models: A SurveyFindings66 citations
  104. Small Models are Valuable Plug-ins for Large Language ModelsFindings65 citations
  105. Trial and Error: Exploration-Based Trajectory Optimization of LLM AgentsLong65 citations
  106. Boosting Language Models Reasoning with Chain-of-Knowledge PromptingLong62 citations
  107. Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language ModelsLong62 citations
  108. Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language ModelsLong62 citations
  109. Direct Preference Optimization with an OffsetFindings61 citations
  110. The Earth is Flat because...: Investigating LLMs’ Belief towards Misinformation via Persuasive ConversationLong61 citations
  111. LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-TuningFindings60 citations
  112. Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?Long60 citations
  113. SciMON: Scientific Inspiration Machines Optimized for NoveltyLong59 citations
  114. DebugBench: Evaluating Debugging Capability of Large Language ModelsFindings58 citations
  115. MAGE: Machine-generated Text Detection in the WildLong58 citations
  116. Quantifying the Persona Effect in LLM SimulationsLong58 citations
  117. Red Teaming Visual Language ModelsFindings58 citations
  118. Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language ModelsFindings58 citations
  119. ChartAssistant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction TuningFindings57 citations
  120. Evaluating Very Long-Term Conversational Memory of LLM AgentsLong57 citations
  121. Rephrasing the Web: A Recipe for Compute and Data-Efficient Language ModelingLong57 citations
  122. Unified Hallucination Detection for Multimodal Large Language ModelsLong57 citations
  123. AIR-Bench: Benchmarking Large Audio-Language Models via Generative ComprehensionLong56 citations
  124. Knowledge of Knowledge: Exploring Known-Unknowns Uncertainty with Large Language ModelsFindings56 citations
  125. Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive DecodingFindings56 citations
  126. CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent EvaluationLong55 citations
  127. The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual ContextsFindings55 citations
  128. Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-TuningLong54 citations
  129. FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language ModelsLong53 citations
  130. A Comprehensive Study of Jailbreak Attack versus Defense for Large Language ModelsFindings52 citations
  131. VIEScore: Towards Explainable Metrics for Conditional Image Synthesis EvaluationLong52 citations
  132. Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language ModelsFindings51 citations
  133. LLM2LLM: Boosting LLMs with Novel Iterative Data EnhancementFindings51 citations
  134. “My Answer is C”: First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language ModelsFindings51 citations
  135. DocLLM: A Layout-Aware Generative Language Model for Multimodal Document UnderstandingLong50 citations
  136. Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-AlignmentLong50 citations
  137. Model Editing at Scale leads to Gradual and Catastrophic ForgettingFindings50 citations
  138. Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on GraphsFindings49 citations
  139. GroundingGPT: Language Enhanced Multi-modal Grounding ModelLong49 citations
  140. Machine Unlearning of Pre-trained Large Language ModelsLong49 citations
  141. MapCoder: Multi-Agent Code Generation for Competitive Problem SolvingLong49 citations
  142. Neurons in Large Language Models: Dead, N-gram, PositionalFindings49 citations
  143. Relying on the Unreliable: The Impact of Language Models’ Reluctance to Express UncertaintyLong49 citations
  144. Shifting Attention to Relevance: Towards the Predictive Uncertainty Quantification of Free-Form Large Language ModelsLong49 citations
  145. Agent-Pro: Learning to Evolve via Policy-Level Reflection and OptimizationLong48 citations
  146. EmotionQueen: A Benchmark for Evaluating Empathy of Large Language ModelsFindings48 citations
  147. MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics BenchmarkFindings48 citations
  148. PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMsFindings48 citations
  149. Visual Hallucinations of Multi-modal Large Language ModelsFindings48 citations
  150. PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM InferenceFindings47 citations
  151. ChatMusician: Understanding and Generating Music Intrinsically with LLMFindings45 citations
  152. ReFT: Reasoning with Reinforced Fine-TuningLong45 citations
  153. Mission: Impossible Language ModelsLong44 citations
  154. MultiLegalPile: A 689GB Multilingual Legal CorpusLong44 citations
  155. Quantifying Uncertainty in Answers from any Language Model and Enhancing their TrustworthinessLong44 citations
  156. Fact-Checking the Output of Large Language Models via Token-Level Uncertainty QuantificationFindings43 citations
  157. MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMsLong43 citations
  158. The Art of Defending: A Systematic Evaluation and Analysis of LLM Defense Strategies on Safety and Over-DefensivenessFindings43 citations
  159. MMToM-QA: Multimodal Theory of Mind Question AnsweringLong42 citations
  160. Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit CluesFindings42 citations
  161. Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language ModelsLong42 citations
  162. Efficient Continual Pre-training for Building Domain Specific Large Language ModelsFindings41 citations
  163. Less is More: Mitigating Multimodal Hallucination from an EOS Decision PerspectiveLong41 citations
  164. LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language ModelsLong41 citations
  165. Long-Context Language Modeling with Parallel Context EncodingLong41 citations
  166. M4GT-Bench: Evaluation Benchmark for Black-Box Machine-Generated Text DetectionLong41 citations
  167. CriticBench: Benchmarking LLMs for Critique-Correct ReasoningFindings40 citations
  168. M3CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-ThoughtLong40 citations
  169. TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful SpaceLong40 citations
  170. ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human PreferencesLong39 citations
  171. OceanGPT: A Large Language Model for Ocean Science TasksLong39 citations
  172. PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System SafetyLong39 citations
  173. RA-ISF: Learning to Answer and Understand from Retrieval Augmentation via Iterative Self-FeedbackFindings39 citations
  174. TRAM: Benchmarking Temporal Reasoning for Large Language ModelsFindings39 citations
  175. The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model PerformanceFindings39 citations
  176. Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference OptimizationFindings38 citations
  177. Can LLMs Learn from Previous Mistakes? Investigating LLMs’ Errors to Boost for ReasoningLong37 citations
  178. Cross-Lingual Knowledge Editing in Large Language ModelsLong37 citations
  179. NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity ClassesLong37 citations
  180. RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text DetectorsLong37 citations
  181. Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-TuningFindings37 citations
  182. Think Twice: Perspective-Taking Improves Large Language Models’ Theory-of-Mind CapabilitiesLong37 citations
  183. BioT5+: Towards Generalized Biological Understanding with IUPAC Integration and Multi-task TuningFindings36 citations
  184. CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI AutomationFindings36 citations
  185. Defending LLMs against Jailbreaking Attacks via BacktranslationFindings36 citations
  186. Experiential Co-Learning of Software-Developing AgentsLong36 citations
  187. Harnessing the Power of Large Language Models for Natural Language to First-Order Logic TranslationLong36 citations
  188. Pride and Prejudice: LLM Amplifies Self-Bias in Self-RefinementLong36 citations
  189. StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language ModelsFindings36 citations
  190. StudentEval: A Benchmark of Student-Written Prompts for Large Language Models of CodeFindings36 citations
  191. Unintended Impacts of LLM Alignment on Global RepresentationLong36 citations
  192. When is Tree Search Useful for LLM Planning? It Depends on the DiscriminatorLong36 citations
  193. ArabicMMLU: Assessing Massive Multitask Language Understanding in ArabicFindings35 citations
  194. LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation ScoresFindings35 citations
  195. LMDX: Language Model-based Document Information Extraction and LocalizationFindings35 citations
  196. PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-RailsLong35 citations
  197. Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-EvaluationLong35 citations
  198. Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with DataFindings34 citations
  199. DELL: Generating Reactions and Explanations for LLM-Based Misinformation DetectionFindings34 citations
  200. Disinformation Capabilities of Large Language ModelsLong34 citations
  201. Enhancing Large Language Models in Coding Through Multi-Perspective Self-ConsistencyLong34 citations
  202. L-Eval: Instituting Standardized Evaluation for Long Context Language ModelsLong34 citations
  203. Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction TuningFindings34 citations
  204. Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse PromptsLong33 citations
  205. Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart CaptioningFindings33 citations
  206. InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference AlignmentFindings33 citations
  207. InstructProtein: Aligning Human and Protein Language via Knowledge InstructionLong33 citations
  208. Knowledge-Infused Prompting: Assessing and Advancing Clinical Text Data Generation with Large Language ModelsFindings33 citations
  209. Learning to Decode Collaboratively with Multiple Language ModelsLong33 citations
  210. LoraRetriever: Input-Aware LoRA Retrieval and Composition for Mixed Tasks in the WildFindings33 citations
  211. OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language ModelsLong33 citations
  212. Revisiting Demonstration Selection Strategies in In-Context LearningLong33 citations
  213. Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement SimulationFindings33 citations
  214. Agent Lumos: Unified and Modular Training for Open-Source Language AgentsLong32 citations
  215. CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code CompletionFindings32 citations
  216. Faithful Persona-based Conversational Dataset Generation with Large Language ModelsFindings32 citations
  217. Knowledgeable Preference Alignment for LLMs in Domain-specific Question AnsweringFindings32 citations
  218. MM-SOC: Benchmarking Multimodal Large Language Models in Social Media PlatformsFindings32 citations
  219. Self-Distillation Bridges Distribution Gap in Language Model Fine-TuningLong32 citations
  220. AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding AgentsLong31 citations
  221. Before Generation, Align it! A Novel and Effective Strategy for Mitigating Hallucinations in Text-to-SQL GenerationFindings31 citations
  222. ChartInstruct: Instruction Tuning for Chart Comprehension and ReasoningFindings31 citations
  223. FinTral: A Family of GPT-4 Level Multimodal Financial Large Language ModelsFindings31 citations
  224. Knowledge-to-SQL: Enhancing SQL Generation with Data Expert LLMFindings31 citations
  225. MARIO: MAth Reasoning with code Interpreter Output - A Reproducible PipelineFindings31 citations
  226. Multilingual Instruction Tuning With Just a Pinch of MultilingualityFindings31 citations
  227. SOTOPIA-π: Interactive Learning of Socially Intelligent Language AgentsLong31 citations
  228. Bridging the Preference Gap between Retrievers and LLMsLong30 citations
  229. EmoBench: Evaluating the Emotional Intelligence of Large Language ModelsLong30 citations
  230. Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question AnsweringLong30 citations
  231. IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens IntactFindings30 citations
  232. MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language NavigationLong30 citations
  233. MatPlotAgent: Method and Evaluation for LLM-Based Agentic Scientific Data VisualizationFindings30 citations
  234. Measuring Political Bias in Large Language Models: What Is Said and How It Is SaidLong30 citations
  235. Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language ModelsLong30 citations
  236. RetrievalQA: Assessing Adaptive Retrieval-Augmented Generation for Short-form Open-Domain Question AnsweringFindings30 citations
  237. UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained GenerationLong30 citations
  238. FineSurE: Fine-grained Summarization Evaluation using LLMsLong29 citations
  239. LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term PromptingFindings29 citations
  240. Learning or Self-aligning? Rethinking Instruction Fine-tuningLong29 citations
  241. Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized RehearsalLong29 citations
  242. Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained EvaluationFindings29 citations
  243. RepCodec: A Speech Representation Codec for Speech TokenizationLong29 citations
  244. Aligning Large Language Models with Human Preferences through Representation EngineeringLong28 citations
  245. Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language ModelsFindings28 citations
  246. DataDreamer: A Tool for Synthetic Data Generation and Reproducible LLM WorkflowsLong28 citations
  247. KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language ModelsLong28 citations
  248. Multimodal Table UnderstandingLong28 citations
  249. On Context Utilization in Summarization with Large Language ModelsLong28 citations
  250. PUB: A Pragmatics Understanding Benchmark for Assessing LLMs’ Pragmatics CapabilitiesFindings28 citations
  251. Quantifying Contamination in Evaluating Code Generation Capabilities of Language ModelsLong28 citations
  252. Small Language Models Need Strong Verifiers to Self-Correct ReasoningFindings28 citations
  253. CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and GenerationLong27 citations
  254. DIALECTBENCH: An NLP Benchmark for Dialects, Varieties, and Closely-Related LanguagesLong27 citations
  255. Do Large Language Models Discriminate in Hiring Decisions on the Basis of Race, Ethnicity, and Gender?Short27 citations
  256. EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language ModelsSystem Demonstrations27 citations
  257. Enhancing Noise Robustness of Retrieval-Augmented Language Models with Adaptive Adversarial TrainingLong27 citations
  258. MAPO: Advancing Multilingual Reasoning through Multilingual-Alignment-as-Preference OptimizationLong27 citations
  259. Synthesizing Text-to-SQL Data from Weak and Strong LLMsLong27 citations
  260. TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language ModelsLong27 citations
  261. A Comprehensive Evaluation of Quantization Strategies for Large Language ModelsFindings26 citations
  262. ARIES: A Corpus of Scientific Paper Edits Made in Response to Peer ReviewsLong26 citations
  263. Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken ConversationsLong26 citations
  264. Are self-explanations from Large Language Models faithful?Findings26 citations
  265. Bootstrapping LLM-based Task-Oriented Dialogue Agents via Self-TalkFindings26 citations
  266. Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMsLong26 citations
  267. Exploring Memorization in Fine-tuned Language ModelsLong26 citations
  268. Exploring the Potential of Large Language Models in Computational ArgumentationLong26 citations
  269. Interactive-KBQA: Multi-Turn Interactions for Knowledge Base Question Answering with Large Language ModelsLong26 citations
  270. LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent EnvironmentsLong26 citations
  271. Landmark Embedding: A Chunking-Free Embedding Method For Retrieval Augmented Long-Context Large Language ModelsLong26 citations
  272. On the Multi-turn Instruction Following for Conversational Web AgentsLong26 citations
  273. One-Shot Learning as Instruction Data Prospector for Large Language ModelsLong26 citations
  274. Proving membership in LLM pretraining data via data watermarksFindings26 citations
  275. WilKE: Wise-Layer Knowledge Editor for Lifelong Knowledge EditingFindings26 citations
  276. Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark for Large Language ModelsLong25 citations
  277. ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase PartitionLong25 citations
  278. Citation-Enhanced Generation for LLM-based ChatbotsLong25 citations
  279. CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model GenerationLong25 citations
  280. Do Androids Know They’re Only Dreaming of Electric Sheep?Findings25 citations
  281. Evaluating LLMs’ Mathematical Reasoning in Financial Document Question AnsweringFindings25 citations
  282. FOFO: A Benchmark to Evaluate LLMs’ Format-Following CapabilityLong25 citations
  283. Investigating Subtler Biases in LLMs: Ageism, Beauty, Institutional, and Nationality Bias in Generative ModelsFindings25 citations
  284. Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile AgentsLong25 citations
  285. Navigating the OverKill in Large Language ModelsLong25 citations
  286. Retrieval-Augmented Multilingual Knowledge EditingLong25 citations
  287. Tell Me More! Towards Implicit User Intention Understanding of Language Model Driven AgentsLong25 citations
  288. An Entropy-based Text Watermarking Detection MethodLong24 citations
  289. BadAgent: Inserting and Activating Backdoor Attacks in LLM AgentsLong24 citations
  290. DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to DeterminacyLong24 citations
  291. Efficient Detection of LLM-generated Texts with a Bayesian Surrogate ModelFindings24 citations
  292. Extending Context Window of Large Language Models via Semantic CompressionFindings24 citations
  293. Identifying Semantic Induction Heads to Understand In-Context LearningFindings24 citations
  294. LM-Cocktail: Resilient Tuning of Language Models via Model MergingFindings24 citations
  295. Llama2Vec: Unsupervised Adaptation of Large Language Models for Dense RetrievalLong24 citations
  296. Navigating the Metrics Maze: Reconciling Score Magnitudes and AccuraciesLong24 citations
  297. RAVEL: Evaluating Interpretability Methods on Disentangling Language Model RepresentationsLong24 citations
  298. ROSE Doesn’t Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive DecodingFindings24 citations
  299. Text-like Encoding of Collaborative Information in Large Language Models for RecommendationLong24 citations
  300. WaterBench: Towards Holistic Evaluation of Watermarks for Large Language ModelsLong24 citations
  301. What Evidence Do Language Models Find Convincing?Long24 citations
  302. When Do LLMs Need Retrieval Augmentation? Mitigating LLMs’ Overconfidence Helps Retrieval AugmentationFindings24 citations
  303. Are LLM-based Evaluators Confusing NLG Quality Criteria?Long23 citations
  304. Better Synthetic Data by Retrieving and Transforming Existing DatasetsFindings23 citations
  305. BitDistiller: Unleashing the Potential of Sub-4-Bit LLMs via Self-DistillationLong23 citations
  306. Competition-Level Problems are Effective LLM EvaluatorsFindings23 citations
  307. E2-LLM: Efficient and Extreme Length Extension of Large Language ModelsFindings23 citations
  308. Forward-Backward Reasoning in Large Language Models for Mathematical VerificationFindings23 citations
  309. LLMs Beyond English: Scaling the Multilingual Capability of LLMs with Cross-Lingual FeedbackFindings23 citations
  310. Layer-Condensed KV Cache for Efficient Inference of Large Language ModelsLong23 citations
  311. MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-TuningLong23 citations
  312. MolTC: Towards Molecular Relational Modeling In Language ModelsFindings23 citations
  313. Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex ScenariosFindings23 citations
  314. Prototypical Reward Network for Data-Efficient RLHFLong23 citations
  315. Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMsLong23 citations
  316. The Unreasonable Effectiveness of Easy Training Data for Hard TasksLong23 citations
  317. Towards Real-World Writing Assistance: A Chinese Character Checking Benchmark with Faked and Misspelled CharactersLong23 citations
  318. WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction TuningLong23 citations
  319. AutoRE: Document-Level Relation Extraction with Large Language ModelsSystem Demonstrations22 citations
  320. Confabulation: The Surprising Value of Large Language Model HallucinationsLong22 citations
  321. Finding and Editing Multi-Modal Neurons in Pre-Trained TransformersFindings22 citations
  322. Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language ModelsLong22 citations
  323. From Role-Play to Drama-Interaction: An LLM SolutionFindings22 citations
  324. Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and BeyondLong22 citations
  325. Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing ConstraintFindings22 citations
  326. LLMs in the Imaginarium: Tool Learning through Simulated Trial and ErrorLong22 citations
  327. M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language ModelsLong22 citations
  328. OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language IdentificationLong22 citations
  329. On the Vulnerability of Safety Alignment in Open-Access LLMsFindings22 citations
  330. PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal RetrieversLong22 citations
  331. Stumbling Blocks: Stress Testing the Robustness of Machine-Generated Text Detectors Under AttacksLong22 citations
  332. Understanding and Patching Compositional Reasoning in LLMsFindings22 citations
  333. ANALOGYKB: Unlocking Analogical Reasoning of Language Models with A Million-scale Knowledge BaseLong21 citations
  334. Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?Long21 citations
  335. CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense ReasoningLong21 citations
  336. Codec-SUPERB: An In-Depth Analysis of Sound Codec ModelsFindings21 citations
  337. Evaluating Large Language Model Biases in Persona-Steered GenerationFindings21 citations
  338. Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQFindings21 citations
  339. Latxa: An Open Language Model and Evaluation Suite for BasqueLong21 citations
  340. MetaPro 2.0: Computational Metaphor Processing on the Effectiveness of Anomalous Language ModelingFindings21 citations
  341. PokeMQA: Programmable knowledge editing for Multi-hop Question AnsweringLong21 citations
  342. RAM-EHR: Retrieval Augmentation Meets Clinical Predictions on Electronic Health RecordsShort21 citations
  343. SAPT: A Shared Attention Framework for Parameter-Efficient Continual Learning of Large Language ModelsLong21 citations
  344. The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models CollapseFindings21 citations
  345. ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three StagesLong21 citations
  346. UniCoder: Scaling Code Large Language Model via Universal CodeLong21 citations
  347. Unveiling Linguistic Regions in Large Language ModelsLong21 citations
  348. VISTA: Visualized Text Embedding For Universal Multi-Modal RetrievalLong21 citations
  349. AdaLomo: Low-memory Optimization with Adaptive Learning RateFindings20 citations
  350. Automatic Engineering of Long PromptsFindings20 citations
  351. COKE: A Cognitive Knowledge Graph for Machine Theory of MindLong20 citations
  352. Calibrating Large Language Models Using Their Generations OnlyLong20 citations
  353. ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language ModelsLong20 citations
  354. DB-LLM: Accurate Dual-Binarization for Efficient LLMsFindings20 citations
  355. Don’t Go To Extremes: Revealing the Excessive Sensitivity and Calibration Limitations of LLMs in Implicit Hate Speech DetectionLong20 citations
  356. ERA-CoT: Improving Chain-of-Thought through Entity Relationship AnalysisLong20 citations
  357. GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-SolvingFindings20 citations
  358. Integrating Pre-Trained Speech and Language Models for End-to-End Speech RecognitionFindings20 citations
  359. M-RAG: Reinforcing Large Language Model Performance through Retrieval-Augmented Generation with Multiple PartitionsLong20 citations
  360. Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQALong20 citations
  361. Prompting open-source and commercial language models for grammatical error correction of English learner textFindings20 citations
  362. Smaller Language Models are capable of selecting Instruction-Tuning Training Data for Larger Language ModelsFindings20 citations
  363. T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by StepLong20 citations
  364. TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language ModelsFindings20 citations
  365. Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language ModelsFindings20 citations
  366. Towards Verifiable Generation: A Benchmark for Knowledge-aware Language Model AttributionFindings20 citations
  367. UOR: Universal Backdoor Attacks on Pre-trained Language ModelsFindings20 citations
  368. Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented GenerationLong20 citations
  369. Why are Sensitive Functions Hard for Transformers?Long20 citations
  370. A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way ParallelismFindings19 citations
  371. API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMsLong19 citations
  372. Beyond Single-Event Extraction: Towards Efficient Document-Level Multi-Event Argument ExtractionFindings19 citations
  373. CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language ModelsLong19 citations
  374. CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological CounselingFindings19 citations
  375. Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support ConversationLong19 citations
  376. Decomposition for Enhancing Attention: Improving LLM-based Text-to-SQL through Workflow ParadigmFindings19 citations
  377. DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code RepositoriesFindings19 citations
  378. EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language ModelsLong19 citations
  379. Generalization-Enhanced Code Vulnerability Detection via Multi-Task Instruction Fine-TuningFindings19 citations
  380. Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler FeedbackFindings19 citations
  381. Knowledge Graph-Enhanced Large Language Models via Path SelectionFindings19 citations
  382. Large Language Models as Zero-shot Dialogue State Tracker through Function CallingLong19 citations
  383. Learning to Edit: Aligning LLMs with Knowledge EditingLong19 citations
  384. MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in PerceptionLong19 citations
  385. Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language ModelsLong19 citations
  386. Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion RecognitionLong19 citations
  387. On Measuring Faithfulness or Self-consistency of Natural Language ExplanationsLong19 citations
  388. ProxyQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language ModelsLong19 citations
  389. Question Translation Training for Better Multilingual ReasoningFindings19 citations
  390. Reducing Privacy Risks in Online Self-Disclosures with Language ModelsLong19 citations
  391. Revisiting Knowledge Distillation for Autoregressive Language ModelsLong19 citations
  392. Unveiling Selection Biases: Exploring Order and Token Sensitivity in Large Language ModelsFindings19 citations
  393. ViSAGe: A Global-Scale Analysis of Visual Stereotypes in Text-to-Image GenerationLong19 citations
  394. A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning TaskFindings18 citations
  395. BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting EvidenceFindings18 citations
  396. Call Me When Necessary: LLMs can Efficiently and Faithfully Reason over Structured EnvironmentsFindings18 citations
  397. DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized DocumentsLong18 citations
  398. Empowering cross-lingual abilities of instruction-tuned large language models by translation-following demonstrationsFindings18 citations
  399. Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool UseLong18 citations
  400. Found in the middle: Calibrating Positional Attention Bias Improves Long Context UtilizationFindings18 citations
  401. Instruction Position Matters in Sequence Generation with Large Language ModelsFindings18 citations
  402. Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language ModelsLong18 citations
  403. Multimodal Instruction Tuning with Conditional Mixture of LoRALong18 citations
  404. OpenWebAgent: An Open Toolkit to Enable Web Agents on Large Language ModelsSystem Demonstrations18 citations
  405. Parrot: Enhancing Multi-Turn Instruction Following for Large Language ModelsLong18 citations
  406. Planning Like Human: A Dual-process Framework for Dialogue PlanningLong18 citations
  407. Towards Faithful and Robust LLM Specialists for Evidence-Based Question-AnsweringLong18 citations
  408. Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI FeedbackLong18 citations
  409. A Survey on Predicting the Factuality and the Bias of News MediaFindings17 citations
  410. An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language ModelsFindings17 citations
  411. Attribute First, then Generate: Locally-attributable Grounded Text GenerationLong17 citations
  412. Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context LearningFindings17 citations
  413. Can Language Models Serve as Text-Based World Simulators?Short17 citations
  414. CausalGym: Benchmarking causal interpretability methods on linguistic tasksLong17 citations
  415. Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt DistillationLong17 citations
  416. DocFinQA: A Long-Context Financial Reasoning DatasetShort17 citations
  417. Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!Long17 citations
  418. Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and CorrectionFindings17 citations
  419. GenTranslate: Large Language Models are Generative Multilingual Speech and Machine TranslatorsLong17 citations
  420. Generalizing Conversational Dense Retrieval via LLM-Cognition Data AugmentationLong17 citations
  421. History-Aware Conversational Dense RetrievalFindings17 citations
  422. Instruction-tuned Language Models are Better Knowledge LearnersLong17 citations
  423. LLMFactor: Extracting Profitable Factors through Prompts for Explainable Stock Movement PredictionFindings17 citations
  424. Model Editing by Standard Fine-TuningFindings17 citations
  425. Moûsai: Efficient Text-to-Music Diffusion ModelsLong17 citations
  426. PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language ModelsLong17 citations
  427. ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-TrainingLong17 citations
  428. RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated AdapterFindings17 citations
  429. ResLoRA: Identity Residual Mapping in Low-Rank AdaptionFindings17 citations
  430. StepCoder: Improving Code Generation with Reinforcement Learning from Compiler FeedbackLong17 citations
  431. TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human FeedbackFindings17 citations
  432. TextBind: Multi-turn Interleaved Multimodal Instruction-following in the WildFindings17 citations
  433. Time is Encoded in the Weights of Finetuned Language ModelsLong17 citations
  434. To Generate or to Retrieve? On the Effectiveness of Artificial Contexts for Medical Open-Domain Question AnsweringLong17 citations
  435. Towards the TopMost: A Topic Modeling System ToolkitSystem Demonstrations17 citations
  436. Training Language Models to Generate Text with Citations via Fine-grained RewardsLong17 citations
  437. Two-stage Generative Question Answering on Temporal Knowledge Graph Using Large Language ModelsFindings17 citations
  438. Word Embeddings Are Steers for Language ModelsLong17 citations
  439. Wordflow: Social Prompt Engineering for Large Language ModelsSystem Demonstrations17 citations
  440. AFaCTA: Assisting the Annotation of Factual Claim Detection with Reliable LLM AnnotatorsLong16 citations
  441. Advancing Parameter Efficiency in Fine-tuning via Representation EditingLong16 citations
  442. Analyzing Temporal Complex Events with Large Language Models? A Benchmark towards Temporal, Long Context UnderstandingLong16 citations
  443. AoE: Angle-optimized Embeddings for Semantic Textual SimilarityLong16 citations
  444. CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs’ Mathematical Reasoning CapabilitiesFindings16 citations
  445. CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction FollowingLong16 citations
  446. CoLLaVO: Crayon Large Language and Vision mOdelFindings16 citations
  447. CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual ExamplesFindings16 citations
  448. GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient AnalysisLong16 citations
  449. Grounding Language Model with Chunking-Free In-Context RetrievalLong16 citations
  450. INTERS: Unlocking the Power of Large Language Models in Search with Instruction TuningLong16 citations
  451. IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic LanguagesLong16 citations
  452. Interpretable User Satisfaction Estimation for Conversational Systems with Large Language ModelsLong16 citations
  453. KorNAT: LLM Alignment Benchmark for Korean Social Values and Common KnowledgeFindings16 citations
  454. LANS: A Layout-Aware Neural Solver for Plane Geometry ProblemFindings16 citations
  455. LLMs as Bridges: Reformulating Grounded Multimodal Named Entity RecognitionFindings16 citations
  456. LangBridge: Multilingual Reasoning Without Multilingual SupervisionLong16 citations
  457. Learn or Recall? Revisiting Incremental Learning with Pre-trained Language ModelsLong16 citations
  458. MinPrompt: Graph-based Minimal Prompt Data Augmentation for Few-shot Question AnsweringLong16 citations
  459. MuggleMath: Assessing the Impact of Query and Response Augmentation on Math ReasoningLong16 citations
  460. Never Lost in the Middle: Mastering Long-Context Question Answering with Position-Agnostic Decompositional TrainingLong16 citations
  461. PPTC Benchmark: Evaluating Large Language Models for PowerPoint Task CompletionFindings16 citations
  462. Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical NotesFindings16 citations
  463. RDRec: Rationale Distillation for LLM-based RecommendationShort16 citations
  464. Temporal Knowledge Question Answering via Abstract Reasoning InductionLong16 citations
  465. Unlocking the Power of Large Language Models for Entity AlignmentLong16 citations
  466. Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model PerformanceFindings16 citations
  467. k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated TextFindings16 citations
  468. AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data FiltersLong15 citations
  469. Angry Men, Sad Women: Large Language Models Reflect Gendered Stereotypes in Emotion AttributionLong15 citations
  470. BatchEval: Towards Human-like Text EvaluationLong15 citations
  471. Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial StatementsFindings15 citations
  472. Competition of Mechanisms: Tracing How Language Models Handle Facts and CounterfactualsLong15 citations
  473. DUAL-REFLECT: Enhancing Large Language Models for Reflective Translation through Dual Learning Feedback MechanismsShort15 citations
  474. Deciphering Digital Detectives: Understanding LLM Behaviors and Capabilities in Multi-Agent Mystery GamesFindings15 citations
  475. DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank DistributionLong15 citations
  476. ECBD: Evidence-Centered Benchmark Design for NLPLong15 citations
  477. Exploring Precision and Recall to assess the quality and diversity of LLMsLong15 citations
  478. Investigating Multi-Hop Factual Shortcuts in Knowledge Editing of Large Language ModelsLong15 citations
  479. Is Table Retrieval a Solved Problem? Exploring Join-Aware Multi-Table RetrievalLong15 citations
  480. Learning to Generate Instruction Tuning Datasets for Zero-Shot Task AdaptationFindings15 citations
  481. ListT5: Listwise Reranking with Fusion-in-Decoder Improves Zero-shot RetrievalLong15 citations
  482. LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative TasksLong15 citations
  483. MPCoder: Multi-user Personalized Code Generator with Explicit and Implicit Style Representation LearningLong15 citations
  484. MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language ModelingLong15 citations
  485. Making Harmful Behaviors Unlearnable for Large Language ModelsFindings15 citations
  486. Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language ModelsLong15 citations
  487. Measuring Bargaining Abilities of LLMs: A Benchmark and A Buyer-Enhancement MethodFindings15 citations
  488. Meta-Task Prompting Elicits Embeddings from Large Language ModelsLong15 citations
  489. Narrowing the Knowledge Evaluation Gap: Open-Domain Question Answering with Multi-Granularity AnswersLong15 citations
  490. Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 BenchmarkLong15 citations
  491. Probing the Emergence of Cross-lingual Alignment during LLM TrainingFindings15 citations
  492. ProtT3: Protein-to-Text Generation for Text-based Protein UnderstandingLong15 citations
  493. Set the Clock: Temporal Alignment of Pretrained Language ModelsFindings15 citations
  494. SocialBench: Sociality Evaluation of Role-Playing Conversational AgentsFindings15 citations
  495. TELLER: A Trustworthy Framework for Explainable, Generalizable and Controllable Fake News DetectionFindings15 citations
  496. The Counterfeit Conundrum: Can Code Language Models Grasp the Nuances of Their Incorrect Generations?Findings15 citations
  497. Towards Privacy-Aware Sign Language Translation at ScaleLong15 citations
  498. Whose Emotions and Moral Sentiments do Language Models Reflect?Findings15 citations
  499. AFLoRA: Adaptive Freezing of Low Rank Adaptation in Parameter Efficient Fine-Tuning of Large ModelsShort14 citations
  500. Anchor-based Large Language ModelsFindings14 citations
  501. Benchmarking Data Science AgentsLong14 citations
  502. DMoERM: Recipes of Mixture-of-Experts for Effective Reward ModelingFindings14 citations
  503. Dataflow-Guided Retrieval Augmentation for Repository-Level Code CompletionLong14 citations
  504. Empowering Large Language Models for Textual Data AugmentationFindings14 citations
  505. FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal ModelLong14 citations
  506. HealMe: Harnessing Cognitive Reframing in Large Language Models for PsychotherapyLong14 citations
  507. ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value ExtractionFindings14 citations
  508. Jailbreak Open-Sourced Large Language Models via Enforced DecodingLong14 citations
  509. Learning Fine-Grained Grounded Citations for Attributed Large Language ModelsFindings14 citations
  510. Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?Long14 citations
  511. Multimodal Reasoning with Multimodal Knowledge GraphLong14 citations
  512. PACE: Improving Prompt with Actor-Critic Editing for Large Language ModelFindings14 citations
  513. PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action ChainFindings14 citations
  514. Propagation and Pitfalls: Reasoning-based Assessment of Knowledge Editing through Counterfactual TasksFindings14 citations
  515. Rewriting the Code: A Simple Method for Large Language Model Augmented Code SearchLong14 citations
  516. SciMMIR: Benchmarking Scientific Multi-modal Information RetrievalFindings14 citations
  517. StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task LearningLong14 citations
  518. TextEE: Benchmark, Reevaluation, Reflections, and Future Challenges in Event ExtractionFindings14 citations
  519. The Knowledge Alignment Problem: Bridging Human and External Knowledge for Large Language ModelsFindings14 citations
  520. ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language ModelsLong14 citations
  521. What Does the Bot Say? Opportunities and Risks of Large Language Models in Social Media Bot DetectionLong14 citations
  522. A Chain-of-Thought Is as Strong as Its Weakest Link: A Benchmark for Verifiers of Reasoning ChainsLong13 citations
  523. Analysing The Impact of Sequence Composition on Language Model Pre-TrainingLong13 citations
  524. Are Decoder-Only Language Models Better than Encoder-Only Language Models in Understanding Word Meaning?Findings13 citations
  525. Ask Again, Then Fail: Large Language Models’ Vacillations in JudgmentLong13 citations
  526. Automated Focused Feedback Generation for Scientific Writing AssistanceFindings13 citations
  527. BizBench: A Quantitative Reasoning Benchmark for Business and FinanceLong13 citations
  528. Cache & Distil: Optimising API Calls to Large Language ModelsFindings13 citations
  529. Chain of Logic: Rule-Based Reasoning with Large Language ModelsFindings13 citations
  530. ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language ModelsFindings13 citations
  531. Deciphering Oracle Bone Language with Diffusion ModelsLong13 citations
  532. Deductive Closure Training of Language Models for Coherence, Accuracy, and UpdatabilityFindings13 citations
  533. Dialogue Summarization with Mixture of Experts based on Large Language ModelsLong13 citations
  534. EX-FEVER: A Dataset for Multi-hop Explainable Fact VerificationFindings13 citations
  535. Effects of diversity incentives on sample diversity and downstream model performance in LLM-based text augmentationLong13 citations
  536. FinanceMATH: Knowledge-Intensive Math Reasoning in Finance DomainsLong13 citations
  537. Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report GenerationLong13 citations
  538. HQP: A Human-Annotated Dataset for Detecting Online PropagandaFindings13 citations
  539. How Vocabulary Sharing Facilitates Multilingualism in LLaMA?Findings13 citations
  540. IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code GeneratorsLong13 citations
  541. LLM Performance Predictors are good initializers for Architecture SearchFindings13 citations
  542. LLaST: Improved End-to-end Speech Translation System Leveraged by Large Language ModelsFindings13 citations
  543. Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task ArithmeticLong13 citations
  544. Large Language Models for Automated Open-domain Scientific Hypotheses DiscoveryFindings13 citations
  545. Learning to Plan and Generate Text with CitationsLong13 citations
  546. Leveraging Large Language Models for Learning Complex Legal Concepts through StorytellingLong13 citations
  547. MARS: Meaning-Aware Response Scoring for Uncertainty Estimation in Generative LLMsLong13 citations
  548. MAVEN-ARG: Completing the Puzzle of All-in-One Event Understanding Dataset with Event Argument AnnotationLong13 citations
  549. Modality-Aware Integration with Large Language Models for Knowledge-Based Visual Question AnsweringLong13 citations
  550. Modeling Dynamic Topics in Chain-Free Fashion by Evolution-Tracking Contrastive Learning and Unassociated Word ExclusionFindings13 citations
  551. NACL: A General and Effective KV Cache Eviction Framework for LLM at Inference TimeLong13 citations
  552. PLUG: Leveraging Pivot Language in Cross-Lingual Instruction TuningLong13 citations
  553. Parallel Structures in Pre-training Data Yield In-Context LearningLong13 citations
  554. Plum: Prompt Learning using MetaheuristicsFindings13 citations
  555. Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language ModelsLong13 citations
  556. RePair: Automated Program Repair with Process-based FeedbackFindings13 citations
  557. Rethinking Negative Instances for Generative Named Entity RecognitionFindings13 citations
  558. SirLLM: Streaming Infinite Retentive LLMLong13 citations
  559. Soft Self-Consistency Improves Language Models AgentsShort13 citations
  560. Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language ModelsFindings13 citations
  561. TURNA: A Turkish Encoder-Decoder Language Model for Enhanced Understanding and GenerationFindings13 citations
  562. Teaching Large Language Models an Unseen Language on the FlyFindings13 citations
  563. TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware SimulationLong13 citations
  564. ULTRA: Unleash LLMs’ Potential for Event Argument Extraction through Hierarchical Modeling and Pair-wise Self-RefinementFindings13 citations
  565. UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMsSystem Demonstrations13 citations
  566. Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data SelectionFindings13 citations
  567. A Chinese Dataset for Evaluating the Safeguards in Large Language ModelsFindings12 citations
  568. Aligning Large Language Models for Controllable RecommendationsLong12 citations
  569. An Information Bottleneck Perspective for Effective Noise Filtering on Retrieval-Augmented GenerationLong12 citations
  570. Bypassing LLM Watermarks with Color-Aware SubstitutionsLong12 citations
  571. CIDAR: Culturally Relevant Instruction Dataset For ArabicFindings12 citations
  572. Contrastive Instruction TuningFindings12 citations
  573. Detoxifying Large Language Models via Knowledge EditingLong12 citations
  574. Dissecting Human and LLM PreferencesLong12 citations
  575. EmpathyEar: An Open-source Avatar Multimodal Empathetic ChatbotSystem Demonstrations12 citations
  576. Generalized Category Discovery with Large Language Models in the LoopFindings12 citations
  577. Greed is All You Need: An Evaluation of Tokenizer Inference MethodsShort12 citations
  578. HOLMES: Hyper-Relational Knowledge Graphs for Multi-hop Question Answering using LLMsLong12 citations
  579. Here’s a Free Lunch: Sanitizing Backdoored Models with Model MergeFindings12 citations
  580. Investigating the Impact of Data Contamination of Large Language Models in Text-to-SQL translationFindings12 citations
  581. LLMs Learn Task Heuristics from Demonstrations: A Heuristic-Driven Prompting Strategy for Document-Level Event Argument ExtractionLong12 citations
  582. Length Generalization of Causal Transformers without Position EncodingFindings12 citations
  583. LinkTransformer: A Unified Package for Record Linkage with Transformer Language ModelsSystem Demonstrations12 citations
  584. LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style PluginLong12 citations
  585. MERA: A Comprehensive LLM Evaluation in RussianLong12 citations
  586. PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual PatternsFindings12 citations
  587. Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMsLong12 citations
  588. Rethinking Task-Oriented Dialogue Systems: From Complex Modularity to Zero-Shot Autonomous AgentLong12 citations
  589. Self-chats from Large Language Models Make Small Emotional Support Chatbot BetterLong12 citations
  590. Spectral Filters, Dark Signals, and Attention SinksLong12 citations
  591. Spiral of Silence: How is Large Language Model Killing Information Retrieval?—A Case Study on Open Domain Question AnsweringLong12 citations
  592. Stealthy Attack on Large Language Model based RecommendationLong12 citations
  593. StyleDubber: Towards Multi-Scale Style Learning for Movie DubbingFindings12 citations
  594. TaPERA: Enhancing Faithfulness and Interpretability in Long-Form Table QA by Content Planning and Execution-based ReasoningLong12 citations
  595. TasTe: Teaching Large Language Models to Translate through Self-ReflectionLong12 citations
  596. Text Embedding Inversion Security for Multilingual Language ModelsLong12 citations
  597. The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language ModelsShort12 citations
  598. Understanding the Impacts of Language Technologies’ Performance Disparities on African American Language SpeakersFindings12 citations
  599. What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German DialectsShort12 citations
  600. ANAH: Analytical Annotation of Hallucinations in Large Language ModelsLong11 citations
  601. An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language ModelsFindings11 citations
  602. Analyzing Semantic Change through Lexical ReplacementsLong11 citations
  603. AttributionBench: How Hard is Automatic Attribution Evaluation?Findings11 citations
  604. Balancing Speciality and Versatility: a Coarse to Fine Framework for Supervised Fine-tuning Large Language ModelFindings11 citations
  605. Benchmarking Knowledge Boundary for Large Language Models: A Different Perspective on Model EvaluationLong11 citations
  606. CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language ModelsFindings11 citations
  607. Causal Estimation of Memorisation ProfilesLong11 citations
  608. Cendol: Open Instruction-tuned Generative Large Language Models for Indonesian LanguagesLong11 citations
  609. Context versus Prior Knowledge in Language ModelsLong11 citations
  610. Context-aware Difference Distilling for Multi-change CaptioningLong11 citations
  611. Detection-Correction Structure via General Language Model for Grammatical Error CorrectionLong11 citations
  612. Differentially Private Knowledge Distillation via Synthetic Text GenerationFindings11 citations
  613. Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language ModelsLong11 citations
  614. EWEK-QA : Enhanced Web and Efficient Knowledge Graph Retrieval for Citation-based Question Answering SystemsLong11 citations
  615. Event-Radar: Event-driven Multi-View Learning for Multimodal Fake News DetectionLong11 citations
  616. Examining the robustness of LLM evaluation to the distributional assumptions of benchmarksLong11 citations
  617. Factual Confidence of LLMs: on Reliability and Robustness of Current EstimatorsLong11 citations
  618. Fine-Tuned Machine Translation Metrics Struggle in Unseen DomainsShort11 citations
  619. FlowVQA: Mapping Multimodal Logic in Visual Question Answering with FlowchartsFindings11 citations
  620. HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria DecompositionLong11 citations
  621. IBSEN: Director-Actor Agent Collaboration for Controllable and Interactive Drama Script GenerationLong11 citations
  622. IMBUE: Improving Interpersonal Effectiveness through Simulation and Just-in-time Feedback with Human-Language Model InteractionLong11 citations
  623. Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language ModelsLong11 citations
  624. LoRA Meets Dropout under a Unified FrameworkFindings11 citations
  625. Looking Right is Sometimes Right: Investigating the Capabilities of Decoder-only LLMs for Sequence LabelingFindings11 citations
  626. Marathon: A Race Through the Realm of Long Context with Large Language ModelsLong11 citations
  627. Meta-Reasoning: Semantics-Symbol Deconstruction for Large Language ModelsFindings11 citations
  628. Mitigating Boundary Ambiguity and Inherent Bias for Text Classification in the Era of Large Language ModelsFindings11 citations
  629. Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language ModelsLong11 citations
  630. Peacock: A Family of Arabic Multimodal Large Language Models and BenchmarksLong11 citations
  631. PsychoGAT: A Novel Psychological Measurement Paradigm through Interactive Fiction Games with LLM AgentsLong11 citations
  632. ReLiK: Retrieve and LinK, Fast and Accurate Entity Linking and Relation Extraction on an Academic BudgetFindings11 citations
  633. Reasons to Reject? Aligning Language Models with JudgmentsFindings11 citations
  634. Self-Training with Direct Preference Optimization Improves Chain-of-Thought ReasoningLong11 citations
  635. Speculative Contrastive DecodingShort11 citations
  636. Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?Long11 citations
  637. ToMBench: Benchmarking Theory of Mind in Large Language ModelsLong11 citations
  638. VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language ModelsFindings11 citations
  639. VillagerAgent: A Graph-Based Multi-Agent Framework for Coordinating Complex Task Dependencies in MinecraftFindings11 citations
  640. XCodeEval: An Execution-based Large Scale Multilingual Multitask Benchmark for Code Understanding, Generation, Translation and RetrievalLong11 citations
  641. A Glitch in the Matrix? Locating and Detecting Language Model Grounding with FakepediaLong10 citations
  642. A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Any TranslationLong10 citations
  643. A synthetic data approach for domain generalization of NLI modelsLong10 citations
  644. Aligning Large Language Models by On-Policy Self-JudgmentLong10 citations
  645. Analyze, Generate and Refine: Query Expansion with LLMs for Zero-Shot Open-Domain QAFindings10 citations
  646. Answer is All You Need: Instruction-following Text Embedding via Answering the QuestionLong10 citations
  647. Beyond Traditional Benchmarks: Analyzing Behaviors of Open LLMs on Data-to-Text GenerationLong10 citations
  648. Blinded by Generated Contexts: How Language Models Merge Generated and Retrieved Contexts When Knowledge Conflicts?Long10 citations
  649. Complex Reasoning over Logical Queries on Commonsense Knowledge GraphsLong10 citations
  650. Debatrix: Multi-dimensional Debate Judge with Iterative Chronological Analysis Based on LLMFindings10 citations
  651. Direct Evaluation of Chain-of-Thought in Multi-hop Reasoning with Knowledge GraphsFindings10 citations
  652. Duwak: Dual Watermarks in Large Language ModelsFindings10 citations
  653. Efficient OCR for Building a Diverse Digital HistoryLong10 citations
  654. Enhancing Dialogue State Tracking Models through LLM-backed User-Agents SimulationLong10 citations
  655. Evaluating Large Language Models on Wikipedia-Style Survey GenerationFindings10 citations
  656. Explore Spurious Correlations at the Concept Level in Language Models for Text ClassificationLong10 citations
  657. FactPICO: Factuality Evaluation for Plain Language Summarization of Medical EvidenceLong10 citations
  658. FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language ModelsShort10 citations
  659. FinTextQA: A Dataset for Long-form Financial Question AnsweringLong10 citations
  660. GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trickLong10 citations
  661. HOTVCOM: Generating Buzzworthy Comments for VideosFindings10 citations
  662. Improving Machine Translation with Large Language Models: A Preliminary Study with Cooperative DecodingFindings10 citations
  663. IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian LanguagesLong10 citations
  664. Inference to the Best Explanation in Large Language ModelsLong10 citations
  665. Iterative Forward Tuning Boosts In-Context Learning in Language ModelsLong10 citations
  666. Knowledge Fusion By Evolving Weights of Language ModelsFindings10 citations
  667. LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language TextsLong10 citations
  668. LPNL: Scalable Link Prediction with Large Language ModelsFindings10 citations
  669. Large Language Models Relearn Removed ConceptsFindings10 citations
  670. Learnable Privacy Neurons Localization in Language ModelsShort10 citations
  671. Making Long-Context Language Models Better Multi-Hop ReasonersLong10 citations
  672. Metaphor Understanding Challenge Dataset for LLMsLong10 citations
  673. Missci: Reconstructing Fallacies in Misrepresented ScienceLong10 citations
  674. MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot DetectorFindings10 citations
  675. Multi-Level Feedback Generation with Large Language Models for Empowering Novice Peer CounselorsLong10 citations
  676. OPEx: A Component-Wise Analysis of LLM-Centric Agents in Embodied Instruction FollowingLong10 citations
  677. On the Impact of Calibration Data in Post-training Quantization and PruningLong10 citations
  678. On the Representational Capacity of Neural Language Models with Chain-of-Thought ReasoningLong10 citations
  679. PRewrite: Prompt Rewriting with Reinforcement LearningShort10 citations
  680. Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation DatasetFindings10 citations
  681. Prompt Expansion for Adaptive Text-to-Image GenerationLong10 citations
  682. RECOST: External Knowledge Guided Data-efficient Instruction TuningFindings10 citations
  683. RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language ModelsLong10 citations
  684. RefuteBench: Evaluating Refuting Instruction-Following for Large Language ModelsFindings10 citations
  685. Revisiting Code Similarity Evaluation with Abstract Syntax Tree Edit DistanceShort10 citations
  686. STAR: Constraint LoRA with Dynamic Active Learning for Data-Efficient Fine-Tuning of Large Language ModelsFindings10 citations
  687. SemRel2024: A Collection of Semantic Textual Relatedness Datasets for 13 LanguagesFindings10 citations
  688. SenticVec: Toward Robust and Human-Centric Neurosymbolic Sentiment AnalysisFindings10 citations
  689. Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language ModelsLong10 citations
  690. Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMsFindings10 citations
  691. The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language ModelsFindings10 citations
  692. Truth-Aware Context Selection: Mitigating Hallucinations of Large Language Models Being Misled by Untruthful ContextsFindings10 citations
  693. UNIMO-G: Unified Image Generation through Multimodal Conditional DiffusionLong10 citations
  694. Unveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to RemediationFindings10 citations
  695. VariErr NLI: Separating Annotation Error from Human Label VariationLong10 citations
  696. When to Trust LLMs: Aligning Confidence with Response QualityFindings10 citations
  697. mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and HumansFindings10 citations
  698. mCoT: Multilingual Instruction Tuning for Reasoning Consistency in Language ModelsLong10 citations
  699. ARL2: Aligning Retrievers with Black-box Large Language Models via Self-guided Adaptive Relevance LabelingLong9 citations
  700. Analyzing LLM Behavior in Dialogue Summarization: Unveiling Circumstantial Hallucination TrendsLong9 citations
  701. CAUSE: Counterfactual Assessment of User Satisfaction Estimation in Task-Oriented Dialogue SystemsFindings9 citations
  702. Chat Vector: A Simple Approach to Equip LLMs with Instruction Following and Model Alignment in New LanguagesLong9 citations
  703. Cheetah: Natural Language Generation for 517 African LanguagesLong9 citations
  704. Chunk, Align, Select: A Simple Long-sequence Processing Method for TransformersLong9 citations
  705. CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal ModelsLong9 citations
  706. Controlled Text Generation for Large Language Model with Dynamic Attribute GraphsFindings9 citations
  707. Countering Reward Over-Optimization in LLM with Demonstration-Guided Reinforcement LearningFindings9 citations
  708. CycleAlign: Iterative Distillation from Black-box LLM to White-box Models for Better Human AlignmentFindings9 citations
  709. Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?Findings9 citations
  710. Efficient Knowledge Infusion via KG-LLM AlignmentFindings9 citations
  711. EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language ModelsShort9 citations
  712. EmpathicStories++: A Multimodal Dataset for Empathy Towards Personal ExperiencesFindings9 citations
  713. Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich LanguagesLong9 citations
  714. Evaluating Large Language Models for Health-related Queries with PresuppositionsFindings9 citations
  715. Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language ModelsFindings9 citations
  716. G-DIG: Towards Gradient-based DIverse and hiGh-quality Instruction Data Selection for Machine TranslationLong9 citations
  717. GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem SolversLong9 citations
  718. Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct DecodingFindings9 citations
  719. Harder Task Needs More Experts: Dynamic Routing in MoE ModelsLong9 citations
  720. Improving Attributed Text Generation of Large Language Models via Preference LearningFindings9 citations
  721. Integrate the Essence and Eliminate the Dross: Fine-Grained Self-Consistency for Free-Form Language GenerationLong9 citations
  722. Interpreting Conversational Dense Retrieval by Rewriting-Enhanced Inversion of Session EmbeddingLong9 citations
  723. LEGENT: Open Platform for Embodied AgentsSystem Demonstrations9 citations
  724. LLM Factoscope: Uncovering LLMs’ Factual Discernment through Measuring Inner StatesFindings9 citations
  725. Large Language Models Fall Short: Understanding Complex Relationships in Detective NarrativesFindings9 citations
  726. Learning to Maximize Mutual Information for Chain-of-Thought DistillationFindings9 citations
  727. Linear-time Minimum Bayes Risk Decoding with Reference AggregationShort9 citations
  728. Mirror: Multiple-perspective Self-Reflection Method for Knowledge-rich ReasoningLong9 citations
  729. Monotonic Representation of Numeric Attributes in Language ModelsShort9 citations
  730. Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?Long9 citations
  731. ODA: Observation-Driven Agent for integrating LLMs and Knowledge GraphsFindings9 citations
  732. OOP: Object-Oriented Programming Evaluation Benchmark for Large Language ModelsFindings9 citations
  733. On the Role of Long-tail Knowledge in Retrieval Augmented Large Language ModelsShort9 citations
  734. Paying More Attention to Source Context: Mitigating Unfaithful Translations from Large Language ModelFindings9 citations
  735. Pushing the Limits of Zero-shot End-to-End Speech TranslationFindings9 citations
  736. REANO: Optimising Retrieval-Augmented Reader Models through Knowledge Graph GenerationLong9 citations
  737. Reasoning in Flux: Enhancing Large Language Models Reasoning through Uncertainty-aware Adaptive GuidanceLong9 citations
  738. Resonance RoPE: Improving Context Length Generalization of Large Language ModelsFindings9 citations
  739. Retrieval-Augmented Retrieval: Large Language Models are Strong Zero-Shot RetrieverFindings9 citations
  740. SoFA: Shielded On-the-fly Alignment via Priority Rule FollowingFindings9 citations
  741. Synergizing Large Language Models and Pre-Trained Smaller Models for Conversational Intent DiscoveryFindings9 citations
  742. The Echoes of Multilinguality: Tracing Cultural Value Shifts during Language Model Fine-tuningLong9 citations
  743. Towards Uncertainty-Aware Language AgentFindings9 citations
  744. TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head TranslationFindings9 citations
  745. Transparent and Scrutable Recommendations Using Natural Language User ProfilesLong9 citations
  746. ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language ModelsFindings9 citations
  747. What Do Language Models Learn in Context? The Structured Task Hypothesis.Long9 citations
  748. What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular LanguagesLong9 citations
  749. 3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document UnderstandingFindings8 citations
  750. AbsInstruct: Eliciting Abstraction Ability from LLMs through Explanation Tuning with Plausibility EstimationLong8 citations
  751. Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language ModelsFindings8 citations
  752. An Expert is Worth One Token: Synergizing Multiple Expert LLMs as Generalist via Expert Token RoutingLong8 citations
  753. An LLM-based Knowledge Synthesis and Scientific Reasoning Framework for Biomedical DiscoverySystem Demonstrations8 citations
  754. Ask LLMs Directly, “What shapes your bias?”: Measuring Social Bias in Large Language ModelsFindings8 citations
  755. Balanced Data Sampling for Language Model Training with ClusteringFindings8 citations
  756. Benchmarking Large Language Models on CFLUE - A Chinese Financial Language Understanding Evaluation DatasetFindings8 citations
  757. Book2Dial: Generating Teacher Student Interactions from Textbooks for Cost-Effective Development of Educational ChatbotsFindings8 citations
  758. CHIME: LLM-Assisted Hierarchical Organization of Scientific Studies for Literature Review SupportFindings8 citations
  759. CODIS: Benchmarking Context-dependent Visual Comprehension for Multimodal Large Language ModelsLong8 citations
  760. CToolEval: A Chinese Benchmark for LLM-Powered Agent Evaluation in Real-World API InteractionsFindings8 citations
  761. Can Large Language Model Summarizers Adapt to Diverse Scientific Communication Goals?Findings8 citations
  762. Chain-of-Exemplar: Enhancing Distractor Generation for Multimodal Educational Question GenerationLong8 citations
  763. Chinese MentalBERT: Domain-Adaptive Pre-training on Social Media for Chinese Mental Health Text AnalysisFindings8 citations
  764. Cocktail: A Comprehensive Information Retrieval Benchmark with LLM-Generated Documents IntegrationFindings8 citations
  765. Code Needs Comments: Enhancing Code LLMs with Comment AugmentationFindings8 citations
  766. Confidence is not Timeless: Modeling Temporal Validity for Rule-based Temporal Knowledge Graph ForecastingLong8 citations
  767. Data Contamination Calibration for Black-box LLMsFindings8 citations
  768. Demonstration Augmentation for Zero-shot In-context LearningFindings8 citations
  769. Diffusion Lens: Interpreting Text Encoders in Text-to-Image PipelinesLong8 citations
  770. Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax ReductionFindings8 citations
  771. Eliciting Better Multilingual Structured Reasoning from LLMs through CodeLong8 citations
  772. Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented ApproachFindings8 citations
  773. Expedited Training of Visual Conditioned Language Generation via Redundancy ReductionLong8 citations
  774. From Moments to Milestones: Incremental Timeline Summarization Leveraging Large Language ModelsLong8 citations
  775. Getting Serious about Humor: Crafting Humor Datasets with Unfunny Large Language ModelsShort8 citations
  776. Hire a Linguist!: Learning Endangered Languages in LLMs with In-Context Linguistic DescriptionsFindings8 citations
  777. HyperMoE: Towards Better Mixture of Experts via Transferring Among ExpertsLong8 citations
  778. Improving Large Language Models in Event Relation Logical PredictionLong8 citations
  779. IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian LanguagesFindings8 citations
  780. Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for DialogueLong8 citations
  781. InterrogateLLM: Zero-Resource Hallucination Detection in LLM-Generated AnswersLong8 citations
  782. ItD: Large Language Models Can Teach Themselves Induction through DeductionLong8 citations
  783. LLMCrit: Teaching Large Language Models to Use CriteriaFindings8 citations
  784. LM Transparency Tool: Interactive Tool for Analyzing Transformer Language ModelsSystem Demonstrations8 citations
  785. MAPLE: Multilingual Evaluation of Parameter Efficient Finetuning of Large Language ModelsFindings8 citations
  786. MLeVLM: Improve Multi-level Progressive Capabilities based on Multimodal Large Language Model for Medical Visual Question AnsweringFindings8 citations
  787. Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask LearnersLong8 citations
  788. MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-SpeechLong8 citations
  789. Multi-modal Stance Detection: New Datasets and ModelFindings8 citations
  790. Must NLP be Extractive?Long8 citations
  791. One Prompt To Rule Them All: LLMs for Opinion Summary EvaluationLong8 citations
  792. PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the CloudSystem Demonstrations8 citations
  793. Peering into the Mind of Language Models: An Approach for Attribution in Contextual Question AnsweringFindings8 citations
  794. Planning First, Question Second: An LLM-Guided Method for Controllable Question GenerationFindings8 citations
  795. ProgGen: Generating Named Entity Recognition Datasets Step-by-step with Self-Reflexive Large Language ModelsFindings8 citations
  796. QueryAgent: A Reliable and Efficient Reasoning Framework with Environmental Feedback based Self-CorrectionLong8 citations
  797. ReactXT: Understanding Molecular “Reaction-ship” via Reaction-Contextualized Molecule-Text PretrainingFindings8 citations
  798. SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge GraphLong8 citations
  799. SEER: Facilitating Structured Reasoning and Explanation via Reinforcement LearningLong8 citations
  800. STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language ModelsFindings8 citations
  801. STICKERCONV: Generating Multimodal Empathetic Responses from ScratchLong8 citations
  802. Se2: Sequential Example Selection for In-Context LearningFindings8 citations
  803. SeeGULL Multilingual: a Dataset of Geo-Culturally Situated StereotypesShort8 citations
  804. SportsMetrics: Blending Text and Numerical Data to Understand Information Fusion in LLMsLong8 citations
  805. StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice ConversionLong8 citations
  806. Synchronized Video Storytelling: Generating Video Narrations with Structured StorylineLong8 citations
  807. TaSL: Continual Dialog State Tracking via Task Skill Localization and ConsolidationLong8 citations
  808. TaxoLLaMA: WordNet-based Model for Solving Multiple Lexical Semantic TasksLong8 citations
  809. The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language ModelsLong8 citations
  810. TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models’ Theory-of-MindFindings8 citations
  811. TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language ModelsLong8 citations
  812. Understanding the Effects of Noise in Text-to-SQL: An Examination of the BIRD-Bench BenchmarkShort8 citations
  813. Using Natural Language Explanations to Improve Robustness of In-context LearningLong8 citations
  814. Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data PerspectivesFindings8 citations
  815. What Do Language Models Hear? Probing for Auditory Representations in Language ModelsLong8 citations
  816. What is the Best Way for ChatGPT to Translate Poetry?Long8 citations
  817. When Good and Reproducible Results are a Giant with Feet of Clay: The Importance of Software Quality in NLPLong8 citations
  818. X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual InstructionsFindings8 citations
  819. Your Transformer is Secretly LinearLong8 citations
  820. string2string: A Modern Python Library for String-to-String AlgorithmsSystem Demonstrations8 citations
  821. A Semantic Distance Metric Learning approach for Lexical Semantic Change DetectionFindings7 citations
  822. A Two-Stage Adaptation of Large Language Models for Text RankingFindings7 citations
  823. An Iterative Associative Memory Model for Empathetic Response GenerationLong7 citations
  824. Are Machines Better at Complex Reasoning? Unveiling Human-Machine Inference Gaps in Entailment VerificationFindings7 citations
  825. Automated Justification Production for Claim Veracity in Fact Checking: A Survey on Architectures and ApproachesLong7 citations
  826. Both Matter: Enhancing the Emotional Intelligence of Large Language Models without Compromising the General IntelligenceFindings7 citations
  827. CLOMO: Counterfactual Logical Modification with Large Language ModelsLong7 citations
  828. Can Large Multimodal Models Uncover Deep Semantics Behind Images?Findings7 citations
  829. Can You Learn Semantics Through Next-Word Prediction? The Case of EntailmentFindings7 citations
  830. CeeBERT: Cross-Domain Inference in Early Exit BERTFindings7 citations
  831. Characterizing Large Language Models as Rationalizers of Knowledge-intensive TasksFindings7 citations
  832. Continual Learning with Semi-supervised Contrastive Distillation for Incremental Neural Machine TranslationLong7 citations
  833. Controllable Text Summarization: Unraveling Challenges, Approaches, and Prospects - A SurveyFindings7 citations
  834. DEBATE: Devil’s Advocate-Based Assessment and Text EvaluationFindings7 citations
  835. Deal, or no deal (or who knows)? Forecasting Uncertainty in Conversations using Large Language ModelsFindings7 citations
  836. Deciphering the Impact of Pretraining Data on Large Language Models through Machine UnlearningFindings7 citations
  837. Distillation Enhanced Generative RetrievalFindings7 citations
  838. Dodo: Dynamic Contextual Compression for Decoder-only LMsLong7 citations
  839. EconNLI: Evaluating Large Language Models on Economics ReasoningFindings7 citations
  840. Enhancing Text-to-SQL Parsing through Question Rewriting and Execution-Guided RefinementFindings7 citations
  841. Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense ReasoningLong7 citations
  842. GKT: A Novel Guidance-Based Knowledge Transfer Framework For Efficient Cloud-edge Collaboration LLM DeploymentFindings7 citations
  843. HiRoPE: Length Extrapolation for Code Models Using Hierarchical PositionLong7 citations
  844. II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question AnsweringFindings7 citations
  845. InstructCMP: Length Control in Sentence Compression through Instruction-based Large Language ModelsFindings7 citations
  846. It’s Not Easy Being Wrong: Large Language Models Struggle with Process of Elimination ReasoningFindings7 citations
  847. Knowledge-Infused Legal Wisdom: Navigating LLM Consultation through the Lens of Diagnostics and Positive-Unlabeled Reinforcement LearningFindings7 citations
  848. LLM-REDIAL: A Large-Scale Dataset for Conversational Recommender Systems Created from User Behaviors with LLMsFindings7 citations
  849. LLM-based Rewriting of Inappropriate Argumentation using Reinforcement Learning from Machine FeedbackLong7 citations
  850. Learning Disentangled Semantic Spaces of Explanations via Invertible Neural NetworksLong7 citations
  851. Legal Judgment Reimagined: PredEx and the Rise of Intelligent AI Interpretation in Indian CourtsFindings7 citations
  852. Let’s Go Real Talk: Spoken Dialogue Model for Face-to-Face ConversationLong7 citations
  853. Likelihood-based Mitigation of Evaluation Bias in Large Language ModelsFindings7 citations
  854. LocalRQA: From Generating Data to Locally Training, Testing, and Deploying Retrieval-Augmented QA SystemsSystem Demonstrations7 citations
  855. MELA: Multilingual Evaluation of Linguistic AcceptabilityLong7 citations
  856. Machine-Generated Text LocalizationFindings7 citations
  857. Maverick: Efficient and Accurate Coreference Resolution Defying Recent TrendsLong7 citations
  858. MemeGuard: An LLM and VLM-based Framework for Advancing Content Moderation via Meme InterventionLong7 citations
  859. Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form GenerationsFindings7 citations
  860. Mitigating Biases for Instruction-following Language Models via Bias Neurons EliminationLong7 citations
  861. Multi-Dimensional Optimization for Text Summarization via Reinforcement LearningLong7 citations
  862. Multi-Label Classification for Implicit Discourse Relation RecognitionFindings7 citations
  863. Navigating the Dual Facets: A Comprehensive Evaluation of Sequential Memory Editing in Large Language ModelsLong7 citations
  864. PAT-Questions: A Self-Updating Benchmark for Present-Anchored Temporal Question-AnsweringFindings7 citations
  865. PRoLoRA: Partial Rotation Empowers More Parameter-Efficient LoRALong7 citations
  866. Plausible Extractive Rationalization through Semi-Supervised Entailment SignalFindings7 citations
  867. Preemptive Answer “Attacks” on Chain-of-Thought ReasoningFindings7 citations
  868. Probing the Multi-turn Planning Capabilities of LLMs via 20 Question GamesLong7 citations
  869. Prompt-Based Length Controlled Generation with Multiple Control TypesFindings7 citations
  870. RadGraph-XL: A Large-Scale Expert-Annotated Dataset for Entity and Relation Extraction from Radiology ReportsFindings7 citations
  871. Reinforcement Tuning for Detecting Stances and Debunking Rumors Jointly with Large Language ModelsFindings7 citations
  872. SIBO: A Simple Booster for Parameter-Efficient Fine-TuningFindings7 citations
  873. Self-Specialization: Uncovering Latent Expertise within Large Language ModelsFindings7 citations
  874. SoMeLVLM: A Large Vision Language Model for Social Media ProcessingFindings7 citations
  875. Soft Knowledge Prompt: Help External Knowledge Become a Better Teacher to Instruct LLM in Knowledge-based VQALong7 citations
  876. Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control MechanismFindings7 citations
  877. Speech language models lack important brain-relevant semanticsLong7 citations
  878. Spotting AI’s Touch: Identifying LLM-Paraphrased Spans in TextFindings7 citations
  879. SwapMoE: Serving Off-the-shelf MoE-based Large Language Models with Tunable Memory BudgetLong7 citations
  880. SyntaxShap: Syntax-aware Explainability Method for Text GenerationFindings7 citations
  881. TOAD: Task-Oriented Automatic Dialogs with Diverse Response StylesFindings7 citations
  882. The Impact of Demonstrations on Multilingual In-Context Learning: A Multidimensional AnalysisFindings7 citations
  883. Towards Better Question Generation in QA-based Event ExtractionFindings7 citations
  884. VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language ModelsLong7 citations
  885. What Makes a Good Order of Examples in In-Context LearningFindings7 citations
  886. Where Do People Tell Stories Online? Story Detection Across Online CommunitiesLong7 citations
  887. A Modular Approach for Multimodal Summarization of TV ShowsLong6 citations
  888. ACUEval: Fine-grained Hallucination Evaluation and Correction for Abstractive SummarizationFindings6 citations
  889. AFPQ: Asymmetric Floating Point Quantization for LLMsFindings6 citations
  890. An Investigation of Neuron Activation as a Unified Lens to Explain Chain-of-Thought Eliciting Arithmetic Reasoning of LLMsLong6 citations
  891. ArchCode: Incorporating Software Requirements in Code Generation with Large Language ModelsLong6 citations
  892. BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language ModelsFindings6 citations
  893. BadActs: A Universal Backdoor Defense in the Activation SpaceFindings6 citations
  894. Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization CorrelationsLong6 citations
  895. Boosting LLM Agents with Recursive Contemplation for Effective Deception HandlingFindings6 citations
  896. CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language ModelsFindings6 citations
  897. Chain-of-History Reasoning for Temporal Knowledge Graph ForecastingFindings6 citations
  898. Chaos with Keywords: Exposing Large Language Models Sycophancy to Misleading Keywords and Evaluating Defense StrategiesFindings6 citations
  899. CharPoet: A Chinese Classical Poetry Generation System Based on Token-free LLMSystem Demonstrations6 citations
  900. Concept-Best-Matching: Evaluating Compositionality In Emergent CommunicationFindings6 citations
  901. Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language ModelsLong6 citations
  902. ConstitutionalExperts: Training a Mixture of Principle-based PromptsShort6 citations
  903. Conundrums in Cross-Prompt Automated Essay Scoring: Making Sense of the State of the ArtLong6 citations
  904. Cross-Modal Projection in Multimodal LLMs Doesn’t Really Project Visual Attributes to Textual SpaceShort6 citations
  905. D2LLM: Decomposed and Distilled Large Language Models for Semantic SearchLong6 citations
  906. DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge GraphsFindings6 citations
  907. Do Language Models Exhibit Human-like Structural Priming Effects?Findings6 citations
  908. Document-level Claim Extraction and Decontextualisation for Fact-CheckingLong6 citations
  909. ELAD: Explanation-Guided Large Language Models Active DistillationFindings6 citations
  910. ESCoT: Towards Interpretable Emotional Support Dialogue SystemsLong6 citations
  911. EasyGen: Easing Multimodal Generation with BiDiffuser and LLMsLong6 citations
  912. Enhancing EEG-to-Text Decoding through Transferable Representations from Pre-trained Contrastive EEG-Text Masked AutoencoderLong6 citations
  913. Enhancing Explainable Rating Prediction through Annotated Macro ConceptsLong6 citations
  914. Evaluating the Validity of Word-level Adversarial Attacks with Large Language ModelsFindings6 citations
  915. Exploring Reasoning Biases in Large Language Models Through Syllogism: Insights from the NeuBAROCO DatasetFindings6 citations
  916. Exploring Spatial Schema Intuitions in Large Language and Vision ModelsFindings6 citations
  917. Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical SemanticsFindings6 citations
  918. Hybrid Alignment Training for Large Language ModelsFindings6 citations
  919. Hyper-CL: Conditioning Sentence Representations with HypernetworksLong6 citations
  920. I am a Strange Dataset: Metalinguistic Tests for Language ModelsLong6 citations
  921. ICLEF: In-Context Learning with Expert Feedback for Explainable Style TransferLong6 citations
  922. IL-TUR: Benchmark for Indian Legal Text Understanding and ReasoningLong6 citations
  923. INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of RepairFindings6 citations
  924. Incremental Sequence Labeling: A Tale of Two ShiftsFindings6 citations
  925. InfoLossQA: Characterizing and Recovering Information Loss in Text SimplificationLong6 citations
  926. Is the Pope Catholic? Yes, the Pope is Catholic. Generative Evaluation of Non-Literal Intent Resolution in LLMsShort6 citations
  927. KG-Adapter: Enabling Knowledge Graph Integration in Large Language Models through Parameter-Efficient Fine-TuningFindings6 citations
  928. KoCommonGEN v2: A Benchmark for Navigating Korean Commonsense Reasoning Challenges in Large Language ModelsFindings6 citations
  929. LANDeRMT: Dectecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine TranslationLong6 citations
  930. LIRE: listwise reward enhancement for preference alignmentFindings6 citations
  931. LRQuant: Learnable and Robust Post-Training Quantization for Large Language ModelsLong6 citations
  932. Limits of Theory of Mind Modelling in Dialogue-Based Collaborative Plan AcquisitionLong6 citations
  933. Linear Transformers with Learnable Kernel Functions are Better In-Context ModelsLong6 citations
  934. LinguaLinked: Distributed Large Language Model Inference on Mobile DevicesSystem Demonstrations6 citations
  935. Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language ModelsFindings6 citations
  936. Medical Dialogue System: A Survey of Categories, Methods, Evaluation and ChallengesFindings6 citations
  937. Meta-Tuning LLMs to Leverage Lexical Knowledge for Generalizable Language Style UnderstandingLong6 citations
  938. More Victories, Less Cooperation: Assessing Cicero’s Diplomacy PlayLong6 citations
  939. Multi-Aspect Controllable Text Generation with Disentangled Counterfactual AugmentationLong6 citations
  940. NICE: To Optimize In-Context Examples or Not?Long6 citations
  941. NoteChat: A Dataset of Synthetic Patient-Physician Conversations Conditioned on Clinical NotesFindings6 citations
  942. On the Evaluation of Speech Foundation Models for Spoken Language UnderstandingFindings6 citations
  943. OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and SafetySystem Demonstrations6 citations
  944. PANDA: Preference Adaptation for Enhancing Domain-Specific Abilities of LLMsFindings6 citations
  945. POMP: Probability-driven Meta-graph Prompter for LLMs in Low-resource Unsupervised Neural Machine TranslationLong6 citations
  946. Persuading across Diverse Domains: a Dataset and Persuasion Large Language ModelLong6 citations
  947. Predicting Text Preference Via Structured Comparative ReasoningLong6 citations
  948. Prompt Optimization via Adversarial In-Context LearningLong6 citations
  949. Prompt Refinement with Image Pivot for Text-to-Image GenerationLong6 citations
  950. RaDA: Retrieval-augmented Web Agent Planning with LLMsFindings6 citations
  951. RomanSetu: Efficiently unlocking multilingual capabilities of Large Language Models via RomanizationLong6 citations
  952. SLIDE: A Framework Integrating Small and Large Language Models for Open-Domain Dialogues EvaluationFindings6 citations
  953. SPAGHETTI: Open-Domain Question Answering from Heterogeneous Data Sources with Retrieval and Semantic ParsingFindings6 citations
  954. Selective Prompting Tuning for Personalized Conversations with LLMsFindings6 citations
  955. SharedCon: Implicit Hate Speech Detection using Shared SemanticsFindings6 citations
  956. Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit AccessShort6 citations
  957. Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMsLong6 citations
  958. Social Intelligence Data Infrastructure: Structuring the Present and Navigating the FutureFindings6 citations
  959. Synergistic Interplay between Search and Large Language Models for Information RetrievalLong6 citations
  960. TOREE: Evaluating Topic Relevance of Student Essays for Chinese Primary and Middle School EducationFindings6 citations
  961. Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language ModelsFindings6 citations
  962. The Fine-Tuning Paradox: Boosting Translation Quality Without Sacrificing LLM AbilitiesLong6 citations
  963. Time Sensitive Knowledge Editing through Efficient FinetuningShort6 citations
  964. Uncertainty Aware Learning for Language Model AlignmentLong6 citations
  965. Understanding Cross-Lingual Alignment—A SurveyFindings6 citations
  966. Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache CompressionLong6 citations
  967. XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech PerceptionLong6 citations
  968. Zero-Shot Cross-Lingual Reranking with Large Language Models for Low-Resource LanguagesShort6 citations
  969. ADAM: Dense Retrieval Distillation with Adaptive Dark ExamplesFindings5 citations
  970. Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency SpaceLong5 citations
  971. Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM GameFindings5 citations
  972. Alirector: Alignment-Enhanced Chinese Grammatical Error CorrectorFindings5 citations
  973. An Empirical Study of In-context Learning in LLMs for Machine TranslationFindings5 citations
  974. Are AI-Generated Text Detectors Robust to Adversarial Perturbations?Long5 citations
  975. AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-ThoughtFindings5 citations
  976. BlendSQL: A Scalable Dialect for Unifying Hybrid Question Answering in Relational AlgebraFindings5 citations
  977. CSCD-NS: a Chinese Spelling Check Dataset for Native SpeakersLong5 citations
  978. Causal-Guided Active Learning for Debiasing Large Language ModelsLong5 citations
  979. Centroid-Based Efficient Minimum Bayes Risk DecodingFindings5 citations
  980. Comparing Inferential Strategies of Humans and Large Language Models in Deductive ReasoningLong5 citations
  981. Continual Dialogue State Tracking via Reason-of-Select DistillationFindings5 citations
  982. Controllable Data Augmentation for Few-Shot Text Mining with Chain-of-Thought Attribute ManipulationFindings5 citations
  983. Controllable Text Generation with Residual Memory TransformerFindings5 citations
  984. CopyNE: Better Contextual ASR by Copying Named EntitiesLong5 citations
  985. Diffusion Guided Language ModelingFindings5 citations
  986. Discerning and Resolving Knowledge Conflicts through Adaptive Decoding with Contextual Information-Entropy ConstraintFindings5 citations
  987. Does DetectGPT Fully Utilize Perturbation? Bridging Selective Perturbation to Fine-tuned Contrastive Learning Detector would be BetterLong5 citations
  988. E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language ModelsFindings5 citations
  989. Enhancing Hallucination Detection through Perturbation-Based Synthetic Data Generation in System ResponsesFindings5 citations
  990. Evaluating Intention Detection Capability of Large Language Models in Persuasive DialoguesLong5 citations
  991. Exploring Reversal Mathematical Reasoning Ability for Large Language ModelsFindings5 citations
  992. Extracting Polymer Nanocomposite Samples from Full-Length DocumentsFindings5 citations
  993. Few-shot Transfer Learning for Knowledge Base Question Answering: Fusing Supervised Models with In-Context LearningLong5 citations
  994. Fora: A corpus and framework for the study of facilitated dialogueLong5 citations
  995. GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models EvaluationFindings5 citations
  996. GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural NetworkFindings5 citations
  997. GeoAgent: To Empower LLMs using Geospatial Tools for Address StandardizationFindings5 citations
  998. Identifying while Learning for Document Event Causality IdentificationLong5 citations
  999. Improving Event Definition Following For Zero-Shot Event DetectionLong5 citations
  1000. Instruction Tuning with Retrieval-based Examples Ranking for Aspect-based Sentiment AnalysisFindings5 citations

Looking for submission deadlines instead? See the conference deadline calendar.

ACL 2024 Accepted Papers · Full List of 1,930 Papers