← All conferences

EMNLP 2024 Accepted Papers

The full list of 2,379 papers accepted at EMNLP 2024 (Conference on Empirical Methods in Natural Language Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Main: 1,234finding: 976Industry: 119System Demonstrations: 50
  1. A Survey on In-context LearningMain1,730 citations
  2. Video-LLaVA: Learning United Visual Representation by Alignment Before ProjectionMain631 citations
  3. Encouraging Divergent Thinking in Large Language Models through Multi-Agent DebateMain377 citations
  4. ORPO: Monolithic Preference Optimization without Reference ModelMain203 citations
  5. Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMsMain160 citations
  6. Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language ModelsMain160 citations
  7. FOLIO: Natural Language Reasoning with First-Order LogicMain150 citations
  8. Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Expertsfinding114 citations
  9. mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understandingfinding112 citations
  10. Arcee’s MergeKit: A Toolkit for Merging Large Language ModelsIndustry107 citations
  11. Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language ModelsMain106 citations
  12. Humans or LLMs as the Judge? A Study on Judgement BiasMain102 citations
  13. LawBench: Benchmarking Legal Knowledge of Large Language ModelsMain101 citations
  14. A Simple LLM Framework for Long-Range Video Question-AnsweringMain96 citations
  15. When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource LanguagesMain96 citations
  16. Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?Main95 citations
  17. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language ModelIndustry92 citations
  18. The Effect of Sampling Temperature on Problem Solving in Large Language Modelsfinding89 citations
  19. Knowledge Conflicts for LLMs: A SurveyMain83 citations
  20. Moral Foundations of Large Language ModelsMain81 citations
  21. Scaling Sentence Embeddings with Large Language Modelsfinding81 citations
  22. MiniCheck: Efficient Fact-Checking of LLMs on Grounding DocumentsMain74 citations
  23. Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalizationfinding74 citations
  24. R-Judge: Benchmarking Safety Risk Awareness for LLM Agentsfinding73 citations
  25. Searching for Best Practices in Retrieval-Augmented GenerationMain71 citations
  26. WavLLM: Towards Robust and Adaptive Speech Large Language Modelfinding70 citations
  27. MLLM-Protector: Ensuring MLLM’s Safety without Hurting PerformanceMain69 citations
  28. Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Modelsfinding69 citations
  29. Towards Measuring and Modeling “Culture” in LLMs: A SurveyMain65 citations
  30. FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Modelsfinding64 citations
  31. Dense X Retrieval: What Retrieval Granularity Should We Use?Main63 citations
  32. FLIRT: Feedback Loop In-context Red TeamingMain61 citations
  33. SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Supportfinding60 citations
  34. Heterogeneous LoRA for Federated Fine-tuning of On-Device Foundation ModelsMain57 citations
  35. Android in the Zoo: Chain-of-Action-Thought for GUI Agentsfinding55 citations
  36. LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-TrainingMain55 citations
  37. A Survey on Detection of LLMs-Generated Contentfinding53 citations
  38. Small LLMs Are Weak Tool Learners: A Multi-LLM AgentMain52 citations
  39. DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLMs Jailbreakersfinding50 citations
  40. DTS-SQL: Decomposed Text-to-SQL with Small Large Language Modelsfinding46 citations
  41. InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model GuidanceMain46 citations
  42. Controllable Preference Optimization: Toward Controllable Multi-Objective AlignmentMain45 citations
  43. Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM AssessmentMain45 citations
  44. LongAlign: A Recipe for Long Context Alignment of Large Language Modelsfinding45 citations
  45. In-Context Learning with Iterative Demonstration Selectionfinding44 citations
  46. Large Language Models for Data Annotation and Synthesis: A SurveyMain44 citations
  47. Chain-of-Dictionary Prompting Elicits Translation in Large Language ModelsMain43 citations
  48. Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context LearningMain43 citations
  49. OpenGraph: Towards Open Graph Foundation Modelsfinding42 citations
  50. Systematic Biases in LLM Simulations of DebatesMain42 citations
  51. A Thorough Examination of Decoding Methods in the Era of LLMsMain41 citations
  52. Foundational Autoraters: Taming Large Language Models for Better Automatic EvaluationMain41 citations
  53. Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QAMain41 citations
  54. Multimodal Procedural Planning via Dual Text-Image Promptingfinding41 citations
  55. VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video GenerationMain41 citations
  56. RepoAgent: An LLM-Powered Open-Source Framework for Repository-level Code Documentation GenerationSystem Demonstrations40 citations
  57. Zero-Resource Hallucination Prevention for Large Language Modelsfinding40 citations
  58. mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text RetrievalIndustry40 citations
  59. A Peek into Token Bias: Large Language Models Are Not Yet Genuine ReasonersMain39 citations
  60. Can LLM be a Personalized Judge?finding38 citations
  61. LLM-Based Agent Society Investigation: Collaboration and Confrontation in Avalon GameplayMain38 citations
  62. Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervisionfinding38 citations
  63. TPTU-v2: Boosting Task Planning and Tool Usage of Large Language Model-based Agents in Real-world Industry SystemsIndustry38 citations
  64. EAGLE-2: Faster Inference of Language Models with Dynamic Draft TreesMain37 citations
  65. Extract, Define, Canonicalize: An LLM-based Framework for Knowledge Graph ConstructionMain37 citations
  66. MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and CollaborationMain37 citations
  67. GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning AbilitiesMain36 citations
  68. Is this the real life? Is this just fantasy? The Misleading Success of Simulating Social Interactions With LLMsMain36 citations
  69. LLM4Decompile: Decompiling Binary Code with Large Language ModelsMain36 citations
  70. OffsetBias: Leveraging Debiased Data for Tuning Evaluatorsfinding36 citations
  71. QUIK: Towards End-to-end 4-Bit Inference on Generative Large Language ModelsMain36 citations
  72. A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and RecommendationsMain35 citations
  73. DALK: Dynamic Co-Augmentation of LLMs and KG to answer Alzheimer’s Disease Questions with Scientific Literaturefinding35 citations
  74. LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inferencefinding35 citations
  75. SOUL: Unlocking the Power of Second-Order Optimization for LLM UnlearningMain35 citations
  76. Tokenization Is More Than CompressionMain34 citations
  77. A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific DiscoveryMain33 citations
  78. Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention MapsMain33 citations
  79. PATIENT-𝜓: Using Large Language Models to Simulate Patients for Training Mental Health ProfessionalsMain33 citations
  80. Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid ApproachIndustry33 citations
  81. AgentReview: Exploring Peer Review Dynamics with LLM AgentsMain32 citations
  82. RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language ModelsMain32 citations
  83. Step-level Value Preference Optimization for Mathematical Reasoningfinding32 citations
  84. Summary of a Haystack: A Challenge to Long-Context LLMs and RAG SystemsMain32 citations
  85. TAP4LLM: Table Provider on Sampling, Augmenting, and Packing Semi-structured Data for Large Language Model Reasoningfinding32 citations
  86. EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health RecordsMain31 citations
  87. Language Models Learn Rare Phenomena from Less Rare Phenomena: The Case of the Missing AANNsMain31 citations
  88. Language Models Still Struggle to Zero-shot Reason about Time Seriesfinding31 citations
  89. Middleware for LLMs: Tools Are Instrumental for Language Agents in Complex EnvironmentsMain31 citations
  90. Roleplay-doh: Enabling Domain-Experts to Create LLM-simulated Patients via Eliciting and Adhering to PrinciplesMain31 citations
  91. Are Large Language Models Capable of Generating Human-Level Narratives?Main30 citations
  92. Mitigating the Alignment Tax of RLHFMain30 citations
  93. Optimizing Instructions and Demonstrations for Multi-Stage Language Model ProgramsMain30 citations
  94. Puzzle Solving using Reasoning of Large Language Models: A SurveyMain30 citations
  95. mDPO: Conditional Preference Optimization for Multimodal Large Language ModelsMain30 citations
  96. Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observationsfinding29 citations
  97. From Complex to Simple: Enhancing Multi-Constraint Complex Instruction Following Ability of Large Language Modelsfinding29 citations
  98. LLMs Assist NLP Researchers: Critique Paper (Meta-)ReviewingMain29 citations
  99. MMedAgent: Learning to Use Medical Tools with Multi-modal Agentfinding29 citations
  100. MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language ModelsMain29 citations
  101. PDFTriage: Question Answering over Long, Structured DocumentsIndustry28 citations
  102. Personas as a Way to Model Truthfulness in Language ModelsMain28 citations
  103. SciAgent: Tool-augmented Language Models for Scientific ReasoningMain28 citations
  104. User Inference Attacks on Large Language ModelsMain28 citations
  105. BiMediX: Bilingual Medical Mixture of Experts LLMfinding27 citations
  106. CultureBank: An Online Community-Driven Knowledge Base Towards Culturally Aware Language Technologiesfinding27 citations
  107. NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated DataMain27 citations
  108. Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality EstimationMain26 citations
  109. Generate-on-Graph: Treat LLM as both Agent and KG for Incomplete Knowledge Graph Question AnsweringMain26 citations
  110. ImageInWords: Unlocking Hyper-Detailed Image DescriptionsMain26 citations
  111. Information Flow Routes: Automatically Interpreting Language Models at ScaleMain26 citations
  112. LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languagesfinding26 citations
  113. Large Language Models Can Be Contextual Privacy Protection LearnersMain26 citations
  114. Learning Planning-based Reasoning by Trajectories Collection and Process Reward SynthesizingMain26 citations
  115. MarkLLM: An Open-Source Toolkit for LLM WatermarkingSystem Demonstrations26 citations
  116. SaySelf: Teaching LLMs to Express Confidence with Self-Reflective RationalesMain26 citations
  117. A Unified Framework for Model Editingfinding25 citations
  118. Breaking the Curse of Multilinguality with Cross-lingual Expert Language ModelsMain25 citations
  119. Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkersfinding25 citations
  120. How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden Statesfinding25 citations
  121. REAR: A Relevance-Aware Retrieval-Augmented Framework for Open-Domain Question AnsweringMain25 citations
  122. ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectorsfinding25 citations
  123. Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed?finding25 citations
  124. Typos that Broke the RAG’s Back: Genetic Attack on RAG Pipeline by Simulating Documents in the Wild via Low-level Perturbationsfinding25 citations
  125. A Simple and Effective L_2 Norm-Based Strategy for KV Cache CompressionMain24 citations
  126. Benchmarking Vision Language Models for Cultural UnderstandingMain24 citations
  127. LUQ: Long-text Uncertainty Quantification for LLMsMain24 citations
  128. Learning to Use Tools via Cooperative and Interactive Agentsfinding24 citations
  129. Linguistic Bias in ChatGPT: Language Models Reinforce Dialect DiscriminationMain24 citations
  130. Modular Pluralism: Pluralistic Alignment via Multi-LLM CollaborationMain24 citations
  131. PromptReps: Prompting Large Language Models to Generate Dense and Sparse Representations for Zero-Shot Document RetrievalMain24 citations
  132. Large Language Models for Propaganda Span Annotationfinding23 citations
  133. LongEmbed: Extending Embedding Models for Long Context RetrievalMain23 citations
  134. Mixture-of-Subspaces in Low-Rank AdaptationMain23 citations
  135. Model Editing Harms General Abilities of Large Language Models: Regularization to the RescueMain23 citations
  136. TransLLaMa: LLM-based Simultaneous Translation Systemfinding23 citations
  137. BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language ModelsMain22 citations
  138. Can Large Language Models Identify Authorship?finding22 citations
  139. Cognitive Bias in Decision-Making with LLMsfinding22 citations
  140. Extracting Prompts by Inverting LLM OutputsMain22 citations
  141. Few shot chain-of-thought driven reasoning to prompt LLMs for open-ended medical question answeringfinding22 citations
  142. Fishing for Magikarp: Automatically Detecting Under-trained Tokens in Large Language ModelsMain22 citations
  143. GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Modelsfinding22 citations
  144. Instruction Pre-Training: Language Models are Supervised Multitask LearnersMain22 citations
  145. Leveraging Large Language Models for NLG Evaluation: Advances and ChallengesMain22 citations
  146. Revisiting Catastrophic Forgetting in Large Language Model Tuningfinding22 citations
  147. Authorship Obfuscation in Multilingual Machine-Generated Text Detectionfinding21 citations
  148. Data Diversity Matters for Robust Instruction Tuningfinding21 citations
  149. Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editingfinding21 citations
  150. Demystifying Verbatim Memorization in Large Language ModelsMain21 citations
  151. Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular TasksIndustry21 citations
  152. Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encodingfinding21 citations
  153. On Leakage of Code Generation Evaluation Datasetsfinding21 citations
  154. One Thousand and One Pairs: A “novel” challenge for long-context language modelsMain21 citations
  155. ProSA: Assessing and Understanding the Prompt Sensitivity of LLMsfinding21 citations
  156. Social Bias Probing: Fairness Benchmarking for Language ModelsMain21 citations
  157. VeriScore: Evaluating the factuality of verifiable claims in long-form text generationfinding21 citations
  158. XRec: Large Language Models for Explainable Recommendationfinding21 citations
  159. An Open-Source Data Contamination Report for Large Language Modelsfinding20 citations
  160. How Far Can We Extract Diverse Perspectives from Large Language Models?Main20 citations
  161. Immunization against harmful fine-tuning attacksfinding20 citations
  162. Knowledge Mechanisms in Large Language Models: A Survey and Perspectivefinding20 citations
  163. Neeko: Leveraging Dynamic LoRA for Efficient Multi-Character Role-Playing AgentMain20 citations
  164. Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMsfinding20 citations
  165. Reformatted Alignmentfinding20 citations
  166. Sailor: Open Language Models for South-East AsiaSystem Demonstrations20 citations
  167. WPO: Enhancing RLHF with Weighted Preference OptimizationMain20 citations
  168. Watch Every Step! LLM Agent Learning via Iterative Step-level Process RefinementMain20 citations
  169. API Is Enough: Conformal Prediction for Large Language Models Without Logit-Accessfinding19 citations
  170. C-ICL: Contrastive In-context Learning for Information Extractionfinding19 citations
  171. Calibrating Long-form Generations From Large Language Modelsfinding19 citations
  172. Discovering Knowledge-Critical Subnetworks in Pretrained Language ModelsMain19 citations
  173. GREEN: Generative Radiology Report Evaluation and Error Notationfinding19 citations
  174. Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop QueriesMain19 citations
  175. Improving Multi-Agent Debate with Sparse Communication Topologyfinding19 citations
  176. MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problemsfinding19 citations
  177. Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoningfinding19 citations
  178. NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surroundingfinding19 citations
  179. Benchmarking Machine Translation with Cultural Awarenessfinding18 citations
  180. Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?Main18 citations
  181. Evaluating the Instruction-Following Robustness of Large Language Models to Prompt InjectionMain18 citations
  182. M2PT: Multimodal Prompt Tuning for Zero-shot Instruction LearningMain18 citations
  183. MetaGPT: Merging Large Language Models Using Model Exclusive Task ArithmeticMain18 citations
  184. Personalized Pieces: Efficient Personalized Large Language Models through Collaborative EffortsMain18 citations
  185. SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text GenerationMain18 citations
  186. The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce HarmMain18 citations
  187. A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Modelsfinding17 citations
  188. Conditional Language Policy: A General Framework For Steerable Multi-Objective Finetuningfinding17 citations
  189. Editing Conceptual Knowledge for Large Language Modelsfinding17 citations
  190. Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional WorksMain17 citations
  191. HoneyComb: A Flexible LLM-Based Agent System for Materials Sciencefinding17 citations
  192. KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approachesfinding17 citations
  193. Knowledge Graph Enhanced Large Language Model EditingMain17 citations
  194. MedAdapter: Efficient Test-Time Adaptation of Large Language Models Towards Medical ReasoningMain17 citations
  195. Open-RAG: Enhanced Retrieval Augmented Reasoning with Open-Source Large Language Modelsfinding17 citations
  196. Patentformer: A Novel Method to Automate the Generation of Patent ApplicationsIndustry17 citations
  197. Personality-aware Student Simulation for Conversational Intelligent Tutoring SystemsMain17 citations
  198. Suri: Multi-constraint Instruction Following in Long-form Text Generationfinding17 citations
  199. Towards Understanding Jailbreak Attacks in LLMs: A Representation Space AnalysisMain17 citations
  200. Are Large Language Models Consistent over Value-laden Questions?finding16 citations
  201. BMRetriever: Tuning Large Language Models as Better Biomedical Text RetrieversMain16 citations
  202. BlendFilter: Advancing Retrieval-Augmented Large Language Models via Query Generation Blending and Knowledge FilteringMain16 citations
  203. ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guaranteesfinding16 citations
  204. Deciphering the Factors Influencing the Efficacy of Chain-of-Thought: Probability, Memorization, and Noisy Reasoningfinding16 citations
  205. Filtered Direct Preference OptimizationMain16 citations
  206. LLoCO: Learning Long Contexts OfflineMain16 citations
  207. Large Language Model-based Human-Agent Collaboration for Complex Task Solvingfinding16 citations
  208. Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal MechanismMain16 citations
  209. LongHeads: Multi-Head Attention is Secretly a Long Context Processorfinding16 citations
  210. NumeroLogic: Number Encoding for Enhanced LLMs’ Numerical ReasoningMain16 citations
  211. RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMsMain16 citations
  212. Rebuilding ROME : Resolving Model Collapse during Sequential Model EditingMain16 citations
  213. Towards Verifiable Text Generation with Evolving Memory and Self-ReflectionMain16 citations
  214. Uncertainty in Language Models: Assessment through Rank-CalibrationMain16 citations
  215. Understanding and Mitigating Language Confusion in LLMsMain16 citations
  216. Unifying Multimodal Retrieval via Document Screenshot EmbeddingMain16 citations
  217. Annotator-Centric Active Learning for Subjective NLP TasksMain15 citations
  218. BASES: Large-scale Web Search User Simulation with Large Language Model based Agentsfinding15 citations
  219. Can LLM Graph Reasoning Generalize beyond Pattern Memorization?finding15 citations
  220. Defending Jailbreak Prompts via In-Context Adversarial GameMain15 citations
  221. Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL DivergenceMain15 citations
  222. Hidden Persuaders: LLMs’ Political Leaning and Their Influence on VotersMain15 citations
  223. LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planningfinding15 citations
  224. MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language ModelMain15 citations
  225. On the Generalization of Training-based ChatGPT Detection Methodsfinding15 citations
  226. Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General TasksMain15 citations
  227. RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question AnsweringMain15 citations
  228. Re-Reading Improves Reasoning in Large Language ModelsMain15 citations
  229. Retrieved Sequence Augmentation for Protein Representation LearningMain15 citations
  230. RoseLoRA: Row and Column-wise Sparse Low-rank Adaptation of Pre-trained Language Model for Knowledge Editing and Fine-tuningMain15 citations
  231. The Mystery of In-Context Learning: A Comprehensive Survey on Interpretation and AnalysisMain15 citations
  232. TinyAgent: Function Calling at the EdgeSystem Demonstrations15 citations
  233. Verification and Refinement of Natural Language Explanations through LLM-Symbolic Theorem ProvingMain15 citations
  234. Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processingfinding15 citations
  235. CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Modelsfinding14 citations
  236. ChatRetriever: Adapting Large Language Models for Generalized and Robust Conversational Dense RetrievalMain14 citations
  237. CompAct: Compressing Retrieved Documents Actively for Question AnsweringMain14 citations
  238. Divide-or-Conquer? Which Part Should You Distill Your LLM?finding14 citations
  239. Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better TogetherMain14 citations
  240. GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image GenerationMain14 citations
  241. Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent ConversationsMain14 citations
  242. Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge Graphsfinding14 citations
  243. LitSearch: A Retrieval Benchmark for Scientific Literature SearchMain14 citations
  244. MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understandingfinding14 citations
  245. RaFe: Ranking Feedback Improves Query Rewriting for RAGfinding14 citations
  246. AdaZeta: Adaptive Zeroth-Order Tensor-Train Adaption for Memory-Efficient Large Language Models Fine-TuningMain13 citations
  247. AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectoriesfinding13 citations
  248. Aligning Language Models to Explicitly Handle AmbiguityMain13 citations
  249. AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?Main13 citations
  250. BLADE: Benchmarking Language Model Agents for Data-Driven Sciencefinding13 citations
  251. Calibrating Language Models with Adaptive Temperature ScalingMain13 citations
  252. ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answeringfinding13 citations
  253. DLoRA: Distributed Parameter-Efficient Fine-Tuning Solution for Large Language Modelfinding13 citations
  254. Direct Multi-Turn Preference Optimization for Language AgentsMain13 citations
  255. Evaluating Psychological Safety of Large Language ModelsMain13 citations
  256. Extrinsic Evaluation of Cultural Competence in Large Language Modelsfinding13 citations
  257. How to Compute the Probability of a WordMain13 citations
  258. Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLPMain13 citations
  259. Large Language Models Can Self-Correct with Key Condition VerificationMain13 citations
  260. LongForm: Effective Instruction Tuning with Reverse Instructionsfinding13 citations
  261. Model Merging and Safety Alignment: One Bad Model Spoils the Bunchfinding13 citations
  262. Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual AlignmentMain13 citations
  263. RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool LearningMain13 citations
  264. STAR: SocioTechnical Approach to Red Teaming Language ModelsMain13 citations
  265. SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLMfinding13 citations
  266. TRACE the Evidence: Constructing Knowledge-Grounded Reasoning Chains for Retrieval-Augmented Generationfinding13 citations
  267. Why Does New Knowledge Create Messy Ripple Effects in LLMs?Main13 citations
  268. ApiQ: Finetuning of 2-Bit Quantized Large Language ModelMain12 citations
  269. AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Modelsfinding12 citations
  270. Automatic Instruction Evolving for Large Language ModelsMain12 citations
  271. Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compressionfinding12 citations
  272. BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMsMain12 citations
  273. Can AI Relate: Testing Large Language Model Response for Mental Health Supportfinding12 citations
  274. CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language ModelsMain12 citations
  275. CodeJudge: Evaluating Code Generation with Large Language ModelsMain12 citations
  276. EchoSight: Advancing Visual-Language Models with Wiki Knowledgefinding12 citations
  277. Fairer Preferences Elicit Improved Human-Aligned Large Language Model JudgmentsMain12 citations
  278. LLM-DetectAIve: a Tool for Fine-Grained Machine-Generated Text DetectionSystem Demonstrations12 citations
  279. Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language ModelsMain12 citations
  280. Language Models in Dialogue: Conversational Maxims for Human-AI Interactionsfinding12 citations
  281. Learn Beyond The Answer: Training Language Models with Reflection for Mathematical ReasoningMain12 citations
  282. Learning to Refine with Fine-Grained Natural Language Feedbackfinding12 citations
  283. LongRAG: A Dual-Perspective Retrieval-Augmented Generation Paradigm for Long-Context Question AnsweringMain12 citations
  284. MedCoT: Medical Chain of Thought via Hierarchical ExpertMain12 citations
  285. Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?Main12 citations
  286. Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimizationfinding12 citations
  287. OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMsSystem Demonstrations12 citations
  288. PEDANTS: Cheap but Effective and Interpretable Answer Equivalencefinding12 citations
  289. Pedagogical Alignment of Large Language Modelsfinding12 citations
  290. PromptKD: Distilling Student-Friendly Knowledge for Generative Language Models via Prompt Tuningfinding12 citations
  291. Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspectivefinding12 citations
  292. Reasoning in Token Economies: Budget-Aware Evaluation of LLM Reasoning StrategiesMain12 citations
  293. The Program Testing Ability of Large Language Models for CodeIndustry12 citations
  294. Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactionsfinding12 citations
  295. TrustAgent: Towards Safe and Trustworthy LLM-based Agentsfinding12 citations
  296. When ”A Helpful Assistant” Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Modelsfinding12 citations
  297. “They are uncultured”: Unveiling Covert Harms and Social Threats in LLM Generated ConversationsMain12 citations
  298. AKEW: Assessing Knowledge Editing in the WildMain11 citations
  299. African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object ClassificationMain11 citations
  300. An Empirical Study on Cross-lingual Vocabulary Adaptation for Efficient Language Model Inferencefinding11 citations
  301. Are LLMs Good Zero-Shot Fallacy Classifiers?Main11 citations
  302. BERGEN: A Benchmarking Library for Retrieval-Augmented Generationfinding11 citations
  303. Backward Lens: Projecting Language Model Gradients into the Vocabulary SpaceMain11 citations
  304. BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical AnalysisSystem Demonstrations11 citations
  305. Beyond Demographics: Aligning Role-playing LLM-based Agents Using Human Belief Networksfinding11 citations
  306. Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex ModelsMain11 citations
  307. Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and SundaneseMain11 citations
  308. CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue CoreferenceMain11 citations
  309. Detection and Measurement of Syntactic Templates in Generated TextMain11 citations
  310. Dual-Space Knowledge Distillation for Large Language ModelsMain11 citations
  311. Evaluating n-Gram Novelty of Language Models Using Rusty-DAWGMain11 citations
  312. How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric LearningMain11 citations
  313. InfuserKI: Enhancing Large Language Models with Knowledge Graphs via Infuser-Guided Knowledge Integrationfinding11 citations
  314. LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvementfinding11 citations
  315. LumberChunker: Long-Form Narrative Document Segmentationfinding11 citations
  316. More DWUGs: Extending and Evaluating Word Usage Graph Datasets in Multiple LanguagesMain11 citations
  317. Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language ModelsMain11 citations
  318. MultiAgent Collaboration Attack: Investigating Adversarial Attacks in Large Language Model Collaborations via Debatefinding11 citations
  319. Neuron-Level Knowledge Attribution in Large Language ModelsMain11 citations
  320. On Diversified Preferences of Large Language Model Alignmentfinding11 citations
  321. PostMark: A Robust Blackbox Watermark for Large Language ModelsMain11 citations
  322. Preference Tuning For Toxicity Mitigation Generalizes Across Languagesfinding11 citations
  323. QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model TuningIndustry11 citations
  324. ReCaLL: Membership Inference via Relative Conditional Log-LikelihoodsMain11 citations
  325. Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question AnsweringMain11 citations
  326. Scaling Laws for Fact Memorization of Large Language Modelsfinding11 citations
  327. To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Modelsfinding11 citations
  328. TopViewRS: Vision-Language Models as Top-View Spatial ReasonersMain11 citations
  329. UrbanLLM: Autonomous Urban Activity Planning and Management with Large Language Modelsfinding11 citations
  330. V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimizationfinding11 citations
  331. VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models AlignmentMain11 citations
  332. Weak-to-Strong Reasoningfinding11 citations
  333. When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression DetectionMain11 citations
  334. “Thinking” Fair and Slow: On the Efficacy of Structured Prompts for Debiasing Language ModelsMain11 citations
  335. A LLM-based Ranking Method for the Evaluation of Automatic Counter-Narrative Generationfinding10 citations
  336. A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Modelsfinding10 citations
  337. A User-Centric Multi-Intent Benchmark for Evaluating Large Language ModelsMain10 citations
  338. AdaMoE: Token-Adaptive Routing with Null Experts for Mixture-of-Experts Language Modelsfinding10 citations
  339. Advancing Social Intelligence in AI Agents: Technical Challenges and Open QuestionsMain10 citations
  340. Aligning Translation-Specific Understanding to General Understanding in Large Language ModelsMain10 citations
  341. ArMeme: Propagandistic Content in Arabic MemesMain10 citations
  342. Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialoguesfinding10 citations
  343. Beyond Natural Language: LLMs Leveraging Alternative Formats for Enhanced Reasoning and Communicationfinding10 citations
  344. Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue AgentsMain10 citations
  345. CHIQ: Contextual History Enhancement for Improving Query Rewriting in Conversational SearchMain10 citations
  346. Can LLMs Reason in the Wild with Programs?finding10 citations
  347. Can Language Models Recognize Convincing Arguments?finding10 citations
  348. CryptoTrade: A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency TradingMain10 citations
  349. DAMRO: Dive into the Attention Mechanism of LVLM to Reduce Object HallucinationMain10 citations
  350. DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Modelsfinding10 citations
  351. ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?Main10 citations
  352. Efficient LLM Comparative Assessment: A Product of Experts Framework for Pairwise ComparisonsMain10 citations
  353. Exploring the Relationship between In-Context Learning and Instruction Tuningfinding10 citations
  354. Factuality of Large Language Models: A SurveyMain10 citations
  355. Fast Matrix Multiplications for Lookup Table-Quantized LLMsfinding10 citations
  356. Finding Blind Spots in Evaluator LLMs with Interpretable ChecklistsMain10 citations
  357. FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food CultureMain10 citations
  358. From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language ModelsMain10 citations
  359. Fuse to Forget: Bias Reduction and Selective Memorization through Model FusionMain10 citations
  360. How Susceptible are Large Language Models to Ideological Manipulation?Main10 citations
  361. ItiNera: Integrating Spatial Optimization with Large Language Models for Open-domain Urban Itinerary PlanningIndustry10 citations
  362. LEMoE: Advanced Mixture of Experts Adaptor for Lifelong Model Editing of Large Language ModelsMain10 citations
  363. LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language ModelsMain10 citations
  364. LongWanjuan: Towards Systematic Measurement for Long Text Qualityfinding10 citations
  365. MIBench: Evaluating Multimodal Large Language Models over Multiple ImagesMain10 citations
  366. MatchTime: Towards Automatic Soccer Game Commentary GenerationMain10 citations
  367. Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language ModelMain10 citations
  368. Not All Contexts Are Equal: Teaching LLMs Credibility-aware GenerationMain10 citations
  369. OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-ConquerMain10 citations
  370. On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimizationfinding10 citations
  371. On the Proper Treatment of Tokenization in PsycholinguisticsMain10 citations
  372. Ontologically Faithful Generation of Non-Player Character DialoguesMain10 citations
  373. PARIKSHA: A Large-Scale Investigation of Human-LLM Evaluator Agreement on Multilingual and Multi-Cultural DataMain10 citations
  374. Perceptions to Beliefs: Exploring Precursory Inferences for Theory of Mind in Large Language ModelsMain10 citations
  375. Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?Main10 citations
  376. RAGLAB: A Modular and Research-Oriented Unified Framework for Retrieval-Augmented GenerationSystem Demonstrations10 citations
  377. RWKV-CLIP: A Robust Vision-Language Representation LearnerMain10 citations
  378. Retrieve-Plan-Generation: An Iterative Planning and Answering Framework for Knowledge-Intensive LLM GenerationMain10 citations
  379. RuBLiMP: Russian Benchmark of Linguistic Minimal PairsMain10 citations
  380. Schema-Driven Information Extraction from Heterogeneous Tablesfinding10 citations
  381. Segment Any Text: A Universal Approach for Robust, Efficient and Adaptable Sentence SegmentationMain10 citations
  382. Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewardsfinding10 citations
  383. Shall We Team Up: Exploring Spontaneous Cooperation of Competing LLM Agentsfinding10 citations
  384. TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video ReasoningMain10 citations
  385. TensorOpera Router: A Multi-Model Router for Efficient LLM InferenceIndustry10 citations
  386. The Zeno’s Paradox of ‘Low-Resource’ LanguagesMain10 citations
  387. TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkishfinding10 citations
  388. Walking in Others’ Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and BiasMain10 citations
  389. Zero-shot Persuasive Chatbots with LLM-Generated Strategies and Information Retrievalfinding10 citations
  390. A Notion of Complexity for Theory of Mind via Discrete World Modelsfinding9 citations
  391. ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix EmbeddingsMain9 citations
  392. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understandingfinding9 citations
  393. An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevanceMain9 citations
  394. Are Large Language Models (LLMs) Good Social Predictors?finding9 citations
  395. Automated Peer Reviewing in Paper SEA: Standardization, Evaluation, and Analysisfinding9 citations
  396. Cactus: Towards Psychological Counseling Conversations using Cognitive Behavioral Theoryfinding9 citations
  397. Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language ModelsMain9 citations
  398. Distract Large Language Models for Automatic Jailbreak AttackMain9 citations
  399. Do LLMs Plan Like Human Writers? Comparing Journalist Coverage of Press Releases with LLMsMain9 citations
  400. Enhancing Reinforcement Learning with Dense Rewards from Language Model CriticMain9 citations
  401. Enhancing Systematic Decompositional Natural Language Inference Using Informal LogicMain9 citations
  402. Enhancing Tool Retrieval with Iterative Feedback from Large Language Modelsfinding9 citations
  403. FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agentsfinding9 citations
  404. If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept DescriptionsMain9 citations
  405. InterIntent: Investigating Social Intelligence of LLMs via Intention Understanding in an Interactive Game ContextMain9 citations
  406. Knowledge Editing in Language Models via Adapted Direct Preference Optimizationfinding9 citations
  407. LLMs Are Prone to Fallacies in Causal InferenceMain9 citations
  408. LLMs for Generating and Evaluating Counterfactuals: A Comprehensive Studyfinding9 citations
  409. LLMs learn governing principles of dynamical systems, revealing an in-context neural scaling lawMain9 citations
  410. Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Modelsfinding9 citations
  411. Mitigating Catastrophic Forgetting in Language Transfer via Model Mergingfinding9 citations
  412. Molecular Facts: Desiderata for Decontextualization in LLM Fact Verificationfinding9 citations
  413. NLEBench+NorGLM: A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in NorwegianMain9 citations
  414. On the Reliability of Psychological Scales on Large Language ModelsMain9 citations
  415. PTD-SQL: Partitioning and Targeted Drilling with LLMs in Text-to-SQLMain9 citations
  416. Perceptions of Linguistic Uncertainty by Language Models and HumansMain9 citations
  417. PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuningfinding9 citations
  418. PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMsfinding9 citations
  419. RaTEScore: A Metric for Radiology Report GenerationMain9 citations
  420. ReadMe++: Benchmarking Multilingual Language Models for Multi-Domain Readability AssessmentMain9 citations
  421. Reference-free Hallucination Detection for Large Vision-Language Modelsfinding9 citations
  422. Resilience of Large Language Models for Noisy Instructionsfinding9 citations
  423. SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research RepositoriesMain9 citations
  424. Safely Learning with Private Data: A Federated Learning Framework for Large Language ModelMain9 citations
  425. Scaling Properties of Speech Language ModelsMain9 citations
  426. Small Agent Can Also Rock! Empowering Small Language Models as Hallucination DetectorMain9 citations
  427. Split and Merge: Aligning Position Biases in LLM-based EvaluatorsMain9 citations
  428. Text-Tuple-Table: Towards Information Integration in Text-to-Table Generation via Global Tuple ExtractionMain9 citations
  429. The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Modelsfinding9 citations
  430. Towards Injecting Medical Visual Knowledge into Multimodal LLMs at ScaleMain9 citations
  431. Train Once, Use Flexibly: A Modular Framework for Multi-Aspect Neural News Recommendationfinding9 citations
  432. Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question AnsweringMain9 citations
  433. Unlocking Memorization in Large Language Models with Dynamic Soft PromptingMain9 citations
  434. VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language ModelsMain9 citations
  435. VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMsfinding9 citations
  436. Virtual Personas for Language Models via an Anthology of BackstoriesMain9 citations
  437. A Simple but Effective Approach to Improve Structured Language Model Output for Information Extractionfinding8 citations
  438. Adaptive Token Biaser: Knowledge Editing via Biasing Key Entitiesfinding8 citations
  439. Assessing and Verifying Task Utility in LLM-Powered ApplicationsMain8 citations
  440. BLSP-Emo: Towards Empathetic Large Speech-Language ModelsMain8 citations
  441. Capturing Minds, Not Just Words: Enhancing Role-Playing Language Models with Personality-Indicative Datafinding8 citations
  442. CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Codefinding8 citations
  443. CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Modelsfinding8 citations
  444. Dense Passage Retrieval: Is it Retrieving?finding8 citations
  445. DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMsfinding8 citations
  446. Dynamic Planning for LLM-based Graphical User Interface Automationfinding8 citations
  447. EPO: Hierarchical LLM Agents with Environment Preference OptimizationMain8 citations
  448. EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoningfinding8 citations
  449. EfficientRAG: Efficient Retriever for Multi-Hop Question AnsweringMain8 citations
  450. Eigen Attention: Attention in Low-Rank Space for KV Cache Compressionfinding8 citations
  451. Evaluating Large Language Models on Time Series Feature Understanding: A Comprehensive Taxonomy and BenchmarkMain8 citations
  452. FEDKIM: Adaptive Federated Knowledge Injection into Medical Foundation ModelsMain8 citations
  453. FFN-SkipLLM: A Hidden Gem for Autoregressive Decoding with Adaptive Feed Forward SkippingMain8 citations
  454. FuseGen: PLM Fusion for Data-generation based Zero-shot LearningMain8 citations
  455. How Does Quantization Affect Multilingual LLMs?finding8 citations
  456. INDUS: Effective and Efficient Language Models for Scientific ApplicationsIndustry8 citations
  457. Intent Detection in the Age of LLMsIndustry8 citations
  458. Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron AnalysisMain8 citations
  459. Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial HypothesisMain8 citations
  460. Is Child-Directed Speech Effective Training Data for Language Models?Main8 citations
  461. Jellyfish: Instruction-Tuning Local Large Language Models for Data PreprocessingMain8 citations
  462. JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Modelsfinding8 citations
  463. LLM Questionnaire Completion for Automatic Psychiatric Assessmentfinding8 citations
  464. Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next LevelMain8 citations
  465. Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student CourseMain8 citations
  466. M5 – A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasksfinding8 citations
  467. MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classificationfinding8 citations
  468. Mitigating Hallucination in Fictional Character Role-Playfinding8 citations
  469. Personal Large Language Model Agents: A Case Study on Tailored Travel PlanningIndustry8 citations
  470. Prompt Leakage effect and mitigation strategies for multi-turn LLM ApplicationsIndustry8 citations
  471. Prospector: Improving LLM Agents with Self-Asking and Trajectory Rankingfinding8 citations
  472. README: Bridging Medical Jargon and Lay Understanding for Patient Education through Data-Centric NLPfinding8 citations
  473. Ranking Manipulation for Conversational Search EnginesMain8 citations
  474. Reconfidencing LLMs from the Grouping Loss Perspectivefinding8 citations
  475. Related Work and Citation Text Generation: A SurveyMain8 citations
  476. SWAG: Storytelling With Action Guidancefinding8 citations
  477. Self-training Large Language Models through Knowledge Detectionfinding8 citations
  478. Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model TutorsMain8 citations
  479. Style-Specific Neurons for Steering LLMs in Text Style TransferMain8 citations
  480. Symbolic Working Memory Enhances Language Models for Complex Rule ApplicationMain8 citations
  481. TOOLVERIFIER: Generalization to New Tools via Self-Verificationfinding8 citations
  482. The Fall of ROME: Understanding the Collapse of LLMs in Model Editingfinding8 citations
  483. The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Modelsfinding8 citations
  484. Themis: A Reference-free NLG Evaluation Language Model with Flexibility and InterpretabilityMain8 citations
  485. TheoremLlama: Transforming General-Purpose LLMs into Lean4 ExpertsMain8 citations
  486. Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflectionfinding8 citations
  487. Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Modelsfinding8 citations
  488. VDebugger: Harnessing Execution Feedback for Debugging Visual Programsfinding8 citations
  489. VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbationfinding8 citations
  490. Virtual Context Enhancing Jailbreak Attacks with Special Token Injectionfinding8 citations
  491. What’s under the hood: Investigating Automatic Metrics on Meeting Summarizationfinding8 citations
  492. Working Memory Identifies Reasoning Limits in Language ModelsMain8 citations
  493. A Study of Implicit Ranking Unfairness in Large Language Modelsfinding7 citations
  494. AppBench: Planning of Multiple APIs from Various APPs for Complex User InstructionMain7 citations
  495. Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agentsfinding7 citations
  496. AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Modelsfinding7 citations
  497. Beyond Persuasion: Towards Conversational Recommender System with Credible Explanationsfinding7 citations
  498. Bridging Local Details and Global Context in Text-Attributed GraphsMain7 citations
  499. Can Automatic Metrics Assess High-Quality Translations?Main7 citations
  500. Change Is the Only Constant: Dynamic LLM Slicing based on Layer Redundancyfinding7 citations
  501. ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipelinefinding7 citations
  502. Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMsMain7 citations
  503. Community-Cross-Instruct: Unsupervised Instruction Generation for Aligning Large Language Models to Online CommunitiesMain7 citations
  504. Conditional and Modal Reasoning in Large Language ModelsMain7 citations
  505. Cultural Conditioning or Placebo? On the Effectiveness of Socio-Demographic PromptingMain7 citations
  506. D3CODE: Disentangling Disagreements in Data across Cultures on Offensiveness Detection and EvaluationMain7 citations
  507. DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language ModelsMain7 citations
  508. Encoding and Controlling Global Semantics for Long-form Video Question AnsweringMain7 citations
  509. Encourage or Inhibit Monosemanticity? Revisit Monosemanticity from a Feature Decorrelation PerspectiveMain7 citations
  510. Enhancing Advanced Visual Reasoning Ability of Large Language ModelsMain7 citations
  511. Evalverse: Unified and Accessible Library for Large Language Model EvaluationSystem Demonstrations7 citations
  512. Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question AnsweringMain7 citations
  513. From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data SynthesisMain7 citations
  514. GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity TheoryMain7 citations
  515. HoLLMwood: Unleashing the Creativity of Large Language Models in Screenwriting via Role Playingfinding7 citations
  516. How Reliable Are Automatic Evaluation Methods for Instruction-Tuned LLMs?finding7 citations
  517. How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning PerspectiveMain7 citations
  518. In-Context Former: Lightning-fast Compressing Context for Large Language Modelfinding7 citations
  519. Insights into LLM Long-Context Failures: When Transformers Know but Don’t Tellfinding7 citations
  520. KnowTuning: Knowledge-aware Fine-tuning for Large Language ModelsMain7 citations
  521. LARA: Linguistic-Adaptive Retrieval-Augmentation for Multi-Turn Intent ClassificationIndustry7 citations
  522. LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression ToolkitIndustry7 citations
  523. LaMDA: Large Model Fine-Tuning via Spectrally Decomposed Low-Dimensional Adaptationfinding7 citations
  524. Language Models are Surprisingly Fragile to Drug Names in Biomedical Benchmarksfinding7 citations
  525. Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical AssessmentMain7 citations
  526. Lifelong Knowledge Editing for LLMs with Retrieval-Augmented Continuous Prompt LearningMain7 citations
  527. LongGenBench: Long-context Generation Benchmarkfinding7 citations
  528. MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase UnderstandingMain7 citations
  529. Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language ModelsMain7 citations
  530. MoleculeQA: A Dataset to Evaluate Factual Accuracy in Molecular Comprehensionfinding7 citations
  531. Monotonic Paraphrasing Improves Generalization of Language Model Promptingfinding7 citations
  532. NormTab: Improving Symbolic Reasoning in LLMs Through Tabular Data Normalizationfinding7 citations
  533. On Evaluating Explanation Utility for Human-AI Decision Making in NLPfinding7 citations
  534. Outcome-Constrained Large Language Models for Countering Hate SpeechMain7 citations
  535. POSIX: A Prompt Sensitivity Index For Large Language Modelsfinding7 citations
  536. PRompt Optimization in Multi-Step Tasks (PROMST): Integrating Human Feedback and Heuristic-based SamplingMain7 citations
  537. PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systemsfinding7 citations
  538. Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model QuantizationMain7 citations
  539. Pretraining Data Detection for Large Language Models: A Divergence-based Calibration MethodMain7 citations
  540. ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Contextfinding7 citations
  541. Pruning Foundation Models for High Accuracy without Retrainingfinding7 citations
  542. RAG-Studio: Towards In-Domain Adaptation of Retrieval Augmented Generation Through Self-Alignmentfinding7 citations
  543. Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language ModelsMain7 citations
  544. Retrieval and Reasoning on KGs: Integrate Knowledge Graphs into Large Language Models for Complex Question Answeringfinding7 citations
  545. Revisiting Who’s Harry Potter: Towards Targeted Unlearning from a Causal Intervention PerspectiveMain7 citations
  546. SLM as Guardian: Pioneering AI Safety with Small Language ModelIndustry7 citations
  547. Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and ActivationsMain7 citations
  548. ScaleLLM: A Resource-Frugal LLM Serving Framework by Optimizing End-to-End EfficiencyIndustry7 citations
  549. ShadowLLM: Predictor-based Contextual Sparsity for Large Language ModelsMain7 citations
  550. ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language ModelsMain7 citations
  551. UniMEEC: Towards Unified Multimodal Emotion Recognition and Emotion Causefinding7 citations
  552. Unified Active Retrieval for Retrieval Augmented Generationfinding7 citations
  553. Unleashing Large Language Models’ Proficiency in Zero-shot Essay Scoringfinding7 citations
  554. VGBench: Evaluating Large Language Models on Vector Graphics Understanding and GenerationMain7 citations
  555. What the Harm? Quantifying the Tangible Impact of Gender Bias in Machine Translation with a Human-centered StudyMain7 citations
  556. When Raw Data Prevails: Are Large Language Model Embeddings Effective in Numerical Data Representation for Medical Machine Learning Applications?finding7 citations
  557. XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inferencefinding7 citations
  558. “A good pun is its own reword”: Can Large Language Models Understand Puns?Main7 citations
  559. A Survey on Natural Language Counterfactual Generationfinding6 citations
  560. ATM: Adversarial Tuning Multi-agent System Makes a Robust Retrieval-Augmented GeneratorMain6 citations
  561. Advancing Large Language Model Attribution through Self-ImprovingMain6 citations
  562. Advancing Process Verification for Large Language Models via Tree-Based Preference LearningMain6 citations
  563. AnaloBench: Benchmarking the Identification of Abstract and Long-context AnalogiesMain6 citations
  564. AnyTrans: Translate AnyText in the Image with Large Scale Modelsfinding6 citations
  565. Assistive Large Language Model Agents for Socially-Aware Negotiation Dialoguesfinding6 citations
  566. Bayesian Example Selection Improves In-Context Learning for Speech, Text and Visual ModalitiesMain6 citations
  567. Beyond Lines and Circles: Unveiling the Geometric Reasoning Gap in Large Language Modelsfinding6 citations
  568. Boosting Large Language Models with Continual Learning for Aspect-based Sentiment Analysisfinding6 citations
  569. Breaking the Ceiling of the LLM Community by Treating Token Generation as a Classification for Ensemblingfinding6 citations
  570. C-LLM: Learn to Check Chinese Spelling Errors Character by CharacterMain6 citations
  571. Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?Main6 citations
  572. CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question AnsweringMain6 citations
  573. Code Membership Inference for Detecting Unauthorized Data Use in Code Pre-trained Language Modelsfinding6 citations
  574. Code Representation Pre-training with Complements from Program ExecutionsIndustry6 citations
  575. Concept-skill Transferability-based Data Selection for Large Vision-Language ModelsMain6 citations
  576. Consolidating Ranking and Relevance Predictions of Large Language Models through Post-ProcessingMain6 citations
  577. CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model GenerationMain6 citations
  578. Data Contamination Can Cross Language BarriersMain6 citations
  579. Data, Data Everywhere: A Guide for Pretraining Dataset ConstructionMain6 citations
  580. Defining Knowledge: Bridging Epistemology and Large Language ModelsMain6 citations
  581. Devil’s Advocate: Anticipatory Reflection for LLM Agentsfinding6 citations
  582. DiVERT: Distractor Generation with Variational Errors Represented as Text for Math Multiple-choice QuestionsMain6 citations
  583. Divine LLaMAs: Bias, Stereotypes, Stigmatization, and Emotion Representation of Religion in Large Language Modelsfinding6 citations
  584. Do We Need Language-Specific Fact-Checking Models? The Case of ChineseMain6 citations
  585. Don’t Forget Your Reward Values: Language Model Alignment via Value-based CalibrationMain6 citations
  586. Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Modelsfinding6 citations
  587. Empowering Multi-step Reasoning across Languages via Program-Aided Language ModelsMain6 citations
  588. FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy DistillationMain6 citations
  589. Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?Main6 citations
  590. Fine-grained Pluggable Gradient Ascent for Knowledge Unlearning in Language ModelsMain6 citations
  591. FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language ModelsSystem Demonstrations6 citations
  592. From RAG to Riches: Retrieval Interlaced with Sequence GenerationMain6 citations
  593. GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-ExplanationMain6 citations
  594. Generalized Measures of Anticipation and Responsivity in Online Language Processingfinding6 citations
  595. Granular Privacy Control for Geolocation with Vision Language ModelsMain6 citations
  596. Hate Personified: Investigating the role of LLMs in content moderationMain6 citations
  597. Holistic Evaluation for Interleaved Text-and-Image GenerationMain6 citations
  598. How You Prompt Matters! Even Task-Oriented Constraints in Instructions Affect LLM-Generated Text Detectionfinding6 citations
  599. I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated ResponsesMain6 citations
  600. Inference-Time Language Model Alignment via Integrated Value Guidancefinding6 citations
  601. Instruction Matters: A Simple yet Effective Task Selection for Optimized Instruction Tuning of Specific TasksMain6 citations
  602. IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commercefinding6 citations
  603. KidLM: Advancing Language Models for Children – Early Insights and Future DirectionsMain6 citations
  604. Let Me Speak Freely? A Study On The Impact Of Format Restrictions On Large Language Model Performance.Industry6 citations
  605. M2QA: Multi-domain Multilingual Question Answeringfinding6 citations
  606. MATE: Meet At The Embedding - Connecting Images with Long Textsfinding6 citations
  607. Mechanistic Understanding and Mitigation of Language Model Non-Factual Hallucinationsfinding6 citations
  608. Memorize Step by Step: Efficient Long-Context Prefilling with Incremental Memory and Decremental ChunkMain6 citations
  609. Mitigating Open-Vocabulary Caption HallucinationsMain6 citations
  610. Mitigating the Language Mismatch and Repetition Issues in LLM-based Machine Translation via Model EditingMain6 citations
  611. MobileQuant: Mobile-friendly Quantization for On-device Language Modelsfinding6 citations
  612. MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical ReasoningMain6 citations
  613. Multi-dimensional Evaluation of Empathetic Dialogue Responsesfinding6 citations
  614. Multi-expert Prompting Improves Reliability, Safety and Usefulness of Large Language ModelsMain6 citations
  615. No Culture Left Behind: ArtELingo-28, a Benchmark of WikiArt with Captions in 28 LanguagesMain6 citations
  616. Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model AlignmentMain6 citations
  617. On the Role of Context in Reading Time PredictionMain6 citations
  618. On the Similarity of Circuits across Languages: a Case Study on the Subject-verb Agreement Taskfinding6 citations
  619. Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative DecodingMain6 citations
  620. PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomesfinding6 citations
  621. PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization EvaluationMain6 citations
  622. Python is Not Always the Best Choice: Embracing Multilingual Program of ThoughtsMain6 citations
  623. Quantifying Generative Media Bias with a Corpus of Real-world and Generated News Articlesfinding6 citations
  624. RE-RAG: Improving Open-Domain QA Performance and Interpretability with Relevance Estimator in Retrieval-Augmented GenerationMain6 citations
  625. Re-ReST: Reflection-Reinforced Self-Training for Language AgentsMain6 citations
  626. Scaling Laws for Linear Complexity Language ModelsMain6 citations
  627. Sonnet or Not, Bot? Poetry Evaluation for Large Models and Datasetsfinding6 citations
  628. StraGo: Harnessing Strategic Guidance for Prompt Optimizationfinding6 citations
  629. Structure Guided Prompt: Instructing Large Language Model in Multi-Step Reasoning by Exploring Graph Structure of the TextMain6 citations
  630. Surveying the Dead Minds: Historical-Psychological Text Analysis with Contextualized Construct Representation (CCR) for Classical ChineseMain6 citations
  631. SynthesizRR: Generating Diverse Datasets with Retrieval AugmentationMain6 citations
  632. Towards Cross-Cultural Machine Translation with Retrieval-Augmented Generation from Multilingual Knowledge GraphsMain6 citations
  633. Towards Robust Speech Representation Learning for Thousands of LanguagesMain6 citations
  634. UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and GenerationMain6 citations
  635. Vanessa: Visual Connotation and Aesthetic Attributes Understanding Network for Multimodal Aspect-based Sentiment Analysisfinding6 citations
  636. WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language ModelsSystem Demonstrations6 citations
  637. Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language ModelsMain6 citations
  638. mABC: Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecturefinding6 citations
  639. sign.mt: Real-Time Multilingual Sign Language Translation ApplicationSystem Demonstrations6 citations
  640. Adaptive Contrastive Decoding in Retrieval-Augmented Generation for Handling Noisy Contextsfinding5 citations
  641. Adversarial Math Word Problem Generationfinding5 citations
  642. Are LLMs Good Annotators for Discourse-level Event Relation Extraction?finding5 citations
  643. ArxivDIGESTables: Synthesizing Scientific Literature into Tables using Language ModelsMain5 citations
  644. Ask the experts: sourcing a high-quality nutrition counseling dataset through Human-AI collaborationfinding5 citations
  645. Augmenting Black-box LLMs with Medical Textbooks for Biomedical Question Answeringfinding5 citations
  646. Bayesian Calibration of Win Rate Estimation with LLM EvaluatorsMain5 citations
  647. BiasDora: Exploring Hidden Biased Associations in Vision-Language Modelsfinding5 citations
  648. Boosting Scientific Concepts Understanding: Can Analogy from Teacher Models Empower Student Models?Main5 citations
  649. CLEAR: Can Language Models Really Understand Causal Graphs?finding5 citations
  650. ClaimVer: Explainable Claim-Level Verification and Evidence Attribution of Text Through Knowledge Graphsfinding5 citations
  651. CoEvol: Constructing Better Responses for Instruction Finetuning through Multi-Agent CooperationMain5 citations
  652. Course-Correction: Safety Alignment Using Synthetic PreferencesIndustry5 citations
  653. Crafting Personalized Agents through Retrieval-Augmented Generation on Editable Memory GraphsMain5 citations
  654. DYNAMICQA: Tracing Internal Knowledge Conflicts in Language Modelsfinding5 citations
  655. DataNarrative: Automated Data-Driven Storytelling with Visualizations and TextsMain5 citations
  656. Dissecting Fine-Tuning Unlearning in Large Language ModelsMain5 citations
  657. Do LLMs Overcome Shortcut Learning? An Evaluation of Shortcut Challenges in Large Language ModelsMain5 citations
  658. Document-level Causal Relation Extraction with Knowledge-guided Binary Question Answeringfinding5 citations
  659. DogeRM: Equipping Reward Models with Domain Knowledge through Model MergingMain5 citations
  660. EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech ModelsMain5 citations
  661. Evaluating Diversity in Automatic Poetry GenerationMain5 citations
  662. Exploring Hint Generation Approaches for Open-Domain Question Answeringfinding5 citations
  663. Exploring the Best Practices of Query Expansion with Large Language Modelsfinding5 citations
  664. Fine-Tuning Large Language Models for Stock Return Prediction Using NewsflowIndustry5 citations
  665. Grasping the Essentials: Tailoring Large Language Models for Zero-Shot Relation ExtractionMain5 citations
  666. HEART-felt Narratives: Tracing Empathy and Narrative Style in Personal Stories with LLMsMain5 citations
  667. HiFT: A Hierarchical Full Parameter Fine-Tuning StrategyMain5 citations
  668. How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?Main5 citations
  669. HyperBERT: Mixing Hypergraph-Aware Layers with Language Models for Node Classification on Text-Attributed Hypergraphsfinding5 citations
  670. Improve Dense Passage Retrieval with Entailment TuningMain5 citations
  671. Improving Demonstration Diversity by Human-Free Fusing for Text-to-SQLfinding5 citations
  672. Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learningfinding5 citations
  673. Improving Minimum Bayes Risk Decoding with Multi-PromptMain5 citations
  674. Instruction Fine-Tuning: Does Prompt Loss Matter?Main5 citations
  675. Investigating Mysteries of CoT-Augmented DistillationMain5 citations
  676. LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraintsfinding5 citations
  677. LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational HistoryMain5 citations
  678. Learning Musical Representations for Music Performance Question Answeringfinding5 citations
  679. Learning Personalized Alignment for Evaluating Open-ended Text GenerationMain5 citations
  680. Learning to Retrieve Iteratively for In-Context LearningMain5 citations
  681. MATHWELL: Generating Educational Math Word Problems Using Teacher Annotationsfinding5 citations
  682. MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimizationfinding5 citations
  683. Make Large Language Model a Better Rankerfinding5 citations
  684. Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decodingfinding5 citations
  685. Mixed Distillation Helps Smaller Language Models Reason Betterfinding5 citations
  686. Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of ModulesMain5 citations
  687. On Fake News Detection with LLM Enhanced Semantics MiningMain5 citations
  688. On the token distance modeling ability of higher RoPE attention dimensionfinding5 citations
  689. Optimizing Code Retrieval: High-Quality and Scalable Dataset Annotation through Large Language ModelsMain5 citations
  690. PPTC-R benchmark: Towards Evaluating the Robustness of Large Language Models for PowerPoint Task Completionfinding5 citations
  691. Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image GenerationMain5 citations
  692. Preserving Generalization of Language models in Few-shot Continual Relation ExtractionMain5 citations
  693. RAG-HAT: A Hallucination-Aware Tuning Pipeline for LLM in Retrieval-Augmented GenerationIndustry5 citations
  694. Re-Invoke: Tool Invocation Rewriting for Zero-Shot Tool Retrievalfinding5 citations
  695. Retrieved In-Context Principles from Previous MistakesMain5 citations
  696. Revisiting Automated Evaluation for Long-form Table Question AnsweringMain5 citations
  697. SEEKR: Selective Attention-Guided Knowledge Retention for Continual Learning of Large Language ModelsMain5 citations
  698. SEER: Self-Aligned Evidence Extraction for Retrieval-Augmented GenerationMain5 citations
  699. STORYSUMM: Evaluating Faithfulness in Story SummarizationMain5 citations
  700. SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic GradingMain5 citations
  701. Self-Recognition in Language Modelsfinding5 citations
  702. Sprout: Green Generative AI with Carbon-Efficient LLM InferenceMain5 citations
  703. StablePrompt : Automatic Prompt Tuning using Reinforcement Learning for Large Language ModelMain5 citations
  704. Structured Chain-of-Thought Prompting for Few-Shot Generation of Content-Grounded QA Conversationsfinding5 citations
  705. Style-Compress: An LLM-Based Prompt Compression Framework Considering Task-Specific Stylesfinding5 citations
  706. Synthetic Multimodal Question Generationfinding5 citations
  707. T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient EmbeddingsMain5 citations
  708. The Base-Rate Effect on LLM Benchmark Performance: Disambiguating Test-Taking Strategies from Benchmark Performancefinding5 citations
  709. The Instinctive Bias: Spurious Images lead to Illusion in MLLMsMain5 citations
  710. The LLM Effect: Are Humans Truly Using LLMs, or Are They Being Influenced By Them Instead?Main5 citations
  711. Towards More Robust NLP System Evaluation: Handling Missing Scores in Benchmarksfinding5 citations
  712. TriageAgent: Towards Better Multi-Agents Collaborations for Large Language Model-Based Clinical Triagefinding5 citations
  713. TroL: Traversal of Layers for Large Language and Vision ModelsMain5 citations
  714. VIMI: Grounding Video Generation through Multi-modal InstructionMain5 citations
  715. VIVA: A Benchmark for Vision-Grounded Decision-Making with Human ValuesMain5 citations
  716. Vision-Language Model Fine-Tuning via Simple Parameter-Efficient ModificationMain5 citations
  717. Voices Unheard: NLP Resources and Models for Yorùbá Regional DialectsMain5 citations
  718. WebOlympus: An Open Platform for Web Agents on Live WebsitesSystem Demonstrations5 citations
  719. When Parts Are Greater Than Sums: Individual LLM Components Can Outperform Full ModelsMain5 citations
  720. Women Are Beautiful, Men Are Leaders: Gender Stereotypes in Machine Translation and Language Modelingfinding5 citations
  721. xTower: A Multilingual LLM for Explaining and Correcting Translation Errorsfinding5 citations
  722. 1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?Main4 citations
  723. A Simple yet Effective Training-free Prompt-free Approach to Chinese Spelling Correction Based on Large Language ModelsMain4 citations
  724. A Usage-centric Take on Intent Understanding in E-CommerceMain4 citations
  725. ABSEval: An Agent-based Framework for Script EvaluationMain4 citations
  726. APPLS: Evaluating Evaluation Metrics for Plain Language SummarizationMain4 citations
  727. AUTOGEN STUDIO: A No-Code Developer Tool for Building and Debugging Multi-Agent SystemsSystem Demonstrations4 citations
  728. Ada-Instruct: Adapting Instruction Generators for Complex Reasoningfinding4 citations
  729. Adaption-of-Thought: Learning Question Difficulty Improves Large Language Models for ReasoningMain4 citations
  730. Adaptive Question Answering: Enhancing Language Model Proficiency for Addressing Knowledge Conflicts with Source CitationsMain4 citations
  731. Altogether: Image Captioning via Re-aligning Alt-textMain4 citations
  732. An Audit on the Perspectives and Challenges of Hallucinations in NLPMain4 citations
  733. Annotation alignment: Comparing LLM and human annotations of conversational safetyMain4 citations
  734. Attribute or Abstain: Large Language Models as Long Document AssistantsMain4 citations
  735. Better Alignment with Instruction Back-and-Forth Translationfinding4 citations
  736. Breaking Language Barriers: Cross-Lingual Continual Pre-Training at ScaleMain4 citations
  737. CELLO: Causal Evaluation of Large Vision-Language ModelsMain4 citations
  738. CUTE: Measuring LLMs’ Understanding of Their TokensMain4 citations
  739. Calibrating LLMs with Preference Optimization on Thought Trees for Generating Rationale in Science Question Scoringfinding4 citations
  740. Calibrating the Confidence of Large Language Models by Eliciting FidelityMain4 citations
  741. Can LLMs Learn Uncertainty on Their Own? Expressing Uncertainty Effectively in A Self-Training MannerMain4 citations
  742. Can we teach language models to gloss endangered languages?finding4 citations
  743. Characterizing LLM Abstention Behavior in Science QA with Context Perturbationsfinding4 citations
  744. CoBa: Convergence Balancer for Multitask Finetuning of Large Language ModelsMain4 citations
  745. CodeAgent: Autonomous Communicative Agents for Code ReviewMain4 citations
  746. Collective Critics for Creative Story GenerationMain4 citations
  747. Connecting the Dots: Evaluating Abstract Reasoning Capabilities of LLMs Using the New York Times Connections Word GameMain4 citations
  748. Context Matters: Pushing the Boundaries of Open-Ended Answer Generation with Graph-Structured Knowledge ContextIndustry4 citations
  749. Context-aware Watermark with Semantic Balanced Green-red Lists for Large Language ModelsMain4 citations
  750. Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language GenerationMain4 citations
  751. ConvKGYarn: Spinning Configurable and Scalable Conversational Knowledge Graph QA Datasets with Large Language ModelsIndustry4 citations
  752. Cross-Domain Audio Deepfake Detection: Dataset and AnalysisMain4 citations
  753. DA-Code: Agent Data Science Code Generation Benchmark for Large Language ModelsMain4 citations
  754. Distractor Generation in Multiple-Choice Tasks: A Survey of Methods, Datasets, and EvaluationMain4 citations
  755. Does Large Language Model Contain Task-Specific Neurons?Main4 citations
  756. Don’t Just Say “I don’t know”! Self-aligning Large Language Models for Responding to Unknown Questions with ExplanationsMain4 citations
  757. EFUF: Efficient Fine-Grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language ModelsMain4 citations
  758. Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding BridgeMain4 citations
  759. Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware TrainingMain4 citations
  760. Enhancing Agent Learning through World Dynamics Modelingfinding4 citations
  761. Enhancing Alignment using Curriculum Learning & Ranked Preferencesfinding4 citations
  762. Enhancing High-order Interaction Awareness in LLM-based Recommender ModelMain4 citations
  763. EvoR: Evolving Retrieval for Code Generationfinding4 citations
  764. Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but InconsistentlyMain4 citations
  765. Exploring Design Choices for Building Language-Specific LLMsfinding4 citations
  766. Eyes Don’t Lie: Subjective Hate Annotation and Detection with GazeMain4 citations
  767. Fine-Grained Prediction of Reading Comprehension from Eye MovementsMain4 citations
  768. Fine-tuning Smaller Language Models for Question Answering over Financial Documentsfinding4 citations
  769. Focused Large Language Models are Stable Many-Shot LearnersMain4 citations
  770. From Generation to Selection: Findings of Converting Analogical Problem-Solving into Multiple-Choice Questionsfinding4 citations
  771. From Insights to Actions: The Impact of Interpretability and Analysis Research on NLPMain4 citations
  772. Game on Tree: Visual Hallucination Mitigation via Coarse-to-Fine View Tree and Game TheoryMain4 citations
  773. Generating Media Background Checks for Automated Source Critical Reasoningfinding4 citations
  774. Geneverse: A Collection of Open-source Multimodal Large Language Models for Genomic and Proteomic Researchfinding4 citations
  775. Getting More from Less: Large Language Models are Good Spontaneous Multilingual LearnersMain4 citations
  776. Glue pizza and eat rocks - Exploiting Vulnerabilities in Retrieval-Augmented Generative ModelsMain4 citations
  777. Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn InteractionMain4 citations
  778. How Do Humans Write Code? Large Models Do It the Same Way TooMain4 citations
  779. How Personality Traits Influence Negotiation Outcomes? A Simulation based on Large Language Modelsfinding4 citations
  780. IDEAW: Robust Neural Audio Watermarking with Invertible Dual-EmbeddingMain4 citations
  781. Implicit Personalization in Language Models: A Systematic Studyfinding4 citations
  782. Improve Student’s Reasoning Generalizability through Cascading Decomposed CoTs DistillationMain4 citations
  783. InfiniPot: Infinite Context Processing on Memory-Constrained LLMsMain4 citations
  784. Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Datafinding4 citations
  785. Investigating LLMs as Voting Assistants via Contextual Augmentation: A Case Study on the European Parliament Elections 2024Main4 citations
  786. Is C4 Dataset Optimal for Pruning? An Investigation of Calibration Data for LLM PruningMain4 citations
  787. Jailbreaking LLMs with Arabic Transliteration and ArabiziMain4 citations
  788. Knowledge Planning in Large Language Models for Domain-Aligned Counseling SummarizationMain4 citations
  789. LLM Tropes: Revealing Fine-Grained Values and Opinions in Large Language Modelsfinding4 citations
  790. LLM-Based Multi-Hop Question Answering with Knowledge Graph Integration in Evolving Environmentsfinding4 citations
  791. LOCR: Location-Guided Transformer for Optical Character Recognitionfinding4 citations
  792. Large Language Models are Students at Various Levels: Zero-shot Question Difficulty Estimationfinding4 citations
  793. Layer-wise Importance Matters: Less Memory for Better Performance in Parameter-efficient Fine-tuning of Large Language Modelsfinding4 citations
  794. Learning from Natural Language Explanations for Generalizable Entity MatchingMain4 citations
  795. Less is More: Making Smaller Language Models Competent Subgraph Retrievers for Multi-hop KGQAfinding4 citations
  796. MACAROON: Training Vision-Language Models To Be Your Engaged Partnersfinding4 citations
  797. MAIR: A Massive Benchmark for Evaluating Instructed RetrievalMain4 citations
  798. MINERS: Multilingual Language Models as Semantic Retrieversfinding4 citations
  799. MUSCLE: A Model Update Strategy for Compatible LLM Evolutionfinding4 citations
  800. MemeCLIP: Leveraging CLIP Representations for Multimodal Meme ClassificationMain4 citations
  801. MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuningfinding4 citations
  802. MiniConGTS: A Near Ultimate Minimalist Contrastive Grid Tagging Scheme for Aspect Sentiment Triplet ExtractionMain4 citations
  803. MoE-I2: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decompositionfinding4 citations
  804. Modeling Gender and Dialect Bias in Automatic Speech Recognitionfinding4 citations
  805. Modeling Human Subjectivity in LLMs Using Explicit and Implicit Human Factors in Personasfinding4 citations
  806. More Than Catastrophic Forgetting: Integrating General Capabilities For Domain-Specific LLMsMain4 citations
  807. Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data AnnotationMain4 citations
  808. Multi-Stage Balanced Distillation: Addressing Long-Tail Challenges in Sequence-Level Knowledge Distillationfinding4 citations
  809. On Sensitivity of Learning with Limited Labelled Data to the Effects of Randomness: Impact of Interactions and Systematic ChoicesMain4 citations
  810. On Training Data Influence of GPT ModelsMain4 citations
  811. On the Relationship between Truth and Political Bias in Language ModelsMain4 citations
  812. OneGen: Efficient One-Pass Unified Generation and Retrieval for LLMsfinding4 citations
  813. OpenOmni: A Collaborative Open Source Tool for Building Future-Ready Multimodal Conversational AgentsSystem Demonstrations4 citations
  814. Paraphrase Types Elicit Prompt Engineering CapabilitiesMain4 citations
  815. Position Engineering: Boosting Large Language Models through Positional Information ManipulationMain4 citations
  816. Prompts have evil twinsMain4 citations
  817. PropTest: Automatic Property Testing for Improved Visual Programmingfinding4 citations
  818. R2AG: Incorporating Retrieval Information into Retrieval Augmented Generationfinding4 citations
  819. R3-NL2GQL: A Model Coordination and Knowledge Graph Alignment Approach for NL2GQLfinding4 citations
  820. Rationale-Aware Answer Verification by Pairwise Self-EvaluationMain4 citations
  821. Recurrent Alignment with Hard Attention for Hierarchical Text RatingMain4 citations
  822. Rethinking the Reversal Curse of LLMs: a Prescription from Human Knowledge ReversalMain4 citations
  823. Retrieving, Rethinking and Revising: The Chain-of-Verification Can Improve Retrieval Augmented Generationfinding4 citations
  824. Robust AI-Generated Text Detection by Restricted Embeddingsfinding4 citations
  825. Robust Text Classification: Analyzing Prototype-Based Networksfinding4 citations
  826. SH2: Self-Highlighted Hesitation Helps You Decode More Truthfullyfinding4 citations
  827. SPINACH: SPARQL-Based Information Navigation for Challenging Real-World Questionsfinding4 citations
  828. STARD: A Chinese Statute Retrieval Dataset Derived from Real-life Queries by Non-professionalsfinding4 citations
  829. SYNFAC-EDIT: Synthetic Imitation Edit Feedback for Factual Alignment in Clinical SummarizationMain4 citations
  830. Scalable Data Ablation Approximations for Language Models through Modular Training and MergingMain4 citations
  831. SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generationfinding4 citations
  832. SecureSQL: Evaluating Data Leakage of Large Language Models as Natural Language Interfaces to Databasesfinding4 citations
  833. SignCLIP: Connecting Text and Sign Language by Contrastive LearningMain4 citations
  834. Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMsfinding4 citations
  835. Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?finding4 citations
  836. StablePT : Towards Stable Prompting for Few-shot Learning via Input Separationfinding4 citations
  837. Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?Main4 citations
  838. Strength Lies in Differences! Improving Strategy Planning for Non-collaborative Dialogues via Diversified User SimulationMain4 citations
  839. Symbolic Prompt Program Search: A Structure-Aware Approach to Efficient Compile-Time Prompt Optimizationfinding4 citations
  840. SynTQA: Synergistic Table-based Question Answering via Mixture of Text-to-SQL and E2E TQAfinding4 citations
  841. TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Modelsfinding4 citations
  842. Targeted Multilingual Adaptation for Low-resource Language Familiesfinding4 citations
  843. Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech RecognitionMain4 citations
  844. Task Oriented In-Domain Data AugmentationMain4 citations
  845. Teaching LLMs to Abstain across Languages via Multilingual FeedbackMain4 citations
  846. The Factuality Tax of Diversity-Intervened Text-to-Image Generation: Benchmark and Fact-Augmented InterventionMain4 citations
  847. The Odyssey of Commonsense Causality: From Foundational Benchmarks to Cutting-Edge ReasoningMain4 citations
  848. TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token MergingMain4 citations
  849. To the Globe (TTG): Towards Language-Driven Guaranteed Travel PlanningSystem Demonstrations4 citations
  850. Topic Modeling: Contextual Token Embeddings Are All You Needfinding4 citations
  851. Tracking the perspectives of interacting language modelsMain4 citations
  852. TraveLER: A Modular Multi-LMM Agent Framework for Video Question-AnsweringMain4 citations
  853. Understanding the Therapeutic Relationship between Counselors and Clients in Online Text-based Counseling using LLMsfinding4 citations
  854. Unlocking the Potential of Model Merging for Low-Resource Languagesfinding4 citations
  855. Unraveling the Truth: Do VLMs really Understand Charts? A Deep Dive into Consistency and Robustnessfinding4 citations
  856. Unveiling the Lexical Sensitivity of LLMs: Combinatorial Optimization for Prompt EnhancementMain4 citations
  857. Verifiable, Debuggable, and Repairable Commonsense Logical Reasoning via LLM-based Theory ResolutionMain4 citations
  858. What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Modelsfinding4 citations
  859. Why do LLaVA Vision-Language Models Reply to Images in English?finding4 citations
  860. Word Alignment as Preference for Machine TranslationMain4 citations
  861. World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and FilteringMain4 citations
  862. WorryWords: Norms of Anxiety Association for over 44k English WordsMain4 citations
  863. XplainLLM: A Knowledge-Augmented Dataset for Reliable Grounded Explanations in LLMsMain4 citations
  864. “Flex Tape Can’t Fix That”: Bias and Misinformation in Edited Language ModelsMain4 citations
  865. “Seeing the Big through the Small”: Can LLMs Approximate Human Judgment Distributions on NLI from a Few Explanations?finding4 citations
  866. “We Demand Justice!”: Towards Social Context Grounding of Political TextsMain4 citations
  867. A Generic Method for Fine-grained Category Discovery in Natural Language TextsMain3 citations
  868. A SMART Mnemonic Sounds like “Glue Tonic”: Mixing LLMs with Student Feedback to Make Mnemonic Learning StickMain3 citations
  869. A Survey on Open Information Extraction from Rule-based Model to Large Language Modelfinding3 citations
  870. ACE: A LLM-based Negotiation Coaching SystemMain3 citations
  871. AMPO: Automatic Multi-Branched Prompt OptimizationMain3 citations
  872. ARM: An Alignment-and-Replacement Module for Chinese Spelling Check Based on LLMsMain3 citations
  873. ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household ActivitiesMain3 citations
  874. Activation Scaling for Steering and Interpreting Language Modelsfinding3 citations
  875. Advancing Adversarial Suffix Transfer Learning on Aligned Large Language ModelsMain3 citations
  876. AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentationfinding3 citations
  877. Aligning Large Language Models with Diverse Political ViewpointsMain3 citations
  878. Alignment-Enhanced Decoding: Defending Jailbreaks via Token-Level Adaptive Refining of Probability DistributionsMain3 citations
  879. AlphaLoRA: Assigning LoRA Experts Based on Layer Training QualityMain3 citations
  880. An Electoral Approach to Diversify LLM-based Multi-Agent Collective Decision-MakingMain3 citations
  881. An Unsupervised Approach to Achieve Supervised-Level Explainability in Healthcare RecordsMain3 citations
  882. Atomic Inference for NLI with Generated Facts as AtomsMain3 citations
  883. Atomic Self-Consistency for Better Long Form GenerationsMain3 citations
  884. Attribute Diversity Determines the Systematicity Gap in VQAMain3 citations
  885. AuriSRec: Adversarial User Intention Learning in Sequential Recommendationfinding3 citations
  886. AutoScraper: A Progressive Understanding Web Agent for Web Scraper GenerationMain3 citations
  887. BPO: Staying Close to the Behavior LLM Creates Better Online LLM AlignmentMain3 citations
  888. BaitAttack: Alleviating Intention Shift in Jailbreak Attacks via Adaptive Bait CraftingMain3 citations
  889. Better Call SAUL: Fluent and Consistent Language Model Editing with Generation Regularizationfinding3 citations
  890. Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Modelsfinding3 citations
  891. Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIPfinding3 citations
  892. Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metricfinding3 citations
  893. Can Large Language Models Grasp Legal Theories? Enhance Legal Reasoning with Insights from Multi-Agent Collaborationfinding3 citations
  894. Can Large Language Models Learn Independent Causal Mechanisms?Main3 citations
  895. Can Machine Unlearning Reduce Social Bias in Language Models?Industry3 citations
  896. Can Transformers Learn n-gram Language Models?Main3 citations
  897. Can We Trust the Performance Evaluation of Uncertainty Estimation Methods in Text Summarization?Main3 citations
  898. CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialoguesfinding3 citations
  899. Can’t Remember Details in Long Documents? You Need Some R&Rfinding3 citations
  900. Casablanca: Data and Models for Multidialectal Arabic Speech RecognitionMain3 citations
  901. ClimRetrieve: A Benchmarking Dataset for Information Retrieval from Corporate Climate DisclosuresMain3 citations
  902. Collaborative Performance Prediction for Large Language ModelsMain3 citations
  903. Consecutive Batch Model Editing with HooK LayersMain3 citations
  904. Consistent Autoformalization for Constructing Mathematical LibrariesMain3 citations
  905. Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashionMain3 citations
  906. Cost-Efficient Subjective Task Annotation and Modeling through Few-Shot Annotator Adaptationfinding3 citations
  907. Decoding Matters: Addressing Amplification Bias and Homogeneity Issue in Recommendations for Large Language ModelsMain3 citations
  908. Decompose and Compare Consistency: Measuring VLMs’ Answer Reliability via Task-Decomposition Consistency ComparisonMain3 citations
  909. Detecting Subtle Differences between Human and Model Languages Using Spectrum of Relative LikelihoodMain3 citations
  910. DictDis: Dictionary Constrained Disambiguation for Improved NMTfinding3 citations
  911. Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planningfinding3 citations
  912. DocCGen: Document-based Controlled Code GenerationMain3 citations
  913. ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital EnvironmentsMain3 citations
  914. ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized TransformersMain3 citations
  915. EVEDIT: Event-based Knowledge Editing for Deterministic Knowledge PropagationMain3 citations
  916. Efficient Answer Retrieval System (EARS): Combining Local DB Search and Web Search for Generative QAIndustry3 citations
  917. Enabling Discriminative Reasoning in LLMs for Legal Judgment Predictionfinding3 citations
  918. Enhancing Language Model Factuality via Activation-Based Confidence Calibration and Guided DecodingMain3 citations
  919. Enhancing Post-Hoc Attributions in Long Document Comprehension via Coarse Grained Answer DecompositionMain3 citations
  920. Enhancing Temporal Sensitivity and Reasoning for Time-Sensitive Question Answeringfinding3 citations
  921. Evaluating Differentially Private Synthetic Data Generation in High-Stakes Domainsfinding3 citations
  922. Evidence Retrieval for Fact Verification using Multi-stage Rerankingfinding3 citations
  923. Experience as Source for Anticipation and Planning: Experiential Policy Learning for Target-driven Recommendation Dialoguesfinding3 citations
  924. Explaining Graph Neural Networks with Large Language Models: A Counterfactual Perspective on Molecule Graphsfinding3 citations
  925. Explaining and Improving Contrastive Decoding by Extrapolating the Probabilities of a Huge and Hypothetical LMMain3 citations
  926. Exploring Multilingual Concepts of Human Values in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?finding3 citations
  927. Exploring the Practicality of Generative Retrieval on Dynamic CorporaMain3 citations
  928. FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Modelsfinding3 citations
  929. Fighting Randomness with Randomness: Mitigating Optimisation Instability of Fine-Tuning using Delayed Ensemble and Noisy Interpolationfinding3 citations
  930. Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language ModelsMain3 citations
  931. From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption EnrichmentMain3 citations
  932. From LLMs to MLLMs: Exploring the Landscape of Multimodal JailbreakingMain3 citations
  933. From Reading to Compressing: Exploring the Multi-document Reader for Prompt Compressionfinding3 citations
  934. Granularity is crucial when applying differential privacy to text: An investigation for neural machine translationfinding3 citations
  935. Greenback Bears and Fiscal Hawks: Finance is a Jungle and Text Embeddings Must AdaptIndustry3 citations
  936. HalluMeasure: Fine-grained Hallucination Measurement Using Chain-of-Thought ReasoningMain3 citations
  937. Householder Pseudo-Rotation: A Novel Approach to Activation Editing in LLMs with Direction-Magnitude PerspectiveMain3 citations
  938. How Do Your Code LLMs perform? Empowering Code Instruction Tuning with Really Good DataMain3 citations
  939. IPL: Leveraging Multimodal Large Language Models for Intelligent Product ListingIndustry3 citations
  940. In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Modelsfinding3 citations
  941. Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation TasksMain3 citations
  942. Is Safer Better? The Impact of Guardrails on the Argumentative Strength of LLMs in Hate Speech CounteringMain3 citations
  943. KB-Plugin: A Plug-and-play Framework for Large Language Models to Induce Programs over Low-resourced Knowledge BasesMain3 citations
  944. Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative FrameworkSystem Demonstrations3 citations
  945. Knowledge Navigator: LLM-guided Browsing Framework for Exploratory Search in Scientific Literaturefinding3 citations
  946. Knowledge-Aware Reasoning over Multimodal Semi-structured Tablesfinding3 citations
  947. KnowledgeSG: Privacy-Preserving Synthetic Text Generation with Knowledge Distillation from ServerMain3 citations
  948. LAMBDA: Large Language Model-Based Data Augmentation for Multi-Modal Machine Translationfinding3 citations
  949. LLM generated responses to mitigate the impact of hate speechfinding3 citations
  950. Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak AttacksMain3 citations
  951. Large Language Models Know What is Key Visual Entity: An LLM-assisted Multimodal Retrieval for VQAMain3 citations
  952. Lexically Grounded Subword SegmentationMain3 citations
  953. LinguAlchemy: Fusing Typological and Geographical Elements for Unseen Language Generalizationfinding3 citations
  954. Llamipa: An Incremental Discourse Parserfinding3 citations
  955. LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language ModelsMain3 citations
  956. MMTE: Corpus and Metrics for Evaluating Machine Translation Quality of Metaphorical LanguageMain3 citations
  957. MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-MakingMain3 citations
  958. MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression ComprehensionMain3 citations
  959. Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Modelsfinding3 citations
  960. Major Entity Identification: A Generalizable Alternative to Coreference ResolutionMain3 citations
  961. MathFish: Evaluating Language Model Math Reasoning via Grounding in Educational Curriculafinding3 citations
  962. MetaReflection: Learning Instructions for Language Agents using Past ReflectionsMain3 citations
  963. MiRAGeNews: Multimodal Realistic AI-Generated News Detectionfinding3 citations
  964. MisinfoEval: Generative AI in the Era of “Alternative Facts”Main3 citations
  965. Modeling Nonnative Sentence Processing with L2 Language ModelsMain3 citations
  966. Modeling User Preferences with Automatic Metrics: Creating a High-Quality Preference Dataset for Machine TranslationMain3 citations
  967. Multi-Level Information Retrieval Augmented Generation for Knowledge-based Visual Question AnsweringMain3 citations
  968. Multimodal Misinformation Detection by Learning from Synthetic Data with Multimodal LLMsfinding3 citations
  969. Narrative-of-Thought: Improving Temporal Reasoning of Large Language Models via Recounted Narrativesfinding3 citations
  970. Navigating the Shortcut Maze: A Comprehensive Analysis of Shortcut Learning in Text Classification by Language Modelsfinding3 citations
  971. Nearest Neighbor Normalization Improves Multimodal RetrievalMain3 citations
  972. Not (yet) the whole story: Evaluating Visual Storytelling Requires More than Measuring Coherence, Grounding, and Repetitionfinding3 citations
  973. Not All Preference Pairs Are Created Equal: A Recipe for Annotation-Efficient Iterative Preference Learningfinding3 citations
  974. Null-Shot Prompting: Rethinking Prompting Large Language Models With HallucinationMain3 citations
  975. On the Robustness of Editing Large Language ModelsMain3 citations
  976. One Model is All You Need: ByT5-Sanskrit, a Unified Model for Sanskrit NLP Tasksfinding3 citations
  977. OpenResearcher: Unleashing AI for Accelerated Scientific ResearchSystem Demonstrations3 citations
  978. Optimizing Language Models with Fair and Stable Reward Composition in Reinforcement LearningMain3 citations
  979. PREDICT: Multi-Agent-based Debate Simulation for Generalized Hate Speech DetectionMain3 citations
  980. PURE: Aligning LLM via Pluggable Query Reformulation for Enhanced Helpfulnessfinding3 citations
  981. PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Modelsfinding3 citations
  982. PairDistill: Pairwise Relevance Distillation for Dense RetrievalMain3 citations
  983. Plausibly Problematic Questions in Multiple-Choice Benchmarks for Commonsense Reasoningfinding3 citations
  984. Pragmatic Norms Are All You Need – Why The Symbol Grounding Problem Does Not Apply to LLMsMain3 citations
  985. Pretraining Language Models Using TranslationeseMain3 citations
  986. Private prediction for large-scale synthetic text generationfinding3 citations
  987. Promoting Data and Model Privacy in Federated Learning through Quantized LoRAfinding3 citations
  988. QPaug: Question and Passage Augmentation for Open-Domain Question Answering of LLMsfinding3 citations
  989. QUDSELECT: Selective Decoding for Questions Under Discussion ParsingMain3 citations
  990. Question-guided Knowledge Graph Re-scoring and Injection for Knowledge Graph Question Answeringfinding3 citations
  991. RESTful-Llama: Connecting User Queries to RESTful APIsIndustry3 citations
  992. Regression Aware Inference with LLMsfinding3 citations
  993. Rethinking Token Reduction for State Space ModelsMain3 citations
  994. Revealing the Parallel Multilingual Learning within Large Language ModelsMain3 citations
  995. Revisiting Query Variation Robustness of Transformer Modelsfinding3 citations
  996. Revisiting the Robustness of Watermarking to Paraphrasing AttacksMain3 citations
  997. RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantizationfinding3 citations
  998. SAFARI: Cross-lingual Bias and Factuality Detection in News Media and News Articlesfinding3 citations
  999. SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian LanguagesMain3 citations
  1000. SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and CalibrationIndustry3 citations

Looking for submission deadlines instead? See the conference deadline calendar.