NAACL 2025 Accepted Papers
The full list of 1,274 papers accepted at NAACL 2025 (North American Chapter of the Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Long: 614Findings: 457Short: 80Industry: 79System Demonstrations: 44
- GPT-NER: Named Entity Recognition via Large Language ModelsFindings421 citations
- RewardBench: Evaluating Reward Models for Language ModelingFindings254 citations
- ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language ModelsLong92 citations
- UFO: A UI-Focused Agent for Windows OS InteractionLong86 citations
- GRAG: Graph Retrieval-Augmented GenerationFindings73 citations
- Huatuo-26M, a Large-scale Chinese Medical QA DatasetFindings71 citations
- In-Context Learning with Long-Context Models: An In-Depth ExplorationLong65 citations
- Simulating Classroom Education with LLM-Empowered AgentsLong61 citations
- EASYTOOL: Enhancing LLM-based Agents with Concise Tool InstructionLong60 citations
- LMMs-Eval: Reality Check on the Evaluation of Large Multimodal ModelsFindings56 citations
- FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language ModelsLong52 citations
- DreamSync: Aligning Text-to-Image Generation with Image Understanding FeedbackLong47 citations
- KMMLU: Measuring Massive Multitask Language Understanding in KoreanLong46 citations
- AudioBench: A Universal Benchmark for Audio Large Language ModelsLong44 citations
- LiPO: Listwise Preference Optimization through Learning-to-RankLong44 citations
- Alleviating Hallucinations of Large Language Models through Induced HallucinationsFindings43 citations
- KnowAgent: Knowledge-Augmented Planning for LLM-Based AgentsFindings41 citations
- Unfamiliar Finetuning Examples Control How Language Models HallucinateLong41 citations
- Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-ImprovementFindings37 citations
- Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language ModelsLong37 citations
- Benchmarking Large Language Models on Answering and Explaining Challenging Medical QuestionsLong35 citations
- FollowIR: Evaluating and Teaching Information Retrieval Models to Follow InstructionsLong34 citations
- ScreenQA: Large-Scale Question-Answer Pairs Over Mobile App ScreenshotsLong34 citations
- xLAM: A Family of Large Action Models to Empower AI Agent SystemsLong34 citations
- The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-DeterminismLong33 citations
- Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion ModelsFindings31 citations
- Hello Again! LLM-powered Personalized Agent for Long-term DialogueLong29 citations
- ImgTrojan: Jailbreaking Vision-Language Models with ONE ImageLong28 citations
- SciAssess: Benchmarking LLM Proficiency in Scientific Literature AnalysisFindings28 citations
- Clarify When Necessary: Resolving Ambiguity Through Interaction with LMsFindings27 citations
- MiLoRA: Harnessing Minor Singular Components for Parameter-Efficient LLM FinetuningLong27 citations
- ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use CapabilitiesFindings27 citations
- What Did I Do Wrong? Quantifying LLMs’ Sensitivity and Consistency to Prompt EngineeringLong26 citations
- Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language ModelsLong24 citations
- Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive DemonstrationsFindings24 citations
- Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific PlotsFindings23 citations
- Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of StereotypesShort23 citations
- ALPACA AGAINST VICUNA: Using LLMs to Uncover Memorization of LLMsLong21 citations
- EvoAgent: Towards Automatic Multi-Agent Generation via Evolutionary AlgorithmsLong21 citations
- Octopus: On-device language model for function calling of software APIsIndustry21 citations
- TESTEVAL: Benchmarking Large Language Models for Test Case GenerationFindings21 citations
- Self-Generated Critiques Boost Reward Modeling for Language ModelsLong20 citations
- COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuningFindings17 citations
- CodexGraph: Bridging Large Language Models and Code Repositories via Code Graph DatabasesLong17 citations
- Improving Reward Models with Synthetic CritiquesFindings17 citations
- Induction Heads as an Essential Mechanism for Pattern Matching in In-context LearningFindings17 citations
- Vision-Language Models Can Self-Improve Reasoning via ReflectionLong17 citations
- CollabStory: Multi-LLM Collaborative Story Generation and Authorship AnalysisFindings15 citations
- Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented GenerationLong15 citations
- Make Every Penny Count: Difficulty-Adaptive Self-Consistency for Cost-Efficient ReasoningFindings15 citations
- RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and RefinementLong15 citations
- Fact-Aware Multimodal Retrieval Augmentation for Accurate Medical Radiology Report GenerationLong14 citations
- MASSW: A New Dataset and Benchmark Tasks for AI-Assisted Scientific WorkflowsFindings14 citations
- Planetarium: A Rigorous Benchmark for Translating Text to Structured Planning LanguagesLong14 citations
- Are We Done with MMLU?Long13 citations
- Ask Optimal Questions: Aligning Large Language Models with Retriever’s Preference in ConversationFindings13 citations
- ChatCRS: Incorporating External Knowledge and Goal Guidance for LLM-based Conversational Recommender SystemsFindings13 citations
- Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with PsychometricsFindings13 citations
- MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer DecodingFindings13 citations
- OLMES: A Standard for Language Model EvaluationsFindings13 citations
- The Russian-focused embedders’ exploration: ruMTEB benchmark and Russian embedding model designLong13 citations
- Can Unconfident LLM Annotations Be Used for Confident Conclusions?Long12 citations
- Direct Preference Optimization of Video Large Multimodal Models from Language Model RewardLong12 citations
- Does Mapo Tofu Contain Coffee? Probing LLMs for Food-related Cultural KnowledgeLong12 citations
- Fine-Tuning Large Language Models with Sequential InstructionsLong12 citations
- Neuro-Symbolic Integration Brings Causal and Reliable Reasoning ProofsFindings12 citations
- SOLID: Self-seeding and Multi-intent Self-instructing LLMs for Generating Intent-aware Information-Seeking DialogsFindings12 citations
- A Closer Look into Mixture-of-Experts in Large Language ModelsFindings11 citations
- CLERC: A Dataset for U. S. Legal Case Retrieval and Retrieval-Augmented Analysis GenerationFindings11 citations
- Data Poisoning for In-context LearningFindings11 citations
- Infogent: An Agent-Based Framework for Web Information AggregationFindings11 citations
- L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional ObjectsSystem Demonstrations11 citations
- LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language ModelsFindings11 citations
- Soft Prompting for Unlearning in Large Language ModelsLong11 citations
- Speculative Diffusion Decoding: Accelerating Language Generation through DiffusionLong11 citations
- WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and ResponseFindings11 citations
- WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global CuisinesLong11 citations
- Can Large Language Models Generate High-quality Patent Claims?Findings10 citations
- Causal Inference with Large Language Model: A SurveyFindings10 citations
- Decoding Speculative DecodingLong10 citations
- DialogGen: Multi-modal Interactive Dialogue System with Multi-turn Text-Image GenerationFindings10 citations
- Few-shot Personalization of LLMs with Mis-aligned ResponsesLong10 citations
- Ground Every Sentence: Improving Retrieval-Augmented LLMs with Interleaved Reference-Claim GenerationFindings10 citations
- Protecting Privacy in Multimodal Large Language Models with MLLMU-BenchLong10 citations
- SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian LanguagesSystem Demonstrations10 citations
- TEaR: Improving LLM-based Machine Translation with Systematic Self-RefinementFindings10 citations
- VLind-Bench: Measuring Language Priors in Large Vision-Language ModelsFindings10 citations
- AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion GenerationFindings9 citations
- Attention Tracker: Detecting Prompt Injection Attacks in LLMsFindings9 citations
- CodeTree: Agent-guided Tree Search for Code Generation with Large Language ModelsLong9 citations
- Is Semantic Chunking Worth the Computational Cost?Findings9 citations
- Logic-of-Thought: Injecting Logic into Contexts for Full Reasoning in Large Language ModelsLong9 citations
- On Behalf of the Stakeholders: Trends in NLP Model Interpretability in the Era of LLMsLong9 citations
- QuaLLM: An LLM-based Framework to Extract Quantitative Insights from Online ForumsFindings9 citations
- Revealing the Barriers of Language Agents in PlanningLong9 citations
- SELFGOAL: Your Language Agents Already Know How to Achieve High-level GoalsLong9 citations
- AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive ScenariosLong8 citations
- Code-Optimise: Self-Generated Preference Data for Correctness and EfficiencyFindings8 citations
- Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-ExpertsLong8 citations
- Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex ReasoningLong8 citations
- Exploring Safety-Utility Trade-Offs in Personalized Language ModelsLong8 citations
- From Distributional to Overton Pluralism: Investigating Large Language Model AlignmentLong8 citations
- Large Language Models Share Representations of Latent Grammatical Concepts Across Typologically Diverse LanguagesLong8 citations
- Large Language Models for Anomaly and Out-of-Distribution Detection: A SurveyFindings8 citations
- MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient EvaluationLong8 citations
- Model Surgery: Modulating LLM’s Behavior Via Simple Parameter EditingLong8 citations
- Navigating the Path of Writing: Outline-guided Text Generation with Large Language ModelsIndustry8 citations
- Repetition Neurons: How Do Language Models Produce Repetitions?Short8 citations
- The LLM Language Network: A Neuroscientific Approach for Identifying Causally Task-Relevant UnitsLong8 citations
- Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning AttacksFindings8 citations
- Uncovering Bias in Large Vision-Language Models at Scale with CounterfactualsLong8 citations
- UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language ModelFindings8 citations
- Verifiable by Design: Aligning Language Models to Quote from Pre-Training DataLong8 citations
- Are LLM-Judges Robust to Expressions of Uncertainty? Investigating the effect of Epistemic Markers on LLM-based EvaluationLong7 citations
- Audio Is the Achilles’ Heel: Red Teaming Audio Large Multimodal ModelsLong7 citations
- CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language ModelsLong7 citations
- Correcting Negative Bias in Large Language Models through Negative Attention Score AlignmentLong7 citations
- DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order OptimizationFindings7 citations
- Evaluating Cultural and Social Awareness of LLM Web AgentsFindings7 citations
- From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context LearningLong7 citations
- GenSim: A General Social Simulation Platform with Large Language Model based AgentsSystem Demonstrations7 citations
- High-Dimension Human Value Representation in Large Language ModelsLong7 citations
- IrokoBench: A New Benchmark for African Languages in the Age of Large Language ModelsLong7 citations
- Privacy Checklist: Privacy Violation Detection Grounding on Contextual Integrity TheoryLong7 citations
- Teaching Models to Balance Resisting and Accepting PersuasionLong7 citations
- TurkingBench: A Challenge Benchmark for Web AgentsLong7 citations
- UCFE: A User-Centric Financial Expertise Benchmark for Large Language ModelsFindings7 citations
- A Picture is Worth A Thousand Numbers: Enabling LLMs Reason about Time Series via VisualizationLong6 citations
- CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language ModelsFindings6 citations
- Can LLMs Convert Graphs to Text-Attributed Graphs?Long6 citations
- Can LLMs Learn Macroeconomic Narratives from Social Media?Findings6 citations
- DHP Benchmark: Are LLMs Good NLG Evaluators?Findings6 citations
- HIGGS: Pushing the Limits of Large Language Model Quantization via the Linearity TheoremLong6 citations
- Investigating Human Values in Online CommunitiesLong6 citations
- LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language ModelsFindings6 citations
- Language Models “Grok” to CopyShort6 citations
- Large Language Models Reflect Human Citation Patterns with a Heightened Citation BiasFindings6 citations
- MLLM-Bench: Evaluating Multimodal LLMs with Per-sample CriteriaLong6 citations
- MSc-SQL: Multi-Sample Critiquing Small Language Models For Text-To-SQL TranslationLong6 citations
- Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language ModelsLong6 citations
- On the Impact of Fine-Tuning on Chain-of-Thought ReasoningLong6 citations
- Prompt Compression for Large Language Models: A SurveyLong6 citations
- REL-A.I.: An Interaction-Centered Approach To Measuring Human-LM RelianceLong6 citations
- ReIFE: Re-evaluating Instruction-Following EvaluationLong6 citations
- Self-DC: When to Reason and When to Act? Self Divide-and-Conquer for Compositional Unknown QuestionsLong6 citations
- Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model TrainingLong6 citations
- Sketch2Code: Evaluating Vision-Language Models for Interactive Web Design PrototypingLong6 citations
- The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language ModelsLong6 citations
- ThoughtSculpt: Reasoning with Intermediate Revision and SearchFindings6 citations
- Understanding Reference Policies in Direct Preference OptimizationFindings6 citations
- Unlearning as multi-task optimization: A normalized gradient difference approach with an adaptive learning rateLong6 citations
- AEGIS2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM GuardrailsLong5 citations
- AdaCAD: Adaptively Decoding to Balance Conflicts between Contextual and Parametric KnowledgeLong5 citations
- Benchmarking Language Model Creativity: A Case Study on Code GenerationLong5 citations
- CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic EnvironmentsLong5 citations
- Do Large Language Models Align with Core Mental Health Counseling Competencies?Findings5 citations
- DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students’ Hand-Drawn Math ImagesLong5 citations
- FunnelRAG: A Coarse-to-Fine Progressive Retrieval Paradigm for RAGFindings5 citations
- HyPA-RAG: A Hybrid Parameter Adaptive Retrieval-Augmented Generation System for AI Legal and Policy ApplicationsIndustry5 citations
- Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational RetrievalLong5 citations
- Language Modeling with Editable External KnowledgeFindings5 citations
- Language Models are Crossword SolversLong5 citations
- Lived Experience Not Found: LLMs Struggle to Align with Experts on Addressing Adverse Drug Reactions from Psychiatric Medication UseLong5 citations
- M2Lingual: Enhancing Multilingual, Multi-Turn Instruction Alignment in Large Language ModelsLong5 citations
- MCQG-SRefine: Multiple Choice Question Generation and Evaluation with Iterative Self-Critique, Correction, and Comparison FeedbackLong5 citations
- MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation SystemsLong5 citations
- Measuring and Benchmarking Large Language Models’ Capabilities to Generate Persuasive LanguageLong5 citations
- Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided DecodingFindings5 citations
- Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning ParadigmFindings5 citations
- One fish, two fish, but not the whole sea: Alignment reduces language models’ conceptual diversityLong5 citations
- PAPILLON: Privacy Preservation from Internet-based and Local Language Model EnsemblesLong5 citations
- Patent-CR: A Dataset for Patent Claim RevisionLong5 citations
- PlagBench: Exploring the Duality of Large Language Models in Plagiarism Generation and DetectionLong5 citations
- Probing-RAG: Self-Probing to Guide Language Models in Selective Document RetrievalFindings5 citations
- ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy ModelsFindings5 citations
- SimulBench: Evaluating Language Models with Creative Simulation TasksFindings5 citations
- Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation EngineeringLong5 citations
- Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language ModelsLong5 citations
- The Promises and Pitfalls of LLM Annotations in Dataset Labeling: a Case Study on Media Bias DetectionFindings5 citations
- Tooling or Not Tooling? The Impact of Tools on Language Agents for Chemistry Problem SolvingFindings5 citations
- Towards Cross-Lingual Explanation of Artwork in Large-scale Vision Language ModelsFindings5 citations
- Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive PromptsLong5 citations
- VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and MusicSystem Demonstrations5 citations
- WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluationFindings5 citations
- mHumanEval - A Multilingual Benchmark to Evaluate Large Language Models for Code GenerationLong5 citations
- A Logical Fallacy-Informed Framework for Argument GenerationLong4 citations
- A Probabilistic Framework for LLM Hallucination Detection via Belief Tree PropagationLong4 citations
- A Template Is All You MemeLong4 citations
- Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM AgentsFindings4 citations
- Adaptive Retrieval-Augmented Generation for Conversational SystemsFindings4 citations
- AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization via Multi-LLMsFindings4 citations
- BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in AlignmentLong4 citations
- Beemo: Benchmark of Expert-edited Machine-generated OutputsLong4 citations
- Benchmarking Distributional Alignment of Large Language ModelsLong4 citations
- Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You InFindings4 citations
- CAVE: Controllable Authorship Verification ExplanationsLong4 citations
- CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior TherapyLong4 citations
- CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmented GenerationFindings4 citations
- Can’t Hide Behind the API: Stealing Black-Box Commercial Embedding ModelsFindings4 citations
- CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-ExpertsLong4 citations
- Challenges in Trustworthy Human Evaluation of ChatbotsFindings4 citations
- CharacterBox: Evaluating the Role-Playing Capabilities of LLMs in Text-Based Virtual WorldsLong4 citations
- Conformalized Answer Set Prediction for Knowledge Graph EmbeddingLong4 citations
- Cracking the Code: Multi-domain LLM Evaluation on Real-World Professional Exams in IndonesiaIndustry4 citations
- Cross-lingual Transfer of Reward Models in Multilingual AlignmentShort4 citations
- DAWN-ICL: Strategic Planning of Problem-solving Trajectories for Zero-Shot In-Context LearningLong4 citations
- Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End EngineeringLong4 citations
- Does Liking Yellow Imply Driving a School Bus? Semantic Leakage in Language ModelsLong4 citations
- Evaluating Morphological Compositional Generalization in Large Language ModelsLong4 citations
- Evaluating the Performance of Large Language Models via DebatesFindings4 citations
- FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMsShort4 citations
- FedSpaLLM: Federated Pruning of Large Language ModelsLong4 citations
- From Allies to Adversaries: Manipulating LLM Tool-Calling through Adversarial InjectionLong4 citations
- Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM AgentsFindings4 citations
- LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling MatricesLong4 citations
- Language Models Can Infer Action Semantics for Symbolic Planners from Environment FeedbackLong4 citations
- Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification ToolsLong4 citations
- Learning to Summarize from LLM-generated FeedbackLong4 citations
- Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and CapabilitySystem Demonstrations4 citations
- MILU: A Multi-task Indic Language Understanding BenchmarkLong4 citations
- MixLLM: Dynamic Routing in Mixed Large Language ModelsLong4 citations
- MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart ProblemsLong4 citations
- NormAd: A Framework for Measuring the Cultural Adaptability of Large Language ModelsLong4 citations
- On Positional Bias of Faithfulness for Long-form SummarizationLong4 citations
- RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language ModelsLong4 citations
- Rationale-Guided Retrieval Augmented Generation for Medical Question AnsweringLong4 citations
- Self-Pluralising Culture Alignment for Large Language ModelsLong4 citations
- Specializing Large Language Models to Simulate Survey Response Distributions for Global PopulationsLong4 citations
- StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style DiffusionLong4 citations
- Thought2Text: Text Generation from EEG Signal using Large Language Models (LLMs)Findings4 citations
- ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue SynthesisLong4 citations
- Towards Better Multi-task Learning: A Framework for Optimizing Dataset Combinations in Large Language ModelsFindings4 citations
- Towards Knowledge Checking in Retrieval-augmented Generation: A Representation PerspectiveLong4 citations
- Transformer-based Causal Language Models Perform ClusteringFindings4 citations
- VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-TuningLong4 citations
- A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language ModelsLong3 citations
- A Novel Computational Modeling Foundation for Automatic Coherence AssessmentLong3 citations
- A Systematic Study of Cross-Layer KV Sharing for Efficient LLM InferenceShort3 citations
- Advocating Character Error Rate for Multilingual ASR EvaluationFindings3 citations
- Analyzing and Evaluating Correlation Measures in NLG Meta-EvaluationLong3 citations
- Assessing LLMs for Zero-shot Abstractive Summarization Through the Lens of Relevance ParaphrasingFindings3 citations
- CAMEL-Bench: A Comprehensive Arabic LMM BenchmarkFindings3 citations
- Causally Testing Gender Bias in LLMs: A Case Study on Occupational BiasFindings3 citations
- Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-StepFindings3 citations
- ComPO: Community Preferences for Language Model PersonalizationLong3 citations
- Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via AbstractionShort3 citations
- Data-centric NLP Backdoor Defense from the Lens of MemorizationFindings3 citations
- Dataverse: Open-Source ETL (Extract, Transform, Load) Pipeline for Large Language ModelsSystem Demonstrations3 citations
- Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection AssumptionsFindings3 citations
- Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question AnsweringFindings3 citations
- Efficient Prompting for Continual Adaptation to Missing ModalitiesLong3 citations
- Enhancing Function-Calling Capabilities in LLMs: Strategies for Prompt Formats, Data Integration, and Multilingual TranslationIndustry3 citations
- Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language ModelsIndustry3 citations
- Enhancing Temporal Understanding in LLMs for Semi-structured TablesFindings3 citations
- Evaluating the Prompt Steerability of Large Language ModelsLong3 citations
- FIRE: Fact-checking with Iterative Retrieval and VerificationFindings3 citations
- Faux Polyglot: A Study on Information Disparity in Multilingual Large Language ModelsLong3 citations
- From Single to Multi: How LLMs Hallucinate in Multi-Document SummarizationFindings3 citations
- GPT-4V Cannot Generate Radiology Reports YetFindings3 citations
- GraphICL: Unlocking Graph Learning Potential in LLMs through Structured Prompt DesignFindings3 citations
- Grounding Fallacies Misrepresenting Scientific Publications in EvidenceLong3 citations
- H-STAR: LLM-driven Hybrid SQL-Text Adaptive Reasoning on TablesLong3 citations
- How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMsLong3 citations
- In-Context Example Selection via Similarity Search Improves Low-Resource Machine TranslationFindings3 citations
- Incremental Sentence Processing Mechanisms in Autoregressive Transformer Language ModelsLong3 citations
- Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta InstructionLong3 citations
- Knowledge Graph-Guided Retrieval Augmented GenerationLong3 citations
- LLM The Genius Paradox: A Linguistic and Math Expert’s Struggle with Simple Word-based Counting ProblemsLong3 citations
- LLMs Are Biased Towards Output Formats! Systematically Evaluating and Mitigating Output Format Bias of LLMsLong3 citations
- LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMsLong3 citations
- LLMs vs Established Text Augmentation Techniques for Classification: When do the Benefits Outweight the Costs?Long3 citations
- Language Models Encode Numbers Using Digit Representations in Base 10Short3 citations
- Large Language Models Are Cross-Lingual Knowledge-Free ReasonersLong3 citations
- LlamaLens: Specialized Multilingual LLM for Analyzing News and Social Media ContentFindings3 citations
- MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data UncertaintyFindings3 citations
- Multi3Hate: Multimodal, Multilingual, and Multicultural Hate Speech Detection with Vision–Language ModelsLong3 citations
- Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical StudyLong3 citations
- Navigating the Cultural Kaleidoscope: A Hitchhiker’s Guide to Sensitivity in Large Language ModelsLong3 citations
- Open Domain Question Answering with Conflicting ContextsFindings3 citations
- Rationale Behind Essay Scores: Enhancing S-LLM’s Multi-Trait Essay Scoring with Rationale Generated by LLMsFindings3 citations
- ReachAgent: Enhancing Mobile Agent via Page Reaching and OperationLong3 citations
- ReasoningRec: Bridging Personalized Recommendations and Human-Interpretable Explanations through LLM ReasoningFindings3 citations
- Reverse Thinking Makes LLMs Stronger ReasonersLong3 citations
- RuleR: Improving LLM Controllability by Rule-based Data RecyclingShort3 citations
- SG-FSM: A Self-Guiding Zero-Shot Prompting Paradigm for Multi-Hop Question Answering Based on Finite State MachineFindings3 citations
- SLIM: Let LLM Learn More and Forget Less with Soft LoRA and Identity MixtureLong3 citations
- Scaling Up Membership Inference: When and How Attacks Succeed on Large Language ModelsFindings3 citations
- Self-Harmonized Chain of ThoughtLong3 citations
- Style Transfer with Multi-iteration Preference OptimizationLong3 citations
- Substance Beats Style: Why Beginning Students Fail to Code with LLMsLong3 citations
- SwissADT: An Audio Description Translation System for Swiss LanguagesIndustry3 citations
- Token-based Decision Criteria Are Suboptimal in In-context LearningLong3 citations
- Towards Zero-Shot Multimodal Machine TranslationFindings3 citations
- UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language ModelsLong3 citations
- Uncovering Latent Arguments in Social Media Messaging by Employing LLMs-in-the-Loop StrategyFindings3 citations
- Unifying AI Tutor Evaluation: An Evaluation Taxonomy for Pedagogical Ability Assessment of LLM-Powered AI TutorsLong3 citations
- VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented GenerationLong3 citations
- VividMed: Vision Language Model with Versatile Visual Grounding for MedicineLong3 citations
- What Is Missing in Multilingual Visual Reasoning and How to Fix ItFindings3 citations
- 2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional SupervisionFindings2 citations
- A Distributional Perspective on Word Learning in Neural Language ModelsLong2 citations
- A Recipe of Parallel Corpora Exploitation for Multilingual Large Language ModelsFindings2 citations
- AI-LieDar : Examine the Trade-off Between Utility and Truthfulness in LLM AgentsLong2 citations
- ALiiCE: Evaluating Positional Fine-grained Citation GenerationLong2 citations
- AfriHate: A Multilingual Collection of Hate Speech and Abusive Language Datasets for African LanguagesLong2 citations
- AgentMove: A Large Language Model based Agentic Framework for Zero-shot Next Location PredictionLong2 citations
- An empirical study of validating synthetic data for formula generationFindings2 citations
- Analyzing (In)Abilities of SAEs via Formal LanguagesLong2 citations
- Audio Description Generation in the Era of LLMs and VLMs: A Review of Transferable Generative AI TechnologiesFindings2 citations
- Avoiding Copyright Infringement via Large Language Model UnlearningFindings2 citations
- Babysit A Language Model From Scratch: Interactive Language Learning by Trials and DemonstrationsLong2 citations
- Beyond English: The Impact of Prompt Translation Strategies across Languages and Tasks in Multilingual LLMsFindings2 citations
- Beyond Words: Exploring Cultural Value Sensitivity in Multimodal ModelsFindings2 citations
- CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question AnsweringFindings2 citations
- Cascading Large Language Models for Salient Event Graph GenerationLong2 citations
- Claim-Guided Textual Backdoor Attack for Practical ApplicationsFindings2 citations
- CoME: An Unlearning-based Approach to Conflict-free Model EditingLong2 citations
- CogLM: Tracking Cognitive Development of Large Language ModelsLong2 citations
- Computational Discovery of Chiasmus in Ancient Religious TextShort2 citations
- Concise and Organized Perception Facilitates Reasoning in Large Language ModelsFindings2 citations
- Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language ModelSystem Demonstrations2 citations
- DIRAS: Efficient LLM Annotation of Document Relevance for Retrieval Augmented GenerationLong2 citations
- Decoding Hate: Exploring Language Models’ Reactions to Hate SpeechLong2 citations
- Diversify-verify-adapt: Efficient and Robust Retrieval-Augmented Ambiguous Question AnsweringLong2 citations
- Diversity Helps Jailbreak Large Language ModelsLong2 citations
- DomainSum: A Hierarchical Benchmark for Fine-Grained Domain Shift in Abstractive Text SummarizationFindings2 citations
- Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language ModelsFindings2 citations
- ESPnet-SpeechLM: An Open Speech Language Model ToolkitSystem Demonstrations2 citations
- Efficient Continual Pre-training of LLMs for Low-resource LanguagesIndustry2 citations
- Enhancing Multimodal Entity Linking with Jaccard Distance-based Conditional Contrastive Learning and Contextual Visual AugmentationLong2 citations
- Entity Decomposition with Filtering: A Zero-Shot Clinical Named Entity Recognition FrameworkLong2 citations
- Entropy-Based Decoding for Retrieval-Augmented Large Language ModelsLong2 citations
- Exploring the Potential of Large Language Models for Heterophilic GraphsLong2 citations
- FLEURS-ASL: Including American Sign Language in Massively Multilingual Multitask EvaluationLong2 citations
- Flaming-hot Initiation with Regular Execution Sampling for Large Language ModelsFindings2 citations
- From Intentions to Techniques: A Comprehensive Taxonomy and Challenges in Text Watermarking for Large Language ModelsFindings2 citations
- From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning TasksLong2 citations
- From Text to Emoji: How PEFT-Driven Personality Manipulation Unleashes the Emoji Potential in LLMsFindings2 citations
- GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence EmbeddingsFindings2 citations
- Human and LLM-Based Resume Matching: An Observational StudyFindings2 citations
- Hybrid Graphs for Table-and-Text based Question Answering using LLMsLong2 citations
- INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic LanguagesFindings2 citations
- Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-TuningFindings2 citations
- Improving Model Evaluation using SMART Filtering of Benchmark DatasetsLong2 citations
- Improving and Assessing the Fidelity of Large Language Models Alignment to Online CommunitiesLong2 citations
- Inference Scaling for Bridging Retrieval and Augmented GenerationFindings2 citations
- InspectorRAGet: An Introspection Platform for RAG EvaluationSystem Demonstrations2 citations
- Investigating the Transferability of Code Repair for Low-Resource Programming LanguagesFindings2 citations
- Is It Navajo? Accurate Language Detection for Endangered Athabaskan LanguagesShort2 citations
- Iterative Self-Tuning LLMs for Enhanced Jailbreaking CapabilitiesLong2 citations
- LLM2: Let Large Language Models Harness System 2 ReasoningShort2 citations
- LLMs are Biased Teachers: Evaluating LLM Bias in Personalized EducationFindings2 citations
- LLMs as Meta-Reviewers’ Assistants: A Case StudyLong2 citations
- LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language ModelsFindings2 citations
- Language Models Predict Empathy Gaps Between Social In-groups and Out-groupsLong2 citations
- Large Language Models are Easily Confused: A Quantitative Metric, Security Implications and Typological AnalysisFindings2 citations
- Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack DefenseLong2 citations
- Learning vs Retrieval: The Role of In-Context Examples in Regression with Large Language ModelsLong2 citations
- LiteWebAgent: The Open-Source Suite for VLM-Based Web-Agent ApplicationsSystem Demonstrations2 citations
- MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context InferenceLong2 citations
- MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse DomainsFindings2 citations
- Mamba-Shedder: Post-Transformer Compression for Efficient Selective Structured State Space ModelsLong2 citations
- ManaTTS Persian: a recipe for creating TTS datasets for lower resource languagesLong2 citations
- MatViX: Multimodal Information Extraction from Visually Rich ArticlesLong2 citations
- Measuring memorization in language models via probabilistic extractionLong2 citations
- MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K TokensFindings2 citations
- Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference OptimizationLong2 citations
- MoDification: Mixture of Depths Made EasyLong2 citations
- MojoBench: Language Modeling and Benchmarks for MojoFindings2 citations
- NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language ModelsFindings2 citations
- Neuro-symbolic Training for Reasoning over Spatial LanguageFindings2 citations
- Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object IdentificationFindings2 citations
- On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic PhenomenaLong2 citations
- OpenReviewer: A Specialized Large Language Model for Generating Critical Scientific Paper ReviewsSystem Demonstrations2 citations
- PORT: Preference Optimization on Reasoning TracesLong2 citations
- Pretrained Image-Text Models are Secretly Video CaptionersShort2 citations
- Probe-Free Low-Rank Activation InterventionLong2 citations
- RATSD: Retrieval Augmented Truthfulness Stance Detection from Social Media Posts Toward Factual ClaimsFindings2 citations
- RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition ProcessFindings2 citations
- Rejected Dialects: Biases Against African American Language in Reward ModelsFindings2 citations
- Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can’t Answer?Short2 citations
- SLM-Mod: Small Language Models Surpass LLMs at Content ModerationLong2 citations
- STRUX: An LLM for Decision-Making with Structured ExplanationsShort2 citations
- SimRAG: Self-Improving Retrieval-Augmented Generation for Adapting Large Language Models to Specialized DomainsLong2 citations
- Stealthy Jailbreak Attacks on Large Language Models via Benign Data MirroringLong2 citations
- Stephanie: Step-by-Step Dialogues for Mimicking Human Interactions in Social ConversationsFindings2 citations
- StyleDistance: Stronger Content-Independent Style Embeddings with Synthetic Parallel ExamplesLong2 citations
- Supportiveness-based Knowledge Rewriting for Retrieval-augmented Language ModelingFindings2 citations
- Swan and ArabicMTEB: Dialect-Aware, Arabic-Centric, Cross-Lingual, and Cross-Cultural Embedding Models and BenchmarksFindings2 citations
- SylloBio-NLI: Evaluating Large Language Models on Biomedical Syllogistic ReasoningLong2 citations
- Synthetic Audio Helps for Cognitive State TasksFindings2 citations
- Syntriever: How to Train Your Retriever with Synthetic Data from LLMsFindings2 citations
- Systematic Knowledge Injection into Large Language Models via Diverse Augmentation for Domain-Specific RAGFindings2 citations
- TART: An Open-Source Tool-Augmented Framework for Explainable Table-based ReasoningFindings2 citations
- TRUSTEVAL: A Dynamic Evaluation Toolkit on Trustworthiness of Generative Foundation ModelsSystem Demonstrations2 citations
- Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal UnderstandingFindings2 citations
- Thank You, Stingray: Multilingual Large Language Models Can Not (Yet) Disambiguate Cross-Lingual Word SensesFindings2 citations
- The Power of Many: Multi-Agent Multimodal Models for Cultural Image CaptioningLong2 citations
- The Stochastic Parrot on LLM’s Shoulder: A Summative Assessment of Physical Concept UnderstandingLong2 citations
- Towards Federated Low-Rank Adaptation of Language Models with Rank HeterogeneityShort2 citations
- Towards Long Context Hallucination DetectionFindings2 citations
- Towards Robust Knowledge Representations in Multilingual LLMs for Equivalence and Inheritance based Consistent ReasoningLong2 citations
- TrendSim: Simulating Trending Topics in Social Media Under Poisoning Attacks with LLM-based Multi-agent SystemFindings2 citations
- UNLEARN Efficient Removal of Knowledge in Large Language ModelsFindings2 citations
- Understanding LLMs’ Fluid Intelligence Deficiency: An Analysis of the ARC TaskLong2 citations
- Unmasking Database Vulnerabilities: Zero-Knowledge Schema Inference Attacks in Text-to-SQL SystemsFindings2 citations
- Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation ClassifiersShort2 citations
- What Goes Into a LM Acceptability Judgment? Rethinking the Impact of Frequency and LengthLong2 citations
- What can Large Language Models Capture about Code Functional Equivalence?Findings2 citations
- World Models with Hints of Large Language Models for Goal AchievingLong2 citations
- XAMPLER: Learning to Retrieve Cross-Lingual In-Context ExamplesFindings2 citations
- Yeah, Un, Oh: Continuous and Real-time Backchannel Prediction with Fine-tuning of Voice Activity ProjectionLong2 citations
- A Practical Examination of AI-Generated Text Detectors for Large Language ModelsFindings1 citations
- A Survey to Recent Progress Towards Understanding In-Context LearningFindings1 citations
- A Zero-Shot Open-Vocabulary Pipeline for Dialogue UnderstandingLong1 citations
- ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Parity LLM Data ValuationLong1 citations
- ASRank: Zero-Shot Re-Ranking with Answer Scent for Document RetrievalFindings1 citations
- Accounting for Sycophancy in Language Model Uncertainty EstimationFindings1 citations
- AdParaphrase: Paraphrase Dataset for Analyzing Linguistic Features toward Generating Attractive Ad TextsFindings1 citations
- AdTEC: A Unified Benchmark for Evaluating Text Quality in Search Engine AdvertisingLong1 citations
- Adaptive Prompting: Ad-hoc Prompt Composition for Social Bias DetectionLong1 citations
- AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective IntelligenceLong1 citations
- Aligning to What? Limits to RLHF Based AlignmentFindings1 citations
- Alligators All Around: Mitigating Lexical Confusion in Low-resource Machine TranslationShort1 citations
- An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuningFindings1 citations
- An Interpretable and Crosslingual Method for Evaluating Second-Language DialoguesLong1 citations
- Arabic Dataset for LLM Safeguard EvaluationLong1 citations
- Assessing the State of the Art in Scene SegmentationLong1 citations
- Automatic Evaluation of Healthcare LLMs Beyond Question-AnsweringShort1 citations
- B4: A Black-Box Scrubbing Attack on LLM WatermarksLong1 citations
- Benchmarking Failures in Tool-Augmented Language ModelsLong1 citations
- Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMsLong1 citations
- Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and EvaluationLong1 citations
- CORD: Balancing COnsistency and Rank Distillation for Robust Retrieval-Augmented GenerationShort1 citations
- COVE: COntext and VEracity prediction for out-of-context imagesLong1 citations
- CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific ConceptsLong1 citations
- CSEval: Towards Automated, Multi-Dimensional, and Reference-Free Counterspeech Evaluation using Auto-Calibrated LLMsLong1 citations
- Can GPT-4 Sway Experts’ Investment Decisions?Findings1 citations
- CharacterGPT: A Persona Reconstruction Framework for Role-Playing AgentsIndustry1 citations
- Characterizing the Role of Similarity in the Property Inferences of Language ModelsLong1 citations
- CoPERLex: Content Planning with Event-based Representations for Legal Case SummarizationFindings1 citations
- CodeRAG-Bench: Can Retrieval Augment Code Generation?Findings1 citations
- CodeSCM: Causal Analysis for Multi-Modal Code GenerationLong1 citations
- Cognitive Kernel: An Open-source Agent System towards Generalist AutopilotsSystem Demonstrations1 citations
- Communication Makes Perfect: Persuasion Dataset Construction via Multi-LLM CommunicationLong1 citations
- Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake DetectionFindings1 citations
- Continuous Speech Tokenizer in Text To SpeechFindings1 citations
- Cross-Lingual Transfer Learning for Speech TranslationShort1 citations
- Cross-Lingual and Cross-Cultural Variation in Image DescriptionsLong1 citations
- CuriousLLM: Elevating Multi-Document Question Answering with LLM-Enhanced Knowledge Graph ReasoningIndustry1 citations
- DART: An AIGT Detector using AMR of Rephrased TextShort1 citations
- DCE-LLM: Dead Code Elimination with Large Language ModelsLong1 citations
- Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation ModelsFindings1 citations
- DiPT: Enhancing LLM Reasoning through Diversified Perspective-TakingFindings1 citations
- Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document SummarizationLong1 citations
- Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design AutomationLong1 citations
- Do Not Design, Learn: A Trainable Scoring Function for Uncertainty Estimation in Generative LLMsFindings1 citations
- Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question CoverageLong1 citations
- ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information CoverageLong1 citations
- Efficient Annotator Reliability Assessment and Sample Weighting for Knowledge-Based Misinformation Detection on Social MediaFindings1 citations
- Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-TuningFindings1 citations
- EqualizeIR: Mitigating Linguistic Biases in Retrieval ModelsShort1 citations
- Evaluating Small Language Models for News Summarization: Implications and Factors Influencing PerformanceLong1 citations
- Evaluating Vision-Language Models for Emotion RecognitionFindings1 citations
- Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?Findings1 citations
- EventFull: Complete and Consistent Event Relation AnnotationSystem Demonstrations1 citations
- Examining and Adapting Time for Multilingual Classification via Mixture of Temporal ExpertsLong1 citations
- Explore the Reasoning Capability of LLMs in the Chess TestbedShort1 citations
- Exploring Large Language Models for Hate Speech Detection in Rioplatense SpanishFindings1 citations
- FactCG: Enhancing Fact Checkers with Graph-Based Multi-Hop DataLong1 citations
- Faster Machine Translation Ensembling with Reinforcement Learning and Competitive CorrectionFindings1 citations
- FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference BenchmarkingFindings1 citations
- Fine-Tuned LLMs are “Time Capsules” for Tracking Societal Bias Through BooksLong1 citations
- Fingerspelling within Sign Language TranslationLong1 citations
- GLiREL - Generalist Model for Zero-Shot Relation ExtractionLong1 citations
- Generating Long-form Story Using Dynamic Hierarchical Outlining with Memory-EnhancementLong1 citations
- GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language ModelsFindings1 citations
- GloCOM: A Short Text Neural Topic Model via Global Clustering ContextLong1 citations
- GraPPI: A Retrieve-Divide-Solve GraphRAG Framework for Large-scale Protein-protein Interaction ExplorationFindings1 citations
- Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination MitigationFindings1 citations
- Grammar Control in Dialogue Response Generation for Language Learning ChatbotsLong1 citations
- Great Memory, Shallow Reasoning: Limits of kNN-LMsShort1 citations
- HALLUCANA: Fixing LLM Hallucination with A Canary LookaheadFindings1 citations
- HARP: Hesitation-Aware Reframing in Transformer Inference PassLong1 citations
- HMT: Hierarchical Memory Transformer for Efficient Long Context Language ProcessingLong1 citations
- Has this Fact been Edited? Detecting Knowledge Edits in Language ModelsLong1 citations
- Have LLMs Reopened the Pandora’s Box of AI-Generated Fake News?Long1 citations
- Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve AnomaliesLong1 citations
- Hephaestus: Improving Fundamental Agent Capabilities of Large Language Models through Continual Pre-TrainingLong1 citations
- How Can We Diagnose and Treat Bias in Large Language Models for Clinical Decision-Making?Long1 citations
- How Do Large Language Models Perform in Dynamical System ModelingFindings1 citations
- How Inclusively do LMs Perceive Social and Moral Norms?Findings1 citations
- How Much Knowledge Can You Pack into a LoRA Adapter without Harming LLM?Findings1 citations
- How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal RepresentationsShort1 citations
- How to Make the Most of LLMs’ Grammatical Knowledge for Acceptability JudgmentsLong1 citations
- IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information RetrievalLong1 citations
- IHEval: Evaluating Language Models on Following the Instruction HierarchyLong1 citations
- Identifying and Mitigating Social Bias Knowledge in Language ModelsFindings1 citations
- Improved Near-Duplicate Detection for Aggregated and Paywalled News-FeedsIndustry1 citations
- Improving Retrospective Language Agents via Joint Policy Gradient OptimizationLong1 citations
- Information-Guided Identification of Training Data Imprint in (Proprietary) Large Language ModelsLong1 citations
- Is a Peeled Apple Still Red? Evaluating LLMs’ Ability for Conceptual Combination with Property TypeLong1 citations
- Jailbreaking with Universal Multi-PromptsFindings1 citations
- KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue CorpusFindings1 citations
- LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of TransformersFindings1 citations
- LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model CompressionFindings1 citations
- Language Model Council: Democratically Benchmarking Foundation Models on Highly Subjective TasksLong1 citations
- Large Language Models Are Better Logical Fallacy Reasoners with Counterargument, Explanation, and Goal-Aware Prompt FormulationFindings1 citations
- LawInstruct: A Resource for Studying Language Model Adaptation to the Legal DomainFindings1 citations
- LayAlign: Enhancing Multilingual Reasoning in Large Language Models via Layer-Wise Adaptive Fusion and Alignment StrategyFindings1 citations
- LeCoPCR: Legal Concept-guided Prior Case Retrieval for European Court of Human Rights casesFindings1 citations
- Learning to Search Effective Example Sequences for In-Context LearningFindings1 citations
- LibEvolutionEval: A Benchmark and Study for Version-Specific Code GenerationLong1 citations
- Lost in Inference: Rediscovering the Role of Natural Language Inference for Large Language ModelsLong1 citations
- MAD Speech: Measures of Acoustic Diversity of SpeechLong1 citations
- MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue GenerationLong1 citations
- MALoRA: Mixture of Asymmetric Low-Rank Adaptation for Enhanced Multi-Task LearningFindings1 citations
- MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent CollaborationLong1 citations
- MAPWise: Evaluating Vision-Language Models for Advanced Map QueriesLong1 citations
- MIDAS: Multi-level Intent, Domain, And Slot Knowledge Distillation for Multi-turn NLUFindings1 citations
- MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation EvaluationFindings1 citations
- MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational AgentsFindings1 citations
- MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool CallingLong1 citations
- Medical Spoken Named Entity RecognitionIndustry1 citations
- MetaAlign: Align Large Language Models with Diverse Preferences during Inference TimeFindings1 citations
- MiCEval: Unveiling Multimodal Chain of Thought’s Quality via Image Description and Reasoning StepsLong1 citations
- Mitigating Hallucinations in Multimodal Spatial Relations through Constraint-Aware PromptingFindings1 citations
- MoDE: Effective Multi-task Parameter Efficient Fine-Tuning with a Mixture of Dyadic ExpertsFindings1 citations
- Multi-Conditional Ranking with Large Language ModelsLong1 citations
- Multi-Stage LLM Fine-Tuning with a Continual Learning SettingFindings1 citations
- Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic ReasoningLong1 citations
- On Reference (In-)Determinacy in Natural Language InferenceFindings1 citations
- On the Impact of Noise in Differentially Private Text RewritingFindings1 citations
- On the Impacts of Contexts on Repository-Level Code GenerationFindings1 citations
- Open-World Evaluation for Retrieving Diverse PerspectivesLong1 citations
- PICLe: Pseudo-annotations for In-Context Learning in Low-Resource Named Entity DetectionLong1 citations
- PLD+: Accelerating LLM Inference by Leveraging Language Model ArtifactsFindings1 citations
- Padding Tone: A Mechanistic Analysis of Padding Tokens in T2I ModelsLong1 citations
- People will agree what I think: Investigating LLM’s False Consensus EffectFindings1 citations
- Perception Compressor: A Training-Free Prompt Compression Framework in Long Context ScenariosFindings1 citations
- PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language ModelsLong1 citations
- Predicting the Target Word of Game-playing Conversations using a Low-Rank Dialect Adapter for Decoder ModelsShort1 citations
- Preserving Multilingual Quality While Tuning Query Encoder on English OnlyShort1 citations
- PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation MetricsLong1 citations
- QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language ModelsFindings1 citations
- RELexED: Retrieval-Enhanced Legal Summarization with Exemplar DiversityFindings1 citations
- Re-evaluating Automatic LLM System Ranking for Alignment with Human PreferenceFindings1 citations
- Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model AlignmentLong1 citations
- Reinforcement Learning for Aligning Large Language Models Agents with Interactive Environments: Quantifying and Mitigating Prompt OverfittingFindings1 citations
- Reliability of Topic ModelingLong1 citations
- Representing Rule-based Chatbots with TransformersLong1 citations
- Retrieval, Reasoning, Re-ranking: A Context-Enriched Framework for Knowledge Graph CompletionLong1 citations
- RusCode: Russian Cultural Code Benchmark for Text-to-Image GenerationFindings1 citations
- S2-MAD: Breaking the Token Barrier to Enhance Multi-Agent Debate EfficiencyLong1 citations
- SAFR: Neuron Redistribution for InterpretabilityFindings1 citations
- SHADES: Towards a Multilingual Assessment of Stereotypes in Large Language ModelsLong1 citations
- SIMPLOT: Enhancing Chart Question Answering by Distilling EssentialsFindings1 citations
- SPeCtrum: A Grounded Framework for Multidimensional Identity Representation in LLM-Based AgentLong1 citations
- STAR: Spectral Truncation and Rescale for Model MergingShort1 citations
- Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language ModelsFindings1 citations
- SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast AsiaFindings1 citations
- Self-Training Meets Consistency: Improving LLMs’ Reasoning with Consistency-Driven Rationale EvaluationLong1 citations
- Semantic Consistency-Based Uncertainty Quantification for Factuality in Radiology Report GenerationFindings1 citations
- Semi-supervised Fine-tuning for Large Language ModelsFindings1 citations
- Sneaking Syntax into Transformer Language Models with Tree RegularizationLong1 citations
- Social Norms in Cinema: A Cross-Cultural Analysis of Shame, Pride and PrejudiceLong1 citations
- Sociodemographic Prompting is Not Yet an Effective Approach for Simulating Subjective Judgments with LLMsShort1 citations
- Soft Syntactic Reinforcement for Neural Event ExtractionLong1 citations
- Stronger Models are Not Always Stronger Teachers for Instruction TuningLong1 citations
- SusGen-GPT: A Data-Centric LLM for Financial NLP and Sustainability Report GenerationFindings1 citations
- SymBa: Symbolic Backward Chaining for Structured Natural Language ReasoningLong1 citations
- TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning DataFindings1 citations
- THREAD: Thinking Deeper with Recursive SpawningLong1 citations
- Teaching Large Language Models Number-Focused Headline Generation With Key Element RationalesFindings1 citations
- The Geometry of Numerical Reasoning: Language Models Compare Numeric Properties in Linear SubspacesShort1 citations
- The Geometry of Prompting: Unveiling Distinct Mechanisms of Task Adaptation in Language ModelsFindings1 citations
- The Impact of Visual Information in Chinese Characters: Evaluating Large Models’ Ability to Recognize and Utilize RadicalsLong1 citations
- Threshold Filtering Packing for Supervised Fine-Tuning: Training Related Samples within PacksLong1 citations
- ToW: Thoughts of Words Improve Reasoning in Large Language ModelsLong1 citations
- Token Weighting for Long-Range Language ModelingFindings1 citations
- Towards Automatic Evaluation for Image TranscreationLong1 citations
- Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation ModelsLong1 citations
- Towards Rationality in Language and Multimodal Agents: A SurveyLong1 citations
- Tuning-Free Personalized Alignment via Trial-Error-Explain In-Context LearningFindings1 citations
- TurtleBench: A Visual Programming Benchmark in Turtle GeometryLong1 citations
- Typographic Attacks in a Multi-Image SettingLong1 citations
- Uncertainty Quantification for Clinical Outcome Predictions with (Large) Language ModelsFindings1 citations
- Understanding Figurative Meaning through Explainable Visual EntailmentLong1 citations
- Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM LeaderboardIndustry1 citations
- Unfolding the Headline: Iterative Self-Questioning for News Retrieval and Timeline SummarizationFindings1 citations
- UniHGKR: Unified Instruction-aware Heterogeneous Knowledge RetrieversLong1 citations
- Unified Automated Essay Scoring and Grammatical Error CorrectionFindings1 citations
- Untangling Hate Speech Definitions: A Semantic Componential Analysis Across Cultures and DomainsFindings1 citations
- Uplifting Lower-Income Data: Strategies for Socioeconomic Perspective Shifts in Large Multi-modal ModelsLong1 citations
- VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMsFindings1 citations
- Visual Zero-Shot E-Commerce Product Attribute Value ExtractionIndustry1 citations
- VisualCoder: Guiding Large Language Models in Code Execution with Fine-grained Multimodal Chain-of-Thought ReasoningFindings1 citations
- WHoW: A Cross-domain Approach for Analysing Conversation ModerationLong1 citations
- WaterSeeker: Pioneering Efficient Detection of Watermarked Segments in Large DocumentsFindings1 citations
- Wav2Prompt: End-to-End Speech Prompt Learning and Task-based Fine-tuning for Text-based LLMsLong1 citations
- Weight-based Analysis of Detokenization in Language Models: Understanding the First Stage of Inference Without InferenceFindings1 citations
- What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and EvaluationLong1 citations
- What We Talk About When We Talk About LMs: Implicit Paradigm Shifts and the Ship of Language ModelsLong1 citations
- Who Relies More on World Knowledge and Bias for Syntactic Ambiguity Resolution: Humans or LLMs?Long1 citations
- Zero-Shot Strategies for Length-Controllable SummarizationFindings1 citations
- eRevise+RF: A Writing Evaluation System for Assessing Student Essay Revisions and Providing Formative FeedbackSystem Demonstrations1 citations
- A Bayesian Optimization Approach to Machine Translation RerankingLong
- A Comprehensive Survey of Contemporary Arabic Sentiment Analysis: Methods, Challenges, and Future DirectionsFindings
- A Context-Aware Contrastive Learning Framework for Hateful Meme Detection and SegmentationFindings
- A Data-Driven Method for Analyzing and Quantifying Lyrics-Dance Motion RelationshipsLong
- A Diverse and Effective Retrieval-Based Debt Collection System with Expert KnowledgeIndustry
- A Fair Comparison without Translationese: English vs. Target-language Instructions for Multilingual LLMsShort
- A Federated Framework for LLM-based RecommendationFindings
- A Grounded Typology of Word ClassesLong
- A Guide To Effectively Leveraging LLMs for Low-Resource Text Summarization: Data Augmentation and Semi-supervised ApproachesFindings
- A Large-Scale Benchmark for Vietnamese Sentence ParaphrasesFindings
- A Layered Debating Multi-Agent System for Similar Disease DiagnosisShort
- A Learning-based Multi-Frame Visual Feature Framework for Real-Time Driver Fatigue DetectionSystem Demonstrations
- A Mixed-Language Multi-Document News Summarization Dataset and a Graphs-Based Extract-Generate ModelLong
- A Multi-modal Large Language Model with Graph-of-Thought for Effective RecommendationLong
- A Practical Analysis of Human Alignment with *POFindings
- A Practical Method for Generating String CounterfactualsFindings
- A Sentence-Level Visualization of Attention in Large Language ModelsSystem Demonstrations
- A Survey of NLP Progress in Sino-Tibetan Low-Resource LanguagesLong
- A Survey of QUD Models for Discourse ProcessingLong
- A Systematic Examination of Preference Learning through the Lens of Instruction-FollowingLong
- A Top-down Graph-based Tool for Modeling Classical Semantic Maps: A Case Study of Supplementary AdverbsLong
- A Unified Supervised and Unsupervised Dialogue Topic Segmentation Framework Based on Utterance Pair ModelingLong
- ACCORD: Closing the Commonsense Measurability GapLong
- AID: Adaptive Integration of Detectors for Safe AI with Language ModelsLong
- ALERT: An LLM-powered Benchmark for Automatic Evaluation of Recommendation ExplanationsLong
- ALOHA: Empowering Multilingual Agent for University Orientation with Hierarchical RetrievalSystem Demonstrations
- AMPS: ASR with Multimodal Paraphrase SupervisionShort
- ARISE: Iterative Rule Induction and Synthetic Data Generation for Text ClassificationFindings
- ATAIGI: An AI-Powered Multimodal Learning App Leveraging Generative Models for Low-Resource Taiwanese HokkienSystem Demonstrations
- AcrosticSleuth: Probabilistic Identification and Ranking of Acrostics in Multilingual CorporaFindings
- Active Few-Shot Learning for Text ClassificationLong
- Adapting LLM Agents with Universal Communication FeedbackFindings
- Adapting Sentence-level Automatic Metrics for Document-level Simplification EvaluationLong
- Advancing Persian LLM EvaluationFindings
- Afrispeech-Dialog: A Benchmark Dataset for Spontaneous English Conversations in Healthcare and BeyondLong
- Aggregation Artifacts in Subjective Tasks Collapse Large Language Models’ PosteriorsLong
- AlgoPuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Algorithmic Multimodal PuzzlesLong
- AlignFreeze: Navigating the Impact of Realignment on the Layers of Multilingual Models Across Diverse LanguagesShort
- Aligning Black-box Language Models with Human JudgmentsFindings
- Aligning Sentence Simplification with ESL Learner’s Proficiency for Language AcquisitionLong
- Aligning to Constraints for Data-Efficient Language Model CustomizationFindings
- Amphista: Bi-directional Multi-head Decoding for Accelerating LLM InferenceLong
- An Annotated Dataset of Errors in Premodern Greek and Baselines for Detecting ThemFindings
- An Efficient Context-Dependent Memory Framework for LLM-Centric AgentsIndustry
- An Efficient Gloss-Free Sign Language Translation Using Spatial Configurations and Motion Dynamics with LLMsLong
- An LLM-Based Approach for Insight Generation in Data AnalysisLong
- An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as OptimizerFindings
- AnaScore: Understanding Semantic Parallelism in Proportional AnalogiesLong
- Analysis of LLM as a grammatical feature tagger for African American EnglishFindings
- Analyzing Memorization in Large Language Models through the Lens of Model AttributionLong
- Analyzing and Improving Coherence of Large Language Models in Question AnsweringLong
- Analyzing the Inner Workings of Transformers in Compositional GeneralizationLong
- Anticipating Future with Large Language Model for Simultaneous Machine TranslationLong
- Are Language Models Agnostic to Linguistically Grounded Perturbations? A Case Study of Indic LanguagesFindings
- Are Multimodal LLMs Robust Against Adversarial Perturbations? RoMMath: A Systematic Evaluation on Multimodal Math ReasoningLong
- Are explicit belief representations necessary? A comparison between Large Language Models and Bayesian probabilistic modelsLong
- As easy as PIE: understanding when pruning causes language models to disagreeFindings
- Atoxia: Red-teaming Large Language Models with Target Toxic AnswersFindings
- Attention on Multiword Expressions: A Multilingual Study of BERT-based Models with Regard to Idiomaticity and MicrosyntaxFindings
- Augmented Adversarial Trigger LearningFindings
- Auto-Cypher: Improving LLMs on Cypher generation via LLM-supervised generation-verification frameworkShort
- AutoClean: LLMs Can Prepare Their Training CorpusSystem Demonstrations
- AutoEval-ToD: Automated Evaluation of Task-oriented Dialog SystemsLong
- AutoKB: Automated Creation of Structured Knowledge Bases for Domain-Specific SupportIndustry
- AutoParLLM: GNN-guided Context Generation for Zero-Shot Code Parallelization using LLMsLong
- Automatic Annotation Augmentation Boosts Translation between Molecules and Natural LanguageFindings
- Automatic Input Rewriting Improves Translation with Large Language ModelsLong
- Automatically Discovering How Misogyny is Framed on Social MediaLong
- BEMEAE: Moving Beyond Exact Span Match for Event Argument ExtractionLong
- BRIEF: Bridging Retrieval and Inference for Multi-hop Reasoning via CompressionFindings
- Balancing Forget Quality and Model Utility: A Reverse KL-Divergence Knowledge Distillation Approach for Better Unlearning in LLMsLong
- BanNERD: A Benchmark Dataset and Context-Driven Approach for Bangla Named Entity RecognitionFindings
- BanTH: A Multi-label Hate Speech Detection Dataset for Transliterated BanglaFindings
- Bayelemabaga: Creating Resources for Bambara NLPLong
- Behavior-SD: Behaviorally Aware Spoken Dialogue Generation with Large Language ModelsLong
- Benchmarking and Building Zero-Shot Hindi Retrieval Model with Hindi-BEIR and NLLB-E5Long
- Beyond Benchmarks: Building a Richer Cross-Document Event Coreference Dataset with DecontextualizationLong
- Beyond End-to-End VLMs: Leveraging Intermediate Text Representations for Superior Flowchart UnderstandingLong
- Beyond Excess and Deficiency: Adaptive Length Bias Mitigation in Reward Models for RLHFFindings
- Beyond Literal Token Overlap: Token Alignability for MultilingualityShort
- Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language ModelsFindings
- Beyond the Mode: Sequence-Level Distillation of Multilingual Translation Models for Low-Resource Language PairsFindings
- Beyond the Safety Bundle: Auditing the Helpful and Harmless DatasetLong
- Biases in Opinion Dynamics in Multi-Agent Systems of Large Language Models: A Case Study on Funding AllocationFindings
- BitAbuse: A Dataset of Visually Perturbed Texts for Defending Phishing AttacksFindings
- Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language ModelsShort
- BnTTS: Few-Shot Speaker Adaptation in Low-Resource SettingFindings
- Bottom-Up Synthesis of Knowledge-Grounded Task-Oriented Dialogues with Iteratively Self-Refined PromptsShort
- Break-Ideate-Generate (BrIdGe): Moving beyond Translations for Localization using LLMsIndustry
- Breaking Boundaries: Investigating the Effects of Model Editing on Cross-linguistic PerformanceIndustry
- Breaking Down Power Barriers in On-Device Streaming ASR: Insights and SolutionsIndustry
- Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted CaptionsLong
- CA*: Addressing Evaluation Pitfalls in Computation-Aware Latency for Simultaneous Speech TranslationFindings
- CAMIEval: Enhancing NLG Evaluation through Multidimensional Comparative Instruction-Following AnalysisLong
- CAPE: A Chinese Dataset for Appraisal-based Emotional Generation in Large Language ModelsFindings
- CAST: Corpus-Aware Self-similarity Enhanced Topic modellingLong
- CDB: A Unified Framework for Hope Speech Detection Through Counterfactual, Desire and BeliefFindings
- CLEAR-Command: Coordinated Listening, Extraction, and Allocation for Emergency Response with Large Language ModelsSystem Demonstrations
- COAST: Enhancing the Code Debugging Ability of LLMs through Communicative Agent Based Data SynthesisFindings
- CONSTRUCTA: Automating Commercial Construction Schedules in Fabrication Facilities with Large Language ModelsIndustry
- CORG: Generating Answers from Complex, Interrelated ContextsLong
- CORRECT: Context- and Reference-Augmented Reasoning and Prompting for Fact-CheckingLong
- CPRM: A LLM-based Continual Pre-training Framework for Relevance Modeling in Commercial SearchIndustry
- CRScore: Grounding Automated Evaluation of Code Review Comments in Code Claims and SmellsLong
- CSR-Bench: Benchmarking LLM Agents in Deployment of Computer Science Research RepositoriesLong
- CVE-Bench: Benchmarking LLM-based Software Engineering Agent’s Ability to Repair Real-World CVE VulnerabilitiesLong
- Can I Introduce My Boyfriend to My Grandmother? Evaluating Large Language Models Capabilities on Iranian Social Norm ClassificationFindings
- Can Large Language Models Invent Algorithms to Improve Themselves?Long
- Can Post-Training Quantization Benefit from an Additional QLoRA Integration?Industry
- Capturing Human Cognitive Styles with Language: Towards an Experimental Evaluation ParadigmShort
- CaseSumm: A Large-Scale Dataset for Long-Context Summarization from U.S. Supreme Court OpinionsFindings
- CausalEval: Towards Better Causal Reasoning in Language ModelsLong
- CausalGraph2LLM: Evaluating LLMs for Causal QueriesFindings
- Causally Modeling the Linguistic and Social Factors that Predict Email ResponseLong
- Cerebrum (AIOS SDK): A Platform for Agent Development, Deployment, Distribution, and DiscoverySystem Demonstrations
- ChaI-TeA: A Benchmark for Evaluating Autocompletion of Interactions with LLM-based ChatbotsShort
- Chain-of-Rank: Enhancing Large Language Models for Domain-Specific RAG in Edge DeviceFindings
- Challenges and Remedies of Domain-Specific Classifiers as LLM Guardrails: Self-Harm as a Case StudyIndustry
- Characterizing the Effects of Translation on Intertextuality using Multilingual Embedding SpacesShort
- Chatbot Arena Estimate: towards a generalized performance benchmark for LLM capabilitiesIndustry
- Chinese Morph Resolution in E-commerce Live Streaming ScenariosIndustry
- Classic4Children: Adapting Chinese Literary Classics for Children with Large Language ModelFindings
- CluSanT: Differentially Private and Semantically Coherent Text SanitizationLong
- CoRAC: Integrating Selective API Document Retrieval with Question Semantic Intent for Code Question AnsweringLong
- CoRAG: Collaborative Retrieval-Augmented GenerationShort
- CodeGenWrangler: Data Wrangling task automation using Code-Generating ModelsIndustry
- Commonality and Individuality! Integrating Humor Commonality with Speaker Individuality for Humor RecognitionLong
- CompAct: Compressed Activations for Memory-Efficient LLM TrainingLong
- Complete Chess Games Enable LLM Become A Chess MasterShort
- ConMeC: A Dataset for Metonymy Resolution with Common NounsLong
- ConQRet: A New Benchmark for Fine-Grained Automatic Evaluation of Retrieval Augmented Computational ArgumentationLong
- ConShift: Sense-based Language Variation Analysis using Flexible AlignmentFindings
- Concept Distillation from Strong to Weak Models via Hypotheses-to-Theories PromptingIndustry
- Conflict and Overlap Classification in Construction Standards Using a Large Language ModelIndustry
- Considering Length Diversity in Retrieval-Augmented SummarizationFindings
- Constrained Decoding with Speculative LookaheadsLong
- Constraining Sequential Model Editing with Editing Anchor CompressionFindings
- Context-Efficient Retrieval with Factual DecompositionShort
- Contextual Metric Meta-Evaluation by Measuring Local Metric AccuracyFindings
- Continual Learning in Multilingual Sign Language TranslationLong
- Coverage-based Fairness in Multi-document SummarizationLong
- CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web NavigationSystem Demonstrations
- CultureInstruct: Curating Multi-Cultural Instructions at ScaleLong
- DDGIP: Radiology Report Generation Through Disease Description Graph and Informed PromptingFindings
- DETQUS: Decomposition-Enhanced Transformers for QUery-focused SummarizationLong
- DOLFIN - Document-Level Financial Test-Set for Machine TranslationFindings
- DPL: Diverse Preference Learning Without A Reference ModelLong
- DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language ModelsLong
- DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation ModelsLong
- DSQG-Syn: Synthesizing High-quality Data for Text-to-SQL Parsing by Domain Specific Question GenerationFindings
- DSRAG: A Double-Stream Retrieval-Augmented Generation Framework for Countless Intent DetectionIndustry
- Data-Efficiently Learn Large Language Model for Universal 3D Scene PerceptionFindings
- DeCAP: Context-Adaptive Prompt Generation for Debiasing Zero-shot Question Answering in Large Language ModelsLong
- Debate-Feedback: A Multi-Agent Framework for Efficient Legal Judgment PredictionShort
- Decoding Fatphobia: Examining Anti-Fat and Pro-Thin Bias in AI-Generated ImagesFindings
- Decomposition Dilemmas: Does Claim Decomposition Boost or Burden Fact-Checking Performance?Long
- Defense against Prompt Injection Attacks via Mixture of EncodingsShort
- Demystifying the Power of Large Language Models in Graph GenerationFindings
- DenseSSM: State Space Models with Dense Hidden Connection for Efficient Large Language ModelsLong
- Detect, Disambiguate, and Translate: On-Demand Visual Reasoning for Multimodal Machine Translation with Large Vision-Language ModelsLong
- Developing a Reliable, Fast, General-Purpose Hallucination Detection and Mitigation ServiceIndustry
- Developing multilingual speech synthesis system for Ojibwe, Mi’kmaq, and MaliseetShort
- DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And IntelligibilityFindings
- Dialetto, ma Quanto Dialetto? Transcribing and Evaluating Dialects on a ContinuumFindings
- Dialogue Language Model with Large-Scale Persona Data EngineeringIndustry
- Differentially Private Learning Needs Better Model Initialization and Self-DistillationLong
- Dis2Dis: Explaining Ambiguity in Fact-CheckingFindings
- DisComp: A Two-Stage Prompt Optimization Framework Combining Task-Agnostic and Task-Aware CompressionFindings
- DiscoGraMS: Enhancing Movie Screen-Play Summarization using Movie Character-Aware Discourse GraphShort
- DiscoverGPT: Multi-task Fine-tuning Large Language Model for Related Table DiscoveryFindings
- Discrete Diffusion Language Model for Efficient Text SummarizationFindings
- Disentangling language change: sparse autoencoders quantify the semantic evolution of indigeneity in FrenchLong
- Distill-C: Enhanced NL2SQL via Distilled Customization with LLMsIndustry
- Diverse In-Context Example Selection After Decomposing Programs and Aligned Utterances Improves Semantic ParsingLong
- Do Audio-Language Models Understand Linguistic Variations?Short
- Does Generative AI speak Nigerian-Pidgin?: Issues about Representativeness and Bias for Multilingualism in LLMsFindings
- Does Self-Attention Need Separate Weights in Transformers?Industry
- Don’t Touch My DiacriticsShort
- DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech RecognitionLong
- DynClean: Training Dynamics-based Label Cleaning for Distantly-Supervised Named Entity RecognitionFindings
- Dynamic Feature Fusion for Sign Language Translation Using HyperNetworksFindings
- Dynamic Fisher-weighted Model Merging via Bayesian OptimizationLong
- Dynamic Strategy Planning for Efficient Question Answering with Large Language ModelsFindings
- Dynamic Uncertainty Ranking: Enhancing Retrieval-Augmented In-Context Learning for Long-Tail Knowledge in LLMsLong
- E-Gen: Leveraging E-Graphs to Improve Continuous Representations of Symbolic ExpressionsLong
- EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language ModelsLong
- ERAS: Evaluating the Robustness of Chinese NLP Models to Morphological Garden Path ErrorsLong
- ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue SystemsSystem Demonstrations
- Echoes of Discord: Forecasting Hater Reactions to CounterspeechFindings
- Effective Self-Mining of In-Context Examples for Unsupervised Machine Translation with LLMsFindings
- Efficient Nearest Neighbor based Uncertainty Estimation for Natural Language Processing TasksFindings
- Efficient One-shot Compression via Low-Rank Local Feature DistillationLong
- Efficient and Effective Prompt Tuning via Prompt Decomposition and Compressed Outer ProductLong
- EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the WildFindings
- Elevating Legal LLM Responses: Harnessing Trainable Logical Structures and Semantic Knowledge with Legal ReasoningLong
- Eliciting Critical Reasoning in Retrieval-Augmented Generation via Contrastive ExplanationsLong
- Embedding derived animacy rankings offer insights into the sources of grammatical animacyLong
- Emergence of Episodic Memory in Transformers: Characterizing Changes in Temporal Structure of Attention Scores During TrainingLong
- Emo3D: Metric and Benchmarking Dataset for 3D Facial Expression Generation from Emotion DescriptionFindings
- EmoCharacter: Evaluating the Emotional Fidelity of Role-Playing Agents in DialoguesLong
- EmoDynamiX: Emotional Support Dialogue Strategy Prediction by Modelling MiXed Emotions and Discourse DynamicsLong
- EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMsLong
- Empowering Retrieval-based Conversational Recommendation with Contrasting User PreferencesLong
- Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based AttackFindings
- Enhancing Discriminative Representation in Similar Relation Clusters for Few-Shot Continual Relation ExtractionLong
- Enhancing Language Model Hypernetworks with Restart: A Study on OptimizationLong
- Enhancing Text-to-SQL with Question Classification and Multi-Agent CollaborationFindings
- Enhancing the Prototype Network with Local-to-Global Optimization for Few-Shot Relation ExtractionFindings
- Entangled Relations: Leveraging NLI and Meta-analysis to Enhance Biomedical Relation ExtractionLong
- Entity Pair-guided Relation Summarization and Retrieval in LLMs for Document-level Relation ExtractionFindings
- Ethical Concern Identification in NLP: A Corpus of ACL Anthology Ethics StatementsLong
- Evaluating Bias in LLMs for Job-Resume Matching: Gender, Race, and EducationIndustry
- Evaluating Contextualized Representations of (Spanish) Ambiguous Words: A New Lexical Resource and Empirical AnalysisLong
- Evaluating Evidence Attribution in Generated Fact Checking ExplanationsLong
- Evaluating Input Feature Explanations through a Unified Diagnostic Evaluation FrameworkLong
- Evaluating LLMs for Quotation Attribution in Literary Texts: A Case Study of LLaMa3Short
- Evaluating Large Language Models with Enterprise BenchmarksIndustry
- Evaluating Multimodal Generative AI with Korean Educational StandardsShort
- Evaluating Numeracy of Language Models as a Natural Language Inference TaskFindings
- Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language ModelsFindings
- Evaluating and Improving Graph to Text Generation with Large Language ModelsLong
- Evaluating and Mitigating Object Hallucination in Large Vision-Language Models: Can They Still See Removed Objects?Long
- Evaluating the Performance of RAG Methods for Conversational AI in the Airport DomainIndustry
- Evaluation of LLMs-based Hidden States as Author Representations for Psychological Human-Centered NLP TasksFindings
- Examining Spanish Counseling with MIDAS: a Motivational Interviewing Dataset in SpanishShort
- Explanation based In-Context Demonstrations Retrieval for Multilingual Grammatical Error CorrectionLong
- Exploiting Edited Large Language Models as General Scientific OptimizersLong
- Exploring Backward Reasoning in Large Language ModelsFindings
- Exploring Hybrid Sampling Inference for Aspect-based Sentiment AnalysisFindings
- Exploring Large Language Models for Effective Rumor Detection on Social MediaLong
- Exploring Straightforward Methods for Automatic Conversational Red-TeamingIndustry
- Exploring the Cost-Effectiveness of Perspective Taking in Crowdsourcing Subjective Assessment: A Case Study of Toxicity DetectionLong
- Extracting Military Event Temporal Relations via Relative Event Time Prediction and Virtual Adversarial TrainingFindings
- Extracting and Understanding the Superficial Knowledge in AlignmentLong
- FACT: Examining the Effectiveness of Iterative Context Rewriting for Multi-fact RetrievalFindings
- FACTS&EVIDENCE: An Interactive Tool for Transparent Fine-Grained Factual Verification of Machine-Generated TextSystem Demonstrations
- FIDELITY: Fine-grained Interpretable Distillation for Effective Language Insights and Topic YieldingFindings
- FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language ModelsFindings
- FLEX: Expert-level False-Less EXecution Metric for Text-to-SQL BenchmarkLong
- FLIQA-AD: a Fusion Model with Large Language Model for Better Diagnose and MMSE Prediction of Alzheimer’s DiseaseShort
- FactEval: Evaluating the Robustness of Fact Verification Systems in the Era of Large Language ModelsLong
- FactTrack: Time-Aware World State Tracking in Story OutlinesLong
- Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary EvaluationLong
- FaithfulPersona: Balancing Faithfulness and Personalization in Code Explanations through Self-CritiqueFindings
- Familiarity: Better Evaluation of Zero-Shot Named Entity Recognition by Quantifying Label Shifts in Synthetic Training DataLong
- Features that Make a Difference: Leveraging Gradients for Improved Dictionary LearningFindings
- Few-Shot Natural Language to First-Order Logic Translation via Code GenerationLong
- FiNE: Filtering and Improving Noisy Data Elaborately with Large Language ModelsLong
- Fighting Spurious Correlations in Text Classification via a Causal Learning PerspectiveLong
- FinLLM-B: When Large Language Models Meet Financial Breakout TradingIndustry
- Find the Intention of Instruction: Comprehensive Evaluation of Instruction Understanding for Large Language ModelsFindings
- Finding-Centric Structuring of Japanese Radiology Reports and Analysis of Performance Gaps for Multiple FacilitiesIndustry
- Fine-Grained Transfer Learning for Harmful Content Detection through Label-Specific Soft Prompt TuningLong
- Fine-grained Fallacy Detection with Human Label VariationLong
- FlexiGPT: Pruning and Extending Large Language Models with Low-Rank Weight SharingLong
- Follow the Beaten Path: The Role of Route Patterns on Vision-Language Navigation Agents Generalization AbilitiesLong
- Forest for the Trees: Overarching Prompting Evokes High-Level Reasoning in Large Language ModelsLong
- From Argumentation to Deliberation: Perspectivized Stance Vectors for Fine-grained (Dis)agreement AnalysisFindings
- From Curiosity to Clarity : Exploring the Impact of Consecutive Why-QuestionsFindings
- From Evidence to Belief: A Bayesian Epistemology Approach to Language ModelsLong
- From Generating Answers to Building Explanations: Integrating Multi-Round RAG and Causal Modeling for Scientific QAIndustry
- Functional Lexicon in Subword TokenizationLong
- GAIfE: Using GenAI to Improve Literacy in Low-resourced SettingsFindings
- GRAIT: Gradient-Driven Refusal-Aware Instruction Tuning for Effective Hallucination MitigationFindings
- GameTox: A Comprehensive Dataset and Analysis for Enhanced Toxicity Detection in Online Gaming CommunitiesShort
- Gender Bias in Instruction-Guided Speech Synthesis ModelsFindings
- Generating Complex Question Decompositions in the Face of Distribution ShiftsLong
- Generating Diverse Hypotheses for Inductive ReasoningLong
- Generative Prompt InternalizationLong
- Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra DataLong
- Giving the Old a Fresh Spin: Quality Estimation-Assisted Constrained Decoding for Automatic Post-EditingShort
- Goal-Conditioned DPO: Prioritizing Safety in Misaligned InstructionsLong
- Goal-Driven Data Story, Narrations and ExplanationsIndustry
- Granite Guardian: Comprehensive LLM SafeguardingIndustry
- Graph Neural Network Enhanced Retrieval for Question Answering of Large Language ModelsLong
- GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph DatasetsFindings
- GraphLSS: Integrating Lexical, Structural, and Semantic Features for Long Document Extractive SummarizationShort
- GroundCocoa: A Benchmark for Evaluating Compositional & Conditional Reasoning in Language ModelsLong
- GuideLLM: Exploring LLM-Guided Conversation with Applications in Autobiography InterviewingLong
- GuideQ: Framework for Guided Questioning for progressive informational collection and classificationFindings
- Guideline Compliance in Task-Oriented Dialogue: The Chained Prior ApproachFindings
- Guiding Medical Vision-Language Models with Diverse Visual Prompts: Framework Design and Comprehensive Exploration of Prompt VariationsLong
- Guiding Through Complexity: What Makes Good Supervision for Hard Reasoning Tasks?Long
- HEISIR: Hierarchical Expansion of Inverted Semantic Indexing for Training-free Retrieval of Conversational Data using LLMsFindings
- HISTOIRESMORALES: A French Dataset for Assessing Moral AlignmentLong
- Handling Missing Entities in Zero-Shot Named Entity Recognition: Integrated Recall and Retrieval AugmentationLong
- Hard Emotion Test Evaluation Sets for Language ModelsFindings
- Harnessing and Evaluating the Intrinsic Extrapolation Ability of Large Language Models for Vehicle Trajectory PredictionLong
- Hierarchical Speculative Decoding with Dynamic WindowFindings
- How LLMs React to Industrial Spatio-Temporal Data? Assessing Hallucination with a Novel Traffic Incident Benchmark DatasetIndustry
- How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language ModelsFindings
- How much do contextualized representations encode long-range context?Findings
- How to Align Multiple Signed Language Corpora for Better Sign-to-Sign Translations?Long
- How to Learn in a Noisy World? Self-Correcting the Real-World Data Noise in Machine TranslationFindings
- How to Make LLMs Forget: On Reversing In-Context Knowledge EditsLong
- How to Talk to Language Models: Serialization Strategies for Structured Entity MatchingFindings
- IMRRF: Integrating Multi-Source Retrieval and Redundancy Filtering for LLM-based Fake News DetectionLong
- ITALIC: An Italian Culture-Aware Natural Language BenchmarkLong
- IdentifyMe: A Challenging Long-Context Mention Resolution Benchmark for LLMsShort
- Identifying Emerging Concepts in Large CorporaLong
- Identifying Power Relations in Conversations using Multi-Agent Social ReasoningShort
- Ihquin tlahtouah in Tetelahtzincocah: An annotated, multi-purpose audio and text corpus of Western Sierra Puebla NahuatlLong
- ImaRA: An Imaginative Frame Augmented Method for Low-Resource Multimodal Metaphor Detection and ExplanationFindings
- Implementing Retrieval Augmented Generation Technique on Unstructured and Structured Data Sources in a Call Center of a Large Financial InstitutionIndustry
- Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language ModelsFindings
- Improving Consistency in LLM Inference using Probabilistic TokenizationFindings
- Improving Data Annotation for Low-Resource Relation Extraction with Logical Rule-Augmented Collaborative Language ModelsLong
- Improving Pre-trained Language Models with Knowledge Enhancement and Filtering FrameworkFindings
- Improving Vietnamese-English Cross-Lingual Retrieval for Legal and General DomainsShort
- In-Context Learning (and Unlearning) of Length BiasesLong
- Inference-Time Selective Debiasing to Enhance Fairness in Text Classification ModelsShort
- InfoPO: On Mutual Information Maximization for Large Language Model AlignmentLong
- Instantly Learning Preference Alignment via In-context DPOLong
- InstructAny2Pix: Image Editing with Multi-Modal PromptsFindings
- Interpret and Control Dense Retrieval with Sparse Latent FeaturesShort
- Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language EncodersLong
- Intrinsic Model Weaknesses: How Priming Attacks Unveil Vulnerabilities in Large Language ModelsFindings
- Investigating Hallucinations in Simultaneous Machine Translation: Knowledge Distillation Solution and Components AnalysisLong
- Investigating the (De)Composition Capabilities of Large Language Models in Natural-to-Formal Language ConversionLong
- Investigating the Shortcomings of LLMs in Step-by-Step Legal ReasoningFindings
- Investigating the Zone of Proximal Development of Language Models for In-Context LearningFindings
- Is In-Context Learning a Type of Error-Driven Learning? Evidence from the Inverse Frequency Effect in Structural PrimingLong
- Is Your LLM Outdated? A Deep Look at Temporal GeneralizationLong
- Is your benchmark truly adversarial? AdvScore: Evaluating Human-Grounded AdversarialnessLong
- It Is Not Only the Negative that Deserves Attention! Understanding, Generation & Evaluation of (Positive) ModerationLong
- JAWAHER: A Multidialectal Dataset of Arabic Proverbs for LLM BenchmarkingLong
- JRE-L: Journalist, Reader, and Editor LLMs in the Loop for Science Journalism for the General AudienceLong
- Joint Learning Event-Specific Probe and Argument Library with Differential Optimization for Document-Level Multi-Event ExtractionFindings
- K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic ReasoningLong
- KMI: A Dataset of Korean Motivational Interviewing Dialogues for PsychotherapyLong
- KS-Lottery: Finding Certified Lottery Tickets for Multilingual Transfer in Large Language ModelsLong
- Keep Guessing? When Considering Inference Scaling, Mind the BaselinesFindings
- Kill two birds with one stone: generalized and robust AI-generated text detection via dynamic perturbationsLong
- Knowledge Graph Guided Evaluation of Abstention TechniquesLong
- LBC: Language-Based-Classifier for Out-Of-Variable GeneralizationLong
- LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMsLong
- LITERA: An LLM Based Approach to Latin-to-English TranslationFindings
- LLM Safety for ChildrenIndustry
- LLM-Based Explicit Models of Opponents for Multi-Agent GamesLong
- LLM-Generated Passphrases That Are Secure and Easy to RememberFindings
- LLM-Human Pipeline for Cultural Grounding of ConversationsLong
- LLM-Supported Natural Language to Bash TranslationLong
- LLM-guided Plan and Retrieval: A Strategic Alignment for Interpretable User Satisfaction Estimation in DialogueLong
- LLM4DistReconfig: A Fine-tuned Large Language Model for Power Distribution Network ReconfigurationLong
- LLMs for Extremely Low-Resource Finno-Ugric LanguagesFindings
- LLaMA-Berry: Pairwise Optimization for Olympiad-level Mathematical Reasoning via O1-like Monte Carlo Tree SearchLong
- LM-Pub-Quiz: A Comprehensive Framework for Zero-Shot Evaluation of Relational Knowledge in Language ModelsSystem Demonstrations
- LOFT: Scalable and More Realistic Long-Context EvaluationFindings
- LSDC: An Efficient and Effective Large-Scale Data Compression Method for Supervised Fine-tuning of Large Language ModelsFindings
- Label Drop for Multi-Aspect Relation Modeling in Universal Information ExtractionLong
- Language Models Largely Exhibit Human-like Constituent Ordering PreferencesLong
- Language Models can Categorize System Inputs for Performance AnalysisLong
- Language-based Valence and Arousal Expressions between the United States and China: a Cross-Cultural ExaminationFindings
- Large Language Models and Causal Inference in Collaboration: A Comprehensive SurveyFindings
- Large Language Models for Persian-English Idiom TranslationLong
- Large-Scale Corpus Construction and Retrieval-Augmented Generation for Ancient Chinese Poetry: New Method and Data InsightsFindings
- Latent Factor Models Meets Instructions: Goal-conditioned Latent Factor Discovery without Task SupervisionLong
- Learning LLM Preference over Intra-Dialogue Pairs: A Framework for Utterance-level UnderstandingsIndustry
- Learning Low-Resource Languages Through NLP-Driven Flashcards: A Case Study of Hokkien in Language Learning ApplicationsSystem Demonstrations
- Learning to Explore and Select for Coverage-Conditioned Retrieval-Augmented GenerationFindings
- Learning to Solve Domain-Specific Calculation Problems with Knowledge-Intensive Programs GeneratorLong
- Learning to Substitute Words with Model-based Score RankingLong
- Learning with Less: Knowledge Distillation from Large Language Models via Unlabeled DataFindings
- Legal Judgment Prediction based on Knowledge-enhanced Multi-Task and Multi-Label Text ClassificationLong
- LegalSeg: Unlocking the Structure of Indian Legal Judgments Through Rhetorical Role ClassificationFindings
- LegalViz: Legal Text Visualization by Text To Diagram GenerationLong
- Lessons from a User Experience Evaluation of NLP InterfacesFindings
- Let Modalities Teach Each Other: Modal-Collaborative Knowledge Extraction and Fusion for Multimodal Knowledge Graph CompletionFindings
- Leveraging Allophony in Self-Supervised Speech Models for Atypical Pronunciation AssessmentLong
- Leveraging LLM For Synchronizing Information Across Multilingual TablesLong
- Leveraging Moment Injection for Enhanced Semi-supervised Natural Language Inference with Large Language ModelsShort
- Lightweight Contenders: Navigating Semi-Supervised Text Mining through Peer Collaboration and Self TranscendenceFindings
- Linguistically Grounded Analysis of Language Models using Shapley Head ValuesFindings
- Little Giants: Synthesizing High-Quality Embedding Data at ScaleLong
- Local Prompt OptimizationShort
- LogRules: Enhancing Log Analysis Capability of Large Language Models through RulesFindings
- Logit Separability-Driven Samples and Multiple Class-Related Words Selection for Advancing In-Context LearningLong
- Long-Tail Crisis in Nearest Neighbor Language ModelsFindings
- LongLeader: A Comprehensive Leaderboard for Large Language Models in Long-context ScenariosLong
- Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative DecodingFindings
- Lost in Overlap: Exploring Logit-based Watermark Collision in LLMsFindings
- Lost in the Distance: Large Language Models Struggle to Capture Long-Distance Relational KnowledgeFindings
- M-IFEval: Multilingual Instruction-Following EvaluationFindings
- MASTER: A Multi-Agent System with LLM Specialized MCTSLong
- MATO: A Model-Agnostic Training Optimization for Aspect Sentiment Triplet ExtractionLong
- MAiDE-up: Multilingual Deception Detection of AI-generated Hotel ReviewsFindings
- MES-RAG: Bringing Multi-modal, Entity-Storage, and Secure Enhancements to RAGFindings
- METAPHORSHARE: A Dynamic Collaborative Repository of Open Metaphor DatasetsSystem Demonstrations
- MGM: Global Understanding of Audience Overlap Graphs for Predicting the Factuality and the Bias of News MediaLong
- MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with ToolsLong
- MMLF: Multi-query Multi-passage Late Fusion RetrievalFindings
- MRE-MI: A Multi-image Dataset for Multimodal Relation Extraction in Social Media PostsFindings
- MT-LENS: An all-in-one Toolkit for Better Machine Translation EvaluationSystem Demonstrations
- Main Predicate and Their Arguments as Explanation Signals For Intent ClassificationLong
NAACL accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.