ACL 2024 Accepted Papers
The full list of 1,930 papers accepted at ACL 2024 (Association for Computational Linguistics). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Findings: 953Long: 863Short: 76System Demonstrations: 38
- Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language ModelsLong766 citations
- Large Language Models are not Fair EvaluatorsLong442 citations
- LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language ModelsSystem Demonstrations440 citations
- Chain-of-Verification Reduces Hallucination in Large Language ModelsFindings390 citations
- Improving Text Embeddings with Large Language ModelsLong339 citations
- Aligning Large Multimodal Models with Factually Augmented RLHFFindings307 citations
- MM-LLMs: Recent Advances in MultiModal Large Language ModelsFindings287 citations
- LLM-QAT: Data-Free Quantization Aware Training for Large Language ModelsFindings278 citations
- How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMsLong260 citations
- DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language ModelsLong245 citations
- CMMLU: Measuring massive multitask language understanding in ChineseFindings244 citations
- Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human AnnotationsLong242 citations
- LongBench: A Bilingual, Multitask Benchmark for Long Context UnderstandingLong221 citations
- BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical DomainsFindings217 citations
- Active Prompting with Chain-of-Thought for Large Language ModelsLong212 citations
- Navigate through Enigmatic Labyrinth A Survey of Chain of Thought Reasoning: Advances, Frontiers and FutureLong209 citations
- RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language ModelsFindings205 citations
- FreshLLMs: Refreshing Large Language Models with Search Engine AugmentationFindings202 citations
- LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt CompressionLong200 citations
- OLMo: Accelerating the Science of Language ModelsLong200 citations
- ChatDev: Communicative Agents for Software DevelopmentLong187 citations
- LaMP: When Large Language Models Meet PersonalizationLong185 citations
- Aya Model: An Instruction Finetuned Open-Access Multilingual Language ModelLong181 citations
- VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web TasksLong177 citations
- SafetyBench: Evaluating the Safety of Large Language ModelsLong176 citations
- Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMsLong174 citations
- Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language ModelsFindings169 citations
- Benchmarking Retrieval-Augmented Generation for MedicineFindings160 citations
- Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining ResearchLong156 citations
- AgentTuning: Enabling Generalized Agent Abilities for LLMsFindings145 citations
- Exploring Collaboration Mechanisms for LLM Agents: A Social Psychology ViewLong142 citations
- SeeClick: Harnessing GUI Grounding for Advanced Visual GUI AgentsLong141 citations
- Defending Against Alignment-Breaking Attacks via Robustly Aligned LLMLong140 citations
- Having Beer after Prayer? Measuring Cultural Bias in Large Language ModelsLong139 citations
- MedAgents: Large Language Models as Collaborators for Zero-shot Medical ReasoningFindings139 citations
- Full Parameter Fine-tuning for Large Language Models with Limited ResourcesLong138 citations
- Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language ModelsLong134 citations
- AnyGPT: Unified Multimodal LLM with Discrete Sequence ModelingLong132 citations
- Steering Llama 2 via Contrastive Activation AdditionLong132 citations
- OpenCodeInterpreter: Integrating Code Generation with Execution and RefinementFindings127 citations
- MindMap: Knowledge Graph Prompting Sparks Graph of Thoughts in Large Language ModelsLong125 citations
- OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific ProblemsLong123 citations
- How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data CompositionLong118 citations
- emotion2vec: Self-Supervised Pre-Training for Speech Emotion RepresentationFindings115 citations
- LLM in a flash: Efficient Large Language Model Inference with Limited MemoryLong113 citations
- LooGLE: Can Long-Context Language Models Understand Long Contexts?Long112 citations
- SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language ModelsFindings112 citations
- SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware DecodingLong108 citations
- WebVoyager: Building an End-to-End Web Agent with Large Multimodal ModelsLong108 citations
- Visual In-Context Learning for Large Vision-Language ModelsFindings106 citations
- Are Emergent Abilities in Large Language Models just In-Context Learning?Long105 citations
- Disentangling Length from Quality in Direct Preference OptimizationFindings104 citations
- ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMsLong103 citations
- The Dawn After the Dark: An Empirical Study on Factuality Hallucination in Large Language ModelsLong103 citations
- Benchmarking Cognitive Biases in Large Language Models as EvaluatorsFindings102 citations
- Defending Large Language Models Against Jailbreaking Attacks Through Goal PrioritizationLong102 citations
- EconAgent: Large Language Model-Empowered Agents for Simulating Macroeconomic ActivitiesLong100 citations
- ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMsLong98 citations
- You Only Look at Screens: Multimodal Chain-of-Action AgentsFindings98 citations
- Aya Dataset: An Open-Access Collection for Multilingual Instruction TuningLong94 citations
- Data Augmentation using LLMs: Data Perspectives, Learning Paradigms and ChallengesFindings94 citations
- On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A SurveyFindings94 citations
- LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt CompressionFindings93 citations
- LLMs cannot find reasoning errors, but can correct them given the error locationFindings93 citations
- TempCompass: Do Video LLMs Really Understand Videos?Findings93 citations
- Do Llamas Work in English? On the Latent Language of Multilingual TransformersLong92 citations
- Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative DecodingFindings92 citations
- Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative DecodingLong91 citations
- The Belebele Benchmark: a Parallel Reading Comprehension Dataset in 122 Language VariantsLong89 citations
- RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language ModelsLong87 citations
- ChatKBQA: A Generate-then-Retrieve Framework for Knowledge Base Question Answering with Fine-tuned Large Language ModelsFindings85 citations
- LayerSkip: Enabling Early Exit Inference and Self-Speculative DecodingLong85 citations
- The Impact of Reasoning Step Length on Large Language ModelsFindings85 citations
- InFoBench: Evaluating Instruction Following Ability in Large Language ModelsFindings82 citations
- Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step by StepFindings80 citations
- Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language ModelsLong80 citations
- Who Wrote this Code? Watermarking for Code GenerationLong80 citations
- ∞Bench: Extending Long Context Evaluation Beyond 100K TokensLong80 citations
- CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding ChallengesLong79 citations
- Don’t Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM CollaborationLong79 citations
- Prompt Engineering a Prompt EngineerFindings79 citations
- Towards Safer Large Language Models through Machine UnlearningFindings79 citations
- Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image SequencesLong78 citations
- The Good and The Bad: Exploring Privacy Issues in Retrieval-Augmented Generation (RAG)Findings78 citations
- Do Large Language Models Latently Perform Multi-Hop Reasoning?Long77 citations
- Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective RewardsLong76 citations
- Black-Box Prompt Optimization: Aligning Large Language Models without Model TrainingLong74 citations
- Faithful Logical Reasoning via Symbolic Chain-of-ThoughtLong73 citations
- Large Language Models Can Learn Temporal ReasoningLong73 citations
- AutoAct: Automatic Agent Learning from Scratch for QA via Self-PlanningLong72 citations
- InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological InterviewsLong71 citations
- Investigating Cultural Alignment of Large Language ModelsLong71 citations
- MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn DialoguesLong71 citations
- Penetrative AI: Making LLMs Comprehend the Physical WorldFindings71 citations
- VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the WildLong71 citations
- AlignBench: Benchmarking Chinese Alignment of Large Language ModelsLong69 citations
- When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model LeaderboardsLong69 citations
- Everything of Thoughts: Defying the Law of Penrose Triangle for Thought GenerationFindings68 citations
- Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language ModelsFindings68 citations
- InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model AgentsFindings68 citations
- LLaMA Pro: Progressive LLaMA with Block ExpansionLong68 citations
- SeaLLMs - Large Language Models for Southeast AsiaSystem Demonstrations68 citations
- The Revolution of Multimodal Large Language Models: A SurveyFindings66 citations
- Small Models are Valuable Plug-ins for Large Language ModelsFindings65 citations
- Trial and Error: Exploration-Based Trajectory Optimization of LLM AgentsLong65 citations
- Boosting Language Models Reasoning with Chain-of-Knowledge PromptingLong62 citations
- Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language ModelsLong62 citations
- Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language ModelsLong62 citations
- Direct Preference Optimization with an OffsetFindings61 citations
- The Earth is Flat because...: Investigating LLMs’ Belief towards Misinformation via Persuasive ConversationLong61 citations
- LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-TuningFindings60 citations
- Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?Long60 citations
- SciMON: Scientific Inspiration Machines Optimized for NoveltyLong59 citations
- DebugBench: Evaluating Debugging Capability of Large Language ModelsFindings58 citations
- MAGE: Machine-generated Text Detection in the WildLong58 citations
- Quantifying the Persona Effect in LLM SimulationsLong58 citations
- Red Teaming Visual Language ModelsFindings58 citations
- Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language ModelsFindings58 citations
- ChartAssistant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction TuningFindings57 citations
- Evaluating Very Long-Term Conversational Memory of LLM AgentsLong57 citations
- Rephrasing the Web: A Recipe for Compute and Data-Efficient Language ModelingLong57 citations
- Unified Hallucination Detection for Multimodal Large Language ModelsLong57 citations
- AIR-Bench: Benchmarking Large Audio-Language Models via Generative ComprehensionLong56 citations
- Knowledge of Knowledge: Exploring Known-Unknowns Uncertainty with Large Language ModelsFindings56 citations
- Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive DecodingFindings56 citations
- CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent EvaluationLong55 citations
- The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual ContextsFindings55 citations
- Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-TuningLong54 citations
- FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language ModelsLong53 citations
- A Comprehensive Study of Jailbreak Attack versus Defense for Large Language ModelsFindings52 citations
- VIEScore: Towards Explainable Metrics for Conditional Image Synthesis EvaluationLong52 citations
- Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language ModelsFindings51 citations
- LLM2LLM: Boosting LLMs with Novel Iterative Data EnhancementFindings51 citations
- “My Answer is C”: First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language ModelsFindings51 citations
- DocLLM: A Layout-Aware Generative Language Model for Multimodal Document UnderstandingLong50 citations
- Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-AlignmentLong50 citations
- Model Editing at Scale leads to Gradual and Catastrophic ForgettingFindings50 citations
- Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on GraphsFindings49 citations
- GroundingGPT: Language Enhanced Multi-modal Grounding ModelLong49 citations
- Machine Unlearning of Pre-trained Large Language ModelsLong49 citations
- MapCoder: Multi-Agent Code Generation for Competitive Problem SolvingLong49 citations
- Neurons in Large Language Models: Dead, N-gram, PositionalFindings49 citations
- Relying on the Unreliable: The Impact of Language Models’ Reluctance to Express UncertaintyLong49 citations
- Shifting Attention to Relevance: Towards the Predictive Uncertainty Quantification of Free-Form Large Language ModelsLong49 citations
- Agent-Pro: Learning to Evolve via Policy-Level Reflection and OptimizationLong48 citations
- EmotionQueen: A Benchmark for Evaluating Empathy of Large Language ModelsFindings48 citations
- MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics BenchmarkFindings48 citations
- PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMsFindings48 citations
- Visual Hallucinations of Multi-modal Large Language ModelsFindings48 citations
- PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM InferenceFindings47 citations
- ChatMusician: Understanding and Generating Music Intrinsically with LLMFindings45 citations
- ReFT: Reasoning with Reinforced Fine-TuningLong45 citations
- Mission: Impossible Language ModelsLong44 citations
- MultiLegalPile: A 689GB Multilingual Legal CorpusLong44 citations
- Quantifying Uncertainty in Answers from any Language Model and Enhancing their TrustworthinessLong44 citations
- Fact-Checking the Output of Large Language Models via Token-Level Uncertainty QuantificationFindings43 citations
- MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMsLong43 citations
- The Art of Defending: A Systematic Evaluation and Analysis of LLM Defense Strategies on Safety and Over-DefensivenessFindings43 citations
- MMToM-QA: Multimodal Theory of Mind Question AnsweringLong42 citations
- Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit CluesFindings42 citations
- Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language ModelsLong42 citations
- Efficient Continual Pre-training for Building Domain Specific Large Language ModelsFindings41 citations
- Less is More: Mitigating Multimodal Hallucination from an EOS Decision PerspectiveLong41 citations
- LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language ModelsLong41 citations
- Long-Context Language Modeling with Parallel Context EncodingLong41 citations
- M4GT-Bench: Evaluation Benchmark for Black-Box Machine-Generated Text DetectionLong41 citations
- CriticBench: Benchmarking LLMs for Critique-Correct ReasoningFindings40 citations
- M3CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-ThoughtLong40 citations
- TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful SpaceLong40 citations
- ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human PreferencesLong39 citations
- OceanGPT: A Large Language Model for Ocean Science TasksLong39 citations
- PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System SafetyLong39 citations
- RA-ISF: Learning to Answer and Understand from Retrieval Augmentation via Iterative Self-FeedbackFindings39 citations
- TRAM: Benchmarking Temporal Reasoning for Large Language ModelsFindings39 citations
- The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model PerformanceFindings39 citations
- Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference OptimizationFindings38 citations
- Can LLMs Learn from Previous Mistakes? Investigating LLMs’ Errors to Boost for ReasoningLong37 citations
- Cross-Lingual Knowledge Editing in Large Language ModelsLong37 citations
- NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity ClassesLong37 citations
- RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text DetectorsLong37 citations
- Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-TuningFindings37 citations
- Think Twice: Perspective-Taking Improves Large Language Models’ Theory-of-Mind CapabilitiesLong37 citations
- BioT5+: Towards Generalized Biological Understanding with IUPAC Integration and Multi-task TuningFindings36 citations
- CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI AutomationFindings36 citations
- Defending LLMs against Jailbreaking Attacks via BacktranslationFindings36 citations
- Experiential Co-Learning of Software-Developing AgentsLong36 citations
- Harnessing the Power of Large Language Models for Natural Language to First-Order Logic TranslationLong36 citations
- Pride and Prejudice: LLM Amplifies Self-Bias in Self-RefinementLong36 citations
- StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language ModelsFindings36 citations
- StudentEval: A Benchmark of Student-Written Prompts for Large Language Models of CodeFindings36 citations
- Unintended Impacts of LLM Alignment on Global RepresentationLong36 citations
- When is Tree Search Useful for LLM Planning? It Depends on the DiscriminatorLong36 citations
- ArabicMMLU: Assessing Massive Multitask Language Understanding in ArabicFindings35 citations
- LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation ScoresFindings35 citations
- LMDX: Language Model-based Document Information Extraction and LocalizationFindings35 citations
- PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-RailsLong35 citations
- Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-EvaluationLong35 citations
- Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with DataFindings34 citations
- DELL: Generating Reactions and Explanations for LLM-Based Misinformation DetectionFindings34 citations
- Disinformation Capabilities of Large Language ModelsLong34 citations
- Enhancing Large Language Models in Coding Through Multi-Perspective Self-ConsistencyLong34 citations
- L-Eval: Instituting Standardized Evaluation for Long Context Language ModelsLong34 citations
- Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction TuningFindings34 citations
- Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse PromptsLong33 citations
- Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart CaptioningFindings33 citations
- InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference AlignmentFindings33 citations
- InstructProtein: Aligning Human and Protein Language via Knowledge InstructionLong33 citations
- Knowledge-Infused Prompting: Assessing and Advancing Clinical Text Data Generation with Large Language ModelsFindings33 citations
- Learning to Decode Collaboratively with Multiple Language ModelsLong33 citations
- LoraRetriever: Input-Aware LoRA Retrieval and Composition for Mixed Tasks in the WildFindings33 citations
- OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language ModelsLong33 citations
- Revisiting Demonstration Selection Strategies in In-Context LearningLong33 citations
- Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement SimulationFindings33 citations
- Agent Lumos: Unified and Modular Training for Open-Source Language AgentsLong32 citations
- CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code CompletionFindings32 citations
- Faithful Persona-based Conversational Dataset Generation with Large Language ModelsFindings32 citations
- Knowledgeable Preference Alignment for LLMs in Domain-specific Question AnsweringFindings32 citations
- MM-SOC: Benchmarking Multimodal Large Language Models in Social Media PlatformsFindings32 citations
- Self-Distillation Bridges Distribution Gap in Language Model Fine-TuningLong32 citations
- AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding AgentsLong31 citations
- Before Generation, Align it! A Novel and Effective Strategy for Mitigating Hallucinations in Text-to-SQL GenerationFindings31 citations
- ChartInstruct: Instruction Tuning for Chart Comprehension and ReasoningFindings31 citations
- FinTral: A Family of GPT-4 Level Multimodal Financial Large Language ModelsFindings31 citations
- Knowledge-to-SQL: Enhancing SQL Generation with Data Expert LLMFindings31 citations
- MARIO: MAth Reasoning with code Interpreter Output - A Reproducible PipelineFindings31 citations
- Multilingual Instruction Tuning With Just a Pinch of MultilingualityFindings31 citations
- SOTOPIA-π: Interactive Learning of Socially Intelligent Language AgentsLong31 citations
- Bridging the Preference Gap between Retrievers and LLMsLong30 citations
- EmoBench: Evaluating the Emotional Intelligence of Large Language ModelsLong30 citations
- Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question AnsweringLong30 citations
- IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens IntactFindings30 citations
- MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language NavigationLong30 citations
- MatPlotAgent: Method and Evaluation for LLM-Based Agentic Scientific Data VisualizationFindings30 citations
- Measuring Political Bias in Large Language Models: What Is Said and How It Is SaidLong30 citations
- Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language ModelsLong30 citations
- RetrievalQA: Assessing Adaptive Retrieval-Augmented Generation for Short-form Open-Domain Question AnsweringFindings30 citations
- UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained GenerationLong30 citations
- FineSurE: Fine-grained Summarization Evaluation using LLMsLong29 citations
- LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term PromptingFindings29 citations
- Learning or Self-aligning? Rethinking Instruction Fine-tuningLong29 citations
- Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized RehearsalLong29 citations
- Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained EvaluationFindings29 citations
- RepCodec: A Speech Representation Codec for Speech TokenizationLong29 citations
- Aligning Large Language Models with Human Preferences through Representation EngineeringLong28 citations
- Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language ModelsFindings28 citations
- DataDreamer: A Tool for Synthetic Data Generation and Reproducible LLM WorkflowsLong28 citations
- KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language ModelsLong28 citations
- Multimodal Table UnderstandingLong28 citations
- On Context Utilization in Summarization with Large Language ModelsLong28 citations
- PUB: A Pragmatics Understanding Benchmark for Assessing LLMs’ Pragmatics CapabilitiesFindings28 citations
- Quantifying Contamination in Evaluating Code Generation Capabilities of Language ModelsLong28 citations
- Small Language Models Need Strong Verifiers to Self-Correct ReasoningFindings28 citations
- CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and GenerationLong27 citations
- DIALECTBENCH: An NLP Benchmark for Dialects, Varieties, and Closely-Related LanguagesLong27 citations
- Do Large Language Models Discriminate in Hiring Decisions on the Basis of Race, Ethnicity, and Gender?Short27 citations
- EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language ModelsSystem Demonstrations27 citations
- Enhancing Noise Robustness of Retrieval-Augmented Language Models with Adaptive Adversarial TrainingLong27 citations
- MAPO: Advancing Multilingual Reasoning through Multilingual-Alignment-as-Preference OptimizationLong27 citations
- Synthesizing Text-to-SQL Data from Weak and Strong LLMsLong27 citations
- TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language ModelsLong27 citations
- A Comprehensive Evaluation of Quantization Strategies for Large Language ModelsFindings26 citations
- ARIES: A Corpus of Scientific Paper Edits Made in Response to Peer ReviewsLong26 citations
- Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken ConversationsLong26 citations
- Are self-explanations from Large Language Models faithful?Findings26 citations
- Bootstrapping LLM-based Task-Oriented Dialogue Agents via Self-TalkFindings26 citations
- Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMsLong26 citations
- Exploring Memorization in Fine-tuned Language ModelsLong26 citations
- Exploring the Potential of Large Language Models in Computational ArgumentationLong26 citations
- Interactive-KBQA: Multi-Turn Interactions for Knowledge Base Question Answering with Large Language ModelsLong26 citations
- LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent EnvironmentsLong26 citations
- Landmark Embedding: A Chunking-Free Embedding Method For Retrieval Augmented Long-Context Large Language ModelsLong26 citations
- On the Multi-turn Instruction Following for Conversational Web AgentsLong26 citations
- One-Shot Learning as Instruction Data Prospector for Large Language ModelsLong26 citations
- Proving membership in LLM pretraining data via data watermarksFindings26 citations
- WilKE: Wise-Layer Knowledge Editor for Lifelong Knowledge EditingFindings26 citations
- Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark for Large Language ModelsLong25 citations
- ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase PartitionLong25 citations
- Citation-Enhanced Generation for LLM-based ChatbotsLong25 citations
- CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model GenerationLong25 citations
- Do Androids Know They’re Only Dreaming of Electric Sheep?Findings25 citations
- Evaluating LLMs’ Mathematical Reasoning in Financial Document Question AnsweringFindings25 citations
- FOFO: A Benchmark to Evaluate LLMs’ Format-Following CapabilityLong25 citations
- Investigating Subtler Biases in LLMs: Ageism, Beauty, Institutional, and Nationality Bias in Generative ModelsFindings25 citations
- Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile AgentsLong25 citations
- Navigating the OverKill in Large Language ModelsLong25 citations
- Retrieval-Augmented Multilingual Knowledge EditingLong25 citations
- Tell Me More! Towards Implicit User Intention Understanding of Language Model Driven AgentsLong25 citations
- An Entropy-based Text Watermarking Detection MethodLong24 citations
- BadAgent: Inserting and Activating Backdoor Attacks in LLM AgentsLong24 citations
- DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to DeterminacyLong24 citations
- Efficient Detection of LLM-generated Texts with a Bayesian Surrogate ModelFindings24 citations
- Extending Context Window of Large Language Models via Semantic CompressionFindings24 citations
- Identifying Semantic Induction Heads to Understand In-Context LearningFindings24 citations
- LM-Cocktail: Resilient Tuning of Language Models via Model MergingFindings24 citations
- Llama2Vec: Unsupervised Adaptation of Large Language Models for Dense RetrievalLong24 citations
- Navigating the Metrics Maze: Reconciling Score Magnitudes and AccuraciesLong24 citations
- RAVEL: Evaluating Interpretability Methods on Disentangling Language Model RepresentationsLong24 citations
- ROSE Doesn’t Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive DecodingFindings24 citations
- Text-like Encoding of Collaborative Information in Large Language Models for RecommendationLong24 citations
- WaterBench: Towards Holistic Evaluation of Watermarks for Large Language ModelsLong24 citations
- What Evidence Do Language Models Find Convincing?Long24 citations
- When Do LLMs Need Retrieval Augmentation? Mitigating LLMs’ Overconfidence Helps Retrieval AugmentationFindings24 citations
- Are LLM-based Evaluators Confusing NLG Quality Criteria?Long23 citations
- Better Synthetic Data by Retrieving and Transforming Existing DatasetsFindings23 citations
- BitDistiller: Unleashing the Potential of Sub-4-Bit LLMs via Self-DistillationLong23 citations
- Competition-Level Problems are Effective LLM EvaluatorsFindings23 citations
- E2-LLM: Efficient and Extreme Length Extension of Large Language ModelsFindings23 citations
- Forward-Backward Reasoning in Large Language Models for Mathematical VerificationFindings23 citations
- LLMs Beyond English: Scaling the Multilingual Capability of LLMs with Cross-Lingual FeedbackFindings23 citations
- Layer-Condensed KV Cache for Efficient Inference of Large Language ModelsLong23 citations
- MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-TuningLong23 citations
- MolTC: Towards Molecular Relational Modeling In Language ModelsFindings23 citations
- Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex ScenariosFindings23 citations
- Prototypical Reward Network for Data-Efficient RLHFLong23 citations
- Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMsLong23 citations
- The Unreasonable Effectiveness of Easy Training Data for Hard TasksLong23 citations
- Towards Real-World Writing Assistance: A Chinese Character Checking Benchmark with Faked and Misspelled CharactersLong23 citations
- WaveCoder: Widespread And Versatile Enhancement For Code Large Language Models By Instruction TuningLong23 citations
- AutoRE: Document-Level Relation Extraction with Large Language ModelsSystem Demonstrations22 citations
- Confabulation: The Surprising Value of Large Language Model HallucinationsLong22 citations
- Finding and Editing Multi-Modal Neurons in Pre-Trained TransformersFindings22 citations
- Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language ModelsLong22 citations
- From Role-Play to Drama-Interaction: An LLM SolutionFindings22 citations
- Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and BeyondLong22 citations
- Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing ConstraintFindings22 citations
- LLMs in the Imaginarium: Tool Learning through Simulated Trial and ErrorLong22 citations
- M4LE: A Multi-Ability Multi-Range Multi-Task Multi-Domain Long-Context Evaluation Benchmark for Large Language ModelsLong22 citations
- OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language IdentificationLong22 citations
- On the Vulnerability of Safety Alignment in Open-Access LLMsFindings22 citations
- PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal RetrieversLong22 citations
- Stumbling Blocks: Stress Testing the Robustness of Machine-Generated Text Detectors Under AttacksLong22 citations
- Understanding and Patching Compositional Reasoning in LLMsFindings22 citations
- ANALOGYKB: Unlocking Analogical Reasoning of Language Models with A Million-scale Knowledge BaseLong21 citations
- Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?Long21 citations
- CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense ReasoningLong21 citations
- Codec-SUPERB: An In-Depth Analysis of Sound Codec ModelsFindings21 citations
- Evaluating Large Language Model Biases in Persona-Steered GenerationFindings21 citations
- Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQFindings21 citations
- Latxa: An Open Language Model and Evaluation Suite for BasqueLong21 citations
- MetaPro 2.0: Computational Metaphor Processing on the Effectiveness of Anomalous Language ModelingFindings21 citations
- PokeMQA: Programmable knowledge editing for Multi-hop Question AnsweringLong21 citations
- RAM-EHR: Retrieval Augmentation Meets Clinical Predictions on Electronic Health RecordsShort21 citations
- SAPT: A Shared Attention Framework for Parameter-Efficient Continual Learning of Large Language ModelsLong21 citations
- The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models CollapseFindings21 citations
- ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three StagesLong21 citations
- UniCoder: Scaling Code Large Language Model via Universal CodeLong21 citations
- Unveiling Linguistic Regions in Large Language ModelsLong21 citations
- VISTA: Visualized Text Embedding For Universal Multi-Modal RetrievalLong21 citations
- AdaLomo: Low-memory Optimization with Adaptive Learning RateFindings20 citations
- Automatic Engineering of Long PromptsFindings20 citations
- COKE: A Cognitive Knowledge Graph for Machine Theory of MindLong20 citations
- Calibrating Large Language Models Using Their Generations OnlyLong20 citations
- ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language ModelsLong20 citations
- DB-LLM: Accurate Dual-Binarization for Efficient LLMsFindings20 citations
- Don’t Go To Extremes: Revealing the Excessive Sensitivity and Calibration Limitations of LLMs in Implicit Hate Speech DetectionLong20 citations
- ERA-CoT: Improving Chain-of-Thought through Entity Relationship AnalysisLong20 citations
- GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-SolvingFindings20 citations
- Integrating Pre-Trained Speech and Language Models for End-to-End Speech RecognitionFindings20 citations
- M-RAG: Reinforcing Large Language Model Performance through Retrieval-Augmented Generation with Multiple PartitionsLong20 citations
- Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQALong20 citations
- Prompting open-source and commercial language models for grammatical error correction of English learner textFindings20 citations
- Smaller Language Models are capable of selecting Instruction-Tuning Training Data for Larger Language ModelsFindings20 citations
- T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by StepLong20 citations
- TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language ModelsFindings20 citations
- Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language ModelsFindings20 citations
- Towards Verifiable Generation: A Benchmark for Knowledge-aware Language Model AttributionFindings20 citations
- UOR: Universal Backdoor Attacks on Pre-trained Language ModelsFindings20 citations
- Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented GenerationLong20 citations
- Why are Sensitive Functions Hard for Transformers?Long20 citations
- A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way ParallelismFindings19 citations
- API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMsLong19 citations
- Beyond Single-Event Extraction: Towards Efficient Document-Level Multi-Event Argument ExtractionFindings19 citations
- CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language ModelsLong19 citations
- CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological CounselingFindings19 citations
- Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support ConversationLong19 citations
- Decomposition for Enhancing Attention: Improving LLM-based Text-to-SQL through Workflow ParadigmFindings19 citations
- DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code RepositoriesFindings19 citations
- EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language ModelsLong19 citations
- Generalization-Enhanced Code Vulnerability Detection via Multi-Task Instruction Fine-TuningFindings19 citations
- Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler FeedbackFindings19 citations
- Knowledge Graph-Enhanced Large Language Models via Path SelectionFindings19 citations
- Large Language Models as Zero-shot Dialogue State Tracker through Function CallingLong19 citations
- Learning to Edit: Aligning LLMs with Knowledge EditingLong19 citations
- MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in PerceptionLong19 citations
- Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language ModelsLong19 citations
- Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion RecognitionLong19 citations
- On Measuring Faithfulness or Self-consistency of Natural Language ExplanationsLong19 citations
- ProxyQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language ModelsLong19 citations
- Question Translation Training for Better Multilingual ReasoningFindings19 citations
- Reducing Privacy Risks in Online Self-Disclosures with Language ModelsLong19 citations
- Revisiting Knowledge Distillation for Autoregressive Language ModelsLong19 citations
- Unveiling Selection Biases: Exploring Order and Token Sensitivity in Large Language ModelsFindings19 citations
- ViSAGe: A Global-Scale Analysis of Visual Stereotypes in Text-to-Image GenerationLong19 citations
- A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning TaskFindings18 citations
- BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting EvidenceFindings18 citations
- Call Me When Necessary: LLMs can Efficiently and Faithfully Reason over Structured EnvironmentsFindings18 citations
- DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized DocumentsLong18 citations
- Empowering cross-lingual abilities of instruction-tuned large language models by translation-following demonstrationsFindings18 citations
- Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool UseLong18 citations
- Found in the middle: Calibrating Positional Attention Bias Improves Long Context UtilizationFindings18 citations
- Instruction Position Matters in Sequence Generation with Large Language ModelsFindings18 citations
- Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language ModelsLong18 citations
- Multimodal Instruction Tuning with Conditional Mixture of LoRALong18 citations
- OpenWebAgent: An Open Toolkit to Enable Web Agents on Large Language ModelsSystem Demonstrations18 citations
- Parrot: Enhancing Multi-Turn Instruction Following for Large Language ModelsLong18 citations
- Planning Like Human: A Dual-process Framework for Dialogue PlanningLong18 citations
- Towards Faithful and Robust LLM Specialists for Evidence-Based Question-AnsweringLong18 citations
- Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI FeedbackLong18 citations
- A Survey on Predicting the Factuality and the Bias of News MediaFindings17 citations
- An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language ModelsFindings17 citations
- Attribute First, then Generate: Locally-attributable Grounded Text GenerationLong17 citations
- Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context LearningFindings17 citations
- Can Language Models Serve as Text-Based World Simulators?Short17 citations
- CausalGym: Benchmarking causal interpretability methods on linguistic tasksLong17 citations
- Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt DistillationLong17 citations
- DocFinQA: A Long-Context Financial Reasoning DatasetShort17 citations
- Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!Long17 citations
- Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and CorrectionFindings17 citations
- GenTranslate: Large Language Models are Generative Multilingual Speech and Machine TranslatorsLong17 citations
- Generalizing Conversational Dense Retrieval via LLM-Cognition Data AugmentationLong17 citations
- History-Aware Conversational Dense RetrievalFindings17 citations
- Instruction-tuned Language Models are Better Knowledge LearnersLong17 citations
- LLMFactor: Extracting Profitable Factors through Prompts for Explainable Stock Movement PredictionFindings17 citations
- Model Editing by Standard Fine-TuningFindings17 citations
- Moûsai: Efficient Text-to-Music Diffusion ModelsLong17 citations
- PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language ModelsLong17 citations
- ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-TrainingLong17 citations
- RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated AdapterFindings17 citations
- ResLoRA: Identity Residual Mapping in Low-Rank AdaptionFindings17 citations
- StepCoder: Improving Code Generation with Reinforcement Learning from Compiler FeedbackLong17 citations
- TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human FeedbackFindings17 citations
- TextBind: Multi-turn Interleaved Multimodal Instruction-following in the WildFindings17 citations
- Time is Encoded in the Weights of Finetuned Language ModelsLong17 citations
- To Generate or to Retrieve? On the Effectiveness of Artificial Contexts for Medical Open-Domain Question AnsweringLong17 citations
- Towards the TopMost: A Topic Modeling System ToolkitSystem Demonstrations17 citations
- Training Language Models to Generate Text with Citations via Fine-grained RewardsLong17 citations
- Two-stage Generative Question Answering on Temporal Knowledge Graph Using Large Language ModelsFindings17 citations
- Word Embeddings Are Steers for Language ModelsLong17 citations
- Wordflow: Social Prompt Engineering for Large Language ModelsSystem Demonstrations17 citations
- AFaCTA: Assisting the Annotation of Factual Claim Detection with Reliable LLM AnnotatorsLong16 citations
- Advancing Parameter Efficiency in Fine-tuning via Representation EditingLong16 citations
- Analyzing Temporal Complex Events with Large Language Models? A Benchmark towards Temporal, Long Context UnderstandingLong16 citations
- AoE: Angle-optimized Embeddings for Semantic Textual SimilarityLong16 citations
- CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs’ Mathematical Reasoning CapabilitiesFindings16 citations
- CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction FollowingLong16 citations
- CoLLaVO: Crayon Large Language and Vision mOdelFindings16 citations
- CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual ExamplesFindings16 citations
- GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient AnalysisLong16 citations
- Grounding Language Model with Chunking-Free In-Context RetrievalLong16 citations
- INTERS: Unlocking the Power of Large Language Models in Search with Instruction TuningLong16 citations
- IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic LanguagesLong16 citations
- Interpretable User Satisfaction Estimation for Conversational Systems with Large Language ModelsLong16 citations
- KorNAT: LLM Alignment Benchmark for Korean Social Values and Common KnowledgeFindings16 citations
- LANS: A Layout-Aware Neural Solver for Plane Geometry ProblemFindings16 citations
- LLMs as Bridges: Reformulating Grounded Multimodal Named Entity RecognitionFindings16 citations
- LangBridge: Multilingual Reasoning Without Multilingual SupervisionLong16 citations
- Learn or Recall? Revisiting Incremental Learning with Pre-trained Language ModelsLong16 citations
- MinPrompt: Graph-based Minimal Prompt Data Augmentation for Few-shot Question AnsweringLong16 citations
- MuggleMath: Assessing the Impact of Query and Response Augmentation on Math ReasoningLong16 citations
- Never Lost in the Middle: Mastering Long-Context Question Answering with Position-Agnostic Decompositional TrainingLong16 citations
- PPTC Benchmark: Evaluating Large Language Models for PowerPoint Task CompletionFindings16 citations
- Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical NotesFindings16 citations
- RDRec: Rationale Distillation for LLM-based RecommendationShort16 citations
- Temporal Knowledge Question Answering via Abstract Reasoning InductionLong16 citations
- Unlocking the Power of Large Language Models for Entity AlignmentLong16 citations
- Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model PerformanceFindings16 citations
- k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated TextFindings16 citations
- AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data FiltersLong15 citations
- Angry Men, Sad Women: Large Language Models Reflect Gendered Stereotypes in Emotion AttributionLong15 citations
- BatchEval: Towards Human-like Text EvaluationLong15 citations
- Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial StatementsFindings15 citations
- Competition of Mechanisms: Tracing How Language Models Handle Facts and CounterfactualsLong15 citations
- DUAL-REFLECT: Enhancing Large Language Models for Reflective Translation through Dual Learning Feedback MechanismsShort15 citations
- Deciphering Digital Detectives: Understanding LLM Behaviors and Capabilities in Multi-Agent Mystery GamesFindings15 citations
- DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank DistributionLong15 citations
- ECBD: Evidence-Centered Benchmark Design for NLPLong15 citations
- Exploring Precision and Recall to assess the quality and diversity of LLMsLong15 citations
- Investigating Multi-Hop Factual Shortcuts in Knowledge Editing of Large Language ModelsLong15 citations
- Is Table Retrieval a Solved Problem? Exploring Join-Aware Multi-Table RetrievalLong15 citations
- Learning to Generate Instruction Tuning Datasets for Zero-Shot Task AdaptationFindings15 citations
- ListT5: Listwise Reranking with Fusion-in-Decoder Improves Zero-shot RetrievalLong15 citations
- LoRA-Flow: Dynamic LoRA Fusion for Large Language Models in Generative TasksLong15 citations
- MPCoder: Multi-user Personalized Code Generator with Explicit and Implicit Style Representation LearningLong15 citations
- MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language ModelingLong15 citations
- Making Harmful Behaviors Unlearnable for Large Language ModelsFindings15 citations
- Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language ModelsLong15 citations
- Measuring Bargaining Abilities of LLMs: A Benchmark and A Buyer-Enhancement MethodFindings15 citations
- Meta-Task Prompting Elicits Embeddings from Large Language ModelsLong15 citations
- Narrowing the Knowledge Evaluation Gap: Open-Domain Question Answering with Multi-Granularity AnswersLong15 citations
- Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 BenchmarkLong15 citations
- Probing the Emergence of Cross-lingual Alignment during LLM TrainingFindings15 citations
- ProtT3: Protein-to-Text Generation for Text-based Protein UnderstandingLong15 citations
- Set the Clock: Temporal Alignment of Pretrained Language ModelsFindings15 citations
- SocialBench: Sociality Evaluation of Role-Playing Conversational AgentsFindings15 citations
- TELLER: A Trustworthy Framework for Explainable, Generalizable and Controllable Fake News DetectionFindings15 citations
- The Counterfeit Conundrum: Can Code Language Models Grasp the Nuances of Their Incorrect Generations?Findings15 citations
- Towards Privacy-Aware Sign Language Translation at ScaleLong15 citations
- Whose Emotions and Moral Sentiments do Language Models Reflect?Findings15 citations
- AFLoRA: Adaptive Freezing of Low Rank Adaptation in Parameter Efficient Fine-Tuning of Large ModelsShort14 citations
- Anchor-based Large Language ModelsFindings14 citations
- Benchmarking Data Science AgentsLong14 citations
- DMoERM: Recipes of Mixture-of-Experts for Effective Reward ModelingFindings14 citations
- Dataflow-Guided Retrieval Augmentation for Repository-Level Code CompletionLong14 citations
- Empowering Large Language Models for Textual Data AugmentationFindings14 citations
- FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal ModelLong14 citations
- HealMe: Harnessing Cognitive Reframing in Large Language Models for PsychotherapyLong14 citations
- ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value ExtractionFindings14 citations
- Jailbreak Open-Sourced Large Language Models via Enforced DecodingLong14 citations
- Learning Fine-Grained Grounded Citations for Attributed Large Language ModelsFindings14 citations
- Living in the Moment: Can Large Language Models Grasp Co-Temporal Reasoning?Long14 citations
- Multimodal Reasoning with Multimodal Knowledge GraphLong14 citations
- PACE: Improving Prompt with Actor-Critic Editing for Large Language ModelFindings14 citations
- PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action ChainFindings14 citations
- Propagation and Pitfalls: Reasoning-based Assessment of Knowledge Editing through Counterfactual TasksFindings14 citations
- Rewriting the Code: A Simple Method for Large Language Model Augmented Code SearchLong14 citations
- SciMMIR: Benchmarking Scientific Multi-modal Information RetrievalFindings14 citations
- StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task LearningLong14 citations
- TextEE: Benchmark, Reevaluation, Reflections, and Future Challenges in Event ExtractionFindings14 citations
- The Knowledge Alignment Problem: Bridging Human and External Knowledge for Large Language ModelsFindings14 citations
- ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language ModelsLong14 citations
- What Does the Bot Say? Opportunities and Risks of Large Language Models in Social Media Bot DetectionLong14 citations
- A Chain-of-Thought Is as Strong as Its Weakest Link: A Benchmark for Verifiers of Reasoning ChainsLong13 citations
- Analysing The Impact of Sequence Composition on Language Model Pre-TrainingLong13 citations
- Are Decoder-Only Language Models Better than Encoder-Only Language Models in Understanding Word Meaning?Findings13 citations
- Ask Again, Then Fail: Large Language Models’ Vacillations in JudgmentLong13 citations
- Automated Focused Feedback Generation for Scientific Writing AssistanceFindings13 citations
- BizBench: A Quantitative Reasoning Benchmark for Business and FinanceLong13 citations
- Cache & Distil: Optimising API Calls to Large Language ModelsFindings13 citations
- Chain of Logic: Rule-Based Reasoning with Large Language ModelsFindings13 citations
- ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language ModelsFindings13 citations
- Deciphering Oracle Bone Language with Diffusion ModelsLong13 citations
- Deductive Closure Training of Language Models for Coherence, Accuracy, and UpdatabilityFindings13 citations
- Dialogue Summarization with Mixture of Experts based on Large Language ModelsLong13 citations
- EX-FEVER: A Dataset for Multi-hop Explainable Fact VerificationFindings13 citations
- Effects of diversity incentives on sample diversity and downstream model performance in LLM-based text augmentationLong13 citations
- FinanceMATH: Knowledge-Intensive Math Reasoning in Finance DomainsLong13 citations
- Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report GenerationLong13 citations
- HQP: A Human-Annotated Dataset for Detecting Online PropagandaFindings13 citations
- How Vocabulary Sharing Facilitates Multilingualism in LLaMA?Findings13 citations
- IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code GeneratorsLong13 citations
- LLM Performance Predictors are good initializers for Architecture SearchFindings13 citations
- LLaST: Improved End-to-end Speech Translation System Leveraged by Large Language ModelsFindings13 citations
- Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task ArithmeticLong13 citations
- Large Language Models for Automated Open-domain Scientific Hypotheses DiscoveryFindings13 citations
- Learning to Plan and Generate Text with CitationsLong13 citations
- Leveraging Large Language Models for Learning Complex Legal Concepts through StorytellingLong13 citations
- MARS: Meaning-Aware Response Scoring for Uncertainty Estimation in Generative LLMsLong13 citations
- MAVEN-ARG: Completing the Puzzle of All-in-One Event Understanding Dataset with Event Argument AnnotationLong13 citations
- Modality-Aware Integration with Large Language Models for Knowledge-Based Visual Question AnsweringLong13 citations
- Modeling Dynamic Topics in Chain-Free Fashion by Evolution-Tracking Contrastive Learning and Unassociated Word ExclusionFindings13 citations
- NACL: A General and Effective KV Cache Eviction Framework for LLM at Inference TimeLong13 citations
- PLUG: Leveraging Pivot Language in Cross-Lingual Instruction TuningLong13 citations
- Parallel Structures in Pre-training Data Yield In-Context LearningLong13 citations
- Plum: Prompt Learning using MetaheuristicsFindings13 citations
- Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language ModelsLong13 citations
- RePair: Automated Program Repair with Process-based FeedbackFindings13 citations
- Rethinking Negative Instances for Generative Named Entity RecognitionFindings13 citations
- SirLLM: Streaming Infinite Retentive LLMLong13 citations
- Soft Self-Consistency Improves Language Models AgentsShort13 citations
- Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language ModelsFindings13 citations
- TURNA: A Turkish Encoder-Decoder Language Model for Enhanced Understanding and GenerationFindings13 citations
- Teaching Large Language Models an Unseen Language on the FlyFindings13 citations
- TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware SimulationLong13 citations
- ULTRA: Unleash LLMs’ Potential for Event Argument Extraction through Hierarchical Modeling and Pair-wise Self-RefinementFindings13 citations
- UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMsSystem Demonstrations13 citations
- Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data SelectionFindings13 citations
- A Chinese Dataset for Evaluating the Safeguards in Large Language ModelsFindings12 citations
- Aligning Large Language Models for Controllable RecommendationsLong12 citations
- An Information Bottleneck Perspective for Effective Noise Filtering on Retrieval-Augmented GenerationLong12 citations
- Bypassing LLM Watermarks with Color-Aware SubstitutionsLong12 citations
- CIDAR: Culturally Relevant Instruction Dataset For ArabicFindings12 citations
- Contrastive Instruction TuningFindings12 citations
- Detoxifying Large Language Models via Knowledge EditingLong12 citations
- Dissecting Human and LLM PreferencesLong12 citations
- EmpathyEar: An Open-source Avatar Multimodal Empathetic ChatbotSystem Demonstrations12 citations
- Generalized Category Discovery with Large Language Models in the LoopFindings12 citations
- Greed is All You Need: An Evaluation of Tokenizer Inference MethodsShort12 citations
- HOLMES: Hyper-Relational Knowledge Graphs for Multi-hop Question Answering using LLMsLong12 citations
- Here’s a Free Lunch: Sanitizing Backdoored Models with Model MergeFindings12 citations
- Investigating the Impact of Data Contamination of Large Language Models in Text-to-SQL translationFindings12 citations
- LLMs Learn Task Heuristics from Demonstrations: A Heuristic-Driven Prompting Strategy for Document-Level Event Argument ExtractionLong12 citations
- Length Generalization of Causal Transformers without Position EncodingFindings12 citations
- LinkTransformer: A Unified Package for Record Linkage with Transformer Language ModelsSystem Demonstrations12 citations
- LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style PluginLong12 citations
- MERA: A Comprehensive LLM Evaluation in RussianLong12 citations
- PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual PatternsFindings12 citations
- Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMsLong12 citations
- Rethinking Task-Oriented Dialogue Systems: From Complex Modularity to Zero-Shot Autonomous AgentLong12 citations
- Self-chats from Large Language Models Make Small Emotional Support Chatbot BetterLong12 citations
- Spectral Filters, Dark Signals, and Attention SinksLong12 citations
- Spiral of Silence: How is Large Language Model Killing Information Retrieval?—A Case Study on Open Domain Question AnsweringLong12 citations
- Stealthy Attack on Large Language Model based RecommendationLong12 citations
- StyleDubber: Towards Multi-Scale Style Learning for Movie DubbingFindings12 citations
- TaPERA: Enhancing Faithfulness and Interpretability in Long-Form Table QA by Content Planning and Execution-based ReasoningLong12 citations
- TasTe: Teaching Large Language Models to Translate through Self-ReflectionLong12 citations
- Text Embedding Inversion Security for Multilingual Language ModelsLong12 citations
- The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language ModelsShort12 citations
- Understanding the Impacts of Language Technologies’ Performance Disparities on African American Language SpeakersFindings12 citations
- What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German DialectsShort12 citations
- ANAH: Analytical Annotation of Hallucinations in Large Language ModelsLong11 citations
- An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language ModelsFindings11 citations
- Analyzing Semantic Change through Lexical ReplacementsLong11 citations
- AttributionBench: How Hard is Automatic Attribution Evaluation?Findings11 citations
- Balancing Speciality and Versatility: a Coarse to Fine Framework for Supervised Fine-tuning Large Language ModelFindings11 citations
- Benchmarking Knowledge Boundary for Large Language Models: A Different Perspective on Model EvaluationLong11 citations
- CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language ModelsFindings11 citations
- Causal Estimation of Memorisation ProfilesLong11 citations
- Cendol: Open Instruction-tuned Generative Large Language Models for Indonesian LanguagesLong11 citations
- Context versus Prior Knowledge in Language ModelsLong11 citations
- Context-aware Difference Distilling for Multi-change CaptioningLong11 citations
- Detection-Correction Structure via General Language Model for Grammatical Error CorrectionLong11 citations
- Differentially Private Knowledge Distillation via Synthetic Text GenerationFindings11 citations
- Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language ModelsLong11 citations
- EWEK-QA : Enhanced Web and Efficient Knowledge Graph Retrieval for Citation-based Question Answering SystemsLong11 citations
- Event-Radar: Event-driven Multi-View Learning for Multimodal Fake News DetectionLong11 citations
- Examining the robustness of LLM evaluation to the distributional assumptions of benchmarksLong11 citations
- Factual Confidence of LLMs: on Reliability and Robustness of Current EstimatorsLong11 citations
- Fine-Tuned Machine Translation Metrics Struggle in Unseen DomainsShort11 citations
- FlowVQA: Mapping Multimodal Logic in Visual Question Answering with FlowchartsFindings11 citations
- HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria DecompositionLong11 citations
- IBSEN: Director-Actor Agent Collaboration for Controllable and Interactive Drama Script GenerationLong11 citations
- IMBUE: Improving Interpersonal Effectiveness through Simulation and Just-in-time Feedback with Human-Language Model InteractionLong11 citations
- Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language ModelsLong11 citations
- LoRA Meets Dropout under a Unified FrameworkFindings11 citations
- Looking Right is Sometimes Right: Investigating the Capabilities of Decoder-only LLMs for Sequence LabelingFindings11 citations
- Marathon: A Race Through the Realm of Long Context with Large Language ModelsLong11 citations
- Meta-Reasoning: Semantics-Symbol Deconstruction for Large Language ModelsFindings11 citations
- Mitigating Boundary Ambiguity and Inherent Bias for Text Classification in the Era of Large Language ModelsFindings11 citations
- Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language ModelsLong11 citations
- Peacock: A Family of Arabic Multimodal Large Language Models and BenchmarksLong11 citations
- PsychoGAT: A Novel Psychological Measurement Paradigm through Interactive Fiction Games with LLM AgentsLong11 citations
- ReLiK: Retrieve and LinK, Fast and Accurate Entity Linking and Relation Extraction on an Academic BudgetFindings11 citations
- Reasons to Reject? Aligning Language Models with JudgmentsFindings11 citations
- Self-Training with Direct Preference Optimization Improves Chain-of-Thought ReasoningLong11 citations
- Speculative Contrastive DecodingShort11 citations
- Speech Translation with Speech Foundation Models and Large Language Models: What is There and What is Missing?Long11 citations
- ToMBench: Benchmarking Theory of Mind in Large Language ModelsLong11 citations
- VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language ModelsFindings11 citations
- VillagerAgent: A Graph-Based Multi-Agent Framework for Coordinating Complex Task Dependencies in MinecraftFindings11 citations
- XCodeEval: An Execution-based Large Scale Multilingual Multitask Benchmark for Code Understanding, Generation, Translation and RetrievalLong11 citations
- A Glitch in the Matrix? Locating and Detecting Language Model Grounding with FakepediaLong10 citations
- A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Any TranslationLong10 citations
- A synthetic data approach for domain generalization of NLI modelsLong10 citations
- Aligning Large Language Models by On-Policy Self-JudgmentLong10 citations
- Analyze, Generate and Refine: Query Expansion with LLMs for Zero-Shot Open-Domain QAFindings10 citations
- Answer is All You Need: Instruction-following Text Embedding via Answering the QuestionLong10 citations
- Beyond Traditional Benchmarks: Analyzing Behaviors of Open LLMs on Data-to-Text GenerationLong10 citations
- Blinded by Generated Contexts: How Language Models Merge Generated and Retrieved Contexts When Knowledge Conflicts?Long10 citations
- Complex Reasoning over Logical Queries on Commonsense Knowledge GraphsLong10 citations
- Debatrix: Multi-dimensional Debate Judge with Iterative Chronological Analysis Based on LLMFindings10 citations
- Direct Evaluation of Chain-of-Thought in Multi-hop Reasoning with Knowledge GraphsFindings10 citations
- Duwak: Dual Watermarks in Large Language ModelsFindings10 citations
- Efficient OCR for Building a Diverse Digital HistoryLong10 citations
- Enhancing Dialogue State Tracking Models through LLM-backed User-Agents SimulationLong10 citations
- Evaluating Large Language Models on Wikipedia-Style Survey GenerationFindings10 citations
- Explore Spurious Correlations at the Concept Level in Language Models for Text ClassificationLong10 citations
- FactPICO: Factuality Evaluation for Plain Language Summarization of Medical EvidenceLong10 citations
- FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language ModelsShort10 citations
- FinTextQA: A Dataset for Long-form Financial Question AnsweringLong10 citations
- GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trickLong10 citations
- HOTVCOM: Generating Buzzworthy Comments for VideosFindings10 citations
- Improving Machine Translation with Large Language Models: A Preliminary Study with Cooperative DecodingFindings10 citations
- IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian LanguagesLong10 citations
- Inference to the Best Explanation in Large Language ModelsLong10 citations
- Iterative Forward Tuning Boosts In-Context Learning in Language ModelsLong10 citations
- Knowledge Fusion By Evolving Weights of Language ModelsFindings10 citations
- LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language TextsLong10 citations
- LPNL: Scalable Link Prediction with Large Language ModelsFindings10 citations
- Large Language Models Relearn Removed ConceptsFindings10 citations
- Learnable Privacy Neurons Localization in Language ModelsShort10 citations
- Making Long-Context Language Models Better Multi-Hop ReasonersLong10 citations
- Metaphor Understanding Challenge Dataset for LLMsLong10 citations
- Missci: Reconstructing Fallacies in Misrepresented ScienceLong10 citations
- MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot DetectorFindings10 citations
- Multi-Level Feedback Generation with Large Language Models for Empowering Novice Peer CounselorsLong10 citations
- OPEx: A Component-Wise Analysis of LLM-Centric Agents in Embodied Instruction FollowingLong10 citations
- On the Impact of Calibration Data in Post-training Quantization and PruningLong10 citations
- On the Representational Capacity of Neural Language Models with Chain-of-Thought ReasoningLong10 citations
- PRewrite: Prompt Rewriting with Reinforcement LearningShort10 citations
- Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation DatasetFindings10 citations
- Prompt Expansion for Adaptive Text-to-Image GenerationLong10 citations
- RECOST: External Knowledge Guided Data-efficient Instruction TuningFindings10 citations
- RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language ModelsLong10 citations
- RefuteBench: Evaluating Refuting Instruction-Following for Large Language ModelsFindings10 citations
- Revisiting Code Similarity Evaluation with Abstract Syntax Tree Edit DistanceShort10 citations
- STAR: Constraint LoRA with Dynamic Active Learning for Data-Efficient Fine-Tuning of Large Language ModelsFindings10 citations
- SemRel2024: A Collection of Semantic Textual Relatedness Datasets for 13 LanguagesFindings10 citations
- SenticVec: Toward Robust and Human-Centric Neurosymbolic Sentiment AnalysisFindings10 citations
- Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language ModelsLong10 citations
- Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMsFindings10 citations
- The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language ModelsFindings10 citations
- Truth-Aware Context Selection: Mitigating Hallucinations of Large Language Models Being Misled by Untruthful ContextsFindings10 citations
- UNIMO-G: Unified Image Generation through Multimodal Conditional DiffusionLong10 citations
- Unveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to RemediationFindings10 citations
- VariErr NLI: Separating Annotation Error from Human Label VariationLong10 citations
- When to Trust LLMs: Aligning Confidence with Response QualityFindings10 citations
- mCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and HumansFindings10 citations
- mCoT: Multilingual Instruction Tuning for Reasoning Consistency in Language ModelsLong10 citations
- ARL2: Aligning Retrievers with Black-box Large Language Models via Self-guided Adaptive Relevance LabelingLong9 citations
- Analyzing LLM Behavior in Dialogue Summarization: Unveiling Circumstantial Hallucination TrendsLong9 citations
- CAUSE: Counterfactual Assessment of User Satisfaction Estimation in Task-Oriented Dialogue SystemsFindings9 citations
- Chat Vector: A Simple Approach to Equip LLMs with Instruction Following and Model Alignment in New LanguagesLong9 citations
- Cheetah: Natural Language Generation for 517 African LanguagesLong9 citations
- Chunk, Align, Select: A Simple Long-sequence Processing Method for TransformersLong9 citations
- CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal ModelsLong9 citations
- Controlled Text Generation for Large Language Model with Dynamic Attribute GraphsFindings9 citations
- Countering Reward Over-Optimization in LLM with Demonstration-Guided Reinforcement LearningFindings9 citations
- CycleAlign: Iterative Distillation from Black-box LLM to White-box Models for Better Human AlignmentFindings9 citations
- Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?Findings9 citations
- Efficient Knowledge Infusion via KG-LLM AlignmentFindings9 citations
- EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language ModelsShort9 citations
- EmpathicStories++: A Multimodal Dataset for Empathy Towards Personal ExperiencesFindings9 citations
- Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich LanguagesLong9 citations
- Evaluating Large Language Models for Health-related Queries with PresuppositionsFindings9 citations
- Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language ModelsFindings9 citations
- G-DIG: Towards Gradient-based DIverse and hiGh-quality Instruction Data Selection for Machine TranslationLong9 citations
- GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem SolversLong9 citations
- Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct DecodingFindings9 citations
- Harder Task Needs More Experts: Dynamic Routing in MoE ModelsLong9 citations
- Improving Attributed Text Generation of Large Language Models via Preference LearningFindings9 citations
- Integrate the Essence and Eliminate the Dross: Fine-Grained Self-Consistency for Free-Form Language GenerationLong9 citations
- Interpreting Conversational Dense Retrieval by Rewriting-Enhanced Inversion of Session EmbeddingLong9 citations
- LEGENT: Open Platform for Embodied AgentsSystem Demonstrations9 citations
- LLM Factoscope: Uncovering LLMs’ Factual Discernment through Measuring Inner StatesFindings9 citations
- Large Language Models Fall Short: Understanding Complex Relationships in Detective NarrativesFindings9 citations
- Learning to Maximize Mutual Information for Chain-of-Thought DistillationFindings9 citations
- Linear-time Minimum Bayes Risk Decoding with Reference AggregationShort9 citations
- Mirror: Multiple-perspective Self-Reflection Method for Knowledge-rich ReasoningLong9 citations
- Monotonic Representation of Numeric Attributes in Language ModelsShort9 citations
- Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?Long9 citations
- ODA: Observation-Driven Agent for integrating LLMs and Knowledge GraphsFindings9 citations
- OOP: Object-Oriented Programming Evaluation Benchmark for Large Language ModelsFindings9 citations
- On the Role of Long-tail Knowledge in Retrieval Augmented Large Language ModelsShort9 citations
- Paying More Attention to Source Context: Mitigating Unfaithful Translations from Large Language ModelFindings9 citations
- Pushing the Limits of Zero-shot End-to-End Speech TranslationFindings9 citations
- REANO: Optimising Retrieval-Augmented Reader Models through Knowledge Graph GenerationLong9 citations
- Reasoning in Flux: Enhancing Large Language Models Reasoning through Uncertainty-aware Adaptive GuidanceLong9 citations
- Resonance RoPE: Improving Context Length Generalization of Large Language ModelsFindings9 citations
- Retrieval-Augmented Retrieval: Large Language Models are Strong Zero-Shot RetrieverFindings9 citations
- SoFA: Shielded On-the-fly Alignment via Priority Rule FollowingFindings9 citations
- Synergizing Large Language Models and Pre-Trained Smaller Models for Conversational Intent DiscoveryFindings9 citations
- The Echoes of Multilinguality: Tracing Cultural Value Shifts during Language Model Fine-tuningLong9 citations
- Towards Uncertainty-Aware Language AgentFindings9 citations
- TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head TranslationFindings9 citations
- Transparent and Scrutable Recommendations Using Natural Language User ProfilesLong9 citations
- ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language ModelsFindings9 citations
- What Do Language Models Learn in Context? The Structured Task Hypothesis.Long9 citations
- What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular LanguagesLong9 citations
- 3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document UnderstandingFindings8 citations
- AbsInstruct: Eliciting Abstraction Ability from LLMs through Explanation Tuning with Plausibility EstimationLong8 citations
- Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language ModelsFindings8 citations
- An Expert is Worth One Token: Synergizing Multiple Expert LLMs as Generalist via Expert Token RoutingLong8 citations
- An LLM-based Knowledge Synthesis and Scientific Reasoning Framework for Biomedical DiscoverySystem Demonstrations8 citations
- Ask LLMs Directly, “What shapes your bias?”: Measuring Social Bias in Large Language ModelsFindings8 citations
- Balanced Data Sampling for Language Model Training with ClusteringFindings8 citations
- Benchmarking Large Language Models on CFLUE - A Chinese Financial Language Understanding Evaluation DatasetFindings8 citations
- Book2Dial: Generating Teacher Student Interactions from Textbooks for Cost-Effective Development of Educational ChatbotsFindings8 citations
- CHIME: LLM-Assisted Hierarchical Organization of Scientific Studies for Literature Review SupportFindings8 citations
- CODIS: Benchmarking Context-dependent Visual Comprehension for Multimodal Large Language ModelsLong8 citations
- CToolEval: A Chinese Benchmark for LLM-Powered Agent Evaluation in Real-World API InteractionsFindings8 citations
- Can Large Language Model Summarizers Adapt to Diverse Scientific Communication Goals?Findings8 citations
- Chain-of-Exemplar: Enhancing Distractor Generation for Multimodal Educational Question GenerationLong8 citations
- Chinese MentalBERT: Domain-Adaptive Pre-training on Social Media for Chinese Mental Health Text AnalysisFindings8 citations
- Cocktail: A Comprehensive Information Retrieval Benchmark with LLM-Generated Documents IntegrationFindings8 citations
- Code Needs Comments: Enhancing Code LLMs with Comment AugmentationFindings8 citations
- Confidence is not Timeless: Modeling Temporal Validity for Rule-based Temporal Knowledge Graph ForecastingLong8 citations
- Data Contamination Calibration for Black-box LLMsFindings8 citations
- Demonstration Augmentation for Zero-shot In-context LearningFindings8 citations
- Diffusion Lens: Interpreting Text Encoders in Text-to-Image PipelinesLong8 citations
- Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax ReductionFindings8 citations
- Eliciting Better Multilingual Structured Reasoning from LLMs through CodeLong8 citations
- Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented ApproachFindings8 citations
- Expedited Training of Visual Conditioned Language Generation via Redundancy ReductionLong8 citations
- From Moments to Milestones: Incremental Timeline Summarization Leveraging Large Language ModelsLong8 citations
- Getting Serious about Humor: Crafting Humor Datasets with Unfunny Large Language ModelsShort8 citations
- Hire a Linguist!: Learning Endangered Languages in LLMs with In-Context Linguistic DescriptionsFindings8 citations
- HyperMoE: Towards Better Mixture of Experts via Transferring Among ExpertsLong8 citations
- Improving Large Language Models in Event Relation Logical PredictionLong8 citations
- IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian LanguagesFindings8 citations
- Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for DialogueLong8 citations
- InterrogateLLM: Zero-Resource Hallucination Detection in LLM-Generated AnswersLong8 citations
- ItD: Large Language Models Can Teach Themselves Induction through DeductionLong8 citations
- LLMCrit: Teaching Large Language Models to Use CriteriaFindings8 citations
- LM Transparency Tool: Interactive Tool for Analyzing Transformer Language ModelsSystem Demonstrations8 citations
- MAPLE: Multilingual Evaluation of Parameter Efficient Finetuning of Large Language ModelsFindings8 citations
- MLeVLM: Improve Multi-level Progressive Capabilities based on Multimodal Large Language Model for Medical Visual Question AnsweringFindings8 citations
- Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask LearnersLong8 citations
- MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-SpeechLong8 citations
- Multi-modal Stance Detection: New Datasets and ModelFindings8 citations
- Must NLP be Extractive?Long8 citations
- One Prompt To Rule Them All: LLMs for Opinion Summary EvaluationLong8 citations
- PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the CloudSystem Demonstrations8 citations
- Peering into the Mind of Language Models: An Approach for Attribution in Contextual Question AnsweringFindings8 citations
- Planning First, Question Second: An LLM-Guided Method for Controllable Question GenerationFindings8 citations
- ProgGen: Generating Named Entity Recognition Datasets Step-by-step with Self-Reflexive Large Language ModelsFindings8 citations
- QueryAgent: A Reliable and Efficient Reasoning Framework with Environmental Feedback based Self-CorrectionLong8 citations
- ReactXT: Understanding Molecular “Reaction-ship” via Reaction-Contextualized Molecule-Text PretrainingFindings8 citations
- SAC-KG: Exploiting Large Language Models as Skilled Automatic Constructors for Domain Knowledge GraphLong8 citations
- SEER: Facilitating Structured Reasoning and Explanation via Reinforcement LearningLong8 citations
- STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language ModelsFindings8 citations
- STICKERCONV: Generating Multimodal Empathetic Responses from ScratchLong8 citations
- Se2: Sequential Example Selection for In-Context LearningFindings8 citations
- SeeGULL Multilingual: a Dataset of Geo-Culturally Situated StereotypesShort8 citations
- SportsMetrics: Blending Text and Numerical Data to Understand Information Fusion in LLMsLong8 citations
- StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice ConversionLong8 citations
- Synchronized Video Storytelling: Generating Video Narrations with Structured StorylineLong8 citations
- TaSL: Continual Dialog State Tracking via Task Skill Localization and ConsolidationLong8 citations
- TaxoLLaMA: WordNet-based Model for Solving Multiple Lexical Semantic TasksLong8 citations
- The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language ModelsLong8 citations
- TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models’ Theory-of-MindFindings8 citations
- TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language ModelsLong8 citations
- Understanding the Effects of Noise in Text-to-SQL: An Examination of the BIRD-Bench BenchmarkShort8 citations
- Using Natural Language Explanations to Improve Robustness of In-context LearningLong8 citations
- Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data PerspectivesFindings8 citations
- What Do Language Models Hear? Probing for Auditory Representations in Language ModelsLong8 citations
- What is the Best Way for ChatGPT to Translate Poetry?Long8 citations
- When Good and Reproducible Results are a Giant with Feet of Clay: The Importance of Software Quality in NLPLong8 citations
- X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual InstructionsFindings8 citations
- Your Transformer is Secretly LinearLong8 citations
- string2string: A Modern Python Library for String-to-String AlgorithmsSystem Demonstrations8 citations
- A Semantic Distance Metric Learning approach for Lexical Semantic Change DetectionFindings7 citations
- A Two-Stage Adaptation of Large Language Models for Text RankingFindings7 citations
- An Iterative Associative Memory Model for Empathetic Response GenerationLong7 citations
- Are Machines Better at Complex Reasoning? Unveiling Human-Machine Inference Gaps in Entailment VerificationFindings7 citations
- Automated Justification Production for Claim Veracity in Fact Checking: A Survey on Architectures and ApproachesLong7 citations
- Both Matter: Enhancing the Emotional Intelligence of Large Language Models without Compromising the General IntelligenceFindings7 citations
- CLOMO: Counterfactual Logical Modification with Large Language ModelsLong7 citations
- Can Large Multimodal Models Uncover Deep Semantics Behind Images?Findings7 citations
- Can You Learn Semantics Through Next-Word Prediction? The Case of EntailmentFindings7 citations
- CeeBERT: Cross-Domain Inference in Early Exit BERTFindings7 citations
- Characterizing Large Language Models as Rationalizers of Knowledge-intensive TasksFindings7 citations
- Continual Learning with Semi-supervised Contrastive Distillation for Incremental Neural Machine TranslationLong7 citations
- Controllable Text Summarization: Unraveling Challenges, Approaches, and Prospects - A SurveyFindings7 citations
- DEBATE: Devil’s Advocate-Based Assessment and Text EvaluationFindings7 citations
- Deal, or no deal (or who knows)? Forecasting Uncertainty in Conversations using Large Language ModelsFindings7 citations
- Deciphering the Impact of Pretraining Data on Large Language Models through Machine UnlearningFindings7 citations
- Distillation Enhanced Generative RetrievalFindings7 citations
- Dodo: Dynamic Contextual Compression for Decoder-only LMsLong7 citations
- EconNLI: Evaluating Large Language Models on Economics ReasoningFindings7 citations
- Enhancing Text-to-SQL Parsing through Question Rewriting and Execution-Guided RefinementFindings7 citations
- Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense ReasoningLong7 citations
- GKT: A Novel Guidance-Based Knowledge Transfer Framework For Efficient Cloud-edge Collaboration LLM DeploymentFindings7 citations
- HiRoPE: Length Extrapolation for Code Models Using Hierarchical PositionLong7 citations
- II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question AnsweringFindings7 citations
- InstructCMP: Length Control in Sentence Compression through Instruction-based Large Language ModelsFindings7 citations
- It’s Not Easy Being Wrong: Large Language Models Struggle with Process of Elimination ReasoningFindings7 citations
- Knowledge-Infused Legal Wisdom: Navigating LLM Consultation through the Lens of Diagnostics and Positive-Unlabeled Reinforcement LearningFindings7 citations
- LLM-REDIAL: A Large-Scale Dataset for Conversational Recommender Systems Created from User Behaviors with LLMsFindings7 citations
- LLM-based Rewriting of Inappropriate Argumentation using Reinforcement Learning from Machine FeedbackLong7 citations
- Learning Disentangled Semantic Spaces of Explanations via Invertible Neural NetworksLong7 citations
- Legal Judgment Reimagined: PredEx and the Rise of Intelligent AI Interpretation in Indian CourtsFindings7 citations
- Let’s Go Real Talk: Spoken Dialogue Model for Face-to-Face ConversationLong7 citations
- Likelihood-based Mitigation of Evaluation Bias in Large Language ModelsFindings7 citations
- LocalRQA: From Generating Data to Locally Training, Testing, and Deploying Retrieval-Augmented QA SystemsSystem Demonstrations7 citations
- MELA: Multilingual Evaluation of Linguistic AcceptabilityLong7 citations
- Machine-Generated Text LocalizationFindings7 citations
- Maverick: Efficient and Accurate Coreference Resolution Defying Recent TrendsLong7 citations
- MemeGuard: An LLM and VLM-based Framework for Advancing Content Moderation via Meme InterventionLong7 citations
- Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form GenerationsFindings7 citations
- Mitigating Biases for Instruction-following Language Models via Bias Neurons EliminationLong7 citations
- Multi-Dimensional Optimization for Text Summarization via Reinforcement LearningLong7 citations
- Multi-Label Classification for Implicit Discourse Relation RecognitionFindings7 citations
- Navigating the Dual Facets: A Comprehensive Evaluation of Sequential Memory Editing in Large Language ModelsLong7 citations
- PAT-Questions: A Self-Updating Benchmark for Present-Anchored Temporal Question-AnsweringFindings7 citations
- PRoLoRA: Partial Rotation Empowers More Parameter-Efficient LoRALong7 citations
- Plausible Extractive Rationalization through Semi-Supervised Entailment SignalFindings7 citations
- Preemptive Answer “Attacks” on Chain-of-Thought ReasoningFindings7 citations
- Probing the Multi-turn Planning Capabilities of LLMs via 20 Question GamesLong7 citations
- Prompt-Based Length Controlled Generation with Multiple Control TypesFindings7 citations
- RadGraph-XL: A Large-Scale Expert-Annotated Dataset for Entity and Relation Extraction from Radiology ReportsFindings7 citations
- Reinforcement Tuning for Detecting Stances and Debunking Rumors Jointly with Large Language ModelsFindings7 citations
- SIBO: A Simple Booster for Parameter-Efficient Fine-TuningFindings7 citations
- Self-Specialization: Uncovering Latent Expertise within Large Language ModelsFindings7 citations
- SoMeLVLM: A Large Vision Language Model for Social Media ProcessingFindings7 citations
- Soft Knowledge Prompt: Help External Knowledge Become a Better Teacher to Instruct LLM in Knowledge-based VQALong7 citations
- Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control MechanismFindings7 citations
- Speech language models lack important brain-relevant semanticsLong7 citations
- Spotting AI’s Touch: Identifying LLM-Paraphrased Spans in TextFindings7 citations
- SwapMoE: Serving Off-the-shelf MoE-based Large Language Models with Tunable Memory BudgetLong7 citations
- SyntaxShap: Syntax-aware Explainability Method for Text GenerationFindings7 citations
- TOAD: Task-Oriented Automatic Dialogs with Diverse Response StylesFindings7 citations
- The Impact of Demonstrations on Multilingual In-Context Learning: A Multidimensional AnalysisFindings7 citations
- Towards Better Question Generation in QA-based Event ExtractionFindings7 citations
- VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language ModelsLong7 citations
- What Makes a Good Order of Examples in In-Context LearningFindings7 citations
- Where Do People Tell Stories Online? Story Detection Across Online CommunitiesLong7 citations
- A Modular Approach for Multimodal Summarization of TV ShowsLong6 citations
- ACUEval: Fine-grained Hallucination Evaluation and Correction for Abstractive SummarizationFindings6 citations
- AFPQ: Asymmetric Floating Point Quantization for LLMsFindings6 citations
- An Investigation of Neuron Activation as a Unified Lens to Explain Chain-of-Thought Eliciting Arithmetic Reasoning of LLMsLong6 citations
- ArchCode: Incorporating Software Requirements in Code Generation with Large Language ModelsLong6 citations
- BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language ModelsFindings6 citations
- BadActs: A Universal Backdoor Defense in the Activation SpaceFindings6 citations
- Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization CorrelationsLong6 citations
- Boosting LLM Agents with Recursive Contemplation for Effective Deception HandlingFindings6 citations
- CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language ModelsFindings6 citations
- Chain-of-History Reasoning for Temporal Knowledge Graph ForecastingFindings6 citations
- Chaos with Keywords: Exposing Large Language Models Sycophancy to Misleading Keywords and Evaluating Defense StrategiesFindings6 citations
- CharPoet: A Chinese Classical Poetry Generation System Based on Token-free LLMSystem Demonstrations6 citations
- Concept-Best-Matching: Evaluating Compositionality In Emergent CommunicationFindings6 citations
- Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language ModelsLong6 citations
- ConstitutionalExperts: Training a Mixture of Principle-based PromptsShort6 citations
- Conundrums in Cross-Prompt Automated Essay Scoring: Making Sense of the State of the ArtLong6 citations
- Cross-Modal Projection in Multimodal LLMs Doesn’t Really Project Visual Attributes to Textual SpaceShort6 citations
- D2LLM: Decomposed and Distilled Large Language Models for Semantic SearchLong6 citations
- DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge GraphsFindings6 citations
- Do Language Models Exhibit Human-like Structural Priming Effects?Findings6 citations
- Document-level Claim Extraction and Decontextualisation for Fact-CheckingLong6 citations
- ELAD: Explanation-Guided Large Language Models Active DistillationFindings6 citations
- ESCoT: Towards Interpretable Emotional Support Dialogue SystemsLong6 citations
- EasyGen: Easing Multimodal Generation with BiDiffuser and LLMsLong6 citations
- Enhancing EEG-to-Text Decoding through Transferable Representations from Pre-trained Contrastive EEG-Text Masked AutoencoderLong6 citations
- Enhancing Explainable Rating Prediction through Annotated Macro ConceptsLong6 citations
- Evaluating the Validity of Word-level Adversarial Attacks with Large Language ModelsFindings6 citations
- Exploring Reasoning Biases in Large Language Models Through Syllogism: Insights from the NeuBAROCO DatasetFindings6 citations
- Exploring Spatial Schema Intuitions in Large Language and Vision ModelsFindings6 citations
- Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical SemanticsFindings6 citations
- Hybrid Alignment Training for Large Language ModelsFindings6 citations
- Hyper-CL: Conditioning Sentence Representations with HypernetworksLong6 citations
- I am a Strange Dataset: Metalinguistic Tests for Language ModelsLong6 citations
- ICLEF: In-Context Learning with Expert Feedback for Explainable Style TransferLong6 citations
- IL-TUR: Benchmark for Indian Legal Text Understanding and ReasoningLong6 citations
- INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of RepairFindings6 citations
- Incremental Sequence Labeling: A Tale of Two ShiftsFindings6 citations
- InfoLossQA: Characterizing and Recovering Information Loss in Text SimplificationLong6 citations
- Is the Pope Catholic? Yes, the Pope is Catholic. Generative Evaluation of Non-Literal Intent Resolution in LLMsShort6 citations
- KG-Adapter: Enabling Knowledge Graph Integration in Large Language Models through Parameter-Efficient Fine-TuningFindings6 citations
- KoCommonGEN v2: A Benchmark for Navigating Korean Commonsense Reasoning Challenges in Large Language ModelsFindings6 citations
- LANDeRMT: Dectecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine TranslationLong6 citations
- LIRE: listwise reward enhancement for preference alignmentFindings6 citations
- LRQuant: Learnable and Robust Post-Training Quantization for Large Language ModelsLong6 citations
- Limits of Theory of Mind Modelling in Dialogue-Based Collaborative Plan AcquisitionLong6 citations
- Linear Transformers with Learnable Kernel Functions are Better In-Context ModelsLong6 citations
- LinguaLinked: Distributed Large Language Model Inference on Mobile DevicesSystem Demonstrations6 citations
- Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language ModelsFindings6 citations
- Medical Dialogue System: A Survey of Categories, Methods, Evaluation and ChallengesFindings6 citations
- Meta-Tuning LLMs to Leverage Lexical Knowledge for Generalizable Language Style UnderstandingLong6 citations
- More Victories, Less Cooperation: Assessing Cicero’s Diplomacy PlayLong6 citations
- Multi-Aspect Controllable Text Generation with Disentangled Counterfactual AugmentationLong6 citations
- NICE: To Optimize In-Context Examples or Not?Long6 citations
- NoteChat: A Dataset of Synthetic Patient-Physician Conversations Conditioned on Clinical NotesFindings6 citations
- On the Evaluation of Speech Foundation Models for Spoken Language UnderstandingFindings6 citations
- OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and SafetySystem Demonstrations6 citations
- PANDA: Preference Adaptation for Enhancing Domain-Specific Abilities of LLMsFindings6 citations
- POMP: Probability-driven Meta-graph Prompter for LLMs in Low-resource Unsupervised Neural Machine TranslationLong6 citations
- Persuading across Diverse Domains: a Dataset and Persuasion Large Language ModelLong6 citations
- Predicting Text Preference Via Structured Comparative ReasoningLong6 citations
- Prompt Optimization via Adversarial In-Context LearningLong6 citations
- Prompt Refinement with Image Pivot for Text-to-Image GenerationLong6 citations
- RaDA: Retrieval-augmented Web Agent Planning with LLMsFindings6 citations
- RomanSetu: Efficiently unlocking multilingual capabilities of Large Language Models via RomanizationLong6 citations
- SLIDE: A Framework Integrating Small and Large Language Models for Open-Domain Dialogues EvaluationFindings6 citations
- SPAGHETTI: Open-Domain Question Answering from Heterogeneous Data Sources with Retrieval and Semantic ParsingFindings6 citations
- Selective Prompting Tuning for Personalized Conversations with LLMsFindings6 citations
- SharedCon: Implicit Hate Speech Detection using Shared SemanticsFindings6 citations
- Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit AccessShort6 citations
- Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMsLong6 citations
- Social Intelligence Data Infrastructure: Structuring the Present and Navigating the FutureFindings6 citations
- Synergistic Interplay between Search and Large Language Models for Information RetrievalLong6 citations
- TOREE: Evaluating Topic Relevance of Student Essays for Chinese Primary and Middle School EducationFindings6 citations
- Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language ModelsFindings6 citations
- The Fine-Tuning Paradox: Boosting Translation Quality Without Sacrificing LLM AbilitiesLong6 citations
- Time Sensitive Knowledge Editing through Efficient FinetuningShort6 citations
- Uncertainty Aware Learning for Language Model AlignmentLong6 citations
- Understanding Cross-Lingual Alignment—A SurveyFindings6 citations
- Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache CompressionLong6 citations
- XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech PerceptionLong6 citations
- Zero-Shot Cross-Lingual Reranking with Large Language Models for Low-Resource LanguagesShort6 citations
- ADAM: Dense Retrieval Distillation with Adaptive Dark ExamplesFindings5 citations
- Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency SpaceLong5 citations
- Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM GameFindings5 citations
- Alirector: Alignment-Enhanced Chinese Grammatical Error CorrectorFindings5 citations
- An Empirical Study of In-context Learning in LLMs for Machine TranslationFindings5 citations
- Are AI-Generated Text Detectors Robust to Adversarial Perturbations?Long5 citations
- AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-ThoughtFindings5 citations
- BlendSQL: A Scalable Dialect for Unifying Hybrid Question Answering in Relational AlgebraFindings5 citations
- CSCD-NS: a Chinese Spelling Check Dataset for Native SpeakersLong5 citations
- Causal-Guided Active Learning for Debiasing Large Language ModelsLong5 citations
- Centroid-Based Efficient Minimum Bayes Risk DecodingFindings5 citations
- Comparing Inferential Strategies of Humans and Large Language Models in Deductive ReasoningLong5 citations
- Continual Dialogue State Tracking via Reason-of-Select DistillationFindings5 citations
- Controllable Data Augmentation for Few-Shot Text Mining with Chain-of-Thought Attribute ManipulationFindings5 citations
- Controllable Text Generation with Residual Memory TransformerFindings5 citations
- CopyNE: Better Contextual ASR by Copying Named EntitiesLong5 citations
- Diffusion Guided Language ModelingFindings5 citations
- Discerning and Resolving Knowledge Conflicts through Adaptive Decoding with Contextual Information-Entropy ConstraintFindings5 citations
- Does DetectGPT Fully Utilize Perturbation? Bridging Selective Perturbation to Fine-tuned Contrastive Learning Detector would be BetterLong5 citations
- E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language ModelsFindings5 citations
- Enhancing Hallucination Detection through Perturbation-Based Synthetic Data Generation in System ResponsesFindings5 citations
- Evaluating Intention Detection Capability of Large Language Models in Persuasive DialoguesLong5 citations
- Exploring Reversal Mathematical Reasoning Ability for Large Language ModelsFindings5 citations
- Extracting Polymer Nanocomposite Samples from Full-Length DocumentsFindings5 citations
- Few-shot Transfer Learning for Knowledge Base Question Answering: Fusing Supervised Models with In-Context LearningLong5 citations
- Fora: A corpus and framework for the study of facilitated dialogueLong5 citations
- GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models EvaluationFindings5 citations
- GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural NetworkFindings5 citations
- GeoAgent: To Empower LLMs using Geospatial Tools for Address StandardizationFindings5 citations
- Identifying while Learning for Document Event Causality IdentificationLong5 citations
- Improving Event Definition Following For Zero-Shot Event DetectionLong5 citations
- Instruction Tuning with Retrieval-based Examples Ranking for Aspect-based Sentiment AnalysisFindings5 citations
ACL accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.