EMNLP 2024 Accepted Papers
The full list of 2,379 papers accepted at EMNLP 2024 (Conference on Empirical Methods in Natural Language Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Main: 1,234finding: 976Industry: 119System Demonstrations: 50
- A Survey on In-context LearningMain1,730 citations
- Video-LLaVA: Learning United Visual Representation by Alignment Before ProjectionMain631 citations
- Encouraging Divergent Thinking in Large Language Models through Multi-Agent DebateMain377 citations
- ORPO: Monolithic Preference Optimization without Reference ModelMain203 citations
- Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMsMain160 citations
- Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language ModelsMain160 citations
- FOLIO: Natural Language Reasoning with First-Order LogicMain150 citations
- Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Expertsfinding114 citations
- mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understandingfinding112 citations
- Arcee’s MergeKit: A Toolkit for Merging Large Language ModelsIndustry107 citations
- Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language ModelsMain106 citations
- Humans or LLMs as the Judge? A Study on Judgement BiasMain102 citations
- LawBench: Benchmarking Legal Knowledge of Large Language ModelsMain101 citations
- A Simple LLM Framework for Long-Range Video Question-AnsweringMain96 citations
- When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource LanguagesMain96 citations
- Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?Main95 citations
- AnyMAL: An Efficient and Scalable Any-Modality Augmented Language ModelIndustry92 citations
- The Effect of Sampling Temperature on Problem Solving in Large Language Modelsfinding89 citations
- Knowledge Conflicts for LLMs: A SurveyMain83 citations
- Moral Foundations of Large Language ModelsMain81 citations
- Scaling Sentence Embeddings with Large Language Modelsfinding81 citations
- MiniCheck: Efficient Fact-Checking of LLMs on Grounding DocumentsMain74 citations
- Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalizationfinding74 citations
- R-Judge: Benchmarking Safety Risk Awareness for LLM Agentsfinding73 citations
- Searching for Best Practices in Retrieval-Augmented GenerationMain71 citations
- WavLLM: Towards Robust and Adaptive Speech Large Language Modelfinding70 citations
- MLLM-Protector: Ensuring MLLM’s Safety without Hurting PerformanceMain69 citations
- Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Modelsfinding69 citations
- Towards Measuring and Modeling “Culture” in LLMs: A SurveyMain65 citations
- FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Modelsfinding64 citations
- Dense X Retrieval: What Retrieval Granularity Should We Use?Main63 citations
- FLIRT: Feedback Loop In-context Red TeamingMain61 citations
- SMILE: Single-turn to Multi-turn Inclusive Language Expansion via ChatGPT for Mental Health Supportfinding60 citations
- Heterogeneous LoRA for Federated Fine-tuning of On-Device Foundation ModelsMain57 citations
- Android in the Zoo: Chain-of-Action-Thought for GUI Agentsfinding55 citations
- LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-TrainingMain55 citations
- A Survey on Detection of LLMs-Generated Contentfinding53 citations
- Small LLMs Are Weak Tool Learners: A Multi-LLM AgentMain52 citations
- DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLMs Jailbreakersfinding50 citations
- DTS-SQL: Decomposed Text-to-SQL with Small Large Language Modelsfinding46 citations
- InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model GuidanceMain46 citations
- Controllable Preference Optimization: Toward Controllable Multi-Objective AlignmentMain45 citations
- Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM AssessmentMain45 citations
- LongAlign: A Recipe for Long Context Alignment of Large Language Modelsfinding45 citations
- In-Context Learning with Iterative Demonstration Selectionfinding44 citations
- Large Language Models for Data Annotation and Synthesis: A SurveyMain44 citations
- Chain-of-Dictionary Prompting Elicits Translation in Large Language ModelsMain43 citations
- Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context LearningMain43 citations
- OpenGraph: Towards Open Graph Foundation Modelsfinding42 citations
- Systematic Biases in LLM Simulations of DebatesMain42 citations
- A Thorough Examination of Decoding Methods in the Era of LLMsMain41 citations
- Foundational Autoraters: Taming Large Language Models for Better Automatic EvaluationMain41 citations
- Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QAMain41 citations
- Multimodal Procedural Planning via Dual Text-Image Promptingfinding41 citations
- VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video GenerationMain41 citations
- RepoAgent: An LLM-Powered Open-Source Framework for Repository-level Code Documentation GenerationSystem Demonstrations40 citations
- Zero-Resource Hallucination Prevention for Large Language Modelsfinding40 citations
- mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text RetrievalIndustry40 citations
- A Peek into Token Bias: Large Language Models Are Not Yet Genuine ReasonersMain39 citations
- Can LLM be a Personalized Judge?finding38 citations
- LLM-Based Agent Society Investigation: Collaboration and Confrontation in Avalon GameplayMain38 citations
- Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervisionfinding38 citations
- TPTU-v2: Boosting Task Planning and Tool Usage of Large Language Model-based Agents in Real-world Industry SystemsIndustry38 citations
- EAGLE-2: Faster Inference of Language Models with Dynamic Draft TreesMain37 citations
- Extract, Define, Canonicalize: An LLM-based Framework for Knowledge Graph ConstructionMain37 citations
- MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and CollaborationMain37 citations
- GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning AbilitiesMain36 citations
- Is this the real life? Is this just fantasy? The Misleading Success of Simulating Social Interactions With LLMsMain36 citations
- LLM4Decompile: Decompiling Binary Code with Large Language ModelsMain36 citations
- OffsetBias: Leveraging Debiased Data for Tuning Evaluatorsfinding36 citations
- QUIK: Towards End-to-end 4-Bit Inference on Generative Large Language ModelsMain36 citations
- A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and RecommendationsMain35 citations
- DALK: Dynamic Co-Augmentation of LLMs and KG to answer Alzheimer’s Disease Questions with Scientific Literaturefinding35 citations
- LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inferencefinding35 citations
- SOUL: Unlocking the Power of Second-Order Optimization for LLM UnlearningMain35 citations
- Tokenization Is More Than CompressionMain34 citations
- A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific DiscoveryMain33 citations
- Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention MapsMain33 citations
- PATIENT-𝜓: Using Large Language Models to Simulate Patients for Training Mental Health ProfessionalsMain33 citations
- Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid ApproachIndustry33 citations
- AgentReview: Exploring Peer Review Dynamics with LLM AgentsMain32 citations
- RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language ModelsMain32 citations
- Step-level Value Preference Optimization for Mathematical Reasoningfinding32 citations
- Summary of a Haystack: A Challenge to Long-Context LLMs and RAG SystemsMain32 citations
- TAP4LLM: Table Provider on Sampling, Augmenting, and Packing Semi-structured Data for Large Language Model Reasoningfinding32 citations
- EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health RecordsMain31 citations
- Language Models Learn Rare Phenomena from Less Rare Phenomena: The Case of the Missing AANNsMain31 citations
- Language Models Still Struggle to Zero-shot Reason about Time Seriesfinding31 citations
- Middleware for LLMs: Tools Are Instrumental for Language Agents in Complex EnvironmentsMain31 citations
- Roleplay-doh: Enabling Domain-Experts to Create LLM-simulated Patients via Eliciting and Adhering to PrinciplesMain31 citations
- Are Large Language Models Capable of Generating Human-Level Narratives?Main30 citations
- Mitigating the Alignment Tax of RLHFMain30 citations
- Optimizing Instructions and Demonstrations for Multi-Stage Language Model ProgramsMain30 citations
- Puzzle Solving using Reasoning of Large Language Models: A SurveyMain30 citations
- mDPO: Conditional Preference Optimization for Multimodal Large Language ModelsMain30 citations
- Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observationsfinding29 citations
- From Complex to Simple: Enhancing Multi-Constraint Complex Instruction Following Ability of Large Language Modelsfinding29 citations
- LLMs Assist NLP Researchers: Critique Paper (Meta-)ReviewingMain29 citations
- MMedAgent: Learning to Use Medical Tools with Multi-modal Agentfinding29 citations
- MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language ModelsMain29 citations
- PDFTriage: Question Answering over Long, Structured DocumentsIndustry28 citations
- Personas as a Way to Model Truthfulness in Language ModelsMain28 citations
- SciAgent: Tool-augmented Language Models for Scientific ReasoningMain28 citations
- User Inference Attacks on Large Language ModelsMain28 citations
- BiMediX: Bilingual Medical Mixture of Experts LLMfinding27 citations
- CultureBank: An Online Community-Driven Knowledge Base Towards Culturally Aware Language Technologiesfinding27 citations
- NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated DataMain27 citations
- Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality EstimationMain26 citations
- Generate-on-Graph: Treat LLM as both Agent and KG for Incomplete Knowledge Graph Question AnsweringMain26 citations
- ImageInWords: Unlocking Hyper-Detailed Image DescriptionsMain26 citations
- Information Flow Routes: Automatically Interpreting Language Models at ScaleMain26 citations
- LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languagesfinding26 citations
- Large Language Models Can Be Contextual Privacy Protection LearnersMain26 citations
- Learning Planning-based Reasoning by Trajectories Collection and Process Reward SynthesizingMain26 citations
- MarkLLM: An Open-Source Toolkit for LLM WatermarkingSystem Demonstrations26 citations
- SaySelf: Teaching LLMs to Express Confidence with Self-Reflective RationalesMain26 citations
- A Unified Framework for Model Editingfinding25 citations
- Breaking the Curse of Multilinguality with Cross-lingual Expert Language ModelsMain25 citations
- Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkersfinding25 citations
- How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden Statesfinding25 citations
- REAR: A Relevance-Aware Retrieval-Augmented Framework for Open-Domain Question AnsweringMain25 citations
- ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectorsfinding25 citations
- Turning English-centric LLMs Into Polyglots: How Much Multilinguality Is Needed?finding25 citations
- Typos that Broke the RAG’s Back: Genetic Attack on RAG Pipeline by Simulating Documents in the Wild via Low-level Perturbationsfinding25 citations
- A Simple and Effective L_2 Norm-Based Strategy for KV Cache CompressionMain24 citations
- Benchmarking Vision Language Models for Cultural UnderstandingMain24 citations
- LUQ: Long-text Uncertainty Quantification for LLMsMain24 citations
- Learning to Use Tools via Cooperative and Interactive Agentsfinding24 citations
- Linguistic Bias in ChatGPT: Language Models Reinforce Dialect DiscriminationMain24 citations
- Modular Pluralism: Pluralistic Alignment via Multi-LLM CollaborationMain24 citations
- PromptReps: Prompting Large Language Models to Generate Dense and Sparse Representations for Zero-Shot Document RetrievalMain24 citations
- Large Language Models for Propaganda Span Annotationfinding23 citations
- LongEmbed: Extending Embedding Models for Long Context RetrievalMain23 citations
- Mixture-of-Subspaces in Low-Rank AdaptationMain23 citations
- Model Editing Harms General Abilities of Large Language Models: Regularization to the RescueMain23 citations
- TransLLaMa: LLM-based Simultaneous Translation Systemfinding23 citations
- BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language ModelsMain22 citations
- Can Large Language Models Identify Authorship?finding22 citations
- Cognitive Bias in Decision-Making with LLMsfinding22 citations
- Extracting Prompts by Inverting LLM OutputsMain22 citations
- Few shot chain-of-thought driven reasoning to prompt LLMs for open-ended medical question answeringfinding22 citations
- Fishing for Magikarp: Automatically Detecting Under-trained Tokens in Large Language ModelsMain22 citations
- GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Modelsfinding22 citations
- Instruction Pre-Training: Language Models are Supervised Multitask LearnersMain22 citations
- Leveraging Large Language Models for NLG Evaluation: Advances and ChallengesMain22 citations
- Revisiting Catastrophic Forgetting in Large Language Model Tuningfinding22 citations
- Authorship Obfuscation in Multilingual Machine-Generated Text Detectionfinding21 citations
- Data Diversity Matters for Robust Instruction Tuningfinding21 citations
- Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editingfinding21 citations
- Demystifying Verbatim Memorization in Large Language ModelsMain21 citations
- Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular TasksIndustry21 citations
- Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encodingfinding21 citations
- On Leakage of Code Generation Evaluation Datasetsfinding21 citations
- One Thousand and One Pairs: A “novel” challenge for long-context language modelsMain21 citations
- ProSA: Assessing and Understanding the Prompt Sensitivity of LLMsfinding21 citations
- Social Bias Probing: Fairness Benchmarking for Language ModelsMain21 citations
- VeriScore: Evaluating the factuality of verifiable claims in long-form text generationfinding21 citations
- XRec: Large Language Models for Explainable Recommendationfinding21 citations
- An Open-Source Data Contamination Report for Large Language Modelsfinding20 citations
- How Far Can We Extract Diverse Perspectives from Large Language Models?Main20 citations
- Immunization against harmful fine-tuning attacksfinding20 citations
- Knowledge Mechanisms in Large Language Models: A Survey and Perspectivefinding20 citations
- Neeko: Leveraging Dynamic LoRA for Efficient Multi-Character Role-Playing AgentMain20 citations
- Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMsfinding20 citations
- Reformatted Alignmentfinding20 citations
- Sailor: Open Language Models for South-East AsiaSystem Demonstrations20 citations
- WPO: Enhancing RLHF with Weighted Preference OptimizationMain20 citations
- Watch Every Step! LLM Agent Learning via Iterative Step-level Process RefinementMain20 citations
- API Is Enough: Conformal Prediction for Large Language Models Without Logit-Accessfinding19 citations
- C-ICL: Contrastive In-context Learning for Information Extractionfinding19 citations
- Calibrating Long-form Generations From Large Language Modelsfinding19 citations
- Discovering Knowledge-Critical Subnetworks in Pretrained Language ModelsMain19 citations
- GREEN: Generative Radiology Report Evaluation and Error Notationfinding19 citations
- Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop QueriesMain19 citations
- Improving Multi-Agent Debate with Sparse Communication Topologyfinding19 citations
- MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problemsfinding19 citations
- Making Reasoning Matter: Measuring and Improving Faithfulness of Chain-of-Thought Reasoningfinding19 citations
- NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surroundingfinding19 citations
- Benchmarking Machine Translation with Cultural Awarenessfinding18 citations
- Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?Main18 citations
- Evaluating the Instruction-Following Robustness of Large Language Models to Prompt InjectionMain18 citations
- M2PT: Multimodal Prompt Tuning for Zero-shot Instruction LearningMain18 citations
- MetaGPT: Merging Large Language Models Using Model Exclusive Task ArithmeticMain18 citations
- Personalized Pieces: Efficient Personalized Large Language Models through Collaborative EffortsMain18 citations
- SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text GenerationMain18 citations
- The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce HarmMain18 citations
- A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Modelsfinding17 citations
- Conditional Language Policy: A General Framework For Steerable Multi-Objective Finetuningfinding17 citations
- Editing Conceptual Knowledge for Large Language Modelsfinding17 citations
- Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional WorksMain17 citations
- HoneyComb: A Flexible LLM-Based Agent System for Materials Sciencefinding17 citations
- KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approachesfinding17 citations
- Knowledge Graph Enhanced Large Language Model EditingMain17 citations
- MedAdapter: Efficient Test-Time Adaptation of Large Language Models Towards Medical ReasoningMain17 citations
- Open-RAG: Enhanced Retrieval Augmented Reasoning with Open-Source Large Language Modelsfinding17 citations
- Patentformer: A Novel Method to Automate the Generation of Patent ApplicationsIndustry17 citations
- Personality-aware Student Simulation for Conversational Intelligent Tutoring SystemsMain17 citations
- Suri: Multi-constraint Instruction Following in Long-form Text Generationfinding17 citations
- Towards Understanding Jailbreak Attacks in LLMs: A Representation Space AnalysisMain17 citations
- Are Large Language Models Consistent over Value-laden Questions?finding16 citations
- BMRetriever: Tuning Large Language Models as Better Biomedical Text RetrieversMain16 citations
- BlendFilter: Advancing Retrieval-Augmented Large Language Models via Query Generation Blending and Knowledge FilteringMain16 citations
- ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guaranteesfinding16 citations
- Deciphering the Factors Influencing the Efficacy of Chain-of-Thought: Probability, Memorization, and Noisy Reasoningfinding16 citations
- Filtered Direct Preference OptimizationMain16 citations
- LLoCO: Learning Long Contexts OfflineMain16 citations
- Large Language Model-based Human-Agent Collaboration for Complex Task Solvingfinding16 citations
- Learn to Refuse: Making Large Language Models More Controllable and Reliable through Knowledge Scope Limitation and Refusal MechanismMain16 citations
- LongHeads: Multi-Head Attention is Secretly a Long Context Processorfinding16 citations
- NumeroLogic: Number Encoding for Enhanced LLMs’ Numerical ReasoningMain16 citations
- RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMsMain16 citations
- Rebuilding ROME : Resolving Model Collapse during Sequential Model EditingMain16 citations
- Towards Verifiable Text Generation with Evolving Memory and Self-ReflectionMain16 citations
- Uncertainty in Language Models: Assessment through Rank-CalibrationMain16 citations
- Understanding and Mitigating Language Confusion in LLMsMain16 citations
- Unifying Multimodal Retrieval via Document Screenshot EmbeddingMain16 citations
- Annotator-Centric Active Learning for Subjective NLP TasksMain15 citations
- BASES: Large-scale Web Search User Simulation with Large Language Model based Agentsfinding15 citations
- Can LLM Graph Reasoning Generalize beyond Pattern Memorization?finding15 citations
- Defending Jailbreak Prompts via In-Context Adversarial GameMain15 citations
- Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL DivergenceMain15 citations
- Hidden Persuaders: LLMs’ Political Leaning and Their Influence on VotersMain15 citations
- LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planningfinding15 citations
- MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language ModelMain15 citations
- On the Generalization of Training-based ChatGPT Detection Methodsfinding15 citations
- Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General TasksMain15 citations
- RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question AnsweringMain15 citations
- Re-Reading Improves Reasoning in Large Language ModelsMain15 citations
- Retrieved Sequence Augmentation for Protein Representation LearningMain15 citations
- RoseLoRA: Row and Column-wise Sparse Low-rank Adaptation of Pre-trained Language Model for Knowledge Editing and Fine-tuningMain15 citations
- The Mystery of In-Context Learning: A Comprehensive Survey on Interpretation and AnalysisMain15 citations
- TinyAgent: Function Calling at the EdgeSystem Demonstrations15 citations
- Verification and Refinement of Natural Language Explanations through LLM-Symbolic Theorem ProvingMain15 citations
- Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processingfinding15 citations
- CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Modelsfinding14 citations
- ChatRetriever: Adapting Large Language Models for Generalized and Robust Conversational Dense RetrievalMain14 citations
- CompAct: Compressing Retrieved Documents Actively for Question AnsweringMain14 citations
- Divide-or-Conquer? Which Part Should You Distill Your LLM?finding14 citations
- Fine-Tuning and Prompt Optimization: Two Great Steps that Work Better TogetherMain14 citations
- GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image GenerationMain14 citations
- Into the Unknown Unknowns: Engaged Human Learning through Participation in Language Model Agent ConversationsMain14 citations
- Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge Graphsfinding14 citations
- LitSearch: A Retrieval Benchmark for Scientific Literature SearchMain14 citations
- MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understandingfinding14 citations
- RaFe: Ranking Feedback Improves Query Rewriting for RAGfinding14 citations
- AdaZeta: Adaptive Zeroth-Order Tensor-Train Adaption for Memory-Efficient Large Language Models Fine-TuningMain13 citations
- AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectoriesfinding13 citations
- Aligning Language Models to Explicitly Handle AmbiguityMain13 citations
- AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?Main13 citations
- BLADE: Benchmarking Language Model Agents for Data-Driven Sciencefinding13 citations
- Calibrating Language Models with Adaptive Temperature ScalingMain13 citations
- ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answeringfinding13 citations
- DLoRA: Distributed Parameter-Efficient Fine-Tuning Solution for Large Language Modelfinding13 citations
- Direct Multi-Turn Preference Optimization for Language AgentsMain13 citations
- Evaluating Psychological Safety of Large Language ModelsMain13 citations
- Extrinsic Evaluation of Cultural Competence in Large Language Modelsfinding13 citations
- How to Compute the Probability of a WordMain13 citations
- Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLPMain13 citations
- Large Language Models Can Self-Correct with Key Condition VerificationMain13 citations
- LongForm: Effective Instruction Tuning with Reverse Instructionsfinding13 citations
- Model Merging and Safety Alignment: One Bad Model Spoils the Bunchfinding13 citations
- Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual AlignmentMain13 citations
- RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool LearningMain13 citations
- STAR: SocioTechnical Approach to Red Teaming Language ModelsMain13 citations
- SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLMfinding13 citations
- TRACE the Evidence: Constructing Knowledge-Grounded Reasoning Chains for Retrieval-Augmented Generationfinding13 citations
- Why Does New Knowledge Create Messy Ripple Effects in LLMs?Main13 citations
- ApiQ: Finetuning of 2-Bit Quantized Large Language ModelMain12 citations
- AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Modelsfinding12 citations
- Automatic Instruction Evolving for Large Language ModelsMain12 citations
- Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compressionfinding12 citations
- BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMsMain12 citations
- Can AI Relate: Testing Large Language Model Response for Mental Health Supportfinding12 citations
- CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language ModelsMain12 citations
- CodeJudge: Evaluating Code Generation with Large Language ModelsMain12 citations
- EchoSight: Advancing Visual-Language Models with Wiki Knowledgefinding12 citations
- Fairer Preferences Elicit Improved Human-Aligned Large Language Model JudgmentsMain12 citations
- LLM-DetectAIve: a Tool for Fine-Grained Machine-Generated Text DetectionSystem Demonstrations12 citations
- Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language ModelsMain12 citations
- Language Models in Dialogue: Conversational Maxims for Human-AI Interactionsfinding12 citations
- Learn Beyond The Answer: Training Language Models with Reflection for Mathematical ReasoningMain12 citations
- Learning to Refine with Fine-Grained Natural Language Feedbackfinding12 citations
- LongRAG: A Dual-Perspective Retrieval-Augmented Generation Paradigm for Long-Context Question AnsweringMain12 citations
- MedCoT: Medical Chain of Thought via Hierarchical ExpertMain12 citations
- Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?Main12 citations
- Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimizationfinding12 citations
- OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMsSystem Demonstrations12 citations
- PEDANTS: Cheap but Effective and Interpretable Answer Equivalencefinding12 citations
- Pedagogical Alignment of Large Language Modelsfinding12 citations
- PromptKD: Distilling Student-Friendly Knowledge for Generative Language Models via Prompt Tuningfinding12 citations
- Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspectivefinding12 citations
- Reasoning in Token Economies: Budget-Aware Evaluation of LLM Reasoning StrategiesMain12 citations
- The Program Testing Ability of Large Language Models for CodeIndustry12 citations
- Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactionsfinding12 citations
- TrustAgent: Towards Safe and Trustworthy LLM-based Agentsfinding12 citations
- When ”A Helpful Assistant” Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Modelsfinding12 citations
- “They are uncultured”: Unveiling Covert Harms and Social Threats in LLM Generated ConversationsMain12 citations
- AKEW: Assessing Knowledge Editing in the WildMain11 citations
- African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object ClassificationMain11 citations
- An Empirical Study on Cross-lingual Vocabulary Adaptation for Efficient Language Model Inferencefinding11 citations
- Are LLMs Good Zero-Shot Fallacy Classifiers?Main11 citations
- BERGEN: A Benchmarking Library for Retrieval-Augmented Generationfinding11 citations
- Backward Lens: Projecting Language Model Gradients into the Vocabulary SpaceMain11 citations
- BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical AnalysisSystem Demonstrations11 citations
- Beyond Demographics: Aligning Role-playing LLM-based Agents Using Human Belief Networksfinding11 citations
- Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex ModelsMain11 citations
- Can LLM Generate Culturally Relevant Commonsense QA Data? Case Study in Indonesian and SundaneseMain11 citations
- CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue CoreferenceMain11 citations
- Detection and Measurement of Syntactic Templates in Generated TextMain11 citations
- Dual-Space Knowledge Distillation for Large Language ModelsMain11 citations
- Evaluating n-Gram Novelty of Language Models Using Rusty-DAWGMain11 citations
- How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric LearningMain11 citations
- InfuserKI: Enhancing Large Language Models with Knowledge Graphs via Infuser-Guided Knowledge Integrationfinding11 citations
- LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvementfinding11 citations
- LumberChunker: Long-Form Narrative Document Segmentationfinding11 citations
- More DWUGs: Extending and Evaluating Word Usage Graph Datasets in Multiple LanguagesMain11 citations
- Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language ModelsMain11 citations
- MultiAgent Collaboration Attack: Investigating Adversarial Attacks in Large Language Model Collaborations via Debatefinding11 citations
- Neuron-Level Knowledge Attribution in Large Language ModelsMain11 citations
- On Diversified Preferences of Large Language Model Alignmentfinding11 citations
- PostMark: A Robust Blackbox Watermark for Large Language ModelsMain11 citations
- Preference Tuning For Toxicity Mitigation Generalizes Across Languagesfinding11 citations
- QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model TuningIndustry11 citations
- ReCaLL: Membership Inference via Relative Conditional Log-LikelihoodsMain11 citations
- Right for Right Reasons: Large Language Models for Verifiable Commonsense Knowledge Graph Question AnsweringMain11 citations
- Scaling Laws for Fact Memorization of Large Language Modelsfinding11 citations
- To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Modelsfinding11 citations
- TopViewRS: Vision-Language Models as Top-View Spatial ReasonersMain11 citations
- UrbanLLM: Autonomous Urban Activity Planning and Management with Large Language Modelsfinding11 citations
- V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimizationfinding11 citations
- VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models AlignmentMain11 citations
- Weak-to-Strong Reasoningfinding11 citations
- When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression DetectionMain11 citations
- “Thinking” Fair and Slow: On the Efficacy of Structured Prompts for Debiasing Language ModelsMain11 citations
- A LLM-based Ranking Method for the Evaluation of Automatic Counter-Narrative Generationfinding10 citations
- A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Modelsfinding10 citations
- A User-Centric Multi-Intent Benchmark for Evaluating Large Language ModelsMain10 citations
- AdaMoE: Token-Adaptive Routing with Null Experts for Mixture-of-Experts Language Modelsfinding10 citations
- Advancing Social Intelligence in AI Agents: Technical Challenges and Open QuestionsMain10 citations
- Aligning Translation-Specific Understanding to General Understanding in Large Language ModelsMain10 citations
- ArMeme: Propagandistic Content in Arabic MemesMain10 citations
- Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialoguesfinding10 citations
- Beyond Natural Language: LLMs Leveraging Alternative Formats for Enhanced Reasoning and Communicationfinding10 citations
- Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue AgentsMain10 citations
- CHIQ: Contextual History Enhancement for Improving Query Rewriting in Conversational SearchMain10 citations
- Can LLMs Reason in the Wild with Programs?finding10 citations
- Can Language Models Recognize Convincing Arguments?finding10 citations
- CryptoTrade: A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency TradingMain10 citations
- DAMRO: Dive into the Attention Mechanism of LVLM to Reduce Object HallucinationMain10 citations
- DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Modelsfinding10 citations
- ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?Main10 citations
- Efficient LLM Comparative Assessment: A Product of Experts Framework for Pairwise ComparisonsMain10 citations
- Exploring the Relationship between In-Context Learning and Instruction Tuningfinding10 citations
- Factuality of Large Language Models: A SurveyMain10 citations
- Fast Matrix Multiplications for Lookup Table-Quantized LLMsfinding10 citations
- Finding Blind Spots in Evaluator LLMs with Interpretable ChecklistsMain10 citations
- FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food CultureMain10 citations
- From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language ModelsMain10 citations
- Fuse to Forget: Bias Reduction and Selective Memorization through Model FusionMain10 citations
- How Susceptible are Large Language Models to Ideological Manipulation?Main10 citations
- ItiNera: Integrating Spatial Optimization with Large Language Models for Open-domain Urban Itinerary PlanningIndustry10 citations
- LEMoE: Advanced Mixture of Experts Adaptor for Lifelong Model Editing of Large Language ModelsMain10 citations
- LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language ModelsMain10 citations
- LongWanjuan: Towards Systematic Measurement for Long Text Qualityfinding10 citations
- MIBench: Evaluating Multimodal Large Language Models over Multiple ImagesMain10 citations
- MatchTime: Towards Automatic Soccer Game Commentary GenerationMain10 citations
- Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language ModelMain10 citations
- Not All Contexts Are Equal: Teaching LLMs Credibility-aware GenerationMain10 citations
- OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-ConquerMain10 citations
- On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimizationfinding10 citations
- On the Proper Treatment of Tokenization in PsycholinguisticsMain10 citations
- Ontologically Faithful Generation of Non-Player Character DialoguesMain10 citations
- PARIKSHA: A Large-Scale Investigation of Human-LLM Evaluator Agreement on Multilingual and Multi-Cultural DataMain10 citations
- Perceptions to Beliefs: Exploring Precursory Inferences for Theory of Mind in Large Language ModelsMain10 citations
- Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?Main10 citations
- RAGLAB: A Modular and Research-Oriented Unified Framework for Retrieval-Augmented GenerationSystem Demonstrations10 citations
- RWKV-CLIP: A Robust Vision-Language Representation LearnerMain10 citations
- Retrieve-Plan-Generation: An Iterative Planning and Answering Framework for Knowledge-Intensive LLM GenerationMain10 citations
- RuBLiMP: Russian Benchmark of Linguistic Minimal PairsMain10 citations
- Schema-Driven Information Extraction from Heterogeneous Tablesfinding10 citations
- Segment Any Text: A Universal Approach for Robust, Efficient and Adaptable Sentence SegmentationMain10 citations
- Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewardsfinding10 citations
- Shall We Team Up: Exploring Spontaneous Cooperation of Competing LLM Agentsfinding10 citations
- TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video ReasoningMain10 citations
- TensorOpera Router: A Multi-Model Router for Efficient LLM InferenceIndustry10 citations
- The Zeno’s Paradox of ‘Low-Resource’ LanguagesMain10 citations
- TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkishfinding10 citations
- Walking in Others’ Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and BiasMain10 citations
- Zero-shot Persuasive Chatbots with LLM-Generated Strategies and Information Retrievalfinding10 citations
- A Notion of Complexity for Theory of Mind via Discrete World Modelsfinding9 citations
- ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix EmbeddingsMain9 citations
- AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understandingfinding9 citations
- An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevanceMain9 citations
- Are Large Language Models (LLMs) Good Social Predictors?finding9 citations
- Automated Peer Reviewing in Paper SEA: Standardization, Evaluation, and Analysisfinding9 citations
- Cactus: Towards Psychological Counseling Conversations using Cognitive Behavioral Theoryfinding9 citations
- Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language ModelsMain9 citations
- Distract Large Language Models for Automatic Jailbreak AttackMain9 citations
- Do LLMs Plan Like Human Writers? Comparing Journalist Coverage of Press Releases with LLMsMain9 citations
- Enhancing Reinforcement Learning with Dense Rewards from Language Model CriticMain9 citations
- Enhancing Systematic Decompositional Natural Language Inference Using Informal LogicMain9 citations
- Enhancing Tool Retrieval with Iterative Feedback from Large Language Modelsfinding9 citations
- FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agentsfinding9 citations
- If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept DescriptionsMain9 citations
- InterIntent: Investigating Social Intelligence of LLMs via Intention Understanding in an Interactive Game ContextMain9 citations
- Knowledge Editing in Language Models via Adapted Direct Preference Optimizationfinding9 citations
- LLMs Are Prone to Fallacies in Causal InferenceMain9 citations
- LLMs for Generating and Evaluating Counterfactuals: A Comprehensive Studyfinding9 citations
- LLMs learn governing principles of dynamical systems, revealing an in-context neural scaling lawMain9 citations
- Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Modelsfinding9 citations
- Mitigating Catastrophic Forgetting in Language Transfer via Model Mergingfinding9 citations
- Molecular Facts: Desiderata for Decontextualization in LLM Fact Verificationfinding9 citations
- NLEBench+NorGLM: A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in NorwegianMain9 citations
- On the Reliability of Psychological Scales on Large Language ModelsMain9 citations
- PTD-SQL: Partitioning and Targeted Drilling with LLMs in Text-to-SQLMain9 citations
- Perceptions of Linguistic Uncertainty by Language Models and HumansMain9 citations
- PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuningfinding9 citations
- PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMsfinding9 citations
- RaTEScore: A Metric for Radiology Report GenerationMain9 citations
- ReadMe++: Benchmarking Multilingual Language Models for Multi-Domain Readability AssessmentMain9 citations
- Reference-free Hallucination Detection for Large Vision-Language Modelsfinding9 citations
- Resilience of Large Language Models for Noisy Instructionsfinding9 citations
- SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research RepositoriesMain9 citations
- Safely Learning with Private Data: A Federated Learning Framework for Large Language ModelMain9 citations
- Scaling Properties of Speech Language ModelsMain9 citations
- Small Agent Can Also Rock! Empowering Small Language Models as Hallucination DetectorMain9 citations
- Split and Merge: Aligning Position Biases in LLM-based EvaluatorsMain9 citations
- Text-Tuple-Table: Towards Information Integration in Text-to-Table Generation via Global Tuple ExtractionMain9 citations
- The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Modelsfinding9 citations
- Towards Injecting Medical Visual Knowledge into Multimodal LLMs at ScaleMain9 citations
- Train Once, Use Flexibly: A Modular Framework for Multi-Aspect Neural News Recommendationfinding9 citations
- Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question AnsweringMain9 citations
- Unlocking Memorization in Large Language Models with Dynamic Soft PromptingMain9 citations
- VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language ModelsMain9 citations
- VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMsfinding9 citations
- Virtual Personas for Language Models via an Anthology of BackstoriesMain9 citations
- A Simple but Effective Approach to Improve Structured Language Model Output for Information Extractionfinding8 citations
- Adaptive Token Biaser: Knowledge Editing via Biasing Key Entitiesfinding8 citations
- Assessing and Verifying Task Utility in LLM-Powered ApplicationsMain8 citations
- BLSP-Emo: Towards Empathetic Large Speech-Language ModelsMain8 citations
- Capturing Minds, Not Just Words: Enhancing Role-Playing Language Models with Personality-Indicative Datafinding8 citations
- CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Codefinding8 citations
- CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Modelsfinding8 citations
- Dense Passage Retrieval: Is it Retrieving?finding8 citations
- DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMsfinding8 citations
- Dynamic Planning for LLM-based Graphical User Interface Automationfinding8 citations
- EPO: Hierarchical LLM Agents with Environment Preference OptimizationMain8 citations
- EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoningfinding8 citations
- EfficientRAG: Efficient Retriever for Multi-Hop Question AnsweringMain8 citations
- Eigen Attention: Attention in Low-Rank Space for KV Cache Compressionfinding8 citations
- Evaluating Large Language Models on Time Series Feature Understanding: A Comprehensive Taxonomy and BenchmarkMain8 citations
- FEDKIM: Adaptive Federated Knowledge Injection into Medical Foundation ModelsMain8 citations
- FFN-SkipLLM: A Hidden Gem for Autoregressive Decoding with Adaptive Feed Forward SkippingMain8 citations
- FuseGen: PLM Fusion for Data-generation based Zero-shot LearningMain8 citations
- How Does Quantization Affect Multilingual LLMs?finding8 citations
- INDUS: Effective and Efficient Language Models for Scientific ApplicationsIndustry8 citations
- Intent Detection in the Age of LLMsIndustry8 citations
- Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron AnalysisMain8 citations
- Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial HypothesisMain8 citations
- Is Child-Directed Speech Effective Training Data for Language Models?Main8 citations
- Jellyfish: Instruction-Tuning Local Large Language Models for Data PreprocessingMain8 citations
- JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Modelsfinding8 citations
- LLM Questionnaire Completion for Automatic Psychiatric Assessmentfinding8 citations
- Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next LevelMain8 citations
- Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student CourseMain8 citations
- M5 – A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasksfinding8 citations
- MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classificationfinding8 citations
- Mitigating Hallucination in Fictional Character Role-Playfinding8 citations
- Personal Large Language Model Agents: A Case Study on Tailored Travel PlanningIndustry8 citations
- Prompt Leakage effect and mitigation strategies for multi-turn LLM ApplicationsIndustry8 citations
- Prospector: Improving LLM Agents with Self-Asking and Trajectory Rankingfinding8 citations
- README: Bridging Medical Jargon and Lay Understanding for Patient Education through Data-Centric NLPfinding8 citations
- Ranking Manipulation for Conversational Search EnginesMain8 citations
- Reconfidencing LLMs from the Grouping Loss Perspectivefinding8 citations
- Related Work and Citation Text Generation: A SurveyMain8 citations
- SWAG: Storytelling With Action Guidancefinding8 citations
- Self-training Large Language Models through Knowledge Detectionfinding8 citations
- Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model TutorsMain8 citations
- Style-Specific Neurons for Steering LLMs in Text Style TransferMain8 citations
- Symbolic Working Memory Enhances Language Models for Complex Rule ApplicationMain8 citations
- TOOLVERIFIER: Generalization to New Tools via Self-Verificationfinding8 citations
- The Fall of ROME: Understanding the Collapse of LLMs in Model Editingfinding8 citations
- The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Modelsfinding8 citations
- Themis: A Reference-free NLG Evaluation Language Model with Flexibility and InterpretabilityMain8 citations
- TheoremLlama: Transforming General-Purpose LLMs into Lean4 ExpertsMain8 citations
- Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflectionfinding8 citations
- Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Modelsfinding8 citations
- VDebugger: Harnessing Execution Feedback for Debugging Visual Programsfinding8 citations
- VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbationfinding8 citations
- Virtual Context Enhancing Jailbreak Attacks with Special Token Injectionfinding8 citations
- What’s under the hood: Investigating Automatic Metrics on Meeting Summarizationfinding8 citations
- Working Memory Identifies Reasoning Limits in Language ModelsMain8 citations
- A Study of Implicit Ranking Unfairness in Large Language Modelsfinding7 citations
- AppBench: Planning of Multiple APIs from Various APPs for Complex User InstructionMain7 citations
- Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agentsfinding7 citations
- AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Modelsfinding7 citations
- Beyond Persuasion: Towards Conversational Recommender System with Credible Explanationsfinding7 citations
- Bridging Local Details and Global Context in Text-Attributed GraphsMain7 citations
- Can Automatic Metrics Assess High-Quality Translations?Main7 citations
- Change Is the Only Constant: Dynamic LLM Slicing based on Layer Redundancyfinding7 citations
- ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipelinefinding7 citations
- Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMsMain7 citations
- Community-Cross-Instruct: Unsupervised Instruction Generation for Aligning Large Language Models to Online CommunitiesMain7 citations
- Conditional and Modal Reasoning in Large Language ModelsMain7 citations
- Cultural Conditioning or Placebo? On the Effectiveness of Socio-Demographic PromptingMain7 citations
- D3CODE: Disentangling Disagreements in Data across Cultures on Offensiveness Detection and EvaluationMain7 citations
- DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language ModelsMain7 citations
- Encoding and Controlling Global Semantics for Long-form Video Question AnsweringMain7 citations
- Encourage or Inhibit Monosemanticity? Revisit Monosemanticity from a Feature Decorrelation PerspectiveMain7 citations
- Enhancing Advanced Visual Reasoning Ability of Large Language ModelsMain7 citations
- Evalverse: Unified and Accessible Library for Large Language Model EvaluationSystem Demonstrations7 citations
- Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question AnsweringMain7 citations
- From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data SynthesisMain7 citations
- GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity TheoryMain7 citations
- HoLLMwood: Unleashing the Creativity of Large Language Models in Screenwriting via Role Playingfinding7 citations
- How Reliable Are Automatic Evaluation Methods for Instruction-Tuned LLMs?finding7 citations
- How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning PerspectiveMain7 citations
- In-Context Former: Lightning-fast Compressing Context for Large Language Modelfinding7 citations
- Insights into LLM Long-Context Failures: When Transformers Know but Don’t Tellfinding7 citations
- KnowTuning: Knowledge-aware Fine-tuning for Large Language ModelsMain7 citations
- LARA: Linguistic-Adaptive Retrieval-Augmentation for Multi-Turn Intent ClassificationIndustry7 citations
- LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression ToolkitIndustry7 citations
- LaMDA: Large Model Fine-Tuning via Spectrally Decomposed Low-Dimensional Adaptationfinding7 citations
- Language Models are Surprisingly Fragile to Drug Names in Biomedical Benchmarksfinding7 citations
- Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical AssessmentMain7 citations
- Lifelong Knowledge Editing for LLMs with Retrieval-Augmented Continuous Prompt LearningMain7 citations
- LongGenBench: Long-context Generation Benchmarkfinding7 citations
- MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase UnderstandingMain7 citations
- Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language ModelsMain7 citations
- MoleculeQA: A Dataset to Evaluate Factual Accuracy in Molecular Comprehensionfinding7 citations
- Monotonic Paraphrasing Improves Generalization of Language Model Promptingfinding7 citations
- NormTab: Improving Symbolic Reasoning in LLMs Through Tabular Data Normalizationfinding7 citations
- On Evaluating Explanation Utility for Human-AI Decision Making in NLPfinding7 citations
- Outcome-Constrained Large Language Models for Countering Hate SpeechMain7 citations
- POSIX: A Prompt Sensitivity Index For Large Language Modelsfinding7 citations
- PRompt Optimization in Multi-Step Tasks (PROMST): Integrating Human Feedback and Heuristic-based SamplingMain7 citations
- PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systemsfinding7 citations
- Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model QuantizationMain7 citations
- Pretraining Data Detection for Large Language Models: A Divergence-based Calibration MethodMain7 citations
- ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Contextfinding7 citations
- Pruning Foundation Models for High Accuracy without Retrainingfinding7 citations
- RAG-Studio: Towards In-Domain Adaptation of Retrieval Augmented Generation Through Self-Alignmentfinding7 citations
- Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language ModelsMain7 citations
- Retrieval and Reasoning on KGs: Integrate Knowledge Graphs into Large Language Models for Complex Question Answeringfinding7 citations
- Revisiting Who’s Harry Potter: Towards Targeted Unlearning from a Causal Intervention PerspectiveMain7 citations
- SLM as Guardian: Pioneering AI Safety with Small Language ModelIndustry7 citations
- Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and ActivationsMain7 citations
- ScaleLLM: A Resource-Frugal LLM Serving Framework by Optimizing End-to-End EfficiencyIndustry7 citations
- ShadowLLM: Predictor-based Contextual Sparsity for Large Language ModelsMain7 citations
- ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language ModelsMain7 citations
- UniMEEC: Towards Unified Multimodal Emotion Recognition and Emotion Causefinding7 citations
- Unified Active Retrieval for Retrieval Augmented Generationfinding7 citations
- Unleashing Large Language Models’ Proficiency in Zero-shot Essay Scoringfinding7 citations
- VGBench: Evaluating Large Language Models on Vector Graphics Understanding and GenerationMain7 citations
- What the Harm? Quantifying the Tangible Impact of Gender Bias in Machine Translation with a Human-centered StudyMain7 citations
- When Raw Data Prevails: Are Large Language Model Embeddings Effective in Numerical Data Representation for Medical Machine Learning Applications?finding7 citations
- XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inferencefinding7 citations
- “A good pun is its own reword”: Can Large Language Models Understand Puns?Main7 citations
- A Survey on Natural Language Counterfactual Generationfinding6 citations
- ATM: Adversarial Tuning Multi-agent System Makes a Robust Retrieval-Augmented GeneratorMain6 citations
- Advancing Large Language Model Attribution through Self-ImprovingMain6 citations
- Advancing Process Verification for Large Language Models via Tree-Based Preference LearningMain6 citations
- AnaloBench: Benchmarking the Identification of Abstract and Long-context AnalogiesMain6 citations
- AnyTrans: Translate AnyText in the Image with Large Scale Modelsfinding6 citations
- Assistive Large Language Model Agents for Socially-Aware Negotiation Dialoguesfinding6 citations
- Bayesian Example Selection Improves In-Context Learning for Speech, Text and Visual ModalitiesMain6 citations
- Beyond Lines and Circles: Unveiling the Geometric Reasoning Gap in Large Language Modelsfinding6 citations
- Boosting Large Language Models with Continual Learning for Aspect-based Sentiment Analysisfinding6 citations
- Breaking the Ceiling of the LLM Community by Treating Token Generation as a Classification for Ensemblingfinding6 citations
- C-LLM: Learn to Check Chinese Spelling Errors Character by CharacterMain6 citations
- Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?Main6 citations
- CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question AnsweringMain6 citations
- Code Membership Inference for Detecting Unauthorized Data Use in Code Pre-trained Language Modelsfinding6 citations
- Code Representation Pre-training with Complements from Program ExecutionsIndustry6 citations
- Concept-skill Transferability-based Data Selection for Large Vision-Language ModelsMain6 citations
- Consolidating Ranking and Relevance Predictions of Large Language Models through Post-ProcessingMain6 citations
- CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model GenerationMain6 citations
- Data Contamination Can Cross Language BarriersMain6 citations
- Data, Data Everywhere: A Guide for Pretraining Dataset ConstructionMain6 citations
- Defining Knowledge: Bridging Epistemology and Large Language ModelsMain6 citations
- Devil’s Advocate: Anticipatory Reflection for LLM Agentsfinding6 citations
- DiVERT: Distractor Generation with Variational Errors Represented as Text for Math Multiple-choice QuestionsMain6 citations
- Divine LLaMAs: Bias, Stereotypes, Stigmatization, and Emotion Representation of Religion in Large Language Modelsfinding6 citations
- Do We Need Language-Specific Fact-Checking Models? The Case of ChineseMain6 citations
- Don’t Forget Your Reward Values: Language Model Alignment via Value-based CalibrationMain6 citations
- Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Modelsfinding6 citations
- Empowering Multi-step Reasoning across Languages via Program-Aided Language ModelsMain6 citations
- FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy DistillationMain6 citations
- Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?Main6 citations
- Fine-grained Pluggable Gradient Ascent for Knowledge Unlearning in Language ModelsMain6 citations
- FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language ModelsSystem Demonstrations6 citations
- From RAG to Riches: Retrieval Interlaced with Sequence GenerationMain6 citations
- GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-ExplanationMain6 citations
- Generalized Measures of Anticipation and Responsivity in Online Language Processingfinding6 citations
- Granular Privacy Control for Geolocation with Vision Language ModelsMain6 citations
- Hate Personified: Investigating the role of LLMs in content moderationMain6 citations
- Holistic Evaluation for Interleaved Text-and-Image GenerationMain6 citations
- How You Prompt Matters! Even Task-Oriented Constraints in Instructions Affect LLM-Generated Text Detectionfinding6 citations
- I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated ResponsesMain6 citations
- Inference-Time Language Model Alignment via Integrated Value Guidancefinding6 citations
- Instruction Matters: A Simple yet Effective Task Selection for Optimized Instruction Tuning of Specific TasksMain6 citations
- IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commercefinding6 citations
- KidLM: Advancing Language Models for Children – Early Insights and Future DirectionsMain6 citations
- Let Me Speak Freely? A Study On The Impact Of Format Restrictions On Large Language Model Performance.Industry6 citations
- M2QA: Multi-domain Multilingual Question Answeringfinding6 citations
- MATE: Meet At The Embedding - Connecting Images with Long Textsfinding6 citations
- Mechanistic Understanding and Mitigation of Language Model Non-Factual Hallucinationsfinding6 citations
- Memorize Step by Step: Efficient Long-Context Prefilling with Incremental Memory and Decremental ChunkMain6 citations
- Mitigating Open-Vocabulary Caption HallucinationsMain6 citations
- Mitigating the Language Mismatch and Repetition Issues in LLM-based Machine Translation via Model EditingMain6 citations
- MobileQuant: Mobile-friendly Quantization for On-device Language Modelsfinding6 citations
- MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical ReasoningMain6 citations
- Multi-dimensional Evaluation of Empathetic Dialogue Responsesfinding6 citations
- Multi-expert Prompting Improves Reliability, Safety and Usefulness of Large Language ModelsMain6 citations
- No Culture Left Behind: ArtELingo-28, a Benchmark of WikiArt with Captions in 28 LanguagesMain6 citations
- Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model AlignmentMain6 citations
- On the Role of Context in Reading Time PredictionMain6 citations
- On the Similarity of Circuits across Languages: a Case Study on the Subject-verb Agreement Taskfinding6 citations
- Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative DecodingMain6 citations
- PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomesfinding6 citations
- PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization EvaluationMain6 citations
- Python is Not Always the Best Choice: Embracing Multilingual Program of ThoughtsMain6 citations
- Quantifying Generative Media Bias with a Corpus of Real-world and Generated News Articlesfinding6 citations
- RE-RAG: Improving Open-Domain QA Performance and Interpretability with Relevance Estimator in Retrieval-Augmented GenerationMain6 citations
- Re-ReST: Reflection-Reinforced Self-Training for Language AgentsMain6 citations
- Scaling Laws for Linear Complexity Language ModelsMain6 citations
- Sonnet or Not, Bot? Poetry Evaluation for Large Models and Datasetsfinding6 citations
- StraGo: Harnessing Strategic Guidance for Prompt Optimizationfinding6 citations
- Structure Guided Prompt: Instructing Large Language Model in Multi-Step Reasoning by Exploring Graph Structure of the TextMain6 citations
- Surveying the Dead Minds: Historical-Psychological Text Analysis with Contextualized Construct Representation (CCR) for Classical ChineseMain6 citations
- SynthesizRR: Generating Diverse Datasets with Retrieval AugmentationMain6 citations
- Towards Cross-Cultural Machine Translation with Retrieval-Augmented Generation from Multilingual Knowledge GraphsMain6 citations
- Towards Robust Speech Representation Learning for Thousands of LanguagesMain6 citations
- UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and GenerationMain6 citations
- Vanessa: Visual Connotation and Aesthetic Attributes Understanding Network for Multimodal Aspect-based Sentiment Analysisfinding6 citations
- WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language ModelsSystem Demonstrations6 citations
- Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language ModelsMain6 citations
- mABC: Multi-Agent Blockchain-inspired Collaboration for Root Cause Analysis in Micro-Services Architecturefinding6 citations
- sign.mt: Real-Time Multilingual Sign Language Translation ApplicationSystem Demonstrations6 citations
- Adaptive Contrastive Decoding in Retrieval-Augmented Generation for Handling Noisy Contextsfinding5 citations
- Adversarial Math Word Problem Generationfinding5 citations
- Are LLMs Good Annotators for Discourse-level Event Relation Extraction?finding5 citations
- ArxivDIGESTables: Synthesizing Scientific Literature into Tables using Language ModelsMain5 citations
- Ask the experts: sourcing a high-quality nutrition counseling dataset through Human-AI collaborationfinding5 citations
- Augmenting Black-box LLMs with Medical Textbooks for Biomedical Question Answeringfinding5 citations
- Bayesian Calibration of Win Rate Estimation with LLM EvaluatorsMain5 citations
- BiasDora: Exploring Hidden Biased Associations in Vision-Language Modelsfinding5 citations
- Boosting Scientific Concepts Understanding: Can Analogy from Teacher Models Empower Student Models?Main5 citations
- CLEAR: Can Language Models Really Understand Causal Graphs?finding5 citations
- ClaimVer: Explainable Claim-Level Verification and Evidence Attribution of Text Through Knowledge Graphsfinding5 citations
- CoEvol: Constructing Better Responses for Instruction Finetuning through Multi-Agent CooperationMain5 citations
- Course-Correction: Safety Alignment Using Synthetic PreferencesIndustry5 citations
- Crafting Personalized Agents through Retrieval-Augmented Generation on Editable Memory GraphsMain5 citations
- DYNAMICQA: Tracing Internal Knowledge Conflicts in Language Modelsfinding5 citations
- DataNarrative: Automated Data-Driven Storytelling with Visualizations and TextsMain5 citations
- Dissecting Fine-Tuning Unlearning in Large Language ModelsMain5 citations
- Do LLMs Overcome Shortcut Learning? An Evaluation of Shortcut Challenges in Large Language ModelsMain5 citations
- Document-level Causal Relation Extraction with Knowledge-guided Binary Question Answeringfinding5 citations
- DogeRM: Equipping Reward Models with Domain Knowledge through Model MergingMain5 citations
- EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech ModelsMain5 citations
- Evaluating Diversity in Automatic Poetry GenerationMain5 citations
- Exploring Hint Generation Approaches for Open-Domain Question Answeringfinding5 citations
- Exploring the Best Practices of Query Expansion with Large Language Modelsfinding5 citations
- Fine-Tuning Large Language Models for Stock Return Prediction Using NewsflowIndustry5 citations
- Grasping the Essentials: Tailoring Large Language Models for Zero-Shot Relation ExtractionMain5 citations
- HEART-felt Narratives: Tracing Empathy and Narrative Style in Personal Stories with LLMsMain5 citations
- HiFT: A Hierarchical Full Parameter Fine-Tuning StrategyMain5 citations
- How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?Main5 citations
- HyperBERT: Mixing Hypergraph-Aware Layers with Language Models for Node Classification on Text-Attributed Hypergraphsfinding5 citations
- Improve Dense Passage Retrieval with Entailment TuningMain5 citations
- Improving Demonstration Diversity by Human-Free Fusing for Text-to-SQLfinding5 citations
- Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learningfinding5 citations
- Improving Minimum Bayes Risk Decoding with Multi-PromptMain5 citations
- Instruction Fine-Tuning: Does Prompt Loss Matter?Main5 citations
- Investigating Mysteries of CoT-Augmented DistillationMain5 citations
- LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraintsfinding5 citations
- LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational HistoryMain5 citations
- Learning Musical Representations for Music Performance Question Answeringfinding5 citations
- Learning Personalized Alignment for Evaluating Open-ended Text GenerationMain5 citations
- Learning to Retrieve Iteratively for In-Context LearningMain5 citations
- MATHWELL: Generating Educational Math Word Problems Using Teacher Annotationsfinding5 citations
- MORL-Prompt: An Empirical Analysis of Multi-Objective Reinforcement Learning for Discrete Prompt Optimizationfinding5 citations
- Make Large Language Model a Better Rankerfinding5 citations
- Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decodingfinding5 citations
- Mixed Distillation Helps Smaller Language Models Reason Betterfinding5 citations
- Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of ModulesMain5 citations
- On Fake News Detection with LLM Enhanced Semantics MiningMain5 citations
- On the token distance modeling ability of higher RoPE attention dimensionfinding5 citations
- Optimizing Code Retrieval: High-Quality and Scalable Dataset Annotation through Large Language ModelsMain5 citations
- PPTC-R benchmark: Towards Evaluating the Robustness of Large Language Models for PowerPoint Task Completionfinding5 citations
- Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image GenerationMain5 citations
- Preserving Generalization of Language models in Few-shot Continual Relation ExtractionMain5 citations
- RAG-HAT: A Hallucination-Aware Tuning Pipeline for LLM in Retrieval-Augmented GenerationIndustry5 citations
- Re-Invoke: Tool Invocation Rewriting for Zero-Shot Tool Retrievalfinding5 citations
- Retrieved In-Context Principles from Previous MistakesMain5 citations
- Revisiting Automated Evaluation for Long-form Table Question AnsweringMain5 citations
- SEEKR: Selective Attention-Guided Knowledge Retention for Continual Learning of Large Language ModelsMain5 citations
- SEER: Self-Aligned Evidence Extraction for Retrieval-Augmented GenerationMain5 citations
- STORYSUMM: Evaluating Faithfulness in Story SummarizationMain5 citations
- SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic GradingMain5 citations
- Self-Recognition in Language Modelsfinding5 citations
- Sprout: Green Generative AI with Carbon-Efficient LLM InferenceMain5 citations
- StablePrompt : Automatic Prompt Tuning using Reinforcement Learning for Large Language ModelMain5 citations
- Structured Chain-of-Thought Prompting for Few-Shot Generation of Content-Grounded QA Conversationsfinding5 citations
- Style-Compress: An LLM-Based Prompt Compression Framework Considering Task-Specific Stylesfinding5 citations
- Synthetic Multimodal Question Generationfinding5 citations
- T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient EmbeddingsMain5 citations
- The Base-Rate Effect on LLM Benchmark Performance: Disambiguating Test-Taking Strategies from Benchmark Performancefinding5 citations
- The Instinctive Bias: Spurious Images lead to Illusion in MLLMsMain5 citations
- The LLM Effect: Are Humans Truly Using LLMs, or Are They Being Influenced By Them Instead?Main5 citations
- Towards More Robust NLP System Evaluation: Handling Missing Scores in Benchmarksfinding5 citations
- TriageAgent: Towards Better Multi-Agents Collaborations for Large Language Model-Based Clinical Triagefinding5 citations
- TroL: Traversal of Layers for Large Language and Vision ModelsMain5 citations
- VIMI: Grounding Video Generation through Multi-modal InstructionMain5 citations
- VIVA: A Benchmark for Vision-Grounded Decision-Making with Human ValuesMain5 citations
- Vision-Language Model Fine-Tuning via Simple Parameter-Efficient ModificationMain5 citations
- Voices Unheard: NLP Resources and Models for Yorùbá Regional DialectsMain5 citations
- WebOlympus: An Open Platform for Web Agents on Live WebsitesSystem Demonstrations5 citations
- When Parts Are Greater Than Sums: Individual LLM Components Can Outperform Full ModelsMain5 citations
- Women Are Beautiful, Men Are Leaders: Gender Stereotypes in Machine Translation and Language Modelingfinding5 citations
- xTower: A Multilingual LLM for Explaining and Correcting Translation Errorsfinding5 citations
- 1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?Main4 citations
- A Simple yet Effective Training-free Prompt-free Approach to Chinese Spelling Correction Based on Large Language ModelsMain4 citations
- A Usage-centric Take on Intent Understanding in E-CommerceMain4 citations
- ABSEval: An Agent-based Framework for Script EvaluationMain4 citations
- APPLS: Evaluating Evaluation Metrics for Plain Language SummarizationMain4 citations
- AUTOGEN STUDIO: A No-Code Developer Tool for Building and Debugging Multi-Agent SystemsSystem Demonstrations4 citations
- Ada-Instruct: Adapting Instruction Generators for Complex Reasoningfinding4 citations
- Adaption-of-Thought: Learning Question Difficulty Improves Large Language Models for ReasoningMain4 citations
- Adaptive Question Answering: Enhancing Language Model Proficiency for Addressing Knowledge Conflicts with Source CitationsMain4 citations
- Altogether: Image Captioning via Re-aligning Alt-textMain4 citations
- An Audit on the Perspectives and Challenges of Hallucinations in NLPMain4 citations
- Annotation alignment: Comparing LLM and human annotations of conversational safetyMain4 citations
- Attribute or Abstain: Large Language Models as Long Document AssistantsMain4 citations
- Better Alignment with Instruction Back-and-Forth Translationfinding4 citations
- Breaking Language Barriers: Cross-Lingual Continual Pre-Training at ScaleMain4 citations
- CELLO: Causal Evaluation of Large Vision-Language ModelsMain4 citations
- CUTE: Measuring LLMs’ Understanding of Their TokensMain4 citations
- Calibrating LLMs with Preference Optimization on Thought Trees for Generating Rationale in Science Question Scoringfinding4 citations
- Calibrating the Confidence of Large Language Models by Eliciting FidelityMain4 citations
- Can LLMs Learn Uncertainty on Their Own? Expressing Uncertainty Effectively in A Self-Training MannerMain4 citations
- Can we teach language models to gloss endangered languages?finding4 citations
- Characterizing LLM Abstention Behavior in Science QA with Context Perturbationsfinding4 citations
- CoBa: Convergence Balancer for Multitask Finetuning of Large Language ModelsMain4 citations
- CodeAgent: Autonomous Communicative Agents for Code ReviewMain4 citations
- Collective Critics for Creative Story GenerationMain4 citations
- Connecting the Dots: Evaluating Abstract Reasoning Capabilities of LLMs Using the New York Times Connections Word GameMain4 citations
- Context Matters: Pushing the Boundaries of Open-Ended Answer Generation with Graph-Structured Knowledge ContextIndustry4 citations
- Context-aware Watermark with Semantic Balanced Green-red Lists for Large Language ModelsMain4 citations
- Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language GenerationMain4 citations
- ConvKGYarn: Spinning Configurable and Scalable Conversational Knowledge Graph QA Datasets with Large Language ModelsIndustry4 citations
- Cross-Domain Audio Deepfake Detection: Dataset and AnalysisMain4 citations
- DA-Code: Agent Data Science Code Generation Benchmark for Large Language ModelsMain4 citations
- Distractor Generation in Multiple-Choice Tasks: A Survey of Methods, Datasets, and EvaluationMain4 citations
- Does Large Language Model Contain Task-Specific Neurons?Main4 citations
- Don’t Just Say “I don’t know”! Self-aligning Large Language Models for Responding to Unknown Questions with ExplanationsMain4 citations
- EFUF: Efficient Fine-Grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language ModelsMain4 citations
- Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding BridgeMain4 citations
- Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware TrainingMain4 citations
- Enhancing Agent Learning through World Dynamics Modelingfinding4 citations
- Enhancing Alignment using Curriculum Learning & Ranked Preferencesfinding4 citations
- Enhancing High-order Interaction Awareness in LLM-based Recommender ModelMain4 citations
- EvoR: Evolving Retrieval for Code Generationfinding4 citations
- Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but InconsistentlyMain4 citations
- Exploring Design Choices for Building Language-Specific LLMsfinding4 citations
- Eyes Don’t Lie: Subjective Hate Annotation and Detection with GazeMain4 citations
- Fine-Grained Prediction of Reading Comprehension from Eye MovementsMain4 citations
- Fine-tuning Smaller Language Models for Question Answering over Financial Documentsfinding4 citations
- Focused Large Language Models are Stable Many-Shot LearnersMain4 citations
- From Generation to Selection: Findings of Converting Analogical Problem-Solving into Multiple-Choice Questionsfinding4 citations
- From Insights to Actions: The Impact of Interpretability and Analysis Research on NLPMain4 citations
- Game on Tree: Visual Hallucination Mitigation via Coarse-to-Fine View Tree and Game TheoryMain4 citations
- Generating Media Background Checks for Automated Source Critical Reasoningfinding4 citations
- Geneverse: A Collection of Open-source Multimodal Large Language Models for Genomic and Proteomic Researchfinding4 citations
- Getting More from Less: Large Language Models are Good Spontaneous Multilingual LearnersMain4 citations
- Glue pizza and eat rocks - Exploiting Vulnerabilities in Retrieval-Augmented Generative ModelsMain4 citations
- Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn InteractionMain4 citations
- How Do Humans Write Code? Large Models Do It the Same Way TooMain4 citations
- How Personality Traits Influence Negotiation Outcomes? A Simulation based on Large Language Modelsfinding4 citations
- IDEAW: Robust Neural Audio Watermarking with Invertible Dual-EmbeddingMain4 citations
- Implicit Personalization in Language Models: A Systematic Studyfinding4 citations
- Improve Student’s Reasoning Generalizability through Cascading Decomposed CoTs DistillationMain4 citations
- InfiniPot: Infinite Context Processing on Memory-Constrained LLMsMain4 citations
- Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Datafinding4 citations
- Investigating LLMs as Voting Assistants via Contextual Augmentation: A Case Study on the European Parliament Elections 2024Main4 citations
- Is C4 Dataset Optimal for Pruning? An Investigation of Calibration Data for LLM PruningMain4 citations
- Jailbreaking LLMs with Arabic Transliteration and ArabiziMain4 citations
- Knowledge Planning in Large Language Models for Domain-Aligned Counseling SummarizationMain4 citations
- LLM Tropes: Revealing Fine-Grained Values and Opinions in Large Language Modelsfinding4 citations
- LLM-Based Multi-Hop Question Answering with Knowledge Graph Integration in Evolving Environmentsfinding4 citations
- LOCR: Location-Guided Transformer for Optical Character Recognitionfinding4 citations
- Large Language Models are Students at Various Levels: Zero-shot Question Difficulty Estimationfinding4 citations
- Layer-wise Importance Matters: Less Memory for Better Performance in Parameter-efficient Fine-tuning of Large Language Modelsfinding4 citations
- Learning from Natural Language Explanations for Generalizable Entity MatchingMain4 citations
- Less is More: Making Smaller Language Models Competent Subgraph Retrievers for Multi-hop KGQAfinding4 citations
- MACAROON: Training Vision-Language Models To Be Your Engaged Partnersfinding4 citations
- MAIR: A Massive Benchmark for Evaluating Instructed RetrievalMain4 citations
- MINERS: Multilingual Language Models as Semantic Retrieversfinding4 citations
- MUSCLE: A Model Update Strategy for Compatible LLM Evolutionfinding4 citations
- MemeCLIP: Leveraging CLIP Representations for Multimodal Meme ClassificationMain4 citations
- MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuningfinding4 citations
- MiniConGTS: A Near Ultimate Minimalist Contrastive Grid Tagging Scheme for Aspect Sentiment Triplet ExtractionMain4 citations
- MoE-I2: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decompositionfinding4 citations
- Modeling Gender and Dialect Bias in Automatic Speech Recognitionfinding4 citations
- Modeling Human Subjectivity in LLMs Using Explicit and Implicit Human Factors in Personasfinding4 citations
- More Than Catastrophic Forgetting: Integrating General Capabilities For Domain-Specific LLMsMain4 citations
- Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data AnnotationMain4 citations
- Multi-Stage Balanced Distillation: Addressing Long-Tail Challenges in Sequence-Level Knowledge Distillationfinding4 citations
- On Sensitivity of Learning with Limited Labelled Data to the Effects of Randomness: Impact of Interactions and Systematic ChoicesMain4 citations
- On Training Data Influence of GPT ModelsMain4 citations
- On the Relationship between Truth and Political Bias in Language ModelsMain4 citations
- OneGen: Efficient One-Pass Unified Generation and Retrieval for LLMsfinding4 citations
- OpenOmni: A Collaborative Open Source Tool for Building Future-Ready Multimodal Conversational AgentsSystem Demonstrations4 citations
- Paraphrase Types Elicit Prompt Engineering CapabilitiesMain4 citations
- Position Engineering: Boosting Large Language Models through Positional Information ManipulationMain4 citations
- Prompts have evil twinsMain4 citations
- PropTest: Automatic Property Testing for Improved Visual Programmingfinding4 citations
- R2AG: Incorporating Retrieval Information into Retrieval Augmented Generationfinding4 citations
- R3-NL2GQL: A Model Coordination and Knowledge Graph Alignment Approach for NL2GQLfinding4 citations
- Rationale-Aware Answer Verification by Pairwise Self-EvaluationMain4 citations
- Recurrent Alignment with Hard Attention for Hierarchical Text RatingMain4 citations
- Rethinking the Reversal Curse of LLMs: a Prescription from Human Knowledge ReversalMain4 citations
- Retrieving, Rethinking and Revising: The Chain-of-Verification Can Improve Retrieval Augmented Generationfinding4 citations
- Robust AI-Generated Text Detection by Restricted Embeddingsfinding4 citations
- Robust Text Classification: Analyzing Prototype-Based Networksfinding4 citations
- SH2: Self-Highlighted Hesitation Helps You Decode More Truthfullyfinding4 citations
- SPINACH: SPARQL-Based Information Navigation for Challenging Real-World Questionsfinding4 citations
- STARD: A Chinese Statute Retrieval Dataset Derived from Real-life Queries by Non-professionalsfinding4 citations
- SYNFAC-EDIT: Synthetic Imitation Edit Feedback for Factual Alignment in Clinical SummarizationMain4 citations
- Scalable Data Ablation Approximations for Language Models through Modular Training and MergingMain4 citations
- SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generationfinding4 citations
- SecureSQL: Evaluating Data Leakage of Large Language Models as Natural Language Interfaces to Databasesfinding4 citations
- SignCLIP: Connecting Text and Sign Language by Contrastive LearningMain4 citations
- Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMsfinding4 citations
- Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?finding4 citations
- StablePT : Towards Stable Prompting for Few-shot Learning via Input Separationfinding4 citations
- Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?Main4 citations
- Strength Lies in Differences! Improving Strategy Planning for Non-collaborative Dialogues via Diversified User SimulationMain4 citations
- Symbolic Prompt Program Search: A Structure-Aware Approach to Efficient Compile-Time Prompt Optimizationfinding4 citations
- SynTQA: Synergistic Table-based Question Answering via Mixture of Text-to-SQL and E2E TQAfinding4 citations
- TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Modelsfinding4 citations
- Targeted Multilingual Adaptation for Low-resource Language Familiesfinding4 citations
- Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech RecognitionMain4 citations
- Task Oriented In-Domain Data AugmentationMain4 citations
- Teaching LLMs to Abstain across Languages via Multilingual FeedbackMain4 citations
- The Factuality Tax of Diversity-Intervened Text-to-Image Generation: Benchmark and Fact-Augmented InterventionMain4 citations
- The Odyssey of Commonsense Causality: From Foundational Benchmarks to Cutting-Edge ReasoningMain4 citations
- TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token MergingMain4 citations
- To the Globe (TTG): Towards Language-Driven Guaranteed Travel PlanningSystem Demonstrations4 citations
- Topic Modeling: Contextual Token Embeddings Are All You Needfinding4 citations
- Tracking the perspectives of interacting language modelsMain4 citations
- TraveLER: A Modular Multi-LMM Agent Framework for Video Question-AnsweringMain4 citations
- Understanding the Therapeutic Relationship between Counselors and Clients in Online Text-based Counseling using LLMsfinding4 citations
- Unlocking the Potential of Model Merging for Low-Resource Languagesfinding4 citations
- Unraveling the Truth: Do VLMs really Understand Charts? A Deep Dive into Consistency and Robustnessfinding4 citations
- Unveiling the Lexical Sensitivity of LLMs: Combinatorial Optimization for Prompt EnhancementMain4 citations
- Verifiable, Debuggable, and Repairable Commonsense Logical Reasoning via LLM-based Theory ResolutionMain4 citations
- What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Modelsfinding4 citations
- Why do LLaVA Vision-Language Models Reply to Images in English?finding4 citations
- Word Alignment as Preference for Machine TranslationMain4 citations
- World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and FilteringMain4 citations
- WorryWords: Norms of Anxiety Association for over 44k English WordsMain4 citations
- XplainLLM: A Knowledge-Augmented Dataset for Reliable Grounded Explanations in LLMsMain4 citations
- “Flex Tape Can’t Fix That”: Bias and Misinformation in Edited Language ModelsMain4 citations
- “Seeing the Big through the Small”: Can LLMs Approximate Human Judgment Distributions on NLI from a Few Explanations?finding4 citations
- “We Demand Justice!”: Towards Social Context Grounding of Political TextsMain4 citations
- A Generic Method for Fine-grained Category Discovery in Natural Language TextsMain3 citations
- A SMART Mnemonic Sounds like “Glue Tonic”: Mixing LLMs with Student Feedback to Make Mnemonic Learning StickMain3 citations
- A Survey on Open Information Extraction from Rule-based Model to Large Language Modelfinding3 citations
- ACE: A LLM-based Negotiation Coaching SystemMain3 citations
- AMPO: Automatic Multi-Branched Prompt OptimizationMain3 citations
- ARM: An Alignment-and-Replacement Module for Chinese Spelling Check Based on LLMsMain3 citations
- ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household ActivitiesMain3 citations
- Activation Scaling for Steering and Interpreting Language Modelsfinding3 citations
- Advancing Adversarial Suffix Transfer Learning on Aligned Large Language ModelsMain3 citations
- AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentationfinding3 citations
- Aligning Large Language Models with Diverse Political ViewpointsMain3 citations
- Alignment-Enhanced Decoding: Defending Jailbreaks via Token-Level Adaptive Refining of Probability DistributionsMain3 citations
- AlphaLoRA: Assigning LoRA Experts Based on Layer Training QualityMain3 citations
- An Electoral Approach to Diversify LLM-based Multi-Agent Collective Decision-MakingMain3 citations
- An Unsupervised Approach to Achieve Supervised-Level Explainability in Healthcare RecordsMain3 citations
- Atomic Inference for NLI with Generated Facts as AtomsMain3 citations
- Atomic Self-Consistency for Better Long Form GenerationsMain3 citations
- Attribute Diversity Determines the Systematicity Gap in VQAMain3 citations
- AuriSRec: Adversarial User Intention Learning in Sequential Recommendationfinding3 citations
- AutoScraper: A Progressive Understanding Web Agent for Web Scraper GenerationMain3 citations
- BPO: Staying Close to the Behavior LLM Creates Better Online LLM AlignmentMain3 citations
- BaitAttack: Alleviating Intention Shift in Jailbreak Attacks via Adaptive Bait CraftingMain3 citations
- Better Call SAUL: Fluent and Consistent Language Model Editing with Generation Regularizationfinding3 citations
- Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Modelsfinding3 citations
- Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIPfinding3 citations
- Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metricfinding3 citations
- Can Large Language Models Grasp Legal Theories? Enhance Legal Reasoning with Insights from Multi-Agent Collaborationfinding3 citations
- Can Large Language Models Learn Independent Causal Mechanisms?Main3 citations
- Can Machine Unlearning Reduce Social Bias in Language Models?Industry3 citations
- Can Transformers Learn n-gram Language Models?Main3 citations
- Can We Trust the Performance Evaluation of Uncertainty Estimation Methods in Text Summarization?Main3 citations
- CantTalkAboutThis: Aligning Language Models to Stay on Topic in Dialoguesfinding3 citations
- Can’t Remember Details in Long Documents? You Need Some R&Rfinding3 citations
- Casablanca: Data and Models for Multidialectal Arabic Speech RecognitionMain3 citations
- ClimRetrieve: A Benchmarking Dataset for Information Retrieval from Corporate Climate DisclosuresMain3 citations
- Collaborative Performance Prediction for Large Language ModelsMain3 citations
- Consecutive Batch Model Editing with HooK LayersMain3 citations
- Consistent Autoformalization for Constructing Mathematical LibrariesMain3 citations
- Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashionMain3 citations
- Cost-Efficient Subjective Task Annotation and Modeling through Few-Shot Annotator Adaptationfinding3 citations
- Decoding Matters: Addressing Amplification Bias and Homogeneity Issue in Recommendations for Large Language ModelsMain3 citations
- Decompose and Compare Consistency: Measuring VLMs’ Answer Reliability via Task-Decomposition Consistency ComparisonMain3 citations
- Detecting Subtle Differences between Human and Model Languages Using Spectrum of Relative LikelihoodMain3 citations
- DictDis: Dictionary Constrained Disambiguation for Improved NMTfinding3 citations
- Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planningfinding3 citations
- DocCGen: Document-based Controlled Code GenerationMain3 citations
- ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital EnvironmentsMain3 citations
- ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized TransformersMain3 citations
- EVEDIT: Event-based Knowledge Editing for Deterministic Knowledge PropagationMain3 citations
- Efficient Answer Retrieval System (EARS): Combining Local DB Search and Web Search for Generative QAIndustry3 citations
- Enabling Discriminative Reasoning in LLMs for Legal Judgment Predictionfinding3 citations
- Enhancing Language Model Factuality via Activation-Based Confidence Calibration and Guided DecodingMain3 citations
- Enhancing Post-Hoc Attributions in Long Document Comprehension via Coarse Grained Answer DecompositionMain3 citations
- Enhancing Temporal Sensitivity and Reasoning for Time-Sensitive Question Answeringfinding3 citations
- Evaluating Differentially Private Synthetic Data Generation in High-Stakes Domainsfinding3 citations
- Evidence Retrieval for Fact Verification using Multi-stage Rerankingfinding3 citations
- Experience as Source for Anticipation and Planning: Experiential Policy Learning for Target-driven Recommendation Dialoguesfinding3 citations
- Explaining Graph Neural Networks with Large Language Models: A Counterfactual Perspective on Molecule Graphsfinding3 citations
- Explaining and Improving Contrastive Decoding by Extrapolating the Probabilities of a Huge and Hypothetical LMMain3 citations
- Exploring Multilingual Concepts of Human Values in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?finding3 citations
- Exploring the Practicality of Generative Retrieval on Dynamic CorporaMain3 citations
- FastMem: Fast Memorization of Prompt Improves Context Awareness of Large Language Modelsfinding3 citations
- Fighting Randomness with Randomness: Mitigating Optimisation Instability of Fine-Tuning using Delayed Ensemble and Noisy Interpolationfinding3 citations
- Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language ModelsMain3 citations
- From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption EnrichmentMain3 citations
- From LLMs to MLLMs: Exploring the Landscape of Multimodal JailbreakingMain3 citations
- From Reading to Compressing: Exploring the Multi-document Reader for Prompt Compressionfinding3 citations
- Granularity is crucial when applying differential privacy to text: An investigation for neural machine translationfinding3 citations
- Greenback Bears and Fiscal Hawks: Finance is a Jungle and Text Embeddings Must AdaptIndustry3 citations
- HalluMeasure: Fine-grained Hallucination Measurement Using Chain-of-Thought ReasoningMain3 citations
- Householder Pseudo-Rotation: A Novel Approach to Activation Editing in LLMs with Direction-Magnitude PerspectiveMain3 citations
- How Do Your Code LLMs perform? Empowering Code Instruction Tuning with Really Good DataMain3 citations
- IPL: Leveraging Multimodal Large Language Models for Intelligent Product ListingIndustry3 citations
- In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Modelsfinding3 citations
- Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation TasksMain3 citations
- Is Safer Better? The Impact of Guardrails on the Argumentative Strength of LLMs in Hate Speech CounteringMain3 citations
- KB-Plugin: A Plug-and-play Framework for Large Language Models to Induce Programs over Low-resourced Knowledge BasesMain3 citations
- Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative FrameworkSystem Demonstrations3 citations
- Knowledge Navigator: LLM-guided Browsing Framework for Exploratory Search in Scientific Literaturefinding3 citations
- Knowledge-Aware Reasoning over Multimodal Semi-structured Tablesfinding3 citations
- KnowledgeSG: Privacy-Preserving Synthetic Text Generation with Knowledge Distillation from ServerMain3 citations
- LAMBDA: Large Language Model-Based Data Augmentation for Multi-Modal Machine Translationfinding3 citations
- LLM generated responses to mitigate the impact of hate speechfinding3 citations
- Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak AttacksMain3 citations
- Large Language Models Know What is Key Visual Entity: An LLM-assisted Multimodal Retrieval for VQAMain3 citations
- Lexically Grounded Subword SegmentationMain3 citations
- LinguAlchemy: Fusing Typological and Geographical Elements for Unseen Language Generalizationfinding3 citations
- Llamipa: An Incremental Discourse Parserfinding3 citations
- LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language ModelsMain3 citations
- MMTE: Corpus and Metrics for Evaluating Machine Translation Quality of Metaphorical LanguageMain3 citations
- MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-MakingMain3 citations
- MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression ComprehensionMain3 citations
- Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Modelsfinding3 citations
- Major Entity Identification: A Generalizable Alternative to Coreference ResolutionMain3 citations
- MathFish: Evaluating Language Model Math Reasoning via Grounding in Educational Curriculafinding3 citations
- MetaReflection: Learning Instructions for Language Agents using Past ReflectionsMain3 citations
- MiRAGeNews: Multimodal Realistic AI-Generated News Detectionfinding3 citations
- MisinfoEval: Generative AI in the Era of “Alternative Facts”Main3 citations
- Modeling Nonnative Sentence Processing with L2 Language ModelsMain3 citations
- Modeling User Preferences with Automatic Metrics: Creating a High-Quality Preference Dataset for Machine TranslationMain3 citations
- Multi-Level Information Retrieval Augmented Generation for Knowledge-based Visual Question AnsweringMain3 citations
- Multimodal Misinformation Detection by Learning from Synthetic Data with Multimodal LLMsfinding3 citations
- Narrative-of-Thought: Improving Temporal Reasoning of Large Language Models via Recounted Narrativesfinding3 citations
- Navigating the Shortcut Maze: A Comprehensive Analysis of Shortcut Learning in Text Classification by Language Modelsfinding3 citations
- Nearest Neighbor Normalization Improves Multimodal RetrievalMain3 citations
- Not (yet) the whole story: Evaluating Visual Storytelling Requires More than Measuring Coherence, Grounding, and Repetitionfinding3 citations
- Not All Preference Pairs Are Created Equal: A Recipe for Annotation-Efficient Iterative Preference Learningfinding3 citations
- Null-Shot Prompting: Rethinking Prompting Large Language Models With HallucinationMain3 citations
- On the Robustness of Editing Large Language ModelsMain3 citations
- One Model is All You Need: ByT5-Sanskrit, a Unified Model for Sanskrit NLP Tasksfinding3 citations
- OpenResearcher: Unleashing AI for Accelerated Scientific ResearchSystem Demonstrations3 citations
- Optimizing Language Models with Fair and Stable Reward Composition in Reinforcement LearningMain3 citations
- PREDICT: Multi-Agent-based Debate Simulation for Generalized Hate Speech DetectionMain3 citations
- PURE: Aligning LLM via Pluggable Query Reformulation for Enhanced Helpfulnessfinding3 citations
- PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Modelsfinding3 citations
- PairDistill: Pairwise Relevance Distillation for Dense RetrievalMain3 citations
- Plausibly Problematic Questions in Multiple-Choice Benchmarks for Commonsense Reasoningfinding3 citations
- Pragmatic Norms Are All You Need – Why The Symbol Grounding Problem Does Not Apply to LLMsMain3 citations
- Pretraining Language Models Using TranslationeseMain3 citations
- Private prediction for large-scale synthetic text generationfinding3 citations
- Promoting Data and Model Privacy in Federated Learning through Quantized LoRAfinding3 citations
- QPaug: Question and Passage Augmentation for Open-Domain Question Answering of LLMsfinding3 citations
- QUDSELECT: Selective Decoding for Questions Under Discussion ParsingMain3 citations
- Question-guided Knowledge Graph Re-scoring and Injection for Knowledge Graph Question Answeringfinding3 citations
- RESTful-Llama: Connecting User Queries to RESTful APIsIndustry3 citations
- Regression Aware Inference with LLMsfinding3 citations
- Rethinking Token Reduction for State Space ModelsMain3 citations
- Revealing the Parallel Multilingual Learning within Large Language ModelsMain3 citations
- Revisiting Query Variation Robustness of Transformer Modelsfinding3 citations
- Revisiting the Robustness of Watermarking to Paraphrasing AttacksMain3 citations
- RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantizationfinding3 citations
- SAFARI: Cross-lingual Bias and Factuality Detection in News Media and News Articlesfinding3 citations
- SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian LanguagesMain3 citations
- SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and CalibrationIndustry3 citations
EMNLP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.