ICLR 2025 Accepted Papers
The full list of 3,704 papers accepted at ICLR 2025 (International Conference on Learning Representations). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 3,111Spotlight: 380Oral: 213
- KAN: Kolmogorov–Arnold NetworksOral1,156 citations
- SAM 2: Segment Anything in Images and VideosOral846 citations
- WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-InstructOral414 citations
- CogVideoX: Text-to-Video Diffusion Models with An Expert TransformerPoster383 citations
- LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for CodePoster224 citations
- GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language ModelsPoster209 citations
- Show-o: One Single Transformer to Unify Multimodal Understanding and GenerationPoster164 citations
- Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive AttacksPoster161 citations
- NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding ModelsSpotlight158 citations
- MediConfusion: Can you trust your AI radiologist? Probing the reliability of multimodal medical foundation modelsPoster152 citations
- Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal ModelOral150 citations
- Scaling and evaluating sparse autoencodersOral138 citations
- Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP ResearchersPoster127 citations
- BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex InstructionsOral114 citations
- Generative Representational Instruction TuningPoster113 citations
- Training Language Models to Self-Correct via Reinforcement LearningOral113 citations
- Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with NothingPoster111 citations
- Generative Verifiers: Reward Modeling as Next-Token PredictionPoster107 citations
- JudgeLM: Fine-tuned Large Language Models are Scalable JudgesSpotlight107 citations
- Self-Play Preference Optimization for Language Model AlignmentPoster105 citations
- mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language ModelsPoster101 citations
- Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language ModelsOral100 citations
- Advancing LLM Reasoning Generalists with Preference TreesPoster92 citations
- Mixture-of-Agents Enhances Large Language Model CapabilitiesSpotlight90 citations
- The Unreasonable Ineffectiveness of the Deeper LayersPoster90 citations
- SpinQuant: LLM Quantization with Learned RotationsPoster87 citations
- To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoningPoster80 citations
- Depth Pro: Sharp Monocular Metric Depth in Less Than a SecondPoster77 citations
- Physics of Language Models: Part 3.2, Knowledge ManipulationPoster76 citations
- Deconstructing Denoising Diffusion Models for Self-Supervised LearningPoster75 citations
- MonST3R: A Simple Approach for Estimating Geometry in the Presence of MotionSpotlight68 citations
- VILA-U: a Unified Foundation Model Integrating Visual Understanding and GenerationPoster67 citations
- LongVILA: Scaling Long-Context Visual Language Models for Long VideosPoster65 citations
- RDT-1B: a Diffusion Foundation Model for Bimanual ManipulationPoster65 citations
- RouteLLM: Learning to Route LLMs from Preference DataPoster63 citations
- OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video GenerationPoster62 citations
- Physics of Language Models: Part 3.3, Knowledge Capacity Scaling LawsSpotlight62 citations
- Pyramidal Flow Matching for Efficient Video Generative ModelingPoster62 citations
- LLaMA-Omni: Seamless Speech Interaction with Large Language ModelsPoster61 citations
- Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of EncodersSpotlight59 citations
- Rewarding Progress: Scaling Automated Process Verifiers for LLM ReasoningSpotlight59 citations
- Towards Semantic Equivalence of Tokenization in Multimodal LLMPoster59 citations
- AndroidWorld: A Dynamic Benchmarking Environment for Autonomous AgentsPoster58 citations
- Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You ThinkOral58 citations
- Eliciting Human Preferences with Language ModelsPoster57 citations
- On the self-verification limitations of large language models on reasoning and planning tasksPoster57 citations
- Safety Alignment Should be Made More Than Just a Few Tokens DeepOral57 citations
- Automated Design of Agentic SystemsPoster56 citations
- Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary ResolutionPoster56 citations
- Vision-LSTM: xLSTM as Generic Vision BackbonePoster56 citations
- Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like ArchitecturesSpotlight53 citations
- Diffusion Models Are Real-Time Game EnginesPoster52 citations
- MUSE: Machine Unlearning Six-Way Evaluation for Language ModelsPoster52 citations
- MuirBench: A Comprehensive Benchmark for Robust Multi-image UnderstandingPoster52 citations
- Retrieval Head Mechanistically Explains Long-Context FactualityOral51 citations
- Mutual Reasoning Makes Smaller LLMs Stronger Problem-SolverPoster50 citations
- Omni-MATH: A Universal Olympiad Level Mathematic Benchmark for Large Language ModelsPoster50 citations
- Repetition Improves Language Model EmbeddingsPoster50 citations
- Justice or Prejudice? Quantifying Biases in LLM-as-a-JudgePoster49 citations
- World Model on Million-Length Video And Language With Blockwise RingAttentionPoster47 citations
- Differential TransformerOral44 citations
- ColPali: Efficient Document Retrieval with Vision Language ModelsPoster43 citations
- Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language ModelingPoster43 citations
- AFlow: Automating Agentic Workflow GenerationOral41 citations
- MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?Poster41 citations
- OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction DataPoster41 citations
- Kolmogorov-Arnold TransformerPoster40 citations
- Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI AgentsOral40 citations
- Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling PerformancePoster39 citations
- SANA: Efficient High-Resolution Text-to-Image Synthesis with Linear Diffusion TransformersOral39 citations
- Improved Techniques for Optimization-Based Jailbreaking on Large Language ModelsPoster38 citations
- LLM-SR: Scientific Equation Discovery via Programming with Large Language ModelsOral38 citations
- VD3D: Taming Large Video Diffusion Transformers for 3D Camera ControlPoster38 citations
- Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHFPoster37 citations
- MeshAnything: Artist-Created Mesh Generation with Autoregressive TransformersPoster37 citations
- SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model CompressionPoster37 citations
- WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language ModelingPoster37 citations
- AgentHarm: A Benchmark for Measuring Harmfulness of LLM AgentsPoster36 citations
- CHASE-SQL: Multi-Path Reasoning and Preference Optimized Candidate Selection in Text-to-SQLPoster36 citations
- Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative IntelligenceSpotlight36 citations
- SafeDiffuser: Safe Planning with Diffusion Probabilistic ModelsPoster36 citations
- VideoPhy: Evaluating Physical Commonsense for Video GenerationPoster36 citations
- Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous TokensPoster35 citations
- Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning ProcessPoster35 citations
- DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming HeadsPoster34 citations
- JudgeBench: A Benchmark for Evaluating LLM-Based JudgesPoster34 citations
- MotionClone: Training-Free Motion Cloning for Controllable Video GenerationPoster34 citations
- SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View ConsistencyPoster34 citations
- Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language ModelsOral33 citations
- Data Scaling Laws in Imitation Learning for Robotic ManipulationOral33 citations
- EIA: ENVIRONMENTAL INJECTION ATTACK ON GENERALIST WEB AGENTS FOR PRIVACY LEAKAGEPoster33 citations
- Lotus: Diffusion-based Visual Foundation Model for High-quality Dense PredictionPoster33 citations
- Matryoshka Multimodal ModelsPoster33 citations
- Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal SamplingPoster33 citations
- Diffusion Policy Policy OptimizationPoster32 citations
- HelpSteer2-Preference: Complementing Ratings with PreferencesPoster32 citations
- OpenHands: An Open Platform for AI Software Developers as Generalist AgentsPoster32 citations
- Adam-mini: Use Fewer Learning Rates To Gain MorePoster31 citations
- AgentStudio: A Toolkit for Building General Virtual AgentsPoster31 citations
- HART: Efficient Visual Generation with Hybrid Autoregressive TransformerPoster31 citations
- MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec TransformerPoster31 citations
- The Geometry of Categorical and Hierarchical Concepts in Large Language ModelsOral31 citations
- Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHFPoster31 citations
- Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal ControlSpotlight30 citations
- Language models scale reliably with over-training and on downstream tasksPoster30 citations
- MLE-bench: Evaluating Machine Learning Agents on Machine Learning EngineeringOral30 citations
- Tamper-Resistant Safeguards for Open-Weight LLMsPoster30 citations
- Towards Principled Evaluations of Sparse Autoencoders for Interpretability and ControlPoster30 citations
- Does Refusal Training in LLMs Generalize to the Past Tense?Poster29 citations
- G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language ModelPoster29 citations
- HD-Painter: High-Resolution and Prompt-Faithful Text-Guided Image Inpainting with Diffusion ModelsPoster29 citations
- Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion DependencyOral29 citations
- MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuningPoster29 citations
- MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout GuidancePoster29 citations
- OS-ATLAS: Foundation Action Model for Generalist GUI AgentsSpotlight29 citations
- Deep Compression Autoencoder for Efficient High-Resolution Diffusion ModelsPoster28 citations
- LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMsPoster28 citations
- MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language ModelsPoster28 citations
- MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for MedicinePoster27 citations
- Planning in Natural Language Improves LLM Search for Code GenerationSpotlight27 citations
- RegMix: Data Mixture as Regression for Language Model Pre-trainingSpotlight27 citations
- A Decade's Battle on Dataset Bias: Are We There Yet?Oral26 citations
- BOND: Aligning LLMs with Best-of-N DistillationPoster26 citations
- Learn Your Reference Model for Real Good AlignmentPoster26 citations
- Real-Time Video Generation with Pyramid Attention BroadcastPoster26 citations
- Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language ModelsSpotlight26 citations
- DreamBench++: A Human-Aligned Benchmark for Personalized Image GenerationPoster25 citations
- Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation SystemsPoster25 citations
- Inference Scaling for Long-Context Retrieval Augmented GenerationOral25 citations
- Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with ChecklistPoster25 citations
- MMAU: A Massive Multi-Task Audio Understanding and Reasoning BenchmarkSpotlight25 citations
- Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference ModelsPoster25 citations
- RNNs are not Transformers (Yet): The Key Bottleneck on In-Context RetrievalPoster25 citations
- Unlocking Guidance for Discrete State-Space Diffusion and Flow ModelsPoster25 citations
- Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based AgentsPoster24 citations
- BRIGHT: A Realistic and Challenging Benchmark for Reasoning-Intensive RetrievalSpotlight24 citations
- Building Math Agents with Multi-Turn Iterative Preference LearningPoster24 citations
- Language Models Learn to Mislead Humans via RLHFPoster24 citations
- Lean-STaR: Learning to Interleave Thinking and ProvingSpotlight24 citations
- Making Text Embedders Few-Shot LearnersPoster24 citations
- MovieDreamer: Hierarchical Generation for Coherent Long Visual SequencesPoster24 citations
- Scaling Laws for PrecisionOral24 citations
- Training-free Camera Control for Video GenerationPoster24 citations
- VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality DocumentsPoster24 citations
- A Sanity Check for AI-generated Image DetectionPoster23 citations
- Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language ModelsPoster23 citations
- RazorAttention: Efficient KV Cache Compression Through Retrieval HeadsPoster23 citations
- SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?Poster23 citations
- Simplifying, Stabilizing and Scaling Continuous-time Consistency ModelsOral23 citations
- ToolACE: Winning the Points of LLM Function CallingPoster23 citations
- Agent S: An Open Agentic Framework that Uses Computers Like a HumanPoster22 citations
- Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?Poster22 citations
- EdgeRunner: Auto-regressive Auto-encoder for Artistic Mesh GenerationPoster22 citations
- Reti-Diff: Illumination Degradation Image Restoration with Retinex-based Latent Diffusion ModelSpotlight22 citations
- Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot VideosPoster22 citations
- Test of Time: A Benchmark for Evaluating LLMs on Temporal ReasoningPoster22 citations
- Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of ExpertsSpotlight22 citations
- ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video GenerationPoster22 citations
- AI Sandbagging: Language Models can Strategically Underperform on EvaluationsPoster21 citations
- AlphaEdit: Null-Space Constrained Knowledge Editing for Language ModelsOral21 citations
- Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion ModelOral21 citations
- DiscoveryBench: Towards Data-Driven Discovery with Large Language ModelsPoster21 citations
- Image and Video Tokenization with Binary Spherical QuantizationPoster21 citations
- LLaRA: Supercharging Robot Learning Data for Vision-Language PolicyPoster21 citations
- MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative DecodingPoster21 citations
- Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical SamplingPoster21 citations
- ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific DiscoveryPoster21 citations
- Weak to Strong Generalization for Large Language Models with Multi-capabilitiesPoster21 citations
- gRNAde: Geometric Deep Learning for 3D RNA inverse designSpotlight21 citations
- Do LLM Agents Have Regret? A Case Study in Online Learning and GamesPoster20 citations
- FakeShield: Explainable Image Forgery Detection and Localization via Multi-modal Large Language ModelsPoster20 citations
- ImageFolder: Autoregressive Image Generation with Folded TokensPoster20 citations
- Latent Action Pretraining from VideosPoster20 citations
- MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data EnginePoster20 citations
- McEval: Massively Multilingual Code EvaluationPoster20 citations
- No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed ImagesOral20 citations
- Physics-Informed Diffusion ModelsPoster20 citations
- SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video GenerationPoster20 citations
- Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL WorkflowsOral20 citations
- Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean DataPoster20 citations
- AdaIR: Adaptive All-in-One Image Restoration via Frequency Mining and ModulationPoster19 citations
- Asynchronous Federated Reinforcement Learning with Policy Gradient Updates: Algorithm Design and Convergence AnalysisPoster19 citations
- AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMsSpotlight19 citations
- Bootstrapping Language Models with DPO Implicit RewardsPoster19 citations
- Consistency Models Made EasyPoster19 citations
- Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts ModelsPoster19 citations
- Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image AnimationPoster19 citations
- LLMs Know More Than They Show: On the Intrinsic Representation of LLM HallucinationsPoster19 citations
- Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAGPoster19 citations
- NVS-Solver: Video Diffusion Model as Zero-Shot Novel View SynthesizerPoster19 citations
- Semantic Image Inversion and Editing using Rectified Stochastic Differential EquationsPoster19 citations
- Strong Model CollapseSpotlight19 citations
- AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic ManipulationPoster18 citations
- CLoSD: Closing the Loop between Simulation and Diffusion for multi-task character controlSpotlight18 citations
- CatVTON: Concatenation Is All You Need for Virtual Try-On with Diffusion ModelsPoster18 citations
- DEEM: Diffusion models serve as the eyes of large language models for image perceptionSpotlight18 citations
- Diffusion Feedback Helps CLIP See BetterPoster18 citations
- Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language ModelsPoster18 citations
- LoRA-Pro: Are Low-Rank Adapters Properly Optimized?Spotlight18 citations
- MindSearch: Mimicking Human Minds Elicits Deep AI SearcherPoster18 citations
- SVDQuant: Absorbing Outliers by Low-Rank Component for 4-Bit Diffusion ModelsSpotlight18 citations
- Safety Layers in Aligned Large Language Models: The Key to LLM SecurityPoster18 citations
- Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language ModelsPoster18 citations
- ThinK: Thinner Key Cache by Query-Driven PruningSpotlight18 citations
- VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding TasksPoster18 citations
- 4K4DGen: Panoramic 4D Generation at 4K ResolutionSpotlight17 citations
- Arithmetic Without Algorithms: Language Models Solve Math with a Bag of HeuristicsPoster17 citations
- CFG++: Manifold-constrained Classifier Free Guidance for Diffusion ModelsPoster17 citations
- Chain-of-Action: Faithful and Multimodal Question Answering through Large Language ModelsPoster17 citations
- ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code GenerationPoster17 citations
- Controlling Space and Time with Diffusion ModelsPoster17 citations
- LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision TokenPoster17 citations
- Large Language Models Assume People are More Rational than We Really arePoster17 citations
- Learning Diverse Attacks on Large Language Models for Robust Red-Teaming and Safety TuningPoster17 citations
- MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language ModelsPoster17 citations
- Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image SynthesisPoster17 citations
- Methods for Convex $(L_0,L_1)$-Smooth Optimization: Clipping, Acceleration, and AdaptivityPoster17 citations
- PolyNet: Learning Diverse Solution Strategies for Neural Combinatorial OptimizationPoster17 citations
- RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and StyleOral17 citations
- Simplifying Deep Temporal Difference LearningSpotlight17 citations
- T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory StitchingPoster17 citations
- T2V-Turbo-v2: Enhancing Video Model Post-Training through Data, Reward, and Conditional Guidance DesignPoster17 citations
- Visual Agents as Fast and Slow ThinkersPoster17 citations
- WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the WildSpotlight17 citations
- 3D Vision-Language Gaussian SplattingPoster16 citations
- Accelerating Inference of Retrieval-Augmented Generation via Sparse Context SelectionPoster16 citations
- BioDiscoveryAgent: An AI Agent for Designing Genetic Perturbation ExperimentsPoster16 citations
- Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent SystemsPoster16 citations
- D-FINE: Redefine Regression Task of DETRs as Fine-grained Distribution RefinementSpotlight16 citations
- DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language ModelsPoster16 citations
- FreDF: Learning to Forecast in the Frequency DomainPoster16 citations
- OMNI-EPIC: Open-endedness via Models of human Notions of Interestingness with Environments Programmed in CodePoster16 citations
- OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with TextSpotlight16 citations
- OmniRe: Omni Urban Scene ReconstructionSpotlight16 citations
- One Step Diffusion via Shortcut ModelsOral16 citations
- Regularization by Texts for Latent Diffusion Inverse SolversSpotlight16 citations
- SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference AccelerationPoster16 citations
- Second-Order Fine-Tuning without Pain for LLMs: A Hessian Informed Zeroth-Order OptimizerPoster16 citations
- $R^2$-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical ReasoningSpotlight15 citations
- Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi DecodingPoster15 citations
- Diffusion-based Neural Network Weights GenerationPoster15 citations
- Dynamic Diffusion TransformerPoster15 citations
- Gated Delta Networks: Improving Mamba2 with Delta RulePoster15 citations
- Language-Image Models with 3D UnderstandingPoster15 citations
- Machine Unlearning Fails to Remove Data Poisoning AttacksPoster15 citations
- On the expressiveness and spectral bias of KANsPoster15 citations
- Process Reward Model with Q-value RankingsPoster15 citations
- Rectified Diffusion: Straightness Is Not Your Need in Rectified FlowPoster15 citations
- Simple is Effective: The Roles of Graphs and Large Language Models in Knowledge-Graph-Based Retrieval-Augmented GenerationPoster15 citations
- Unifying Unsupervised Graph-Level Anomaly Detection and Out-of-Distribution Detection: A BenchmarkPoster15 citations
- Variational Best-of-N AlignmentPoster15 citations
- Animate-X: Universal Character Image Animation with Enhanced Motion RepresentationPoster14 citations
- Backtracking Improves Generation SafetyOral14 citations
- ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG CapabilitiesPoster14 citations
- EG4D: Explicit Generation of 4D Object without Score DistillationPoster14 citations
- Fundamental Limits of Prompt Tuning Transformers: Universality, Capacity and EfficiencyPoster14 citations
- Improving Pretraining Data Using Perplexity CorrelationsPoster14 citations
- Is In-Context Learning Sufficient for Instruction Following in LLMs?Poster14 citations
- MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMsPoster14 citations
- MagicPIG: LSH Sampling for Efficient LLM GenerationSpotlight14 citations
- On the Relation between Trainability and Dequantization of Variational Quantum Learning ModelsPoster14 citations
- Pangea: A Fully Open Multilingual Multimodal LLM for 39 LanguagesPoster14 citations
- Promptriever: Instruction-Trained Retrievers Can Be Prompted Like Language ModelsPoster14 citations
- Round and Round We Go! What makes Rotary Positional Encodings useful?Poster14 citations
- SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative RefinementPoster14 citations
- Signature Kernel Conditional Independence Tests in Causal Discovery for Stochastic ProcessesSpotlight14 citations
- Towards Realistic Data Generation for Real-World Super-ResolutionPoster14 citations
- AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web AgentsPoster13 citations
- An Image is Worth More Than 16x16 Patches: Exploring Transformers on Individual PixelsPoster13 citations
- Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning AgentPoster13 citations
- CBQ: Cross-Block Quantization for Large Language ModelsSpotlight13 citations
- Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference OptimizationSpotlight13 citations
- Depth Any Video with Scalable Synthetic DataPoster13 citations
- Dissecting Adversarial Robustness of Multimodal LM AgentsPoster13 citations
- DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control AgentPoster13 citations
- GameGen-X: Interactive Open-world Game Video GenerationPoster13 citations
- GoodDrag: Towards Good Practices for Drag Editing with Diffusion ModelsPoster13 citations
- Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation ModelsPoster13 citations
- Learning How Hard to Think: Input-Adaptive Allocation of LM ComputationPoster13 citations
- MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in VideosPoster13 citations
- MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model EvaluationPoster13 citations
- Scaling Large Language Model-based Multi-Agent CollaborationPoster13 citations
- Speculative RAG: Enhancing Retrieval Augmented Generation through DraftingPoster13 citations
- TestGenEval: A Real World Unit Test Generation and Test Completion BenchmarkPoster13 citations
- Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful PerturbationOral12 citations
- CEB: Compositional Evaluation Benchmark for Fairness in Large Language ModelsSpotlight12 citations
- DPLM-2: A Multimodal Diffusion Protein Language ModelPoster12 citations
- DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree SearchPoster12 citations
- Eliminating Position Bias of Language Models: A Mechanistic ApproachPoster12 citations
- EmbodiedSAM: Online Segment Any 3D Thing in Real TimeOral12 citations
- Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language ModelsPoster12 citations
- Fantastic Copyrighted Beasts and How (Not) to Generate ThemPoster12 citations
- Graph Sparsification via Mixture of GraphsSpotlight12 citations
- Hymba: A Hybrid-head Architecture for Small Language ModelsSpotlight12 citations
- Interpreting and Editing Vision-Language Representations to Mitigate HallucinationsPoster12 citations
- IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image GenerationPoster12 citations
- Large Scale Knowledge WashingPoster12 citations
- Long Context Compression with Activation BeaconPoster12 citations
- MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific HypothesesPoster12 citations
- Multiagent Finetuning: Self Improvement with Diverse Reasoning ChainsPoster12 citations
- O(d/T) Convergence Theory for Diffusion Probabilistic Models under Minimal AssumptionsPoster12 citations
- On Targeted Manipulation and Deception when Optimizing LLMs for User FeedbackPoster12 citations
- Revisiting text-to-image evaluation with Gecko: on metrics, prompts, and human ratingSpotlight12 citations
- SG-I2V: Self-Guided Trajectory Control in Image-to-Video GenerationPoster12 citations
- Sequential Controlled Langevin DiffusionsPoster12 citations
- Tighter Privacy Auditing of DP-SGD in the Hidden State Threat ModelPoster12 citations
- Towards Interpreting Visual Information Processing in Vision-Language ModelsPoster12 citations
- Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and MethodologyPoster12 citations
- Training on the Test Task Confounds Evaluation and EmergenceOral12 citations
- VisualAgentBench: Towards Large Multimodal Models as Visual Foundation AgentsPoster12 citations
- Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web NavigationPoster12 citations
- A New Perspective on Shampoo's PreconditionerPoster11 citations
- ALLaM: Large Language Models for Arabic and EnglishPoster11 citations
- Adaptive Data Optimization: Dynamic Sample Selection with Scaling LawsPoster11 citations
- Adversarial Search Engine Optimization for Large Language ModelsPoster11 citations
- AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web TutorialsSpotlight11 citations
- Autoregressive Video Generation without Vector QuantizationPoster11 citations
- Bridging Context Gaps: Leveraging Coreference Resolution for Long Contextual UnderstandingPoster11 citations
- CATCH: Channel-Aware Multivariate Time Series Anomaly Detection via Frequency PatchingPoster11 citations
- Can Large Language Models Understand Symbolic Graphics Programs?Spotlight11 citations
- Cheating Automatic LLM Benchmarks: Null Models Achieve High Win RatesOral11 citations
- Combining Induction and Transduction for Abstract ReasoningPoster11 citations
- ControlAR: Controllable Image Generation with Autoregressive ModelsPoster11 citations
- Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning TracesPoster11 citations
- Enhancing End-to-End Autonomous Driving with Latent World ModelPoster11 citations
- InstantSwap: Fast Customized Concept Swapping across Sharp Shape DifferencesPoster11 citations
- Intent3D: 3D Object Detection in RGB-D Scans Based on Human IntentionPoster11 citations
- Inverse Constitutional AI: Compressing Preferences into PrinciplesPoster11 citations
- LLaVA-MoD: Making LLaVA Tiny via MoE-Knowledge DistillationPoster11 citations
- LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive MemoryPoster11 citations
- MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language ModelsPoster11 citations
- MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language ModelsOral11 citations
- OGBench: Benchmarking Offline Goal-Conditioned RLPoster11 citations
- OmniBind: Large-scale Omni Multimodal Representation via Binding SpacesPoster11 citations
- On Scaling Up 3D Gaussian Splatting TrainingOral11 citations
- PersonalLLM: Tailoring LLMs to Individual PreferencesPoster11 citations
- Perturbation-Restrained Sequential Model EditingPoster11 citations
- Physics of Language Models: Part 2.2, How to Learn From Mistakes on Grade-School Math ProblemsPoster11 citations
- PivotMesh: Generic 3D Mesh Generation via Pivot Vertices GuidancePoster11 citations
- Predictive Inverse Dynamics Models are Scalable Learners for Robotic ManipulationOral11 citations
- Progress or Regress? Self-Improvement Reversal in Post-trainingPoster11 citations
- RepoGraph: Enhancing AI Software Engineering with Repository-level Code GraphPoster11 citations
- SORRY-Bench: Systematically Evaluating Large Language Model Safety RefusalPoster11 citations
- Synthetic continued pretrainingOral11 citations
- System 1.x: Learning to Balance Fast and Slow Planning with Language ModelsPoster11 citations
- TRACE: Temporal Grounding Video LLM via Causal Event ModelingPoster11 citations
- Theory, Analysis, and Best Practices for Sigmoid Self-AttentionPoster11 citations
- Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference OptimizationPoster11 citations
- Training-Free Activation Sparsity in Large Language ModelsSpotlight11 citations
- Transformers are Universal In-context LearnersPoster11 citations
- Why Does the Effective Context Length of LLMs Fall Short?Poster11 citations
- 3D-Properties: Identifying Challenges in DPO and Charting a Path ForwardPoster10 citations
- A Closer Look at Machine Unlearning for Large Language ModelsPoster10 citations
- A Transfer Attack to Image WatermarksPoster10 citations
- ACE: All-round Creator and Editor Following Instructions via Diffusion TransformerPoster10 citations
- ConFIG: Towards Conflict-free Training of Physics Informed Neural NetworksSpotlight10 citations
- DeciMamba: Exploring the Length Extrapolation Potential of MambaPoster10 citations
- Diversity Empowers Intelligence: Integrating Expertise of Software Engineering AgentsPoster10 citations
- Do I Know This Entity? Knowledge Awareness and Hallucinations in Language ModelsOral10 citations
- Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You WantPoster10 citations
- Dynamic Mixture of Experts: An Auto-Tuning Approach for Efficient Transformer ModelsPoster10 citations
- Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context SparsificationPoster10 citations
- Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 TasksPoster10 citations
- Efficient Alternating Minimization with Applications to Weighted Low Rank ApproximationPoster10 citations
- EffoVPR: Effective Foundation Model Utilization for Visual Place RecognitionPoster10 citations
- Energy-Based Diffusion Language Models for Text GenerationPoster10 citations
- Ensembling Diffusion Models via Adaptive Feature AggregationPoster10 citations
- GraphRouter: A Graph-based Router for LLM SelectionsPoster10 citations
- How Discrete and Continuous Diffusion Meet: Comprehensive Analysis of Discrete Diffusion Models via a Stochastic Integral FrameworkPoster10 citations
- Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for LLM Problem-SolvingPoster10 citations
- MM-EMBED: UNIVERSAL MULTIMODAL RETRIEVAL WITH MULTIMODAL LLMSPoster10 citations
- MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly DetectionPoster10 citations
- Mixture of In-Context Prompters for Tabular PFNsPoster10 citations
- MuPT: A Generative Symbolic Music Pretrained TransformerPoster10 citations
- OSCAR: Operating System Control via State-Aware Reasoning and Re-PlanningPoster10 citations
- OmniEdit: Building Image Editing Generalist Models Through Specialist SupervisionPoster10 citations
- On Statistical Rates of Conditional Diffusion Transformers: Approximation, Estimation and Minimax OptimalityPoster10 citations
- PAD: Personalized Alignment of LLMs at Decoding-timePoster10 citations
- PnP-Flow: Plug-and-Play Image Restoration with Flow MatchingPoster10 citations
- Programming Refusal with Conditional Activation SteeringSpotlight10 citations
- Scaling FP8 training to trillion-token LLMsSpotlight10 citations
- Scaling Transformers for Low-Bitrate High-Quality Speech CodingPoster10 citations
- Self-Evolving Multi-Agent Collaboration Networks for Software DevelopmentPoster10 citations
- Self-MoE: Towards Compositional Large Language Models with Self-Specialized ExpertsPoster10 citations
- Stable Segment Anything ModelPoster10 citations
- Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong GeneralizationPoster10 citations
- SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-CorrectionPoster10 citations
- SymmCD: Symmetry-Preserving Crystal Generation with Diffusion ModelsPoster10 citations
- TabM: Advancing tabular deep learning with parameter-efficient ensemblingPoster10 citations
- Taming Overconfidence in LLMs: Reward Calibration in RLHFPoster10 citations
- Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented GenerationPoster10 citations
- TimeSuite: Improving MLLMs for Long Video Understanding via Grounded TuningPoster10 citations
- Towards Fast, Specialized Machine Learning Force Fields: Distilling Foundation Models via Energy HessiansPoster10 citations
- U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical ModelsPoster10 citations
- 3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video GenerationPoster9 citations
- Adversarial Perturbations Cannot Reliably Protect Artists From Generative AISpotlight9 citations
- Agents' Room: Narrative Generation through Multi-step CollaborationPoster9 citations
- Almost Optimal Batch-Regret Tradeoff for Batch Linear Contextual BanditsPoster9 citations
- Autoregressive Pretraining with Mamba in VisionPoster9 citations
- BALROG: Benchmarking Agentic LLM and VLM Reasoning On GamesPoster9 citations
- Beyond Autoregression: Discrete Diffusion for Complex Reasoning and PlanningPoster9 citations
- Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language ModelsSpotlight9 citations
- COMBO: Compositional World Models for Embodied Multi-Agent CooperationPoster9 citations
- Can Knowledge Editing Really Correct Hallucinations?Poster9 citations
- CycleResearcher: Improving Automated Research via Automated ReviewPoster9 citations
- Data Shapley in One Training RunOral9 citations
- Differentiable Optimization of Similarity Scores Between Models and BrainsPoster9 citations
- Diffusion Bridge Implicit ModelsPoster9 citations
- Does Spatial Cognition Emerge in Frontier Models?Poster9 citations
- Emergence of a High-Dimensional Abstraction Phase in Language TransformersPoster9 citations
- ForecastBench: A Dynamic Benchmark of AI Forecasting CapabilitiesPoster9 citations
- FreeVS: Generative View Synthesis on Free Driving TrajectoryPoster9 citations
- GOFA: A Generative One-For-All Model for Joint Graph Language ModelingPoster9 citations
- Grounding Continuous Representations in Geometry: Equivariant Neural FieldsPoster9 citations
- INCLUDE: Evaluating Multilingual Language Understanding with Regional KnowledgeSpotlight9 citations
- Improved Convergence Rate for Diffusion Probabilistic ModelsSpotlight9 citations
- Improving Instruction-Following in Language Models through Activation SteeringPoster9 citations
- InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized RationalesPoster9 citations
- LANTERN: Accelerating Visual Autoregressive Models with Relaxed Speculative DecodingPoster9 citations
- MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal ModelsPoster9 citations
- MeteoRA: Multiple-tasks Embedded LoRA for Large Language ModelsPoster9 citations
- OLMoE: Open Mixture-of-Experts Language ModelsOral9 citations
- On Evaluating the Durability of Safeguards for Open-Weight LLMsPoster9 citations
- PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language InstructionsPoster9 citations
- PointOBB-v2: Towards Simpler, Faster, and Stronger Single Point Supervised Oriented Object DetectionPoster9 citations
- Preble: Efficient Distributed Prompt Scheduling for LLM ServingPoster9 citations
- Procedural Knowledge in Pretraining Drives Reasoning in Large Language ModelsPoster9 citations
- Real2Code: Reconstruct Articulated Objects via Code GenerationPoster9 citations
- Robust LLM safeguarding via refusal feature adversarial trainingPoster9 citations
- SPA-BENCH: A COMPREHENSIVE BENCHMARK FOR SMARTPHONE AGENT EVALUATIONSpotlight9 citations
- STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMsPoster9 citations
- Scalable Extraction of Training Data from Aligned, Production Language ModelsPoster9 citations
- ShortcutsBench: A Large-Scale Real-world Benchmark for API-based AgentsPoster9 citations
- Simple Guidance Mechanisms for Discrete Diffusion ModelsPoster9 citations
- StructRAG: Boosting Knowledge Intensive Reasoning of LLMs via Inference-time Hybrid Information StructurizationPoster9 citations
- TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion InterpolationOral9 citations
- TempMe: Video Temporal Token Merging for Efficient Text-Video RetrievalPoster9 citations
- The AdEMAMix Optimizer: Better, Faster, OlderPoster9 citations
- Theory on Mixture-of-Experts in Continual LearningSpotlight9 citations
- TimeMixer++: A General Time Series Pattern Machine for Universal Predictive AnalysisOral9 citations
- Can LLMs Solve Longer Math Word Problems Better?Poster8 citations
- Can LLMs Understand Time Series Anomalies?Poster8 citations
- Deep Learning Alternatives Of The Kolmogorov Superposition TheoremSpotlight8 citations
- DisPose: Disentangling Pose Guidance for Controllable Human Image AnimationPoster8 citations
- E(n) Equivariant Topological Neural NetworksPoster8 citations
- Efficient stagewise pretraining via progressive subnetworksPoster8 citations
- ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory LearningPoster8 citations
- Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation ModelsPoster8 citations
- First-Person Fairness in ChatbotsSpotlight8 citations
- Frame-Voyager: Learning to Query Frames for Video Large Language ModelsPoster8 citations
- GOAL: A Generalist Combinatorial Optimization Agent LearnerPoster8 citations
- GenXD: Generating Any 3D and 4D ScenesPoster8 citations
- GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-trainingPoster8 citations
- Group Distributionally Robust Dataset Distillation with Risk MinimizationPoster8 citations
- Harnessing Diversity for Important Data Selection in Pretraining Large Language ModelsSpotlight8 citations
- Hypothetical Minds: Scaffolding Theory of Mind for Multi-Agent Tasks with Large Language ModelsPoster8 citations
- Improving Equivariant Networks with Probabilistic Symmetry BreakingPoster8 citations
- Instruct-SkillMix: A Powerful Pipeline for LLM Instruction TuningPoster8 citations
- Interleaved Scene Graphs for Interleaved Text-and-Image Generation AssessmentSpotlight8 citations
- Interpreting the Second-Order Effects of Neurons in CLIPPoster8 citations
- LARP: Tokenizing Videos with a Learned Autoregressive Generative PriorOral8 citations
- LVSM: A Large View Synthesis Model with Minimal 3D Inductive BiasOral8 citations
- LaGeM: A Large Geometry Model for 3D Representation Learning and DiffusionPoster8 citations
- LeanAgent: Lifelong Learning for Formal Theorem ProvingPoster8 citations
- Learn-by-interact: A Data-Centric Framework For Self-Adaptive Agents in Realistic EnvironmentsPoster8 citations
- Learning Dynamics of LLM FinetuningOral8 citations
- Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-TrainingPoster8 citations
- LoLCATs: On Low-Rank Linearizing of Large Language ModelsPoster8 citations
- Looking Backward: Streaming Video-to-Video Translation with Feature BanksPoster8 citations
- Manifolds, Random Matrices and Spectral Gaps: The geometric phases of generative diffusionPoster8 citations
- Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention CausalityPoster8 citations
- Model merging with SVD to tie the KnotsPoster8 citations
- Monitoring Latent World States in Language Models with Propositional ProbesSpotlight8 citations
- Motion-Agent: A Conversational Framework for Human Motion Generation with LLMsPoster8 citations
- PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World UnderstandingOral8 citations
- Point-SAM: Promptable 3D Segmentation Model for Point CloudsPoster8 citations
- Preference Optimization for Reasoning with Pseudo FeedbackSpotlight8 citations
- REEF: Representation Encoding Fingerprints for Large Language ModelsOral8 citations
- ReDeEP: Detecting Hallucination in Retrieval-Augmented Generation via Mechanistic InterpretabilitySpotlight8 citations
- Residual Connections and Normalization Can Provably Prevent Oversmoothing in GNNsPoster8 citations
- RevisEval: Improving LLM-as-a-Judge via Response-Adapted ReferencesPoster8 citations
- Robust Watermarking Using Generative Priors Against Image Editing: From Benchmarking to AdvancesPoster8 citations
- SCBench: A KV Cache-Centric Analysis of Long-Context MethodsPoster8 citations
- Scaling In-the-Wild Training for Diffusion-based Illumination Harmonization and Editing by Imposing Consistent Light TransportOral8 citations
- SciLitLLM: How to Adapt LLMs for Scientific Literature UnderstandingPoster8 citations
- Steering Masked Discrete Diffusion Models via Discrete Denoising Posterior PredictionPoster8 citations
- SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse ViewpointsPoster8 citations
- TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation ModelsPoster8 citations
- The Power of LLM-Generated Synthetic Data for Stance Detection in Online Political DiscussionsSpotlight8 citations
- TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic PoliciesPoster8 citations
- Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement LearningPoster8 citations
- Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM OutputsOral8 citations
- Unintentional Unalignment: Likelihood Displacement in Direct Preference OptimizationPoster8 citations
- Video-STaR: Self-Training Enables Video Instruction Tuning with Any SupervisionPoster8 citations
- nGPT: Normalized Transformer with Representation Learning on the HyperspherePoster8 citations
- A Geometric Framework for Understanding Memorization in Generative ModelsSpotlight7 citations
- Accurate and Scalable Graph Neural Networks via Message InvariancePoster7 citations
- Ambient Diffusion Posterior Sampling: Solving Inverse Problems with Diffusion Models Trained on Corrupted DataPoster7 citations
- An Undetectable Watermark for Generative Image ModelsPoster7 citations
- Apollo-MILP: An Alternating Prediction-Correction Neural Solving Framework for Mixed-Integer Linear ProgrammingPoster7 citations
- Benchmarking Agentic Workflow GenerationPoster7 citations
- Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity DatasetPoster7 citations
- CBraMod: A Criss-Cross Brain Foundation Model for EEG DecodingPoster7 citations
- CREAM: Consistency Regularized Self-Rewarding Language ModelsPoster7 citations
- Concept Bottleneck Large Language ModelsPoster7 citations
- ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference TimePoster7 citations
- Efficient Evolutionary Search Over Chemical Space with Large Language ModelsPoster7 citations
- Exploring Prosocial Irrationality for LLM Agents: A Social Cognition ViewPoster7 citations
- Fine-Tuning Discrete Diffusion Models via Reward Optimization with Applications to DNA and Protein DesignPoster7 citations
- From Tokens to Words: On the Inner Lexicon of LLMsPoster7 citations
- GPUDrive: Data-driven, multi-agent driving simulation at 1 million FPSPoster7 citations
- GS-CPR: Efficient Camera Pose Refinement via 3D Gaussian SplattingPoster7 citations
- Generalizable Human Gaussians from Single-View ImagePoster7 citations
- Generative Inbetweening: Adapting Image-to-Video Models for Keyframe InterpolationPoster7 citations
- Geometry Image Diffusion: Fast and Data-Efficient Text-to-3D with Image-Based Surface RepresentationPoster7 citations
- How to Evaluate Reward Models for RLHFPoster7 citations
- Human Simulacra: Benchmarking the Personification of Large Language ModelsPoster7 citations
- ICLR: In-Context Learning of RepresentationsPoster7 citations
- Instant Policy: In-Context Imitation Learning via Graph DiffusionOral7 citations
- Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language ModelsPoster7 citations
- JetFormer: An autoregressive generative model of raw images and textPoster7 citations
- LICO: Large Language Models for In-Context Molecular OptimizationPoster7 citations
- Learning Harmonized Representations for Speculative SamplingPoster7 citations
- Limits to scalable evaluation at the frontier: LLM as judge won’t beat twice the dataOral7 citations
- MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World TasksPoster7 citations
- MLLM can see? Dynamic Correction Decoding for Hallucination MitigationPoster7 citations
- MMRole: A Comprehensive Framework for Developing and Evaluating Multimodal Role-Playing AgentsPoster7 citations
- Measuring And Improving Persuasiveness Of Large Language ModelsPoster7 citations
- MoDeGPT: Modular Decomposition for Large Language Model CompressionOral7 citations
- Moral Alignment for LLM AgentsPoster7 citations
- ND-SDF: Learning Normal Deflection Fields for High-Fidelity Indoor ReconstructionSpotlight7 citations
- PathGen-1.6M: 1.6 Million Pathology Image-text Pairs Generation through Multi-agent CollaborationOral7 citations
- Personalized Visual Instruction TuningPoster7 citations
- Preference Diffusion for RecommendationPoster7 citations
- Provable Benefit of Annealed Langevin Monte Carlo for Non-log-concave SamplingPoster7 citations
- Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language ModelPoster7 citations
- ReSi: A Comprehensive Benchmark for Representational Similarity MeasuresPoster7 citations
- Reconciling Model Multiplicity for Downstream Decision MakingPoster7 citations
- Robustness of Quantum Algorithms for Nonconvex OptimizationPoster7 citations
- SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data SelectionPoster7 citations
- SPA: 3D Spatial-Awareness Enables Effective Embodied RepresentationPoster7 citations
- Self-Improving Robust Preference OptimizationPoster7 citations
- Sparse Autoencoders Reveal Temporal Difference Learning in Large Language ModelsPoster7 citations
- SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based SpikingPoster7 citations
- SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal BudgetPoster7 citations
- Standardizing Structural Causal ModelsPoster7 citations
- SysCaps: Language Interfaces for Simulation Surrogates of Complex SystemsPoster7 citations
- TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation DataPoster7 citations
- TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated WeightsPoster7 citations
- The 3D-PC: a benchmark for visual perspective taking in humans and machinesPoster7 citations
- The OMG dataset: An Open MetaGenomic corpus for mixed-modality genomic language modelingPoster7 citations
- ThinkBot: Embodied Instruction Following with Thought Chain ReasoningPoster7 citations
- Towards Scalable Exact Machine Unlearning Using Parameter-Efficient Fine-TuningPoster7 citations
- Uncovering Overfitting in Large Language Model EditingSpotlight7 citations
- Understanding Factual Recall in Transformers via Associative MemoriesSpotlight7 citations
- Universal Sharpness Dynamics in Neural Network Training: Fixed Point Analysis, Edge of Stability, and Route to ChaosPoster7 citations
- Unlocking State-Tracking in Linear RNNs Through Negative EigenvaluesOral7 citations
- What Makes Large Language Models Reason in (Multi-Turn) Code Generation?Poster7 citations
- What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?Poster7 citations
- X-ALMA: Plug & Play Modules and Adaptive Rejection for Quality Translation at ScaleSpotlight7 citations
- u-$\mu$P: The Unit-Scaled Maximal Update ParametrizationSpotlight7 citations
- A Percolation Model of Emergence: Analyzing Transformers Trained on a Formal LanguagePoster6 citations
- ADBM: Adversarial Diffusion Bridge Model for Reliable Adversarial PurificationPoster6 citations
- ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video GenerationPoster6 citations
- Adding Conditional Control to Diffusion Models with Reinforcement LearningPoster6 citations
- Agent-Oriented Planning in Multi-Agent SystemsPoster6 citations
- AgentSquare: Automatic LLM Agent Search in Modular Design SpacePoster6 citations
- Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation ModelPoster6 citations
- AuroraCap: Efficient, Performant Video Detailed Captioning and a New BenchmarkPoster6 citations
- AvatarGO: Zero-shot 4D Human-Object Interaction Generation and AnimationPoster6 citations
- Bio-xLSTM: Generative modeling, representation and in-context learning of biological and chemical sequencesPoster6 citations
- Black-Box Detection of Language Model WatermarksPoster6 citations
- Commit0: Library Generation from ScratchPoster6 citations
- Competition Dynamics Shape Algorithmic Phases of In-Context LearningSpotlight6 citations
- Composable Interventions for Language ModelsPoster6 citations
- Contextual Document EmbeddingsPoster6 citations
- CrossMPT: Cross-attention Message-passing Transformer for Error Correcting CodesPoster6 citations
- Deep MMD Gradient Flow without adversarial trainingPoster6 citations
- DelTA: An Online Document-Level Translation Agent Based on Multi-Level MemoryPoster6 citations
- Diffusing States and Matching Scores: A New Framework for Imitation LearningPoster6 citations
- Do Vision & Language Decoders use Images and Text equally? How Self-consistent are their Explanations?Poster6 citations
- Dual Process Learning: Controlling Use of In-Context vs. In-Weights Strategies with Weight ForgettingPoster6 citations
- Efficiently Learning at Test-Time: Active Fine-Tuning of LLMsPoster6 citations
- Emergence of meta-stable clustering in mean-field transformer modelsOral6 citations
- Encryption-Friendly LLM ArchitecturePoster6 citations
- Fast Feedforward 3D Gaussian Splatting CompressionPoster6 citations
- Fast Summation of Radial Kernels via QMC SlicingPoster6 citations
- FasterCache: Training-Free Video Diffusion Model Acceleration with High QualityPoster6 citations
- Federated $Q$-Learning with Reference-Advantage Decomposition: Almost Optimal Regret and Logarithmic Communication CostPoster6 citations
- Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language AlignmentPoster6 citations
- From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven InteractionsOral6 citations
- Graph Neural Preconditioners for Iterative Solutions of Sparse Linear SystemsPoster6 citations
- Heavy-Tailed Diffusion ModelsPoster6 citations
- HiSplat: Hierarchical 3D Gaussian Splatting for Generalizable Sparse-View ReconstructionPoster6 citations
- Highly Efficient Self-Adaptive Reward Shaping for Reinforcement LearningPoster6 citations
- In-Context Editing: Learning Knowledge from Self-Induced DistributionsPoster6 citations
- In-context Time Series PredictorPoster6 citations
- Instructional Segment Embedding: Improving LLM Safety with Instruction HierarchyPoster6 citations
- LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal ModelsSpotlight6 citations
- LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and CaptioningPoster6 citations
- Language Guided Skill DiscoveryPoster6 citations
- Language Representations Can be What Recommenders Need: Findings and PotentialsOral6 citations
- LongGenBench: Benchmarking Long-Form Generation in Long Context LLMsPoster6 citations
- MallowsPO: Fine-Tune Your LLM with Preference DispersionsPoster6 citations
- Memory MosaicsPoster6 citations
- Meta Flow Matching: Integrating Vector Fields on the Wasserstein ManifoldPoster6 citations
- MetaMetrics: Calibrating Metrics for Generation Tasks Using Human PreferencesPoster6 citations
- MetaOOD: Automatic Selection of OOD Detection ModelsPoster6 citations
- Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image PyramidPoster6 citations
- Multi-Robot Motion Planning with Diffusion ModelsSpotlight6 citations
- Multi-objective Differentiable Neural Architecture SearchPoster6 citations
- No Training, No Problem: Rethinking Classifier-Free Guidance for Diffusion ModelsPoster6 citations
- On the Identification of Temporal Causal Representation with Instantaneous DependenceOral6 citations
- OptiBench Meets ReSocratic: Measure and Improve LLMs for Optimization ModelingPoster6 citations
- Pareto Low-Rank Adapters: Efficient Multi-Task Learning with PreferencesPoster6 citations
- PeriodWave: Multi-Period Flow Matching for High-Fidelity Waveform GenerationPoster6 citations
- Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized ProgrammingPoster6 citations
- Posterior-Mean Rectified Flow: Towards Minimum MSE Photo-Realistic Image RestorationPoster6 citations
- ProteinBench: A Holistic Evaluation of Protein Foundation ModelsPoster6 citations
- Quantifying Generalization Complexity for Large Language ModelsPoster6 citations
- Reasoning with Latent Thoughts: On the Power of Looped TransformersPoster6 citations
- SINGAPO: Single Image Controlled Generation of Articulated Parts in ObjectsPoster6 citations
- SLoPe: Double-Pruned Sparse Plus Lazy Low-Rank Adapter Pretraining of LLMsPoster6 citations
- SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language ModelPoster6 citations
- SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language ModelsPoster6 citations
- Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language ModelsSpotlight6 citations
- Scaling Wearable Foundation ModelsPoster6 citations
- Selective Attention Improves TransformerPoster6 citations
- SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement LearningSpotlight6 citations
- Specialized Foundation Models Struggle to Beat Supervised BaselinesPoster6 citations
- Speech Robust Bench: A Robustness Benchmark For Speech RecognitionPoster6 citations
- Statistical Advantages of Perturbing Cosine Router in Mixture of ExpertsPoster6 citations
- Streaming Video Understanding and Multi-round Interaction with Memory-enhanced KnowledgePoster6 citations
- Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided SearchPoster6 citations
- TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference TreesPoster6 citations
- Timer-XL: Long-Context Transformers for Unified Time Series ForecastingPoster6 citations
- ToolGen: Unified Tool Retrieval and Calling via GenerationPoster6 citations
- Topological Blindspots: Understanding and Extending Topological Deep Learning Through the Lens of ExpressivityOral6 citations
- TorchTitan: One-stop PyTorch native solution for production ready LLM pretrainingPoster6 citations
- Transformers Provably Solve Parity Efficiently with Chain of ThoughtOral6 citations
- Trust or Escalate: LLM Judges with Provable Guarantees for Human AgreementOral6 citations
- Unleashing the Power of Task-Specific Directions in Parameter Efficient Fine-tuningPoster6 citations
- VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference AccelerationPoster6 citations
- Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts ReasoningPoster6 citations
- When does compositional structure yield compositional generalization? A kernel theory.Poster6 citations
- A Quantum Circuit-Based Compression Perspective for Parameter-Efficient LearningPoster5 citations
- A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image GenerationPoster5 citations
- A Unified Theory of Quantum Neural Network Loss LandscapesPoster5 citations
- ARB-LLM: Alternating Refined Binarizations for Large Language ModelsPoster5 citations
- Achieving Dimension-Free Communication in Federated Learning via Zeroth-Order OptimizationPoster5 citations
- Active Learning for Neural PDE SolversPoster5 citations
- Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion ModelsPoster5 citations
- AgentRefine: Enhancing Agent Generalization through Refinement TuningPoster5 citations
- An Intelligent Agentic System for Complex Image Restoration ProblemsPoster5 citations
- Attention as a HypernetworkOral5 citations
- Better Instruction-Following Through Minimum Bayes RiskSpotlight5 citations
- BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak AttacksPoster5 citations
- CG-Bench: Clue-grounded Question Answering Benchmark for Long Video UnderstandingPoster5 citations
- CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science MasteryPoster5 citations
- Can LLMs Really Learn to Translate a Low-Resource Language from One Grammar Book?Spotlight5 citations
- Can Watermarked LLMs be Identified by Users via Crafted Prompts?Spotlight5 citations
- Can We Trust Embodied Agents? Exploring Backdoor Attacks against Embodied LLM-Based Decision-Making SystemsPoster5 citations
- CityGaussianV2: Efficient and Geometrically Accurate Reconstruction for Large-Scale ScenesPoster5 citations
- Computationally Efficient RL under Linear Bellman Completeness for Deterministic DynamicsOral5 citations
- DeLLMa: Decision Making Under Uncertainty with Large Language ModelsSpotlight5 citations
- DiffSplat: Repurposing Image Diffusion Models for Scalable Gaussian Splat GenerationPoster5 citations
- Differentiable Integer Linear ProgrammingSpotlight5 citations
- Diffusion Models are Evolutionary AlgorithmsPoster5 citations
- Divide and Translate: Compositional First-Order Logic Translation and Verification for Complex Logical ReasoningPoster5 citations
- Does SGD really happen in tiny subspaces?Poster5 citations
- ECHOPulse: ECG Controlled Echocardio-gram Video GenerationPoster5 citations
- Effective Interplay between Sparsity and Quantization: From Theory to PracticeSpotlight5 citations
- Efficient Dictionary Learning with Switch Sparse AutoencodersPoster5 citations
- ElasticTok: Adaptive Tokenization for Image and VideoPoster5 citations
- Explore Theory of Mind: program-guided adversarial data generation for theory of mind reasoningPoster5 citations
- From Lazy to Rich: Exact Learning Dynamics in Deep Linear NetworksPoster5 citations
- Generative Monoculture in Large Language ModelsPoster5 citations
- Grounding by Trying: LLMs with Reinforcement Learning-Enhanced RetrievalPoster5 citations
- HAMSTER: Hierarchical Action Models for Open-World Robot ManipulationPoster5 citations
- Hierarchical World Models as Visual Whole-Body Humanoid ControllersPoster5 citations
- How Does Critical Batch Size Scale in Pre-training?Poster5 citations
- How Feature Learning Can Improve Neural Scaling LawsSpotlight5 citations
- How efficient is LLM-generated code? A rigorous & high-standard benchmarkPoster5 citations
- InterMask: 3D Human Interaction Generation via Collaborative Masked ModelingPoster5 citations
- Jailbreaking as a Reward Misspecification ProblemPoster5 citations
- KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal ModelsPoster5 citations
- Language Models Need Inductive Biases to Count InductivelyPoster5 citations
- Law of the Weakest Link: Cross Capabilities of Large Language ModelsPoster5 citations
- LiNeS: Post-training Layer Scaling Prevents Forgetting and Enhances Model MergingPoster5 citations
- Logically Consistent Language Models via Neuro-Symbolic IntegrationPoster5 citations
- Long-time asymptotics of noisy SVGD outside the population limitPoster5 citations
- Longhorn: State Space Models are Amortized Online LearnersPoster5 citations
- MAGE: Model-Level Graph Neural Networks Explanations via Motif-based Graph GenerationPoster5 citations
- MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language ModelsPoster5 citations
- Model-based RL as a Minimalist Approach to Horizon-Free and Second-Order BoundsPoster5 citations
- Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool UsageSpotlight5 citations
- Multimodal Large Language Models for Inverse Molecular Design with Retrosynthetic PlanningPoster5 citations
- Multimodal Situational SafetyPoster5 citations
- Navigating Neural Space: Revisiting Concept Activation Vectors to Overcome Directional DivergencePoster5 citations
- NovelQA: Benchmarking Question Answering on Documents Exceeding 200K TokensPoster5 citations
- OASIS Uncovers: High-Quality T2I Models, Same Old StereotypesSpotlight5 citations
- OmnixR: Evaluating Omni-modality Language Models on Reasoning across ModalitiesPoster5 citations
- On the Completeness of Invariant Geometric Deep Learning ModelsPoster5 citations
- One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single PromptSpotlight5 citations
- Online Preference Alignment for Language Models via Count-based ExplorationSpotlight5 citations
- Overcoming Lower-Level Constraints in Bilevel Optimization: A Novel Approach with Regularized Gap FunctionsPoster5 citations
- PARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent TasksPoster5 citations
- Phidias: A Generative Model for Creating 3D Content from Text, Image, and 3D Conditions with Reference-Augmented DiffusionPoster5 citations
- Post-hoc Reward Calibration: A Case Study on Length BiasPoster5 citations
- Privacy Auditing of Large Language ModelsPoster5 citations
- Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language ModelsPoster5 citations
- Protein Language Model Fitness is a Matter of PreferencePoster5 citations
- Provable weak-to-strong generalization via benign overfittingPoster5 citations
- RainbowPO: A Unified Framework for Combining Improvements in Preference OptimizationPoster5 citations
- Reading Your Heart: Learning ECG Words and Sentences via Pre-training ECG Language ModelPoster5 citations
- Reconstructive Visual Instruction TuningPoster5 citations
- Relaxed Recursive Transformers: Effective Parameter Sharing with Layer-wise LoRAPoster5 citations
- SONICS: Synthetic Or Not - Identifying Counterfeit SongsPoster5 citations
- SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language ModelsPoster5 citations
- STAMP: Scalable Task- And Model-agnostic Collaborative PerceptionPoster5 citations
- SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent ExplanationsPoster5 citations
- Selective Aggregation for Low-Rank Adaptation in Federated LearningPoster5 citations
- Self-Improvement in Language Models: The Sharpening MechanismOral5 citations
- Simple ReFlow: Improved Techniques for Fast Flow ModelsPoster5 citations
- Spatial-Mamba: Effective Visual State Space Models via Structure-Aware State FusionPoster5 citations
- Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved SamplingPoster5 citations
- Spread Preference Annotation: Direct Preference Judgment for Efficient LLM AlignmentOral5 citations
- Steering Large Language Models between Code Execution and Textual ReasoningPoster5 citations
- TLDR: Token-Level Detective Reward Model for Large Vision Language ModelsPoster5 citations
- Text-to-Image Rectified Flow as Plug-and-Play PriorsPoster5 citations
- Text4Seg: Reimagining Image Segmentation as Text GenerationPoster5 citations
- The Foundations of Tokenization: Statistical and Computational ConcernsPoster5 citations
- The Optimization Landscape of SGD Across the Feature Learning StrengthPoster5 citations
- Towards Foundation Models for Mixed Integer Linear ProgrammingPoster5 citations
- Towards a General Time Series Anomaly Detector with Adaptive Bottlenecks and Dual Adversarial DecodersPoster5 citations
- Transformer-Squared: Self-adaptive LLMsPoster5 citations
- Unifying Causal Representation Learning with the Invariance PrinciplePoster5 citations
- VSTAR: Generative Temporal Nursing for Longer Dynamic Video SynthesisPoster5 citations
- Visual Haystacks: A Vision-Centric Needle-In-A-Haystack BenchmarkPoster5 citations
- YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel CorpusPoster5 citations
- Your Mixture-of-Experts LLM Is Secretly an Embedding Model for FreeOral5 citations
- Zero-shot forecasting of chaotic systemsPoster5 citations
- $\gamma-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language ModelsPoster4 citations
- 3DitScene: Editing Any Scene via Language-guided Disentangled Gaussian SplattingPoster4 citations
- A Formal Framework for Understanding Length Generalization in TransformersPoster4 citations
- A Little Goes a Long Way: Efficient Long Context Training and Inference with Partial ContextsPoster4 citations
- A Second-Order Perspective on Model Compositionality and Incremental LearningSpotlight4 citations
- AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language ModelsPoster4 citations
- Activation Gradient based Poisoned Sample Detection Against Backdoor AttacksPoster4 citations
- AdaManip: Adaptive Articulated Object Manipulation Environments and Policy LearningPoster4 citations
- Adversarial Score identity Distillation: Rapidly Surpassing the Teacher in One StepPoster4 citations
- Adversarially Robust Out-of-Distribution Detection Using Lyapunov-Stabilized EmbeddingsPoster4 citations
- Aioli: A Unified Optimization Framework for Language Model Data MixingPoster4 citations
- Aligning Human Motion Generation with Human PerceptionsPoster4 citations
- Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language ModelsPoster4 citations
- Approaching Rate-Distortion Limits in Neural Compression with Lattice Transform CodingSpotlight4 citations
- Artificial Kuramoto Oscillatory NeuronsOral4 citations
- Ask, and it shall be given: On the Turing completeness of promptingPoster4 citations
- Attention layers provably solve single-location regressionPoster4 citations
- Automated Proof Generation for Rust Code via Self-EvolutionPoster4 citations
- Automatic Curriculum Expert Iteration for Reliable LLM ReasoningPoster4 citations
- BIRD: A Trustworthy Bayesian Inference Framework for Large Language ModelsOral4 citations
- Beyond Linear Approximations: A Novel Pruning Approach for Attention MatrixPoster4 citations
- Beyond Single Concept Vector: Modeling Concept Subspace in LLMs with Gaussian DistributionPoster4 citations
- BiGR: Harnessing Binary Latent Codes for Image Generation and Improved Visual Representation CapabilitiesPoster4 citations
- Block Diffusion: Interpolating Between Autoregressive and Diffusion Language ModelsOral4 citations
- Broadening Target Distributions for Accelerated Diffusion Models via a Novel Analysis ApproachPoster4 citations
- Build-A-Scene: Interactive 3D Layout Control for Diffusion-Based Image GenerationPoster4 citations
- CLIBD: Bridging Vision and Genomics for Biodiversity Monitoring at ScalePoster4 citations
- COAT: Compressing Optimizer states and Activations for Memory-Efficient FP8 TrainingPoster4 citations
- Causal Concept Graph Models: Beyond Causal Opacity in Deep LearningPoster4 citations
- ChemAgent: Self-updating Memories in Large Language Models Improves Chemical ReasoningPoster4 citations
- CircuitFusion: Multimodal Circuit Representation Learning for Agile Chip DesignPoster4 citations
- ClassDiffusion: More Aligned Personalization Tuning with Explicit Class GuidancePoster4 citations
- CofCA: A STEP-WISE Counterfactual Multi-hop QA benchmarkPoster4 citations
- Computing Circuits Optimization via Model-Based Circuit Genetic EvolutionPoster4 citations
- ConceptPrune: Concept Editing in Diffusion Models via Skilled Neuron PruningPoster4 citations
- Context-Alignment: Activating and Enhancing LLMs Capabilities in Time SeriesPoster4 citations
- Context-Parametric Inversion: Why Instruction Finetuning May Not Actually Improve Context RelianceOral4 citations
- Cross-Embodiment Dexterous Grasping with Reinforcement LearningPoster4 citations
- Ctrl-U: Robust Conditional Image Generation via Uncertainty-aware Reward ModelingPoster4 citations
- DELTA: DENSE EFFICIENT LONG-RANGE 3D TRACKING FOR ANY VIDEOPoster4 citations
- DON’T STOP ME NOW: EMBEDDING BASED SCHEDULING FOR LLMSPoster4 citations
- DaWin: Training-free Dynamic Weight Interpolation for Robust AdaptationPoster4 citations
- DailyDilemmas: Revealing Value Preferences of LLMs with Quandaries of Daily LifeSpotlight4 citations
- Decomposition Polyhedra of Piecewise Linear FunctionsSpotlight4 citations
- Determine-Then-Ensemble: Necessity of Top-k Union for Large Language Model EnsemblingSpotlight4 citations
- DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific FactorsPoster4 citations
- Diffusion Models as Cartoonists: The Curious Case of High Density RegionsPoster4 citations
- Diffusion On Syntax Trees For Program SynthesisSpotlight4 citations
- Doubly Optimal Policy Evaluation for Reinforcement LearningPoster4 citations
- DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous DrivingPoster4 citations
- Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language BootstrappingOral4 citations
- ET-SEED: EFFICIENT TRAJECTORY-LEVEL SE(3) EQUIVARIANT DIFFUSION POLICYPoster4 citations
- Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline DataPoster4 citations
- Efficient Reinforcement Learning with Large Language Model PriorsPoster4 citations
- Efficiently Democratizing Medical LLMs for 50 Languages via a Mixture of Language Family ExpertsPoster4 citations
- Eliminating Oversaturation and Artifacts of High Guidance Scales in Diffusion ModelsPoster4 citations
- Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank StructuresPoster4 citations
- FaceShot: Bring Any Character into LifePoster4 citations
- Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction TuningPoster4 citations
- FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMsSpotlight4 citations
- Fantastic Targets for Concept Erasure in Diffusion Models and Where To Find ThemPoster4 citations
- Faster Cascades via Speculative DecodingOral4 citations
- Few for Many: Tchebycheff Set Scalarization for Many-Objective OptimizationPoster4 citations
- Flow Matching with General Discrete Paths: A Kinetic-Optimal PerspectiveOral4 citations
- Formation of Representations in Neural NetworksSpotlight4 citations
- Fundamental Limitations on Subquadratic Alternatives to TransformersPoster4 citations
- GenEx: Generating an Explorable WorldPoster4 citations
- Generating CAD Code with Vision-Language Models for 3D DesignsPoster4 citations
- Generative Flows on Synthetic Pathway for Drug DesignPoster4 citations
- Geometry of Lightning Self-Attention: Identifiability and DimensionPoster4 citations
- HARDMath: A Benchmark Dataset for Challenging Problems in Applied MathematicsPoster4 citations
- HiLo: A Learning Framework for Generalized Category Discovery Robust to Domain ShiftsPoster4 citations
- How Do Large Language Models Understand Graph Patterns? A Benchmark for Graph Pattern ComprehensionPoster4 citations
- How many samples are needed to train a deep neural network?Poster4 citations
- Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph GenerationPoster4 citations
- HyperFace: Generating Synthetic Face Recognition Datasets by Exploring Face Embedding HyperspherePoster4 citations
- I2VControl-Camera: Precise Video Camera Control with Adjustable Motion StrengthPoster4 citations
- IgGM: A Generative Model for Functional Antibody and Nanobody DesignPoster4 citations
- Improving Semantic Understanding in Speech Language Models via Brain-tuningPoster4 citations
- In Search of Forgotten Domain GeneralizationSpotlight4 citations
- Integrative Decoding: Improving Factuality via Implicit Self-consistencyPoster4 citations
- Interaction Asymmetry: A General Principle for Learning Composable AbstractionsPoster4 citations
- Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret LearningOral4 citations
- Knowledge Distillation with Multi-granularity Mixture of Priors for Image Super-ResolutionSpotlight4 citations
- Knowledge Localization: Mission Not Accomplished? Enter Query Localization!Spotlight4 citations
- Language Models Trained to do Arithmetic Predict Human Risky and Intertemporal ChoicePoster4 citations
- Latent-EnSF: A Latent Ensemble Score Filter for High-Dimensional Data Assimilation with Sparse Observation DataPoster4 citations
- Learning Continually by Spectral RegularizationPoster4 citations
- Learning Evolving Tools for Large Language ModelsPoster4 citations
- Learning Long Range Dependencies on Graphs via Random WalksPoster4 citations
- Learning system dynamics without forgettingPoster4 citations
- Learning to Steer Markovian Agents under Model UncertaintyPoster4 citations
- Leveraging Sub-Optimal Data for Human-in-the-Loop Reinforcement LearningPoster4 citations
- Linear Combination of Saved Checkpoints Makes Consistency and Diffusion Models BetterPoster4 citations
- Local-Prompt: Extensible Local Prompts for Few-Shot Out-of-Distribution DetectionPoster4 citations
- Locality-aware Gaussian Compression for Fast and High-quality RenderingPoster4 citations
- Looking Inward: Language Models Can Learn About Themselves by IntrospectionPoster4 citations
- LucidPPN: Unambiguous Prototypical Parts Network for User-centric Interpretable Computer VisionPoster4 citations
- Many-Objective Multi-Solution TransportPoster4 citations
- MatExpert: Decomposing Materials Discovery By Mimicking Human ExpertsPoster4 citations
- MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical CodeSpotlight4 citations
- Mind the Gap: Examining the Self-Improvement Capabilities of Large Language ModelsOral4 citations
- MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation ExpertsOral4 citations
- Modeling Future Conversation Turns to Teach LLMs to Ask Clarifying QuestionsPoster4 citations
- Modeling dynamic social vision highlights gaps between deep learning and humansPoster4 citations
- MotherNet: Fast Training and Inference via Hyper-Network TransformersPoster4 citations
- NarrativeBridge: Enhancing Video Captioning with Causal-Temporal NarrativePoster4 citations
- Neural Sampling from Boltzmann Densities: Fisher-Rao Curves in the Wasserstein GeometryPoster4 citations
- NeuroLM: A Universal Multi-task Foundation Model for Bridging the Gap between Language and EEG SignalsPoster4 citations
- Non-myopic Generation of Language Models for Reasoning and PlanningPoster4 citations
- Nonasymptotic Analysis of Stochastic Gradient Descent with the Richardson–Romberg ExtrapolationPoster4 citations
- Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and ReasoningPoster4 citations
- Not All Prompts Are Made Equal: Prompt-based Pruning of Text-to-Image Diffusion ModelsPoster4 citations
- On the Feature Learning in Diffusion ModelsPoster4 citations
- On the Optimal Memorization Capacity of TransformersPoster4 citations
- On the Role of Attention Heads in Large Language Model SafetyOral4 citations
- Open-Set Graph Anomaly Detection via Normal Structure RegularisationPoster4 citations
- PhyMPGN: Physics-encoded Message Passing Graph Network for spatiotemporal PDE systemsSpotlight4 citations
- Presto! Distilling Steps and Layers for Accelerating Music GenerationSpotlight4 citations
- Probabilistic Conformal Prediction with Approximate Conditional ValidityPoster4 citations
- PuzzleFusion++: Auto-agglomerative 3D Fracture Assembly by Denoise and VerifyPoster4 citations
- Quamba: A Post-Training Quantization Recipe for Selective State Space ModelsPoster4 citations
- RAG-DDR: Optimizing Retrieval-Augmented Generation Using Differentiable Data RewardsPoster4 citations
- RecFlow: An Industrial Full Flow Recommendation DatasetPoster4 citations
- Refine Knowledge of Large Language Models via Adaptive Contrastive LearningPoster4 citations
- Rethinking Artistic Copyright Infringements In the Era Of Text-to-Image Generative ModelsPoster4 citations
- Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?Spotlight4 citations
- Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation ModelsPoster4 citations
- Revisiting In-context Learning Inference Circuit in Large Language ModelsPoster4 citations
- Revisiting Prefix-tuning: Statistical Benefits of Reparameterization among PromptsPoster4 citations
- RobustKV: Defending Large Language Models against Jailbreak Attacks via KV EvictionPoster4 citations
- Scaling up Masked Diffusion Models on TextPoster4 citations
- Self-Boosting Large Language Models with Synthetic Preference DataPoster4 citations
- Shallow diffusion networks provably learn hidden low-dimensional structurePoster4 citations
- SimPER: A Minimalist Approach to Preference Alignment without HyperparametersPoster4 citations
- SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video GenerationSpotlight4 citations
- SmartRAG: Jointly Learn RAG-Related Tasks From the Environment FeedbackPoster4 citations
- Standard Gaussian Process is All You Need for High-Dimensional Bayesian OptimizationOral4 citations
- Streaming Video Question-Answering with In-context Video KV-Cache RetrievalPoster4 citations
- Streamlining Redundant Layers to Compress Large Language ModelsSpotlight4 citations
- Sufficient Context: A New Lens on Retrieval Augmented Generation SystemsPoster4 citations
- Syntactic and Semantic Control of Large Language Models via Sequential Monte CarloOral4 citations
- TULIP: Token-length Upgraded CLIPPoster4 citations
- Tell me about yourself: LLMs are aware of their learned behaviorsSpotlight4 citations
- TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric MeshesOral4 citations
- The Crucial Role of Samplers in Online Direct Preference OptimizationPoster4 citations
- The Superposition of Diffusion Models Using the Itô Density EstimatorSpotlight4 citations
- ThermalGaussian: Thermal 3D Gaussian SplattingPoster4 citations
- TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse AttentionPoster4 citations
- To Code or Not To Code? Exploring Impact of Code in Pre-trainingPoster4 citations
- Tool-Planner: Task Planning with Clusters across Multiple ToolsPoster4 citations
- ToolDial: Multi-turn Dialogue Generation Method for Tool-Augmented Language ModelsPoster4 citations
- Topograph: An Efficient Graph-Based Framework for Strictly Topology Preserving Image SegmentationSpotlight4 citations
- Towards Neural Scaling Laws for Time Series Foundation ModelsPoster4 citations
- Tree-Wasserstein Distance for High Dimensional Data with a Latent Feature HierarchyPoster4 citations
- UNSURE: self-supervised learning with Unknown Noise level and Stein's Unbiased Risk EstimatePoster4 citations
- Vec2Face: Scaling Face Dataset Generation with Loosely Constrained VectorsPoster4 citations
- Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised DisentanglementPoster4 citations
- Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMsPoster4 citations
- Ward: Provable RAG Dataset Inference via LLM WatermarksPoster4 citations
- Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned ModelSpotlight4 citations
- WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement LearningPoster4 citations
- What Does It Mean to Be a Transformer? Insights from a Theoretical Hessian AnalysisSpotlight4 citations
- What is Wrong with Perplexity for Long-context Language Modeling?Poster4 citations
- When Attention Sink Emerges in Language Models: An Empirical ViewSpotlight4 citations
- WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language ModelsPoster4 citations
- You Only Sample Once: Taming One-Step Text-to-Image Synthesis by Self-Cooperative Diffusion GANsPoster4 citations
- Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation ModelsPoster4 citations
- A Policy-Gradient Approach to Solving Imperfect-Information Games with Best-Iterate ConvergencePoster3 citations
- ADAM: An Embodied Causal Agent in Open-World EnvironmentsPoster3 citations
- AdaGrad under Anisotropic SmoothnessPoster3 citations
- AdaRankGrad: Adaptive Gradient Rank and Moments for Memory-Efficient LLMs Training and Fine-TuningPoster3 citations
- Adaptive Deployment of Untrusted LLMs Reduces Distributed ThreatsPoster3 citations
- Adaptive teachers for amortized samplersPoster3 citations
- Air Quality Prediction with Physics-Guided Dual Neural ODEs in Open SystemsPoster3 citations
- Arithmetic Transformers Can Length-Generalize in Both Operand Length and CountPoster3 citations
- AssembleFlow: Rigid Flow Matching with Inertial Frames for Molecular AssemblyPoster3 citations
- Associative memory and dead neuronsPoster3 citations
- Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language ModelsPoster3 citations
- Atlas Gaussians Diffusion for 3D GenerationSpotlight3 citations
- AtomSurf: Surface Representation for Learning on Protein StructuresPoster3 citations
- Attention in Large Language Models Yields Efficient Zero-Shot Re-RankersPoster3 citations
- Attention with Markov: A Curious Case of Single-layer TransformersSpotlight3 citations
- Backdooring Vision-Language Models with Out-Of-Distribution DataPoster3 citations
- Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model CompressionPoster3 citations
- Beyond Canonicalization: How Tensorial Messages Improve Equivariant Message PassingPoster3 citations
- Beyond Model Collapse: Scaling Up with Synthesized Data Requires VerificationPoster3 citations
- Block Verification Accelerates Speculative DecodingPoster3 citations
- Breaking Class Barriers: Efficient Dataset Distillation via Inter-Class Feature CompensatorPoster3 citations
- Budgeted Online Continual Learning by Adaptive Layer Freezing and Frequency-based SamplingSpotlight3 citations
- CAT-3DGS: A Context-Adaptive Triplane Approach to Rate-Distortion-Optimized 3DGS CompressionPoster3 citations
- CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMsPoster3 citations
- CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular FusionPoster3 citations
- CipherPrune: Efficient and Scalable Private Transformer InferencePoster3 citations
- Closed-Form Merging of Parameter-Efficient Modules for Federated Continual LearningPoster3 citations
- CodePlan: Unlocking Reasoning Potential in Large Language Models by Scaling Code-form PlanningPoster3 citations
- Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question AnsweringPoster3 citations
- Conformal Prediction Sets Can Cause Disparate ImpactSpotlight3 citations
- Conformalized Interactive Imitation Learning: Handling Expert Shift and Intermittent FeedbackPoster3 citations
- Continuous Diffusion for Mixed-Type Tabular DataPoster3 citations
- Controllable Context Sensitivity and the Knob Behind ItPoster3 citations
- Controlling Language and Diffusion Models by Transporting ActivationsSpotlight3 citations
- Convergence of Score-Based Discrete Diffusion Models: A Discrete-Time AnalysisPoster3 citations
- Convergent Privacy Loss of Noisy-SGD without Convexity and SmoothnessPoster3 citations
- CraftRTL: High-quality Synthetic Data Generation for Verilog Code Models with Correct-by-Construction Non-Textual Representations and Targeted Code RepairPoster3 citations
- Cross-Modal Safety Mechanism Transfer in Large Vision-Language ModelsPoster3 citations
- CtrLoRA: An Extensible and Efficient Framework for Controllable Image GenerationPoster3 citations
- CubeDiff: Repurposing Diffusion-Based Image Models for Panorama GenerationSpotlight3 citations
- DELIFT: Data Efficient Language model Instruction Fine-TuningPoster3 citations
- DSPO: Direct Score Preference Optimization for Diffusion Model AlignmentOral3 citations
- DartControl: A Diffusion-Based Autoregressive Motion Model for Real-Time Text-Driven Motion ControlSpotlight3 citations
- DeepRTL: Bridging Verilog Understanding and Generation with a Unified Representation ModelSpotlight3 citations
- DenseMatcher: Learning 3D Semantic Correspondence for Category-Level Manipulation from a Single DemoSpotlight3 citations
- Deriving Causal Order from Single-Variable Interventions: Guarantees & AlgorithmPoster3 citations
- Diff-Prompt: Diffusion-Driven Prompt Generator with Mask SupervisionPoster3 citations
- Differential learning kinetics govern the transition from memorization to generalization during in-context learningSpotlight3 citations
- Diffusion Transformer Captures Spatial-Temporal Dependencies: A Theory for Gaussian Process DataPoster3 citations
- Diffusion-Based Planning for Autonomous Driving with Flexible GuidanceOral3 citations
- Discrete Diffusion Schrödinger Bridge Matching for Graph TransformationPoster3 citations
- Diversity-Rewarded CFG DistillationPoster3 citations
- Do LLMs have Consistent Values?Poster3 citations
- Duoduo CLIP: Efficient 3D Understanding with Multi-View ImagesPoster3 citations
- Efficient Diffusion Transformer Policies with Mixture of Expert Denoisers for Multitask LearningPoster3 citations
- Efficient Policy Evaluation with Safety Constraint for Reinforcement LearningPoster3 citations
- Efficiently Parameterized Neural Metriplectic SystemsPoster3 citations
- Empowering LLM Agents with Zero-Shot Optimal Decision-Making through Q-learningPoster3 citations
- Endless Jailbreaks with Bijection LearningPoster3 citations
- Estimating the Probabilities of Rare Outputs in Language ModelsSpotlight3 citations
- Expected Sliced Transport PlansPoster3 citations
- Failures to Find Transferable Image Jailbreaks Between Vision-Language ModelsPoster3 citations
- Fair Submodular CoverPoster3 citations
- Flow matching achieves almost minimax optimal convergencePoster3 citations
- Fourier Head: Helping Large Language Models Learn Complex Probability DistributionsPoster3 citations
- Framer: Interactive Frame InterpolationPoster3 citations
- From Isolated Conversations to Hierarchical Schemas: Dynamic Tree Memory Representation for LLMsPoster3 citations
- GTR: Improving Large 3D Reconstruction Models through Geometry and Texture RefinementPoster3 citations
- Gap-Dependent Bounds for Q-Learning using Reference-Advantage DecompositionSpotlight3 citations
- Generalized Principal-Agent Problem with a Learning AgentSpotlight3 citations
- Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward PassPoster3 citations
- Glauber Generative Model: Discrete Diffusion Models via Binary ClassificationPoster3 citations
- GlycanML: A Multi-Task and Multi-Structure Benchmark for Glycan Machine LearningPoster3 citations
- Going Beyond Feature Similarity: Effective Dataset distillation based on Class-aware Conditional Mutual InformationPoster3 citations
- GotenNet: Rethinking Efficient 3D Equivariant Graph Neural NetworksPoster3 citations
- Guaranteed Generation from Large Language ModelsPoster3 citations
- HarmAug: Effective Data Augmentation for Knowledge Distillation of Safety Guard ModelsPoster3 citations
- Harnessing Webpage UIs for Text-Rich Visual UnderstandingPoster3 citations
- HiRA: Parameter-Efficient Hadamard High-Rank Adaptation for Large Language ModelsOral3 citations
- High-dimensional Analysis of Knowledge Distillation: Weak-to-Strong Generalization and Scaling LawsSpotlight3 citations
- IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language ModelPoster3 citations
- IGL-Bench: Establishing the Comprehensive Benchmark for Imbalanced Graph LearningSpotlight3 citations
- IPDreamer: Appearance-Controllable 3D Object Generation with Complex Image PromptsPoster3 citations
- IRIS: LLM-Assisted Static Analysis for Detecting Security VulnerabilitiesPoster3 citations
- Identifiable Exchangeable Mechanisms for Causal Structure and Representation LearningSpotlight3 citations
- Improved Finite-Particle Convergence Rates for Stein Variational Gradient DescentOral3 citations
- Improving Data Efficiency via Curating LLM-Driven Rating SystemsPoster3 citations
- Improving Long-Text Alignment for Text-to-Image Diffusion ModelsPoster3 citations
- Improving Uncertainty Estimation through Semantically Diverse Language GenerationPoster3 citations
- Imputation for prediction: beware of diminishing returns.Spotlight3 citations
ICLR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.