← All conferences

ICML 2025 Accepted Papers

The full list of 3,333 papers accepted at ICML 2025 (International Conference on Machine Learning). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,988Spotlight: 225Oral: 120
  1. Learning to (Learn at Test Time): RNNs with Expressive Hidden StatesSpotlight90 citations
  2. AdvPrompter: Fast Adaptive Adversarial Prompting for LLMsPoster88 citations
  3. rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep ThinkingOral78 citations
  4. SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-trainingPoster72 citations
  5. MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose GuidancePoster65 citations
  6. LongVU: Spatiotemporal Adaptive Compression for Long Video-Language UnderstandingPoster59 citations
  7. DPO Meets PPO: Reinforced Token Optimization for RLHFSpotlight58 citations
  8. Demystifying Long Chain-of-Thought ReasoningPoster51 citations
  9. OR-Bench: An Over-Refusal Benchmark for Large Language ModelsPoster47 citations
  10. Agent Workflow MemoryPoster42 citations
  11. What If We Recaption Billions of Web Images with LLaMA-3?Poster38 citations
  12. Free Process Rewards without Process LabelsPoster36 citations
  13. How Far Is Video Generation from World Model: A Physical Law PerspectivePoster35 citations
  14. Agent-as-a-Judge: Evaluate Agents with AgentsPoster34 citations
  15. LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language ModelsPoster34 citations
  16. Windows Agent Arena: Evaluating Multi-Modal OS Agents at ScalePoster33 citations
  17. Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM ReasoningPoster32 citations
  18. Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLMPoster32 citations
  19. Theoretical guarantees on the best-of-n alignment policyPoster31 citations
  20. Nonparametric Modern Hopfield ModelsPoster30 citations
  21. Discrepancy Minimization in Input-Sparsity TimeSpotlight29 citations
  22. Aguvis: Unified Pure Vision Agents for Autonomous GUI InteractionPoster27 citations
  23. High-Dimensional Prediction for Sequential Decision MakingOral26 citations
  24. RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement LearningSpotlight25 citations
  25. Cradle: Empowering Foundation Agents towards General Computer ControlPoster22 citations
  26. Imagine While Reasoning in Space: Multimodal Visualization-of-ThoughtPoster22 citations
  27. Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video GenerationPoster22 citations
  28. Training Software Engineering Agents and Verifiers with SWE-GymPoster22 citations
  29. Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans WorsePoster21 citations
  30. Optimizing Test-Time Compute via Meta Reinforcement FinetuningPoster21 citations
  31. AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoMLPoster20 citations
  32. Taming Rectified Flow for Inversion and EditingPoster19 citations
  33. VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series ForecastersPoster19 citations
  34. WorldSimBench: Towards Video Generation Models as World SimulatorsPoster18 citations
  35. AutoEval Done Right: Using Synthetic Data for Model EvaluationPoster17 citations
  36. Automatically Interpreting Millions of Features in Large Language ModelsPoster17 citations
  37. DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot PlanningPoster17 citations
  38. FourierMamba: Fourier Learning Integration with State Space Models for Image DerainingPoster17 citations
  39. G-Designer: Architecting Multi-agent Communication Topologies via Graph Neural NetworksSpotlight17 citations
  40. The Surprising Effectiveness of Test-Time Training for Few-Shot LearningPoster17 citations
  41. Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMsOral16 citations
  42. FlipAttack: Jailbreak LLMs via FlippingPoster16 citations
  43. Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion ModelPoster16 citations
  44. MedXpertQA: Benchmarking Expert-Level Medical Reasoning and UnderstandingPoster16 citations
  45. Putnam-AXIOM: A Functional & Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMsPoster16 citations
  46. RE-Bench: Evaluating Frontier AI R&D Capabilities of Language Model Agents against Human ExpertsSpotlight16 citations
  47. SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language ModelsPoster16 citations
  48. Thinking LLMs: General Instruction Following with Thought GenerationPoster16 citations
  49. A General Framework for Inference-time Scaling and Steering of Diffusion ModelsPoster15 citations
  50. AI for Global Climate Cooperation: Modeling Global Climate Negotiations, Agreements, and Long-Term Cooperation in RICE-NPoster14 citations
  51. Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM’s Reasoning CapabilityPoster14 citations
  52. Graph-constrained Reasoning: Faithful Reasoning on Knowledge Graphs with Large Language ModelsPoster14 citations
  53. MoH: Multi-Head Attention as Mixture-of-Head AttentionPoster14 citations
  54. Reward-Guided Speculative Decoding for Efficient LLM ReasoningPoster14 citations
  55. WMAdapter: Adding WaterMark Control to Latent Diffusion ModelsPoster14 citations
  56. Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?Poster14 citations
  57. FlowAR: Scale-wise Autoregressive Image Generation Meets Flow MatchingPoster13 citations
  58. Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-JudgePoster13 citations
  59. Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language ModelsPoster13 citations
  60. MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard PerturbationsPoster13 citations
  61. MM-RLHF: The Next Step Forward in Multimodal LLM AlignmentPoster13 citations
  62. NETS: A Non-equilibrium Transport SamplerPoster13 citations
  63. SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?Oral13 citations
  64. Shortcut-connected Expert Parallelism for Accelerating Mixture of ExpertsPoster13 citations
  65. Addressing Misspecification in Simulation-based Inference through Data-driven CalibrationOral12 citations
  66. AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse AutoencodersSpotlight12 citations
  67. Parrot: Multilingual Visual Instruction TuningPoster12 citations
  68. SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion TransformerPoster12 citations
  69. Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language ModelsSpotlight11 citations
  70. Context is Key: A Benchmark for Forecasting with Essential Textual InformationPoster11 citations
  71. Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action ModelsPoster11 citations
  72. Learning Adversarial MDPs with Stochastic Hard ConstraintsPoster11 citations
  73. One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion DistillationPoster11 citations
  74. Proposer-Agent-Evaluator (PAE): Autonomous Skill Discovery For Foundation Model Internet AgentsPoster11 citations
  75. Sparse Video-Gen: Accelerating Video Diffusion Transformers with Spatial-Temporal SparsityPoster11 citations
  76. Star Attention: Efficient LLM Inference over Long SequencesPoster11 citations
  77. Contrastive Localized Language-Image Pre-TrainingPoster10 citations
  78. Diffusion Adversarial Post-Training for One-Step Video GenerationPoster10 citations
  79. Editable Concept Bottleneck ModelsPoster10 citations
  80. EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied AgentsOral10 citations
  81. Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic LocalizationSpotlight10 citations
  82. Subobject-level Image TokenizationPoster10 citations
  83. Token Assorted: Mixing Latent and Text Tokens for Improved Language Model ReasoningPoster10 citations
  84. A Manifold Perspective on the Statistical Generalization of Graph Neural NetworksPoster9 citations
  85. A Trichotomy for List Transductive Online LearningPoster9 citations
  86. An analytic theory of creativity in convolutional diffusion modelsOral9 citations
  87. Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning AbilitiesPoster9 citations
  88. EARTH: Epidemiology-Aware Neural ODE with Continuous Disease Transmission GraphPoster9 citations
  89. Learn from Downstream and Be Yourself in Multimodal Large Language Models Fine-TuningPoster9 citations
  90. Normalizing Flows are Capable Generative ModelsOral9 citations
  91. Programming Every Example: Lifting Pre-training Data Quality Like Experts at ScalePoster9 citations
  92. Self-Consistency Preference OptimizationPoster9 citations
  93. The dark side of the forces: assessing non-conservative force models for atomistic machine learningOral9 citations
  94. Video Prediction Policy: A Generalist Robot Policy with Predictive Visual RepresentationsSpotlight9 citations
  95. AnyEdit: Edit Any Knowledge Encoded in Language ModelsPoster8 citations
  96. Automated Red Teaming with GOAT: the Generative Offensive Agent TesterPoster8 citations
  97. Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated AttentionPoster8 citations
  98. CodeIO: Condensing Reasoning Patterns via Code Input-Output PredictionOral8 citations
  99. Collapse or Thrive: Perils and Promises of Synthetic Data in a Self-Generating WorldPoster8 citations
  100. Compute or Load KV Cache? Why Not Both?Poster8 citations
  101. Distillation Scaling LawsPoster8 citations
  102. Diverging Preferences: When do Annotators Disagree and do Models Know?Poster8 citations
  103. Flow-field inference from neural data using deep recurrent networksPoster8 citations
  104. How to set AdamW's weight decay as you scale model and dataset sizePoster8 citations
  105. KAN-AD: Time Series Anomaly Detection with Kolmogorov–Arnold NetworksPoster8 citations
  106. Limitations of measure-first protocols in quantum machine learningPoster8 citations
  107. Masked Autoencoders Are Effective Tokenizers for Diffusion ModelsSpotlight8 citations
  108. Modular Duality in Deep LearningPoster8 citations
  109. Optimizing Large Language Model Training Using FP4 QuantizationPoster8 citations
  110. Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific HeadsPoster8 citations
  111. Scaling Test-Time Compute Without Verification or RL is SuboptimalSpotlight8 citations
  112. Selective Prompt Anchoring for Code GenerationPoster8 citations
  113. Understanding Mode Connectivity via Parameter Space SymmetryPoster8 citations
  114. VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video ModelsOral8 citations
  115. Wyckoff Transformer: Generation of Symmetric CrystalsPoster8 citations
  116. Adaptive Message Passing: A General Framework to Mitigate Oversmoothing, Oversquashing, and UnderreachingPoster7 citations
  117. Adversaries Can Misuse Combinations of Safe ModelsPoster7 citations
  118. AlphaVerus: Bootstrapping Formally Verified Code Generation through Self-Improving Translation and TreefinementPoster7 citations
  119. Autoformulation of Mathematical Optimization Models Using LLMsPoster7 citations
  120. DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference OptimizationPoster7 citations
  121. Geometry-Informed Neural NetworksPoster7 citations
  122. No-Regret is not enough! Bandits with General Constraints through Adaptive Regret MinimizationPoster7 citations
  123. NoLiMa: Long-Context Evaluation Beyond Literal MatchingPoster7 citations
  124. Synthetic Face Datasets Generation via Latent Space Exploration from Brownian Identity DiffusionPoster7 citations
  125. TabPFN Unleashed: A Scalable and Effective Solution to Tabular Classification ProblemsPoster7 citations
  126. Think Smarter not Harder: Adaptive Reasoning with Inference Aware OptimizationPoster7 citations
  127. ZebraLogic: On the Scaling Limits of LLMs for Logical ReasoningPoster7 citations
  128. A Physics-Informed Machine Learning Framework for Safe and Optimal Control of Autonomous SystemsPoster6 citations
  129. AdaptiveStep: Automatically Dividing Reasoning Step through Model ConfidencePoster6 citations
  130. Alpha-SQL: Zero-Shot Text-to-SQL using Monte Carlo Tree SearchPoster6 citations
  131. CTBench: A Library and Benchmark for Certified TrainingPoster6 citations
  132. Clients Collaborate: Flexible Differentially Private Federated Learning with Guaranteed Improvement of Utility-Privacy Trade-offPoster6 citations
  133. Discrete Neural Algorithmic ReasoningPoster6 citations
  134. EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLMPoster6 citations
  135. Emergence in non-neural models: grokking modular arithmetic via average gradient outer productOral6 citations
  136. FACTER: Fairness-Aware Conformal Thresholding and Prompt Engineering for Enabling Fair LLM-Based Recommender SystemsPoster6 citations
  137. History-Guided Video DiffusionPoster6 citations
  138. Learning Smooth and Expressive Interatomic Potentials for Physical Property PredictionOral6 citations
  139. Learnings from Scaling Visual Tokenizers for Reconstruction and GenerationPoster6 citations
  140. Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant EvaluationPoster6 citations
  141. Mastering Board Games by External and Internal Planning with Language ModelsSpotlight6 citations
  142. Memory Layers at ScalePoster6 citations
  143. Model Swarms: Collaborative Search to Adapt LLM Experts via Swarm IntelligencePoster6 citations
  144. Multi-Session Budget Optimization for Forward Auction-based Federated LearningPoster6 citations
  145. Multi-agent Architecture Search via Agentic SupernetOral6 citations
  146. Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language ModelsPoster6 citations
  147. Position: Language model developers should report train-test overlapSpotlight6 citations
  148. QLASS: Boosting Language Agent Inference via Q-Guided Stepwise SearchPoster6 citations
  149. QMamba: On First Exploration of Vision Mamba for Image Quality AssessmentPoster6 citations
  150. Reducing Tool Hallucination via Reliability AlignmentPoster6 citations
  151. Self-Discriminative Modeling for Anomalous Graph DetectionPoster6 citations
  152. SepLLM: Accelerate Large Language Models by Compressing One Segment into One SeparatorPoster6 citations
  153. ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM InferenceSpotlight6 citations
  154. Step-DAD: Semi-Amortized Policy-Based Bayesian Experimental DesignPoster6 citations
  155. Subspace Optimization for Large Language Models with Convergence GuaranteesPoster6 citations
  156. TabICL: A Tabular Foundation Model for In-Context Learning on Large DataPoster6 citations
  157. Understanding Chain-of-Thought in LLMs through Information TheoryPoster6 citations
  158. Universal Length Generalization with Turing ProgramsPoster6 citations
  159. ViTally Consistent: Scaling Biological Representation Learning for Cell MicroscopyPoster6 citations
  160. Where is the Truth? The Risk of Getting Confounded in a Continual WorldSpotlight6 citations
  161. Which Attention Heads Matter for In-Context Learning?Poster6 citations
  162. Zero-Shot Generalization of GNNs over Distinct Attribute DomainsPoster6 citations
  163. Beyond Log-Concavity and Score Regularity: Improved Convergence Bounds for Score-Based Generative Models in W2-distancePoster5 citations
  164. Causal Discovery from Conditionally Stationary Time SeriesPoster5 citations
  165. Compress then Serve: Serving Thousands of LoRA Adapters with Little OverheadPoster5 citations
  166. Dissecting Submission Limit in Desk-Rejections: A Mathematical Analysis of Fairness in AI Conference PoliciesPoster5 citations
  167. Distilling the Knowledge in Data PruningPoster5 citations
  168. Dueling Convex Optimization with General PreferencesPoster5 citations
  169. EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image ModelingPoster5 citations
  170. EVOLvE: Evaluating and Optimizing LLMs For In-Context ExplorationPoster5 citations
  171. Efficient Time Series Processing for Transformers and State-Space Models through Token MergingPoster5 citations
  172. Fast Video Generation with Sliding Tile AttentionPoster5 citations
  173. Ferret: Federated Full-Parameter Tuning at Scale for Large Language ModelsPoster5 citations
  174. Fixing the Double Penalty in Data-Driven Weather Forecasting Through a Modified Spherical Harmonic Loss FunctionPoster5 citations
  175. FlatQuant: Flatness Matters for LLM QuantizationPoster5 citations
  176. From Language Models over Tokens to Language Models over CharactersSpotlight5 citations
  177. From Mechanistic Interpretability to Mechanistic Biology: Training, Evaluating, and Interpreting Sparse Autoencoders on Protein Language ModelsSpotlight5 citations
  178. From RAG to Memory: Non-Parametric Continual Learning for Large Language ModelsPoster5 citations
  179. FunBO: Discovering Acquisition Functions for Bayesian Optimization with FunSearchPoster5 citations
  180. HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge AdaptationSpotlight5 citations
  181. Improving LLMs for Recommendation with Out-Of-Vocabulary TokensPoster5 citations
  182. LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal DemonstrationsPoster5 citations
  183. Layer by Layer: Uncovering Hidden Representations in Language ModelsOral5 citations
  184. MARS: Unleashing the Power of Variance Reduction for Training Large ModelsPoster5 citations
  185. MAS-GPT: Training LLMs to Build LLM-based Multi-Agent SystemsPoster5 citations
  186. MedRAX: Medical Reasoning Agent for Chest X-rayPoster5 citations
  187. Metadata Conditioning Accelerates Language Model Pre-trainingPoster5 citations
  188. Monte Carlo Tree Search for Comprehensive Exploration in LLM-Based Automatic Heuristic DesignPoster5 citations
  189. OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature ExtractionPoster5 citations
  190. On Temperature Scaling and Conformal Prediction of Deep ClassifiersPoster5 citations
  191. On the Vulnerability of Applying Retrieval-Augmented Generation within Knowledge-Intensive Application DomainsPoster5 citations
  192. P(all-atom) Is Unlocking New Path For Protein DesignSpotlight5 citations
  193. PaperBench: Evaluating AI’s Ability to Replicate AI ResearchPoster5 citations
  194. PertEval-scFM: Benchmarking Single-Cell Foundation Models for Perturbation Effect PredictionPoster5 citations
  195. Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving TestingPoster5 citations
  196. SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic ManipulationPoster5 citations
  197. SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse AutoencodersPoster5 citations
  198. SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMsOral5 citations
  199. Sample, Scrutinize and Scale: Effective Inference-Time Search by Scaling VerificationPoster5 citations
  200. Scaling Laws for Pre-training Agents and World ModelsPoster5 citations
  201. Stochastic Deep Restoration Priors for Imaging Inverse ProblemsPoster5 citations
  202. Textual Unlearning Gives a False Sense of UnlearningPoster5 citations
  203. The Best of Both Worlds: Bridging Quality and Diversity in Data Selection with Bipartite GraphPoster5 citations
  204. The Brain's Bitter Lesson: Scaling Speech Decoding With Self-Supervised LearningPoster5 citations
  205. Annealing Flow Generative Models Towards Sampling High-Dimensional and Multi-Modal DistributionsPoster4 citations
  206. Are Sparse Autoencoders Useful? A Case Study in Sparse ProbingPoster4 citations
  207. Auditing $f$-differential privacy in one runOral4 citations
  208. Beyond Matryoshka: Revisiting Sparse Coding for Adaptive RepresentationOral4 citations
  209. Bring Reason to Vision: Understanding Perception and Reasoning through Model MergingPoster4 citations
  210. Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning BenchmarkOral4 citations
  211. DEFAME: Dynamic Evidence-based FAct-checking with Multimodal ExpertsPoster4 citations
  212. Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUsPoster4 citations
  213. EpiCoder: Encompassing Diversity and Complexity in Code GenerationPoster4 citations
  214. EraseAnything: Enabling Concept Erasure in Rectified Flow TransformersPoster4 citations
  215. Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling EvaluatorsPoster4 citations
  216. Exploring and Mitigating Adversarial Manipulation of Voting-Based LeaderboardsOral4 citations
  217. FireFlow: Fast Inversion of Rectified Flow for Image Semantic EditingPoster4 citations
  218. Fourier Position Embedding: Enhancing Attention’s Periodic Extension for Length GeneralizationPoster4 citations
  219. Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?Poster4 citations
  220. GeoPixel: Pixel Grounding Large Multimodal Model in Remote SensingPoster4 citations
  221. Gradient Boosting Reinforcement LearningPoster4 citations
  222. How to Synthesize Text Data without Model Collapse?Poster4 citations
  223. Importance Corrected Neural JKO SamplingPoster4 citations
  224. Is Noise Conditioning Necessary for Denoising Generative Models?Poster4 citations
  225. Large Language-Geometry Model: When LLM meets EquivariancePoster4 citations
  226. Locate-then-edit for Multi-hop Factual Recall under Knowledge EditingPoster4 citations
  227. Multimodal Medical Code TokenizerPoster4 citations
  228. Optimizing Adaptive Attacks against Watermarks for Language ModelsSpotlight4 citations
  229. Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D ModelsPoster4 citations
  230. PENCIL: Long Thoughts with Short MemoryPoster4 citations
  231. Position: LLM Social Simulations Are a Promising Research MethodPoster4 citations
  232. ReFocus: Visual Editing as a Chain of Thought for Structured Image UnderstandingPoster4 citations
  233. RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive LearningPoster4 citations
  234. Rethinking External Slow-Thinking: From Snowball Errors to Probability of Correct ReasoningPoster4 citations
  235. Ringmaster ASGD: The First Asynchronous SGD with Optimal Time ComplexityPoster4 citations
  236. Risk and cross validation in ridge regression with correlated samplesPoster4 citations
  237. Robust Autonomy Emerges from Self-PlayPoster4 citations
  238. SITCOM: Step-wise Triple-Consistent Diffusion Sampling For Inverse ProblemsPoster4 citations
  239. SafeArena: Evaluating the Safety of Autonomous Web AgentsPoster4 citations
  240. Teaching Transformers Causal Reasoning through Axiomatic TrainingPoster4 citations
  241. TimeBridge: Non-Stationarity Matters for Long-term Time Series ForecastingPoster4 citations
  242. TopoTune: A Framework for Generalized Combinatorial Complex Neural NetworksPoster4 citations
  243. Towards Black-Box Membership Inference Attack for Diffusion ModelsPoster4 citations
  244. Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked DiffusionsOral4 citations
  245. Training Deep Learning Models with Norm-Constrained LMOsSpotlight4 citations
  246. Universal Sparse Autoencoders: Interpretable Cross-Model Concept AlignmentPoster4 citations
  247. VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning DataOral4 citations
  248. A Hitchhiker's Guide to Scaling Law EstimationPoster3 citations
  249. A Large Recurrent Action Model: xLSTM enables Fast Inference for Robotics TasksPoster3 citations
  250. A Simple Model of Inference Scaling LawsPoster3 citations
  251. AdaWorld: Learning Adaptable World Models with Latent ActionsPoster3 citations
  252. Adaptive Learn-then-Test: Statistically Valid and Efficient Hyperparameter SelectionSpotlight3 citations
  253. AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language ModelsOral3 citations
  254. Bongard in Wonderland: Visual Puzzles that Still Make AI Go Mad?Poster3 citations
  255. CaDA: Cross-Problem Routing Solver with Constraint-Aware Dual-AttentionPoster3 citations
  256. Commute Graph Neural NetworksPoster3 citations
  257. Complex Wavelet Mutual Information Loss: A Multi-Scale Loss Function for Semantic SegmentationPoster3 citations
  258. Compositional Risk MinimizationPoster3 citations
  259. Contextual Bandits for Unbounded Context DistributionsPoster3 citations
  260. DSP: Dynamic Sequence Parallelism for Multi-Dimensional TransformersPoster3 citations
  261. DeFoG: Discrete Flow Matching for Graph GenerationOral3 citations
  262. Decision Making under the Exponential Family: Distributionally Robust Optimisation with Bayesian Ambiguity SetsSpotlight3 citations
  263. Decision Theoretic Foundations for Conformal Prediction: Optimal Uncertainty Quantification for Risk-Averse AgentsSpotlight3 citations
  264. Deliberation in Latent Space via Differentiable Cache AugmentationPoster3 citations
  265. Diffusion models for Gaussian distributions: Exact solutions and Wasserstein errorsPoster3 citations
  266. Disentangling and Integrating Relational and Sensory Information in Transformer ArchitecturesPoster3 citations
  267. Distributed Event-Based Learning via ADMMPoster3 citations
  268. Distributional Diffusion Models with Scoring RulesPoster3 citations
  269. Does Graph Prompt Work? A Data Operation Perspective with Theoretical AnalysisPoster3 citations
  270. Doubly Robust Conformalized Survival Analysis with Right-Censored DataSpotlight3 citations
  271. EasyInv: Toward Fast and Better DDIM InversionPoster3 citations
  272. Eliciting Language Model Behaviors with Investigator AgentsPoster3 citations
  273. Elucidating the design space of language models for image generationPoster3 citations
  274. Emergent Symbolic Mechanisms Support Abstract Reasoning in Large Language ModelsPoster3 citations
  275. Everything Everywhere All at Once: LLMs can In-Context Learn Multiple Tasks in SuperpositionSpotlight3 citations
  276. ExPLoRA: Parameter-Efficient Extended Pre-Training to Adapt Vision Transformers under Domain ShiftsPoster3 citations
  277. GenMol: A Drug Discovery Generalist with Discrete DiffusionPoster3 citations
  278. Guardians of Image Quality: Benchmarking Defenses Against Adversarial Attacks on Image Quality MetricsPoster3 citations
  279. HashAttention: Semantic Sparsity for Faster InferencePoster3 citations
  280. Hyperband-based Bayesian Optimization for Black-box Prompt SelectionPoster3 citations
  281. Improving LLM Safety Alignment with Dual-Objective OptimizationPoster3 citations
  282. Improving Your Model Ranking on Chatbot Arena by Vote RiggingPoster3 citations
  283. In-Context Learning and Occam's RazorPoster3 citations
  284. InfAlign: Inference-aware language model alignmentPoster3 citations
  285. KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree SearchPoster3 citations
  286. Lexico: Extreme KV Cache Compression via Sparse Coding over Universal DictionariesPoster3 citations
  287. LightningDrag: Lightning Fast and Accurate Drag-based Image Editing Emerging from VideosPoster3 citations
  288. MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement LearningPoster3 citations
  289. MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference OptimizationPoster3 citations
  290. Machines and Mathematical Mutations: Using GNNs to Characterize Quiver Mutation ClassesPoster3 citations
  291. Mechanisms of Projective Composition of Diffusion ModelsPoster3 citations
  292. MetaOptimize: A Framework for Optimizing Step Sizes and Other Meta-parametersPoster3 citations
  293. Metastable Dynamics of Chain-of-Thought Reasoning: Provable Benefits of Search, RL and DistillationPoster3 citations
  294. MiraGe: Editable 2D Images using Gaussian SplattingPoster3 citations
  295. Mitigating Heterogeneous Token Overfitting in LLM Knowledge EditingPoster3 citations
  296. Modeling Multi-Task Model Merging as Adaptive Projective Gradient DescentPoster3 citations
  297. Monte Carlo Tree Diffusion for System 2 PlanningSpotlight3 citations
  298. Monte-Carlo Tree Search with Uncertainty Propagation via Optimal TransportSpotlight3 citations
  299. Objective drives the consistency of representational similarity across datasetsPoster3 citations
  300. One Example Shown, Many Concepts Known! Counterexample-Driven Conceptual Reasoning in Mathematical LLMsPoster3 citations
  301. Optimizing Temperature for Language Models with Multi-Sample InferencePoster3 citations
  302. OrcaLoca: An LLM Agent Framework for Software Issue LocalizationPoster3 citations
  303. Parameter-Efficient Fine-Tuning of State Space ModelsPoster3 citations
  304. Point-Level Topological Representation Learning on Point CloudsPoster3 citations
  305. Position: Deep Learning is Not So Mysterious or DifferentSpotlight3 citations
  306. Position: Editing Large Language Models Poses Serious Safety RisksPoster3 citations
  307. ReQFlow: Rectified Quaternion Flow for Efficient and High-Quality Protein Backbone GenerationPoster3 citations
  308. ReVISE: Learning to Refine at Test-Time via Intrinsic Self-VerificationPoster3 citations
  309. Reasoning Limitations of Multimodal Large Language Models. A case study of Bongard ProblemsPoster3 citations
  310. Reasoning-as-Logic-Units: Scaling Test-Time Reasoning in Large Language Models Through Logic Unit AlignmentPoster3 citations
  311. Scaling Laws for Task-Optimized Models of the Primate Visual Ventral StreamSpotlight3 citations
  312. Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And MorePoster3 citations
  313. Sundial: A Family of Highly Capable Time Series Foundation ModelsOral3 citations
  314. Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual FeedbackPoster3 citations
  315. Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series ForecastingPoster3 citations
  316. Toward a Unified Theory of Gradient Descent under Generalized SmoothnessPoster3 citations
  317. Towards flexible perception with visual memoryPoster3 citations
  318. Understanding Model Ensemble in Transferable Adversarial AttackPoster3 citations
  319. Understanding the Emergence of Multimodal Representation AlignmentPoster3 citations
  320. video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language ModelPoster3 citations
  321. A Theoretical Framework For Overfitting In Energy-based ModelingPoster2 citations
  322. A Unified Approach to Routing and Cascading for LLMsPoster2 citations
  323. AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality AssessmentPoster2 citations
  324. Adaptive kernel predictors from feature-learning infinite limits of neural networksPoster2 citations
  325. AdvI2I: Adversarial Image Attack on Image-to-Image Diffusion ModelsPoster2 citations
  326. Archetypal SAE: Adaptive and Stable Dictionary Learning for Concept Extraction in Large Vision ModelsPoster2 citations
  327. AutoAdvExBench: Benchmarking Autonomous Exploitation of Adversarial Example DefensesOral2 citations
  328. AutoElicit: Using Large Language Models for Expert Prior Elicitation in Predictive ModellingPoster2 citations
  329. AutoStep: Locally adaptive involutive MCMCPoster2 citations
  330. BaxBench: Can LLMs Generate Correct and Secure Backends?Spotlight2 citations
  331. Benchmarking Quantum Reinforcement LearningPoster2 citations
  332. Best of Both Worlds: Advantages of Hybrid Graph Sequence ModelsPoster2 citations
  333. CVE-Bench: A Benchmark for AI Agents’ Ability to Exploit Real-World Web Application VulnerabilitiesSpotlight2 citations
  334. Clone-Robust AI AlignmentPoster2 citations
  335. CoSER: Coordinating LLM-Based Persona Simulation of Established RolesPoster2 citations
  336. CodeSteer: Symbolic-Augmented Language Models via Code/Text GuidancePoster2 citations
  337. Compression via Pre-trained Transformers: A Study on Byte-Level Multimodal DataPoster2 citations
  338. CtrlSynth: Controllable Image Text Synthesis for Data-Efficient Multimodal LearningPoster2 citations
  339. De-mark: Watermark Removal in Large Language ModelsPoster2 citations
  340. Dimension-Independent Rates for Structured Neural Density EstimationPoster2 citations
  341. Do Vision-Language Models Really Understand Visual Language?Poster2 citations
  342. Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical PerspectivePoster2 citations
  343. Does learning the right latent variables necessarily improve in-context learning?Poster2 citations
  344. Doubly Protected Estimation for Survival Outcomes Utilizing External Controls for Randomized Clinical TrialsPoster2 citations
  345. ESPFormer: Doubly-Stochastic Attention with Expected Sliced Transport PlansPoster2 citations
  346. Enhancing Foundation Models for Time Series Forecasting via Wavelet-based TokenizationPoster2 citations
  347. Enhancing Performance of Explainable AI Models with Constrained Concept RefinementPoster2 citations
  348. Enhancing Statistical Validity and Power in Hybrid Controlled Trials: A Randomization Inference Approach with Conformal Selective BorrowingPoster2 citations
  349. Event-Customized Image GenerationPoster2 citations
  350. Expressive Power of Graph Neural Networks for (Mixed-Integer) Quadratic ProgramsPoster2 citations
  351. Feynman-Kac Correctors in Diffusion: Annealing, Guidance, and Product of ExpertsSpotlight2 citations
  352. From Individual Experience to Collective Evidence: A Reporting-Based Framework for Identifying Systemic HarmsPoster2 citations
  353. G-Adaptivity: optimised graph-based mesh relocation for finite element methodsSpotlight2 citations
  354. Graph Generative Pre-trained TransformerPoster2 citations
  355. Guarantees of a Preconditioned Subgradient Algorithm for Overparameterized Asymmetric Low-rank Matrix RecoveryPoster2 citations
  356. Haste Makes Waste: A Simple Approach for Scaling Graph Neural NetworksPoster2 citations
  357. Hierarchical Equivariant Policy via Frame TransferPoster2 citations
  358. Idiosyncrasies in Large Language ModelsPoster2 citations
  359. Implicit degree bias in the link prediction taskPoster2 citations
  360. Improved Off-policy Reinforcement Learning in Biological Sequence DesignPoster2 citations
  361. Interpolating Neural Network-Tensor Decomposition (INN-TD): a scalable and interpretable approach for large-scale physics-based problemsPoster2 citations
  362. Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time AlignmentPoster2 citations
  363. Joint Learning of Energy-based Models and their Partition FunctionPoster2 citations
  364. KV Shifting Attention Enhances Language ModelingPoster2 citations
  365. LASER: Attention with Exponential TransformationPoster2 citations
  366. LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language ModelsOral2 citations
  367. LOGO --- Long cOntext aliGnment via efficient preference OptimizationPoster2 citations
  368. Latent Preference Coding: Aligning Large Language Models via Discrete Latent CodesPoster2 citations
  369. Learning Distances from Data with Normalizing Flows and Score MatchingPoster2 citations
  370. Learning Multi-Level Features with Matryoshka Sparse AutoencodersPoster2 citations
  371. Learning With Multi-Group Guarantees For Clusterable SubpopulationsPoster2 citations
  372. Learning multivariate Gaussians with imperfect advicePoster2 citations
  373. Linear Contextual Bandits With InterferencePoster2 citations
  374. Linearization Turns Neural Operators into Function-Valued Gaussian ProcessesSpotlight2 citations
  375. Long-Form Speech Generation with Spoken Language ModelsOral2 citations
  376. Lower Bounds for Chain-of-Thought Reasoning in Hard-Attention TransformersPoster2 citations
  377. MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUsPoster2 citations
  378. Measuring Diversity: Axioms and ChallengesPoster2 citations
  379. MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech RecognitionPoster2 citations
  380. MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible CostPoster2 citations
  381. Multi-Domain Graph Foundation Models: Robust Knowledge Transfer via Topology AlignmentPoster2 citations
  382. Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial FeedbackPoster2 citations
  383. Neural Genetic Search in Discrete SpacesPoster2 citations
  384. Observation Interference in Partially Observable Assistance GamesPoster2 citations
  385. On Expressive Power of Looped Transformers: Theoretical Analysis and Enhancement via Timestep EncodingPoster2 citations
  386. On-Device Collaborative Language Modeling via a Mixture of Generalists and SpecialistsPoster2 citations
  387. Online Learning with Unknown ConstraintsPoster2 citations
  388. Optimal transport-based conformal predictionPoster2 citations
  389. Over-Tokenized Transformer: Vocabulary is Generally Worth ScalingPoster2 citations
  390. Parametric Scaling Law of Tuning Bias in Conformal PredictionPoster2 citations
  391. PepTune: De Novo Generation of Therapeutic Peptides with Multi-Objective-Guided Discrete DiffusionPoster2 citations
  392. Persistent Topological Features in Large Language ModelsPoster2 citations
  393. Polynomial Time Learning Augmented Algorithms for NP-hard Permutation ProblemsPoster2 citations
  394. Position: Scaling LLM Agents Requires Asymptotic Analysis with LLM PrimitivesPoster2 citations
  395. Principled Data Selection for Alignment: The Hidden Risks of Difficult ExamplesPoster2 citations
  396. Probing Visual Language Priors in VLMsPoster2 citations
  397. Provably Efficient Exploration in Inverse Constrained Reinforcement LearningPoster2 citations
  398. Puzzle: Distillation-Based NAS for Inference-Optimized LLMsPoster2 citations
  399. QT-DoG: Quantization-Aware Training for Domain GeneralizationPoster2 citations
  400. ROPO: Robust Preference Optimization for Large Language ModelsPoster2 citations
  401. Reflection-Window Decoding: Text Generation with Selective RefinementPoster2 citations
  402. Regularized Langevin Dynamics for Combinatorial OptimizationPoster2 citations
  403. Reinforced Lifelong Editing for Language ModelsPoster2 citations
  404. Reliable and Efficient Amortized Model-based EvaluationPoster2 citations
  405. RepoAudit: An Autonomous LLM-Agent for Repository-Level Code AuditingPoster2 citations
  406. ResearchTown: Simulator of Human Research CommunityPoster2 citations
  407. Rethinking Aleatoric and Epistemic UncertaintyPoster2 citations
  408. Retraining with Predicted Hard Labels Provably Increases Model AccuracyPoster2 citations
  409. Revolve: Optimizing AI Systems by Tracking Response Evolution in Textual OptimizationPoster2 citations
  410. Reward Modeling with Ordinal Feedback: Wisdom of the CrowdPoster2 citations
  411. Reward-Augmented Data Enhances Direct Preference Alignment of LLMsPoster2 citations
  412. Robust Conformal Outlier Detection under Contaminated Reference DataPoster2 citations
  413. SENSEI: Semantic Exploration Guided by Foundation Models to Learn Versatile World ModelsPoster2 citations
  414. SPHINX: Structural Prediction using Hypergraph Inference NetworkPoster2 citations
  415. STAIR: Improving Safety Alignment with Introspective ReasoningOral2 citations
  416. Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive SearchPoster2 citations
  417. Scalable Equilibrium Sampling with Sequential Boltzmann GeneratorsPoster2 citations
  418. Scaling Laws for Differentially Private Language ModelsPoster2 citations
  419. Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization ChallengesPoster2 citations
  420. Sliding Puzzles Gym: A Scalable Benchmark for State Representation in Visual Reinforcement LearningPoster2 citations
  421. SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song GenerationPoster2 citations
  422. Stochastic Online Conformal Prediction with Semi-Bandit FeedbackPoster2 citations
  423. Structured Preconditioners in Adaptive Optimization: A Unified AnalysisPoster2 citations
  424. TabFlex: Scaling Tabular Learning to Millions with Linear AttentionSpotlight2 citations
  425. Teaching Language Models to Critique via Reinforcement LearningPoster2 citations
  426. The Double-Ellipsoid Geometry of CLIPPoster2 citations
  427. Thermalizer: Stable autoregressive neural emulation of spatiotemporal chaosPoster2 citations
  428. Tool Unlearning for Tool-Augmented LLMsPoster2 citations
  429. UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language ModelsPoster2 citations
  430. UP-VLA: A Unified Understanding and Prediction Model for Embodied AgentPoster2 citations
  431. Understanding Multimodal LLMs Under Distribution Shifts: An Information-Theoretic ApproachPoster2 citations
  432. VideoRoPE: What Makes for Good Video Rotary Position Embedding?Oral2 citations
  433. Wasserstein Flow Matching: Generative Modeling Over Families of DistributionsPoster2 citations
  434. Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent SystemsSpotlight2 citations
  435. X-Hacking: The Threat of Misguided AutoMLPoster2 citations
  436. Zebra: In-Context Generative Pretraining for Solving Parametric PDEsPoster2 citations
  437. Zero-Inflated BanditsPoster2 citations
  438. (How) Do Language Models Track State?Poster1 citations
  439. A Dynamical Systems-Inspired Pruning Strategy for Addressing Oversmoothing in Graph Attention NetworksPoster1 citations
  440. A Market for Accuracy: Classification Under CompetitionPoster1 citations
  441. A Memory Efficient Randomized Subspace Optimization Method for Training Large Language ModelsPoster1 citations
  442. A Meta-learner for Heterogeneous Effects in Difference-in-DifferencesPoster1 citations
  443. A Model of Place Field Reorganization During Reward MaximizationPoster1 citations
  444. A Theoretical Justification for Asymmetric Actor-Critic AlgorithmsPoster1 citations
  445. A Two-Stage Learning-to-Defer Approach for Multi-Task LearningPoster1 citations
  446. A Unified Comparative Study with Generalized Conformity Scores for Multi-Output Conformal RegressionPoster1 citations
  447. A Unified Framework for Entropy Search and Expected Improvement in Bayesian OptimizationOral1 citations
  448. A Unified View on Learning Unnormalized Distributions via Noise-Contrastive EstimationPoster1 citations
  449. Accelerated Diffusion Models via Speculative SamplingPoster1 citations
  450. Activation by Interval-wise Dropout: A Simple Way to Prevent Neural Networks from Plasticity LossPoster1 citations
  451. Active Evaluation Acquisition for Efficient LLM BenchmarkingPoster1 citations
  452. Active Learning of Deep Neural Networks via Gradient-Free Cutting PlanesPoster1 citations
  453. Adapting While Learning: Grounding LLMs for Scientific Problems with Tool Usage AdaptationPoster1 citations
  454. Adaptive Exploration for Multi-Reward Multi-Policy EvaluationPoster1 citations
  455. Adjustment for Confounding using Pre-Trained RepresentationsPoster1 citations
  456. Adversarial Reasoning at Jailbreaking TimePoster1 citations
  457. Adversarial Robustness in Two-Stage Learning-to-Defer: Algorithms and GuaranteesPoster1 citations
  458. Aligned Multi Objective OptimizationPoster1 citations
  459. An Analysis for Reasoning Bias of Language Models with Small InitializationSpotlight1 citations
  460. Arbitrarily-Conditioned Multi-Functional Diffusion for Multi-Physics EmulationPoster1 citations
  461. AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and RestorationPoster1 citations
  462. Automated Benchmark Generation for Repository-Level Coding TasksPoster1 citations
  463. Automated Hypothesis Validation with Agentic Sequential FalsificationsPoster1 citations
  464. Automatic Differentiation of Optimization Algorithms with Time-Varying UpdatesPoster1 citations
  465. Average Certified Radius is a Poor Metric for Randomized SmoothingPoster1 citations
  466. Avoiding spurious sharpness minimization broadens applicability of SAMPoster1 citations
  467. BARNN: A Bayesian Autoregressive and Recurrent Neural NetworkPoster1 citations
  468. BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model ReasoningPoster1 citations
  469. Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement LearningPoster1 citations
  470. Beyond Atoms: Enhancing Molecular Pretrained Representations with 3D Space ModelingPoster1 citations
  471. Beyond CVaR: Leveraging Static Spectral Risk Measures for Enhanced Decision-Making in Distributional Reinforcement LearningPoster1 citations
  472. Bipartite Ranking From Multiple Labels: On Loss Versus Label AggregationPoster1 citations
  473. Black-Box Adversarial Attacks on LLM-Based Code CompletionPoster1 citations
  474. Breaking the Quadratic Barrier: Robust Cardinality Sketches for Adaptive QueriesPoster1 citations
  475. C-3PO: Compact Plug-and-Play Proxy Optimization to Achieve Human-like Retrieval-Augmented GenerationPoster1 citations
  476. CROW: Eliminating Backdoors from Large Language Models via Internal Consistency RegularizationPoster1 citations
  477. Can Diffusion Models Learn Hidden Inter-Feature Rules Behind Images?Poster1 citations
  478. Can RLHF be More Efficient with Imperfect Reward Models? A Policy Coverage PerspectivePoster1 citations
  479. Can Transformers Reason Logically? A Study in SAT SolvingPoster1 citations
  480. Certification for Differentially Private Prediction in Gradient-Based TrainingPoster1 citations
  481. Chaos Meets Attention: Transformers for Large-Scale Dynamical PredictionPoster1 citations
  482. Closed-Loop Long-Horizon Robotic Planning via Equilibrium Sequence ModelingPoster1 citations
  483. CoDy: Counterfactual Explainers for Dynamic GraphsPoster1 citations
  484. CollabLLM: From Passive Responders to Active CollaboratorsOral1 citations
  485. Comparing Comparisons: Informative and Easy Human Feedback with Distinguishability QueriesPoster1 citations
  486. Compositional Causal Reasoning Evaluation in Language ModelsPoster1 citations
  487. Compressed Image Generation with Denoising Diffusion Codebook ModelsPoster1 citations
  488. ConceptAttention: Diffusion Transformers Learn Highly Interpretable FeaturesOral1 citations
  489. Conformal Prediction as Bayesian QuadratureOral1 citations
  490. Context Matters: Query-aware Dynamic Long Sequence Modeling of Gigapixel ImagesPoster1 citations
  491. Contextual Online Decision Making with Infinite-Dimensional Functional RegressionPoster1 citations
  492. Continuous Bayesian Model Selection for Multivariate Causal DiscoveryPoster1 citations
  493. Contrastive Private Data Synthesis via Weighted Multi-PLM FusionPoster1 citations
  494. Controlling Neural Collapse Enhances Out-of-Distribution Detection and Transfer LearningPoster1 citations
  495. Counterfactual Graphical Models: Constraints and InferenceSpotlight1 citations
  496. CursorCore: Assist Programming through Aligning AnythingPoster1 citations
  497. DCTdiff: Intriguing Properties of Image Generative Modeling in the DCT SpacePoster1 citations
  498. DOLPHIN: A Programmable Framework for Scalable Neurosymbolic LearningPoster1 citations
  499. Deep Bayesian Filter for Bayes-Faithful Data AssimilationPoster1 citations
  500. Deep Linear Network Training Dynamics from Random Initialization: Data, Width, Depth, and Hyperparameter TransferPoster1 citations
  501. Demonstration Selection for In-Context Learning via Reinforcement LearningPoster1 citations
  502. Density Ratio Estimation-based Bayesian Optimization with Semi-Supervised LearningPoster1 citations
  503. Detecting Strategic Deception with Linear ProbesPoster1 citations
  504. DiTAR: Diffusion Transformer Autoregressive Modeling for Speech GenerationPoster1 citations
  505. Dialogue Without Limits: Constant-Sized KV Caches for Extended Response in LLMsPoster1 citations
  506. Differential Coding for Training-Free ANN-to-SNN ConversionPoster1 citations
  507. Differential Privacy Under Class Imbalance: Methods and Empirical InsightsPoster1 citations
  508. Differentially Private BoxplotsPoster1 citations
  509. Discovering Symbolic Cognitive Models from Human and Animal BehaviorSpotlight1 citations
  510. Distillation of Discrete Diffusion through Dimensional CorrelationsPoster1 citations
  511. Distributionally Robust Policy Learning under Concept DriftsPoster1 citations
  512. Diversity By Design: Leveraging Distribution Matching for Offline Model-Based OptimizationPoster1 citations
  513. DriveGPT: Scaling Autoregressive Behavior Models for DrivingPoster1 citations
  514. Edge-Colored Clustering in Hypergraphs: Beyond Minimizing Unsatisfied EdgesPoster1 citations
  515. Effective and Efficient Masked Image Generation ModelsPoster1 citations
  516. Efficient Distributed Optimization under Heavy-Tailed NoisePoster1 citations
  517. Efficient and Scalable Density Functional Theory Hamiltonian Prediction through Adaptive SparsityPoster1 citations
  518. Efficiently Serving Large Multimodal Models Using EPD DisaggregationPoster1 citations
  519. Emotional Face-to-SpeechPoster1 citations
  520. Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference ModelPoster1 citations
  521. Exact risk curves of signSGD in High-Dimensions: quantifying preconditioning and noise-compression effectsPoster1 citations
  522. Expected Variational InequalitiesOral1 citations
  523. Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot GeneralizationPoster1 citations
  524. Exploring Representations and Interventions in Time Series Foundation ModelsPoster1 citations
  525. Extractive Structures Learned in Pretraining Enable Generalization on Finetuned FactsPoster1 citations
  526. Falsification of Unconfoundedness by Testing Independence of Causal MechanismsPoster1 citations
  527. Faster Global Minimum Cut with PredictionsPoster1 citations
  528. Features are fate: a theory of transfer learning in high-dimensional regressionPoster1 citations
  529. FlexTok: Resampling Images into 1D Token Sequences of Flexible LengthPoster1 citations
  530. Flexible Tails for Normalizing FlowsPoster1 citations
  531. Flexible and Efficient Grammar-Constrained DecodingPoster1 citations
  532. Flow Q-LearningPoster1 citations
  533. Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal ExamplesPoster1 citations
  534. Flow-of-Options: Diversified and Improved LLM Reasoning by Thinking Through OptionsPoster1 citations
  535. FrameBridge: Improving Image-to-Video Generation with Bridge ModelsPoster1 citations
  536. From Kernels to Features: A Multi-Scale Adaptive Theory of Feature LearningPoster1 citations
  537. From Logits to Hierarchies: Hierarchical Clustering made SimplePoster1 citations
  538. Fully Heteroscedastic Count Regression with Deep Double Poisson NetworksPoster1 citations
  539. Function-Space Learning RatesPoster1 citations
  540. Gap-Dependent Bounds for Federated $Q$-LearningPoster1 citations
  541. General framework for online-to-nonconvex conversion: Schedule-free SGD is also effective for nonconvex optimizationOral1 citations
  542. Generative Intervention Models for Causal Perturbation ModelingPoster1 citations
  543. Geometric Representation Condition Improves Equivariant Molecule GenerationSpotlight1 citations
  544. Gravity-Bench-v1: A Benchmark on Gravitational Physics Discovery for AgentsPoster1 citations
  545. High-Fidelity Simultaneous Speech-To-Speech TranslationPoster1 citations
  546. How Much Can We Forget about Data Contamination?Poster1 citations
  547. Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement LearningPoster1 citations
  548. Implicit Language Models are RNNs: Balancing Parallelization and ExpressivitySpotlight1 citations
  549. Impossible VideosPoster1 citations
  550. Improved Online Confidence Bounds for Multinomial Logistic BanditsPoster1 citations
  551. Improved Regret Analysis in Gaussian Process Bandits: Optimality for Noiseless Reward, RKHS norm, and Non-Stationary VarianceOral1 citations
  552. Improved Sample Complexity for Private Nonsmooth Nonconvex OptimizationPoster1 citations
  553. Improving LLM Video Understanding with 16 Frames Per SecondPoster1 citations
  554. IntLoRA: Integral Low-rank Adaptation of Quantized Diffusion ModelsPoster1 citations
  555. Inverse Problem Sampling in Latent Space Using Sequential Monte CarloPoster1 citations
  556. Is Complex Query Answering Really Complex?Spotlight1 citations
  557. Isolated Causal Effects of Natural LanguagePoster1 citations
  558. Joint Metric Space Embedding by Unbalanced Optimal Transport with Gromov–Wasserstein Marginal PenalizationPoster1 citations
  559. KernelBench: Can LLMs Write Efficient GPU Kernels?Poster1 citations
  560. Kinetic Langevin Diffusion for Crystalline Materials GenerationPoster1 citations
  561. LARM: Large Auto-Regressive Model for Long-Horizon Embodied IntelligencePoster1 citations
  562. LAuReL: Learned Augmented Residual LayerPoster1 citations
  563. LEAPS: A discrete neural sampler via locally equivariant networksPoster1 citations
  564. LIVS: A Pluralistic Alignment Dataset for Inclusive Public SpacesPoster1 citations
  565. LLM Alignment as Retriever Optimization: An Information Retrieval PerspectivePoster1 citations
  566. LLMs can see and hear without any trainingPoster1 citations
  567. LOB-Bench: Benchmarking Generative AI for Finance - an Application to Limit Order Book DataPoster1 citations
  568. LaRA: Benchmarking Retrieval-Augmented Generation and Long-Context LLMs – No Silver Bullet for LC or RAG RoutingPoster1 citations
  569. Large Language Model-driven Large Neighborhood Search for Large-Scale MILP ProblemsSpotlight1 citations
  570. Latent Diffusion Planning for Imitation LearningSpotlight1 citations
  571. Learning Latent Graph Structures and their UncertaintyPoster1 citations
  572. Learning Representations of Instruments for Partial Identification of Treatment EffectsPoster1 citations
  573. Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy OptimizationPoster1 citations
  574. Learning Utilities from Demonstrations in Markov Decision ProcessesPoster1 citations
  575. Learning curves theory for hierarchically compositional data with power-law distributed featuresPoster1 citations
  576. Learning dynamics in linear recurrent neural networksOral1 citations
  577. Learning from others' mistakes: Finetuning machine translation models with span-level error annotationsPoster1 citations
  578. Learning the RoPEs: Better 2D and 3D Position Encodings with STRINGSpotlight1 citations
  579. Lightspeed Geometric Dataset Distance via Sliced Optimal TransportPoster1 citations
  580. Lightweight Dataset Pruning without Full Training via Example Difficulty and Prediction UncertaintyPoster1 citations
  581. Lightweight Online Adaption for Time Series Foundation Model ForecastsPoster1 citations
  582. LoRA Training Provably Converges to a Low-Rank Global Minimum Or It Fails Loudly (But it Probably Won't Fail)Oral1 citations
  583. Logarithmic Regret for Online KL-Regularized Reinforcement LearningPoster1 citations
  584. Looking Beyond the Top-1: Transformers Determine Top Tokens in OrderPoster1 citations
  585. Low-Dimension-to-High-Dimension Generalization and Its Implications for Length GeneralizationPoster1 citations
  586. MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward HackingPoster1 citations
  587. Massive Values in Self-Attention Modules are the Key to Contextual Knowledge UnderstandingPoster1 citations
  588. MathConstruct: Challenging LLM Reasoning with Constructive ProofsPoster1 citations
  589. Matryoshka QuantizationPoster1 citations
  590. Mechanistic PDE Networks for Discovery of Governing EquationsPoster1 citations
  591. Meta-Black-Box-Optimization through Offline Q-function LearningPoster1 citations
  592. Mixed-curvature decision trees and random forestsPoster1 citations
  593. MoE-SVD: Structured Mixture-of-Experts LLMs Compression via Singular Value DecompositionPoster1 citations
  594. Model-Based Exploration in Monitored Markov Decision ProcessesPoster1 citations
  595. Multi-Objective Causal Bayesian OptimizationPoster1 citations
  596. Multiple-policy Evaluation via Density EstimationPoster1 citations
  597. NBDI: A Simple and Effective Termination Condition for Skill Extraction from Task-Agnostic DemonstrationsPoster1 citations
  598. NExtLong: Toward Effective Long-Context Training without Long DocumentsPoster1 citations
  599. Near-Optimal Sample Complexity for MDPs via AnchoringPoster1 citations
  600. Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit FeedbackPoster1 citations
  601. Nested Expectations with Kernel QuadraturePoster1 citations
  602. Neural Discovery in Mathematics: Do Machines Dream of Colored Planes?Oral1 citations
  603. Neural Encoding and Decoding at ScaleSpotlight1 citations
  604. No Task Left Behind: Isotropic Model Merging with Common and Task-Specific SubspacesPoster1 citations
  605. Nonlinearly Preconditioned Gradient Methods under Generalized SmoothnessOral1 citations
  606. Nonparametric Teaching for Graph Property LearnersSpotlight1 citations
  607. OOD-Chameleon: Is Algorithm Selection for OOD Generalization Learnable?Poster1 citations
  608. OWLS: Scaling Laws for Multilingual Speech Recognition and Translation ModelsPoster1 citations
  609. Offline Learning for Combinatorial Multi-armed BanditsPoster1 citations
  610. On Linear Convergence in Smooth Convex-Concave Bilinearly-Coupled Saddle-Point Optimization: Lower Bounds and Optimal AlgorithmsPoster1 citations
  611. On Volume Minimization in Conformal RegressionPoster1 citations
  612. On Zero-Initialized Attention: Optimal Prompt and Gating Factor EstimationPoster1 citations
  613. On the Benefits of Active Data Collection in Operator LearningSpotlight1 citations
  614. On the Importance of Embedding Norms in Self-Supervised LearningPoster1 citations
  615. On the Local Complexity of Linear Regions in Deep ReLU NetworksPoster1 citations
  616. On the Power of Context-Enhanced Learning in LLMsSpotlight1 citations
  617. On the Query Complexity of Verifier-Assisted Language GenerationPoster1 citations
  618. OneForecast: A Universal Framework for Global and Regional Weather ForecastingPoster1 citations
  619. OptMATH: A Scalable Bidirectional Data Synthesis Framework for Optimization ModelingPoster1 citations
  620. Optimal Task Order for Continual Learning of Multiple TasksPoster1 citations
  621. Optimal Transport Barycenter via Nonconvex-Concave Minimax OptimizationPoster1 citations
  622. Oscillation-Reduced MXFP4 Training for Vision TransformersPoster1 citations
  623. Outlier Gradient Analysis: Efficiently Identifying Detrimental Training Samples for Deep Learning ModelsOral1 citations
  624. Overcoming the Curse of Dimensionality in Reinforcement Learning Through Approximate FactorizationPoster1 citations
  625. Overtrained Language Models Are Harder to Fine-TunePoster1 citations
  626. PDE-Controller: LLMs for Autoformalization and Reasoning of PDEsPoster1 citations
  627. PILAF: Optimal Human Preference Sampling for Reward ModelingPoster1 citations
  628. POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference OptimizationPoster1 citations
  629. Perception in ReflectionPoster1 citations
  630. Permutation Equivariant Neural Networks for Symmetric TensorsPoster1 citations
  631. PhantomWiki: On-Demand Datasets for Reasoning and Retrieval EvaluationPoster1 citations
  632. Physics-Informed Generative Modeling of Wireless ChannelsPoster1 citations
  633. PlaySlot: Learning Inverse Latent Dynamics for Controllable Object-Centric Video Prediction and PlanningPoster1 citations
  634. Policy Design for Two-sided Platforms with Participation DynamicsPoster1 citations
  635. Policy Guided Tree Search for Enhanced LLM ReasoningPoster1 citations
  636. PolyConf: Unlocking Polymer Conformation Generation through Hierarchical Generative ModelsPoster1 citations
  637. Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained ModelsPoster1 citations
  638. Position: AI Should Not Be An Imitation Game: Centaur EvaluationsPoster1 citations
  639. Position: Graph Learning Will Lose Relevance Due To Poor BenchmarksPoster1 citations
  640. Position: Medical Large Language Model Benchmarks Should Prioritize Construct ValidityOral1 citations
  641. Posterior Inference with Diffusion Models for High-dimensional Black-box OptimizationPoster1 citations
  642. Prediction-Powered Adaptive Shrinkage EstimationPoster1 citations
  643. Predictive Data Selection: The Data That Predicts Is the Data That TeachesPoster1 citations
  644. Premise-Augmented Reasoning Chains Improve Error Identification in Math reasoning with LLMsPoster1 citations
  645. Pretraining Generative Flow Networks with Inexpensive Rewards for Molecular Graph GenerationPoster1 citations
  646. Proactive Agents for Multi-Turn Text-to-Image Generation Under UncertaintyPoster1 citations
  647. R.I.P.: Better Models by Survival of the Fittest PromptsPoster1 citations
  648. RUN: Reversible Unfolding Network for Concealed Object SegmentationPoster1 citations
  649. Rectifying Conformity Scores for Better Conditional CoveragePoster1 citations
  650. Reinforcement Learning for Quantum Control under Physical ConstraintsPoster1 citations
  651. RelGNN: Composite Message Passing for Relational Deep LearningPoster1 citations
  652. Relating Misfit to Gain in Weak-to-Strong Generalization Beyond the Squared LossPoster1 citations
  653. RepLoRA: Reparameterizing Low-rank Adaptation via the Perspective of Mixture of ExpertsPoster1 citations
  654. ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank ResidualsSpotlight1 citations
  655. Rethinking Addressing in Language Models via Contextualized Equivariant Positional EncodingPoster1 citations
  656. Rethinking Benign Overfitting in Two-Layer Neural NetworksPoster1 citations
  657. Rethinking Chain-of-Thought from the Perspective of Self-TrainingPoster1 citations
  658. Retrieval Augmented Time Series ForecastingPoster1 citations
  659. Revisiting Instance-Optimal Cluster Recovery in the Labeled Stochastic Block ModelPoster1 citations
  660. Revisiting Non-Acyclic GFlowNets in Discrete EnvironmentsPoster1 citations
  661. Robust Multi-bit Text Watermark with LLM-based ParaphrasersPoster1 citations
  662. Robust and Conjugate Spatio-Temporal Gaussian ProcessesPoster1 citations
  663. SAE-V: Interpreting Multimodal Models for Enhanced AlignmentPoster1 citations
  664. SKIM: Any-bit Quantization Pushing The Limits of Post-Training QuantizationPoster1 citations
  665. SUICA: Learning Super-high Dimensional Sparse Implicit Neural Representations for Spatial TranscriptomicsPoster1 citations
  666. Scaling Laws for Floating–Point Quantization TrainingPoster1 citations
  667. Scaling Laws for Forgetting during Finetuning with Pretraining Data InjectionPoster1 citations
  668. Scaling Value Iteration Networks to 5000 Layers for Extreme Long-Term PlanningPoster1 citations
  669. Score as Action: Fine Tuning Diffusion Generative Models by Continuous-time Reinforcement LearningPoster1 citations
  670. Selective Response Strategies for GenAIPoster1 citations
  671. Simple Policy OptimizationPoster1 citations
  672. Sparse Autoencoders for Hypothesis GenerationPoster1 citations
  673. Sparse Spectral Training and Inference on Euclidean and Hyperbolic Neural NetworksPoster1 citations
  674. Spatial Reasoning with Denoising ModelsPoster1 citations
  675. Speculate, then Collaborate: Fusing Knowledge of Language Models during DecodingPoster1 citations
  676. Speeding up Policy Simulation in Supply Chain RLPoster1 citations
  677. Statistical Test for Feature Selection Pipelines by Selective InferenceOral1 citations
  678. Statistical and Computational Guarantees of Kernel Max-Sliced Wasserstein DistancesPoster1 citations
  679. Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement LearningPoster1 citations
  680. Stochastic Control for Fine-tuning Diffusion Models: Optimality, Regularity, and ConvergencePoster1 citations
  681. Sub-Sequential Physics-Informed Learning with State Space ModelPoster1 citations
  682. Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model ScalesPoster1 citations
  683. SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software EngineeringPoster1 citations
  684. TAROT: Targeted Data Selection via Optimal TransportPoster1 citations
  685. TCP-Diffusion: A Multi-modal Diffusion Model for Global Tropical Cyclone Precipitation Forecasting with Change AwarenessPoster1 citations
  686. Target Concrete Score Matching: A Holistic Framework for Discrete DiffusionPoster1 citations
  687. Temperature-Annealed Boltzmann GeneratorsPoster1 citations
  688. Test-Time Training Provably Improves Transformers as In-context LearnersPoster1 citations
  689. Text-to-CAD Generation Through Infusing Visual Feedback in Large Language ModelsPoster1 citations
  690. The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward ModelsPoster1 citations
  691. The Disparate Benefits of Deep EnsemblesPoster1 citations
  692. The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low RegretPoster1 citations
  693. The Role of Randomness in StabilitySpotlight1 citations
  694. The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-TrainingPoster1 citations
  695. TimeFilter: Patch-Specific Spatial-Temporal Graph Filtration for Time Series ForecastingPoster1 citations
  696. Toward Efficient Kernel-Based Solvers for Nonlinear PDEsPoster1 citations
  697. Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and CoveragePoster1 citations
  698. Towards Attributions of Input Variables in a CoalitionPoster1 citations
  699. Towards Cost-Effective Reward Guided Text GenerationPoster1 citations
  700. Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and BeyondPoster1 citations
  701. Towards characterizing the value of edge embeddings in Graph Neural NetworksPoster1 citations
  702. Towards scientific discovery with dictionary learning: Extracting biological concepts from microscopy foundation modelsPoster1 citations
  703. Training Dynamics of In-Context Learning in Linear AttentionSpotlight1 citations
  704. Trajectory Inference with Smooth Schrödinger BridgesPoster1 citations
  705. Transolver++: An Accurate Neural Solver for PDEs on Million-Scale GeometriesPoster1 citations
  706. Tuning LLM Judge Design Decisions for 1/1000 of the CostPoster1 citations
  707. Ultra-Resolution Adaptation with EasePoster1 citations
  708. Uncertainty Quantification for LLM-Based Survey SimulationsPoster1 citations
  709. Understanding Generalization in Quantum Machine Learning with MarginsPoster1 citations
  710. Understanding High-Dimensional Bayesian OptimizationPoster1 citations
  711. Understanding and Mitigating Miscalibration in Prompt Tuning for Vision-Language ModelsPoster1 citations
  712. Understanding the Limits of Deep Tabular Methods with Temporal ShiftPoster1 citations
  713. Understanding the Skill Gap in Recurrent Language Models: The Role of the Gather-and-Aggregate MechanismPoster1 citations
  714. Unified Breakdown Analysis for Byzantine Robust GossipPoster1 citations
  715. Unifying 2D and 3D Vision-Language UnderstandingPoster1 citations
  716. Unifying Specialized Visual Encoders for Video Language ModelsPoster1 citations
  717. Universal Approximation Theorem of Deep Q-NetworksPoster1 citations
  718. Unveiling AI's Blind Spots: An Oracle for In-Domain, Out-of-Domain, and Adversarial ErrorsPoster1 citations
  719. Upweighting Easy Samples in Fine-Tuning Mitigates ForgettingSpotlight1 citations
  720. Variational Rectified Flow MatchingPoster1 citations
  721. Vintix: Action Model via In-Context Reinforcement LearningPoster1 citations
  722. Visual Autoregressive Modeling for Image Super-ResolutionPoster1 citations
  723. Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus AreasPoster1 citations
  724. XAttnMark: Learning Robust Audio Watermarking with Cross-AttentionPoster1 citations
  725. You Get What You Give: Reciprocally Fair Federated LearningPoster1 citations
  726. Zero-shot Meta-learning for Tabular Prediction Tasks with Adversarially Pre-trained TransformerPoster1 citations
  727. ZeroFlow: Overcoming Catastrophic Forgetting is Easier than You ThinkPoster1 citations
  728. xLSTM 7B: A Recurrent LLM for Fast and Efficient InferencePoster1 citations
  729. µnit Scaling: Simple and Scalable FP8 LLM TrainingPoster1 citations
  730. "Who experiences large model decay and why?" A Hierarchical Framework for Diagnosing Heterogeneous Performance DriftPoster
  731. "Why Is There a Tumor?": Tell Me the Reason, Show Me the EvidencePoster
  732. $K^2$VAE: A Koopman-Kalman Enhanced Variational AutoEncoder for Probabilistic Time Series ForecastingSpotlight
  733. $S^2$FGL: Spatial Spectral Federated Graph LearningPoster
  734. $\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory ConsolidationPoster
  735. $\mathcal{V}ista\mathcal{DPO}$: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video ModelsPoster
  736. $\texttt{I$^2$MoE}$: Interpretable Multimodal Interaction-aware Mixture-of-ExpertsPoster
  737. (How) Can Transformers Predict Pseudo-Random Numbers?Poster
  738. 3D Question Answering via only 2D Vision-Language ModelsPoster
  739. 3D-LMVIC: Learning-based Multi-View Image Compression with 3D Gaussian Geometric PriorsPoster
  740. A Bayesian Model Selection Criterion for Selecting Pretraining CheckpointsPoster
  741. A Bregman Proximal Viewpoint on Neural OperatorsPoster
  742. A Causal World Model Underlying Next Token Prediction: Exploring GPT in a Controlled EnvironmentPoster
  743. A Certified Unlearning Approach without Access to Source DataPoster
  744. A Chaotic Dynamics Framework Inspired by Dorsal Stream for Event Signal ProcessingPoster
  745. A Checks-and-Balances Framework for Context-Aware Ethical AI AlignmentPoster
  746. A Classification View on Meta Learning BanditsPoster
  747. A Closer Look at Backdoor Attacks on CLIPPoster
  748. A Closer Look at Generalized BH Algorithm for Out-of-Distribution DetectionPoster
  749. A Closer Look at Multimodal Representation CollapseSpotlight
  750. A Closer Look at Transformers for Time Series Forecasting: Understanding Why They Work and Where They StrugglePoster
  751. A Cognac Shot To Forget Bad Memories: Corrective Unlearning for Graph Neural NetworksPoster
  752. A Comprehensive Framework for Analyzing the Convergence of Adam: Bridging the Gap with SGDPoster
  753. A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPsPoster
  754. A Cross Modal Knowledge Distillation & Data Augmentation Recipe for Improving Transcriptomics Representations through Morphological FeaturesPoster
  755. A First-order Generative Bilevel Optimization Framework for Diffusion ModelsPoster
  756. A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous ControlPoster
  757. A General Graph Spectral Wavelet Convolution via Chebyshev Order DecompositionPoster
  758. A General Representation-Based Approach to Multi-Source Domain AdaptationPoster
  759. A Generalizable Physics-Enhanced State Space Model for Long-Term Dynamics Forecasting in Complex EnvironmentsPoster
  760. A Generalization Result for Convergence in Learning-to-OptimizeOral
  761. A Generalization Theory for Zero-Shot PredictionOral
  762. A Generic Family of Graphical Models: Diversity, Efficiency, and HeterogeneityPoster
  763. A Geometric Approach to Personalized Recommendation with Set-Theoretic Constraints Using Box EmbeddingsPoster
  764. A Lens into Interpretable Transformer Mistakes via Semantic DependencyPoster
  765. A Likelihood Based Approach to Distribution Regression Using Conditional Deep Generative ModelsPoster
  766. A Machine Learning Approach to Duality in Statistical PhysicsPoster
  767. A Mathematical Framework for AI-Human Integration in WorkPoster
  768. A Mixed-Curvature based Pre-training Paradigm for Multi-Task Vehicle Routing SolverPoster
  769. A Mixture-Based Framework for Guiding Diffusion ModelsPoster
  770. A Multi-Region Brain Model to Elucidate the Role of Hippocampus in Spatially Embedded Decision-MakingPoster
  771. A Near Linear Query Lower Bound for Submodular MaximizationPoster
  772. A Near-Optimal Single-Loop Stochastic Algorithm for Convex Finite-Sum Coupled Compositional OptimizationPoster
  773. A New Approach to Backtracking Counterfactual Explanations: A Unified Causal Framework for Efficient Model InterpretabilityPoster
  774. A New Concentration Inequality for Sampling Without Replacement and Its Application for Transductive LearningPoster
  775. A Non-Asymptotic Convergent Analysis for Scored-Based Graph Generative Model via a System of Stochastic Differential EquationsPoster
  776. A Non-isotropic Time Series Diffusion Model with Moving Average TransitionsPoster
  777. A Novel Characterization of the Population Area Under the Risk Coverage Curve (AURC) and Rates of Finite Sample EstimatorsPoster
  778. A Online Statistical Framework for Out-of-Distribution DetectionPoster
  779. A Parameter-Free and Near-Optimal Zeroth-Order Algorithm for Stochastic Convex OptimizationPoster
  780. A Parametric Contextual Online Learning Theory of BrokeragePoster
  781. A Peer-review Look on Multi-modal Clustering: An Information Bottleneck Realization MethodPoster
  782. A Physics-Augmented Deep Learning Framework for Classifying Single Molecule Force Spectroscopy DataPoster
  783. A Reasoning-Based Approach to Cryptic Crossword Clue SolvingPoster
  784. A Recipe for Causal Graph Regression: Confounding Effects RevisitedPoster
  785. A Reduction Framework for Distributionally Robust Reinforcement Learning under Average RewardPoster
  786. A Reductions Approach to Risk-Sensitive Reinforcement Learning with Optimized Certainty EquivalentsPoster
  787. A Rescaling-Invariant Lipschitz Bound Based on Path-Metrics for Modern ReLU Network ParameterizationsPoster
  788. A Sample Efficient Conditional Independence Test in the Presence of DiscretizationPoster
  789. A Selective Learning Method for Temporal Graph Continual LearningPoster
  790. A Sharper Global Convergence Analysis for Average Reward Reinforcement Learning via an Actor-Critic ApproachPoster
  791. A Square Peg in a Square Hole: Meta-Expert for Long-Tailed Semi-Supervised LearningPoster
  792. A Stronger Mixture of Low-Rank Experts for Fine-Tuning Foundation ModelsPoster
  793. A Sub-Problem Quantum Alternating Operator Ansatz for Correlation ClusteringPoster
  794. A Tale of Two Structures: Do LLMs Capture the Fractal Complexity of Language?Poster
  795. A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, GeneralizationPoster
  796. A Theory for Conditional Generative Modeling on Multiple Data SourcesPoster
  797. A Unified Framework for Generalization Error Analysis of Learning with Arbitrary Discrete Weak FeaturesPoster
  798. A Unified Theoretical Analysis of Private and Robust Offline Alignment: from RLHF to DPOSpotlight
  799. A Variational Framework for Improving Naturalness in Generative Spoken Language ModelsPoster
  800. A Variational Information Theoretic Approach to Out-of-Distribution DetectionPoster
  801. A Variational Perspective on Generative Protein Fitness OptimizationPoster
  802. A Versatile Influence Function for Data Attribution with Non-Decomposable LossPoster
  803. A-PSRO: A Unified Strategy Learning Method with Advantage Metric for Normal-form GamesPoster
  804. AAAR-1.0: Assessing AI’s Potential to Assist ResearchPoster
  805. ABKD: Pursuing a Proper Allocation of the Probability Mass in Knowledge Distillation via $\alpha$-$\beta$-DivergenceOral
  806. ABNet: Adaptive explicit-Barrier Net for Safe and Scalable Robot LearningPoster
  807. ADDQ: Adaptive distributional double Q-learningPoster
  808. ADHMR: Aligning Diffusion-based Human Mesh Recovery via Direct Preference OptimizationPoster
  809. ADIOS: Antibody Development via Opponent ShapingPoster
  810. AEQA-NAT : Adaptive End-to-end Quantization Alignment Training Framework for Non-autoregressive Machine TranslationPoster
  811. AKORN: Adaptive Knots generated Online for RegressioN splinesPoster
  812. AKRMap: Adaptive Kernel Regression for Trustworthy Visualization of Cross-Modal EmbeddingsPoster
  813. ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language ModelingPoster
  814. AMPO: Active Multi Preference Optimization for Self-play Preference SelectionPoster
  815. ARS: Adaptive Reward Scaling for Multi-Task Reinforcement LearningPoster
  816. ATA: Adaptive Task Allocation for Efficient Resource Management in Distributed Machine LearningPoster
  817. AUTOCIRCUIT-RL: Reinforcement Learning-Driven LLM for Automated Circuit Topology GenerationPoster
  818. Ab Initio Nonparametric Variable Selection for Scalable Symbolic Regression with Large $p$Poster
  819. Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous VocabulariesOral
  820. Accelerating Large Language Model Reasoning via Speculative SearchPoster
  821. Accelerating Linear Recurrent Neural Networks for the Edge with Unstructured SparsityPoster
  822. Accelerating PDE-Constrained Optimization by the Derivative of Neural OperatorsPoster
  823. Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based ApproachPoster
  824. Accelerating Spectral Clustering under Fairness ConstraintsPoster
  825. Accelerating Unbiased LLM Evaluation via Synthetic FeedbackPoster
  826. Accurate Identification of Communication Between Multiple Interacting Neural PopulationsPoster
  827. Accurate and Efficient World Modeling with Masked Latent TransformersPoster
  828. Achieving Linear Speedup and Near-Optimal Complexity for Decentralized Optimization over Row-stochastic NetworksSpotlight
  829. Action Dubber: Timing Audible Actions via Inflectional FlowPoster
  830. Action-Constrained Imitation LearningPoster
  831. Action-Dependent Optimality-Preserving Reward ShapingPoster
  832. Action-Minimization Meets Generative Modeling: Efficient Transition Path Sampling with the Onsager-Machlup FunctionalPoster
  833. ActionPiece: Contextually Tokenizing Action Sequences for Generative RecommendationSpotlight
  834. Activation Space Interventions Can Be Transferred Between Large Language ModelsPoster
  835. Active Fine-Tuning of Multi-Task PoliciesPoster
  836. Active Learning for Efficient Discovery of Optimal Combinatorial PerturbationsPoster
  837. Active Learning with Selective Time-Step Acquisition for PDEsPoster
  838. Active Reward Modeling: Adaptive Preference Labeling for Large Language Model AlignmentPoster
  839. Active Treatment Effect Estimation via Limited SamplesPoster
  840. Active feature acquisition via explainability-driven rankingPoster
  841. Actor-Critics Can Achieve Optimal Sample EfficiencyPoster
  842. Ad Hoc Teamwork via Offline Goal-Based Decision TransformersPoster
  843. Ad-Hoc Human-AI Coordination ChallengeSpotlight
  844. AdaDecode: Accelerating LLM Decoding with Adaptive Layer ParallelismPoster
  845. AdaPTS: Adapting Univariate Foundation Models to Probabilistic Multivariate Time Series ForecastingPoster
  846. AdaSplash: Adaptive Sparse Flash AttentionOral
  847. Adapter Naturally Serves as Decoupler for Cross-Domain Few-Shot Semantic SegmentationSpotlight
  848. Adapting Precomputed Features for Efficient Graph CondensationPoster
  849. Adapting to Evolving Adversaries with Regularized Continual Robust TrainingPoster
  850. Adapting to Linear Separable Subsets with Large-Margin in Differentially Private LearningPoster
  851. Adaptive Data Collection for Robust Learning Across Multiple DistributionsPoster
  852. Adaptive Elicitation of Latent Information Using Natural LanguagePoster
  853. Adaptive Estimation and Learning under Temporal Distribution ShiftPoster
  854. Adaptive Flow Matching for Resolving Small-Scale PhysicsPoster
  855. Adaptive Localization of Knowledge Negation for Continual LLM UnlearningPoster
  856. Adaptive Median Smoothing: Adversarial Defense for Unlearned Text-to-Image Diffusion Models at Inference TimePoster
  857. Adaptive Multi-prompt Contrastive Network for Few-shot Out-of-distribution DetectionSpotlight
  858. Adaptive Partitioning Schemes for Optimistic OptimizationPoster
  859. Adaptive Sample Sharing for Multi Agent Linear BanditsPoster
  860. Adaptive Self-improvement LLM Agentic System for ML Library DevelopmentPoster
  861. Adaptive Sensitivity Analysis for Robust Augmentation against Natural Corruptions in Image SegmentationPoster
  862. Addressing Concept Mislabeling in Concept Bottleneck Models Through Preference OptimizationPoster
  863. Addressing Imbalanced Domain-Incremental Learning through Dual-Balance Collaborative ExpertsPoster
  864. Adjoint Sampling: Highly Scalable Diffusion Samplers via Adjoint MatchingPoster
  865. Adjusting Model Size in Continual Gaussian Processes: How Big is Big Enough?Spotlight
  866. AdvAgent: Controllable Blackbox Red-teaming on Web AgentsPoster
  867. Advancing Constrained Monotonic Neural Networks: Achieving Universal Approximation Beyond Bounded ActivationsPoster
  868. Advancing Personalized Learning with Neural Collapse for Long-Tail ChallengePoster
  869. Adversarial Combinatorial Semi-bandits with Graph FeedbackPoster
  870. Adversarial Cooperative Rationalization: The Risk of Spurious Correlations in Even Clean DatasetsPoster
  871. Adversarial Inception Backdoor Attacks against Reinforcement LearningPoster
  872. Adversarial Inputs for Linear Algebra BackendsPoster
  873. Adversarial Perturbations Are Formed by Iteratively Learning Linear Combinations of the Right Singular Vectors of the Adversarial JacobianPoster
  874. Adversarial Robust Generalization of Graph Neural NetworksPoster
  875. Adversarial Robustness via Deformable Convolution with StochasticityPoster
  876. Aequa: Fair Model Rewards in Collaborative Learning via Slimmable NetworksPoster
  877. AffinityFlow: Guided Flows for Antibody Affinity MaturationPoster
  878. Agent Reviewers: Domain-specific Multimodal Agents with Shared Memory for Paper ReviewPoster
  879. Agent-Centric Actor-Critic for Asynchronous Multi-Agent Reinforcement LearningPoster
  880. Aggregation Buffer: Revisiting DropEdge with a New Parameter BlockPoster
  881. Aggregation of Dependent Expert Distributions in Multimodal Variational AutoencodersPoster
  882. Alberta Wells Dataset: Pinpointing Oil and Gas Wells from Satellite ImageryPoster
  883. Algorithm Development in Neural Networks: Insights from the Streaming Parity TaskOral
  884. Algorithmic Recourse for Long-Term ImprovementPoster
  885. Algorithms and Hardness for Active Learning on GraphsPoster
  886. Algorithms with Calibrated Machine Learning PredictionsSpotlight
  887. Aligning LLMs by Predicting Preferences from User Writing SamplesPoster
  888. Aligning Multimodal Representations through an Information BottleneckPoster
  889. Aligning Protein Conformation Ensemble Generation with Physical FeedbackPoster
  890. Aligning Spoken Dialogue Models from User InteractionsPoster
  891. All-Purpose Mean Estimation over R: Optimal Sub-Gaussianity with Outlier Robustness and Low Moments PerformanceOral
  892. All-atom Diffusion Transformers: Unified generative modelling of molecules and materialsPoster
  893. All-atom inverse protein folding through discrete flow matchingPoster
  894. Almost Optimal Fully Dynamic $k$-Center Clustering with RecoursePoster
  895. AlphaDPO: Adaptive Reward Margin for Direct Preference OptimizationPoster
  896. AlphaPO: Reward Shape Matters for LLM AlignmentPoster
  897. AlphaQCM: Alpha Discovery in Finance with Distributional Reinforcement LearningPoster
  898. An Adaptive Orthogonal Convolution Scheme for Efficient and Flexible CNN ArchitecturesPoster
  899. An All-Atom Generative Model for Designing Protein ComplexesPoster
  900. An Architecture Search Framework for Inference-Time TechniquesPoster
  901. An Asymptotically Optimal Approximation Algorithm for Multiobjective Submodular Maximization at ScalePoster
  902. An Augmentation-Aware Theory for Self-Supervised Contrastive LearningPoster
  903. An Effective and Secure Federated Multi-View Clustering Method with Information-Theoretic PerspectivePoster
  904. An Efficient Matrix Multiplication Algorithm for Accelerating Inference in Binary and Ternary Neural NetworksPoster
  905. An Efficient Private GPT Never Autoregressively DecodesPoster
  906. An Efficient Pruner for Large Language Model with Theoretical GuaranteePoster
  907. An Efficient Search-and-Score Algorithm for Ancestral Graphs using Multivariate Information Scores for Complex Non-linear and Categorical DataPoster
  908. An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception CapabilityPoster
  909. An End-to-End Model for Logits-Based Large Language Models WatermarkingPoster
  910. An Error Analysis of Flow Matching for Deep Generative ModelingSpotlight
  911. An Expressive and Self-Adaptive Dynamical System for Efficient Function LearningPoster
  912. An Improved Clique-Picking Algorithm for Counting Markov Equivalent DAGs via Super Cliques TransferOral
  913. An Instrumental Value for Data Production and its Application to Data PricingPoster
  914. An Interpretable N-gram Perplexity Threat Model for Large Language Model JailbreaksPoster
  915. An Online Adaptive Sampling Algorithm for Stochastic Difference-of-convex Optimization with Time-varying DistributionsOral
  916. An Online Learning Approach to Prompt-based Selection of Generative Models and LLMsPoster
  917. An Optimistic Algorithm for online CMDPS with Anytime Adversarial ConstraintsPoster
  918. An in depth look at the Procrustes-Wasserstein distance: properties and barycentersPoster
  919. AnalogGenie-Lite: Enhancing Scalability and Precision in Circuit Topology Discovery through Lightweight Graph ModelingPoster
  920. Analytical Construction on Geometric Architectures: Transitioning from Static to Temporal Link PredictionPoster
  921. Analytical Lyapunov Function Discovery: An RL-based Generative ApproachPoster
  922. Analyze Feature Flow to Enhance Interpretation and Steering in Language ModelsPoster
  923. Angle Domain Guidance: Latent Diffusion Requires Rotation Rather Than ExtrapolationPoster
  924. Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning AttackPoster
  925. Anytime-Constrained Equilibria in Polynomial TimePoster
  926. Approximate Differential Privacy of the $\ell_2$ MechanismPoster
  927. Approximate Forest Completion and Learning-Augmented Algorithms for Metric Minimum Spanning TreesPoster
  928. Approximately Correct Label Distribution LearningPoster
  929. Approximating Latent Manifolds in Neural Networks via Vanishing IdealsPoster
  930. Approximation to Smooth Functions by Low-Rank Swish NetworksPoster
  931. Are High-Quality AI-Generated Images More Difficult for Models to Detect?Poster
  932. Are LLMs Prescient? A Continuous Evaluation using Daily News as the OraclePoster
  933. Are Large Brainwave Foundation Models Capable Yet ? Insights from Fine-TuningPoster
  934. Are Large Language Models Ready for Multi-Turn Tabular Data Analysis?Poster
  935. Armijo Line-search Can Make (Stochastic) Gradient Descent Provably FasterPoster
  936. ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion PriorPoster
  937. Arrow: Accelerator for Time Series Causal Discovery with Time WeavingPoster
  938. Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language ModelsPoster
  939. AssistanceZero: Scalably Solving Assistance GamesPoster
  940. Asymmetric Decision-Making in Online Knowledge Distillation: Unifying Consensus and DivergencePoster
  941. AtlasD: Automatic Local Symmetry DiscoveryPoster
  942. Attention Mechanisms Perspective: Exploring LLM Processing of Graph-Structured DataPoster
  943. Attention-Level SpeculationPoster
  944. Attention-Only Transformers via Unrolled Subspace DenoisingPoster
  945. Attributes Shape the Embedding Space of Face Recognition ModelsPoster
  946. AuPair: Golden Example Pairs for Code RepairPoster
  947. Auditing Prompt Caching in Language Model APIsPoster
  948. Auto-reconfiguration for Latency Minimization in CPU-based DNN ServingPoster
  949. AutoAL: Automated Active Learning with Differentiable Query Strategy SearchPoster
  950. AutoCATE: End-to-End, Automated Treatment Effect EstimationPoster
  951. AutoGFM: Automated Graph Foundation Model with Adaptive Architecture CustomizationOral
  952. Autoencoder-Based Hybrid Replay for Class-Incremental LearningPoster
  953. Automatic Reward Shaping from Confounded Offline DataPoster
  954. Automatically Identify and Rectify: Robust Deep Contrastive Multi-view Clustering in Noisy ScenariosSpotlight
  955. Autonomy-of-Experts ModelsPoster
  956. Average Sensitivity of Hierarchical $k$-Median ClusteringPoster
  957. Avoiding Catastrophe in Online Learning by Asking for HelpPoster
  958. Avoiding Leakage Poisoning: Concept Interventions Under Distribution ShiftsPoster
  959. B-score: Detecting biases in large language models using response historyPoster
  960. BAME: Block-Aware Mask Evolution for Efficient N:M Sparse TrainingPoster
  961. BARK: A Fully Bayesian Tree Kernel for Black-box OptimizationPoster
  962. BAnG: Bidirectional Anchored Generation for Conditional RNA DesignPoster
  963. BCE vs. CE in Deep Feature LearningPoster
  964. BDC-CLIP: Brownian Distance Covariance for Adapting CLIP to Action RecognitionPoster
  965. BECAME: Bayesian Continual Learning with Adaptive Model MergingPoster
  966. BEST-Route: Adaptive LLM Routing with Test-Time Optimal ComputePoster
  967. BILBO: BILevel Bayesian OptimizationPoster
  968. BOOD: Boundary-based Out-Of-Distribution Data GenerationPoster
  969. BOPO: Neural Combinatorial Optimization via Best-anchored and Objective-guided Preference OptimizationPoster
  970. BRIDGE: Bootstrapping Text to Control Time-Series Generation via Multi-Agent Iterative Optimization and Diffusion ModelingPoster
  971. BSLoRA: Enhancing the Parameter Efficiency of LoRA with Intra-Layer and Inter-Layer SharingPoster
  972. BSO: Binary Spiking Online Optimization AlgorithmPoster
  973. BSemiFL: Semi-supervised Federated Learning via a Bayesian ApproachPoster
  974. BaWA: Automatic Optimizing Pruning Metric for Large Language Models with Balanced Weight and ActivationPoster
  975. BackSlash: Rate Constrained Optimized Training of Large Language ModelsPoster
  976. Backdoor Attacks in Token Selection of Attention MechanismPoster
  977. BalancEdit: Dynamically Balancing the Generality-Locality Trade-off in Multi-modal Model EditingPoster
  978. Balanced Learning for Domain Adaptive Semantic SegmentationPoster
  979. Balancing Efficiency and Expressiveness: Subgraph GNNs with Walk-Based CentralityPoster
  980. Balancing Interference and Correlation in Spatial Experimental Designs: A Causal Graph Cut ApproachPoster
  981. Balancing Model Efficiency and Performance: Adaptive Pruner for Long-tailed DataPoster
  982. Balancing Preservation and Modification: A Region and Semantic Aware Metric for Instruction-Based Image EditingPoster
  983. Balancing the Scales: A Theoretical and Algorithmic Framework for Learning from Imbalanced DataPoster
  984. BanditSpec: Adaptive Speculative Decoding via Bandit AlgorithmsPoster
  985. Banyan: Improved Representation Learning with Explicit StructurePoster
  986. Batch List-Decodable Linear Regression via Higher MomentsPoster
  987. Bayesian Active Learning for Bivariate Causal DiscoveryPoster
  988. Bayesian Basis Function Approximation for Scalable Gaussian Process Priors in Deep Generative ModelsPoster
  989. Bayesian Inference for Correlated Human Experts and ClassifiersPoster
  990. Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted NetworksPoster
  991. Bayesian Optimization from Human Feedback: Near-Optimal Regret BoundsPoster
  992. Bayesian Weight Enhancement with Steady-State Adaptation for Test-time Adaptation in Dynamic EnvironmentsPoster
  993. Be Confident: Uncovering Overfitting in MLLM Multi-Task TuningPoster
  994. Be a Goldfish: Forgetting Bad Conditioning in Sparse Linear Regression via Variational AutoencodersPoster
  995. Behavior-agnostic Task Inference for Robust Offline In-context Reinforcement LearningPoster
  996. Behavioral Exploration: Learning to Explore via In-Context AdaptationPoster
  997. Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function ApproximationPoster
  998. Benchmarking Abstract and Reasoning Abilities Through A Theoretical PerspectivePoster
  999. Benefits of Early Stopping in Gradient Descent for Overparameterized Logistic RegressionPoster
  1000. Benign Overfitting in Token Selection of Attention MechanismPoster

Looking for submission deadlines instead? See the conference deadline calendar.