← All conferences

ICML 2024 Accepted Papers

The full list of 2,610 papers accepted at ICML 2024 (International Conference on Machine Learning). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,275Spotlight: 191Oral: 144
  1. Scaling Rectified Flow Transformers for High-Resolution Image SynthesisOral1,056 citations
  2. MM-Vet: Evaluating Large Multimodal Models for Integrated CapabilitiesPoster666 citations
  3. Improving Factuality and Reasoning in Language Models through Multiagent DebatePoster620 citations
  4. NExT-GPT: Any-to-Any Multimodal LLMOral616 citations
  5. Chatbot Arena: An Open Platform for Evaluating LLMs by Human PreferencePoster554 citations
  6. Self-Play Fine-Tuning Converts Weak Language Models to Strong Language ModelsPoster548 citations
  7. Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space DualityPoster487 citations
  8. DoRA: Weight-Decomposed Low-Rank AdaptationOral396 citations
  9. Why Larger Language Models Do In-context Learning Differently?Poster348 citations
  10. How Language Model Hallucinations Can SnowballPoster301 citations
  11. HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust RefusalPoster270 citations
  12. Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak SupervisionOral260 citations
  13. VideoPoet: A Large Language Model for Zero-Shot Video GenerationOral257 citations
  14. A decoder-only foundation model for time-series forecastingPoster253 citations
  15. Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free LunchPoster252 citations
  16. GPT-4V(ision) is a Generalist Web Agent, if GroundedPoster230 citations
  17. Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding HeadsPoster229 citations
  18. SqueezeLLM: Dense-and-Sparse QuantizationPoster215 citations
  19. Fundamental Limitations of Alignment in Large Language ModelsPoster208 citations
  20. LESS: Selecting Influential Data for Targeted Instruction TuningPoster200 citations
  21. Promptbreeder: Self-Referential Self-Improvement via Prompt EvolutionPoster200 citations
  22. Position: LLMs Can’t Plan, But Can Help Planning in LLM-Modulo FrameworksSpotlight192 citations
  23. Language Agent Tree Search Unifies Reasoning, Acting, and Planning in Language ModelsPoster191 citations
  24. Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine TranslationPoster185 citations
  25. Unified Training of Universal Time Series Forecasting TransformersOral175 citations
  26. Genie: Generative Interactive EnvironmentsOral172 citations
  27. NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion ModelsOral172 citations
  28. Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined LevelsPoster165 citations
  29. MOMENT: A Family of Open Time-series Foundation ModelsPoster164 citations
  30. LoRA+: Efficient Low Rank Adaptation of Large ModelsPoster162 citations
  31. GaLore: Memory-Efficient LLM Training by Gradient Low-Rank ProjectionOral158 citations
  32. The Linear Representation Hypothesis and the Geometry of Large Language ModelsPoster155 citations
  33. Executable Code Actions Elicit Better LLM AgentsPoster154 citations
  34. KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV CachePoster152 citations
  35. Gated Linear Attention Transformers with Hardware-Efficient TrainingPoster148 citations
  36. LongRoPE: Extending LLM Context Window Beyond 2 Million TokensPoster148 citations
  37. The WMDP Benchmark: Measuring and Reducing Malicious Use with UnlearningPoster145 citations
  38. An Embodied Generalist Agent in 3D WorldPoster143 citations
  39. Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-constraintPoster139 citations
  40. TravelPlanner: A Benchmark for Real-World Planning with Language AgentsSpotlight133 citations
  41. Nash Learning from Human FeedbackSpotlight129 citations
  42. SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language ModelsPoster129 citations
  43. AlphaZero-Like Tree-Search can Guide Large Language Model Decoding and TrainingPoster125 citations
  44. LLM Maybe LongLM: SelfExtend LLM Context Window Without TuningSpotlight125 citations
  45. Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer ReviewsOral122 citations
  46. SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language ModelsPoster121 citations
  47. Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMsPoster120 citations
  48. Fast Timing-Conditioned Latent Audio DiffusionOral119 citations
  49. Physics of Language Models: Part 3.1, Knowledge Storage and ExtractionSpotlight118 citations
  50. EAGLE: Speculative Sampling Requires Rethinking Feature UncertaintyPoster113 citations
  51. In-Context Unlearning: Language Models as Few-Shot UnlearnersPoster113 citations
  52. Generative Flows on Discrete State-Spaces: Enabling Multimodal Flows with Applications to Protein Co-DesignPoster112 citations
  53. AlphaFold Meets Flow Matching for Generating Protein EnsemblesOral108 citations
  54. Is DPO Superior to PPO for LLM Alignment? A Comprehensive StudyOral107 citations
  55. Magicoder: Empowering Code Generation with OSS-InstructPoster104 citations
  56. Image Hijacks: Adversarial Images can Control Generative Models at RuntimePoster103 citations
  57. Debating with More Persuasive LLMs Leads to More Truthful AnswersOral102 citations
  58. Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language ModelsPoster102 citations
  59. Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence ModelingPoster101 citations
  60. Data Engineering for Scaling Language Models to 128K ContextPoster100 citations
  61. RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI FeedbackPoster99 citations
  62. Video-of-Thought: Step-by-Step Video Reasoning from Perception to CognitionOral99 citations
  63. Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank ModificationsPoster98 citations
  64. MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use CasesPoster97 citations
  65. PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMsPoster95 citations
  66. Position: TrustLLM: Trustworthiness in Large Language ModelsPoster95 citations
  67. A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and ToxicityOral93 citations
  68. Break the Sequential Dependency of LLM Inference Using Lookahead DecodingPoster92 citations
  69. Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language ModelOral90 citations
  70. In-context Convergence of TransformersPoster90 citations
  71. MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language BenchmarkOral90 citations
  72. BiLLM: Pushing the Limit of Post-Training Quantization for LLMsPoster89 citations
  73. Extreme Compression of Large Language Models via Additive QuantizationPoster89 citations
  74. Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language ModelsPoster89 citations
  75. Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue AbilitiesPoster88 citations
  76. Language Agents with Reinforcement Learning for Strategic Play in the Werewolf GamePoster88 citations
  77. RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative SimulationPoster88 citations
  78. A Minimaximalist Approach to Reinforcement Learning from Human FeedbackPoster87 citations
  79. COLD-Attack: Jailbreaking LLMs with Stealthiness and ControllabilityPoster87 citations
  80. InstructZero: Efficient Instruction Optimization for Black-Box Large Language ModelsPoster87 citations
  81. QuIP$\#$: Even Better LLM Quantization with Hadamard Incoherence and Lattice CodebooksPoster87 citations
  82. Controlled Decoding from Language ModelsPoster86 citations
  83. Better & Faster Large Language Models via Multi-token PredictionPoster85 citations
  84. CRUXEval: A Benchmark for Code Reasoning, Understanding and ExecutionPoster84 citations
  85. MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGIPoster84 citations
  86. On Prompt-Driven Safeguarding for Large Language ModelsPoster84 citations
  87. OpenMoE: An Early Effort on Open Mixture-of-Experts Language ModelsPoster84 citations
  88. Stealing part of a production language modelOral84 citations
  89. Can Mamba Learn How To Learn? A Comparative Study on In-Context Learning TasksPoster83 citations
  90. Generalized Preference Optimization: A Unified Approach to Offline AlignmentPoster83 citations
  91. LLaGA: Large Language and Graph AssistantPoster82 citations
  92. MaxMin-RLHF: Alignment with Diverse Human PreferencesPoster82 citations
  93. Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative RecommendationsPoster81 citations
  94. Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language ModelsPoster80 citations
  95. CompeteAI: Understanding the Competition Dynamics of Large Language Model-based AgentsOral80 citations
  96. Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy DataPoster79 citations
  97. Repeat After Me: Transformers are Better than State Space Models at CopyingPoster78 citations
  98. 3D-VLA: A 3D Vision-Language-Action Generative World ModelPoster77 citations
  99. In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space SteeringPoster77 citations
  100. Discrete Diffusion Modeling by Estimating the Ratios of the Data DistributionOral76 citations
  101. ULTRAFEEDBACK: Boosting Language Models with Scaled AI FeedbackPoster76 citations
  102. WARM: On the Benefits of Weight Averaged Reward ModelsPoster76 citations
  103. How Transformers Learn Causal Structure with Gradient DescentPoster75 citations
  104. Simple linear attention language models balance the recall-throughput tradeoffSpotlight72 citations
  105. Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially FastPoster71 citations
  106. Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic PromptsPoster71 citations
  107. Scalable Pre-training of Large Autoregressive Image ModelsPoster70 citations
  108. Chain of Code: Reasoning with a Language Model-Augmented Code EmulatorOral69 citations
  109. In-Context Language Learning: Architectures and AlgorithmsPoster69 citations
  110. Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High SparsityPoster69 citations
  111. Challenges in Training PINNs: A Loss Landscape PerspectiveOral68 citations
  112. HALC: Object Hallucination Reduction via Adaptive Focal-Contrast DecodingPoster68 citations
  113. QUEST: Query-Aware Sparsity for Efficient Long-Context LLM InferencePoster68 citations
  114. Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference AdjustmentPoster68 citations
  115. Accurate LoRA-Finetuning Quantization of LLMs via Information RetentionOral67 citations
  116. Online Speculative DecodingPoster67 citations
  117. An LLM Compiler for Parallel Function CallingPoster66 citations
  118. HumanTOMATO: Text-aligned Whole-body Motion GenerationPoster65 citations
  119. NExT-Chat: An LMM for Chat, Detection and SegmentationPoster65 citations
  120. Robust Classification via a Single Diffusion ModelPoster65 citations
  121. Token-level Direct Preference OptimizationPoster65 citations
  122. Evaluating Quantized Large Language ModelsPoster64 citations
  123. Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language ModelsPoster64 citations
  124. Premise Order Matters in Reasoning with Large Language ModelsPoster64 citations
  125. MathScale: Scaling Instruction Tuning for Mathematical ReasoningPoster63 citations
  126. QuRating: Selecting High-Quality Data for Training Language ModelsSpotlight63 citations
  127. GaussianPro: 3D Gaussian Splatting with Progressive PropagationPoster62 citations
  128. Timer: Generative Pre-trained Transformers Are Large Time Series ModelsPoster62 citations
  129. MLAgentBench: Evaluating Language Agents on Machine Learning ExperimentationPoster61 citations
  130. WorkArena: How Capable are Web Agents at Solving Common Knowledge Work Tasks?Poster61 citations
  131. Large Language Models are Geographically BiasedPoster60 citations
  132. Stop Regressing: Training Value Functions via Classification for Scalable Deep RLOral60 citations
  133. A Tale of Tails: Model Collapse as a Change of Scaling LawsPoster58 citations
  134. DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)Poster58 citations
  135. RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model FeedbackPoster58 citations
  136. TSLANet: Rethinking Transformers for Time Series Representation LearningPoster58 citations
  137. Behavior Generation with Latent ActionsSpotlight57 citations
  138. Do Models Explain Themselves? Counterfactual Simulatability of Natural Language ExplanationsSpotlight57 citations
  139. ODIN: Disentangled Reward Mitigates Hacking in RLHFPoster57 citations
  140. The Emergence of Reproducibility and Consistency in Diffusion ModelsPoster57 citations
  141. The Pitfalls of Next-Token PredictionPoster57 citations
  142. Differentially Private Bias-Term Fine-tuning of Foundation ModelsPoster55 citations
  143. GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian SplattingPoster55 citations
  144. MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware DiffusionPoster55 citations
  145. Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A BenchmarkPoster55 citations
  146. SparseTSF: Modeling Long-term Time Series Forecasting with *1k* ParametersOral54 citations
  147. Dynamic Memory Compression: Retrofitting LLMs for Accelerated InferencePoster53 citations
  148. IM-3D: Iterative Multiview Diffusion and Reconstruction for High-Quality 3D GenerationPoster53 citations
  149. Provably Robust DPO: Aligning Language Models with Noisy FeedbackPoster53 citations
  150. DistiLLM: Towards Streamlined Distillation for Large Language ModelsPoster52 citations
  151. GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local RefinementsPoster52 citations
  152. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling LawsPoster51 citations
  153. Learning to Model the World With LanguageOral51 citations
  154. Transolver: A Fast Transformer Solver for PDEs on General GeometriesSpotlight51 citations
  155. Boximator: Generating Rich and Controllable Motions for Video SynthesisPoster50 citations
  156. Prodigy: An Expeditiously Adaptive Parameter-Free LearnerPoster50 citations
  157. Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language ModelsOral50 citations
  158. The Illusion of State in State-Space ModelsPoster50 citations
  159. $S^2$IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series ForecastingPoster49 citations
  160. Flora: Low-Rank Adapters Are Secretly Gradient CompressorsPoster49 citations
  161. InstructRetro: Instruction Tuning post Retrieval-Augmented PretrainingPoster49 citations
  162. Iterated Denoising Energy Matching for Sampling from Boltzmann DensitiesPoster49 citations
  163. Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional TokenizationOral49 citations
  164. Can AI Assistants Know What They Don't Know?Poster48 citations
  165. Dirichlet Flow Matching with Applications to DNA Sequence DesignPoster48 citations
  166. Outlier-Efficient Hopfield Layers for Large Transformer-Based ModelsPoster48 citations
  167. DsDm: Model-Aware Dataset Selection with DatamodelsSpotlight47 citations
  168. RigorLLM: Resilient Guardrails for Large Language Models against Undesired ContentPoster47 citations
  169. SparQ Attention: Bandwidth-Efficient LLM InferencePoster47 citations
  170. Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion TransformersPoster46 citations
  171. Transformers Implement Functional Gradient Descent to Learn Non-Linear Functions In ContextPoster46 citations
  172. DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based ReasoningPoster45 citations
  173. Decomposing Uncertainty for Large Language Models through Input Clarification EnsemblingOral45 citations
  174. GPTSwarm: Language Agents as Optimizable GraphsOral45 citations
  175. InfiAgent-DABench: Evaluating Agents on Data Analysis TasksPoster45 citations
  176. Position: Will we run out of data? Limits of LLM scaling based on human-generated dataPoster45 citations
  177. ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language ModelsPoster45 citations
  178. AI Control: Improving Safety Despite Intentional SubversionOral44 citations
  179. ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLPoster44 citations
  180. FiT: Flexible Vision Transformer for Diffusion ModelSpotlight44 citations
  181. On Computational Limits of Modern Hopfield Models: A Fine-Grained Complexity AnalysisPoster44 citations
  182. Score identity Distillation: Exponentially Fast Distillation of Pretrained Diffusion Models for One-Step GenerationPoster44 citations
  183. How Universal Polynomial Bases Enhance Spectral Graph Neural Networks: Heterophily, Over-smoothing, and Over-squashingPoster43 citations
  184. Stay on Topic with Classifier-Free GuidanceSpotlight43 citations
  185. Momentor: Advancing Video Large Language Model with Fine-Grained Temporal ReasoningPoster42 citations
  186. WebLINX: Real-World Website Navigation with Multi-Turn DialogueSpotlight42 citations
  187. Proactive Detection of Voice Cloning with Localized WatermarkingPoster41 citations
  188. Pruner-Zero: Evolving Symbolic Pruning Metric From Scratch for Large Language ModelsPoster41 citations
  189. VideoPrism: A Foundational Visual Encoder for Video UnderstandingPoster41 citations
  190. A Dynamical Model of Neural Scaling LawsPoster40 citations
  191. Accelerating Convergence of Score-Based Diffusion Models, ProvablyPoster40 citations
  192. BetterV: Controlled Verilog Generation with Discriminative GuidancePoster40 citations
  193. Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 KilobytesPoster40 citations
  194. Human Alignment of Large Language Models through Online Preference OptimisationPoster40 citations
  195. MindEye2: Shared-Subject Models Enable fMRI-To-Image With 1 Hour of DataPoster40 citations
  196. Position: Topological Deep Learning is the New Frontier for Relational LearningPoster40 citations
  197. Watermark Stealing in Large Language ModelsPoster40 citations
  198. AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API CallsPoster39 citations
  199. Language Models with Conformal Factuality GuaranteesPoster39 citations
  200. Long Is More for Alignment: A Simple but Tough-to-Beat Baseline for Instruction Fine-TuningPoster39 citations
  201. Position: Graph Foundation Models Are Already HereSpotlight39 citations
  202. Position: The No Free Lunch Theorem, Kolmogorov Complexity, and the Role of Inductive Biases in Machine LearningSpotlight39 citations
  203. SceneCraft: An LLM Agent for Synthesizing 3D Scenes as Blender CodeOral39 citations
  204. Feature Reuse and Scaling: Understanding Transfer Learning with Protein Language ModelsPoster38 citations
  205. Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM InferencePoster38 citations
  206. Representation Surgery for Multi-Task Model MergingPoster38 citations
  207. Transformers, parallel computation, and logarithmic depthSpotlight38 citations
  208. Algorithm and Hardness for Dynamic Attention Maintenance in Large Language ModelsPoster37 citations
  209. Asymmetry in Low-Rank Adapters of Foundation ModelsPoster37 citations
  210. Diffusion Language Models Are Versatile Protein LearnersPoster37 citations
  211. MagicLens: Self-Supervised Image Retrieval with Open-Ended InstructionsOral37 citations
  212. Merging Multi-Task Models via Weight-Ensembling Mixture of ExpertsPoster37 citations
  213. DOGE: Domain Reweighting with Generalization EstimationPoster36 citations
  214. Dense Reward for Free in Reinforcement Learning from Human FeedbackPoster36 citations
  215. Less is More: on the Over-Globalizing Problem in Graph TransformersOral36 citations
  216. Localizing Task Information for Improved Model Merging and CompressionPoster36 citations
  217. Position: Bayesian Deep Learning is Needed in the Age of Large-Scale AIPoster36 citations
  218. Position: What Can Large Language Models Tell Us about Time Series AnalysisPoster36 citations
  219. The Benefits of Reusing Batches for Gradient Descent in Two-Layer Networks: Breaking the Curse of Information and Leap ExponentsPoster36 citations
  220. Training-Free Long-Context Scaling of Large Language ModelsPoster36 citations
  221. Uniform Memory Retrieval with Larger Capacity for Modern Hopfield ModelsPoster36 citations
  222. VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language ModelPoster36 citations
  223. A Touch, Vision, and Language Dataset for Multimodal AlignmentOral35 citations
  224. Guiding LLMs The Right Way: Fast, Non-Invasive Constrained GenerationPoster35 citations
  225. Image Fusion via Vision-Language ModelPoster35 citations
  226. LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific DiscoveryPoster35 citations
  227. Low-Cost High-Power Membership Inference AttacksOral35 citations
  228. NExT: Teaching Large Language Models to Reason about Code ExecutionPoster35 citations
  229. Parameter-Efficient Fine-Tuning with Discrete Fourier TransformPoster35 citations
  230. Differentially Private Synthetic Data via Foundation Model APIs 2: TextSpotlight34 citations
  231. FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language ModelsPoster34 citations
  232. FlowMM: Generating Materials with Riemannian Flow MatchingPoster34 citations
  233. How Well Can LLMs Negotiate? NegotiationArena Platform and AnalysisPoster34 citations
  234. Probabilistic Inference in Language Models via Twisted Sequential Monte CarloOral34 citations
  235. Scaling Laws for Fine-Grained Mixture of ExpertsPoster34 citations
  236. BiSHop: Bi-Directional Cellular Learning for Tabular Data with Generalized Sparse Modern Hopfield ModelPoster33 citations
  237. Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement LearningSpotlight33 citations
  238. DE-COP: Detecting Copyrighted Content in Language Models Training DataPoster33 citations
  239. DITTO: Diffusion Inference-Time T-Optimization for Music GenerationOral33 citations
  240. Decoding-time Realignment of Language ModelsSpotlight33 citations
  241. Getting the most out of your tokenizer for pre-training and domain adaptationPoster33 citations
  242. Mixtures of Experts Unlock Parameter Scaling for Deep RLSpotlight33 citations
  243. Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language ModelsPoster33 citations
  244. Position: Why Tabular Foundation Models Should Be a Research PriorityPoster33 citations
  245. Prompt-tuning Latent Diffusion Models for Inverse ProblemsPoster33 citations
  246. All-in-one simulation-based inferenceOral32 citations
  247. AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for TransformersPoster32 citations
  248. Auto-Regressive Next-Token Predictors are Universal LearnersPoster32 citations
  249. Learning and Forgetting Unsafe Examples in Large Language ModelsPoster32 citations
  250. Learning to Route Among Specialized Experts for Zero-Shot GeneralizationPoster32 citations
  251. Model Alignment as Prospect Theoretic OptimizationSpotlight32 citations
  252. RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust AdaptationPoster32 citations
  253. A Theory of Non-Linear Feature Learning with One Gradient Step in Two-Layer Neural NetworksPoster31 citations
  254. CogBench: a large language model walks into a psychology labPoster31 citations
  255. DiffDA: a Diffusion model for weather-scale Data AssimilationPoster31 citations
  256. Dual Operating Modes of In-Context LearningPoster31 citations
  257. Language Models as Semantic IndexersPoster31 citations
  258. Position: The Platonic Representation HypothesisOral31 citations
  259. Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated TextPoster31 citations
  260. Towards Modular LLMs by Building and Reusing a Library of LoRAsPoster31 citations
  261. tinyBenchmarks: evaluating LLMs with fewer examplesPoster31 citations
  262. CLLMs: Consistency Large Language ModelsPoster30 citations
  263. Copyright Traps for Large Language ModelsPoster30 citations
  264. Covert Malicious Finetuning: Challenges in Safeguarding LLM AdaptationPoster30 citations
  265. DPOT: Auto-Regressive Denoising Operator Transformer for Large-Scale PDE Pre-TrainingPoster30 citations
  266. Repoformer: Selective Retrieval for Repository-Level Code CompletionOral30 citations
  267. SLEB: Streamlining LLMs through Redundancy Verification and Elimination of Transformer BlocksPoster30 citations
  268. A Human-Inspired Reading Agent with Gist Memory of Very Long ContextsPoster29 citations
  269. Asymptotics of feature learning in two-layer networks after one gradient-stepSpotlight29 citations
  270. DéjàVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM ServingPoster29 citations
  271. Feedback Loops With Language Models Drive In-Context Reward HackingPoster29 citations
  272. In-Context Principle Learning from MistakesPoster29 citations
  273. Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHFPoster29 citations
  274. OptiMUS: Scalable Optimization Modeling with (MI)LP Solvers and Large Language ModelsPoster29 citations
  275. Position: Levels of AGI for Operationalizing Progress on the Path to AGISpotlight29 citations
  276. Position: Social Choice Should Guide AI Alignment in Dealing with Diverse Human FeedbackPoster29 citations
  277. Reprompting: Automated Chain-of-Thought Prompt Inference Through Gibbs SamplingPoster29 citations
  278. Rolling Diffusion ModelsPoster29 citations
  279. Sequential Neural Score Estimation: Likelihood-Free Inference with Conditional Score Based Diffusion ModelsSpotlight29 citations
  280. Tag-LLM: Repurposing General-Purpose LLMs for Specialized DomainsPoster29 citations
  281. Theoretical insights for diffusion guidance: A case study for Gaussian mixture modelsPoster29 citations
  282. Transformers Learn Nonlinear Features In Context: Nonconvex Mean-field Dynamics on the Attention LandscapeOral29 citations
  283. Zero-Shot ECG Classification with Multimodal Learning and Test-time Clinical Knowledge EnhancementPoster29 citations
  284. video-SALMONN: Speech-Enhanced Audio-Visual Large Language ModelsPoster29 citations
  285. An Information-Theoretic Analysis of In-Context LearningPoster28 citations
  286. Assessing Large Language Models on Climate InformationPoster28 citations
  287. C-RAG: Certified Generation Risks for Retrieval-Augmented Language ModelsPoster28 citations
  288. D-Flow: Differentiating through Flows for Controlled GenerationPoster28 citations
  289. Instruction Tuning for Secure Code GenerationPoster28 citations
  290. Online conformal prediction with decaying step sizesPoster28 citations
  291. Position: Near to Mid-term Risks and Opportunities of Open-Source Generative AIOral28 citations
  292. Conformal Prediction Sets Improve Human Decision MakingPoster27 citations
  293. EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D ParallelismPoster27 citations
  294. Fast Adversarial Attacks on Language Models In One GPU MinutePoster27 citations
  295. Guidance with Spherical Gaussian Constraint for Conditional DiffusionPoster27 citations
  296. Long-Tail Learning with Foundation Model: Heavy Fine-Tuning HurtsPoster27 citations
  297. MEMORYLLM: Towards Self-Updatable Large Language ModelsPoster27 citations
  298. Navigating Complexity: Toward Lossless Graph Condensation via Expanding Window MatchingPoster27 citations
  299. Particle Denoising Diffusion SamplerPoster27 citations
  300. Position: Open-Endedness is Essential for Artificial Superhuman IntelligenceOral27 citations
  301. Revisiting the Role of Language Priors in Vision-Language ModelsPoster27 citations
  302. Self-Alignment of Large Language Models via Monopolylogue-based Social Scene SimulationSpotlight27 citations
  303. Adaptive Text Watermark for Large Language ModelsPoster26 citations
  304. Feedback Efficient Online Fine-Tuning of Diffusion ModelsPoster26 citations
  305. Fool Your (Vision and) Language Model with Embarrassingly Simple PermutationsPoster26 citations
  306. How Learning by Reconstruction Produces Uninformative Features For PerceptionPoster26 citations
  307. MVMoE: Multi-Task Vehicle Routing Solver with Mixture-of-ExpertsPoster26 citations
  308. Minimax Optimality of Score-based Diffusion Models: Beyond the Density Lower Bound AssumptionsSpotlight26 citations
  309. R2E: Turning any Github Repository into a Programming Agent EnvironmentPoster26 citations
  310. Chain-of-Thought Predictive ControlPoster25 citations
  311. Cooperative Graph Neural NetworksPoster25 citations
  312. Diffusion Model-Augmented Behavioral CloningPoster25 citations
  313. Memory Consolidation Enables Long-Context Video UnderstandingSpotlight25 citations
  314. On the Origins of Linear Representations in Large Language ModelsPoster25 citations
  315. PARDEN, Can You Repeat That? Defending against Jailbreaks via RepetitionPoster25 citations
  316. Position: Amazing Things Come From Having Many Good ModelsSpotlight25 citations
  317. Second-Order Uncertainty Quantification: A Distance-Based ApproachSpotlight25 citations
  318. Structured Chemistry Reasoning with Large Language ModelsPoster25 citations
  319. The Stronger the Diffusion Model, the Easier the Backdoor: Data Poisoning to Induce Copyright BreachesWithout Adjusting Finetuning PipelineOral25 citations
  320. Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement LearningPoster25 citations
  321. A Dense Reward View on Aligning Text-to-Image Diffusion with PreferencePoster24 citations
  322. APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and InferenceOral24 citations
  323. Active Preference Learning for Large Language ModelsPoster24 citations
  324. Adversarial Robustness Limits via Scaling-Law and Human-Alignment StudiesPoster24 citations
  325. AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRAPoster24 citations
  326. Conformal prediction for multi-dimensional time series by ellipsoidal setsSpotlight24 citations
  327. Converting Transformers to Polynomial Form for Secure Inference Over Homomorphic EncryptionPoster24 citations
  328. Decomposing and Editing Predictions by Modeling Model ComputationPoster24 citations
  329. Discovering Environments with XRMOral24 citations
  330. Foundation Policies with Hilbert RepresentationsPoster24 citations
  331. Generalization in Kernel Regression Under Realistic AssumptionsSpotlight24 citations
  332. In-Context Learning Agents Are Asymmetric Belief UpdatersPoster24 citations
  333. Large Language Models Can Automatically Engineer Features for Few-Shot Tabular LearningPoster24 citations
  334. Learning a Diffusion Model Policy from Rewards via Q-Score MatchingPoster24 citations
  335. Linguistic Calibration of Long-Form GenerationsPoster24 citations
  336. Smooth Tchebycheff Scalarization for Multi-Objective OptimizationPoster24 citations
  337. Split-and-Denoise: Protect large language model inference with local differential privacyPoster24 citations
  338. Towards Efficient Exact Optimization of Language Model AlignmentPoster24 citations
  339. Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention CalibrationPoster24 citations
  340. Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM InversionPoster24 citations
  341. Causal Representation Learning from Multiple Distributions: A General SettingPoster23 citations
  342. Conformal Prediction for Deep Classifier via Label RankingPoster23 citations
  343. Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under CompressionPoster23 citations
  344. Deep Networks Always Grok and Here is WhyPoster23 citations
  345. Don't trust your eyes: on the (un)reliability of feature visualizationsPoster23 citations
  346. Efficient Exploration for LLMsPoster23 citations
  347. Parameterized Physics-informed Neural Networks for Parameterized PDEsOral23 citations
  348. Revitalizing Multivariate Time Series Forecasting: Learnable Decomposition with Inter-Series Dependencies and Intra-Series Variations ModelingPoster23 citations
  349. RoboDreamer: Learning Compositional World Models for Robot ImaginationPoster23 citations
  350. SelfIE: Self-Interpretation of Large Language Model EmbeddingsPoster23 citations
  351. Variational Learning is Effective for Large Deep NetworksSpotlight23 citations
  352. A Sober Look at LLMs for Material Discovery: Are They Actually Good for Bayesian Optimization Over Molecules?Poster22 citations
  353. AI Alignment with Changing and Influenceable Reward FunctionsPoster22 citations
  354. AST-T5: Structure-Aware Pretraining for Code Generation and UnderstandingPoster22 citations
  355. CATS: Enhancing Multivariate Time Series Forecasting by Constructing Auxiliary Time Series as Exogenous VariablesPoster22 citations
  356. CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language TransformersPoster22 citations
  357. Disentangled 3D Scene Generation with Layout LearningPoster22 citations
  358. Generalized Neural Collapse for a Large Number of ClassesPoster22 citations
  359. Graph-enhanced Large Language Models in Asynchronous Plan ReasoningPoster22 citations
  360. Mechanistic Design and Scaling of Hybrid ArchitecturesPoster22 citations
  361. Non-Vacuous Generalization Bounds for Large Language ModelsPoster22 citations
  362. On the Implicit Bias of AdamPoster22 citations
  363. Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement LearningPoster22 citations
  364. Align Your Steps: Optimizing Sampling Schedules in Diffusion ModelsPoster21 citations
  365. Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERTPoster21 citations
  366. Codebook Features: Sparse and Discrete Interpretability for Neural NetworksPoster21 citations
  367. Graph Generation with Diffusion MixturePoster21 citations
  368. IBD-PSC: Input-level Backdoor Detection via Parameter-oriented Scaling ConsistencyPoster21 citations
  369. In-Context Reinforcement Learning for Variable Action SpacesPoster21 citations
  370. LoRA Training in the NTK Regime has No Spurious Local MinimaOral21 citations
  371. Modeling Caption Diversity in Contrastive Vision-Language PretrainingPoster21 citations
  372. Privacy-Preserving Instructions for Aligning Large Language ModelsPoster21 citations
  373. Protein Conformation Generation via Force-Guided SE(3) Diffusion ModelsPoster21 citations
  374. Riemannian Preconditioned LoRA for Fine-Tuning Foundation ModelsPoster21 citations
  375. Scaling Exponents Across Parameterizations and OptimizersPoster21 citations
  376. Trainable Transformer in TransformerPoster21 citations
  377. Unifying Image Processing as Visual Prompting Question AnsweringPoster21 citations
  378. Vanilla Bayesian Optimization Performs Great in High DimensionsPoster21 citations
  379. Wukong: Towards a Scaling Law for Large-Scale RecommendationPoster21 citations
  380. Agent Instructs Large Language Models to be General Zero-Shot ReasonersPoster20 citations
  381. Beyond ELBOs: A Large-Scale Evaluation of Variational Methods for SamplingPoster20 citations
  382. CasCast: Skillful High-resolution Precipitation Nowcasting via Cascaded ModellingPoster20 citations
  383. CodeIt: Self-Improving Language Models with Prioritized Hindsight ReplayPoster20 citations
  384. Consistent Diffusion Meets Tweedie: Training Exact Ambient Diffusion Models with Noisy DataPoster20 citations
  385. Critical windows: non-asymptotic theory for feature emergence in diffusion modelsPoster20 citations
  386. DRCT: Diffusion Reconstruction Contrastive Training towards Universal Detection of Diffusion Generated ImagesSpotlight20 citations
  387. Diffusion Models Encode the Intrinsic Dimension of Data ManifoldsPoster20 citations
  388. Distinguishing the Knowable from the Unknowable with Language ModelsPoster20 citations
  389. Equivariant Graph Neural Operator for Modeling 3D DynamicsPoster20 citations
  390. Fewer Truncations Improve Language ModelingPoster20 citations
  391. Generalization to New Sequential Decision Making Tasks with In-Context LearningPoster20 citations
  392. Graph Positional and Structural EncoderPoster20 citations
  393. LLark: A Multimodal Instruction-Following Language Model for MusicPoster20 citations
  394. Neural Operators with Localized Integral and Differential KernelsPoster20 citations
  395. Position: Considerations for Differentially Private Learning with Large-Scale Public PretrainingOral20 citations
  396. Privacy Backdoors: Stealing Data with Corrupted Pretrained ModelsPoster20 citations
  397. Q-value Regularized Transformer for Offline Reinforcement LearningPoster20 citations
  398. Rethinking Optimization and Architecture for Tiny Language ModelsPoster20 citations
  399. Stochastic Interpolants with Data-Dependent CouplingsSpotlight20 citations
  400. Test-Time Model Adaptation with Only Forward PassesOral20 citations
  401. Variance-reduced Zeroth-Order Methods for Fine-Tuning Language ModelsPoster20 citations
  402. VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual ContextPoster20 citations
  403. What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formationSpotlight20 citations
  404. eCeLLM: Generalizing Large Language Models for E-commerce from Large-scale, High-quality Instruction DataPoster20 citations
  405. A Diffusion Model Framework for Unsupervised Neural Combinatorial OptimizationPoster19 citations
  406. A Language Model’s Guide Through Latent SpacePoster19 citations
  407. A Multimodal Automated Interpretability AgentPoster19 citations
  408. Accelerating Parallel Sampling of Diffusion ModelsPoster19 citations
  409. Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam GenerationOral19 citations
  410. Case-Based or Rule-Based: How Do Transformers Do the Math?Poster19 citations
  411. Cell2Sentence: Teaching Large Language Models the Language of BiologyPoster19 citations
  412. Equivariant Deep Weight Space AlignmentPoster19 citations
  413. Equivariant Frames and the Impossibility of Continuous CanonicalizationPoster19 citations
  414. From Self-Attention to Markov Models: Unveiling the Dynamics of Generative TransformersPoster19 citations
  415. GliDe with a CaPE: A Low-Hassle Method to Accelerate Speculative DecodingPoster19 citations
  416. Hybrid Inverse Reinforcement LearningPoster19 citations
  417. In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination MitigationPoster19 citations
  418. Learning to Intervene on Concept BottlenecksPoster19 citations
  419. MolCRAFT: Structure-Based Drug Design in Continuous Parameter SpacePoster19 citations
  420. MusicRL: Aligning Music Generation to Human PreferencesPoster19 citations
  421. The Entropy Enigma: Success and Failure of Entropy MinimizationPoster19 citations
  422. To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language ModelsPoster19 citations
  423. Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language ModelsPoster19 citations
  424. TroVE: Inducing Verifiable and Efficient Toolboxes for Solving Programmatic TasksPoster19 citations
  425. A Closer Look at the Limitations of Instruction TuningPoster18 citations
  426. A Statistical Theory of Regularization-Based Continual LearningPoster18 citations
  427. Benign Overfitting in Two-Layer ReLU Convolutional Neural Networks for XOR DataPoster18 citations
  428. Can Looped Transformers Learn to Implement Multi-step Gradient Descent for In-context Learning?Poster18 citations
  429. Compressible Dynamics in Deep Overparameterized Low-Rank Learning & AdaptationOral18 citations
  430. GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision TransformerPoster18 citations
  431. High-Probability Convergence for Composite and Distributed Stochastic Minimization and Variational Inequalities with Heavy-Tailed NoiseOral18 citations
  432. Hypergraph-enhanced Dual Semi-supervised Graph ClassificationPoster18 citations
  433. Image Clustering with External GuidanceOral18 citations
  434. LQER: Low-Rank Quantization Error Reconstruction for LLMsPoster18 citations
  435. Matrix Information Theory for Self-Supervised LearningPoster18 citations
  436. Multi-layer Rehearsal Feature Augmentation for Class-Incremental LearningPoster18 citations
  437. Multicalibration for Confidence Scoring in LLMsPoster18 citations
  438. On the Embedding Collapse when Scaling up Recommendation ModelsPoster18 citations
  439. Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman ProblemsOral18 citations
  440. RoboCodeX: Multimodal Code Generation for Robotic Behavior SynthesisPoster18 citations
  441. Sampling in Unit Time with Kernel Fisher-Rao FlowPoster18 citations
  442. TimeSiam: A Pre-Training Framework for Siamese Time-Series ModelingPoster18 citations
  443. ViP: A Differentially Private Foundation Model for Computer VisionOral18 citations
  444. A Computational Framework for Solving Wasserstein Lagrangian FlowsPoster17 citations
  445. A Hierarchical Adaptive Multi-Task Reinforcement Learning Framework for Multiplier Circuit DesignPoster17 citations
  446. An Analysis of Linear Time Series Forecasting ModelsPoster17 citations
  447. Auto-Encoding Morph-Tokens for Multimodal LLMSpotlight17 citations
  448. Catapults in SGD: spikes in the training loss and their impact on generalization through feature learningPoster17 citations
  449. Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic DimensionPoster17 citations
  450. Curated LLM: Synergy of LLMs and Data Curation for tabular augmentation in low-data regimesPoster17 citations
  451. DPZero: Private Fine-Tuning of Language Models without BackpropagationPoster17 citations
  452. Data-efficient Large Vision Models through Sequential AutoregressionPoster17 citations
  453. Designing Decision Support Systems using Counterfactual Prediction SetsSpotlight17 citations
  454. DetKDS: Knowledge Distillation Search for Object DetectorsPoster17 citations
  455. Dynamic Evaluation of Large Language Models by Meta Probing AgentsPoster17 citations
  456. Exploration and Anti-Exploration with Distributional Random Network DistillationPoster17 citations
  457. Learning Reward for Robot Skills Using Large Language Models via Self-AlignmentPoster17 citations
  458. Multimodal Prototyping for cancer survival predictionPoster17 citations
  459. Offline Actor-Critic Reinforcement Learning Scales to Large ModelsOral17 citations
  460. Optimal Differentially Private Model Training with Public DataPoster17 citations
  461. Position: Measure Dataset Diversity, Don't Just Claim ItOral17 citations
  462. Prototypical Transformer As Unified Motion LearnersPoster17 citations
  463. Reinforcement Learning within Tree Search for Fast Macro PlacementPoster17 citations
  464. SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise AttentionOral17 citations
  465. Swallowing the Bitter Pill: Simplified Scalable Conformer GenerationPoster17 citations
  466. Time Weaver: A Conditional Time Series Generation ModelSpotlight17 citations
  467. BAT: Learning to Reason about Spatial Sounds with Large Language ModelsPoster16 citations
  468. CARTE: Pretraining and Transfer for Tabular LearningPoster16 citations
  469. Compositional Text-to-Image Generation with Dense Blob RepresentationsPoster16 citations
  470. Compressing Large Language Models by Joint Sparsification and QuantizationPoster16 citations
  471. ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal ModelsPoster16 citations
  472. Do Efficient Transformers Really Save Computation?Poster16 citations
  473. Do Language Models Exhibit the Same Cognitive Biases in Problem Solving as Human Learners?Poster16 citations
  474. Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization FunctionPoster16 citations
  475. Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data UtilizationPoster16 citations
  476. Flextron: Many-in-One Flexible Large Language ModelOral16 citations
  477. Graph Neural Networks Use Graphs When They Shouldn'tPoster16 citations
  478. Graph-based Time Series Clustering for End-to-End Hierarchical ForecastingPoster16 citations
  479. How Private are DP-SGD Implementations?Oral16 citations
  480. How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?Oral16 citations
  481. How do Transformers Perform In-Context Autoregressive Learning ?Poster16 citations
  482. Improved Generalization of Weight Space Networks via AugmentationsPoster16 citations
  483. Improving Context Understanding in Multimodal Large Language Models via Multimodal Composition LearningPoster16 citations
  484. Improving fine-grained understanding in image-text pre-trainingPoster16 citations
  485. Language Models as Science TutorsPoster16 citations
  486. Learning with 3D rotations, a hitchhiker's guide to SO(3)Poster16 citations
  487. Offline Training of Language Model Agents with Functions as Learnable WeightsPoster16 citations
  488. Prompting a Pretrained Transformer Can Be a Universal ApproximatorPoster16 citations
  489. ReGAL: Refactoring Programs to Discover Generalizable AbstractionsPoster16 citations
  490. Rethinking Decision Transformer via Hierarchical Reinforcement LearningPoster16 citations
  491. STEER: Assessing the Economic Rationality of Large Language ModelsPoster16 citations
  492. Scalable AI Safety via Doubly-Efficient DebateOral16 citations
  493. Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-CriticPoster16 citations
  494. The Good, The Bad, and Why: Unveiling Emotions in Generative AIPoster16 citations
  495. Two Heads Are Better Than One: Boosting Graph Sparse Training via Semantic and Topological AwarenessPoster16 citations
  496. Understanding Heterophily for Graph Neural NetworksPoster16 citations
  497. UniAudio: Towards Universal Audio Generation with Large Language ModelsPoster16 citations
  498. What Improves the Generalization of Graph Transformers? A Theoretical Dive into the Self-attention and Positional EncodingPoster16 citations
  499. Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMsOral15 citations
  500. Diving into Underwater: Segment Anything Model Guided Underwater Salient Instance Segmentation and A Large-scale DatasetPoster15 citations
  501. Envisioning Outlier Exposure by Large Language Models for Out-of-Distribution DetectionPoster15 citations
  502. EquiPocket: an E(3)-Equivariant Geometric Graph Neural Network for Ligand Binding Site PredictionOral15 citations
  503. Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation ProblemSpotlight15 citations
  504. FlashST: A Simple and Universal Prompt-Tuning Framework for Traffic PredictionPoster15 citations
  505. Graph Neural Network Explanations are FragilePoster15 citations
  506. Hierarchical State Space Models for Continuous Sequence-to-Sequence ModelingPoster15 citations
  507. Human vs. Generative AI in Content Creation Competition: Symbiosis or Conflict?Poster15 citations
  508. INViT: A Generalizable Routing Problem Solver with Invariant Nested View TransformerPoster15 citations
  509. Improving Diffusion Models for Inverse Problems Using Optimal Posterior CovariancePoster15 citations
  510. InferCept: Efficient Intercept Support for Augmented Large Language Model InferencePoster15 citations
  511. LSEnet: Lorentz Structural Entropy Neural Network for Deep Graph ClusteringOral15 citations
  512. Larimar: Large Language Models with Episodic Memory ControlPoster15 citations
  513. Learning to Scale Logits for Temperature-Conditional GFlowNetsPoster15 citations
  514. Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context LearningPoster15 citations
  515. More Benefits of Being Distributional: Second-Order Bounds for Reinforcement LearningPoster15 citations
  516. Plug-in Performative OptimizationPoster15 citations
  517. Position: Key Claims in LLM Research Have a Long Tail of FootnotesPoster15 citations
  518. Reinformer: Max-Return Sequence Modeling for Offline RLPoster15 citations
  519. Robust and Conjugate Gaussian Process RegressionSpotlight15 citations
  520. S3GCL: Spectral, Swift, Spatial Graph Contrastive LearningPoster15 citations
  521. Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMsPoster15 citations
  522. An Image is Worth Multiple Words: Discovering Object Level Concepts using Multi-Concept Prompt LearningPoster14 citations
  523. Class-Imbalanced Graph Learning without Class RebalancingPoster14 citations
  524. Equivariant Diffusion for Crystal Structure PredictionPoster14 citations
  525. Full-Atom Peptide Design based on Multi-modal Flow MatchingPoster14 citations
  526. HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement LearningPoster14 citations
  527. How Do Nonlinear Transformers Learn and Generalize in In-Context Learning?Poster14 citations
  528. In value-based deep reinforcement learning, a pruned network is a good networkPoster14 citations
  529. Interpretability Illusions in the Generalization of Simplified ModelsPoster14 citations
  530. Interpretable Deep Clustering for Tabular DataPoster14 citations
  531. Is In-Context Learning in Large Language Models Bayesian? A Martingale PerspectivePoster14 citations
  532. Learning Adaptive and View-Invariant Vision Transformer for Real-Time UAV TrackingPoster14 citations
  533. Learning Universal PredictorsPoster14 citations
  534. Liouville Flow Importance SamplerPoster14 citations
  535. Lyapunov-stable Neural Control for State and Output Feedback: A Novel FormulationPoster14 citations
  536. MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language ModelsPoster14 citations
  537. Make-A-Shape: a Ten-Million-scale 3D Shape ModelPoster14 citations
  538. Memorization Through the Lens of Curvature of Loss Function Around SamplesSpotlight14 citations
  539. On Least Square Estimation in Softmax Gating Mixture of ExpertsPoster14 citations
  540. On Mechanistic Knowledge Localization in Text-to-Image Generative ModelsPoster14 citations
  541. Physics-Informed Neural Network Policy Iteration: Algorithms, Convergence, and VerificationPoster14 citations
  542. Position: Future Directions in the Theory of Graph Machine LearningPoster14 citations
  543. Revisiting Character-level Adversarial Attacks for Language ModelsPoster14 citations
  544. SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch NormalizationPoster14 citations
  545. Stochastic Localization via Iterative Posterior SamplingSpotlight14 citations
  546. Symbolic Music Generation with Non-Differentiable Rule Guided DiffusionOral14 citations
  547. Towards Certified Unlearning for Deep Neural NetworksPoster14 citations
  548. Towards Scalable and Versatile Weight Space LearningPoster14 citations
  549. Transformers Provably Learn Sparse Token Selection While Fully-Connected Nets CannotPoster14 citations
  550. Weisfeiler-Leman at the margin: When more expressivity mattersPoster14 citations
  551. A Sparsity Principle for Partially Observable Causal Representation LearningPoster13 citations
  552. Automated Statistical Model Discovery with Language ModelsPoster13 citations
  553. Borda Regret Minimization for Generalized Linear Dueling BanditsPoster13 citations
  554. Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic SegmentationPoster13 citations
  555. Causal Representation Learning Made Identifiable by Grouping of Observational VariablesPoster13 citations
  556. Characterizing Overfitting in Kernel Ridgeless Regression Through the EigenspectrumPoster13 citations
  557. Clifford-Steerable Convolutional Neural NetworksPoster13 citations
  558. Community-Invariant Graph Contrastive LearningPoster13 citations
  559. Comparing Graph Transformers via Positional EncodingsPoster13 citations
  560. ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet AccuracyPoster13 citations
  561. DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete LatentsPoster13 citations
  562. DySLIM: Dynamics Stable Learning by Invariant Measure for Chaotic SystemsPoster13 citations
  563. Fair Resource Allocation in Multi-Task LearningPoster13 citations
  564. Few-Shot Character Understanding in Movies as an Assessment to Meta-Learning of Theory-of-MindPoster13 citations
  565. Generalist Equivariant Transformer Towards 3D Molecular Interaction LearningPoster13 citations
  566. GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language ModelPoster13 citations
  567. Graph Neural Stochastic Diffusion for Estimating Uncertainty in Node ClassificationPoster13 citations
  568. Graph-based Forecasting with Missing Data through Spatiotemporal DownsamplingPoster13 citations
  569. Hyperbolic Geometric Latent Diffusion Model for Graph GenerationPoster13 citations
  570. Image Restoration Through Generalized Ornstein-Uhlenbeck BridgePoster13 citations
  571. Jetfire: Efficient and Accurate Transformer Pretraining with INT8 Data Flow and Per-Block QuantizationSpotlight13 citations
  572. Locally Estimated Global Perturbations are Better than Local Perturbations for Federated Sharpness-aware MinimizationSpotlight13 citations
  573. Non-confusing Generation of Customized Concepts in Diffusion ModelsPoster13 citations
  574. On the Independence Assumption in Neurosymbolic LearningPoster13 citations
  575. Pairwise Alignment Improves Graph Domain AdaptationSpotlight13 citations
  576. Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHFPoster13 citations
  577. RIME: Robust Preference-based Reinforcement Learning with Noisy PreferencesSpotlight13 citations
  578. Recovering the Pre-Fine-Tuning Weights of Generative ModelsPoster13 citations
  579. Regression with Multi-Expert DeferralSpotlight13 citations
  580. Sample-Efficient Robust Multi-Agent Reinforcement Learning in the Face of Environmental UncertaintyPoster13 citations
  581. Scalable Online Exploration via CoverabilityPoster13 citations
  582. Self-Correcting Self-Consuming Loops for Generative Model TrainingPoster13 citations
  583. Single-Trajectory Distributionally Robust Reinforcement LearningPoster13 citations
  584. Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise NetworksPoster13 citations
  585. Stable Differentiable Causal DiscoveryPoster13 citations
  586. TERD: A Unified Framework for Safeguarding Diffusion Models Against BackdoorsPoster13 citations
  587. Toward Adaptive Reasoning in Large Language Models with Thought RollbackPoster13 citations
  588. Understanding Adam Optimizer via Online Learning of Updates: Adam is FTRL in DisguisePoster13 citations
  589. WAVES: Benchmarking the Robustness of Image WatermarksPoster13 citations
  590. A connection between Tempering and Entropic Mirror DescentPoster12 citations
  591. Autoformalizing Euclidean GeometryPoster12 citations
  592. BAGEL: Bootstrapping Agents by Guiding Exploration with LanguagePoster12 citations
  593. Binning as a Pretext Task: Improving Self-Supervised Learning in Tabular DomainsPoster12 citations
  594. CHEMREASONER: Heuristic Search over a Large Language Model’s Knowledge Space using Quantum-Chemical FeedbackPoster12 citations
  595. CLIF: Complementary Leaky Integrate-and-Fire Neuron for Spiking Neural NetworksSpotlight12 citations
  596. Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order PerspectivePoster12 citations
  597. Code as Reward: Empowering Reinforcement Learning with VLMsSpotlight12 citations
  598. FreeBind: Free Lunch in Unified Multimodal Space via Knowledge FusionPoster12 citations
  599. Gaussian Processes on Cellular ComplexesPoster12 citations
  600. Graph Mixup on Approximate Gromov–Wasserstein GeodesicsPoster12 citations
  601. How to Trace Latent Generative Model Generated Images without Artificial Watermark?Poster12 citations
  602. Improved Operator Learning by Orthogonal AttentionSpotlight12 citations
  603. Integrated Hardware Architecture and Device Placement SearchPoster12 citations
  604. Irregular Multivariate Time Series Forecasting: A Transformable Patching Graph Neural Networks ApproachPoster12 citations
  605. KernelSHAP-IQ: Weighted Least Square Optimization for Shapley InteractionsPoster12 citations
  606. Latent Space Symmetry DiscoveryPoster12 citations
  607. Libra: Building Decoupled Vision System on Large Language ModelsPoster12 citations
  608. Light and Optimal Schrödinger Bridge MatchingPoster12 citations
  609. Neural Collapse for Cross-entropy Class-Imbalanced Learning with Unconstrained ReLU Features ModelPoster12 citations
  610. Outlier-robust Kalman Filtering through Generalised BayesPoster12 citations
  611. PICLe: Eliciting Diverse Behaviors from Large Language Models with Persona In-Context LearningPoster12 citations
  612. Position: Relational Deep Learning - Graph Representation Learning on Relational DatabasesPoster12 citations
  613. Probabilistic Forecasting with Stochastic Interpolants and Föllmer ProcessesPoster12 citations
  614. Provable Multi-Task Representation Learning by Two-Layer ReLU Neural NetworksOral12 citations
  615. RNAFlow: RNA Structure & Sequence Design via Inverse Folding-Based Flow MatchingPoster12 citations
  616. Random Masking Finds Winning Tickets for Parameter Efficient Fine-tuningPoster12 citations
  617. Rate-Optimal Policy Optimization for Linear Markov Decision ProcessesOral12 citations
  618. Refining Minimax Regret for Unsupervised Environment DesignPoster12 citations
  619. Relaxing the Accurate Imputation Assumption in Doubly Robust Learning for Debiased Collaborative FilteringSpotlight12 citations
  620. Revisiting the Power of Prompt for Visual TuningSpotlight12 citations
  621. Selecting Large Language Model to Fine-tune via Rectified Scaling LawPoster12 citations
  622. StrokeNUWA—Tokenizing Strokes for Vector Graphic SynthesisPoster12 citations
  623. Superpoint Gaussian Splatting for Real-Time High-Fidelity Dynamic Scene ReconstructionPoster12 citations
  624. TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance LearningPoster12 citations
  625. Truly No-Regret Learning in Constrained MDPsSpotlight12 citations
  626. Two Stones Hit One Bird: Bilevel Positional Encoding for Better Length ExtrapolationPoster12 citations
  627. Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths AggregationPoster12 citations
  628. Unsupervised Evaluation of Code LLMs with Round-Trip CorrectnessPoster12 citations
  629. Using AI Uncertainty Quantification to Improve Human Decision-MakingPoster12 citations
  630. $H$-Consistency Guarantees for RegressionPoster11 citations
  631. A New Robust Partial p-Wasserstein-Based Metric for Comparing DistributionsPoster11 citations
  632. Active Statistical InferenceOral11 citations
  633. Asymptotics of Learning with Deep Structured (Random) FeaturesPoster11 citations
  634. BECoTTA: Input-dependent Online Blending of Experts for Continual Test-time AdaptationPoster11 citations
  635. Causally Motivated Personalized Federated Invariant Learning with Shortcut-Averse Information-Theoretic RegularizationPoster11 citations
  636. Compute Better Spent: Replacing Dense Layers with Structured MatricesPoster11 citations
  637. Conformal Prediction with Learned FeaturesPoster11 citations
  638. CuTS: Customizable Tabular Synthetic Data GenerationPoster11 citations
  639. DRED: Zero-Shot Transfer in Reinforcement Learning via Data-Regularised Environment DesignPoster11 citations
  640. Deeper or Wider: A Perspective from Optimal Generalization Error with Sobolev LossPoster11 citations
  641. Disentangled Graph Self-supervised Learning for Out-of-Distribution GeneralizationPoster11 citations
  642. Distribution Alignment Optimization through Neural Collapse for Long-tailed ClassificationPoster11 citations
  643. ERQ: Error Reduction for Post-Training Quantization of Vision TransformersSpotlight11 citations
  644. Efficient and Effective Time-Series Forecasting with Spiking Neural NetworksPoster11 citations
  645. Emergence of In-Context Reinforcement Learning from Noise DistillationPoster11 citations
  646. Failures Are Fated, But Can Be Faded: Characterizing and Mitigating Unwanted Behaviors in Large-Scale Vision and Language ModelsSpotlight11 citations
  647. Fast Decision Boundary based Out-of-Distribution DetectorPoster11 citations
  648. Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage SufficesPoster11 citations
  649. Gradient-based Visual Explanation for Transformer-based CLIPPoster11 citations
  650. Grokking Group Multiplication with CosetsPoster11 citations
  651. How Smooth Is Attention?Poster11 citations
  652. How to Escape Sharp Minima with Random PerturbationsPoster11 citations
  653. Information Flow in Self-Supervised LearningPoster11 citations
  654. Is Temperature Sample Efficient for Softmax Gaussian Mixture of Experts?Poster11 citations
  655. LaMAGIC: Language-Model-based Topology Generation for Analog Integrated CircuitsPoster11 citations
  656. Language Models Represent Beliefs of Self and OthersPoster11 citations
  657. Mastering Robot Manipulation with Multimodal Prompts through Pretraining and Multi-task Fine-tuningPoster11 citations
  658. Mind the Boundary: Coreset Selection via Reconstructing the Decision BoundaryPoster11 citations
  659. Multi-Sender Persuasion: A Computational PerspectivePoster11 citations
  660. On the Duality Between Sharpness-Aware Minimization and Adversarial TrainingPoster11 citations
  661. Parameter Efficient Quasi-Orthogonal Fine-Tuning via Givens RotationPoster11 citations
  662. Position: AI-Powered Autonomous Weapons Risk Geopolitical Instability and Threaten AI ResearchOral11 citations
  663. Position: Why We Must Rethink Empirical Research in Machine LearningPoster11 citations
  664. PrE-Text: Training Language Models on Private Federated Data in the Age of LLMsOral11 citations
  665. ProtoGate: Prototype-based Neural Networks with Global-to-local Feature Selection for Tabular Biomedical DataPoster11 citations
  666. RLVF: Learning from Verbal Feedback without OvergeneralizationPoster11 citations
  667. Residual Quantization with Implicit Neural CodebooksPoster11 citations
  668. Rethinking Data Shapley for Data Selection Tasks: Misleads and MeritsOral11 citations
  669. Rethinking Momentum Knowledge Distillation in Online Continual LearningPoster11 citations
  670. SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied ManipulationPoster11 citations
  671. See More Details: Efficient Image Super-Resolution by Experts MiningPoster11 citations
  672. Simulation of Graph Algorithms with Looped TransformersPoster11 citations
  673. SleepFM: Multi-modal Representation Learning for Sleep Across Brain Activity, ECG and Respiratory SignalsPoster11 citations
  674. Spider: A Unified Framework for Context-dependent Concept SegmentationPoster11 citations
  675. Time Series Diffusion in the Frequency DomainPoster11 citations
  676. TimeX++: Learning Time-Series Explanations with Information BottleneckPoster11 citations
  677. UniCorn: A Unified Contrastive Learning Approach for Multi-view Molecular Representation LearningPoster11 citations
  678. Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with TransformersPoster11 citations
  679. What Can Transformer Learn with Varying Depth? Case Studies on Sequence Learning TasksPoster11 citations
  680. An Empirical Study of Realized GNN ExpressivenessPoster10 citations
  681. Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor AttacksPoster10 citations
  682. Beyond Sole Strength: Customized Ensembles for Generalized Vision-Language ModelsPoster10 citations
  683. CoLoRA: Continuous low-rank adaptation for reduced implicit neural modeling of parameterized partial differential equationsPoster10 citations
  684. Coarse-to-Fine Highlighting: Reducing Knowledge Hallucination in Large Language ModelsPoster10 citations
  685. Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy BiasesPoster10 citations
  686. CosPGD: an efficient white-box adversarial attack for pixel-wise prediction tasksPoster10 citations
  687. Cross-Domain Policy Adaptation by Capturing Representation MismatchPoster10 citations
  688. DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory StitchingPoster10 citations
  689. Differentiability and Optimization of Multiparameter Persistent HomologyPoster10 citations
  690. DiracDiffusion: Denoising and Incremental Reconstruction with Assured Data-ConsistencyPoster10 citations
  691. Disentangled Continual Graph Neural Architecture Search with Invariant Modular SupernetPoster10 citations
  692. EfficientZero V2: Mastering Discrete and Continuous Control with Limited DataSpotlight10 citations
  693. Erasing the Bias: Fine-Tuning Foundation Models for Semi-Supervised LearningPoster10 citations
  694. EvGGS: A Collaborative Learning Framework for Event-based Generalizable Gaussian SplattingPoster10 citations
  695. EvTexture: Event-driven Texture Enhancement for Video Super-ResolutionPoster10 citations
  696. Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle TasksOral10 citations
  697. FedRC: Tackling Diverse Distribution Shifts Challenge in Federated Learning by Robust ClusteringPoster10 citations
  698. FrameQuant: Flexible Low-Bit Quantization for TransformersPoster10 citations
  699. From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint TuningPoster10 citations
  700. FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement LearningPoster10 citations
  701. HAMLET: Graph Transformer Neural Operator for Partial Differential EquationsPoster10 citations
  702. Harmonizing Generalization and Personalization in Federated Prompt LearningPoster10 citations
  703. Harnessing the Power of Neural Operators with Automatically Encoded Conservation LawsSpotlight10 citations
  704. HyperFields: Towards Zero-Shot Generation of NeRFs from TextPoster10 citations
  705. In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-ThoughtPoster10 citations
  706. In-Context Freeze-Thaw Bayesian Optimization for Hyperparameter OptimizationPoster10 citations
  707. Is Epistemic Uncertainty Faithfully Represented by Evidential Deep Learning Methods?Poster10 citations
  708. Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific ModelsPoster10 citations
  709. LLM-Empowered State Representation for Reinforcement LearningPoster10 citations
  710. LangCell: Language-Cell Pre-training for Cell Identity UnderstandingPoster10 citations
  711. Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-MakingPoster10 citations
  712. Leveraging Self-Consistency for Data-Efficient Amortized Bayesian InferencePoster10 citations
  713. Log Neural Controlled Differential Equations: The Lie Brackets Make A DifferencePoster10 citations
  714. MH-pFLID: Model Heterogeneous personalized Federated Learning via Injection and Distillation for Medical Data AnalysisPoster10 citations
  715. Memory-Space Visual Prompting for Efficient Vision-Language Fine-TuningPoster10 citations
  716. On the Trajectory Regularity of ODE-based Diffusion SamplingPoster10 citations
  717. Out-of-Domain Generalization in Dynamical Systems ReconstructionPoster10 citations
  718. Potential Based Diffusion Motion PlanningPoster10 citations
  719. Principled Preferential Bayesian OptimizationOral10 citations
  720. Prometheus: Out-of-distribution Fluid Dynamics Modeling with Disentangled Graph ODEPoster10 citations
  721. Random Exploration in Bayesian Optimization: Order-Optimal Regret and Computational EfficiencyPoster10 citations
  722. Re-Dock: Towards Flexible and Realistic Molecular Docking with Diffusion BridgeSpotlight10 citations
  723. Refined Coreset Selection: Towards Minimal Coreset Size under Model Performance ConstraintsSpotlight10 citations
  724. Replicable Learning of Large-Margin HalfspacesSpotlight10 citations
  725. Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human PreferencesPoster10 citations
  726. Rotational Equilibrium: How Weight Decay Balances Learning Across Neural NetworksPoster10 citations
  727. Scalable Wasserstein Gradient Flow for Generative Modeling through Unbalanced Optimal TransportPoster10 citations
  728. Shifted Interpolation for Differential PrivacyPoster10 citations
  729. Sign is Not a Remedy: Multiset-to-Multiset Message Passing for Learning on Heterophilic GraphsPoster10 citations
  730. Smoothness Adaptive Hypothesis Transfer LearningPoster10 citations
  731. Subgraphormer: Unifying Subgraph GNNs and Graph Transformers via Graph ProductsPoster10 citations
  732. Superposition Prompting: Improving and Accelerating Retrieval-Augmented GenerationPoster10 citations
  733. The Relative Value of Prediction in Algorithmic Decision MakingPoster10 citations
  734. Towards Resource-friendly, Extensible and Stable Incomplete Multi-view ClusteringSpotlight10 citations
  735. Towards Understanding Inductive Bias in Transformers: A View From InfinityPoster10 citations
  736. Triplet Interaction Improves Graph Transformers: Accurate Molecular Graph Learning with Triplet Graph TransformersPoster10 citations
  737. Tuning-Free Stochastic OptimizationSpotlight10 citations
  738. Uncertainty for Active Learning on GraphsPoster10 citations
  739. Understanding the Effects of Iterative Prompting on TruthfulnessPoster10 citations
  740. Various Lengths, Constant Speed: Efficient Language Modeling with Lightning AttentionPoster10 citations
  741. Weakly Convex Regularisers for Inverse Problems: Convergence of Critical Points and Primal-Dual OptimisationPoster10 citations
  742. A Geometric Decomposition of Finite Games: Convergence vs. Recurrence under Exponential WeightsSpotlight9 citations
  743. A Geometric Explanation of the Likelihood OOD Detection ParadoxPoster9 citations
  744. A fast algorithm to simulate nonlinear resistive networksPoster9 citations
  745. Balanced Resonate-and-Fire NeuronsPoster9 citations
  746. BayOTIDE: Bayesian Online Multivariate Time Series Imputation with Functional DecompositionSpotlight9 citations
  747. Beyond Individual Input for Deep Anomaly Detection on Tabular DataPoster9 citations
  748. CLIPZyme: Reaction-Conditioned Virtual Screening of EnzymesPoster9 citations
  749. CarbonNovo: Joint Design of Protein Structure and Sequence Using a Unified Energy-based ModelPoster9 citations
  750. Compositional Capabilities of Autoregressive Transformers: A Study on Synthetic, Interpretable TasksPoster9 citations
  751. Compositional Few-Shot Class-Incremental LearningPoster9 citations
  752. Conformal Validity Guarantees Exist for Any Data Distribution (and How to Find Them)Poster9 citations
  753. Connecting the Dots: Is Mode-Connectedness the Key to Feasible Sample-Based Inference in Bayesian Neural Networks?Poster9 citations
  754. DiJiang: Efficient Large Language Models through Compact KernelizationOral9 citations
  755. Differentiable Weightless Neural NetworksPoster9 citations
  756. Diffusion Posterior Sampling is Computationally IntractablePoster9 citations
  757. Discrete Latent Perspective Learning for Segmentation and DetectionSpotlight9 citations
  758. EDISON: Enhanced Dictionary-Induced Tensorized Incomplete Multi-View Clustering with Gaussian Error Rank MinimizationPoster9 citations
  759. Emergent Representations of Program Semantics in Language Models Trained on ProgramsPoster9 citations
  760. Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language ModelsPoster9 citations
  761. Experts Don't Cheat: Learning What You Don't Know By Predicting PairsPoster9 citations
  762. Explaining Graph Neural Networks via Structure-aware Interaction IndexPoster9 citations
  763. Feature Distribution on Graph Topology Mediates the Effect of Graph Convolution: Homophily PerspectivePoster9 citations
  764. Federated Continual Learning via Prompt-based Dual Knowledge TransferPoster9 citations
  765. Feel-Good Thompson Sampling for Contextual Dueling BanditsPoster9 citations
  766. HexGen: Generative Inference of Large Language Model over Heterogeneous EnvironmentPoster9 citations
  767. Homomorphism Counts for Graph Neural Networks: All About That BasisPoster9 citations
  768. How Interpretable Are Interpretable Graph Neural Networks?Poster9 citations
  769. How to Make the Gradients Small Privately: Improved Rates for Differentially Private Non-Convex OptimizationPoster9 citations
  770. Hyperbolic Active Learning for Semantic Segmentation under Domain ShiftPoster9 citations
  771. Improving Open-Ended Text Generation via Adaptive DecodingPoster9 citations
  772. Inferring the Long-Term Causal Effects of Long-Term Treatments from Short-Term ExperimentsOral9 citations
  773. Interpreting and Improving Large Language Models in Arithmetic CalculationOral9 citations
  774. Language-guided Skill Learning with Temporal Variational InferencePoster9 citations
  775. Learning Coverage Paths in Unknown Environments with Deep Reinforcement LearningPoster9 citations
  776. Learning Useful Representations of Recurrent Neural Network Weight MatricesOral9 citations
  777. Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMsPoster9 citations
  778. Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and FeedbackPoster9 citations
  779. Membership Inference Attacks on Diffusion Models via Quantile RegressionPoster9 citations
  780. Moreau Envelope for Nonconvex Bi-Level Optimization: A Single-Loop and Hessian-Free Solution StrategyPoster9 citations
  781. Multi-Source Conformal Inference Under Distribution ShiftPoster9 citations
  782. MusicFlow: Cascaded Flow Matching for Text Guided Music GenerationPoster9 citations
  783. Neural operators meet conjugate gradients: The FCG-NO method for efficient PDE solvingPoster9 citations
  784. OSSCAR: One-Shot Structured Pruning in Vision and Language Models with Combinatorial OptimizationPoster9 citations
  785. OTMatch: Improving Semi-Supervised Learning with Optimal TransportPoster9 citations
  786. On Hypothesis Transfer Learning of Functional Linear ModelsPoster9 citations
  787. One-Shot Strategic Classification Under Unknown CostsPoster9 citations
  788. Online Learning under Budget and ROI Constraints via Weak AdaptivityPoster9 citations
  789. Optimal Ridge Regularization for Out-of-Distribution PredictionSpotlight9 citations
  790. Position: Understanding LLMs Requires More Than Statistical GeneralizationSpotlight9 citations
  791. Position: Video as the New Language for Real-World Decision MakingPoster9 citations
  792. Projecting Molecules into Synthesizable Chemical SpacesPoster9 citations
  793. Proteus: Exploring Protein Structure Generation for Enhanced Designability and EfficiencyPoster9 citations
  794. Purify Unlearnable Examples via Rate-Constrained Variational AutoencodersPoster9 citations
  795. Purifying Quantization-conditioned Backdoors via Layer-wise Activation Correction with Distribution ApproximationPoster9 citations
  796. Q-Star Meets Scalable Posterior Sampling: Bridging Theory and Practice via HyperAgentPoster9 citations
  797. Robust Multi-Task Learning with Excess RisksPoster9 citations
  798. SIN: Selective and Interpretable Normalization for Long-Term Time Series ForecastingPoster9 citations
  799. Sample as you Infer: Predictive Coding with Langevin DynamicsPoster9 citations
  800. SelMatch: Effectively Scaling Up Dataset Distillation via Selection-Based Initialization and Partial Updates by Trajectory MatchingPoster9 citations
  801. Self-attention Networks Localize When QK-eigenspectrum ConcentratesPoster9 citations
  802. Sharp Rates in Dependent Learning Theory: Avoiding Sample Size Deflation for the Square LossSpotlight9 citations
  803. StableSSM: Alleviating the Curse of Memory in State-space Models through Stable ReparameterizationPoster9 citations
  804. SurfPro: Functional Protein Design Based on Continuous SurfacePoster9 citations
  805. The Privacy Power of Correlated Noise in Decentralized LearningPoster9 citations
  806. Towards a Better Theoretical Understanding of Independent Subnetwork TrainingPoster9 citations
  807. Towards efficient deep spiking neural networks construction with spiking activity based pruningPoster9 citations
  808. Transforming and Combining Rewards for Aligning Large Language ModelsPoster9 citations
  809. UPOCR: Towards Unified Pixel-Level OCR InterfacePoster9 citations
  810. Understanding Forgetting in Continual Learning with Linear RegressionPoster9 citations
  811. Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential EquationsPoster9 citations
  812. Unsupervised Zero-Shot Reinforcement Learning via Functional Reward EncodingsSpotlight9 citations
  813. Unveiling Privacy, Memorization, and Input Curvature LinksPoster9 citations
  814. VQDNA: Unleashing the Power of Vector Quantization for Multi-Species Genomic Sequence ModelingPoster9 citations
  815. Variational Schrödinger Diffusion ModelsPoster9 citations
  816. Vectorized Conditional Neural Fields: A Framework for Solving Time-dependent Parametric Partial Differential EquationsPoster9 citations
  817. Verification of Machine Unlearning is FragilePoster9 citations
  818. A General Theory for Softmax Gating Multinomial Logistic Mixture of ExpertsPoster8 citations
  819. A Resilient and Accessible Distribution-Preserving Watermark for Large Language ModelsPoster8 citations
  820. Accelerating Transformer Pre-training with 2:4 SparsityPoster8 citations
  821. An Empirical Study Into What Matters for Calibrating Vision-Language ModelsPoster8 citations
  822. BBox-Adapter: Lightweight Adapting for Black-Box Large Language ModelsSpotlight8 citations
  823. CaRiNG: Learning Temporal Causal Representation under Non-Invertible Generation ProcessPoster8 citations
  824. Candidate Pseudolabel Learning: Enhancing Vision-Language Models by Prompt Tuning with Unlabeled DataOral8 citations
  825. Causal Action Influence Aware Counterfactual Data AugmentationPoster8 citations
  826. Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement LearningPoster8 citations
  827. Convex Relaxations of ReLU Neural Networks Approximate Global Optima in Polynomial TimeSpotlight8 citations
  828. Diffusive Gibbs SamplingPoster8 citations
  829. Discovering Bias in Latent Space: An Unsupervised Debiasing ApproachPoster8 citations
  830. Doubly Robust Causal Effect Estimation under Networked Interference via Targeted LearningOral8 citations
  831. E$^2$GAN: Efficient Training of Efficient GANs for Image-to-Image TranslationPoster8 citations
  832. Efficient Contrastive Learning for Fast and Accurate Inference on GraphsPoster8 citations
  833. Enabling Uncertainty Estimation in Iterative Neural NetworksPoster8 citations
  834. Eureka-Moments in Transformers: Multi-Step Tasks Reveal Softmax Induced Optimization ProblemsPoster8 citations
  835. FRAPPÉ: A Group Fairness Framework for Post-Processing EverythingPoster8 citations
  836. FairProof : Confidential and Certifiable Fairness for Neural NetworksPoster8 citations
  837. From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous SystemsPoster8 citations
  838. GRATH: Gradual Self-Truthifying for Large Language ModelsPoster8 citations
  839. Graph Distillation with Eigenbasis MatchingPoster8 citations
  840. Graph Geometry-Preserving AutoencodersPoster8 citations
  841. How Deep Networks Learn Sparse and Hierarchical Data: the Sparse Random Hierarchy ModelSpotlight8 citations
  842. IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech SeparationPoster8 citations
  843. Implicit meta-learning may lead language models to trust more reliable sourcesPoster8 citations
  844. Inherent Trade-Offs between Diversity and Stability in Multi-Task BenchmarksPoster8 citations
  845. Learning Iterative Reasoning through Energy DiffusionPoster8 citations
  846. Learning to Predict Mutational Effects of Protein-Protein Interactions by Microenvironment-aware Hierarchical Prompt LearningPoster8 citations
  847. Mean-field Underdamped Langevin Dynamics and its Spacetime DiscretizationPoster8 citations
  848. Mitigating Catastrophic Forgetting in Online Continual Learning by Modeling Previous Task Interrelations via Pareto OptimizationPoster8 citations
  849. Mitigating Label Noise on Graphs via Topological Sample SelectionPoster8 citations
  850. MoMo: Momentum Models for Adaptive Learning RatesPoster8 citations
  851. Multi-Track Message Passing: Tackling Oversmoothing and Oversquashing in Graph Learning via Preventing Heterophily MixingSpotlight8 citations
  852. Neural Collapse in Multi-label Learning with Pick-all-label LossPoster8 citations
  853. Neural SPH: Improved Neural Modeling of Lagrangian Fluid DynamicsPoster8 citations
  854. Not Just Pretty Pictures: Toward Interventional Data Augmentation Using Text-to-Image GeneratorsPoster8 citations
  855. Not all distributional shifts are equal: Fine-grained robust conformal inferencePoster8 citations
  856. OODRobustBench: a Benchmark and Large-Scale Analysis of Adversarial Robustness under Distribution ShiftPoster8 citations
  857. On Discrete Prompt Optimization for Diffusion ModelsPoster8 citations
  858. On Interpolating Experts and Multi-Armed BanditsPoster8 citations
  859. On the Diminishing Returns of Width for Continual LearningPoster8 citations
  860. On the Expressive Power of Spectral Invariant Graph Neural NetworksPoster8 citations
  861. Position: A Call to Action for a Human-Centered AutoML ParadigmPoster8 citations
  862. Position: Mission Critical – Satellite Data is a Distinct Modality in Machine LearningSpotlight8 citations
  863. Provable Representation with Efficient Planning for Partially Observable Reinforcement LearningPoster8 citations
  864. RODEO: Robust Outlier Detection via Exposing Adaptive Out-of-Distribution SamplesPoster8 citations
  865. ReconBoost: Boosting Can Achieve Modality ReconcilementPoster8 citations
  866. Recurrent Distance Filtering for Graph Representation LearningPoster8 citations
  867. Representation Surgery: Theory and Practice of Affine SteeringPoster8 citations
  868. Revisiting Context Aggregation for Image MattingPoster8 citations
  869. Robustness of Deep Learning for Accelerated MRI: Benefits of Diverse Training DataPoster8 citations
  870. SLOG: An Inductive Spectral Graph Neural Network Beyond Polynomial FilterPoster8 citations
  871. Sample Complexity Bounds for Estimating Probability Divergences under InvariancesPoster8 citations
  872. Sarah Frank-Wolfe: Methods for Constrained Optimization with Best Rates and Practical FeaturesPoster8 citations
  873. Scaling Down Deep Learning with MNIST-1DPoster8 citations
  874. Scaling Tractable Probabilistic Circuits: A Systems PerspectivePoster8 citations
  875. Simplicity Bias of Two-Layer Networks beyond Linearly Separable DataPoster8 citations
  876. Skill Set Optimization: Reinforcing Language Model Behavior via Transferable SkillsPoster8 citations
  877. Sliced Wasserstein with Random-Path Projecting DirectionsPoster8 citations
  878. Slot Abstractors: Toward Scalable Abstract Visual ReasoningPoster8 citations
  879. SpikeLM: Towards General Spike-Driven Language Modeling via Elastic Bi-Spiking MechanismsPoster8 citations
  880. SpikeZIP-TF: Conversion is All You Need for Transformer-based SNNPoster8 citations
  881. StableMask: Refining Causal Masking in Decoder-only TransformerPoster8 citations
  882. Statistical Test for Attention Maps in Vision TransformersPoster8 citations
  883. Stereo Risk: A Continuous Modeling Approach to Stereo MatchingOral8 citations
  884. Stereographic Spherical Sliced Wasserstein DistancesSpotlight8 citations
  885. Taylor Videos for Action RecognitionPoster8 citations
  886. Test-Time Degradation Adaptation for Open-Set Image RestorationSpotlight8 citations
  887. Theoretical Guarantees for Variational Inference with Fixed-Variance Mixture of GaussiansPoster8 citations
  888. TinyTrain: Resource-Aware Task-Adaptive Sparse Training of DNNs at the Data-Scarce EdgePoster8 citations
  889. Towards Theoretical Understandings of Self-Consuming Generative ModelsPoster8 citations
  890. Towards a Self-contained Data-driven Global Weather Forecasting FrameworkPoster8 citations
  891. Trustless Audits without Revealing Data or ModelsPoster8 citations
  892. UP2ME: Univariate Pre-training to Multivariate Fine-tuning as a General-purpose Framework for Multivariate Time Series AnalysisPoster8 citations
  893. Understanding Finetuning for Factual Knowledge ExtractionPoster8 citations
  894. Understanding Retrieval-Augmented Task Adaptation for Vision-Language ModelsPoster8 citations
  895. Understanding the Learning Dynamics of Alignment with Human FeedbackPoster8 citations
  896. Using Uncertainty Quantification to Characterize and Improve Out-of-Domain Learning for PDEsPoster8 citations
  897. Variational Linearized Laplace Approximation for Bayesian Deep LearningPoster8 citations
  898. Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language ModelsPoster8 citations
  899. Which Frequencies do CNNs Need? Emergent Bottleneck Structure in Feature LearningPoster8 citations
  900. Why Do Animals Need Shaping? A Theory of Task Composition and Curriculum LearningPoster8 citations
  901. $f$-Divergence Based Classification: Beyond the Use of Cross-EntropyPoster7 citations
  902. ACE: Off-Policy Actor-Critic with Causality-Aware Entropy RegularizationOral7 citations
  903. Accelerated Algorithms for Constrained Nonconvex-Nonconcave Min-Max Optimization and Comonotone InclusionPoster7 citations
  904. Acquiring Diverse Skills using Curriculum Reinforcement Learning with Mixture of ExpertsPoster7 citations
  905. Adaptive Horizon Actor-Critic for Policy Learning in Contact-Rich Differentiable SimulationPoster7 citations
  906. Adaptively Perturbed Mirror Descent for Learning in GamesPoster7 citations
  907. An Explicit Frame Construction for Normalizing 3D Point CloudsPoster7 citations
  908. ArtWhisperer: A Dataset for Characterizing Human-AI Interactions in Artistic CreationsPoster7 citations
  909. Attention Meets Post-hoc Interpretability: A Mathematical PerspectivePoster7 citations
  910. Batch and match: black-box variational inference with a score-based divergenceSpotlight7 citations
  911. Be Your Own Neighborhood: Detecting Adversarial Examples by the Neighborhood Relations Built on Self-Supervised LearningPoster7 citations
  912. Best Arm Identification for Stochastic Rising BanditsSpotlight7 citations
  913. Beyond the Federation: Topology-aware Federated Learning for Generalization to Unseen ClientsPoster7 citations
  914. CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD DetectionPoster7 citations
  915. CaM: Cache Merging for Memory-efficient LLMs InferencePoster7 citations
  916. Conformalized Adaptive Forecasting of Heterogeneous TrajectoriesPoster7 citations
  917. Constrained Reinforcement Learning Under Model MismatchPoster7 citations
  918. Controllable Prompt Tuning For Balancing Group Distributional RobustnessPoster7 citations
  919. DecisionNCE: Embodied Multimodal Representations via Implicit Preference LearningPoster7 citations
  920. DeepPolar: Inventing Nonlinear Large-Kernel Polar Codes via Deep LearningPoster7 citations
  921. Delving into Differentially Private TransformerPoster7 citations
  922. Differentially Private Representation Learning via Image CaptioningPoster7 citations
  923. Discovering Symmetry Breaking in Physical Systems with Relaxed Group ConvolutionPoster7 citations
  924. Disentanglement Learning via TopologyPoster7 citations
  925. Disguised Copyright Infringement of Latent Diffusion ModelsPoster7 citations
  926. Drug Discovery with Dynamic Goal-aware FragmentsPoster7 citations
  927. EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal TokensPoster7 citations
  928. Efficient Algorithms for Empirical Group Distributionally Robust Optimization and BeyondPoster7 citations
  929. Efficient World Models with Context-Aware TokenizationPoster7 citations
  930. Emergent Equivariance in Deep EnsemblesOral7 citations
  931. End-to-End Neuro-Symbolic Reinforcement Learning with Textual ExplanationsSpotlight7 citations
  932. Exploiting Code Symmetries for Learning Program SemanticsSpotlight7 citations
  933. Explorations of Self-Repair in Language ModelsPoster7 citations
  934. Extracting Training Data From Document-Based VQA ModelsPoster7 citations
  935. Fair Federated Learning via the Proportional Veto CorePoster7 citations
  936. Fair Off-Policy Learning from Observational DataPoster7 citations
  937. Faithfulness Measurable Masked Language ModelsSpotlight7 citations
  938. Faster Sampling via Stochastic Gradient Proximal SamplerPoster7 citations
  939. Feature Contamination: Neural Networks Learn Uncorrelated Features and Fail to GeneralizePoster7 citations
  940. FedREDefense: Defending against Model Poisoning Attacks for Federated Learning using Model Update Reconstruction ErrorPoster7 citations
  941. Federated Optimization with Doubly Regularized Drift CorrectionPoster7 citations
  942. Generative Active Learning for Long-tailed Instance SegmentationPoster7 citations
  943. Global Reinforcement Learning : Beyond Linear and Convex Rewards via Submodular Semi-gradient MethodsPoster7 citations
  944. Graph Out-of-Distribution Detection Goes Neighborhood ShapingPoster7 citations
  945. Harmonic Self-Conditioned Flow Matching for joint Multi-Ligand Docking and Binding Site DesignPoster7 citations
  946. Harmony in Diversity: Merging Neural Networks with Canonical Correlation AnalysisPoster7 citations
  947. HarmonyDream: Task Harmonization Inside World ModelsPoster7 citations
  948. Harnessing Hierarchical Label Distribution Variations in Test Agnostic Long-tail RecognitionPoster7 citations
  949. How Spurious Features are Memorized: Precise Analysis for Random and NTK FeaturesPoster7 citations
  950. Incentivized Learning in Principal-Agent Bandit GamesPoster7 citations
  951. Integrating Global Context Contrast and Local Sensitivity for Blind Image Quality AssessmentSpotlight7 citations
  952. InterLUDE: Interactions between Labeled and Unlabeled Data to Enhance Semi-Supervised LearningPoster7 citations
  953. Iterative Search Attribution for Deep Neural NetworksPoster7 citations
  954. LASER: Linear Compression in Wireless Distributed OptimizationPoster7 citations
  955. LCA-on-the-Line: Benchmarking Out of Distribution Generalization with Class TaxonomiesOral7 citations
  956. Layerwise Proximal Replay: A Proximal Point Method for Online Continual LearningPoster7 citations
  957. Learning Associative Memories with Gradient DescentPoster7 citations
  958. Linear Explanations for Individual NeuronsPoster7 citations
  959. LoCoCo: Dropping In Convolutions for Long Context CompressionPoster7 citations
  960. Long Range Propagation on Continuous-Time Dynamic GraphsPoster7 citations
  961. Mechanistic Neural Networks for Scientific Machine LearningPoster7 citations
  962. Minimum-Norm Interpolation Under Covariate ShiftPoster7 citations
  963. Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RLPoster7 citations
  964. Mol-AE: Auto-Encoder Based Molecular Representation Learning With 3D Cloze Test ObjectivePoster7 citations
  965. Momentum for the Win: Collaborative Federated Reinforcement Learning across Heterogeneous EnvironmentsPoster7 citations
  966. MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM ServingPoster7 citations
  967. NeWRF: A Deep Learning Framework for Wireless Radiation Field Reconstruction and Channel PredictionPoster7 citations
  968. Neural Networks Learn Statistics of Increasing ComplexityPoster7 citations
  969. No-Regret Reinforcement Learning in Smooth MDPsPoster7 citations
  970. Non-clairvoyant Scheduling with Partial PredictionsPoster7 citations
  971. Non-stationary Online Convex Optimization with Arbitrary DelaysPoster7 citations
  972. On Which Nodes Does GCN Fail? Enhancing GCN From the Node PerspectivePoster7 citations
  973. On the Nonlinearity of Layer NormalizationPoster7 citations
  974. Overcoming Data and Model heterogeneities in Decentralized Federated Learning via Synthetic AnchorsPoster7 citations
  975. PIDformer: Transformer Meets Control TheoryPoster7 citations
  976. PPFLOW: Target-Aware Peptide Design with Torsional Flow MatchingPoster7 citations
  977. PolySketchFormer: Fast Transformers via Sketching Polynomial KernelsPoster7 citations
  978. Position: Benchmarking is Limited in Reinforcement Learning ResearchPoster7 citations
  979. Position: Categorical Deep Learning is an Algebraic Theory of All ArchitecturesPoster7 citations
  980. Position: Explain to Question not to JustifyPoster7 citations
  981. Position: Leverage Foundational Models for Black-Box OptimizationPoster7 citations
  982. Position: Quo Vadis, Unsupervised Time Series Anomaly Detection?Poster7 citations
  983. Predictive Dynamic FusionPoster7 citations
  984. Predictive Linear Online Tracking for Unknown TargetsSpotlight7 citations
  985. Privacy-Preserving Data Release Leveraging Optimal Transport and Particle Gradient DescentPoster7 citations
  986. Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case RegretPoster7 citations
  987. Reducing Item Discrepancy via Differentially Private Robust Embedding Alignment for Privacy-Preserving Cross Domain RecommendationPoster7 citations
  988. Revealing Vision-Language Integration in the Brain with Multimodal NetworksPoster7 citations
  989. Robust Yet Efficient Conformal Prediction SetsPoster7 citations
  990. SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language ModelsPoster7 citations
  991. Sample-specific Masks for Visual Reprogramming-based PromptingSpotlight7 citations
  992. Selective Mixup Helps with Distribution Shifts, But Not (Only) because of MixupPoster7 citations
  993. SelfVC: Voice Conversion With Iterative Refinement using Self TransformationsPoster7 citations
  994. SimPro: A Simple Probabilistic Framework Towards Realistic Long-Tailed Semi-Supervised LearningPoster7 citations
  995. Size-invariance Matters: Rethinking Metrics and Losses for Imbalanced Multi-object Salient Object DetectionSpotlight7 citations
  996. Sliced-Wasserstein Estimation with Spherical Harmonics as Control VariatesPoster7 citations
  997. Structure Your Data: Towards Semantic Graph CounterfactualsPoster7 citations
  998. TENG: Time-Evolving Natural Gradient for Solving PDEs With Deep Neural Nets Toward Machine PrecisionPoster7 citations
  999. Task-aware Orthogonal Sparse Network for Exploring Shared Knowledge in Continual LearningPoster7 citations
  1000. Tell, Don't Show: Language Guidance Eases Transfer Across Domains in Images and VideosPoster7 citations

Looking for submission deadlines instead? See the conference deadline calendar.