ICML 2024 Accepted Papers
The full list of 2,610 papers accepted at ICML 2024 (International Conference on Machine Learning). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,275Spotlight: 191Oral: 144
- Scaling Rectified Flow Transformers for High-Resolution Image SynthesisOral1,056 citations
- MM-Vet: Evaluating Large Multimodal Models for Integrated CapabilitiesPoster666 citations
- Improving Factuality and Reasoning in Language Models through Multiagent DebatePoster620 citations
- NExT-GPT: Any-to-Any Multimodal LLMOral616 citations
- Chatbot Arena: An Open Platform for Evaluating LLMs by Human PreferencePoster554 citations
- Self-Play Fine-Tuning Converts Weak Language Models to Strong Language ModelsPoster548 citations
- Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space DualityPoster487 citations
- DoRA: Weight-Decomposed Low-Rank AdaptationOral396 citations
- Why Larger Language Models Do In-context Learning Differently?Poster348 citations
- How Language Model Hallucinations Can SnowballPoster301 citations
- HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust RefusalPoster270 citations
- Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak SupervisionOral260 citations
- VideoPoet: A Large Language Model for Zero-Shot Video GenerationOral257 citations
- A decoder-only foundation model for time-series forecastingPoster253 citations
- Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free LunchPoster252 citations
- GPT-4V(ision) is a Generalist Web Agent, if GroundedPoster230 citations
- Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding HeadsPoster229 citations
- SqueezeLLM: Dense-and-Sparse QuantizationPoster215 citations
- Fundamental Limitations of Alignment in Large Language ModelsPoster208 citations
- LESS: Selecting Influential Data for Targeted Instruction TuningPoster200 citations
- Promptbreeder: Self-Referential Self-Improvement via Prompt EvolutionPoster200 citations
- Position: LLMs Can’t Plan, But Can Help Planning in LLM-Modulo FrameworksSpotlight192 citations
- Language Agent Tree Search Unifies Reasoning, Acting, and Planning in Language ModelsPoster191 citations
- Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine TranslationPoster185 citations
- Unified Training of Universal Time Series Forecasting TransformersOral175 citations
- Genie: Generative Interactive EnvironmentsOral172 citations
- NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion ModelsOral172 citations
- Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined LevelsPoster165 citations
- MOMENT: A Family of Open Time-series Foundation ModelsPoster164 citations
- LoRA+: Efficient Low Rank Adaptation of Large ModelsPoster162 citations
- GaLore: Memory-Efficient LLM Training by Gradient Low-Rank ProjectionOral158 citations
- The Linear Representation Hypothesis and the Geometry of Large Language ModelsPoster155 citations
- Executable Code Actions Elicit Better LLM AgentsPoster154 citations
- KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV CachePoster152 citations
- Gated Linear Attention Transformers with Hardware-Efficient TrainingPoster148 citations
- LongRoPE: Extending LLM Context Window Beyond 2 Million TokensPoster148 citations
- The WMDP Benchmark: Measuring and Reducing Malicious Use with UnlearningPoster145 citations
- An Embodied Generalist Agent in 3D WorldPoster143 citations
- Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-constraintPoster139 citations
- TravelPlanner: A Benchmark for Real-World Planning with Language AgentsSpotlight133 citations
- Nash Learning from Human FeedbackSpotlight129 citations
- SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language ModelsPoster129 citations
- AlphaZero-Like Tree-Search can Guide Large Language Model Decoding and TrainingPoster125 citations
- LLM Maybe LongLM: SelfExtend LLM Context Window Without TuningSpotlight125 citations
- Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer ReviewsOral122 citations
- SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language ModelsPoster121 citations
- Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMsPoster120 citations
- Fast Timing-Conditioned Latent Audio DiffusionOral119 citations
- Physics of Language Models: Part 3.1, Knowledge Storage and ExtractionSpotlight118 citations
- EAGLE: Speculative Sampling Requires Rethinking Feature UncertaintyPoster113 citations
- In-Context Unlearning: Language Models as Few-Shot UnlearnersPoster113 citations
- Generative Flows on Discrete State-Spaces: Enabling Multimodal Flows with Applications to Protein Co-DesignPoster112 citations
- AlphaFold Meets Flow Matching for Generating Protein EnsemblesOral108 citations
- Is DPO Superior to PPO for LLM Alignment? A Comprehensive StudyOral107 citations
- Magicoder: Empowering Code Generation with OSS-InstructPoster104 citations
- Image Hijacks: Adversarial Images can Control Generative Models at RuntimePoster103 citations
- Debating with More Persuasive LLMs Leads to More Truthful AnswersOral102 citations
- Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language ModelsPoster102 citations
- Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence ModelingPoster101 citations
- Data Engineering for Scaling Language Models to 128K ContextPoster100 citations
- RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI FeedbackPoster99 citations
- Video-of-Thought: Step-by-Step Video Reasoning from Perception to CognitionOral99 citations
- Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank ModificationsPoster98 citations
- MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use CasesPoster97 citations
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMsPoster95 citations
- Position: TrustLLM: Trustworthiness in Large Language ModelsPoster95 citations
- A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and ToxicityOral93 citations
- Break the Sequential Dependency of LLM Inference Using Lookahead DecodingPoster92 citations
- Evolution of Heuristics: Towards Efficient Automatic Algorithm Design Using Large Language ModelOral90 citations
- In-context Convergence of TransformersPoster90 citations
- MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language BenchmarkOral90 citations
- BiLLM: Pushing the Limit of Post-Training Quantization for LLMsPoster89 citations
- Extreme Compression of Large Language Models via Additive QuantizationPoster89 citations
- Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language ModelsPoster89 citations
- Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue AbilitiesPoster88 citations
- Language Agents with Reinforcement Learning for Strategic Play in the Werewolf GamePoster88 citations
- RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative SimulationPoster88 citations
- A Minimaximalist Approach to Reinforcement Learning from Human FeedbackPoster87 citations
- COLD-Attack: Jailbreaking LLMs with Stealthiness and ControllabilityPoster87 citations
- InstructZero: Efficient Instruction Optimization for Black-Box Large Language ModelsPoster87 citations
- QuIP$\#$: Even Better LLM Quantization with Hadamard Incoherence and Lattice CodebooksPoster87 citations
- Controlled Decoding from Language ModelsPoster86 citations
- Better & Faster Large Language Models via Multi-token PredictionPoster85 citations
- CRUXEval: A Benchmark for Code Reasoning, Understanding and ExecutionPoster84 citations
- MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGIPoster84 citations
- On Prompt-Driven Safeguarding for Large Language ModelsPoster84 citations
- OpenMoE: An Early Effort on Open Mixture-of-Experts Language ModelsPoster84 citations
- Stealing part of a production language modelOral84 citations
- Can Mamba Learn How To Learn? A Comparative Study on In-Context Learning TasksPoster83 citations
- Generalized Preference Optimization: A Unified Approach to Offline AlignmentPoster83 citations
- LLaGA: Large Language and Graph AssistantPoster82 citations
- MaxMin-RLHF: Alignment with Diverse Human PreferencesPoster82 citations
- Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative RecommendationsPoster81 citations
- Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language ModelsPoster80 citations
- CompeteAI: Understanding the Competition Dynamics of Large Language Model-based AgentsOral80 citations
- Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy DataPoster79 citations
- Repeat After Me: Transformers are Better than State Space Models at CopyingPoster78 citations
- 3D-VLA: A 3D Vision-Language-Action Generative World ModelPoster77 citations
- In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space SteeringPoster77 citations
- Discrete Diffusion Modeling by Estimating the Ratios of the Data DistributionOral76 citations
- ULTRAFEEDBACK: Boosting Language Models with Scaled AI FeedbackPoster76 citations
- WARM: On the Benefits of Weight Averaged Reward ModelsPoster76 citations
- How Transformers Learn Causal Structure with Gradient DescentPoster75 citations
- Simple linear attention language models balance the recall-throughput tradeoffSpotlight72 citations
- Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially FastPoster71 citations
- Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic PromptsPoster71 citations
- Scalable Pre-training of Large Autoregressive Image ModelsPoster70 citations
- Chain of Code: Reasoning with a Language Model-Augmented Code EmulatorOral69 citations
- In-Context Language Learning: Architectures and AlgorithmsPoster69 citations
- Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High SparsityPoster69 citations
- Challenges in Training PINNs: A Loss Landscape PerspectiveOral68 citations
- HALC: Object Hallucination Reduction via Adaptive Focal-Contrast DecodingPoster68 citations
- QUEST: Query-Aware Sparsity for Efficient Long-Context LLM InferencePoster68 citations
- Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference AdjustmentPoster68 citations
- Accurate LoRA-Finetuning Quantization of LLMs via Information RetentionOral67 citations
- Online Speculative DecodingPoster67 citations
- An LLM Compiler for Parallel Function CallingPoster66 citations
- HumanTOMATO: Text-aligned Whole-body Motion GenerationPoster65 citations
- NExT-Chat: An LMM for Chat, Detection and SegmentationPoster65 citations
- Robust Classification via a Single Diffusion ModelPoster65 citations
- Token-level Direct Preference OptimizationPoster65 citations
- Evaluating Quantized Large Language ModelsPoster64 citations
- Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language ModelsPoster64 citations
- Premise Order Matters in Reasoning with Large Language ModelsPoster64 citations
- MathScale: Scaling Instruction Tuning for Mathematical ReasoningPoster63 citations
- QuRating: Selecting High-Quality Data for Training Language ModelsSpotlight63 citations
- GaussianPro: 3D Gaussian Splatting with Progressive PropagationPoster62 citations
- Timer: Generative Pre-trained Transformers Are Large Time Series ModelsPoster62 citations
- MLAgentBench: Evaluating Language Agents on Machine Learning ExperimentationPoster61 citations
- WorkArena: How Capable are Web Agents at Solving Common Knowledge Work Tasks?Poster61 citations
- Large Language Models are Geographically BiasedPoster60 citations
- Stop Regressing: Training Value Functions via Classification for Scalable Deep RLOral60 citations
- A Tale of Tails: Model Collapse as a Change of Scaling LawsPoster58 citations
- DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)Poster58 citations
- RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model FeedbackPoster58 citations
- TSLANet: Rethinking Transformers for Time Series Representation LearningPoster58 citations
- Behavior Generation with Latent ActionsSpotlight57 citations
- Do Models Explain Themselves? Counterfactual Simulatability of Natural Language ExplanationsSpotlight57 citations
- ODIN: Disentangled Reward Mitigates Hacking in RLHFPoster57 citations
- The Emergence of Reproducibility and Consistency in Diffusion ModelsPoster57 citations
- The Pitfalls of Next-Token PredictionPoster57 citations
- Differentially Private Bias-Term Fine-tuning of Foundation ModelsPoster55 citations
- GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian SplattingPoster55 citations
- MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware DiffusionPoster55 citations
- Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A BenchmarkPoster55 citations
- SparseTSF: Modeling Long-term Time Series Forecasting with *1k* ParametersOral54 citations
- Dynamic Memory Compression: Retrofitting LLMs for Accelerated InferencePoster53 citations
- IM-3D: Iterative Multiview Diffusion and Reconstruction for High-Quality 3D GenerationPoster53 citations
- Provably Robust DPO: Aligning Language Models with Noisy FeedbackPoster53 citations
- DistiLLM: Towards Streamlined Distillation for Large Language ModelsPoster52 citations
- GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local RefinementsPoster52 citations
- Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling LawsPoster51 citations
- Learning to Model the World With LanguageOral51 citations
- Transolver: A Fast Transformer Solver for PDEs on General GeometriesSpotlight51 citations
- Boximator: Generating Rich and Controllable Motions for Video SynthesisPoster50 citations
- Prodigy: An Expeditiously Adaptive Parameter-Free LearnerPoster50 citations
- Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language ModelsOral50 citations
- The Illusion of State in State-Space ModelsPoster50 citations
- $S^2$IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series ForecastingPoster49 citations
- Flora: Low-Rank Adapters Are Secretly Gradient CompressorsPoster49 citations
- InstructRetro: Instruction Tuning post Retrieval-Augmented PretrainingPoster49 citations
- Iterated Denoising Energy Matching for Sampling from Boltzmann DensitiesPoster49 citations
- Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional TokenizationOral49 citations
- Can AI Assistants Know What They Don't Know?Poster48 citations
- Dirichlet Flow Matching with Applications to DNA Sequence DesignPoster48 citations
- Outlier-Efficient Hopfield Layers for Large Transformer-Based ModelsPoster48 citations
- DsDm: Model-Aware Dataset Selection with DatamodelsSpotlight47 citations
- RigorLLM: Resilient Guardrails for Large Language Models against Undesired ContentPoster47 citations
- SparQ Attention: Bandwidth-Efficient LLM InferencePoster47 citations
- Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion TransformersPoster46 citations
- Transformers Implement Functional Gradient Descent to Learn Non-Linear Functions In ContextPoster46 citations
- DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based ReasoningPoster45 citations
- Decomposing Uncertainty for Large Language Models through Input Clarification EnsemblingOral45 citations
- GPTSwarm: Language Agents as Optimizable GraphsOral45 citations
- InfiAgent-DABench: Evaluating Agents on Data Analysis TasksPoster45 citations
- Position: Will we run out of data? Limits of LLM scaling based on human-generated dataPoster45 citations
- ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language ModelsPoster45 citations
- AI Control: Improving Safety Despite Intentional SubversionOral44 citations
- ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RLPoster44 citations
- FiT: Flexible Vision Transformer for Diffusion ModelSpotlight44 citations
- On Computational Limits of Modern Hopfield Models: A Fine-Grained Complexity AnalysisPoster44 citations
- Score identity Distillation: Exponentially Fast Distillation of Pretrained Diffusion Models for One-Step GenerationPoster44 citations
- How Universal Polynomial Bases Enhance Spectral Graph Neural Networks: Heterophily, Over-smoothing, and Over-squashingPoster43 citations
- Stay on Topic with Classifier-Free GuidanceSpotlight43 citations
- Momentor: Advancing Video Large Language Model with Fine-Grained Temporal ReasoningPoster42 citations
- WebLINX: Real-World Website Navigation with Multi-Turn DialogueSpotlight42 citations
- Proactive Detection of Voice Cloning with Localized WatermarkingPoster41 citations
- Pruner-Zero: Evolving Symbolic Pruning Metric From Scratch for Large Language ModelsPoster41 citations
- VideoPrism: A Foundational Visual Encoder for Video UnderstandingPoster41 citations
- A Dynamical Model of Neural Scaling LawsPoster40 citations
- Accelerating Convergence of Score-Based Diffusion Models, ProvablyPoster40 citations
- BetterV: Controlled Verilog Generation with Discriminative GuidancePoster40 citations
- Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 KilobytesPoster40 citations
- Human Alignment of Large Language Models through Online Preference OptimisationPoster40 citations
- MindEye2: Shared-Subject Models Enable fMRI-To-Image With 1 Hour of DataPoster40 citations
- Position: Topological Deep Learning is the New Frontier for Relational LearningPoster40 citations
- Watermark Stealing in Large Language ModelsPoster40 citations
- AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API CallsPoster39 citations
- Language Models with Conformal Factuality GuaranteesPoster39 citations
- Long Is More for Alignment: A Simple but Tough-to-Beat Baseline for Instruction Fine-TuningPoster39 citations
- Position: Graph Foundation Models Are Already HereSpotlight39 citations
- Position: The No Free Lunch Theorem, Kolmogorov Complexity, and the Role of Inductive Biases in Machine LearningSpotlight39 citations
- SceneCraft: An LLM Agent for Synthesizing 3D Scenes as Blender CodeOral39 citations
- Feature Reuse and Scaling: Understanding Transfer Learning with Protein Language ModelsPoster38 citations
- Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM InferencePoster38 citations
- Representation Surgery for Multi-Task Model MergingPoster38 citations
- Transformers, parallel computation, and logarithmic depthSpotlight38 citations
- Algorithm and Hardness for Dynamic Attention Maintenance in Large Language ModelsPoster37 citations
- Asymmetry in Low-Rank Adapters of Foundation ModelsPoster37 citations
- Diffusion Language Models Are Versatile Protein LearnersPoster37 citations
- MagicLens: Self-Supervised Image Retrieval with Open-Ended InstructionsOral37 citations
- Merging Multi-Task Models via Weight-Ensembling Mixture of ExpertsPoster37 citations
- DOGE: Domain Reweighting with Generalization EstimationPoster36 citations
- Dense Reward for Free in Reinforcement Learning from Human FeedbackPoster36 citations
- Less is More: on the Over-Globalizing Problem in Graph TransformersOral36 citations
- Localizing Task Information for Improved Model Merging and CompressionPoster36 citations
- Position: Bayesian Deep Learning is Needed in the Age of Large-Scale AIPoster36 citations
- Position: What Can Large Language Models Tell Us about Time Series AnalysisPoster36 citations
- The Benefits of Reusing Batches for Gradient Descent in Two-Layer Networks: Breaking the Curse of Information and Leap ExponentsPoster36 citations
- Training-Free Long-Context Scaling of Large Language ModelsPoster36 citations
- Uniform Memory Retrieval with Larger Capacity for Modern Hopfield ModelsPoster36 citations
- VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language ModelPoster36 citations
- A Touch, Vision, and Language Dataset for Multimodal AlignmentOral35 citations
- Guiding LLMs The Right Way: Fast, Non-Invasive Constrained GenerationPoster35 citations
- Image Fusion via Vision-Language ModelPoster35 citations
- LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific DiscoveryPoster35 citations
- Low-Cost High-Power Membership Inference AttacksOral35 citations
- NExT: Teaching Large Language Models to Reason about Code ExecutionPoster35 citations
- Parameter-Efficient Fine-Tuning with Discrete Fourier TransformPoster35 citations
- Differentially Private Synthetic Data via Foundation Model APIs 2: TextSpotlight34 citations
- FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language ModelsPoster34 citations
- FlowMM: Generating Materials with Riemannian Flow MatchingPoster34 citations
- How Well Can LLMs Negotiate? NegotiationArena Platform and AnalysisPoster34 citations
- Probabilistic Inference in Language Models via Twisted Sequential Monte CarloOral34 citations
- Scaling Laws for Fine-Grained Mixture of ExpertsPoster34 citations
- BiSHop: Bi-Directional Cellular Learning for Tabular Data with Generalized Sparse Modern Hopfield ModelPoster33 citations
- Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement LearningSpotlight33 citations
- DE-COP: Detecting Copyrighted Content in Language Models Training DataPoster33 citations
- DITTO: Diffusion Inference-Time T-Optimization for Music GenerationOral33 citations
- Decoding-time Realignment of Language ModelsSpotlight33 citations
- Getting the most out of your tokenizer for pre-training and domain adaptationPoster33 citations
- Mixtures of Experts Unlock Parameter Scaling for Deep RLSpotlight33 citations
- Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language ModelsPoster33 citations
- Position: Why Tabular Foundation Models Should Be a Research PriorityPoster33 citations
- Prompt-tuning Latent Diffusion Models for Inverse ProblemsPoster33 citations
- All-in-one simulation-based inferenceOral32 citations
- AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for TransformersPoster32 citations
- Auto-Regressive Next-Token Predictors are Universal LearnersPoster32 citations
- Learning and Forgetting Unsafe Examples in Large Language ModelsPoster32 citations
- Learning to Route Among Specialized Experts for Zero-Shot GeneralizationPoster32 citations
- Model Alignment as Prospect Theoretic OptimizationSpotlight32 citations
- RoSA: Accurate Parameter-Efficient Fine-Tuning via Robust AdaptationPoster32 citations
- A Theory of Non-Linear Feature Learning with One Gradient Step in Two-Layer Neural NetworksPoster31 citations
- CogBench: a large language model walks into a psychology labPoster31 citations
- DiffDA: a Diffusion model for weather-scale Data AssimilationPoster31 citations
- Dual Operating Modes of In-Context LearningPoster31 citations
- Language Models as Semantic IndexersPoster31 citations
- Position: The Platonic Representation HypothesisOral31 citations
- Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated TextPoster31 citations
- Towards Modular LLMs by Building and Reusing a Library of LoRAsPoster31 citations
- tinyBenchmarks: evaluating LLMs with fewer examplesPoster31 citations
- CLLMs: Consistency Large Language ModelsPoster30 citations
- Copyright Traps for Large Language ModelsPoster30 citations
- Covert Malicious Finetuning: Challenges in Safeguarding LLM AdaptationPoster30 citations
- DPOT: Auto-Regressive Denoising Operator Transformer for Large-Scale PDE Pre-TrainingPoster30 citations
- Repoformer: Selective Retrieval for Repository-Level Code CompletionOral30 citations
- SLEB: Streamlining LLMs through Redundancy Verification and Elimination of Transformer BlocksPoster30 citations
- A Human-Inspired Reading Agent with Gist Memory of Very Long ContextsPoster29 citations
- Asymptotics of feature learning in two-layer networks after one gradient-stepSpotlight29 citations
- DéjàVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM ServingPoster29 citations
- Feedback Loops With Language Models Drive In-Context Reward HackingPoster29 citations
- In-Context Principle Learning from MistakesPoster29 citations
- Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHFPoster29 citations
- OptiMUS: Scalable Optimization Modeling with (MI)LP Solvers and Large Language ModelsPoster29 citations
- Position: Levels of AGI for Operationalizing Progress on the Path to AGISpotlight29 citations
- Position: Social Choice Should Guide AI Alignment in Dealing with Diverse Human FeedbackPoster29 citations
- Reprompting: Automated Chain-of-Thought Prompt Inference Through Gibbs SamplingPoster29 citations
- Rolling Diffusion ModelsPoster29 citations
- Sequential Neural Score Estimation: Likelihood-Free Inference with Conditional Score Based Diffusion ModelsSpotlight29 citations
- Tag-LLM: Repurposing General-Purpose LLMs for Specialized DomainsPoster29 citations
- Theoretical insights for diffusion guidance: A case study for Gaussian mixture modelsPoster29 citations
- Transformers Learn Nonlinear Features In Context: Nonconvex Mean-field Dynamics on the Attention LandscapeOral29 citations
- Zero-Shot ECG Classification with Multimodal Learning and Test-time Clinical Knowledge EnhancementPoster29 citations
- video-SALMONN: Speech-Enhanced Audio-Visual Large Language ModelsPoster29 citations
- An Information-Theoretic Analysis of In-Context LearningPoster28 citations
- Assessing Large Language Models on Climate InformationPoster28 citations
- C-RAG: Certified Generation Risks for Retrieval-Augmented Language ModelsPoster28 citations
- D-Flow: Differentiating through Flows for Controlled GenerationPoster28 citations
- Instruction Tuning for Secure Code GenerationPoster28 citations
- Online conformal prediction with decaying step sizesPoster28 citations
- Position: Near to Mid-term Risks and Opportunities of Open-Source Generative AIOral28 citations
- Conformal Prediction Sets Improve Human Decision MakingPoster27 citations
- EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D ParallelismPoster27 citations
- Fast Adversarial Attacks on Language Models In One GPU MinutePoster27 citations
- Guidance with Spherical Gaussian Constraint for Conditional DiffusionPoster27 citations
- Long-Tail Learning with Foundation Model: Heavy Fine-Tuning HurtsPoster27 citations
- MEMORYLLM: Towards Self-Updatable Large Language ModelsPoster27 citations
- Navigating Complexity: Toward Lossless Graph Condensation via Expanding Window MatchingPoster27 citations
- Particle Denoising Diffusion SamplerPoster27 citations
- Position: Open-Endedness is Essential for Artificial Superhuman IntelligenceOral27 citations
- Revisiting the Role of Language Priors in Vision-Language ModelsPoster27 citations
- Self-Alignment of Large Language Models via Monopolylogue-based Social Scene SimulationSpotlight27 citations
- Adaptive Text Watermark for Large Language ModelsPoster26 citations
- Feedback Efficient Online Fine-Tuning of Diffusion ModelsPoster26 citations
- Fool Your (Vision and) Language Model with Embarrassingly Simple PermutationsPoster26 citations
- How Learning by Reconstruction Produces Uninformative Features For PerceptionPoster26 citations
- MVMoE: Multi-Task Vehicle Routing Solver with Mixture-of-ExpertsPoster26 citations
- Minimax Optimality of Score-based Diffusion Models: Beyond the Density Lower Bound AssumptionsSpotlight26 citations
- R2E: Turning any Github Repository into a Programming Agent EnvironmentPoster26 citations
- Chain-of-Thought Predictive ControlPoster25 citations
- Cooperative Graph Neural NetworksPoster25 citations
- Diffusion Model-Augmented Behavioral CloningPoster25 citations
- Memory Consolidation Enables Long-Context Video UnderstandingSpotlight25 citations
- On the Origins of Linear Representations in Large Language ModelsPoster25 citations
- PARDEN, Can You Repeat That? Defending against Jailbreaks via RepetitionPoster25 citations
- Position: Amazing Things Come From Having Many Good ModelsSpotlight25 citations
- Second-Order Uncertainty Quantification: A Distance-Based ApproachSpotlight25 citations
- Structured Chemistry Reasoning with Large Language ModelsPoster25 citations
- The Stronger the Diffusion Model, the Easier the Backdoor: Data Poisoning to Induce Copyright BreachesWithout Adjusting Finetuning PipelineOral25 citations
- Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement LearningPoster25 citations
- A Dense Reward View on Aligning Text-to-Image Diffusion with PreferencePoster24 citations
- APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and InferenceOral24 citations
- Active Preference Learning for Large Language ModelsPoster24 citations
- Adversarial Robustness Limits via Scaling-Law and Human-Alignment StudiesPoster24 citations
- AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRAPoster24 citations
- Conformal prediction for multi-dimensional time series by ellipsoidal setsSpotlight24 citations
- Converting Transformers to Polynomial Form for Secure Inference Over Homomorphic EncryptionPoster24 citations
- Decomposing and Editing Predictions by Modeling Model ComputationPoster24 citations
- Discovering Environments with XRMOral24 citations
- Foundation Policies with Hilbert RepresentationsPoster24 citations
- Generalization in Kernel Regression Under Realistic AssumptionsSpotlight24 citations
- In-Context Learning Agents Are Asymmetric Belief UpdatersPoster24 citations
- Large Language Models Can Automatically Engineer Features for Few-Shot Tabular LearningPoster24 citations
- Learning a Diffusion Model Policy from Rewards via Q-Score MatchingPoster24 citations
- Linguistic Calibration of Long-Form GenerationsPoster24 citations
- Smooth Tchebycheff Scalarization for Multi-Objective OptimizationPoster24 citations
- Split-and-Denoise: Protect large language model inference with local differential privacyPoster24 citations
- Towards Efficient Exact Optimization of Language Model AlignmentPoster24 citations
- Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention CalibrationPoster24 citations
- Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM InversionPoster24 citations
- Causal Representation Learning from Multiple Distributions: A General SettingPoster23 citations
- Conformal Prediction for Deep Classifier via Label RankingPoster23 citations
- Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under CompressionPoster23 citations
- Deep Networks Always Grok and Here is WhyPoster23 citations
- Don't trust your eyes: on the (un)reliability of feature visualizationsPoster23 citations
- Efficient Exploration for LLMsPoster23 citations
- Parameterized Physics-informed Neural Networks for Parameterized PDEsOral23 citations
- Revitalizing Multivariate Time Series Forecasting: Learnable Decomposition with Inter-Series Dependencies and Intra-Series Variations ModelingPoster23 citations
- RoboDreamer: Learning Compositional World Models for Robot ImaginationPoster23 citations
- SelfIE: Self-Interpretation of Large Language Model EmbeddingsPoster23 citations
- Variational Learning is Effective for Large Deep NetworksSpotlight23 citations
- A Sober Look at LLMs for Material Discovery: Are They Actually Good for Bayesian Optimization Over Molecules?Poster22 citations
- AI Alignment with Changing and Influenceable Reward FunctionsPoster22 citations
- AST-T5: Structure-Aware Pretraining for Code Generation and UnderstandingPoster22 citations
- CATS: Enhancing Multivariate Time Series Forecasting by Constructing Auxiliary Time Series as Exogenous VariablesPoster22 citations
- CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language TransformersPoster22 citations
- Disentangled 3D Scene Generation with Layout LearningPoster22 citations
- Generalized Neural Collapse for a Large Number of ClassesPoster22 citations
- Graph-enhanced Large Language Models in Asynchronous Plan ReasoningPoster22 citations
- Mechanistic Design and Scaling of Hybrid ArchitecturesPoster22 citations
- Non-Vacuous Generalization Bounds for Large Language ModelsPoster22 citations
- On the Implicit Bias of AdamPoster22 citations
- Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement LearningPoster22 citations
- Align Your Steps: Optimizing Sampling Schedules in Diffusion ModelsPoster21 citations
- Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERTPoster21 citations
- Codebook Features: Sparse and Discrete Interpretability for Neural NetworksPoster21 citations
- Graph Generation with Diffusion MixturePoster21 citations
- IBD-PSC: Input-level Backdoor Detection via Parameter-oriented Scaling ConsistencyPoster21 citations
- In-Context Reinforcement Learning for Variable Action SpacesPoster21 citations
- LoRA Training in the NTK Regime has No Spurious Local MinimaOral21 citations
- Modeling Caption Diversity in Contrastive Vision-Language PretrainingPoster21 citations
- Privacy-Preserving Instructions for Aligning Large Language ModelsPoster21 citations
- Protein Conformation Generation via Force-Guided SE(3) Diffusion ModelsPoster21 citations
- Riemannian Preconditioned LoRA for Fine-Tuning Foundation ModelsPoster21 citations
- Scaling Exponents Across Parameterizations and OptimizersPoster21 citations
- Trainable Transformer in TransformerPoster21 citations
- Unifying Image Processing as Visual Prompting Question AnsweringPoster21 citations
- Vanilla Bayesian Optimization Performs Great in High DimensionsPoster21 citations
- Wukong: Towards a Scaling Law for Large-Scale RecommendationPoster21 citations
- Agent Instructs Large Language Models to be General Zero-Shot ReasonersPoster20 citations
- Beyond ELBOs: A Large-Scale Evaluation of Variational Methods for SamplingPoster20 citations
- CasCast: Skillful High-resolution Precipitation Nowcasting via Cascaded ModellingPoster20 citations
- CodeIt: Self-Improving Language Models with Prioritized Hindsight ReplayPoster20 citations
- Consistent Diffusion Meets Tweedie: Training Exact Ambient Diffusion Models with Noisy DataPoster20 citations
- Critical windows: non-asymptotic theory for feature emergence in diffusion modelsPoster20 citations
- DRCT: Diffusion Reconstruction Contrastive Training towards Universal Detection of Diffusion Generated ImagesSpotlight20 citations
- Diffusion Models Encode the Intrinsic Dimension of Data ManifoldsPoster20 citations
- Distinguishing the Knowable from the Unknowable with Language ModelsPoster20 citations
- Equivariant Graph Neural Operator for Modeling 3D DynamicsPoster20 citations
- Fewer Truncations Improve Language ModelingPoster20 citations
- Generalization to New Sequential Decision Making Tasks with In-Context LearningPoster20 citations
- Graph Positional and Structural EncoderPoster20 citations
- LLark: A Multimodal Instruction-Following Language Model for MusicPoster20 citations
- Neural Operators with Localized Integral and Differential KernelsPoster20 citations
- Position: Considerations for Differentially Private Learning with Large-Scale Public PretrainingOral20 citations
- Privacy Backdoors: Stealing Data with Corrupted Pretrained ModelsPoster20 citations
- Q-value Regularized Transformer for Offline Reinforcement LearningPoster20 citations
- Rethinking Optimization and Architecture for Tiny Language ModelsPoster20 citations
- Stochastic Interpolants with Data-Dependent CouplingsSpotlight20 citations
- Test-Time Model Adaptation with Only Forward PassesOral20 citations
- Variance-reduced Zeroth-Order Methods for Fine-Tuning Language ModelsPoster20 citations
- VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual ContextPoster20 citations
- What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formationSpotlight20 citations
- eCeLLM: Generalizing Large Language Models for E-commerce from Large-scale, High-quality Instruction DataPoster20 citations
- A Diffusion Model Framework for Unsupervised Neural Combinatorial OptimizationPoster19 citations
- A Language Model’s Guide Through Latent SpacePoster19 citations
- A Multimodal Automated Interpretability AgentPoster19 citations
- Accelerating Parallel Sampling of Diffusion ModelsPoster19 citations
- Automated Evaluation of Retrieval-Augmented Language Models with Task-Specific Exam GenerationOral19 citations
- Case-Based or Rule-Based: How Do Transformers Do the Math?Poster19 citations
- Cell2Sentence: Teaching Large Language Models the Language of BiologyPoster19 citations
- Equivariant Deep Weight Space AlignmentPoster19 citations
- Equivariant Frames and the Impossibility of Continuous CanonicalizationPoster19 citations
- From Self-Attention to Markov Models: Unveiling the Dynamics of Generative TransformersPoster19 citations
- GliDe with a CaPE: A Low-Hassle Method to Accelerate Speculative DecodingPoster19 citations
- Hybrid Inverse Reinforcement LearningPoster19 citations
- In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination MitigationPoster19 citations
- Learning to Intervene on Concept BottlenecksPoster19 citations
- MolCRAFT: Structure-Based Drug Design in Continuous Parameter SpacePoster19 citations
- MusicRL: Aligning Music Generation to Human PreferencesPoster19 citations
- The Entropy Enigma: Success and Failure of Entropy MinimizationPoster19 citations
- To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language ModelsPoster19 citations
- Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language ModelsPoster19 citations
- TroVE: Inducing Verifiable and Efficient Toolboxes for Solving Programmatic TasksPoster19 citations
- A Closer Look at the Limitations of Instruction TuningPoster18 citations
- A Statistical Theory of Regularization-Based Continual LearningPoster18 citations
- Benign Overfitting in Two-Layer ReLU Convolutional Neural Networks for XOR DataPoster18 citations
- Can Looped Transformers Learn to Implement Multi-step Gradient Descent for In-context Learning?Poster18 citations
- Compressible Dynamics in Deep Overparameterized Low-Rank Learning & AdaptationOral18 citations
- GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision TransformerPoster18 citations
- High-Probability Convergence for Composite and Distributed Stochastic Minimization and Variational Inequalities with Heavy-Tailed NoiseOral18 citations
- Hypergraph-enhanced Dual Semi-supervised Graph ClassificationPoster18 citations
- Image Clustering with External GuidanceOral18 citations
- LQER: Low-Rank Quantization Error Reconstruction for LLMsPoster18 citations
- Matrix Information Theory for Self-Supervised LearningPoster18 citations
- Multi-layer Rehearsal Feature Augmentation for Class-Incremental LearningPoster18 citations
- Multicalibration for Confidence Scoring in LLMsPoster18 citations
- On the Embedding Collapse when Scaling up Recommendation ModelsPoster18 citations
- Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman ProblemsOral18 citations
- RoboCodeX: Multimodal Code Generation for Robotic Behavior SynthesisPoster18 citations
- Sampling in Unit Time with Kernel Fisher-Rao FlowPoster18 citations
- TimeSiam: A Pre-Training Framework for Siamese Time-Series ModelingPoster18 citations
- ViP: A Differentially Private Foundation Model for Computer VisionOral18 citations
- A Computational Framework for Solving Wasserstein Lagrangian FlowsPoster17 citations
- A Hierarchical Adaptive Multi-Task Reinforcement Learning Framework for Multiplier Circuit DesignPoster17 citations
- An Analysis of Linear Time Series Forecasting ModelsPoster17 citations
- Auto-Encoding Morph-Tokens for Multimodal LLMSpotlight17 citations
- Catapults in SGD: spikes in the training loss and their impact on generalization through feature learningPoster17 citations
- Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic DimensionPoster17 citations
- Curated LLM: Synergy of LLMs and Data Curation for tabular augmentation in low-data regimesPoster17 citations
- DPZero: Private Fine-Tuning of Language Models without BackpropagationPoster17 citations
- Data-efficient Large Vision Models through Sequential AutoregressionPoster17 citations
- Designing Decision Support Systems using Counterfactual Prediction SetsSpotlight17 citations
- DetKDS: Knowledge Distillation Search for Object DetectorsPoster17 citations
- Dynamic Evaluation of Large Language Models by Meta Probing AgentsPoster17 citations
- Exploration and Anti-Exploration with Distributional Random Network DistillationPoster17 citations
- Learning Reward for Robot Skills Using Large Language Models via Self-AlignmentPoster17 citations
- Multimodal Prototyping for cancer survival predictionPoster17 citations
- Offline Actor-Critic Reinforcement Learning Scales to Large ModelsOral17 citations
- Optimal Differentially Private Model Training with Public DataPoster17 citations
- Position: Measure Dataset Diversity, Don't Just Claim ItOral17 citations
- Prototypical Transformer As Unified Motion LearnersPoster17 citations
- Reinforcement Learning within Tree Search for Fast Macro PlacementPoster17 citations
- SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise AttentionOral17 citations
- Swallowing the Bitter Pill: Simplified Scalable Conformer GenerationPoster17 citations
- Time Weaver: A Conditional Time Series Generation ModelSpotlight17 citations
- BAT: Learning to Reason about Spatial Sounds with Large Language ModelsPoster16 citations
- CARTE: Pretraining and Transfer for Tabular LearningPoster16 citations
- Compositional Text-to-Image Generation with Dense Blob RepresentationsPoster16 citations
- Compressing Large Language Models by Joint Sparsification and QuantizationPoster16 citations
- ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal ModelsPoster16 citations
- Do Efficient Transformers Really Save Computation?Poster16 citations
- Do Language Models Exhibit the Same Cognitive Biases in Problem Solving as Human Learners?Poster16 citations
- Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization FunctionPoster16 citations
- Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data UtilizationPoster16 citations
- Flextron: Many-in-One Flexible Large Language ModelOral16 citations
- Graph Neural Networks Use Graphs When They Shouldn'tPoster16 citations
- Graph-based Time Series Clustering for End-to-End Hierarchical ForecastingPoster16 citations
- How Private are DP-SGD Implementations?Oral16 citations
- How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?Oral16 citations
- How do Transformers Perform In-Context Autoregressive Learning ?Poster16 citations
- Improved Generalization of Weight Space Networks via AugmentationsPoster16 citations
- Improving Context Understanding in Multimodal Large Language Models via Multimodal Composition LearningPoster16 citations
- Improving fine-grained understanding in image-text pre-trainingPoster16 citations
- Language Models as Science TutorsPoster16 citations
- Learning with 3D rotations, a hitchhiker's guide to SO(3)Poster16 citations
- Offline Training of Language Model Agents with Functions as Learnable WeightsPoster16 citations
- Prompting a Pretrained Transformer Can Be a Universal ApproximatorPoster16 citations
- ReGAL: Refactoring Programs to Discover Generalizable AbstractionsPoster16 citations
- Rethinking Decision Transformer via Hierarchical Reinforcement LearningPoster16 citations
- STEER: Assessing the Economic Rationality of Large Language ModelsPoster16 citations
- Scalable AI Safety via Doubly-Efficient DebateOral16 citations
- Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-CriticPoster16 citations
- The Good, The Bad, and Why: Unveiling Emotions in Generative AIPoster16 citations
- Two Heads Are Better Than One: Boosting Graph Sparse Training via Semantic and Topological AwarenessPoster16 citations
- Understanding Heterophily for Graph Neural NetworksPoster16 citations
- UniAudio: Towards Universal Audio Generation with Large Language ModelsPoster16 citations
- What Improves the Generalization of Graph Transformers? A Theoretical Dive into the Self-attention and Positional EncodingPoster16 citations
- Any-Precision LLM: Low-Cost Deployment of Multiple, Different-Sized LLMsOral15 citations
- Diving into Underwater: Segment Anything Model Guided Underwater Salient Instance Segmentation and A Large-scale DatasetPoster15 citations
- Envisioning Outlier Exposure by Large Language Models for Out-of-Distribution DetectionPoster15 citations
- EquiPocket: an E(3)-Equivariant Geometric Graph Neural Network for Ligand Binding Site PredictionOral15 citations
- Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation ProblemSpotlight15 citations
- FlashST: A Simple and Universal Prompt-Tuning Framework for Traffic PredictionPoster15 citations
- Graph Neural Network Explanations are FragilePoster15 citations
- Hierarchical State Space Models for Continuous Sequence-to-Sequence ModelingPoster15 citations
- Human vs. Generative AI in Content Creation Competition: Symbiosis or Conflict?Poster15 citations
- INViT: A Generalizable Routing Problem Solver with Invariant Nested View TransformerPoster15 citations
- Improving Diffusion Models for Inverse Problems Using Optimal Posterior CovariancePoster15 citations
- InferCept: Efficient Intercept Support for Augmented Large Language Model InferencePoster15 citations
- LSEnet: Lorentz Structural Entropy Neural Network for Deep Graph ClusteringOral15 citations
- Larimar: Large Language Models with Episodic Memory ControlPoster15 citations
- Learning to Scale Logits for Temperature-Conditional GFlowNetsPoster15 citations
- Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context LearningPoster15 citations
- More Benefits of Being Distributional: Second-Order Bounds for Reinforcement LearningPoster15 citations
- Plug-in Performative OptimizationPoster15 citations
- Position: Key Claims in LLM Research Have a Long Tail of FootnotesPoster15 citations
- Reinformer: Max-Return Sequence Modeling for Offline RLPoster15 citations
- Robust and Conjugate Gaussian Process RegressionSpotlight15 citations
- S3GCL: Spectral, Swift, Spatial Graph Contrastive LearningPoster15 citations
- Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMsPoster15 citations
- An Image is Worth Multiple Words: Discovering Object Level Concepts using Multi-Concept Prompt LearningPoster14 citations
- Class-Imbalanced Graph Learning without Class RebalancingPoster14 citations
- Equivariant Diffusion for Crystal Structure PredictionPoster14 citations
- Full-Atom Peptide Design based on Multi-modal Flow MatchingPoster14 citations
- HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement LearningPoster14 citations
- How Do Nonlinear Transformers Learn and Generalize in In-Context Learning?Poster14 citations
- In value-based deep reinforcement learning, a pruned network is a good networkPoster14 citations
- Interpretability Illusions in the Generalization of Simplified ModelsPoster14 citations
- Interpretable Deep Clustering for Tabular DataPoster14 citations
- Is In-Context Learning in Large Language Models Bayesian? A Martingale PerspectivePoster14 citations
- Learning Adaptive and View-Invariant Vision Transformer for Real-Time UAV TrackingPoster14 citations
- Learning Universal PredictorsPoster14 citations
- Liouville Flow Importance SamplerPoster14 citations
- Lyapunov-stable Neural Control for State and Output Feedback: A Novel FormulationPoster14 citations
- MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language ModelsPoster14 citations
- Make-A-Shape: a Ten-Million-scale 3D Shape ModelPoster14 citations
- Memorization Through the Lens of Curvature of Loss Function Around SamplesSpotlight14 citations
- On Least Square Estimation in Softmax Gating Mixture of ExpertsPoster14 citations
- On Mechanistic Knowledge Localization in Text-to-Image Generative ModelsPoster14 citations
- Physics-Informed Neural Network Policy Iteration: Algorithms, Convergence, and VerificationPoster14 citations
- Position: Future Directions in the Theory of Graph Machine LearningPoster14 citations
- Revisiting Character-level Adversarial Attacks for Language ModelsPoster14 citations
- SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch NormalizationPoster14 citations
- Stochastic Localization via Iterative Posterior SamplingSpotlight14 citations
- Symbolic Music Generation with Non-Differentiable Rule Guided DiffusionOral14 citations
- Towards Certified Unlearning for Deep Neural NetworksPoster14 citations
- Towards Scalable and Versatile Weight Space LearningPoster14 citations
- Transformers Provably Learn Sparse Token Selection While Fully-Connected Nets CannotPoster14 citations
- Weisfeiler-Leman at the margin: When more expressivity mattersPoster14 citations
- A Sparsity Principle for Partially Observable Causal Representation LearningPoster13 citations
- Automated Statistical Model Discovery with Language ModelsPoster13 citations
- Borda Regret Minimization for Generalized Linear Dueling BanditsPoster13 citations
- Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic SegmentationPoster13 citations
- Causal Representation Learning Made Identifiable by Grouping of Observational VariablesPoster13 citations
- Characterizing Overfitting in Kernel Ridgeless Regression Through the EigenspectrumPoster13 citations
- Clifford-Steerable Convolutional Neural NetworksPoster13 citations
- Community-Invariant Graph Contrastive LearningPoster13 citations
- Comparing Graph Transformers via Positional EncodingsPoster13 citations
- ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet AccuracyPoster13 citations
- DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete LatentsPoster13 citations
- DySLIM: Dynamics Stable Learning by Invariant Measure for Chaotic SystemsPoster13 citations
- Fair Resource Allocation in Multi-Task LearningPoster13 citations
- Few-Shot Character Understanding in Movies as an Assessment to Meta-Learning of Theory-of-MindPoster13 citations
- Generalist Equivariant Transformer Towards 3D Molecular Interaction LearningPoster13 citations
- GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language ModelPoster13 citations
- Graph Neural Stochastic Diffusion for Estimating Uncertainty in Node ClassificationPoster13 citations
- Graph-based Forecasting with Missing Data through Spatiotemporal DownsamplingPoster13 citations
- Hyperbolic Geometric Latent Diffusion Model for Graph GenerationPoster13 citations
- Image Restoration Through Generalized Ornstein-Uhlenbeck BridgePoster13 citations
- Jetfire: Efficient and Accurate Transformer Pretraining with INT8 Data Flow and Per-Block QuantizationSpotlight13 citations
- Locally Estimated Global Perturbations are Better than Local Perturbations for Federated Sharpness-aware MinimizationSpotlight13 citations
- Non-confusing Generation of Customized Concepts in Diffusion ModelsPoster13 citations
- On the Independence Assumption in Neurosymbolic LearningPoster13 citations
- Pairwise Alignment Improves Graph Domain AdaptationSpotlight13 citations
- Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHFPoster13 citations
- RIME: Robust Preference-based Reinforcement Learning with Noisy PreferencesSpotlight13 citations
- Recovering the Pre-Fine-Tuning Weights of Generative ModelsPoster13 citations
- Regression with Multi-Expert DeferralSpotlight13 citations
- Sample-Efficient Robust Multi-Agent Reinforcement Learning in the Face of Environmental UncertaintyPoster13 citations
- Scalable Online Exploration via CoverabilityPoster13 citations
- Self-Correcting Self-Consuming Loops for Generative Model TrainingPoster13 citations
- Single-Trajectory Distributionally Robust Reinforcement LearningPoster13 citations
- Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise NetworksPoster13 citations
- Stable Differentiable Causal DiscoveryPoster13 citations
- TERD: A Unified Framework for Safeguarding Diffusion Models Against BackdoorsPoster13 citations
- Toward Adaptive Reasoning in Large Language Models with Thought RollbackPoster13 citations
- Understanding Adam Optimizer via Online Learning of Updates: Adam is FTRL in DisguisePoster13 citations
- WAVES: Benchmarking the Robustness of Image WatermarksPoster13 citations
- A connection between Tempering and Entropic Mirror DescentPoster12 citations
- Autoformalizing Euclidean GeometryPoster12 citations
- BAGEL: Bootstrapping Agents by Guiding Exploration with LanguagePoster12 citations
- Binning as a Pretext Task: Improving Self-Supervised Learning in Tabular DomainsPoster12 citations
- CHEMREASONER: Heuristic Search over a Large Language Model’s Knowledge Space using Quantum-Chemical FeedbackPoster12 citations
- CLIF: Complementary Leaky Integrate-and-Fire Neuron for Spiking Neural NetworksSpotlight12 citations
- Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order PerspectivePoster12 citations
- Code as Reward: Empowering Reinforcement Learning with VLMsSpotlight12 citations
- FreeBind: Free Lunch in Unified Multimodal Space via Knowledge FusionPoster12 citations
- Gaussian Processes on Cellular ComplexesPoster12 citations
- Graph Mixup on Approximate Gromov–Wasserstein GeodesicsPoster12 citations
- How to Trace Latent Generative Model Generated Images without Artificial Watermark?Poster12 citations
- Improved Operator Learning by Orthogonal AttentionSpotlight12 citations
- Integrated Hardware Architecture and Device Placement SearchPoster12 citations
- Irregular Multivariate Time Series Forecasting: A Transformable Patching Graph Neural Networks ApproachPoster12 citations
- KernelSHAP-IQ: Weighted Least Square Optimization for Shapley InteractionsPoster12 citations
- Latent Space Symmetry DiscoveryPoster12 citations
- Libra: Building Decoupled Vision System on Large Language ModelsPoster12 citations
- Light and Optimal Schrödinger Bridge MatchingPoster12 citations
- Neural Collapse for Cross-entropy Class-Imbalanced Learning with Unconstrained ReLU Features ModelPoster12 citations
- Outlier-robust Kalman Filtering through Generalised BayesPoster12 citations
- PICLe: Eliciting Diverse Behaviors from Large Language Models with Persona In-Context LearningPoster12 citations
- Position: Relational Deep Learning - Graph Representation Learning on Relational DatabasesPoster12 citations
- Probabilistic Forecasting with Stochastic Interpolants and Föllmer ProcessesPoster12 citations
- Provable Multi-Task Representation Learning by Two-Layer ReLU Neural NetworksOral12 citations
- RNAFlow: RNA Structure & Sequence Design via Inverse Folding-Based Flow MatchingPoster12 citations
- Random Masking Finds Winning Tickets for Parameter Efficient Fine-tuningPoster12 citations
- Rate-Optimal Policy Optimization for Linear Markov Decision ProcessesOral12 citations
- Refining Minimax Regret for Unsupervised Environment DesignPoster12 citations
- Relaxing the Accurate Imputation Assumption in Doubly Robust Learning for Debiased Collaborative FilteringSpotlight12 citations
- Revisiting the Power of Prompt for Visual TuningSpotlight12 citations
- Selecting Large Language Model to Fine-tune via Rectified Scaling LawPoster12 citations
- StrokeNUWA—Tokenizing Strokes for Vector Graphic SynthesisPoster12 citations
- Superpoint Gaussian Splatting for Real-Time High-Fidelity Dynamic Scene ReconstructionPoster12 citations
- TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance LearningPoster12 citations
- Truly No-Regret Learning in Constrained MDPsSpotlight12 citations
- Two Stones Hit One Bird: Bilevel Positional Encoding for Better Length ExtrapolationPoster12 citations
- Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths AggregationPoster12 citations
- Unsupervised Evaluation of Code LLMs with Round-Trip CorrectnessPoster12 citations
- Using AI Uncertainty Quantification to Improve Human Decision-MakingPoster12 citations
- $H$-Consistency Guarantees for RegressionPoster11 citations
- A New Robust Partial p-Wasserstein-Based Metric for Comparing DistributionsPoster11 citations
- Active Statistical InferenceOral11 citations
- Asymptotics of Learning with Deep Structured (Random) FeaturesPoster11 citations
- BECoTTA: Input-dependent Online Blending of Experts for Continual Test-time AdaptationPoster11 citations
- Causally Motivated Personalized Federated Invariant Learning with Shortcut-Averse Information-Theoretic RegularizationPoster11 citations
- Compute Better Spent: Replacing Dense Layers with Structured MatricesPoster11 citations
- Conformal Prediction with Learned FeaturesPoster11 citations
- CuTS: Customizable Tabular Synthetic Data GenerationPoster11 citations
- DRED: Zero-Shot Transfer in Reinforcement Learning via Data-Regularised Environment DesignPoster11 citations
- Deeper or Wider: A Perspective from Optimal Generalization Error with Sobolev LossPoster11 citations
- Disentangled Graph Self-supervised Learning for Out-of-Distribution GeneralizationPoster11 citations
- Distribution Alignment Optimization through Neural Collapse for Long-tailed ClassificationPoster11 citations
- ERQ: Error Reduction for Post-Training Quantization of Vision TransformersSpotlight11 citations
- Efficient and Effective Time-Series Forecasting with Spiking Neural NetworksPoster11 citations
- Emergence of In-Context Reinforcement Learning from Noise DistillationPoster11 citations
- Failures Are Fated, But Can Be Faded: Characterizing and Mitigating Unwanted Behaviors in Large-Scale Vision and Language ModelsSpotlight11 citations
- Fast Decision Boundary based Out-of-Distribution DetectorPoster11 citations
- Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage SufficesPoster11 citations
- Gradient-based Visual Explanation for Transformer-based CLIPPoster11 citations
- Grokking Group Multiplication with CosetsPoster11 citations
- How Smooth Is Attention?Poster11 citations
- How to Escape Sharp Minima with Random PerturbationsPoster11 citations
- Information Flow in Self-Supervised LearningPoster11 citations
- Is Temperature Sample Efficient for Softmax Gaussian Mixture of Experts?Poster11 citations
- LaMAGIC: Language-Model-based Topology Generation for Analog Integrated CircuitsPoster11 citations
- Language Models Represent Beliefs of Self and OthersPoster11 citations
- Mastering Robot Manipulation with Multimodal Prompts through Pretraining and Multi-task Fine-tuningPoster11 citations
- Mind the Boundary: Coreset Selection via Reconstructing the Decision BoundaryPoster11 citations
- Multi-Sender Persuasion: A Computational PerspectivePoster11 citations
- On the Duality Between Sharpness-Aware Minimization and Adversarial TrainingPoster11 citations
- Parameter Efficient Quasi-Orthogonal Fine-Tuning via Givens RotationPoster11 citations
- Position: AI-Powered Autonomous Weapons Risk Geopolitical Instability and Threaten AI ResearchOral11 citations
- Position: Why We Must Rethink Empirical Research in Machine LearningPoster11 citations
- PrE-Text: Training Language Models on Private Federated Data in the Age of LLMsOral11 citations
- ProtoGate: Prototype-based Neural Networks with Global-to-local Feature Selection for Tabular Biomedical DataPoster11 citations
- RLVF: Learning from Verbal Feedback without OvergeneralizationPoster11 citations
- Residual Quantization with Implicit Neural CodebooksPoster11 citations
- Rethinking Data Shapley for Data Selection Tasks: Misleads and MeritsOral11 citations
- Rethinking Momentum Knowledge Distillation in Online Continual LearningPoster11 citations
- SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied ManipulationPoster11 citations
- See More Details: Efficient Image Super-Resolution by Experts MiningPoster11 citations
- Simulation of Graph Algorithms with Looped TransformersPoster11 citations
- SleepFM: Multi-modal Representation Learning for Sleep Across Brain Activity, ECG and Respiratory SignalsPoster11 citations
- Spider: A Unified Framework for Context-dependent Concept SegmentationPoster11 citations
- Time Series Diffusion in the Frequency DomainPoster11 citations
- TimeX++: Learning Time-Series Explanations with Information BottleneckPoster11 citations
- UniCorn: A Unified Contrastive Learning Approach for Multi-view Molecular Representation LearningPoster11 citations
- Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with TransformersPoster11 citations
- What Can Transformer Learn with Varying Depth? Case Studies on Sequence Learning TasksPoster11 citations
- An Empirical Study of Realized GNN ExpressivenessPoster10 citations
- Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor AttacksPoster10 citations
- Beyond Sole Strength: Customized Ensembles for Generalized Vision-Language ModelsPoster10 citations
- CoLoRA: Continuous low-rank adaptation for reduced implicit neural modeling of parameterized partial differential equationsPoster10 citations
- Coarse-to-Fine Highlighting: Reducing Knowledge Hallucination in Large Language ModelsPoster10 citations
- Confronting Reward Overoptimization for Diffusion Models: A Perspective of Inductive and Primacy BiasesPoster10 citations
- CosPGD: an efficient white-box adversarial attack for pixel-wise prediction tasksPoster10 citations
- Cross-Domain Policy Adaptation by Capturing Representation MismatchPoster10 citations
- DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory StitchingPoster10 citations
- Differentiability and Optimization of Multiparameter Persistent HomologyPoster10 citations
- DiracDiffusion: Denoising and Incremental Reconstruction with Assured Data-ConsistencyPoster10 citations
- Disentangled Continual Graph Neural Architecture Search with Invariant Modular SupernetPoster10 citations
- EfficientZero V2: Mastering Discrete and Continuous Control with Limited DataSpotlight10 citations
- Erasing the Bias: Fine-Tuning Foundation Models for Semi-Supervised LearningPoster10 citations
- EvGGS: A Collaborative Learning Framework for Event-based Generalizable Gaussian SplattingPoster10 citations
- EvTexture: Event-driven Texture Enhancement for Video Super-ResolutionPoster10 citations
- Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle TasksOral10 citations
- FedRC: Tackling Diverse Distribution Shifts Challenge in Federated Learning by Robust ClusteringPoster10 citations
- FrameQuant: Flexible Low-Bit Quantization for TransformersPoster10 citations
- From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint TuningPoster10 citations
- FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement LearningPoster10 citations
- HAMLET: Graph Transformer Neural Operator for Partial Differential EquationsPoster10 citations
- Harmonizing Generalization and Personalization in Federated Prompt LearningPoster10 citations
- Harnessing the Power of Neural Operators with Automatically Encoded Conservation LawsSpotlight10 citations
- HyperFields: Towards Zero-Shot Generation of NeRFs from TextPoster10 citations
- In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-ThoughtPoster10 citations
- In-Context Freeze-Thaw Bayesian Optimization for Hyperparameter OptimizationPoster10 citations
- Is Epistemic Uncertainty Faithfully Represented by Evidential Deep Learning Methods?Poster10 citations
- Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific ModelsPoster10 citations
- LLM-Empowered State Representation for Reinforcement LearningPoster10 citations
- LangCell: Language-Cell Pre-training for Cell Identity UnderstandingPoster10 citations
- Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-MakingPoster10 citations
- Leveraging Self-Consistency for Data-Efficient Amortized Bayesian InferencePoster10 citations
- Log Neural Controlled Differential Equations: The Lie Brackets Make A DifferencePoster10 citations
- MH-pFLID: Model Heterogeneous personalized Federated Learning via Injection and Distillation for Medical Data AnalysisPoster10 citations
- Memory-Space Visual Prompting for Efficient Vision-Language Fine-TuningPoster10 citations
- On the Trajectory Regularity of ODE-based Diffusion SamplingPoster10 citations
- Out-of-Domain Generalization in Dynamical Systems ReconstructionPoster10 citations
- Potential Based Diffusion Motion PlanningPoster10 citations
- Principled Preferential Bayesian OptimizationOral10 citations
- Prometheus: Out-of-distribution Fluid Dynamics Modeling with Disentangled Graph ODEPoster10 citations
- Random Exploration in Bayesian Optimization: Order-Optimal Regret and Computational EfficiencyPoster10 citations
- Re-Dock: Towards Flexible and Realistic Molecular Docking with Diffusion BridgeSpotlight10 citations
- Refined Coreset Selection: Towards Minimal Coreset Size under Model Performance ConstraintsSpotlight10 citations
- Replicable Learning of Large-Margin HalfspacesSpotlight10 citations
- Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human PreferencesPoster10 citations
- Rotational Equilibrium: How Weight Decay Balances Learning Across Neural NetworksPoster10 citations
- Scalable Wasserstein Gradient Flow for Generative Modeling through Unbalanced Optimal TransportPoster10 citations
- Shifted Interpolation for Differential PrivacyPoster10 citations
- Sign is Not a Remedy: Multiset-to-Multiset Message Passing for Learning on Heterophilic GraphsPoster10 citations
- Smoothness Adaptive Hypothesis Transfer LearningPoster10 citations
- Subgraphormer: Unifying Subgraph GNNs and Graph Transformers via Graph ProductsPoster10 citations
- Superposition Prompting: Improving and Accelerating Retrieval-Augmented GenerationPoster10 citations
- The Relative Value of Prediction in Algorithmic Decision MakingPoster10 citations
- Towards Resource-friendly, Extensible and Stable Incomplete Multi-view ClusteringSpotlight10 citations
- Towards Understanding Inductive Bias in Transformers: A View From InfinityPoster10 citations
- Triplet Interaction Improves Graph Transformers: Accurate Molecular Graph Learning with Triplet Graph TransformersPoster10 citations
- Tuning-Free Stochastic OptimizationSpotlight10 citations
- Uncertainty for Active Learning on GraphsPoster10 citations
- Understanding the Effects of Iterative Prompting on TruthfulnessPoster10 citations
- Various Lengths, Constant Speed: Efficient Language Modeling with Lightning AttentionPoster10 citations
- Weakly Convex Regularisers for Inverse Problems: Convergence of Critical Points and Primal-Dual OptimisationPoster10 citations
- A Geometric Decomposition of Finite Games: Convergence vs. Recurrence under Exponential WeightsSpotlight9 citations
- A Geometric Explanation of the Likelihood OOD Detection ParadoxPoster9 citations
- A fast algorithm to simulate nonlinear resistive networksPoster9 citations
- Balanced Resonate-and-Fire NeuronsPoster9 citations
- BayOTIDE: Bayesian Online Multivariate Time Series Imputation with Functional DecompositionSpotlight9 citations
- Beyond Individual Input for Deep Anomaly Detection on Tabular DataPoster9 citations
- CLIPZyme: Reaction-Conditioned Virtual Screening of EnzymesPoster9 citations
- CarbonNovo: Joint Design of Protein Structure and Sequence Using a Unified Energy-based ModelPoster9 citations
- Compositional Capabilities of Autoregressive Transformers: A Study on Synthetic, Interpretable TasksPoster9 citations
- Compositional Few-Shot Class-Incremental LearningPoster9 citations
- Conformal Validity Guarantees Exist for Any Data Distribution (and How to Find Them)Poster9 citations
- Connecting the Dots: Is Mode-Connectedness the Key to Feasible Sample-Based Inference in Bayesian Neural Networks?Poster9 citations
- DiJiang: Efficient Large Language Models through Compact KernelizationOral9 citations
- Differentiable Weightless Neural NetworksPoster9 citations
- Diffusion Posterior Sampling is Computationally IntractablePoster9 citations
- Discrete Latent Perspective Learning for Segmentation and DetectionSpotlight9 citations
- EDISON: Enhanced Dictionary-Induced Tensorized Incomplete Multi-View Clustering with Gaussian Error Rank MinimizationPoster9 citations
- Emergent Representations of Program Semantics in Language Models Trained on ProgramsPoster9 citations
- Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language ModelsPoster9 citations
- Experts Don't Cheat: Learning What You Don't Know By Predicting PairsPoster9 citations
- Explaining Graph Neural Networks via Structure-aware Interaction IndexPoster9 citations
- Feature Distribution on Graph Topology Mediates the Effect of Graph Convolution: Homophily PerspectivePoster9 citations
- Federated Continual Learning via Prompt-based Dual Knowledge TransferPoster9 citations
- Feel-Good Thompson Sampling for Contextual Dueling BanditsPoster9 citations
- HexGen: Generative Inference of Large Language Model over Heterogeneous EnvironmentPoster9 citations
- Homomorphism Counts for Graph Neural Networks: All About That BasisPoster9 citations
- How Interpretable Are Interpretable Graph Neural Networks?Poster9 citations
- How to Make the Gradients Small Privately: Improved Rates for Differentially Private Non-Convex OptimizationPoster9 citations
- Hyperbolic Active Learning for Semantic Segmentation under Domain ShiftPoster9 citations
- Improving Open-Ended Text Generation via Adaptive DecodingPoster9 citations
- Inferring the Long-Term Causal Effects of Long-Term Treatments from Short-Term ExperimentsOral9 citations
- Interpreting and Improving Large Language Models in Arithmetic CalculationOral9 citations
- Language-guided Skill Learning with Temporal Variational InferencePoster9 citations
- Learning Coverage Paths in Unknown Environments with Deep Reinforcement LearningPoster9 citations
- Learning Useful Representations of Recurrent Neural Network Weight MatricesOral9 citations
- Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMsPoster9 citations
- Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and FeedbackPoster9 citations
- Membership Inference Attacks on Diffusion Models via Quantile RegressionPoster9 citations
- Moreau Envelope for Nonconvex Bi-Level Optimization: A Single-Loop and Hessian-Free Solution StrategyPoster9 citations
- Multi-Source Conformal Inference Under Distribution ShiftPoster9 citations
- MusicFlow: Cascaded Flow Matching for Text Guided Music GenerationPoster9 citations
- Neural operators meet conjugate gradients: The FCG-NO method for efficient PDE solvingPoster9 citations
- OSSCAR: One-Shot Structured Pruning in Vision and Language Models with Combinatorial OptimizationPoster9 citations
- OTMatch: Improving Semi-Supervised Learning with Optimal TransportPoster9 citations
- On Hypothesis Transfer Learning of Functional Linear ModelsPoster9 citations
- One-Shot Strategic Classification Under Unknown CostsPoster9 citations
- Online Learning under Budget and ROI Constraints via Weak AdaptivityPoster9 citations
- Optimal Ridge Regularization for Out-of-Distribution PredictionSpotlight9 citations
- Position: Understanding LLMs Requires More Than Statistical GeneralizationSpotlight9 citations
- Position: Video as the New Language for Real-World Decision MakingPoster9 citations
- Projecting Molecules into Synthesizable Chemical SpacesPoster9 citations
- Proteus: Exploring Protein Structure Generation for Enhanced Designability and EfficiencyPoster9 citations
- Purify Unlearnable Examples via Rate-Constrained Variational AutoencodersPoster9 citations
- Purifying Quantization-conditioned Backdoors via Layer-wise Activation Correction with Distribution ApproximationPoster9 citations
- Q-Star Meets Scalable Posterior Sampling: Bridging Theory and Practice via HyperAgentPoster9 citations
- Robust Multi-Task Learning with Excess RisksPoster9 citations
- SIN: Selective and Interpretable Normalization for Long-Term Time Series ForecastingPoster9 citations
- Sample as you Infer: Predictive Coding with Langevin DynamicsPoster9 citations
- SelMatch: Effectively Scaling Up Dataset Distillation via Selection-Based Initialization and Partial Updates by Trajectory MatchingPoster9 citations
- Self-attention Networks Localize When QK-eigenspectrum ConcentratesPoster9 citations
- Sharp Rates in Dependent Learning Theory: Avoiding Sample Size Deflation for the Square LossSpotlight9 citations
- StableSSM: Alleviating the Curse of Memory in State-space Models through Stable ReparameterizationPoster9 citations
- SurfPro: Functional Protein Design Based on Continuous SurfacePoster9 citations
- The Privacy Power of Correlated Noise in Decentralized LearningPoster9 citations
- Towards a Better Theoretical Understanding of Independent Subnetwork TrainingPoster9 citations
- Towards efficient deep spiking neural networks construction with spiking activity based pruningPoster9 citations
- Transforming and Combining Rewards for Aligning Large Language ModelsPoster9 citations
- UPOCR: Towards Unified Pixel-Level OCR InterfacePoster9 citations
- Understanding Forgetting in Continual Learning with Linear RegressionPoster9 citations
- Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential EquationsPoster9 citations
- Unsupervised Zero-Shot Reinforcement Learning via Functional Reward EncodingsSpotlight9 citations
- Unveiling Privacy, Memorization, and Input Curvature LinksPoster9 citations
- VQDNA: Unleashing the Power of Vector Quantization for Multi-Species Genomic Sequence ModelingPoster9 citations
- Variational Schrödinger Diffusion ModelsPoster9 citations
- Vectorized Conditional Neural Fields: A Framework for Solving Time-dependent Parametric Partial Differential EquationsPoster9 citations
- Verification of Machine Unlearning is FragilePoster9 citations
- A General Theory for Softmax Gating Multinomial Logistic Mixture of ExpertsPoster8 citations
- A Resilient and Accessible Distribution-Preserving Watermark for Large Language ModelsPoster8 citations
- Accelerating Transformer Pre-training with 2:4 SparsityPoster8 citations
- An Empirical Study Into What Matters for Calibrating Vision-Language ModelsPoster8 citations
- BBox-Adapter: Lightweight Adapting for Black-Box Large Language ModelsSpotlight8 citations
- CaRiNG: Learning Temporal Causal Representation under Non-Invertible Generation ProcessPoster8 citations
- Candidate Pseudolabel Learning: Enhancing Vision-Language Models by Prompt Tuning with Unlabeled DataOral8 citations
- Causal Action Influence Aware Counterfactual Data AugmentationPoster8 citations
- Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement LearningPoster8 citations
- Convex Relaxations of ReLU Neural Networks Approximate Global Optima in Polynomial TimeSpotlight8 citations
- Diffusive Gibbs SamplingPoster8 citations
- Discovering Bias in Latent Space: An Unsupervised Debiasing ApproachPoster8 citations
- Doubly Robust Causal Effect Estimation under Networked Interference via Targeted LearningOral8 citations
- E$^2$GAN: Efficient Training of Efficient GANs for Image-to-Image TranslationPoster8 citations
- Efficient Contrastive Learning for Fast and Accurate Inference on GraphsPoster8 citations
- Enabling Uncertainty Estimation in Iterative Neural NetworksPoster8 citations
- Eureka-Moments in Transformers: Multi-Step Tasks Reveal Softmax Induced Optimization ProblemsPoster8 citations
- FRAPPÉ: A Group Fairness Framework for Post-Processing EverythingPoster8 citations
- FairProof : Confidential and Certifiable Fairness for Neural NetworksPoster8 citations
- From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous SystemsPoster8 citations
- GRATH: Gradual Self-Truthifying for Large Language ModelsPoster8 citations
- Graph Distillation with Eigenbasis MatchingPoster8 citations
- Graph Geometry-Preserving AutoencodersPoster8 citations
- How Deep Networks Learn Sparse and Hierarchical Data: the Sparse Random Hierarchy ModelSpotlight8 citations
- IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech SeparationPoster8 citations
- Implicit meta-learning may lead language models to trust more reliable sourcesPoster8 citations
- Inherent Trade-Offs between Diversity and Stability in Multi-Task BenchmarksPoster8 citations
- Learning Iterative Reasoning through Energy DiffusionPoster8 citations
- Learning to Predict Mutational Effects of Protein-Protein Interactions by Microenvironment-aware Hierarchical Prompt LearningPoster8 citations
- Mean-field Underdamped Langevin Dynamics and its Spacetime DiscretizationPoster8 citations
- Mitigating Catastrophic Forgetting in Online Continual Learning by Modeling Previous Task Interrelations via Pareto OptimizationPoster8 citations
- Mitigating Label Noise on Graphs via Topological Sample SelectionPoster8 citations
- MoMo: Momentum Models for Adaptive Learning RatesPoster8 citations
- Multi-Track Message Passing: Tackling Oversmoothing and Oversquashing in Graph Learning via Preventing Heterophily MixingSpotlight8 citations
- Neural Collapse in Multi-label Learning with Pick-all-label LossPoster8 citations
- Neural SPH: Improved Neural Modeling of Lagrangian Fluid DynamicsPoster8 citations
- Not Just Pretty Pictures: Toward Interventional Data Augmentation Using Text-to-Image GeneratorsPoster8 citations
- Not all distributional shifts are equal: Fine-grained robust conformal inferencePoster8 citations
- OODRobustBench: a Benchmark and Large-Scale Analysis of Adversarial Robustness under Distribution ShiftPoster8 citations
- On Discrete Prompt Optimization for Diffusion ModelsPoster8 citations
- On Interpolating Experts and Multi-Armed BanditsPoster8 citations
- On the Diminishing Returns of Width for Continual LearningPoster8 citations
- On the Expressive Power of Spectral Invariant Graph Neural NetworksPoster8 citations
- Position: A Call to Action for a Human-Centered AutoML ParadigmPoster8 citations
- Position: Mission Critical – Satellite Data is a Distinct Modality in Machine LearningSpotlight8 citations
- Provable Representation with Efficient Planning for Partially Observable Reinforcement LearningPoster8 citations
- RODEO: Robust Outlier Detection via Exposing Adaptive Out-of-Distribution SamplesPoster8 citations
- ReconBoost: Boosting Can Achieve Modality ReconcilementPoster8 citations
- Recurrent Distance Filtering for Graph Representation LearningPoster8 citations
- Representation Surgery: Theory and Practice of Affine SteeringPoster8 citations
- Revisiting Context Aggregation for Image MattingPoster8 citations
- Robustness of Deep Learning for Accelerated MRI: Benefits of Diverse Training DataPoster8 citations
- SLOG: An Inductive Spectral Graph Neural Network Beyond Polynomial FilterPoster8 citations
- Sample Complexity Bounds for Estimating Probability Divergences under InvariancesPoster8 citations
- Sarah Frank-Wolfe: Methods for Constrained Optimization with Best Rates and Practical FeaturesPoster8 citations
- Scaling Down Deep Learning with MNIST-1DPoster8 citations
- Scaling Tractable Probabilistic Circuits: A Systems PerspectivePoster8 citations
- Simplicity Bias of Two-Layer Networks beyond Linearly Separable DataPoster8 citations
- Skill Set Optimization: Reinforcing Language Model Behavior via Transferable SkillsPoster8 citations
- Sliced Wasserstein with Random-Path Projecting DirectionsPoster8 citations
- Slot Abstractors: Toward Scalable Abstract Visual ReasoningPoster8 citations
- SpikeLM: Towards General Spike-Driven Language Modeling via Elastic Bi-Spiking MechanismsPoster8 citations
- SpikeZIP-TF: Conversion is All You Need for Transformer-based SNNPoster8 citations
- StableMask: Refining Causal Masking in Decoder-only TransformerPoster8 citations
- Statistical Test for Attention Maps in Vision TransformersPoster8 citations
- Stereo Risk: A Continuous Modeling Approach to Stereo MatchingOral8 citations
- Stereographic Spherical Sliced Wasserstein DistancesSpotlight8 citations
- Taylor Videos for Action RecognitionPoster8 citations
- Test-Time Degradation Adaptation for Open-Set Image RestorationSpotlight8 citations
- Theoretical Guarantees for Variational Inference with Fixed-Variance Mixture of GaussiansPoster8 citations
- TinyTrain: Resource-Aware Task-Adaptive Sparse Training of DNNs at the Data-Scarce EdgePoster8 citations
- Towards Theoretical Understandings of Self-Consuming Generative ModelsPoster8 citations
- Towards a Self-contained Data-driven Global Weather Forecasting FrameworkPoster8 citations
- Trustless Audits without Revealing Data or ModelsPoster8 citations
- UP2ME: Univariate Pre-training to Multivariate Fine-tuning as a General-purpose Framework for Multivariate Time Series AnalysisPoster8 citations
- Understanding Finetuning for Factual Knowledge ExtractionPoster8 citations
- Understanding Retrieval-Augmented Task Adaptation for Vision-Language ModelsPoster8 citations
- Understanding the Learning Dynamics of Alignment with Human FeedbackPoster8 citations
- Using Uncertainty Quantification to Characterize and Improve Out-of-Domain Learning for PDEsPoster8 citations
- Variational Linearized Laplace Approximation for Bayesian Deep LearningPoster8 citations
- Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language ModelsPoster8 citations
- Which Frequencies do CNNs Need? Emergent Bottleneck Structure in Feature LearningPoster8 citations
- Why Do Animals Need Shaping? A Theory of Task Composition and Curriculum LearningPoster8 citations
- $f$-Divergence Based Classification: Beyond the Use of Cross-EntropyPoster7 citations
- ACE: Off-Policy Actor-Critic with Causality-Aware Entropy RegularizationOral7 citations
- Accelerated Algorithms for Constrained Nonconvex-Nonconcave Min-Max Optimization and Comonotone InclusionPoster7 citations
- Acquiring Diverse Skills using Curriculum Reinforcement Learning with Mixture of ExpertsPoster7 citations
- Adaptive Horizon Actor-Critic for Policy Learning in Contact-Rich Differentiable SimulationPoster7 citations
- Adaptively Perturbed Mirror Descent for Learning in GamesPoster7 citations
- An Explicit Frame Construction for Normalizing 3D Point CloudsPoster7 citations
- ArtWhisperer: A Dataset for Characterizing Human-AI Interactions in Artistic CreationsPoster7 citations
- Attention Meets Post-hoc Interpretability: A Mathematical PerspectivePoster7 citations
- Batch and match: black-box variational inference with a score-based divergenceSpotlight7 citations
- Be Your Own Neighborhood: Detecting Adversarial Examples by the Neighborhood Relations Built on Self-Supervised LearningPoster7 citations
- Best Arm Identification for Stochastic Rising BanditsSpotlight7 citations
- Beyond the Federation: Topology-aware Federated Learning for Generalization to Unseen ClientsPoster7 citations
- CRoFT: Robust Fine-Tuning with Concurrent Optimization for OOD Generalization and Open-Set OOD DetectionPoster7 citations
- CaM: Cache Merging for Memory-efficient LLMs InferencePoster7 citations
- Conformalized Adaptive Forecasting of Heterogeneous TrajectoriesPoster7 citations
- Constrained Reinforcement Learning Under Model MismatchPoster7 citations
- Controllable Prompt Tuning For Balancing Group Distributional RobustnessPoster7 citations
- DecisionNCE: Embodied Multimodal Representations via Implicit Preference LearningPoster7 citations
- DeepPolar: Inventing Nonlinear Large-Kernel Polar Codes via Deep LearningPoster7 citations
- Delving into Differentially Private TransformerPoster7 citations
- Differentially Private Representation Learning via Image CaptioningPoster7 citations
- Discovering Symmetry Breaking in Physical Systems with Relaxed Group ConvolutionPoster7 citations
- Disentanglement Learning via TopologyPoster7 citations
- Disguised Copyright Infringement of Latent Diffusion ModelsPoster7 citations
- Drug Discovery with Dynamic Goal-aware FragmentsPoster7 citations
- EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal TokensPoster7 citations
- Efficient Algorithms for Empirical Group Distributionally Robust Optimization and BeyondPoster7 citations
- Efficient World Models with Context-Aware TokenizationPoster7 citations
- Emergent Equivariance in Deep EnsemblesOral7 citations
- End-to-End Neuro-Symbolic Reinforcement Learning with Textual ExplanationsSpotlight7 citations
- Exploiting Code Symmetries for Learning Program SemanticsSpotlight7 citations
- Explorations of Self-Repair in Language ModelsPoster7 citations
- Extracting Training Data From Document-Based VQA ModelsPoster7 citations
- Fair Federated Learning via the Proportional Veto CorePoster7 citations
- Fair Off-Policy Learning from Observational DataPoster7 citations
- Faithfulness Measurable Masked Language ModelsSpotlight7 citations
- Faster Sampling via Stochastic Gradient Proximal SamplerPoster7 citations
- Feature Contamination: Neural Networks Learn Uncorrelated Features and Fail to GeneralizePoster7 citations
- FedREDefense: Defending against Model Poisoning Attacks for Federated Learning using Model Update Reconstruction ErrorPoster7 citations
- Federated Optimization with Doubly Regularized Drift CorrectionPoster7 citations
- Generative Active Learning for Long-tailed Instance SegmentationPoster7 citations
- Global Reinforcement Learning : Beyond Linear and Convex Rewards via Submodular Semi-gradient MethodsPoster7 citations
- Graph Out-of-Distribution Detection Goes Neighborhood ShapingPoster7 citations
- Harmonic Self-Conditioned Flow Matching for joint Multi-Ligand Docking and Binding Site DesignPoster7 citations
- Harmony in Diversity: Merging Neural Networks with Canonical Correlation AnalysisPoster7 citations
- HarmonyDream: Task Harmonization Inside World ModelsPoster7 citations
- Harnessing Hierarchical Label Distribution Variations in Test Agnostic Long-tail RecognitionPoster7 citations
- How Spurious Features are Memorized: Precise Analysis for Random and NTK FeaturesPoster7 citations
- Incentivized Learning in Principal-Agent Bandit GamesPoster7 citations
- Integrating Global Context Contrast and Local Sensitivity for Blind Image Quality AssessmentSpotlight7 citations
- InterLUDE: Interactions between Labeled and Unlabeled Data to Enhance Semi-Supervised LearningPoster7 citations
- Iterative Search Attribution for Deep Neural NetworksPoster7 citations
- LASER: Linear Compression in Wireless Distributed OptimizationPoster7 citations
- LCA-on-the-Line: Benchmarking Out of Distribution Generalization with Class TaxonomiesOral7 citations
- Layerwise Proximal Replay: A Proximal Point Method for Online Continual LearningPoster7 citations
- Learning Associative Memories with Gradient DescentPoster7 citations
- Linear Explanations for Individual NeuronsPoster7 citations
- LoCoCo: Dropping In Convolutions for Long Context CompressionPoster7 citations
- Long Range Propagation on Continuous-Time Dynamic GraphsPoster7 citations
- Mechanistic Neural Networks for Scientific Machine LearningPoster7 citations
- Minimum-Norm Interpolation Under Covariate ShiftPoster7 citations
- Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RLPoster7 citations
- Mol-AE: Auto-Encoder Based Molecular Representation Learning With 3D Cloze Test ObjectivePoster7 citations
- Momentum for the Win: Collaborative Federated Reinforcement Learning across Heterogeneous EnvironmentsPoster7 citations
- MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM ServingPoster7 citations
- NeWRF: A Deep Learning Framework for Wireless Radiation Field Reconstruction and Channel PredictionPoster7 citations
- Neural Networks Learn Statistics of Increasing ComplexityPoster7 citations
- No-Regret Reinforcement Learning in Smooth MDPsPoster7 citations
- Non-clairvoyant Scheduling with Partial PredictionsPoster7 citations
- Non-stationary Online Convex Optimization with Arbitrary DelaysPoster7 citations
- On Which Nodes Does GCN Fail? Enhancing GCN From the Node PerspectivePoster7 citations
- On the Nonlinearity of Layer NormalizationPoster7 citations
- Overcoming Data and Model heterogeneities in Decentralized Federated Learning via Synthetic AnchorsPoster7 citations
- PIDformer: Transformer Meets Control TheoryPoster7 citations
- PPFLOW: Target-Aware Peptide Design with Torsional Flow MatchingPoster7 citations
- PolySketchFormer: Fast Transformers via Sketching Polynomial KernelsPoster7 citations
- Position: Benchmarking is Limited in Reinforcement Learning ResearchPoster7 citations
- Position: Categorical Deep Learning is an Algebraic Theory of All ArchitecturesPoster7 citations
- Position: Explain to Question not to JustifyPoster7 citations
- Position: Leverage Foundational Models for Black-Box OptimizationPoster7 citations
- Position: Quo Vadis, Unsupervised Time Series Anomaly Detection?Poster7 citations
- Predictive Dynamic FusionPoster7 citations
- Predictive Linear Online Tracking for Unknown TargetsSpotlight7 citations
- Privacy-Preserving Data Release Leveraging Optimal Transport and Particle Gradient DescentPoster7 citations
- Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case RegretPoster7 citations
- Reducing Item Discrepancy via Differentially Private Robust Embedding Alignment for Privacy-Preserving Cross Domain RecommendationPoster7 citations
- Revealing Vision-Language Integration in the Brain with Multimodal NetworksPoster7 citations
- Robust Yet Efficient Conformal Prediction SetsPoster7 citations
- SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language ModelsPoster7 citations
- Sample-specific Masks for Visual Reprogramming-based PromptingSpotlight7 citations
- Selective Mixup Helps with Distribution Shifts, But Not (Only) because of MixupPoster7 citations
- SelfVC: Voice Conversion With Iterative Refinement using Self TransformationsPoster7 citations
- SimPro: A Simple Probabilistic Framework Towards Realistic Long-Tailed Semi-Supervised LearningPoster7 citations
- Size-invariance Matters: Rethinking Metrics and Losses for Imbalanced Multi-object Salient Object DetectionSpotlight7 citations
- Sliced-Wasserstein Estimation with Spherical Harmonics as Control VariatesPoster7 citations
- Structure Your Data: Towards Semantic Graph CounterfactualsPoster7 citations
- TENG: Time-Evolving Natural Gradient for Solving PDEs With Deep Neural Nets Toward Machine PrecisionPoster7 citations
- Task-aware Orthogonal Sparse Network for Exploring Shared Knowledge in Continual LearningPoster7 citations
- Tell, Don't Show: Language Guidance Eases Transfer Across Domains in Images and VideosPoster7 citations
ICML accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.