AAAI 2025 Accepted Papers
The full list of 3,478 papers accepted at AAAI 2025 (Association for the Advancement of Artificial Intelligence Annual Conference on Artificial Intelligence). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Technical: 3,478
- Language Prompt for Autonomous DrivingTechnical238 citations
- U-KAN Makes Strong Backbone for Medical Image Segmentation and GenerationTechnical155 citations
- FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual PromptsTechnical146 citations
- EfficientVMamba: Atrous Selective Scan for Light Weight Visual MambaTechnical115 citations
- Point Cloud Mamba: Point Cloud Learning via State Space ModelTechnical83 citations
- Segment Any 3D GaussiansTechnical82 citations
- SatCLIP: Global, General-Purpose Location Embeddings with Satellite ImageryTechnical75 citations
- Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient InferenceTechnical72 citations
- LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR UnderstandingTechnical68 citations
- IMAGDressing-v1: Customizable Virtual DressingTechnical67 citations
- DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video GenerationTechnical62 citations
- OOTDiffusion: Outfitting Fusion Based Latent Diffusion for Controllable Virtual Try-OnTechnical62 citations
- Boosting Consistency in Story Visualization with Rich-Contextual Conditional Diffusion ModelsTechnical58 citations
- EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark ConditionsTechnical53 citations
- Follow-Your-Click: Open-domain Regional Image Animation via Motion PromptsTechnical52 citations
- Deep Reinforcement Learning for Robotics: A Survey of Real-World SuccessesTechnical48 citations
- Augmenting Math Word Problems via Iterative Question ComposingTechnical47 citations
- Evaluating Mathematical Reasoning Beyond AccuracyTechnical39 citations
- XCOT: Cross-lingual Instruction Tuning for Cross-lingual Chain-of-Thought ReasoningTechnical39 citations
- Key-Point-Driven Data Synthesis with Its Enhancement on Mathematical ReasoningTechnical37 citations
- ELLA-V: Stable Neural Codec Language Modeling with Alignment-Guided Sequence ReorderingTechnical36 citations
- DiffScene: Diffusion-Based Safety-Critical Scenario Generation for Autonomous VehiclesTechnical34 citations
- AnalogCoder: Analog Circuit Design via Training-Free Code GenerationTechnical29 citations
- Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid InferenceTechnical29 citations
- Visual Prompting Upgrades Neural Network Sparsification: A Data-Model PerspectiveTechnical29 citations
- SafetyPrompts: A Systematic Review of Open Datasets for Evaluating and Improving Large Language Model SafetyTechnical27 citations
- DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous DrivingTechnical25 citations
- MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image SynthesisTechnical25 citations
- CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition AbilitiesTechnical24 citations
- Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI FeedbackTechnical24 citations
- Revisiting Multimodal Emotion Recognition in Conversation from the Perspective of Graph SpectrumTechnical24 citations
- V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction TuningTechnical24 citations
- VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal GroundingTechnical24 citations
- Calibrating Large Language Models with Sample ConsistencyTechnical22 citations
- DiT4Edit: Diffusion Transformer for Image EditingTechnical22 citations
- Image Conductor: Precision Control for Interactive Video SynthesisTechnical22 citations
- WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic ExplorationTechnical21 citations
- LLM4GEN: Leveraging Semantic Representation of LLMs for Text-to-Image GenerationTechnical20 citations
- MENTOR: Multi-level Self-supervised Learning for Multimodal RecommendationTechnical20 citations
- Open Models, Closed Minds? On Agents Capabilities in Mimicking Human Personalities through Open Large Language ModelsTechnical20 citations
- TinySAM: Pushing the Envelope for Efficient Segment Anything ModelTechnical20 citations
- Unlearning Concepts in Diffusion Model via Concept Domain Correction and Concept Preserving GradientTechnical20 citations
- GFlow: Recovering 4D World from Monocular VideoTechnical19 citations
- Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical ReasoningTechnical19 citations
- MultiBooth: Towards Generating All Your Concepts in an Image from TextTechnical19 citations
- Ultra-High Resolution Segmentation via Boundary-Enhanced Patch-Merging TransformerTechnical19 citations
- VerilogCoder: Autonomous Verilog Coding Agents with Graph-based Planning and Abstract Syntax Tree (AST)-based Waveform Tracing ToolTechnical19 citations
- BLADE: Enhancing Black-Box Large Language Models with Small Domain-Specific ModelsTechnical18 citations
- Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction CycleTechnical18 citations
- Language-Models-as-a-Service: Overview of a New Paradigm and its ChallengesTechnical18 citations
- OpenVIS: Open-vocabulary Video Instance SegmentationTechnical18 citations
- ParGo: Bridging Vision-Language with Partial and Global ViewsTechnical18 citations
- Selective Forgetting: Advancing Machine Unlearning Techniques and Evaluation in Language ModelsTechnical18 citations
- Axioms for AI Alignment from Human FeedbackTechnical17 citations
- LazyDiT: Lazy Learning for the Acceleration of Diffusion TransformersTechnical17 citations
- Unleashing the Potential of Large Language Models as Prompt Optimizers: Analogical Analysis with Gradient-based Model OptimizersTechnical17 citations
- CALF: Aligning LLMs for Time Series Forecasting via Cross-modal Fine-TuningTechnical16 citations
- Causal Prompting: Debiasing Large Language Model Prompting Based on Front-Door AdjustmentTechnical16 citations
- HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language ModelsTechnical16 citations
- Improving Complex Reasoning over Knowledge Graph with Logic-Aware Curriculum TuningTechnical16 citations
- Read, Watch and Scream! Sound Generation from Text and VideoTechnical16 citations
- Transformer Layers as PaintersTechnical16 citations
- End-to-End Autonomous Driving Through V2X CooperationTechnical15 citations
- Learning Personalized Decision Support PoliciesTechnical15 citations
- Fair Text-to-Image Diffusion via Fair MappingTechnical14 citations
- PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud LearningTechnical14 citations
- 3DMambaIPF: A State Space Model for Iterative Point Cloud Filtering via Differentiable RenderingTechnical13 citations
- Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language ModelsTechnical13 citations
- Learning to Prompt with Text Only Supervision for Vision-Language ModelsTechnical13 citations
- QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero OverheadTechnical13 citations
- Attentive Eraser: Unleashing Diffusion Model’s Object Removal Potential via Self-Attention Redirection GuidanceTechnical12 citations
- CoCoCo: Improving Text-Guided Video Inpainting for Better Consistency, Controllability and CompatibilityTechnical12 citations
- Increased Compute Efficiency and the Diffusion of AI CapabilitiesTechnical12 citations
- JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music GenerationTechnical12 citations
- MAGIC: Generating Self-Correction Guideline for In-Context Text-to-SQLTechnical12 citations
- MUSE: Mamba Is Efficient Multi-scale Learner for Text-video RetrievalTechnical12 citations
- Toward Falsifying Causal Graphs Using a Permutation-Based TestTechnical12 citations
- TranSplat: Generalizable 3D Gaussian Splatting from Sparse Multi-View Images with TransformersTechnical12 citations
- Prompt Compression with Context-Aware Sentence Encoding for Fast and Improved LLM InferenceTechnical11 citations
- ResMaster: Mastering High-Resolution Image Generation via Structural and Fine-Grained GuidanceTechnical11 citations
- SCALM: Detecting Bad Practices in Smart Contracts Through LLMsTechnical11 citations
- SWIFT: A Scalable Lightweight Infrastructure for Fine-TuningTechnical11 citations
- Scalable Quantum-Inspired Optimization Through Dynamic Qubit CompressionTechnical11 citations
- SubjectDrive: Scaling Generative Data in Autonomous Driving via Subject ControlTechnical11 citations
- Towards Adversarially Robust Dataset Distillation by Curvature RegularizationTechnical11 citations
- TrackGo: A Flexible and Efficient Method for Controllable Video GenerationTechnical11 citations
- B2Opt: Learning to Optimize Black-box Optimization with Little BudgetTechnical10 citations
- BindGPT: A Scalable Framework for 3D Molecular Design via Language Modeling and Reinforcement LearningTechnical10 citations
- C2P-CLIP: Injecting Category Common Prompt in CLIP to Enhance Generalization in Deepfake DetectionTechnical10 citations
- C3oT: Generating Shorter Chain-of-Thought Without Compromising EffectivenessTechnical10 citations
- ChatTime: A Unified Multimodal Time Series Foundation Model Bridging Numerical and Textual DataTechnical10 citations
- Epsilon: Exploring Comprehensive Visual-Semantic Projection for Multi-Label Zero-Shot LearningTechnical10 citations
- Evaluating the Evaluator: Measuring LLMs’ Adherence to Task Evaluation InstructionsTechnical10 citations
- Explore In-Context Segmentation via Latent Diffusion ModelsTechnical10 citations
- FoldToken: Learning Protein Language via Vector Quantization and BeyondTechnical10 citations
- MuMA-ToM: Multi-modal Multi-Agent Theory of MindTechnical10 citations
- Numerical Pruning for Efficient Autoregressive ModelsTechnical10 citations
- ResAdapter: Domain Consistent Resolution Adapter for Diffusion ModelsTechnical10 citations
- VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion ModelsTechnical10 citations
- AutoMMLab: Automatically Generating Deployable Models from Language Instructions for Computer Vision TasksTechnical9 citations
- ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry AreaTechnical9 citations
- Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language ModelsTechnical9 citations
- Envisioning Class Entity Reasoning by Large Language Models for Few-shot LearningTechnical9 citations
- Grounded Multi-Hop VideoQA in Long-Form Egocentric VideosTechnical9 citations
- Spectral Motion Alignment for Video Motion Transfer Using Diffusion ModelsTechnical9 citations
- StyO: Stylize Your Face in Only One-ShotTechnical9 citations
- Towards a Comprehensive, Efficient and Promptable Anatomic Structure Segmentation Model Using 3D Whole-Body CT ScansTechnical9 citations
- Unlocking the Power of LSTM for Long Term Time Series ForecastingTechnical9 citations
- VQA4CIR: Boosting Composed Image Retrieval with Visual Question AnsweringTechnical9 citations
- Yuan: Yielding Unblemished Aesthetics Through a Unified Network for Visual Imperfections Removal in Generated ImagesTechnical9 citations
- Adaptive Guidance: Training-free Acceleration of Conditional Diffusion ModelsTechnical8 citations
- Affordances-Oriented Planning Using Foundation Models for Continuous Vision-Language NavigationTechnical8 citations
- DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual SlimmingTechnical8 citations
- Enhancing Decision-Making for LLM Agents via Step-Level Q-Value ModelsTechnical8 citations
- Evolutionary Large Language Model for Automated Feature TransformationTechnical8 citations
- Exploiting Multimodal Spatial-temporal Patterns for Video Object TrackingTechnical8 citations
- Flash Diffusion: Accelerating Any Conditional Diffusion Model for Few Steps Image GenerationTechnical8 citations
- Graphic Design with Large Multimodal ModelTechnical8 citations
- Harnessing Multimodal Large Language Models for Multimodal Sequential RecommendationTechnical8 citations
- InstructAvatar: Text-Guided Emotion and Motion Control for Avatar GenerationTechnical8 citations
- Is Sarcasm Detection a Step-by-Step Reasoning Process in Large Language Models?Technical8 citations
- KITS: Inductive Spatio-Temporal Kriging with Increment Training StrategyTechnical8 citations
- Learning Logic Specifications for Policy Guidance in POMDPs: an Inductive Logic Programming ApproachTechnical8 citations
- MagicMan: Generative Novel View Synthesis of Humans with 3D-Aware Diffusion and Iterative RefinementTechnical8 citations
- MegActor-Sigma: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion TransformerTechnical8 citations
- MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic CorrectionTechnical8 citations
- One Token Can Help! Learning Scalable and Pluggable Virtual Tokens for Retrieval-Augmented Large Language ModelsTechnical8 citations
- Stable-Hair: Real-World Hair Transfer via Diffusion ModelTechnical8 citations
- Stochastic Online Instrumental Variable Regression: Regrets for Endogeneity and Bandit FeedbackTechnical8 citations
- Structured Packing in LLM Training Improves Long Context UtilizationTechnical8 citations
- Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive TasksTechnical8 citations
- Tuning-Free Accountable Intervention for LLM Deployment – a Metacognitive ApproachTechnical8 citations
- Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models ReasoningTechnical8 citations
- VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion TransformersTechnical8 citations
- A Comprehensive Overhaul of Multimodal Assistant with Small Language ModelsTechnical7 citations
- A Domain-Independent Agent Architecture for Adaptive Operation in Evolving Open WorldsTechnical7 citations
- AGLLDiff: Guiding Diffusion Models Towards Unsupervised Training-free Real-world Low-light Image EnhancementTechnical7 citations
- CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with DiffusionTechnical7 citations
- Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language ModelTechnical7 citations
- DELTA: Pre-Train a Discriminative Encoder for Legal Case Retrieval via Structural Word AlignmentTechnical7 citations
- DiffuseHigh: Training-Free Progressive High-Resolution Image Synthesis Through Structure GuidanceTechnical7 citations
- DrivingForward: Feed-forward 3D Gaussian Splatting for Driving Scene Reconstruction from Flexible Surround-view InputTechnical7 citations
- ExcluIR: Exclusionary Neural Information RetrievalTechnical7 citations
- FastLGS: Speeding Up Language Embedded Gaussians with Feature Grid MappingTechnical7 citations
- Geolocation Representation from Large Language Models Are Generic Enhancers for Spatio-Temporal LearningTechnical7 citations
- Improving Retrieval Augmented Language Model with Self-ReasoningTechnical7 citations
- L4DR: LiDAR-4DRadar Fusion for Weather-Robust 3D Object DetectionTechnical7 citations
- Learning 2D Invariant Affordance Knowledge for 3D Affordance GroundingTechnical7 citations
- MV-VTON: Multi-View Virtual Try-On with Diffusion ModelsTechnical7 citations
- Multi-Objective Evolution of Heuristic Using Large Language ModelTechnical7 citations
- On Effects of Steering Latent Representation for Large Language Model UnlearningTechnical7 citations
- ParZC: Parametric Zero-Cost Proxies for Efficient NASTechnical7 citations
- Perception-Guided Jailbreak Against Text-to-Image ModelsTechnical7 citations
- RHanDS: Refining Malformed Hands for Generated Images with Decoupled Structure and Style GuidanceTechnical7 citations
- Re2LLM: Reflective Reinforcement Large Language Model for Session-based RecommendationTechnical7 citations
- S^3cMath: Spontaneous Step-Level Self-Correction Makes Large Language Models Better Mathematical ReasonersTechnical7 citations
- SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language ModelsTechnical7 citations
- Shield Synthesis for LTL Modulo TheoriesTechnical7 citations
- SpikingSSMs: Learning Long Sequences with Sparse and Parallel Spiking State Space ModelsTechnical7 citations
- Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language ModelsTechnical7 citations
- Advancing Spiking Neural Networks Towards Multiscale Spatiotemporal Interaction LearningTechnical6 citations
- An Item Is Worth a Prompt: Versatile Image Editing with Disentangled ControlTechnical6 citations
- Audio Entailment: Assessing Deductive Reasoning for Audio UnderstandingTechnical6 citations
- Boosting Segment Anything Model Towards Open-Vocabulary LearningTechnical6 citations
- CustomContrast: A Multilevel Contrastive Perspective for Subject-Driven Text-to-Image CustomizationTechnical6 citations
- DABL: Detecting Semantic Anomalies in Business Processes Using Large Language ModelsTechnical6 citations
- DPLUT: Unsupervised Low-light Image Enhancement with Lookup Tables and Diffusion PriorsTechnical6 citations
- EBBS: An Ensemble with Bi-Level Beam Search for Zero-Shot Machine TranslationTechnical6 citations
- Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action RecognitionTechnical6 citations
- HandDiffuse: Generative Controllers for Two-Hand Interactions via Diffusion ModelsTechnical6 citations
- LEARN: Knowledge Adaptation from Large Language Model to Recommendation for Practical Industrial ApplicationTechnical6 citations
- Local Conditional Controlling for Text-to-Image Diffusion ModelsTechnical6 citations
- MSP-MVS: Multi-Granularity Segmentation Prior Guided Multi-View StereoTechnical6 citations
- OV-DQUO: Open-Vocabulary DETR with Denoising Text Query Training and Open-World Unknown Objects SupervisionTechnical6 citations
- Object-level Geometric Structure Preserving for Natural Image StitchingTechnical6 citations
- PNVC: Towards Practical INR-based Video CompressionTechnical6 citations
- Patch-level Sounding Object Tracking for Audio-Visual Question AnsweringTechnical6 citations
- Pedestrian Attribute Recognition: A New Benchmark Dataset and a Large Language Model Augmented FrameworkTechnical6 citations
- Personalized Federated Collaborative Filtering: A Variational AutoEncoder ApproachTechnical6 citations
- PhishAgent: A Robust Multimodal Agent for Phishing Webpage DetectionTechnical6 citations
- Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image GenerationTechnical6 citations
- Robust Performance Incentivizing Algorithms for Multi-Armed Bandits with Strategic AgentsTechnical6 citations
- SlerpFace: Face Template Protection via Spherical Linear InterpolationTechnical6 citations
- TableBench: A Comprehensive and Complex Benchmark for Table Question AnsweringTechnical6 citations
- TextToucher: Fine-Grained Text-to-Touch GenerationTechnical6 citations
- The Bandit Whisperer: Communication Learning for Restless BanditsTechnical6 citations
- Towards Generalizable Multi-Camera 3D Object Detection via Perspective RenderingTechnical6 citations
- VIoTGPT: Learning to Schedule Vision Tools Towards Intelligent Video Internet of ThingsTechnical6 citations
- Verifying Proportionality in Temporal VotingTechnical6 citations
- What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical ReasoningTechnical6 citations
- AI-Driven Virtual Teacher for Enhanced Educational Efficiency: Leveraging Large Pretrain Models for Autonomous Error Analysis and CorrectionTechnical5 citations
- Adaptive Computation Modules: Granular Conditional Computation for Efficient InferenceTechnical5 citations
- Adaptive Multi-Scale Decomposition Framework for Time Series ForecastingTechnical5 citations
- AttackBench: Evaluating Gradient-based Attacks for Adversarial ExamplesTechnical5 citations
- Automating Thought of Search: A Journey Towards Soundness and Completeness (Student Abstract)Technical5 citations
- Bayesian Low-Rank Learning (Bella): A Practical Approach to Bayesian Neural NetworksTechnical5 citations
- CLIP-CID: Efficient CLIP Distillation via Cluster-Instance DiscriminationTechnical5 citations
- CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding EvaluationTechnical5 citations
- Can We Get Rid of Handcrafted Feature Extractors? SparseViT: Nonsemantics-Centered, Parameter-Efficient Image Manipulation Localization Through Spare-Coding TransformerTechnical5 citations
- ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat TemplatesTechnical5 citations
- CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language ModelsTechnical5 citations
- ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language ModelsTechnical5 citations
- ConfigX: Modular Configuration for Evolutionary Algorithms via Multitask Reinforcement LearningTechnical5 citations
- Conformal Thresholded Intervals for Efficient RegressionTechnical5 citations
- Conformalized Interval Arithmetic with Symmetric CalibrationTechnical5 citations
- CrAM: Credibility-Aware Attention Modification in LLMs for Combating Misinformation in RAGTechnical5 citations
- DeMo: Decoupled Feature-Based Mixture of Experts for Multi-Modal Object Re-IdentificationTechnical5 citations
- DisCo: Graph-Based Disentangled Contrastive Learning for Cold-Start Cross-Domain RecommendationTechnical5 citations
- Efficient 3D Recognition with Event-driven Spike Sparse ConvolutionTechnical5 citations
- Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal UnderstandingTechnical5 citations
- Epistemic EFX Allocations Exist for Monotone ValuationsTechnical5 citations
- Exploring Enhanced Contextual Information for Video-Level Object TrackingTechnical5 citations
- Fields of The World: A Machine Learning Benchmark Dataset for Global Agricultural Field Boundary SegmentationTechnical5 citations
- From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in TransformersTechnical5 citations
- GIM: A Million-scale Benchmark for Generative Image Manipulation Detection and LocalizationTechnical5 citations
- HSEvo: Elevating Automatic Heuristic Design with Diversity-Driven Harmony Search and Genetic Algorithm Using LLMsTechnical5 citations
- Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMsTechnical5 citations
- Large Language Model Meets Graph Neural Network in Knowledge DistillationTechnical5 citations
- Learning Deep Dissipative DynamicsTechnical5 citations
- MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object ScenariosTechnical5 citations
- MOS: Model Surgery for Pre-Trained Model-Based Class-Incremental LearningTechnical5 citations
- Mamba YOLO: A Simple Baseline for Object Detection with State Space ModelTechnical5 citations
- MoE-LPR: Multilingual Extension of Large Language Models Through Mixture-of-Experts with Language Priors RoutingTechnical5 citations
- Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language ModelsTechnical5 citations
- NightHaze: Nighttime Image Dehazing via Self-Prior LearningTechnical5 citations
- Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text InformationTechnical5 citations
- STD-PLM: Understanding Both Spatial and Temporal Properties of Spatial-Temporal Data with PLMTechnical5 citations
- SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement LearningTechnical5 citations
- Scaling Combinatorial Optimization Neural Improvement Heuristics with Online Search and AdaptationTechnical5 citations
- SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer NetworksTechnical5 citations
- Sum of Squares CircuitsTechnical5 citations
- Sweeping Heterogeneity with Smart MoPs: Mixture of Prompts for LLM Task AdaptationTechnical5 citations
- The AI Race: Why Current Neural Network-based Architectures are a Poor Basis for Artificial General IntelligenceTechnical5 citations
- TimeCMA: Towards LLM-Empowered Multivariate Time Series Forecasting via Cross-Modality AlignmentTechnical5 citations
- Trusted Unified Feature-Neighborhood Dynamics for Multi-View ClassificationTechnical5 citations
- Unsupervised Audio-Visual Segmentation with Modality AlignmentTechnical5 citations
- UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban ScenariosTechnical5 citations
- Video Diffusion Models Are Strong Video InpainterTechnical5 citations
- Why AI Is WEIRD and Shouldn't Be This Way: Towards AI for Everyone, with Everyone, by EveryoneTechnical5 citations
- A Comprehensive Evaluation on Event Reasoning of Large Language ModelsTechnical4 citations
- ACPBench: Reasoning About Action, Change, and PlanningTechnical4 citations
- AE-NeRF: Augmenting Event-Based Neural Radiance Fields for Non-ideal Conditions and Larger ScenesTechnical4 citations
- AIM: Let Any Multimodal Large Language Models Embrace Efficient In-Context LearningTechnical4 citations
- Adaptive Draft-Verification for Efficient Large Language Model DecodingTechnical4 citations
- AutoSGNN: Automatic Propagation Mechanism Discovery for Spectral Graph Neural NetworksTechnical4 citations
- Braess’s Paradox of Generative AITechnical4 citations
- Can Generative Models Improve Self-Supervised Representation Learning?Technical4 citations
- Can LVLMs Obtain a Driver’s License? A Benchmark Towards Reliable AGI for Autonomous DrivingTechnical4 citations
- Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data?Technical4 citations
- CoRA: Collaborative Information Perception by Large Language Model’s Weights for RecommendationTechnical4 citations
- CoRe: Context-Regularized Text Embedding Learning for Text-to-Image PersonalizationTechnical4 citations
- Cross-Validated Off-Policy EvaluationTechnical4 citations
- CustomTTT: Motion and Appearance Customized Video Generation via Test-Time TrainingTechnical4 citations
- CyberPal.AI: Empowering LLMs with Expert-Driven Cybersecurity InstructionsTechnical4 citations
- DEEPTalk: Dynamic Emotion Embedding for Probabilistic Speech-Driven 3D Face AnimationTechnical4 citations
- DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code GenerationTechnical4 citations
- DVP-MVS: Synergize Depth-Edge and Visibility Prior for Multi-View StereoTechnical4 citations
- Debate on Graph: A Flexible and Reliable Reasoning Framework for Large Language ModelsTechnical4 citations
- Deep Generative Model for Mechanical System Configuration DesignTechnical4 citations
- Design Principle Transfer in Neural Architecture Search via Large Language ModelsTechnical4 citations
- Diff-Shadow: Global-guided Diffusion Model for Shadow RemovalTechnical4 citations
- DiffCalib: Reformulating Monocular Camera Calibration as Diffusion-Based Dense Incident Map GenerationTechnical4 citations
- Differential Private Stochastic Optimization with Heavy-tailed Data: Towards Optimal RatesTechnical4 citations
- Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous DrivingTechnical4 citations
- EWMoE: An Effective Model for Global Weather Forecasting with Mixture-of-ExpertsTechnical4 citations
- EXCGEC: A Benchmark for Edit-Wise Explainable Chinese Grammatical Error CorrectionTechnical4 citations
- Effective Diffusion Transformer Architecture for Image Super-ResolutionTechnical4 citations
- EvoChart: A Benchmark and a Self-Training Approach Towards Real-World Chart UnderstandingTechnical4 citations
- Exploring Activation Patterns of Parameters in Language ModelsTechnical4 citations
- FOCUS: Towards Universal Foreground SegmentationTechnical4 citations
- Falcon: Faster and Parallel Inference of Large Language Models Through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding TreeTechnical4 citations
- FlowPolicy: Enabling Fast and Robust 3D Flow-Based Policy via Consistency Flow Matching for Robot ManipulationTechnical4 citations
- Forget to Flourish: Leveraging Machine-Unlearning on Pretrained Language Models for Privacy LeakageTechnical4 citations
- Generalizing Alignment Paradigm of Text-to-Image Generation with Preferences Through f-Divergence MinimizationTechnical4 citations
- Generative Medical SegmentationTechnical4 citations
- GenesisTex2: Stable, Consistent and High-Quality Text-to-Texture GenerationTechnical4 citations
- HS-FPN: High Frequency and Spatial Perception FPN for Tiny Object DetectionTechnical4 citations
- Hand1000: Generating Realistic Hands from Text with Only 1,000 ImagesTechnical4 citations
- Improving Factuality in Large Language Models via Decoding-Time Hallucinatory and Truthful ComparatorsTechnical4 citations
- In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement LearningTechnical4 citations
- LLM-Powered User Simulator for Recommender SystemTechnical4 citations
- Light-T2M: A Lightweight and Fast Model for Text-to-motion GenerationTechnical4 citations
- LogicAD: Explainable Anomaly Detection via VLM-based Text Feature ExtractionTechnical4 citations
- MAPF-GPT: Imitation Learning for Multi-Agent Pathfinding at ScaleTechnical4 citations
- MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene GenerationTechnical4 citations
- Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer NetworkTechnical4 citations
- On the Relationship Between Monotone and Squared Probabilistic CircuitsTechnical4 citations
- PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head SynthesisTechnical4 citations
- Prototypical Calibrating Ambiguous Samples for Micro-Action RecognitionTechnical4 citations
- Pruning Large Language Models with Semi-Structural Adaptive Sparse TrainingTechnical4 citations
- RLLTE: Long-Term Evolution Project of Reinforcement LearningTechnical4 citations
- Retrieval-Augmented Dynamic Prompt Tuning for Incomplete Multimodal LearningTechnical4 citations
- SNAP: Semantic Stories for Next Activity PredictionTechnical4 citations
- Scalable Surrogate Verification of Image-Based Neural Network Control Systems Using Composition and UnrollingTechnical4 citations
- Security Attacks on LLM-based Code Completion ToolsTechnical4 citations
- Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice ConversionTechnical4 citations
- Semantic Convergence: Harmonizing Recommender Systems via Two-Stage Alignment and Behavioral Semantic TokenizationTechnical4 citations
- Sequence to Sequence Reward Modeling: Improving RLHF by Language FeedbackTechnical4 citations
- TG-LLaVA: Text Guided LLaVA via Learnable Latent EmbeddingsTechnical4 citations
- TRANSFORMER EXPLAINER: Interactive Learning of Text-Generative ModelsTechnical4 citations
- TimeCAP: Learning to Contextualize, Augment, and Predict Time Series Events with Large Language Model AgentsTechnical4 citations
- Towards Scientific Discovery with Generative AI: Progress, Opportunities, and ChallengesTechnical4 citations
- TrustUQA: A Trustful Framework for Unified Structured Data Question AnsweringTechnical4 citations
- USDRL: Unified Skeleton-Based Dense Representation Learning with Multi-Grained Feature DecorrelationTechnical4 citations
- Uncovering LLM-Generated Code: A Zero-Shot Synthetic Code Detector via Code RewritingTechnical4 citations
- Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object SegmentationTechnical4 citations
- What Kind of Visual Tokens Do We Need? Training-Free Visual Token Pruning for Multi-Modal Large Language Models from the Perspective of GraphTechnical4 citations
- (1+1) Genetic Programming with Functionally Complete Instruction Sets Can Evolve Boolean Conjunctions and Disjunctions with Arbitrarily Small ErrorTechnical3 citations
- A No Free Lunch Theorem for Human-AI CollaborationTechnical3 citations
- ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language ModelsTechnical3 citations
- Against All Odds: Overcoming Typology, Script, and Language Confusion in Multilingual Embedding Inversion AttacksTechnical3 citations
- Attack-in-the-Chain: Bootstrapping Large Language Models for Attacks Against Black-Box Neural Ranking ModelsTechnical3 citations
- Augmenting Sequential Recommendation with Balanced Relevance and DiversityTechnical3 citations
- Automatically Generating Numerous Context-Driven SFT Data for LLMs Across Diverse GranularityTechnical3 citations
- Autonomous Goal Detection and Cessation in Reinforcement Learning: A Case Study on Source Term EstimationTechnical3 citations
- Bias Unveiled: Investigating Social Bias in LLM-Generated CodeTechnical3 citations
- Boosting Short Text Classification with Multi-Source Information Exploration and Dual-Level Contrastive LearningTechnical3 citations
- Breaking Barriers in Physical-World Adversarial Examples: Improving Robustness and Transferability via Robust FeatureTechnical3 citations
- Bridging the User-side Knowledge Gap in Knowledge-aware Recommendations with Large Language ModelsTechnical3 citations
- CP-Guard: Malicious Agent Detection and Defense in Collaborative Bird’s Eye View PerceptionTechnical3 citations
- CTD4 – a Deep Continuous Distributional Actor-Critic Agent with a Kalman Fusion of Multiple CriticsTechnical3 citations
- DASK: Distribution Rehearsing via Adaptive Style Kernel Learning for Exemplar-Free Lifelong Person Re-IdentificationTechnical3 citations
- DLF: Disentangled-Language-Focused Multimodal Sentiment AnalysisTechnical3 citations
- Discovering Conceptual Knowledge with Analytic Ontology Templates for Articulated ObjectsTechnical3 citations
- Efficient Multi-Policy Evaluation for Reinforcement LearningTechnical3 citations
- Efficient Rectification of Neuro-Symbolic Reasoning Inconsistencies by Abductive ReflectionTechnical3 citations
- Enhance Vision-Language Alignment with NoiseTechnical3 citations
- Enhancing Portuguese Variety Identification with Cross-Domain ApproachesTechnical3 citations
- Enhancing Trustworthiness of Graph Neural Networks with Rank-Based Conformal TrainingTechnical3 citations
- Exploring Semantic Consistency and Style Diversity for Domain Generalized Semantic SegmentationTechnical3 citations
- FLAME: Learning to Navigate with Multimodal LLM in Urban EnvironmentsTechnical3 citations
- Fair Graph U-Net: A Fair Graph Learning Framework Integrating Group and Individual AwarenessTechnical3 citations
- Federated Graph Condensation with Information Bottleneck PrinciplesTechnical3 citations
- Forward KL Regularized Preference Optimization for Aligning Diffusion PoliciesTechnical3 citations
- G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4oTechnical3 citations
- GLAD: Improving Latent Graph Generative Modeling with Simple QuantizationTechnical3 citations
- GRPose: Learning Graph Relations for Human Image Generation with Pose PriorsTechnical3 citations
- GVMGen: A General Video-to-Music Generation Model with Hierarchical AttentionsTechnical3 citations
- Game4Loc: A UAV Geo-Localization Benchmark from Game DataTechnical3 citations
- GaussianSR: High Fidelity 2D Gaussian Splatting for Arbitrary-Scale Image Super-ResolutionTechnical3 citations
- Generalized Dimension Reduction Using Semi-Relaxed Gromov-Wasserstein DistanceTechnical3 citations
- Generative Planning with 3D-Vision Language Pre-training for End-to-End Autonomous DrivingTechnical3 citations
- GeoBEV: Learning Geometric BEV Representation for Multi-view 3D Object DetectionTechnical3 citations
- GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language ModelsTechnical3 citations
- GraphAvatar: Compact Head Avatars with GNN-Generated 3D GaussiansTechnical3 citations
- Guided Real Image Dehazing Using YCbCr Color SpaceTechnical3 citations
- HC-LLM: Historical-Constrained Large Language Models for Radiology Report GenerationTechnical3 citations
- Harmonizing Visual and Textual Embeddings for Zero-Shot Text-to-Image CustomizationTechnical3 citations
- Hierarchical Classification Auxiliary Network for Time Series ForecastingTechnical3 citations
- Importance Weighting Can Help Large Language Models Self-ImproveTechnical3 citations
- Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal ModelTechnical3 citations
- KnowPO: Knowledge-Aware Preference Optimization for Controllable Knowledge Selection in Retrieval-Augmented Language ModelsTechnical3 citations
- LLM Attributor: Interactive Visual Attribution for LLM GenerationTechnical3 citations
- Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource LanguagesTechnical3 citations
- Learned Image Transmission with Hierarchical Variational AutoencoderTechnical3 citations
- Learning Complex Heterogeneous Multimodal Fake News via Social Latent Network InferenceTechnical3 citations
- Learning Language Structures Through GroundingTechnical3 citations
- Learning to Manipulate Under Limited InformationTechnical3 citations
- Lessons for Editors of AI Incidents from the AI Incident DatabaseTechnical3 citations
- Leveraging Large Language Models for Node Generation in Few-Shot Learning on Text-Attributed GraphsTechnical3 citations
- Locate Anything on Earth: Advancing Open-Vocabulary Object Detection for Remote Sensing CommunityTechnical3 citations
- MTL-LoRA: Low-Rank Adaptation for Multi-Task LearningTechnical3 citations
- MUC: Mixture of Uncalibrated Cameras for Robust 3D Human Body ReconstructionTechnical3 citations
- MaFeRw: Query Rewriting with Multi-Aspect Feedbacks for Retrieval-Augmented Large Language ModelsTechnical3 citations
- MambaPro: Multi-Modal Object Re-identification with Mamba Aggregation and Synergistic PromptTechnical3 citations
- Massively Parallel Continuous Local Search for Hybrid SAT Solving on GPUsTechnical3 citations
- Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis PredictionTechnical3 citations
- Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-SpeechTechnical3 citations
- Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video ParsingTechnical3 citations
- NEST: A Neuromodulated Small-world Hypergraph Trajectory Prediction Model for Autonomous DrivingTechnical3 citations
- On the Distortion of Committee Election with 1-Euclidean Preferences and Few Distance QueriesTechnical3 citations
- Online Guidance Graph Optimization for Lifelong Multi-Agent Path FindingTechnical3 citations
- Online and Streaming Algorithms for Constrained k-Submodular MaximizationTechnical3 citations
- Optimize Incompatible Parameters Through Compatibility-aware Knowledge IntegrationTechnical3 citations
- Optimizing Vital Sign Monitoring in Resource-Constrained Maternal Care: An RL-Based Restless Bandit ApproachTechnical3 citations
- PRAGA: Prototype-aware Graph Adaptive Aggregation for Spatial Multi-modal Omics AnalysisTechnical3 citations
- Pinwheel-shaped Convolution and Scale-based Dynamic Loss for Infrared Small Target DetectionTechnical3 citations
- Pose Magic: Efficient and Temporally Consistent Human Pose Estimation with a Hybrid Mamba-GCN NetworkTechnical3 citations
- PoseMamba: Monocular 3D Human Pose Estimation with Bidirectional Global-Local Spatio-Temporal State Space ModelTechnical3 citations
- Promptable Anomaly Segmentation with SAM Through Self-Perception TuningTechnical3 citations
- RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted BehaviorsTechnical3 citations
- RTP-LX: Can LLMs Evaluate Toxicity in Multilingual Scenarios?Technical3 citations
- Real-Time Recurrent Reinforcement LearningTechnical3 citations
- RealisHuman: A Two-Stage Approach for Refining Malformed Human Parts in Generated ImagesTechnical3 citations
- Relation-Aware Equivariant Graph Networks for Epitope-Unknown Antibody Design and Specificity OptimizationTechnical3 citations
- Robust Tracking via Mamba-based Context-aware Token LearningTechnical3 citations
- SCKD: Semi-Supervised Cross-Modality Knowledge Distillation for 4D Radar Object DetectionTechnical3 citations
- SWEA: Updating Factual Knowledge in Large Language Models via Subject Word Embedding AlteringTechnical3 citations
- Safe Planner: Empowering Safety Awareness in Large Pre-Trained Models for Robot Task PlanningTechnical3 citations
- Sequential Conditional Transport on Probabilistic Graphs for Interpretable Counterfactual FairnessTechnical3 citations
- Sign-IDD: Iconicity Disentangled Diffusion for Sign Language ProductionTechnical3 citations
- Single Character Perturbations Break LLM AlignmentTechnical3 citations
- Single Image Rolling Shutter Removal with Diffusion ModelsTechnical3 citations
- StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow MatchingTechnical3 citations
- Structural Entropy Guided Probabilistic CodingTechnical3 citations
- To Err Is AI: A Case Study Informing LLM Flaw Reporting PracticesTechnical3 citations
- Towards Unifying Evaluation of Counterfactual Explanations: Leveraging Large Language Models for Human-Centric AssessmentsTechnical3 citations
- Training-Free and Hardware-Friendly Acceleration for Diffusion Models via Similarity-based Token PruningTechnical3 citations
- UniDet3D: Multi-dataset Indoor 3D Object DetectionTechnical3 citations
- UniMuMo: Unified Text, Music, and Motion GenerationTechnical3 citations
- Universality of Real Minimal Complexity ReservoirTechnical3 citations
- Using Explainable AI and Hierarchical Planning for Outreach with RobotsTechnical3 citations
- VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality AssessmentTechnical3 citations
- ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy PredictionTechnical3 citations
- Video Repurposing from User Generated Content: A Large-scale Dataset and BenchmarkTechnical3 citations
- WEPO: Web Element Preference Optimization for LLM-based Web NavigationTechnical3 citations
- A Many-Objective Problem Where Crossover Is Provably IndispensableTechnical2 citations
- A Simple Graph Contrastive Learning Framework for Short Text ClassificationTechnical2 citations
- AGFSync: Leveraging AI-Generated Feedback for Preference Optimization in Text-to-Image GenerationTechnical2 citations
- AGMixup: Adaptive Graph Mixup for Semi-supervised Node ClassificationTechnical2 citations
- AIF-SFDA: Autonomous Information Filter Driven Source-Free Domain Adaptation for Medical Image SegmentationTechnical2 citations
- Accurate and Regret-Aware Numerical Problem Solver for Tabular Question AnsweringTechnical2 citations
- Agent4Edu: Generating Learner Response Data by Generative Agents for Intelligent Education SystemsTechnical2 citations
- Arbitrary Reading Order Scene Text Spotter with Local Semantics GuidanceTechnical2 citations
- Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language ModelsTechnical2 citations
- Asynchronous Federated Clustering with Unknown Number of ClustersTechnical2 citations
- Autonomous LLM-Enhanced Adversarial Attack for Text-to-MotionTechnical2 citations
- BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous DrivingTechnical2 citations
- Backdoor Attacks Against No-Reference Image Quality Assessment Models via a Scalable TriggerTechnical2 citations
- Bi-level Contrastive Learning for Knowledge-Enhanced Molecule RepresentationsTechnical2 citations
- Bootstraping Clustering of Gaussians for View-consistent 3D Scene UnderstandingTechnical2 citations
- Bridge Then Begin Anew: Generating Target-Relevant Intermediate Model for Source-Free Visual Emotion AdaptationTechnical2 citations
- Bridging the Gap for Test-Time Multimodal Sentiment AnalysisTechnical2 citations
- Bridging the Gap: Enhancing LLM Performance for Low-Resource African Languages with New Benchmarks, Fine-Tuning, and Cultural AdjustmentsTechnical2 citations
- CA-Edit: Causality-Aware Condition Adapter for High-Fidelity Local Facial Attribute EditingTechnical2 citations
- CL-Attack: Textual Backdoor Attacks via Cross-Lingual TriggersTechnical2 citations
- COSEE: Consistency-Oriented Signal-Based Early Exiting via Calibrated Sample Weighting MechanismTechnical2 citations
- Can Go AIs Be Adversarially Robust?Technical2 citations
- Can LLMs Obfuscate Code? A Systematic Analysis of Large Language Models into Assembly Code ObfuscationTechnical2 citations
- Chain-of-Instructions: Compositional Instruction Tuning on Large Language ModelsTechnical2 citations
- Channel Merging: Preserving Specialization for Merged ExpertsTechnical2 citations
- Characterising Simulation-Based Program EquilibriaTechnical2 citations
- CoPRA: Bridging Cross-domain Pretrained Sequence Models with Complex Structures for Protein-RNA Binding Affinity PredictionTechnical2 citations
- CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based VerificationTechnical2 citations
- Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image SynthesisTechnical2 citations
- Context-aware Inductive Knowledge Graph Completion with Latent Type Constraints and Subgraph ReasoningTechnical2 citations
- Cradle-VAE: Enhancing Single-Cell Gene Perturbation Modeling with Counterfactual Reasoning-based Artifact DisentanglementTechnical2 citations
- Cross-Lingual Text-Rich Visual Comprehension: An Information Theory PerspectiveTechnical2 citations
- Cross-Silo Feature Space Alignment for Federated Learning on Clients with Imbalanced DataTechnical2 citations
- Cross-View Referring Multi-Object TrackingTechnical2 citations
- DMF-Net: Image-Guided Point Cloud Completion with Dual-Channel Modality Fusion and Shape-Aware Upsampling TransformerTechnical2 citations
- Debiased All-in-one Image Restoration with Task Uncertainty RegularizationTechnical2 citations
- Decentralized and Uncoordinated Learning of Stable Matchings: A Game-Theoretic ApproachTechnical2 citations
- Decoupling Appearance Variations with 3D Consistent Features in Gaussian SplattingTechnical2 citations
- DeepSN: A Sheaf Neural Framework for Influence MaximizationTechnical2 citations
- Dense Audio-Visual Event Localization Under Cross-Modal Consistency and Multi-Temporal Granularity CollaborationTechnical2 citations
- Depth-Centric Dehazing and Depth-Estimation from Real-World Hazy Driving VideoTechnical2 citations
- Diversifying Query: Region-Guided Transformer for Temporal Sentence GroundingTechnical2 citations
- DreamFit: Garment-Centric Human Generation via a Lightweight Anything-Dressing EncoderTechnical2 citations
- DuMo: Dual Encoder Modulation Network for Precise Concept ErasureTechnical2 citations
- DutyTTE: Deciphering Uncertainty in Origin-Destination Travel Time EstimationTechnical2 citations
- EMHI: A Multimodal Egocentric Human Motion Dataset with HMD and Body-Worn IMUsTechnical2 citations
- ENCODER: Entity Mining and Modification Relation Binding for Composed Image RetrievalTechnical2 citations
- EOV-Seg: Efficient Open-Vocabulary Panoptic SegmentationTechnical2 citations
- Efficient Attention-Sharing Information Distillation Transformer for Lightweight Single Image Super-ResolutionTechnical2 citations
- Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented SamplesTechnical2 citations
- Enhancing Multimodal Large Language Models Complex Reason via Similarity ComputationTechnical2 citations
- Even-if Explanations: Formal Foundations, Priorities and ComplexityTechnical2 citations
- Every Bit Helps: Achieving the Optimal Distortion with a Few QueriesTechnical2 citations
- Expensive Multi-Objective Bayesian Optimization Based on Diffusion ModelsTechnical2 citations
- Exploring Unbiased Deepfake Detection via Token-Level Shuffling and MixingTechnical2 citations
- FD2-Net: Frequency-Driven Feature Decomposition Network for Infrared-Visible Object DetectionTechnical2 citations
- FIDLAR: Forecast-Informed Deep Learning Architecture for Flood MitigationTechnical2 citations
- Fairness-Accuracy Trade-Offs: A Causal PerspectiveTechnical2 citations
- Fast and Interpretable Mixed-Integer Linear Program Solving by Learning Model ReductionTechnical2 citations
- FatesGS: Fast and Accurate Sparse-View Surface Reconstruction Using Gaussian Splatting with Depth-Feature ConsistencyTechnical2 citations
- Feature Clipping for Uncertainty CalibrationTechnical2 citations
- FedPIA – Permuting and Integrating Adapters Leveraging Wasserstein Barycenters for Finetuning Foundation Models in Multi-Modal Federated LearningTechnical2 citations
- FedSPU: Personalized Federated Learning for Resource-Constrained Devices with Stochastic Parameter UpdateTechnical2 citations
- Federated AssembliesTechnical2 citations
- Federated Unsupervised Domain Generalization Using Global and Local Alignment of GradientsTechnical2 citations
- Federated t-SNE and UMAP for Distributed Data VisualizationTechnical2 citations
- Filling Memory Gaps: Enhancing Continual Semantic Parsing via SQL Syntax Variance-Guided LLMs Without Real Data ReplayTechnical2 citations
- FlowMamba: Learning Point Cloud Scene Flow with Global Motion PropagationTechnical2 citations
- Foreground-Covering Prototype Generation and Matching for SAM-Aided Few-Shot SegmentationTechnical2 citations
- From Logistic Regression to the Perceptron Algorithm: Exploring Gradient Descent with Large Step SizesTechnical2 citations
- From Words to Worth: Newborn Article Impact Prediction with LLMTechnical2 citations
- Fusing Pruned and Backdoored Models: Optimal Transport-based Data-free Backdoor MitigationTechnical2 citations
- Generalization of Graph Neural Networks Is Robust to Model MismatchTechnical2 citations
- H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous DrivingTechnical2 citations
- HDT: Hierarchical Discrete Transformer for Multivariate Time Series ForecastingTechnical2 citations
- HeGTa: Leveraging Heterogeneous Graph-enhanced Large Language Models for Few-shot Complex Table UnderstandingTechnical2 citations
- HeMeNet: Heterogeneous Multichannel Equivariant Network for Protein Multi-task LearningTechnical2 citations
- Hypergraph Attacks via Injecting Homogeneous Nodes into Elite HyperedgesTechnical2 citations
- Identifying Macro Conditional Independencies and Macro Total Effects in Summary Causal Graphs with Latent ConfoundingTechnical2 citations
- Improved Maximin Share Approximations for Chores by Bin PackingTechnical2 citations
- Infer Human’s Intentions Before Following Natural Language InstructionsTechnical2 citations
- Internal Activation Revision: Safeguarding Vision Language Models Without Parameter UpdateTechnical2 citations
- Inverse Reinforcement Learning by Estimating Expertise of DemonstratorsTechnical2 citations
- IsUMap: Manifold Learning and Data Visualization Leveraging Vietoris-Rips FiltrationsTechnical2 citations
- JEN-1 DreamStyler: Customized Musical Concept Learning via Pivotal Parameters TuningTechnical2 citations
- KPL: Training-Free Medical Knowledge Mining of Vision-Language ModelsTechnical2 citations
- LDP: Generalizing to Multilingual Visual Information Extraction by Language Decoupled PretrainingTechnical2 citations
- LNS2+RL: Combining Multi-agent Reinforcement Learning with Large Neighborhood Search in Multi-agent Path FindingTechnical2 citations
- Label-Free Backdoor Attacks in Vertical Federated LearningTechnical2 citations
- Language Model Can Listen While SpeakingTechnical2 citations
- Language Model Meets Prototypes: Towards Interpretable Text Classification Models through Prototypical NetworksTechnical2 citations
- Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement LearningTechnical2 citations
- Learn2Aggregate: Supervised Generation of Chvatal-Gomory Cuts Using Graph Neural NetworksTechnical2 citations
- Learning About Algorithm Auditing in Five Steps: Scaffolding How High School Youth Can Systematically and Critically Evaluate Machine Learning ApplicationsTechnical2 citations
- Learning Production Functions for Supply Chains with Graph Neural NetworksTechnical2 citations
- Less Is More: Adaptive Program Repair with Bug Localization and Preference LearningTechnical2 citations
- Leveraging Large Vision-Language Model as User Intent-Aware Encoder for Composed Image RetrievalTechnical2 citations
- Limitations in Employing Natural Language Supervision for Sensor-Based Human Activity Recognition - And Ways to Overcome ThemTechnical2 citations
- LoRID: Low-Rank Iterative Diffusion for Adversarial PurificationTechnical2 citations
- Look Inside for More: Internal Spatial Modality Perception for 3D Anomaly DetectionTechnical2 citations
- MAPLE: A Framework for Active Preference Learning Guided by Large Language ModelsTechnical2 citations
- MIA-Tuner: Adapting Large Language Models as Pre-training Text DetectorTechnical2 citations
- MLAAN: Scaling Supervised Local Learning with Multilaminar Leap Augmented Auxiliary NetworkTechnical2 citations
- Measuring Human and AI Values Based on Generative Psychometrics with Large Language ModelsTechnical2 citations
- Mesoscopic Insights: Orchestrating Multi-Scale & Hybrid Architecture for Image Manipulation LocalizationTechnical2 citations
- MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head GenerationTechnical2 citations
- Modality-Independent Graph Neural Networks with Global Transformers for Multimodal RecommendationTechnical2 citations
- More Text, Less Point: Towards 3D Data-Efficient Point-Language UnderstandingTechnical2 citations
- Motif Guided Graph Transformers with Combinatorial Skeleton Prototype Learning for Skeleton-Based Person Re-IdentificationTechnical2 citations
- Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph GenerationTechnical2 citations
- MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal ControlsTechnical2 citations
- Multi Agent Reinforcement Learning for Sequential Satellite Assignment ProblemsTechnical2 citations
- Multi-Reference Preference Optimization for Large Language ModelsTechnical2 citations
- NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-TuningTechnical2 citations
- NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional GeneralizationTechnical2 citations
- Nearly Tight Bounds for Exploration in Streaming Multi-Armed Bandits with Known Optimality GapTechnical2 citations
- Neighbor Does Matter: Density-Aware Contrastive Learning for Medical Semi-supervised SegmentationTechnical2 citations
- Neural Continuous-Time Supermartingale CertificatesTechnical2 citations
- Neural-Symbolic Collaborative Distillation: Advancing Small Language Models for Complex Reasoning TasksTechnical2 citations
- Noisy Node Classification by Bi-level Optimization Based Multi-Teacher DistillationTechnical2 citations
- NumbOD: A Spatial-Frequency Fusion Attack Against Object DetectorsTechnical2 citations
- OmniCount: Multi-label Object Counting with Semantic-Geometric PriorsTechnical2 citations
- On the Convergence of Tâtonnement for Linear Fisher MarketsTechnical2 citations
- On the Power of Convolution-Augmented TransformerTechnical2 citations
- One Node One Model: Featuring the Missing-Half for Graph ClusteringTechnical2 citations
- Out of Length Text Recognition with Sub-String MatchingTechnical2 citations
- PSMGD: Periodic Stochastic Multi-Gradient Descent for Fast Multi-Objective OptimizationTechnical2 citations
- PersonaMagic: Stage-Regulated High-Fidelity Face Customization with Tandem EquilibriumTechnical2 citations
- Personalized Federated Learning for Spatio-Temporal Forecasting: A Dual Semantic Alignment-Based Contrastive ApproachTechnical2 citations
- Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and LanguageTechnical2 citations
- Physics-Guided Foundation Model for Scientific Discovery: An Application to Aquatic ScienceTechnical2 citations
- Planning in the Dark: LLM-Symbolic Planning Pipeline Without ExpertsTechnical2 citations
- Precision-Enhanced Human-Object Contact Detection via Depth-Aware Perspective Interaction and Object Texture RestorationTechnical2 citations
- Private Blotto: Viewpoint Competition with Polarized AgentsTechnical2 citations
- ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction DataTechnical2 citations
- Proportional Representation in Practice: Quantifying Proportionality in Ordinal ElectionsTechnical2 citations
- ProtCLIP: Function-Informed Protein Multi-Modal LearningTechnical2 citations
- Qsco: A Quantum Scoring Module for Open-Set Supervised Anomaly DetectionTechnical2 citations
- Quantified Linear and Polynomial Arithmetic Satisfiability via Template-based SkolemizationTechnical2 citations
- Queryable Prototype Multiple Instance Learning with Vision-Language Models for Incremental Whole Slide Image ClassificationTechnical2 citations
- RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion MambaTechnical2 citations
- RLPF: Reinforcement Learning from Prediction Feedback for User Summarization with LLMsTechnical2 citations
- RaCMC: Residual-Aware Compensation Network with Multi-Granularity Constraints for Fake News DetectionTechnical2 citations
- Radiology Report Generation via Multi-objective Preference OptimizationTechnical2 citations
- Re-Attentional Controllable Video Diffusion EditingTechnical2 citations
- Realistic Noise Synthesis with Diffusion ModelsTechnical2 citations
- Reasoning About Actual Causes in Nondeterministic DomainsTechnical2 citations
- Relational Neurosymbolic Markov ModelsTechnical2 citations
- Retention Score: Quantifying Jailbreak Risks for Vision Language ModelsTechnical2 citations
- Rethinking Open-Vocabulary Segmentation of Radiance Fields in 3D SpaceTechnical2 citations
- Revisiting Attention for Multivariate Time Series ForecastingTechnical2 citations
- Revisiting Multimodal Fusion for 3D Anomaly Detection from an Architectural PerspectiveTechnical2 citations
- Runtime Analysis for Multi-Objective Evolutionary Algorithms in Unbounded Integer SpacesTechnical2 citations
- SAFIRE: Segment Any Forged Image RegionTechnical2 citations
- SCott: Accelerating Diffusion Models with Stochastic Consistency DistillationTechnical2 citations
- SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated ResponsesTechnical2 citations
- SGTC: Semantic-Guided Triplet Co-training for Sparsely Annotated Semi-Supervised Medical Image SegmentationTechnical2 citations
- SQLFixAgent: Towards Semantic-Accurate Text-to-SQL Parsing via Consistency-Enhanced Multi-Agent CollaborationTechnical2 citations
- ST3: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token TrimmingTechnical2 citations
- SUTrack: Towards Simple and Unified Single Object TrackingTechnical2 citations
- ScriptSmith: A Unified LLM Framework for Enhancing IT Operations via Automated Bash Script Generation, Assessment, and RefinementTechnical2 citations
- SeFAR: Semi-supervised Fine-grained Action Recognition with Temporal Perturbation and Learning StabilizationTechnical2 citations
- SegFace: Face Segmentation of Long-Tail ClassesTechnical2 citations
- Self-Evolutionary Large Language Models Through Uncertainty-Enhanced Preference OptimizationTechnical2 citations
- Sequential Decision Making in Stochastic Games with Incomplete Preferences over Temporal ObjectivesTechnical2 citations
- Simulate and Eliminate: Revoke Backdoors for Generative Large Language ModelsTechnical2 citations
- Single Exposure Quantitative Phase Imaging with a Conventional Microscope Using Diffusion ModelsTechnical2 citations
- Sparis: Neural Implicit Surface Reconstruction of Indoor Scenes from Sparse ViewsTechnical2 citations
- Spike2Former: Efficient Spiking Transformer for High-performance Image SegmentationTechnical2 citations
- SpotActor: Training-Free Layout-Controlled Consistent Image GenerationTechnical2 citations
- Stable Mean Teacher for Semi-supervised Video Action DetectionTechnical2 citations
- Standing on the Shoulders of Giants: Reprogramming Visual-Language Model for General Deepfake DetectionTechnical2 citations
- StarVector: Generating Scalable Vector Graphics Code from Images and TextTechnical2 citations
- StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character CustomizationTechnical2 citations
- StressPrompt: Does Stress Impact Large Language Models and Human Performance Similarly?Technical2 citations
- Surgical Workflow Recognition and Blocking Effectiveness Detection in Laparoscopic Liver Resection with Pringle ManeuverTechnical2 citations
- TCPFormer: Learning Temporal Correlation with Implicit Pose Proxy for 3D Human Pose EstimationTechnical2 citations
- Text2midi: Generating Symbolic Music from CaptionsTechnical2 citations
- Thin-Plate Spline-based Interpolation for Animation Line InbetweeningTechnical2 citations
- Time Series Supplier Allocation via Deep Black-Litterman ModelTechnical2 citations
- TimeDP: Learning to Generate Multi-Domain Time Series with Domain PromptsTechnical2 citations
- Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language ModelsTechnical2 citations
- Towards Effective, Efficient and Unsupervised Social Event Detection in the Hyperbolic SpaceTechnical2 citations
- Towards Open-Vocabulary Remote Sensing Image Semantic SegmentationTechnical2 citations
- Towards Trustworthy Knowledge Graph Reasoning: An Uncertainty Aware PerspectiveTechnical2 citations
- Towards a Theory of AI PersonhoodTechnical2 citations
- Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal CluesTechnical2 citations
- Training on the Benchmark Is Not All You NeedTechnical2 citations
- Tri-Ergon: Fine-Grained Video-to-Audio Generation with Multi-Modal Conditions and LUFS ControlTechnical2 citations
- Unlocking the Potential of Reverse Distillation for Anomaly DetectionTechnical2 citations
- Usage Governance Advisor: From Intent to AI GovernanceTechnical2 citations
- Using Case Studies to Teach Responsible AI to Industry PractitionersTechnical2 citations
- Utilize the Flow Before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction TuningTechnical2 citations
- VHM: Versatile and Honest Vision Language Model for Remote Sensing Image AnalysisTechnical2 citations
- ViG: Linear-complexity Visual Sequence Learning with Gated Linear AttentionTechnical2 citations
- When Witnesses Defend: A Witness Graph Topological Layer for Adversarial Graph LearningTechnical2 citations
- Whole Genome Transformer for Gene Interaction Effects in Microbiome Habitat SpecificityTechnical2 citations
- WiFi CSI Based Temporal Activity Detection via Dual Pyramid NetworkTechnical2 citations
- World Knowledge-Enhanced Reasoning Using Instruction-Guided Interactor in Autonomous DrivingTechnical2 citations
- WorldAPIs: The World Is Worth How Many APIs? A Thought ExperimentTechnical2 citations
- Zero-Shot Scene Change DetectionTechnical2 citations
- Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language ModelsTechnical2 citations
- 3D Denoisers Are Good 2D Teachers: Molecular Pretraining via Denoising and Cross-Modal DistillationTechnical1 citations
- 3D-RPE: Enhancing Long-Context Modeling Through 3D Rotary Position EncodingTechnical1 citations
- A Deployed Online Reinforcement Learning Algorithm in an Oral Health Clinical TrialTechnical1 citations
- A Method for Enhancing Generalization of Adam by Multiple IntegrationsTechnical1 citations
- A Multiagent Path Search Algorithm for Large-Scale Coalition Structure GenerationTechnical1 citations
- A Pioneering Neural Network Method for Efficient and Robust Fuel Sloshing Simulation in AircraftTechnical1 citations
- A Scalable and Effective Alternative to Graph TransformersTechnical1 citations
- A Versatile Low-Cost Kit for Teaching Novice Learners AI Using Robotics Components and a No-Code Development PlaygroundTechnical1 citations
- A Vision for Reinventing Credible Elections with Artificial IntelligenceTechnical1 citations
- A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal AdapterTechnical1 citations
- A-VL: Adaptive Attention for Large Vision-Language ModelsTechnical1 citations
- AI Chef Trainer: Introducing Students to the Importance of Data in Machine LearningTechnical1 citations
- ASER: Activation Smoothing and Error Reconstruction for Large Language Model QuantizationTechnical1 citations
- AWRaCLe: All-Weather Image Restoration Using Visual In-Context LearningTechnical1 citations
- Accelerated Methods with Compressed Communications for Distributed Optimization Problems Under Data SimilarityTechnical1 citations
- Accessible, At-Home Detection of Parkinson’s Disease via Multi-Task Video AnalysisTechnical1 citations
- Accurate Link Prediction for Edge-Incomplete Graphs via PU LearningTechnical1 citations
- Achieving Maximin Share and EFX/EF1 Guarantees SimultaneouslyTechnical1 citations
- Action-Agnostic Point-Level Supervision for Temporal Action DetectionTechnical1 citations
- Active Large Language Model-Based Knowledge Distillation for Session-Based RecommendationTechnical1 citations
- Adapting to Non-Stationary Environments: Multi-Armed Bandit Enhanced Retrieval-Augmented Generation on Knowledge GraphsTechnical1 citations
- Adaptive Calibration: A Unified Conversion Framework of Spiking Neural NetworksTechnical1 citations
- Adaptive Prompting for Continual Relation Extraction: A Within-Task Variance PerspectiveTechnical1 citations
- Adaptive Prototype Replay for Class Incremental Semantic SegmentationTechnical1 citations
- Advancing Feature Extraction in Healthcare through the Integration of Knowledge Graphs and Large Language ModelsTechnical1 citations
- AgentMixer: Multi-Agent Correlated Policy FactorizationTechnical1 citations
- AirRadar: Inferring Nationwide Air Quality in China with Deep Neural NetworksTechnical1 citations
- Aligning Language Models Using Follow-up Likelihood as Reward SignalTechnical1 citations
- Aligning Large Language Models for Faithful Integrity Against Opposing ArgumentTechnical1 citations
- All-in-One: Transferring Vision Foundation Models into Stereo MatchingTechnical1 citations
- Alleviate and Mining: Rethinking Unsupervised Domain Adaptation for Mitochondria Segmentation from Pseudo-Label PerspectiveTechnical1 citations
- AlphaForge: A Framework to Mine and Dynamically Combine Formulaic Alpha FactorsTechnical1 citations
- An Application-Agnostic Automatic Target Recognition System Using Vision Language ModelsTechnical1 citations
- An Evaluation Framework for Product Images Background Inpainting Based on Human Feedback and Product ConsistencyTechnical1 citations
- Anytime Multi-Agent Path Finding with an Adaptive Delay-Based HeuristicTechnical1 citations
- Approximating Metric Magnitude of Point SetsTechnical1 citations
- Architecture-Aware Learning Curve Extrapolation via Graph Ordinary Differential EquationTechnical1 citations
- Attention Bootstrapping for Multi-Modal Test-Time AdaptationTechnical1 citations
- Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEditTechnical1 citations
- AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based ReferringTechnical1 citations
- Autoregressive Sequence Modeling for 3D Medical Image RepresentationTechnical1 citations
- A²RNet: Adversarial Attack Resilient Network for Robust Infrared and Visible Image FusionTechnical1 citations
- BLS-GAN: A Deep Layer Separation Framework for Eliminating Bone Overlap in Conventional RadiographsTechnical1 citations
- Balanced and Fair Partitioning of FriendsTechnical1 citations
- Batch Ensemble for Variance Dependent Regret in Stochastic BanditsTechnical1 citations
- Benchmarking and Understanding Compositional Relational Reasoning of LLMsTechnical1 citations
- Beyond Human Data: Aligning Multimodal Large Language Models by Iterative Self-EvolutionTechnical1 citations
- Bi-Directional Multi-Scale Graph Dataset Condensation via Information BottleneckTechnical1 citations
- BiDeV: Bilateral Defusing Verification for Complex Claim Fact-CheckingTechnical1 citations
- Boosting Image De-Raining via Central-Surrounding Synergistic ConvolutionTechnical1 citations
- Bootstrapping Heterogeneous Graph Representation Learning via Large Language Models: A Generalized ApproachTechnical1 citations
- BrainGuard: Privacy-Preserving Multisubject Image Reconstructions from Brain ActivitiesTechnical1 citations
- Breaking Data Silos in Parkinson’s Disease Diagnosis: An Adaptive Federated Learning Approach for Privacy-Preserving Facial Expression AnalysisTechnical1 citations
- Bridge 2D-3D: Uncertainty-aware Hierarchical Registration Network with Domain AlignmentTechnical1 citations
- Bridging Training and Execution via Dynamic Directed Graph-Based Communication in Cooperative Multi-Agent SystemsTechnical1 citations
- C2PD: Continuity-Constrained Pixelwise Deformation for Guided Depth Super-ResolutionTechnical1 citations
- CAD-GPT: Synthesising CAD Construction Sequence with Spatial Reasoning-Enhanced Multimodal LLMsTechnical1 citations
- CALLIC: Content Adaptive Learning for Lossless Image CompressionTechnical1 citations
- CAMSIC: Content-aware Masked Image Modeling Transformer for Stereo Image CompressionTechnical1 citations
- CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language ModelsTechnical1 citations
- CNC: Cross-modal Normality Constraint for Unsupervised Multi-class Anomaly DetectionTechnical1 citations
- COLUMBUS: Evaluating COgnitive Lateral Understanding Through Multiple-Choice reBUSesTechnical1 citations
- CSR:Achieving 1 Bit Key-Value Cache via Sparse RepresentationTechnical1 citations
- CVE-LLM: Ontology-Assisted Automatic Vulnerability Evaluation Using Large Language ModelsTechnical1 citations
- Can LLMs Reliably Simulate Human Learner Actions? A Simulation Authoring Framework for Open-Ended Learning EnvironmentsTechnical1 citations
- CasFT: Future Trend Modeling for Information Popularity Prediction with Dynamic Cues-Driven Diffusion ModelsTechnical1 citations
- Causal Discovery by Interventions via Integer ProgrammingTechnical1 citations
- Causal-Inspired Multitask Learning for Video-Based Human Pose EstimationTechnical1 citations
- ChangeDiff: A Multi-Temporal Change Detection Data Generator with Flexible Text Prompts via Diffusion ModelTechnical1 citations
- Cherry-Picking in Time Series Forecasting: How to Select Datasets to Make Your Model ShineTechnical1 citations
- Citations and Trust in LLM Generated ResponsesTechnical1 citations
- Cluster-guided Contrastive Class-imbalanced Graph ClassificationTechnical1 citations
- CodecNeRF: Toward Fast Encoding and Decoding, Compact, and High-quality Novel-view SynthesisTechnical1 citations
- CognitionCapturer: Decoding Visual Stimuli from Human EEG Signal with Multimodal InformationTechnical1 citations
- Column-Oriented Datalog on the GPUTechnical1 citations
- Complex-Cycle-Consistent Diffusion Model for Monaural Speech EnhancementTechnical1 citations
- Comprehensive Multi-Modal Prototypes Are Simple and Effective Classifiers for Vast-Vocabulary Object DetectionTechnical1 citations
- Computing Game Symmetries and Equilibria That Respect ThemTechnical1 citations
- ConDSeg: A General Medical Image Segmentation Framework via Contrast-Driven Feature EnhancementTechnical1 citations
- ConSense: Continually Sensing Human Activity with WiFi via Growing and PickingTechnical1 citations
- Conditional Diffusion Models Based Conditional Independence TestingTechnical1 citations
- Confidence Estimation for Error Detection in Text-to-SQL SystemsTechnical1 citations
- Configuring Data Augmentations to Reduce Variance Shift in Positional Embedding of Vision TransformersTechnical1 citations
- Conformal Inference of Individual Treatment Effects Using Conditional Density EstimatesTechnical1 citations
- Constrained Fair and Efficient AllocationsTechnical1 citations
- Constrained Offline Black-Box Optimization via Risk Evaluation and ManagementTechnical1 citations
- Constraint-Adaptive Policy Switching for Offline Safe Reinforcement LearningTechnical1 citations
- ContextHOI: Spatial Context Learning for Human-Object Interaction DetectionTechnical1 citations
- Contextual Stochastic Optimization for School Desegregation PolicymakingTechnical1 citations
- Continual Learning Using a Kernel-Based Method Over Foundation ModelsTechnical1 citations
- Controllable Distortion-Perception Tradeoff Through Latent Diffusion for Neural Image CompressionTechnical1 citations
- Controlling Large Language Models Through Concept Activation VectorsTechnical1 citations
- Cross-Modal Few-Shot Learning with Second-Order Neural Ordinary Differential EquationsTechnical1 citations
- Cross-View Graph Consistency Learning for Invariant Graph RepresentationsTechnical1 citations
- Cross-modulated Attention Transformer for RGBT TrackingTechnical1 citations
- Curriculum Conditioned Diffusion for Multimodal RecommendationTechnical1 citations
- DARR: A Dual-Branch Arithmetic Regression Reasoning Framework for Solving Machine Number ReasoningTechnical1 citations
- DECIDER: Difference-aware Contrastive Diffusion Model with Adversarial Perturbations for Image Change CaptioningTechnical1 citations
- DG-Mamba: Robust and Efficient Dynamic Graph Structure Learning with Selective State Space ModelsTechnical1 citations
- DGFamba: Learning Flow Factorized State Space for Visual Domain GeneralizationTechnical1 citations
- DM-Adapter: Domain-Aware Mixture-of-Adapters for Text-Based Person RetrievalTechnical1 citations
- DR-Encoder: Encode Low-rank Gradients with Random Prior for Large Language Models Differentially PrivatelyTechnical1 citations
- DR-VAE: Debiased and Representation-enhanced Variational Autoencoder for Collaborative RecommendationTechnical1 citations
- DSRC: Learning Density-Insensitive and Semantic-Aware Collaborative Representation Against CorruptionsTechnical1 citations
- Debiased Multimodal Understanding for Human Language SequencesTechnical1 citations
- Decentralized Federated Learning with Model Caching on Mobile AgentsTechnical1 citations
- Deep Hypergraph Neural Networks with Tight FrameletsTechnical1 citations
- Delay as Payoff in MABTechnical1 citations
- Densely Connected Parameter-Efficient Tuning for Referring Image SegmentationTechnical1 citations
- Detecting and Corrupting Convolution-based Unlearnable ExamplesTechnical1 citations
- Deterministic Policy Gradient Primal-Dual Methods for Continuous-Space Constrained MDPsTechnical1 citations
- DiffCLIP: Few-shot Language-driven Multimodal ClassifierTechnical1 citations
- DiffGrasp: Whole-Body Grasping Synthesis Guided by Object Motion Using a Diffusion ModelTechnical1 citations
- Digging into Intrinsic Contextual Information for High-fidelity 3D Point Cloud CompletionTechnical1 citations
- Dimension Reduction with Locally Adjusted GraphsTechnical1 citations
- Discrete Curvature Graph Information BottleneckTechnical1 citations
- Disentangle Nighttime Lens Flares: Self-supervised Generation-based Lens Flare RemovalTechnical1 citations
- Disentangled Motion Modeling for Video Frame InterpolationTechnical1 citations
- Distilling Structured Rationale from Large Language Models to Small Language Models for Abstractive SummarizationTechnical1 citations
- Distribution-Consistency-Guided Multi-modal HashingTechnical1 citations
- Distribution-Level Feature Distancing for Machine Unlearning: Towards a Better Trade-off Between Model Utility and ForgettingTechnical1 citations
- DivGCL: A Graph Contrastive Learning Model for Diverse RecommendationTechnical1 citations
- DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing ConstraintsTechnical1 citations
- Do Transformer Interpretability Methods Transfer to RNNs?Technical1 citations
- Does Your AI Agent Get You? A Personalizable Framework for Approximating Human Models from Argumentation-based Dialogue TracesTechnical1 citations
- Domain Generalized Medical Landmark Detection via Robust Boundary-Aware Pre-TrainingTechnical1 citations
- DriveGazen: Event-Based Driving Status Recognition Using Conventional CameraTechnical1 citations
- Drop the Beat! Freestyler for Accompaniment Conditioned Rapping Voice GenerationTechnical1 citations
- Dual Conditioned Motion Diffusion for Pose-Based Video Anomaly DetectionTechnical1 citations
- Dual Information Purification for Lightweight SAR Object DetectionTechnical1 citations
- DualDynamics: Synergizing Implicit and Explicit Methods for Robust Irregular Time Series AnalysisTechnical1 citations
- ECLAIR: Enhanced Clarification for Interactive ResponsesTechnical1 citations
- EDGE: Unknown-aware Multi-label Learning by Energy Distribution Gap ExpansionTechnical1 citations
- Each Fake News Is Fake in Its Own Way: An Attribution Multi-Granularity Benchmark for Multimodal Fake News DetectionTechnical1 citations
- EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing ModelsTechnical1 citations
- Efficient Few-Shot Neural Architecture Search by Counting the Number of Nonlinear FunctionsTechnical1 citations
- Efficient Gaussian Splatting for Monocular Dynamic Scene Rendering via Sparse Time-Variant Attribute ModelingTechnical1 citations
- Efficient Image-to-Image Diffusion Classifier for Adversarial RobustnessTechnical1 citations
- Efficient Language-instructed Skill Acquisition via Reward-Policy Co-EvolutionTechnical1 citations
- Efficient Self-Supervised Video Hashing with Selective State SpacesTechnical1 citations
- Efficient Traffic Prediction Through Spatio-Temporal DistillationTechnical1 citations
- Efficient Training of Neural Fractional-Order Differential Equation via Adjoint BackpropagationTechnical1 citations
- Eliminating Majority Illusion Is EasyTechnical1 citations
- Enhancing Close-up Novel View Synthesis via Pseudo-labelingTechnical1 citations
- Enhancing Contrastive Learning Inspired by the Philosophy of “The Blind Men and the Elephant”Technical1 citations
- Enhancing Diffusion Model with Auxiliary Information Mining-Exploration and Efficient Sampling Mechanism for Sequential RecommendationTechnical1 citations
- Enhancing Elusive Clues in Knowledge Learning by Contrasting Attention of Language ModelsTechnical1 citations
- Enhancing Identity-Deformation Disentanglement in StyleGAN for One-Shot Face Video Re-EnactmentTechnical1 citations
- Enhancing Multi-Robot Semantic Navigation Through Multimodal Chain-of-Thought Score CollaborationTechnical1 citations
- Enhancing SQL Query Generation with Neurosymbolic ReasoningTechnical1 citations
- Enhancing Uncertainty Modeling with Semantic Graph for Hallucination DetectionTechnical1 citations
- Equal Merit Does Not Imply Equality: Discrimination at Equilibrium in a Hiring Market with Symmetric AgentsTechnical1 citations
- Error Bounds for Gaussian Process Regression Under Bounded Support Noise with Applications to Safety CertificationTechnical1 citations
- Error Diversity Matters: An Error-Resistant Ensemble Method for Unsupervised Dependency ParsingTechnical1 citations
- EvalAssist: LLM-as-a-Judge SimplifiedTechnical1 citations
- Evaluating Image Hallucination in Text-to-Image Generation with Question-AnsweringTechnical1 citations
- Event-Enhanced Blurry Video Super-ResolutionTechnical1 citations
- EventSum: A Large-Scale Event-Centric Summarization Dataset for Chinese Multi-News DocumentsTechnical1 citations
- Every Component Counts: Rethinking the Measure of Success for Medical Semantic Segmentation in Multi-Instance Segmentation TasksTechnical1 citations
- Explaining Decisions of Agents in Mixed-Motive GamesTechnical1 citations
- Exploiting Continuous Motion Clues for Vision-Based Occupancy PredictionTechnical1 citations
- Exploiting Diffusion Prior for Real-World Image Dehazing with Unpaired TrainingTechnical1 citations
- Exploring Iterative Enhancement for Improving Learnersourced Multiple-Choice Question Explanations with Large Language ModelsTechnical1 citations
- Exploring Query Efficient Data Generation Towards Data-Free Model Stealing in Hard Label SettingTechnical1 citations
- Expressive Power of Temporal Message PassingTechnical1 citations
- Extract Free Dense Misalignment from CLIPTechnical1 citations
- Extracting Interpretable Task-Specific Circuits from Large Language Models for Faster InferenceTechnical1 citations
- FairGP: A Scalable and Fair Graph Transformer Using Graph PartitioningTechnical1 citations
- Fairness Issues and Mitigations in (Differentially Private) Socio-Demographic Data ProcessesTechnical1 citations
- Feature Denoising Diffusion Model for Blind Image Quality AssessmentTechnical1 citations
- Fed-DFA: Federated Distillation for Heterogeneous Model Fusion Through the Adversarial LensTechnical1 citations
- FedPop: Federated Population-based Hyperparameter TuningTechnical1 citations
- Federated Foundation Models on Heterogeneous Time SeriesTechnical1 citations
- Federated Unlearning with Gradient Descent and Conflict MitigationTechnical1 citations
- Filter or Compensate: Towards Invariant Representation from Distribution Shift for Anomaly DetectionTechnical1 citations
- Forecasting Competitions with Correlated EventsTechnical1 citations
- Formal Quality Measures for Predictors in Markov Decision ProcessesTechnical1 citations
- Formally Verified Approximate Policy IterationTechnical1 citations
- Fostering Epistemic Insights into AI Ethics through a Constructionist Pedagogy: An Interdisciplinary Approach to AI LiteracyTechnical1 citations
- FriendsQA: A New Large-Scale Deep Video Understanding Dataset with Fine-grained Topic Categorization for Story VideosTechnical1 citations
- From 2D CAD Drawings to 3D Parametric Models: A Vision-Language ApproachTechnical1 citations
- From Pairwise to Ranking: Climbing the Ladder to Ideal Collaborative Filtering with Pseudo-RankingTechnical1 citations
- Fully Test-time Adaptation for Tabular DataTechnical1 citations
- GCAD: Anomaly Detection in Multivariate Time Series from the Perspective of Granger CausalityTechnical1 citations
- GGS: Generalizable Gaussian Splatting for Lane Switching in Autonomous DrivingTechnical1 citations
- Gaze Label Alignment: Alleviating Domain Shift for Gaze EstimationTechnical1 citations
- Generalizable Disaster Damage Assessment via Change Detection with Vision Foundation ModelTechnical1 citations
- GraSP: Simple Yet Effective Graph Similarity PredictionsTechnical1 citations
- Gradient Alignment Improves Test-Time Adaptation for Medical Image SegmentationTechnical1 citations
- Gradient Weight-normalized Low-rank Projection for Efficient LLM TrainingTechnical1 citations
- Graph Coarsening via Supervised Granular-Ball for Scalable Graph Neural Network TrainingTechnical1 citations
- Graph Mixture of Experts and Memory-augmented Routers for Multivariate Time Series Anomaly DetectionTechnical1 citations
- Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person RetrievalTechnical1 citations
- HGSFusion: Radar-Camera Fusion with Hybrid Generation and Synchronization for 3D Object DetectionTechnical1 citations
- HVIS: A Human-like Vision and Inference System for Human Motion PredictionTechnical1 citations
- HYGENE: A Diffusion-Based Hypergraph Generation MethodTechnical1 citations
- Hansel: Output Length Controlling Framework for Large Language ModelsTechnical1 citations
- Harnessing Large Language Models for Knowledge Graph Question Answering via Adaptive Multi-Aspect Retrieval-AugmentationTechnical1 citations
- HiCM²: Hierarchical Compact Memory Modeling for Dense Video CaptioningTechnical1 citations
- Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression ComprehensionTechnical1 citations
- Hierarchically Controlled Deformable 3D Gaussians for Talking Head SynthesisTechnical1 citations
- How Many Lines to Paint the City: Exact Edge-Cover in Temporal GraphsTechnical1 citations
- How Your Location Relates to Health: Variable Importance and Interpretable Machine Learning for Environmental and Sociodemographic DataTechnical1 citations
- Human-in-the-loop or AI-in-the-loop? Automate or Collaborate?Technical1 citations
- IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal CapabilitiesTechnical1 citations
- ICE-T: Interactions-aware Cross-column Contrastive Embedding for Heterogeneous Tabular DatasetsTechnical1 citations
- IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression SegmentationTechnical1 citations
- ITP: Instance-Aware Test Pruning for Out-of-Distribution DetectionTechnical1 citations
- Identifying Predictions That Influence the Future: Detecting Performative Concept Drift in Data StreamsTechnical1 citations
- Identity-Text Video Corpus GroundingTechnical1 citations
- Imperceptible 3D Point Cloud Attacks on Lattice-based Barycentric CoordinatesTechnical1 citations
- Improved Fixed-Parameter Bounds for Min-Sum-Radii and Diameters k-Clustering and Their Fair VariantsTechnical1 citations
- Improving Generalization of Deep Neural Networks by Optimum ShiftingTechnical1 citations
- Improving Generalization of Universal Adversarial Perturbation via Dynamic Maximin OptimizationTechnical1 citations
- Improving Integrated Gradient-based Transferable Adversarial Examples by Refining the Integration PathTechnical1 citations
- Improving Pareto Set Learning for Expensive Multi-objective Optimization via Stein Variational HypernetworksTechnical1 citations
- In-depth Analysis of Low-rank Matrix Factorisation in a Federated SettingTechnical1 citations
- Incomplete Modality Disentangled Representation for Ophthalmic Disease Grading and DiagnosisTechnical1 citations
- Instruction-Augmented Long-Horizon Planning: Embedding Grounding Mechanisms in Embodied Mobile ManipulationTechnical1 citations
- Integrating Symbolic Reasoning into Neural Generative Models for Design GenerationTechnical1 citations
- Intelligent OPC Engineer Assistant for Semiconductor ManufacturingTechnical1 citations
- Interacted Object Grounding in Spatio-Temporal Human-Object InteractionsTechnical1 citations
- Interpretable Solutions for Multi-Physics PDEs Using T-NNGPTechnical1 citations
- Is There No Such Thing as a Bad Question? H4R: HalluciBot for Ratiocination, Rewriting, Ranking, and RoutingTechnical1 citations
- Kernel-Aware Graph Prompt Learning for Few-Shot Anomaly DetectionTechnical1 citations
- Knowledge Tagging with Large Language Model Based Multi-Agent SystemTechnical1 citations
- Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language ModelsTechnical1 citations
- LATTE: Improving Latex Recognition for Tables and Formulae with Iterative RefinementTechnical1 citations
- LEGEND: Leveraging Representation Engineering to Annotate Safety Margin for Preference DatasetsTechnical1 citations
- LLM+AL: Bridging Large Language Models and Action Languages for Complex Reasoning About ActionsTechnical1 citations
- LLM-RG4: Flexible and Factual Radiology Report Generation Across Diverse Input ContextsTechnical1 citations
- LLaVA Needs More Knowledge: Retrieval Augmented Natural Language Generation with Knowledge Graph for Explaining Thoracic PathologiesTechnical1 citations
- LOMA: Language-assisted Semantic Occupancy Network via Triplane MambaTechnical1 citations
- LTLf Synthesis Under Unreliable InputTechnical1 citations
- Langevin Monte Carlo Beyond Lipschitz Gradient ContinuityTechnical1 citations
- Learnability of Parameter-Bounded Bayes NetsTechnical1 citations
- Learning Fine-grained Domain Generalization via Hyperbolic State Space HallucinationTechnical1 citations
- Learning Physics Informed Neural ODEs with Partial MeasurementsTechnical1 citations
- Leveraging Consistent Spatio-Temporal Correspondence for Robust Visual OdometryTechnical1 citations
- Leveraging Group Classification with Descending Soft Labeling for Deep Imbalanced RegressionTechnical1 citations
- Leveraging Large Language Models for Wind Energy AssessmentTechnical1 citations
- Leveraging RGB-D Data with Cross-Modal Context Mining for Glass Surface DetectionTechnical1 citations
- MCGAN: Enhancing GAN Training with Regression-Based Generator LossTechnical1 citations
- MDD-5k: A New Diagnostic Conversation Dataset for Mental Disorders Synthesized via Neuro-Symbolic LLM AgentsTechnical1 citations
- MOL-Mamba: Enhancing Molecular Representation with Structural & Electronic InsightsTechnical1 citations
- MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion ModelsTechnical1 citations
- MTGA: Multi-View Temporal Granularity Aligned Aggregation for Event-Based Lip-ReadingTechnical1 citations
- MagicNaming: Consistent Identity Generation by Finding a “Name Space” in T2I Diffusion ModelsTechnical1 citations
- Make Domain Shift a Catastrophic Forgetting Alleviator in Class-Incremental LearningTechnical1 citations
- MalCL: Leveraging GAN-Based Generative Replay to Combat Catastrophic Forgetting in Malware ClassificationTechnical1 citations
- MambaLCT: Boosting Tracking via Long-term Context State Space ModelTechnical1 citations
- MapExpert: Online HD Map Construction with Simple and Efficient Sparse Map Element ExpertTechnical1 citations
- Masked Language Modeling Becomes Conditional Density Estimation for Tabular Data SynthesisTechnical1 citations
- MathSpeech: Leveraging Small LMs for Accurate Conversion in Mathematical Speech-to-FormulaTechnical1 citations
- MeRino: Entropy-Driven Design for Generative Language Models on IoT DevicesTechnical1 citations
- Measuring Error Alignment for Decision-Making SystemsTechnical1 citations
- Medical MLLM Is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language ModelsTechnical1 citations
- Medical Manifestation-Aware De-IdentificationTechnical1 citations
- Medical Multimodal Model Stealing Attacks via Adversarial Domain AlignmentTechnical1 citations
- Mixture of Experts Based Multi-Task Supervise Learning from CrowdsTechnical1 citations
- MoRe: Class Patch Attention Needs Regularization for Weakly Supervised Semantic SegmentationTechnical1 citations
- Modeling Inter-Intra Heterogeneity for Graph Federated LearningTechnical1 citations
- MonoBox: Tightness-Free Box-Supervised Polyp Segmentation Using Monotonicity ConstraintTechnical1 citations
- Multi-Agent Motion Planning for Differential Drive Robots Through Stationary State SearchTechnical1 citations
- Multi-Agent Security Tax: Trading Off Security and Collaboration Capabilities in Multi-Agent SystemsTechnical1 citations
- Multi-Grained Query-Guided Set Prediction Network for Grounded Multimodal Named Entity RecognitionTechnical1 citations
- Multi-Modal Grounded Planning and Efficient Replanning for Learning Embodied Agents with a Few ExamplesTechnical1 citations
- Multi-Objective Molecular Design Through Learning Latent Pareto SetTechnical1 citations
- Multi-Robot Task Allocation Using Global Games with Negative Feedback: The Colony Maintenance ProblemTechnical1 citations
- Multi-Scale Contrastive Learning for Video Temporal GroundingTechnical1 citations
- Multi-View Incremental Learning with Structured Hebbian Plasticity for Enhanced Fusion EfficiencyTechnical1 citations
- Multi-clue Consistency Learning to Bridge Gaps Between General and Oriented Object in Semi-supervised DetectionTechnical1 citations
- Multi-task Visual Grounding with Coarse-to-Fine Consistency ConstraintsTechnical1 citations
- Multifaceted User Modeling in Recommendation: A Federated Foundation Models ApproachTechnical1 citations
- Multilingual LLMs Inherently Reward In-Language Time-Sensitive Semantic Alignment for Low-Resource LanguagesTechnical1 citations
- Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and EnglishTechnical1 citations
- Multimodal Commonsense Knowledge Distillation for Visual Question Answering (Student Abstract)Technical1 citations
- NLGT: Neighborhood-based and Label-enhanced Graph Transformer Framework for Node ClassificationTechnical1 citations
- Navigating Label Ambiguity for Facial Expression Recognition in the WildTechnical1 citations
- Nearly Tight Bounds on Approximate Equilibria in Spatial Competition on the LineTechnical1 citations
- Neural Collapse Inspired Knowledge DistillationTechnical1 citations
- Neural Reasoning Networks: Efficient Interpretable Neural Networks with Automatic Textual ExplanationsTechnical1 citations
- Neural Variable-Order Fractional Differential Equation NetworksTechnical1 citations
- NeuralFlix: A Simple While Effective Framework for Semantic Decoding of Videos from Non-invasive Brain RecordingsTechnical1 citations
- Noise-Resilient Symbolic Regression with Dynamic Gating Reinforcement LearningTechnical1 citations
- ODDN: Addressing Unpaired Data Challenges in Open-World Deepfake Detection on Online Social NetworksTechnical1 citations
- OGP-Net: Optical Guidance Meets Pixel-Level Contrastive Distillation for Robust Multi-Modal and Missing Modality SegmentationTechnical1 citations
- OLiDM: Object-aware LiDAR Diffusion Models for Autonomous DrivingTechnical1 citations
- Offline-to-Online Hyperparameter Transfer for Stochastic BanditsTechnical1 citations
- OmniSR: Shadow Removal Under Direct and Indirect LightingTechnical1 citations
- On Corruption-Robustness in Performative Reinforcement LearningTechnical1 citations
- On Oversquashing in Graph Neural Networks Through the Lens of Dynamical SystemsTechnical1 citations
- On the Consideration of AI Openness: Can Good Intent Be Abused?Technical1 citations
- On the Power of Strategic Corpus Enrichment in Content Creation GamesTechnical1 citations
- On the Trainability and Classical Simulability of Learning Matrix Product States VariationallyTechnical1 citations
- Operationalising Rawlsian Ethics for Fairness in Norm Learning AgentsTechnical1 citations
- Optimizing Human Pose Estimation Through Focused Human and Joint RegionsTechnical1 citations
- Orchestrating the Symphony of Prompt Distribution Learning for Human-Object Interaction DetectionTechnical1 citations
- PALM: Pushing Adaptive Learning Rate Mechanisms for Continual Test-Time AdaptationTechnical1 citations
- PAT: Pruning-Aware Tuning for Large Language ModelsTechnical1 citations
- PEARL: Input-Agnostic Prompt Enhancement with Negative Feedback Regulation for Class-Incremental LearningTechnical1 citations
- PIXELS: Progressive Image Xemplar-based Editing with Latent SurgeryTechnical1 citations
- PLATYPUS: Progressive Local Surface Estimator for Arbitrary-Scale Point Cloud UpsamplingTechnical1 citations
- PSReg: Prior-guided Sparse Mixture of Experts for Point Cloud RegistrationTechnical1 citations
- PanAdapter: Two-Stage Fine-Tuning with Spatial-Spectral Priors Injecting for PansharpeningTechnical1 citations
- Pareto Set Learning for Multi-Objective Reinforcement LearningTechnical1 citations
- ParseCaps: An Interpretable Parsing Capsule Network for Medical Image DiagnosisTechnical1 citations
- Partially Blinded Unlearning: Class Unlearning for Deep Networks from Bayesian PerspectiveTechnical1 citations
- PatentLMM: Large Multimodal Model for Generating Descriptions for Patent FiguresTechnical1 citations
- Personalized Sleep Staging Leveraging Source-free Unsupervised Domain AdaptationTechnical1 citations
- Pilot: Building the Federated Multimodal Instruction Tuning FrameworkTechnical1 citations
- Pioneer: Physics-informed Riemannian Graph ODE for Entropy-increasing DynamicsTechnical1 citations
- Pixel Is Not a Barrier: An Effective Evasion Attack for Pixel-Domain Diffusion ModelsTechnical1 citations
- PlanLLM: Video Procedure Planning with Refinable Large Language ModelsTechnical1 citations
- Point Cloud Semantic Segmentation with Sparse and Inhomogeneous AnnotationsTechnical1 citations
- Political Actor Agent: Simulating Legislative System for Roll Call Votes Prediction with Large Language ModelsTechnical1 citations
- PowerMLP: An Efficient Version of KANTechnical1 citations
- Practicable Black-Box Evasion Attacks on Link Prediction in Dynamic Graphs—a Graph Sequential Embedding MethodTechnical1 citations
- Prediction-Feedback DETR for Temporal Action DetectionTechnical1 citations
- Probabilistic Explanations for Linear ModelsTechnical1 citations
- Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language ModelsTechnical1 citations
- Promptable Representation Distribution Learning and Data Augmentation for Gigapixel Histopathology WSI AnalysisTechnical1 citations
- ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech SynthesisTechnical1 citations
- Provable Discriminative Hyperspherical Embedding for Out-of-Distribution DetectionTechnical1 citations
- Putting People in LLMs’ Shoes: Generating Better Answers via Question RewriterTechnical1 citations
- QCS:Feature Refining from Quadruplet Cross Similarity for Facial Expression RecognitionTechnical1 citations
- QORT-Former: Query-optimized Real-time Transformer for Understanding Two Hands Manipulating ObjectsTechnical1 citations
- Quantifying Misalignment Between Agents: Towards a Sociotechnical Understanding of AlignmentTechnical1 citations
- RCTrans: Radar-Camera Transformer via Radar Densifier and Sequential Decoder for 3D Object DetectionTechnical1 citations
- RETQA: A Large-Scale Open-Domain Tabular Question Answering Dataset for Real Estate SectorTechnical1 citations
- RI-MAE: Rotation-Invariant Masked AutoEncoders for Self-Supervised Point Cloud Representation LearningTechnical1 citations
- RaDIO: Real-Time Hallucination Detection with Contextual Index Optimized Query Formulation for Dynamic Retrieval Augmented GenerationTechnical1 citations
- ReX: A Framework for Incorporating Temporal Information in Model-Agnostic Local Explanation TechniquesTechnical1 citations
- RealisID: Scale-Robust and Fine-Controllable Identity Customization via Local and Global ComplementationTechnical1 citations
- Rebalancing Multi-Label Class-Incremental LearningTechnical1 citations
- Recording for Eyes, Not Echoing to Ears: Contextualized Spoken-to-Written Conversion of ASR TranscriptsTechnical1 citations
- Region-Based Optimization in Continual Learning for Audio Deepfake DetectionTechnical1 citations
- Regional Expected Improvement for Efficient Trust Region Selection in High-Dimensional Bayesian OptimizationTechnical1 citations
- Regret Analysis of Multi-task Representation Learning for Linear-Quadratic Adaptive ControlTechnical1 citations
- Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph GenerationTechnical1 citations
- Relaxed Class-consensus Consistency for Semi-supervised Semantic SegmentationTechnical1 citations
- Replicating Electoral SuccessTechnical1 citations
- Rethinking Cancer Gene Identification Through Graph Anomaly AnalysisTechnical1 citations
- Rethinking Pseudo-Label Guided Learning for Weakly Supervised Temporal Action Localization from the Perspective of Noise CorrectionTechnical1 citations
- Revisiting Projection-Free Online Learning with Time-Varying ConstraintsTechnical1 citations
- RhythmMamba: Fast, Lightweight, and Accurate Remote Physiological MeasurementTechnical1 citations
- Riemann-based Multi-scale Attention Reasoning Network for Text-3D RetrievalTechnical1 citations
- RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference DataTechnical1 citations
- Robust SAM: On the Adversarial Robustness of Vision Foundation ModelsTechnical1 citations
- RouterRetriever: Routing over a Mixture of Expert Embedding ModelsTechnical1 citations
- SAIL: Sample-Centric In-Context Learning for Document Information ExtractionTechnical1 citations
- SCOPE: Sign Language Contextual Processing with Embedding from LLMsTechnical1 citations
- SEAL: Systematic Error Analysis for Value ALignmentTechnical1 citations
- SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language ModelsTechnical1 citations
- SKI Models: Skeleton Induced Vision-Language Embeddings for Understanding Activities of Daily LivingTechnical1 citations
- SMMF: Square-Matricized Momentum Factorization for Memory-Efficient OptimizationTechnical1 citations
- SMamba: Sparse Mamba for Event-based Object DetectionTechnical1 citations
- SMoSE: Sparse Mixture of Shallow Experts for Interpretable Reinforcement Learning in Continuous Control TasksTechnical1 citations
- SS-GEN: A Social Story Generation Framework with Large Language ModelsTechnical1 citations
- STAIR: Manipulating Collaborative and Multimodal Information for E-Commerce RecommendationTechnical1 citations
- SUMI-IFL: An Information-Theoretic Framework for Image Forgery Localization with Sufficiency and Minimality ConstraintsTechnical1 citations
- SalM²: An Extremely Lightweight Saliency Mamba Model for Real-Time Cognitive Awareness of Driver AttentionTechnical1 citations
- ScaleOT: Privacy-utility-scalable Offsite-tuning with Dynamic LayerReplace and Selective Rank CompressionTechnical1 citations
- SceneX: Procedural Controllable Large-Scale Scene GenerationTechnical1 citations
- Selective Uncertainty Propagation in Offline RLTechnical1 citations
- Selective Visual Prompting in Vision MambaTechnical1 citations
- Self-Corrected Flow Distillation for Consistent One-Step and Few-Step Image GenerationTechnical1 citations
- Semi-Implicit Neural Ordinary Differential EquationsTechnical1 citations
- Sensing Surface Patches in Volume Rendering for Inferring Signed Distance FunctionsTechnical1 citations
- Sequence Matters: Harnessing Video Models in 3D Super-ResolutionTechnical1 citations
- Sharpening Neural Implicit Functions with Frequency Consolidation PriorsTechnical1 citations
- SigStyle: Signature Style Transfer via Personalized Text-to-Image ModelsTechnical1 citations
- Simulation-Free Hierarchical Latent Policy Planning for Proactive DialoguesTechnical1 citations
- Skeleton-based Action Recognition with Non-linear Dependency Modeling and Hilbert-Schmidt Independence CriterionTechnical1 citations
- SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control TasksTechnical1 citations
- Smoothness Really Matters: A Simple Yet Effective Approach for Unsupervised Graph Domain AdaptationTechnical1 citations
- Solving Robust Markov Decision Processes: Generic, Reliable, EfficientTechnical1 citations
- SongGLM: Lyric-to-Melody Generation with 2D Alignment Encoding and Multi-Task Pre-TrainingTechnical1 citations
- SpatioTemporal Learning for Human Pose Estimation in Sparsely-Labeled VideosTechnical1 citations
- Speech Is Not Enough: Interpreting Nonverbal Indicators of Common Knowledge and EngagementTechnical1 citations
- Speech Watermarking with Discrete Intermediate RepresentationsTechnical1 citations
- Speeding Up the NSGA-II with a Simple Tie-Breaking RuleTechnical1 citations
- Speedup Techniques for Switchable Temporal Plan Graph OptimizationTechnical1 citations
- Spiking Point Transformer for Point Cloud ClassificationTechnical1 citations
- Statistical Methodologies for Decision-Making and Uncertainty Reduction in Machine LearningTechnical1 citations
- Step-Calibrated Diffusion for Biomedical Optical Image RestorationTechnical1 citations
- Storynizor: Consistent Story Generation via Inter-Frame Synchronized and Shuffled ID InjectionTechnical1 citations
- Strategyproof Matching of Roommates and RoomsTechnical1 citations
- Synthetic Tabular Data Generation for Imbalanced Classification: The Surprising Effectiveness of an Overlap ClassTechnical1 citations
- S³-Mamba: Small-Size-Sensitive Mamba for Lesion SegmentationTechnical1 citations
- TCAQ-DM: Timestep-Channel Adaptive Quantization for Diffusion ModelsTechnical1 citations
- TEncDM: Understanding the Properties of the Diffusion Model in the Space of Language Model EncodingsTechnical1 citations
AAAI accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.