AAAI 2026 Accepted Papers
The full list of 4,902 papers accepted at AAAI 2026 (Association for the Advancement of Artificial Intelligence Annual Conference on Artificial Intelligence). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Technical: 4,902
- Self-Supervised One-Step Diffusion Refinement for Snapshot Compressive ImagingTechnical
- Self-Supervised Representation Learning with Joint Embedding Predictive Architecture for Automotive LiDAR Object DetectionTechnical
- Self-supervised Multiplex Consensus Mamba for General Image FusionTechnical
- Semantic Alignment of Malicious Question Based on Contrastive Semantic Networks and Data Augmentation (Abstract Reprint)Technical
- Semantic Document Derendering: SVG Reconstruction via Vision-Language ModelingTechnical
- Semantic Embedding and Synthetic Augmentation for Longitudinal Survey Prediction (Student Abstract)Technical
- Semantic Feature Purification for Adversarially-Aware RGB-T TrackingTechnical
- Semantic Guided Part Relation-aware Network for Point Cloud CompletionTechnical
- Semantic Volume: Quantifying and Detecting Both External and Internal Uncertainty in LLMsTechnical
- Semantic-Augmented Image Clustering via Adaptive Multi-Modal CollaborationTechnical
- Semantic-Aware Data Augmentation for Sequential RecommendationTechnical
- Semantic-Aware Feature Enhancement for Partial Label LearningTechnical
- Semantic-Consistent Bidirectional Contrastive Hashing for Noisy Multi-Label Cross-Modal RetrievalTechnical
- Semantic-Driven Visual Progressive Refinement for Aerial-Ground Person ReID: A Challenging Large-Scale BenchmarkTechnical
- Semantic-Guided Sketch-to-RGB Image Generation via Controlled Diffusion for Improved Sketch Recognition (Student Abstract)Technical
- SemanticNN: Compressive and Error-Resilient Semantic Offloading for Extremely Weak DevicesTechnical
- SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic ManipulationTechnical
- Semantics and Content Matter: Towards Multi-Prior Hierarchical Mamba for Image DerainingTechnical
- Semantics-Preserving Adversarial Attacks on Event-Driven Stock Prediction ModelsTechnical
- Semi-Supervised High Dynamic Range Image Reconstructing via Bi-Level Uncertain Area MaskingTechnical
- Semi-Supervised Regression by Preserving Ranking Relationships Between Close Unlabeled SamplesTechnical
- Semi-Supervised Semantic Segmentation via Derivative Label PropagationTechnical
- Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance ModelingTechnical
- Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern GenerationTechnical
- Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement LearningTechnical
- Sensor Model Identification via Simultaneous Model Selection and State Variable Determination (Abstract Reprint)Technical
- Sentient: Detecting APTs via Capturing Indirect Dependencies and Behavioral LogicTechnical
- SepPrune: Structured Pruning for Efficient Deep Speech SeparationTechnical
- SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical PlanningTechnical
- Sequence-Free for Compound Protein Interaction PredictionTechnical
- Sequential Selling with Sunk Cost BiasTechnical
- ShaLa: Multimodal Shared Latent Generative ModellingTechnical
- ShadeEdit: A Utility-Preserving and Defense-Evasive Knowledge Manipulation Attack in Federated LLMsTechnical
- Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development SystemsTechnical
- ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition TreesTechnical
- Shaping Human–AI Collaboration in Education: Effects of AI-Assisted Decision-Making Paradigms and Human–AI Decision Consistency on Pre-Service Teachers’ Psychological States and PerformanceTechnical
- Shaping Parameter Contribution Patterns for Out-of-Distribution DetectionTechnical
- Shaping Without Tearing: Controllable Diffeomorphic Deformations for Topology-Preserving 3D Point Cloud AugmentationTechnical
- Shapley Value Approximation Based on k-Additive GamesTechnical
- Share Your Attention: Transformer Weight Sharing via Matrix-based Dictionary LearningTechnical
- Shared & Domain Self-Adaptive Experts with Frequency-Aware Discrimination for Continual Test-Time AdaptationTechnical
- SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse PreferencesTechnical
- Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM ReasoningTechnical
- Sheaf Graph Neural Networks via PAC-Bayes Spectral OptimizationTechnical
- Shedding the Facades, Connecting the Domains: Detecting Shifting Multimodal Hate Video with Test-Time AdaptationTechnical
- SheetBrain: A Neuro-Symbolic Agent for Accurate Reasoning over Complex and Large SpreadsheetsTechnical
- ShieldRAG: Safeguarding Retrieval-Augmented Generation from Untrusted Knowledge BasesTechnical
- ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based AgentsTechnical
- ShortageSim: Simulating Drug Shortages Under Information AsymmetryTechnical
- Shortcut Learning Susceptibility in Vision Classifiers (Student Abstract)Technical
- Should You Use LLMs to Simulate Opinions? Quality Checks for Early-Stage DeliberationTechnical
- Shrinking the Teacher: An Adaptive Teaching Paradigm for Asymmetric EEG-Vision AlignmentTechnical
- SigFusion: Unified Signal-Level Self-Supervised Learning Paradigm for Image FusionTechnical
- Sign-Aware Multimodal Graph RecommendationTechnical
- Signal Enhancement via Multi-view Dynamic Representation and Alignment-aware FusionTechnical
- Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-IdentificationTechnical
- Silenced Biases: The Dark Side LLMs Learned to RefuseTechnical
- Sim-to-Real: An Unsupervised Noise Layer for Screen-Camera Watermarking RobustnessTechnical
- Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity MasksTechnical
- SimDiff: Simpler Yet Better Diffusion Model for Time Series Point ForecastingTechnical
- SimLabel: Similarity-Weighted Semi-supervision for Multi-annotator Learning with Missing LabelsTechnical
- SimROD: A Simple Baseline for Raw Object Detection with Global and Local EnhancementsTechnical
- Simba: Towards High-Fidelity and Geometrically-Consistent Point Cloud Completion via Transformation DiffusionTechnical
- SimpleDiffusion: A Lightweight and Efficient Conditional Diffusion Model for Multi-Modal Salient Object DetectionTechnical
- Simulated Rewards, Skewed Strategies: Tracing the Acquired Preference Bias in LLM-Based Dialogue PlannersTechnical
- Simulating Dispute Mediation with LLM-Based Agents for Legal ResearchTechnical
- Simulating Distribution Dynamics: Liquid Temporal Feature Evolution for Single-Domain Generalized Object DetectionTechnical
- Simulating Human-Like Counseling: A Path- and Scenario-Guided Framework for Psychological Support DialogueTechnical
- Simulation-Driven Railway Delay Prediction: An Imitation Learning ApproachTechnical
- SinBasis Networks: Matrix-Equivalent Feature Extraction for Wave-Like Optical SpectrogramsTechnical
- SineLoRA∆: Sine-Activated Delta CompressionTechnical
- Single-Stage fMRI-to-3D Reconstruction via Viewpoint-Aware Embedding and Hierarchical GuidanceTechnical
- Situating Youth Agency in Designing AI & Art PoliciesTechnical
- Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-IdentificationTechnical
- Sketch-Guided Anime Hair Editing Using Multimodal Diffusion Transformer (Student Abstract)Technical
- Skill Path: Unveiling Language Skills from Circuit GraphsTechnical
- SkillGen: Learning Domain Skills for In-Context Sequential Decision MakingTechnical
- SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block SkippingTechnical
- SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of ExpertsTechnical
- SkySplat: Generalizable 3D Gaussian Splatting from Multi-Temporal Sparse Satellite ImagesTechnical
- Sleep-Like Replay Reduces Loss-Landscape Sharpness to Improve Generalization (Student Abstract)Technical
- Slender3D: Curve-Guided Multi-View Reconstruction of Slender StructuresTechnical
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal PresentationsTechnical
- SlideTailor: Personalized Presentation Slide Generation for Scientific PapersTechnical
- Sliding-Window Merging for Compacting Patch-Redundant Layers in LLMsTechnical
- SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token PruningTechnical
- Small Models Exhibit Limited Answer Consistency in Repetition Trials of the Multiple-Choice MMLU-Redux and MedQA BenchmarksTechnical
- Small but Mighty: Dynamic Wavelet Expert-Guided Fine-Tuning of Large-Scale Models for Optical Remote Sensing Object SegmentationTechnical
- SmartAgent: Chain-of-User-Thought for Embodied Personalized Agent in Cyber WorldTechnical
- SmartEyes: Plug-and-Play Event Detection for Retail Loss PreventionTechnical
- SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention CollapseTechnical
- SmartSplat: Feature-Smart Gaussians for Scalable Compression of Ultra-High-Resolution ImagesTechnical
- SoMe: A Realistic Benchmark for LLM-based Social Media AgentsTechnical
- Social Behavior as a Key to Learning-Based Multi-Agent Pathfinding Dilemmas (Abstract Reprint)Technical
- Social Influence-Based Mutual Acknowledgement Token Exchange (Student Abstract)Technical
- Socrates or Smartypants: Testing Logic Reasoning Capabilities of Large Language Models with Logic Programming-Based Test OraclesTechnical
- Soft Conflict-Resolution Decision Transformer for Offline Multi-Task Reinforcement LearningTechnical
- Sonic4D: Spatial Audio Generation for Immersive 4D Scene ExplorationTechnical
- Sonnet: Spectral Operator Neural Network for Multivariable Time Series ForecastingTechnical
- Sortblock: Similarity-Aware Feature Reuse for Diffusion ModelTechnical
- Sound-AI: A Pedagogical Tool for Exploring AI in Audio and Bioacoustic ResearchTechnical
- Source-Free Graph Foundation Model Adaptation via Pseudo-Source ReconstructionTechnical
- SpaCRD: Multimodal Deep Fusion of Histology and Spatial Transcriptomics for Cancer Region DetectionTechnical
- Space Alignment Matters: The Missing Piece for Inducing Neural Collapse in Long-Tailed LearningTechnical
- SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding CapabilityTechnical
- SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel PruningTechnical
- Sparse Additive Model Pruning for Order-Based Causal Structure LearningTechnical
- Sparse Attention Across Multiple-Context KV CacheTechnical
- Sparse Poisson Gamma Belief Networks for High-Dimensional Sparse Count DataTechnical
- Sparse Tuning Enhances Plasticity in PTM-based Continual LearningTechnical
- Sparse-Scale Transformer with Bidirectional Awareness for Time Series ForecastingTechnical
- Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache EvictionTechnical
- Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion TransformersTechnical
- Sparse3DPR: Training-Free 3D Hierarchical Scene Parsing and Task-Adaptive Subgraph Reasoning from Sparse RGB ViewsTechnical
- Sparse4DGS: 4D Gaussian Splatting for Sparse-Frame Dynamic Scene ReconstructionTechnical
- SparseCoop: Cooperative Perception with Kinematic-Grounded QueriesTechnical
- SparseRM: A Lightweight Preference Modeling with Sparse AutoencoderTechnical
- SparseSurf: Sparse-View 3D Gaussian Splatting for Surface ReconstructionTechnical
- SparseWorld: A Flexible, Adaptive, and Efficient 4D Occupancy World Model Powered by Sparse and Dynamic QueriesTechnical
- Spatial Branch-and-Bound for Computing Multiplayer Nash EquilibriumTechnical
- Spatial Graph Attention Network Modeling for Neighborhood-Scale Lead Contamination Risk Prediction Using Publicly Available DataTechnical
- Spatial-Frequency Spiking Neural Network for Underwater Object DetectionTechnical
- Spatial-Spectral Homogeneous Attacks on Physical-World Large Vision-Language ModelsTechnical
- Spatial-Temporal Feedback Diffusion Guidance for Controlled Traffic ImputationTechnical
- SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic ManipulationTechnical
- SpatialLogic-Bench: A Diagnostic Benchmark for Task-Oriented Spatiotemporal ReasoningTechnical
- Spatially Grouped Curriculum Learning for Multi-Agent Path FindingTechnical
- Spatially-Guided Self-Attention Refinement for Zero-Shot Hair Segmentation (Student Abstract)Technical
- Spatio-Temporal Context Learning with Temporal Difference Convolution for Moving Infrared Small Target DetectionTechnical
- Spatio-Temporal Distortion Aware Omnidirectional Video Super-ResolutionTechnical
- Spatio-Temporal Hierarchical Causal ModelsTechnical
- SpatioTemporal Difference Network for Video Depth Super-ResolutionTechnical
- Spatiotemporal Transformers with Multiple Instance Learning for Label-Efficient Behavioral Analysis in Autism (Student Abstract)Technical
- Spatiotemporal-Untrammelled Mixture of Experts for Multi-Person Motion PredictionTechnical
- Speaker Anonymization for ChildrenTechnical
- SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language ModelsTechnical
- SpecDetect: Simple, Fast, and Training-Free Detection of LLM-Generated Text via Spectral AnalysisTechnical
- SpecDiff: Accelerating Diffusion Model Inference with Self-SpeculationTechnical
- SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs QuantizationTechnical
- Specification-Guided Reinforcement LearningTechnical
- Spectral Basis Learning for Expressive Graph Neural Networks in Link PredictionTechnical
- Spectral Property-Driven Data Augmentation for Hyperspectral Single-Source Domain GeneralizationTechnical
- Spectrally Adaptive Channel-aware Unrolling Network for Compressed SensingTechnical
- Speech Recognition Model Improves Text-to-Speech Synthesis Using Fine-Grained RewardTechnical
- Speech-Aware Long Context Pruning and Integration for Contextualized Automatic Speech RecognitionTechnical
- SphereDiff: Tuning-free 360° Static and Dynamic Panorama Generation via Spherical Latent RepresentationTechnical
- Spherical Geometry Diffusion: Generating High-quality 3D Face Geometry via Sphere-anchored RepresentationsTechnical
- SpiderGen: Towards Procedure Generation for Carbon Life Cycle Assessments with Generative AITechnical
- SpikCommander: A High-performance Spiking Transformer with Multi-view Learning for Efficient Speech Command RecognitionTechnical
- Spike Imaging Velocimetry: Dense Motion Estimation of Fluids Using Spike StreamsTechnical
- Spike Stream Memory Transfer for Dynamic Scene ReconstructionTechnical
- Spiking Heterogeneous Graph Attention NetworksTechnical
- Spiking-Aided Neural Architecture for Efficient and Robust WiFi SensingTechnical
- SpikingIR: A Novel Converted Spiking Neural Network for Efficient Image RestorationTechnical
- Spikingformer: A Key Foundation Model for Spiking Neural NetworksTechnical
- Splat-SAP: Feed-Forward Gaussian Splatting for Human-Centered Scene with Scale-Aware Point Map ReconstructionTechnical
- SplatSSC: Decoupled Depth-Guided Gaussian Splatting for Semantic Scene CompletionTechnical
- Splats in Splats: Robust and Effective 3D Steganography Towards Gaussian SplattingTechnical
- Split-Layer: Enhancing Implicit Neural Representation by Maximizing the Dimensionality of Feature SpaceTechnical
- Spontaneous Yet Predictable: Shapelet-Driven, Channel-Aware Intention Decoding from Multi-Region ECoGTechnical
- Stability-Aware Reinforcement Learning for Robust Class Integration Test Order GenerationTechnical
- Stabilizing Cross-Modal Bidirectional Attribution: Few-Shot Adversarial Prompt Tuning for Robust Vision-Language ModelsTechnical
- Stabilizing Policy Gradient Methods via Reward ProfilingTechnical
- Stabilizing Self-Consuming Diffusion Models with Latent Space FilteringTechnical
- Stabilizing Spiking Neurons Through Biologically Inspired PolarizationTechnical
- Stable Voting and the Splitting of CyclesTechnical
- Stable and Adaptive Fusion for Multi-domain Multi-task RecommendationTechnical
- Stage-Aware Graph Contrastive Learning with Node-oriented Mixture of ExpertsTechnical
- Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual GroundingTechnical
- State Mamba: Spatiotemporal EEG State-Space Model with Dynamic Brain Alignment for Cross-Subject RepresentationTechnical
- State Proficiency-Based Adaptive Fine-Tuning for Offline-to-Online Reinforcement LearningTechnical
- State-Derivative-Aware Neural Controlled Differential Equations for Multivariate Time Series Anomaly Detection and DiagnosisTechnical
- State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal ModelsTechnical
- Stationary and Clustering Transformer Hashing for Cross-modal RetrievalTechnical
- Statistical Learning Theory for Distributional ClassificationTechnical
- Statistically Robust Sparse High-order Interaction ModelTechnical
- SteerMusic: Enhanced Musical Consistency for Zero-shot Text-Guided and Personalized Music EditingTechnical
- Steering One-Step Diffusion Model with Fidelity-Rich Decoder for Fast Image CompressionTechnical
- Steering Pretrained Drafters During Speculative DecodingTechnical
- Steering Representations, Safeguarding Privacy: A Cross-Modal Privacy Protection Method for Generative AITechnical
- Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)Technical
- Steering Visuomotor Policy in Open Worlds via Cross-View Goal AlignmentTechnical
- StegaVAR: Privacy-Preserving Video Action Recognition via Steganographic Domain AnalysisTechnical
- Step Back to Leap Forward: Self-Backtracking for Symbolic Reasoning and Planning in Language ModelsTechnical
- Step-GRPO: Enhancing Reasoning Quality and Efficiency via Structured PRM-Based Reinforcement LearningTechnical
- Step-by-step Layered Design GenerationTechnical
- StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs Through Knowledge-Reasoning FusionTechnical
- Stepwise Contrastive Reasoning for Retrieval-Augmented Generation over Knowledge GraphsTechnical
- Steve: Your Personal AI Career CoachTechnical
- Stochastic Decentralized Optimization of Non-Smooth Convex and Convex-Concave Problems over Time-Varying NetworksTechnical
- Stochastic Universal Adversarial Perturbations with Fixed Optimization Constraint and Ensured High-probability TransferabilityTechnical
- Stop Mixing Things Up! BISCUIT Teaches Vision-Language Models to Learn New Concepts from Images on the SpotTechnical
- StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language ModelsTechnical
- Strategic Reasoning over Golog Programs in the Nondeterministic Situation CalculusTechnical
- Strategic Tool Enhanced AI Agent for Multi-Issue Negotiation (Student Abstract)Technical
- Stratified Knowledge-Density Super-Network for Scalable Vision TransformersTechnical
- Stratos: An End-to-End Distillation Pipeline for Customized LLMs Under Distributed Cloud EnvironmentsTechnical
- StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and CompressionTechnical
- StreamSTGS: Streaming Spatial and Temporal Gaussian Grids for Real-Time Free-Viewpoint VideoTechnical
- Streaming Generated Gaussian Process Experts for Online Learning and ControlTechnical
- Streaming Generation of Co-Speech Gestures via Accelerated Rolling DiffusionTechnical
- StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion ModelTechnical
- Strip R-CNN: Large Strip Convolution for Remote Sensing Object DetectionTechnical
- StrokeFusion: Vector Sketch Generation via Joint Stroke-UDF Encoding and Latent Sequence DiffusionTechnical
- Structural Approach to Guiding a Present-Biased AgentTechnical
- Structural Entropy Guided Incremental Learning for Open-World Multimodal Social Event DetectionTechnical
- Structure Detection for Contextual Reinforcement LearningTechnical
- Structure-Aware Encodings of Argumentation Properties for Clique-widthTechnical
- Structure-Enhanced Adapter for Self-Supervised Heterogeneous Graph LearningTechnical
- Structure-based RNA Design by Step-wise Optimization of Latent Diffusion ModelTechnical
- Structures Meet Semantics: Multimodal Fusion via Graph Contrastive LearningTechnical
- Studying Classifier(-Free) Guidance from a Classifier-Centric PerspectiveTechnical
- Style-First Authorship Verification for Academic Integrity in the Generative AI Era (Student Abstract)Technical
- Style4D-Bench: A Benchmark Suite for 4D StylizationTechnical
- StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio JailbreakTechnical
- StyleDrive: Towards Driving-Style Aware Benchmarking of End-To-End Autonomous DrivingTechnical
- StyleFM: Frequency Manipulation Empowered by Recursive Attention on Diffusion Models for Arbitrary Style TransferTechnical
- StyleProto: Style-Augmented Prototype Learning for Cross-Domain Few-Shot Object DetectionTechnical
- StyleSentinel: Reliable Artistic Copyright Verification via Stylistic FingerprintsTechnical
- StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative FeedbackTechnical
- Sub-MoE: Efficient Mixture-of-Expert LLMs Compression via Subspace Expert MergingTechnical
- SubGCache: Accelerating Graph-based RAG with Subgraph-level KV CacheTechnical
- Subgraph Encoding with Bicentric Sphere Node Labeling and Pooling for Link PredictionTechnical
- Subspace-Aware Graph Construction and Contrastive Alignment for Multimodal Recommendation with Large Language ModelsTechnical
- Suit the Remedy to the Retriever: Interpretable Query Optimization with Retriever Preference Alignment for Vision-Language RetrievalTechnical
- Super Level Sets and Exponential Decay: A Synergistic Approach to Stable Neural Network Training (Abstract Reprint)Technical
- Superior Runtime Guarantees for the MOEA/D Multi-Objective Optimizer via Weighted-Sum DecompositionTechnical
- Supervised Dynamic Dimension Reduction with Deep Neural NetworkTechnical
- SurgPub-Video: A Comprehensive Surgical Video Framework for Enhanced Surgical Intelligence in Vision-Language ModelTechnical
- Surgical AI Copilot: Energy-Based Fourier Gradient Low-Rank Adaptation for Surgical LLM Agent Reasoning and PlanningTechnical
- Surrogate as Teacher: Distillation-Guided Graph Poisoning AttackTechnical
- SwiftVideo: A Unified Framework for Few-Step Video Generation Through Trajectory-Distribution AlignmentTechnical
- Syllogism-Inspired TableQA: Evidentialization Makes Decomposition Reasoning and Answer Verification More ReliableTechnical
- SymGS: Leveraging Reflective Symmetries for 3DGS CompressionTechnical
- Symbolic Planning and Multi-Agent Path Finding in Extremely Dense Environments with Unassigned AgentsTechnical
- Symbolic Task Inference in Deep Reinforcement Learning (Abstract Reprint)Technical
- Symmetric Aggregation of Conformity Scores for Efficient Uncertainty SetsTechnical
- Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative ModelsTechnical
- Symmetries and Other Variations of “End-Recursive” HTN Problems: Mapping the Border Between Decidable and Undecidable RestrictionsTechnical
- Symmetry Breaking for Inductive Logic ProgrammingTechnical
- Symmetry-Aware Transformer Training for Automated PlanningTechnical
- Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-ExpertsTechnical
- SynWeather: Weather Observation Data Synthesis Across Multiple Regions and Variables via a General Diffusion TransformerTechnical
- SyncBrain: Exploring Brain Functional Dynamics Through Neural Oscillatory SynchronizationTechnical
- SynerDetect: Hierarchical Synergistic Learning for Generalizable AI-Generated Image DetectionTechnical
- Synergizing Multigrid Algorithms with Vision Transformer: A Novel Approach to Enhance the Seismic Foundation ModelTechnical
- Synthetic Forgetting Without Access: A Few-Shot Zero-Glance Framework for Machine UnlearningTechnical
- Synthetic-to-Real Transfer Learning for League of Legends Minimap Object Detection (Student Abstract)Technical
- System L: Toward System 2-Style Legal ReasoningTechnical
- S²Drug: Bridging Protein Sequence and 3D Structure in Contrastive Representation Learning for Virtual ScreeningTechnical
- S²Flow: Towards Fast and Authentic Training-Free High-Resolution Video GenerationTechnical
- S²HyRec: Self-Supervised Hypergraph Sequential RecommendationTechnical
- S²Teacher: Step-by-step Teacher for Sparsely Annotated Oriented Object DetectionTechnical
- S³-MSD: Large Vision-Language Model for Explainable and Generalizable Multi-modal Sarcasm DetectionTechnical
- S³: Spiking Neurons as an Isolating Segmenter for Brain Signal DecodingTechnical
- T-APT: Text-Guided Modality-Aware Prompt Tuning for Arbitrary Multimodal Remote Sensing Data Joint ClassificationTechnical
- T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low BitratesTechnical
- T-LoRA: Single Image Diffusion Model Customization Without OverfittingTechnical
- T-Retriever: Tree-based Hierarchical Retrieval Augmented Generation for Textual GraphsTechnical
- T-Rex-Omni: Integrating Negative Visual Prompt in Generic Object DetectionTechnical
- T-SKM-Net: Trainable Neural Network Framework for Linear Constraint Satisfaction via Sampling Kaczmarz-Motzkin MethodTechnical
- T2Agent: A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree SearchTechnical
- T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image ModelTechnical
- T3Time: Tri-Modal Time Series Forecasting via Adaptive Multi-Head Alignment and Residual FusionTechnical
- T3former: Temporal Graph Classification with Topological Machine LearningTechnical
- T4NMTD: Transition-Centric Reinforcement Learning for Non-Markovian Task DecompositionTechnical
- TAPO: Dynamic Teacher and Perturbed Answer Injection for Policy OptimizationTechnical
- TARA: Token-Aware LoRA for Composable Personalization in Diffusion ModelsTechnical
- TASE: Token Awareness and Structured Evaluation for Multilingual Language ModelsTechnical
- TAdaRAG: Task Adaptive Retrieval-Augmented Generation via On-the-Fly Knowledge Graph ConstructionTechnical
- TCoT: Trajectory Chain-of-Thoughts for Robotic Manipulation with Failure Recovery in Vision-Language-Action ModelTechnical
- TDSNNs: Competitive Topographic Deep Spiking Neural Networks for Visual Cortex ModelingTechnical
- TDSS: Task Dynamic-Synergistic Skill Adaptation for Boosting Efficient and Scalable Multi-Task Learning in Dense Visual PredictionTechnical
- TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT AlignmentTechnical
- TFD-Net: Towards Intelligent Time-Frequency Mode Decomposition with Practical ApplicationsTechnical
- TFRank: Think-Free Reasoning Enables Practical Pointwise LLM RankingTechnical
- TG-Field: Geometry-Aware Radiative Gaussian Fields for Tomographic ReconstructionTechnical
- TGCA-LLM: Time-Aware Graph-Text Contrastive Alignment for Enhancing LLMs in Temporal Knowledge Graph CompletionTechnical
- TGCD: A Framework for Generalized Category Discovery in Time-Series DataTechnical
- TGDD: Trajectory Guided Dataset Distillation with Balanced DistributionTechnical
- THGB: A Comprehensive Benchmark for Text-attributed Heterogeneous GraphsTechnical
- TIDE: Temporal-Aware Sparse Autoencoders for Interpretable Diffusion Transformers in Image GenerationTechnical
- TIM++: Transductive Information Maximization for Few-Shot CLIPTechnical
- TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization AbilityTechnical
- TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMsTechnical
- TIV: Thought Injection via Vectors for Efficient Reasoning in Large Reasoning ModelsTechnical
- TLAGC: Taylor Linear Attention-Guided Graph Convolutions for Revealing Spatial Domains in Spatial Multi-Omics DataTechnical
- TMAE:Learning Targeted Multi-Agent Exploration via Causal InferenceTechnical
- TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy ModalitiesTechnical
- TO-GATE: Clarifying Questions and Summarizing Responses with Trajectory Optimization for Eliciting Human PreferenceTechnical
- TOFA: Training-Free One-Shot Federated Adaptation for Vision-Language ModelsTechnical
- TOP-RL: Task-Optimized Progressive Token Pruning with Reinforcement Learning for Vision Language ModelsTechnical
- TOPOGRAPH: Topology-Preserving Graph Reduction with Adaptive Structure for Persistent HomologyTechnical
- TORA: Train Once, Realign Anytime for Offline Multi-Objective Reinforcement LearningTechnical
- TOSC: Task-Oriented Shape Completion for Open-World Dexterous Grasp Generation from Partial Point CloudsTechnical
- TPR: A Training Procedure Representation to Augment XR Simulations with LLMsTechnical
- TR-DQ: Time-Rotation Diffusion QuantizationTechnical
- TRACE: A Generalizable Drift Detector for Streaming Data-Driven OptimizationTechnical
- TRACE: Textual Relevance Augmentation and Contextual Encoding for Multimodal Hate DetectionTechnical
- TRACE: Trajectory-based Activation Change Estimation for Task-specific Data SelectionTechnical
- TRACE: Transformation-Aware Graph Refinement for Reaction Condition PredictionTechnical
- TRIPLE: Theory-Driven Integration of Planned and Habitual Behaviors for LLM-based PersonalizationTechnical
- TRT: Harnessing Tensor Ring Transformer for Hyperspectral Image Super-ResolutionTechnical
- TRUST: Leveraging Text Robustness for Unsupervised Domain AdaptationTechnical
- TRUST: Transaction Risk via Unified Sequence and TopologyTechnical
- TSBOW – Traffic Surveillance Benchmark for Occluded Vehicles Under Various Weather ConditionsTechnical
- TSGDiff: Rethinking Synthetic Time Series Generation from a Pure Graph PerspectiveTechnical
- TSPE-GS: Probabilistic Depth Extraction for Semi-Transparent Surface Reconstruction via 3D Gaussian SplattingTechnical
- TSPO: Temporal Sampling Policy Optimization for Long-form Video Language UnderstandingTechnical
- TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio ModelsTechnical
- TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action ModelsTechnical
- TTF: A Trapezoidal Temporal Fusion Framework for LTV Forecasting in DouyinTechnical
- TTVAE: Transformer-Based Generative Modeling for Tabular Data Generation (Abstract Reprint)Technical
- TVChain: Leveraging Textual-Visual Prompt Chains for Jailbreaking Large Vision-Language ModelsTechnical
- TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement LearningTechnical
- TWINFUZZ: Dual-Model Fuzzing for Robustness Generalization in Deep LearningTechnical
- TWiST: Temporal Weakly-Supervised Triplets Recognition in Surgical Videos (Student Abstract)Technical
- TaREx: Reinforcement Learning for Code-Driven Table ReasoningTechnical
- Tab-PET: Graph-Based Positional Encodings for Tabular TransformersTechnical
- TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token FocusingTechnical
- TabGeoFlow: A Geometric Flow Matching Model for Tabular Data SynthesisTechnical
- Tabular Learnwares Can Be Repurposed for Seemingly Irrelevant New TasksTechnical
- Tackling Dual-stage Missing Modalities in Brain Tumor Segmentation via Robust Modality Reconstruction and Prompt-guided Modality AdaptationTechnical
- Tackling Resource-Constrained and Data-Heterogeneity in Federated Learning with Double-Weight Sparse PackTechnical
- TacpAgent: Enhancing Student Engagement in Classroom Exercises Through LLM-Generated FeedbackTechnical
- TactGen: Tactile Sensory Data Generation via Zero-Shot Sim-to-Real Transfer (Abstract Reprint)Technical
- Tailored ViT Slimming: Budget-Aware Multi-Dimensional Sparsity Regularization for Vision Transformers Pruning (Student Abstract)Technical
- Talk, Snap, Complain: Validation-Aware Multimodal Expert Framework for Fine-Grained Customer GrievancesTechnical
- Talk2Code: A Multi-Turn Interaction Benchmark with Dual-Track Evaluation for Code GenerationTechnical
- Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and EditingTechnical
- Talking Trails: LLM-Enhanced Spatiotemporal Trajectory Modeling for E-Bike Delivery Route PlanningTechnical
- Talon: Breaking the Synchronization Barrier in Speculative Decoding with Hybrid Model-based and Retrieve-based DraftingTechnical
- Taming Cascaded Mixture-of-Experts for Modality-missing Multi-modal Salient Object DetectionTechnical
- Taming the Phantom: Token-Asymmetric Filtering for Hallucination Mitigation in Large Vision-Language ModelsTechnical
- Tapas Are Free! Training-Free Adaptation of Programmatic Agents via LLM-Guided Program Synthesis in Dynamic EnvironmentsTechnical
- TarPro: Targeted Protection Against Malicious Image EditingTechnical
- Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability PerspectiveTechnical
- Target-Balanced Score DistillationTechnical
- TargetVAU: Multimodal Anomaly-Aware Reasoning for Target Behavior Understanding in VideosTechnical
- Targeted Data Protection for Diffusion Model by Matching Training TrajectoryTechnical
- Targeted Pathway Inference for Biological Knowledge Bases via Graph Learning and ExplanationTechnical
- Targeting Borderline Fraudsters: Multi-View Hypergraph Fraud Detection with LLM-Guided Contrastive LearningTechnical
- Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM AlignmentTechnical
- Targeting in Multi-Criteria Decision MakingTechnical
- Task Prototype-Based Knowledge Retrieval for Multi-Task Learning from Partially Annotated DataTechnical
- Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric RefinementTechnical
- Task-Aware Meta-Learning on Heterogeneous Knowledge Graph for POI RecommendationTechnical
- Task-Aware Retrieval Augmentation for Dynamic RecommendationTechnical
- Task-Specific Distance Correlation Matching for Few-Shot Action RecognitionTechnical
- TawPipe: Topology-Aware Weight Pipeline Parallelism for Accelerating Long-Context Large Models TrainingTechnical
- TaxReasoning: Benchmarking Knowledge-Intensive Mathematical Reasoning with Evolving Tax LawsTechnical
- Teach AI What It Doesn’t KnowTechnical
- Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement LearningTechnical
- TechCoach: Towards Technical-Point-Aware Descriptive Action CoachingTechnical
- Tell as You Want: Customizing Image Narrative with Knowledge and ThoughtsTechnical
- Template-Theorems Graph Construction to Enhance Mathematical Reasoning Capabilities of LLMTechnical
- Temporal Calibrating and Distilling for Scene-Text Aware Text-Video RetrievalTechnical
- Temporal Dynamics Enhancer for Directly Trained Spiking Object DetectorsTechnical
- Temporal Inconsistency Guidance for Super-resolution Video Quality AssessmentTechnical
- Temporal Object-Aware Vision Transformer for Few-Shot Video Object DetectionTechnical
- Temporal Properties of Conditional Independence in Dynamic Bayesian NetworksTechnical
- Temporal and Spatial Representation Learning for Multimodal Low-Beam 3D Object DetectionTechnical
- Temporal-Consistent Video Restoration with Pre-trained Diffusion ModelsTechnical
- Tensor Decomposition and Language Description for Open-Vocabulary Object DetectionTechnical
- Tensorized Label Learning via Balanced Tensor RegressionTechnical
- TermGPT: Multi-Level Contrastive Fine-Tuning for Terminology Adaptation in Legal and Financial DomainsTechnical
- Test-Time Preference Optimization for Image RestorationTechnical
- Test-Time Reinforcement Learning for GUI Grounding via Region ConsistencyTechnical
- Test-driven Reinforcement Learning in Continuous ControlTechnical
- Test-time Diverse Reasoning by Riemannian Activation SteeringTechnical
- Test-time Prompt InterventionTechnical
- Testing Under Strategic Manipulation: Mechanism Design for Human and AI InstitutionsTechnical
- Text-Guided Channel Perturbation and Pre-Trained Knowledge Integration for Unified Multi-Modality Image FusionTechnical
- Text-Guided Gradient Refinement: Resolving Multimodal Gradient Conflicts to Boost Adversarial Attacks on Vision-Language ModelsTechnical
- Text-based Aerial-Ground Person RetrievalTechnical
- Text-guided Controllable Diffusion for Realistic Camouflage Images GenerationTechnical
- Text-to-Scene with Large Reasoning ModelsTechnical
- TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text RenderingTechnical
- TextShield-R1: Reinforced Reasoning for Tampered Text DetectionTechnical
- Textual Self-Attention Network: Test-Time Preference Optimization Through Textual Gradient-Based AttentionTechnical
- Textured Geometry Evaluation: Perceptual 3D Textured Shape Metric via 3D Latent-Geometry NetworkTechnical
- The Alignment Game: A Theory of Long-Horizon Alignment Through Recursive CurationTechnical
- The Avengers: A Routing Recipe for Collective Intelligence in Language ModelsTechnical
- The Confidence Trap: Gender Bias and Predictive Certainty in LLMsTechnical
- The Correspondence Between Bounded Graph Neural Networks and Fragments of First-Order LogicTechnical
- The Cost and Complexity of Minimizing Envy in House Allocations (Abstract Reprint)Technical
- The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language ModelsTechnical
- The Emotional Baby Is Truly Deadly: Does Your Multimodal Large Reasoning Model Have Emotional Flattery Towards Humans?Technical
- The Essentials of AI for Life and Society: A Full-Scale AI Literacy Course Accessible to AllTechnical
- The Finer the Better: Towards Granular-aware Open-set Domain GeneralizationTechnical
- The Fixed-Point of Distrust: A Formal Theory of Perceived Systemic IncompetenceTechnical
- The Future Is Neuro-Symbolic: Where Has It Been, and Where Is It Going?Technical
- The GATTACA Framework: Graph Neural Network-Based Reinforcement Learning for Controlling Biological NetworksTechnical
- The Illusion of Fairness: Auditing Fairness Interventions in Algorithmic Hiring with Audit StudiesTechnical
- The Last Byte: Learning Just Enough for Machine-Oriented Image CompressionTechnical
- The Limitations and Power of NP-Oracle Based Functional Synthesis TechniquesTechnical
- The Other Mind: How Language Models Exhibit Human Temporal CognitionTechnical
- The Power of Initial Investigation in Audit GamesTechnical
- The Publication Choice ProblemTechnical
- The River Voting MethodTechnical
- The Search for Stability: Learning Dynamics of Strategic Publishers with Initial Documents (Abstract Reprint)Technical
- The Semantic Architect: How FEAML Bridges Structured Data and LLMs for Multi-Label TasksTechnical
- The Shepherd Test: How Will Super Intelligent Agents Balance Care and Control in Asymmetric Relationships?Technical
- The Silent Amplifier: In-Context Examples Fuel Bias in Large Language ModelsTechnical
- The Strong Lottery Ticket Hypothesis for Multi-Head Attention MechanismsTechnical
- The Structure-Equivalent Prior: Unifying Temporal Dynamics and 3D Evolution in 4D Latent SpaceTechnical
- The Tatort Test of Intelligence: Towards Narrative Comprehension as a Benchmark for AITechnical
- The Visual Prism: Refracting Images into Parallel Multilingual Descriptions with Structured Visual GuidanceTechnical
- Themis: Automated Constraint-Aware Test Synthesis Framework for Code Reinforcement LearningTechnical
- Theoretical Guarantees for Domain Adaptation with Hierarchical Optimal Transport (Abstract Reprint)Technical
- Theoretical and Empirical Analysis of Lehmer Codes to Search Permutation Spaces with Evolutionary AlgorithmsTechnical
- Theory-of-Mind in Partially Observed, Mixed-Motive GamesTechnical
- Thermal-Physics Guided Infrared Image Super-Resolution with Dynamic High-Frequency AmplificationTechnical
- Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual SegmentationTechnical
- Think How Your Teammates Think: Active Inference Can Benefit Decentralized ExecutionTechnical
- Think Then Rewrite: Reasoning Enhanced Query Rewriting for Domain Specific RetrievalTechnical
- Think Wise, Collaborate Effectively: A Rationale-Aware LLM-Based Recommender with Reinforcement Learning from Collaborative SignalsTechnical
- Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-MakingTechnical
- Think-J: Learning to Think for Generative LLM-as-a-JudgeTechnical
- Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn InteractionTechnical
- Thinking Aesthetics Assessment of Image Color Temperature: Models, Datasets and BenchmarksTechnical
- Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented ReasoningTechnical
- Thinking Through the Hands: An Exploratory Study of Hand Movements to Assess Students Problem-Solving in Mechanistic Reasoning TasksTechnical
- Through the Water: Refractive Gaussian Splatting for Water Surface ScenesTechnical
- TiCAL:Typicality-Based Consistency-Aware Learning for Multimodal Emotion RecognitionTechnical
- Tight Robustness Certification Through the Convex Hull of ℓ₀ AttacksTechnical
- Tighter Truncated Rectangular Prism Approximation for RNN Robustness VerificationTechnical
- TileGS: Adaptive Gaussian Densification Through Tile-Guided Perceptual AnalysisTechnical
- Time Series Class-Incremental Learning via Confidence-guided Mask Distillation and Prototype-guided Contrastive LearningTechnical
- Time Series Forecasting via Direct Per-Step Probability Distribution ModelingTechnical
- Time Shuffle: A Transferability-Booster for Multiple Audio Adversarial TasksTechnical
- Time-Frequency Augmented Multi-level Contrastive Clustering for Time SeriesTechnical
- Time-Frequency Token Advantage Clipping for Training Efficient Large Reasoning ModelTechnical
- Time-Series Anomaly Detection with Graph-Based Self-Supervised Learning and Foundation Models: Towards Real-World ApplicationsTechnical
- Time2Agri: Temporal Pretext Tasks for Agricultural MonitoringTechnical
- TimeBill: Time-Budgeted Inference for Large Language ModelsTechnical
- TimeCAP: A Channel-Aware Pre-Training Framework for Multivariate Time Series ForecastingTechnical
- TimeMosaic: Temporal Heterogeneity Guided Time Series Forecasting via Adaptive Granularity Patch and Segment-wise DecodingTechnical
- Timestep-Compressed Attack on Spiking Neural Networks Through Timestep-Level BackpropagationTechnical
- TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction TasksTechnical
- To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal PerformanceTechnical
- ToC: Tree-of-Claims Search with Multi-Agent Language ModelsTechnical
- Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive ModelsTechnical
- Token-Context Attention for NLI: An Alternative to Self-AttentionTechnical
- TokenPowerBench: Benchmarking the Power Consumption of LLM InferenceTechnical
- Tokenize Once, Recommend Anywhere: Unified Item Tokenization for Multi-domain LLM-based RecommendationTechnical
- TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI AgentsTechnical
- Too Sure for Our Own Good: A User Study on AI Confidence and Human RelianceTechnical
- ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool learningTechnical
- ToolSmith: A Multi-Agent Framework for Enterprise Tool CreationTechnical
- Top-Down Semantic Refinement for Image CaptioningTechnical
- Topo-GraT: Learning to Grow with Causal Graph Transformers (Student Abstract)Technical
- Topological Federated Clustering via Gravitational Potential Fields Under Local Differential PrivacyTechnical
- Topology-Aware Vision Transformers for Enhanced Scene RecognitionTechnical
- Topology-Enhanced and Label Correlation-Aware Model for Protein-Protein Interaction PredictionTechnical
- Topology-Inspired Backward-Free Framework for Test-Time Adaptation in Medical DetectionTechnical
- Topology-aware Knowledge Preservation for Class-Incremental LearningTechnical
- TouchFormer: A Robust Transformer-based Framework for Multimodal Material PerceptionTechnical
- Toward Artificial MetacognitionTechnical
- Toward Better EHR Reasoning in LLMs: Reinforcement Learning with Expert Attention GuidanceTechnical
- Toward Causal Foundation World Models: From Representation to Decision-MakingTechnical
- Toward Controllable and Trustworthy LLM Reasoning: From Failure Mapping to Cognition-inspired Control and Real-world ImpactTechnical
- Toward Gaze Target Detection of Young Autistic ChildrenTechnical
- Toward Multimodal Fake News Detection by Multi-perspective Rationale Generation and VerificationTechnical
- Toward Real-World High-Precision Image Matting and SegmentationTechnical
- Toward Simulating Networked Societies with Formal Institutions Using AI AgentsTechnical
- Toward Time-Continuous Data Inference in Sparse Urban CrowdSensingTechnical
- Toward Trustworthy AI for Decision Making in Population HealthTechnical
- Toward the Frontiers of Reliable Diffusion Sampling via Adversarial Sinkhorn Attention GuidanceTechnical
- Towards 3D Object-Centric Feature Learning for Semantic Scene CompletionTechnical
- Towards Accurate 3D Object Detection in Adverse Weather by Leveraging 4D Radar for LiDAR Geometry EnhancementTechnical
- Towards Acyclic Preference Evaluation of Language Models via Multiple EvaluatorsTechnical
- Towards Adaptive Humanoid Control via Multi-Behavior Distillation and Reinforced Fine-TuningTechnical
- Towards Affordance-Aware Robotic Dexterous Grasping with Human-like PriorsTechnical
- Towards Agents That Exhibit Human-Like Autonomy in Complex EnvironmentsTechnical
- Towards Aligned and Efficient Large Language ModelsTechnical
- Towards Authentic Movie Dubbing with Retrieve-Augmented Director-Actor Interaction LearningTechnical
- Towards Automated Self-Supervised Learning for Truly Unsupervised Graph Anomaly Detection (Abstract Reprint)Technical
- Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic MethodologyTechnical
- Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language ModelsTechnical
- Towards Better Code Understanding in Decoder-Only Models with Contrastive LearningTechnical
- Towards Better Correctness and Efficiency in Code GenerationTechnical
- Towards Better IncomLDL: We Are Unaware of Hidden Labels in AdvanceTechnical
- Towards Capable and Secure Autonomous Computer-Use Agents (Student Abstract)Technical
- Towards Closed-Loop Embodied Empathy Evolution: Probing LLM-Centric Lifelong Empathic Motion Generation in Unseen ScenariosTechnical
- Towards Continually-Evolving AI: Selective and Expandable Multimodal Memory SystemTechnical
- Towards Data-Efficient Deep Learning for RNA 3D Structure Prediction and DesignTechnical
- Towards Distance-Invariant Radio Frequency Fingerprinting via Augmented Unsupervised LearningTechnical
- Towards Effective Code-Integrated ReasoningTechnical
- Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF BenchmarkTechnical
- Towards Effective and Efficient Context-aware Nucleus Detection in Histopathology Whole Slide ImagesTechnical
- Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation ModelsTechnical
- Towards Efficient Low-rate Image Compression with Frequency-aware Diffusion Prior RefinementTechnical
- Towards Efficient and Effective Interactive 3D SegmentationTechnical
- Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action ModelingTechnical
- Towards Explainable Video Camouflaged Object Detection: SAM2 with Eventstream-Inspired DataTechnical
- Towards Fairness in Transportation Gig Markets: Identifying, Imitating, and Mitigating Algorithm Discrimination via Deep Reinforcement LearningTechnical
- Towards Federated Clustering: A Client-wise Private Graph Aggregation FrameworkTechnical
- Towards Generalist Robot Learning from Internet Video: A Survey (Abstract Reprint)Technical
- Towards High Resolution Probabilistic Coastal Inundation Forecasting from Sparse ObservationsTechnical
- Towards High-Fidelity 3D Portrait Generation with Rich Details by Cross-View Prior-Aware DiffusionTechnical
- Towards High-Resolution 3D Anomaly Detection: A Scalable Dataset and Real-Time Framework for Subtle Industrial DefectsTechnical
- Towards Human-centered Proactive Conversational AITechnical
- Towards Illumination-Aware Restoration of Metalens-Captured Images: A New Dataset and a Strong BaselineTechnical
- Towards Inclusive AI: Advancing Multilingual Large Language ModelsTechnical
- Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic SpaceTechnical
- Towards Long-window Anchoring in Vision-Language Model DistillationTechnical
- Towards Multimodal Continual Knowledge Embedding with Modality Forgetting ModulationTechnical
- Towards Multiple Missing Values-resistant Unsupervised Graph Anomaly DetectionTechnical
- Towards Non-Stationary Time Series Forecasting with Temporal Stabilization and Frequency DifferencingTechnical
- Towards Nonlinear Sparse AUC Maximization via Compositional Stochastic Hard ThresholdingTechnical
- Towards OOD Generalization in Dynamic Graphs via Causal Invariant LearningTechnical
- Towards Offline Imitation Learning: Strictly Batch Settings, Generalization, and Variability in ExpertiseTechnical
- Towards Privacy-Protected Generalized Gaze Estimation Using Diffusion Models and Domain Stability Adaptation FrameworkTechnical
- Towards Provably Secure and Highly Robust Generative Image Steganography Leveraging Latent Diffusion ModelTechnical
- Towards Provably Unlearnable Examples via Bayes Error OptimizationTechnical
- Towards Real-Time Neutral Atom Array Assembly via Unsupervised Hologram Generation and Path OptimizationTechnical
- Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent PerformanceTechnical
- Towards Robust Edge Model Adaptation via Elastic Architecture SearchTechnical
- Towards Robust Event-Based Depth Estimation: Bridging Synthetic and Real Domains with Motion AdaptationTechnical
- Towards Robust Human–AI Decision-Making via Learning-to-DeferTechnical
- Towards Robust Text-Attributed Federated Graph Learning: Multimodal Threats and DefenseTechnical
- Towards Robust and Interpretable Event–Frame Fusion for Autonomous DrivingTechnical
- Towards Robust, Reliable, and Generalized Medical AITechnical
- Towards Scalable Web Accessibility Audit with MLLMs as CopilotsTechnical
- Towards Single Exponential Time for Temporal and Spatial Reasoning: A Study via Redundancy and Dynamic ProgrammingTechnical
- Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion ModelsTechnical
- Towards Synthesizing High-Dimensional Tabular Data with Limited SamplesTechnical
- Towards Temporal Fusion Beyond the Field of View for Camera-based Semantic Scene CompletionTechnical
- Towards Test-time Efficient Visual Place Recognition via Asymmetric Query ProcessingTechnical
- Towards Training-Free and Accurate ANN-to-SNN Conversion via Activation-Aware RedistributionTechnical
- Towards Trustworthy Multimodal AI SystemsTechnical
- Towards Ultrasound-based Reliable Disease Diagnosis Using Causal InferenceTechnical
- Towards Understanding Generalization in DP-GD: A Case Study in Training Two-Layer CNNsTechnical
- Towards Understanding In-Context Learning of Transformers Under Non-I.I.D. ScenariosTechnical
- Towards Unified Vision-Language Models with Incomplete Multi-Modal InputsTechnical
- Towards Zero-Shot Diabetic Retinopathy Grading: Learning Generalized Knowledge via Prompt-Driven Matching and EmulatingTechnical
- Towards a Common Framework for AutoformalizationTechnical
- Towards a Rigorous Understanding of the Population Dynamics of the NSGA-III: Tight Runtime BoundsTechnical
- Towards an Ontology-Driven Approach to Document Bias (Abstract Reprint)Technical
- TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as AgentsTechnical
- TraceTrans: Translation and Spatial Tracing for Surgical PredictionTechnical
- Tracing the Heart’s Pathways: ECG Representation Learning from a Cardiac Conduction PerspectiveTechnical
- TrackGS: Optimizing COLMAP-Free 3D Gaussian Splatting with Global Track ConstraintsTechnical
- Tracking and Segmenting Anything in Any ModalityTechnical
- Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured VideosTechnical
- Tractable Sharpness-Aware Learning of Probabilistic CircuitsTechnical
- Tractable Weighted First-Order Model Counting with Bounded Treewidth Binary EvidenceTechnical
- Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational CapabilitiesTechnical
- Traffic Signal Plans Explorer: A General Framework for Visualising Traffic EvolutionTechnical
- Trainable EEG Interpolation and Structure-Sharing Dual-Path Encoders for Brain-Assisted Target Speaker ExtractionTechnical
- Training and Inference Within 1 Second – Tackle Cross-Sensor Degradation of Real-World Pansharpening with Efficient Residual Feature TailoringTechnical
- Training-Free ANN-to-SNN Conversion for High-Performance Spiking TransformersTechnical
- Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward FeedbackTechnical
- Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object MemoryTechnical
- Training-free Boosting for Few-shot Segmentation via Generalizing Semantic MiningTechnical
- TrajAgg: Dual-Scale Feature Aggregation with Hybrid Training for Trajectory Similarity Computation in Free SpaceTechnical
- TrajEvo: Trajectory Prediction Heuristics Design via LLM-driven EvolutionTechnical
- TransFR: Transferable Federated Recommendation with Adapter Tuning on Pre-trained Language ModelsTechnical
- TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language ModelTechnical
- Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video ApproachTechnical
- Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial PerturbationTechnical
- Transferable Graph Condensation from the Causal PerspectiveTechnical
- Transferable Hypergraph Attack via Injecting Nodes into Pivotal HyperedgesTechnical
- Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong GeneralizationTechnical
- Transferable RL for Real-World Navigation Using Semantic Segmentation and Bird’s-Eye View AbstractionTechnical
- Transferring Causal Driving Patterns for Generalizable Traffic Simulation with Diffusion-Based DistillationTechnical
- Transform-Free Feature Coding via Entropy-Constrained Vector QuantizationTechnical
- Transformer with Controlled Attention for Synchronous Motion CaptioningTechnical
- Transformers in Pseudo-Random Number Generation: A Dual Perspective on Theory and PracticeTechnical
- Transolver Is a Linear Transformer: Revisiting Physics-Attention Through the Lens of Linear AttentionTechnical
- Transparent Networks for Multivariate Time SeriesTechnical
- Trauma THOMPSON: A Dataset and Realistic Generative Framework for AI Copilots in Emergency CareTechnical
- TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured ReasoningTechnical
- Treatment Stitching with Schrödinger Bridge for Enhancing Offline Reinforcement Learning in Adaptive Treatment StrategiesTechnical
- Tree-Based Stochastic Optimization for Solving Large-Scale Urban Network Security GamesTechnical
- TreeBridge: Aligning LLM Embeddings in Industrial Recommender SystemsTechnical
- TriFusion-IDS: A Multimodal Graph-Tabular-Text Contrastive Framework for Cross-Dataset Intrusion DetectionTechnical
- Trimming the Fat: Redundancy-Aware Acceleration Framework for DGNNsTechnical
- TrinityDNA: A Bio-Inspired Foundational Model for Efficient Long-Sequence DNA ModelingTechnical
- TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text EditingTechnical
- Truncated Counterfactual Learning for Anytime Multi-Agent Path FindingTechnical
- TrustEnergy: A Unified Framework for Accurate and Reliable User-level Energy Usage PredictionTechnical
- Trusted Multi-view Learning for Long-tailed ClassificationTechnical
- Trustworthy AI-Assisted Programming: Detection and Repair of Unreliable CodeTechnical
- Trustworthy Autonomy Without Human Intervention in Uncertain DomainsTechnical
- Trustworthy Classification for Complex Social Surveys: A Memory-Enhanced Hierarchical Framework with Calibrated UncertaintyTechnical
- Truth, Justice, and Secrecy: Cake Cutting Under Privacy ConstraintsTechnical
- Truth-Tracking Evaluation in Opinion-Based ArgumentationTechnical
- TruthfulRAG: Resolving Factual-level Conflicts in Retrieval-Augmented Generation with Knowledge GraphsTechnical
- TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video GroundingTechnical
- TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-TuningTechnical
- Tuning Medical Foundation Models for Inner Ear Temporal CT Analysis with Plug-and-play Domain Knowledge AggregatorTechnical
- Tuning for Two Adversaries: Enhancing the Robustness Against Transfer and Query-Based Attacks Using Hyperparameter TuningTechnical
- Tuning-Free Amodal Segmentation via the Occlusion-Free Bias of Inpainting ModelsTechnical
- TuningIQA: Fine-Grained Blind Image Quality Assessment for Livestreaming Camera TuningTechnical
- Turbo-VAED: Fast and Stable Transfer of Video-VAEs to Mobile DevicesTechnical
- TweezeEdit: Consistent and Efficient Image Editing with Path RegularizationTechnical
- Two Constraint Compilation Methods for Lifted PlanningTechnical
- Two Heads Are Better than One: Distilling Large Language Model Features into Small Models with Feature Decomposition and MixtureTechnical
- U2B: Scale-unbiased Representation Converter for Graph Classification with Imbalanced and Balanced Scale DistributionsTechnical
- U2UData+: A Scalable Swarm UAVs Autonomous Flight Dataset for Embodied Long-horizon TasksTechnical
- UAV4D: Dynamic Neural Rendering of Human-Centric UAV Imagery Using Gaussian SplattingTechnical
- UCPO: A Universal Constrained Combinatorial Optimization Method via Preference OptimizationTechnical
- UDA: Unsupervised Debiasing Alignment for Pair-wise LLM-as-a-JudgeTechnical
- UDCH: Unsupervised Dynamic Weighted Cluster-cooperative Hashing for Cross-modal RetreivalTechnical
- UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement LearningTechnical
- UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text EditingTechnical
- UMNet: Uncertainty-guided Memory Network for Hyperspectral PansharpeningTechnical
- UNO! UNified Offline Training Paradigm for Learning Path RecommendationTechnical
- UNSEEN: Enhancing Dataset Pruning from a Generalization PerspectiveTechnical
- UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World ModelTechnical
- UQ-Bench: A Benchmark for Evaluating Multimodal LLMs on Underwater Image Quality AssessmentTechnical
- UQ-ViT: Harmonizing Extreme Activations with Hardware-Friendly Uniform Quantization in Vision TransformersTechnical
- URPO: A Unified Reward & Policy Optimization Framework for Large Language ModelsTechnical
- URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document UnderstandingTechnical
- USE: A Unified Model for Universal Sound Separation and ExtractionTechnical
- USPR: Learning a Unified Solver for Profiled RoutingTechnical
- UV-RGS: Relightable 3D Gaussian Splatting from Unposed Views Under Varied IlluminationsTechnical
- UVLM: Benchmarking Video Language Model for Underwater World UnderstandingTechnical
- UltraGen: High-Resolution Video Generation with Hierarchical AttentionTechnical
- Ultralight Polarity-Split Neuromorphic SNN for Event-Stream Super-ResolutionTechnical
- Unaligned UAV RGBT Tracking: A Largescale Benchmark and a Novel ApproachTechnical
- Unbiased Rectification for Sequential Recommender Systems Under Fake OrdersTechnical
- Uncertainty Quantification for Machine Learning: One Size Does Not Fit AllTechnical
- Uncertainty-Based Methods for Automated Process Reward Data Construction and Output Aggregation in Mathematical ReasoningTechnical
- Uncertainty-Guided View-Strength-Aware Feature Utilization for Multi-View ClassificationTechnical
- Uncertainty-Propelled Physics-MAE Fusion for Self-Supervised Diffusion-Weighted Image DenoisingTechnical
- Uncovering Bias Paths with LLM-guided Causal Discovery: An Active Learning and Dynamic Scoring ApproachTechnical
- Uncovering Hidden Degeneration: A Physics-Guided Bidirectional Inference Framework for Industrial Time Series PredictionTechnical
- Uncovering Pretraining Code in LLMs: A Syntax-Aware Attribution ApproachTechnical
- Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor AttacksTechnical
- Uncovering and Mitigating Destructive Multi-Embedding Attacks in Deepfake Proactive ForensicsTechnical
- Uncovering and Mitigating Transient Blindness in Multimodal Model EditingTechnical
- Under-Approximating Semantics in Clustered Assumption-Based ArgumentationTechnical
- Understanding Dynamic Scenes in Ego Centric 4D Point CloudsTechnical
- Understanding Interaction as You Need: Intention-Driven Pedestrian Behavior PredictionTechnical
- Understanding and Enhancing Differentiable Architecture Search from Information Bottleneck PerspectiveTechnical
- Understanding the Effects of GenAI as No-Code Alternative for Teaching Machine Learning WorkflowsTechnical
- Understanding the Impact of Proportionality in Approval-Based Multiwinner ElectionsTechnical
- Understanding the Management of Rape Trauma with AI and NeuroimagingTechnical
- UniABG: Unified Adversarial View Bridging and Graph Correspondence for Unsupervised Cross-View Geo-LocalizationTechnical
- UniAPO: Unified Multimodal Automated Prompt OptimizationTechnical
- UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and PerceptionTechnical
- UniC-Lift: Unified 3D Instance Segmentation via Contrastive LearningTechnical
- UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech GenerationTechnical
- UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic AlignmentTechnical
- UniHOI: Unified Human-Object Interaction Understanding via Unified Token SpaceTechnical
- UniHR: Hierarchical Representation Learning for Unified Knowledge Graph Link PredictionTechnical
- UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding LearningTechnical
- UniMGS: Unifying Mesh and 3D Gaussian Splatting with Single-Pass Rasterization and Proxy-Based DeformationTechnical
- UniMM-V2X: MoE-Enhanced Multi-Level Fusion for End-to-End Cooperative Autonomous DrivingTechnical
- UniMapGen: A Generative Framework for Large-Scale Map Construction from Multi-modal DataTechnical
- UniMo: Unified Motion Generation and Understanding with Chain of ThoughtTechnical
- UniScene-MoTion: Unified Scene & Motion-aware Diffusion Transition FrameworkTechnical
- UniSketch: A Unified Framework for Parametric Sketch Generation and Constraint PredictionTechnical
- UniVarFL: Uniformity and Variance Regularized Federated Learning for Heterogeneous Data (Student Abstract)Technical
- Unified Interaction Consistency Learning for Single-Source Domain-Generalized Object Detection in Urban SceneTechnical
- Unified Minimax Optimization Framework for Propensity Score Estimation in Debiased RecommendationTechnical
- Unified Mixture-of-Experts Framework for Joint Cardiac and Vascular Ultrasound Analysis and Report GenerationTechnical
- Unified Representation Causal Prompt Distillation for Re-Inference-Free Lifelong Person Re-IdentificationTechnical
- Unified Structural Factors for Transfer Learning Generalization with PAC-Bayesian GuaranteesTechnical
- Unified View Extraction with Low-Rankness and Smoothness Fusion for Multi-View Subspace ClusteringTechnical
- Unifying Channel Independence and Mixing: Multi-Scale Patch Recursion for Global–Local Representation Synergy in Multivariate Time Series ForecastingTechnical
- Unifying Locality of KANs and Feature Drift Compensation Projection for Data-Free Replay Based Continual Face Forgery DetectionTechnical
- Unifying Multi-View Knowledge for Graph Learning via Model CollaborationTechnical
- Unintended Misalignment from Agentic Fine-Tuning: Risks and MitigationTechnical
- Universal Adversarial Purification with DDIM Metric Loss for Stable DiffusionTechnical
- Universal Compressed Image Restoration via Codec-Aware Conditioning with Reinforcement LearningTechnical
- Universal EEG Epilepsy Detection via Evidential Multi-View De-BiasingTechnical
- Universal Learning of Stochastic Dynamics for Exact Belief Propagation Using Bernstein Normalizing FlowsTechnical
- Universal Safety Controllers with Learned PropheciesTechnical
- Unlearning in Cross-Modal Retrieval via Prior-Prototype Guided Partitioned DampeningTechnical
- Unleashing Semantic and Geometric Priors for 3D Scene CompletionTechnical
- Unleashing the Potential of Large Language Models for Text-to-Image Generation Through Autoregressive Representation AlignmentTechnical
- Unleashing the Power of Image-Tabular Self-Supervised Learning via Breaking Cross-Tabular BarriersTechnical
- Unlocking Dynamic Inter-Client Spatial Dependencies: A Federated Spatio-temporal Graph Learning Method for Traffic Flow ForecastingTechnical
- Unlocking Efficient Vehicle Dynamics Modeling via Analytic World ModelsTechnical
- Unlocking Multi-Modal Potentials for Link Prediction on Dynamic Text-Attributed GraphsTechnical
- Unlocking the Power of Large Multimodal Models for Robot Learning: Robustness, Generalization, and OpportunitiesTechnical
- Unnoticed Yet Effective: A Hybrid Physical Camouflage Framework Against DNNs and Human PerceptionTechnical
- Unpacking the Implicit Norm Dynamics of Sharpness-Aware Minimization in Tensorized ModelsTechnical
- Unplugged Activities on Machine Learning and Their Evaluation Through Mental States AttributionTechnical
- Unreal-MAP: Unreal-Engine-Based General Platform for Multi-agent Reinforcement LearningTechnical
- Unsupervised Combinatorial Probabilistic Reasoning: Probabilistic Coin Change ProblemTechnical
- Unsupervised Contrastive Learning for Efficient and Robust Spectral Shape MatchingTechnical
- Unsupervised Feature Selection Through Group DiscoveryTechnical
- Unsupervised Motion-Compensated Decomposition for Cardiac MRI Reconstruction via Neural RepresentationTechnical
- Unsupervised Multi-Parameter Inverse Solving for Reducing Ring Artifacts in 3D X-Ray CBCTTechnical
- Unsupervised Multi-View Visual Anomaly Detection via Progressive Homography-Guided AlignmentTechnical
- Unsupervised Semantic Discovery via Global and Local Semantic Alignment in Multimodal ClusteringTechnical
- Unsupervised Single-Channel Audio Separation with Diffusion Source PriorsTechnical
- Unveiling AI Safety in Fine-tuning Quantized ModelTechnical
- Unveiling the Attribute Misbinding Threat in Identity-Preserving ModelsTechnical
- Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal OptimizationTechnical
- Unveiling the Landscape of Clinical Depression Assessment: From Behavioral Signatures to Psychiatric ReasoningTechnical
- Uplift Modeling with Delayed Feedback: Identifiability and AlgorithmsTechnical
- Urban Incident Prediction with Graph Neural Networks: Integrating Government Ratings and Crowdsourced ReportsTechnical
- UrbanNav: Learning Language-Guided Embodied Urban Navigation from Web-Scale Human TrajectoriesTechnical
- UrbanPG: An Efficient Framework with Personalized Context and General Backbone Interaction for Urban Spatio-Temporal LearningTechnical
- Using Certifying Constraint Solvers for Generating Step-wise ExplanationsTechnical
- Using Constraint Solvers to Construct Binary Codes with Good Error Correction PerformanceTechnical
- Utilitarian Guarantees for the Method of Equal SharesTechnical
- V-Pruner: A Fast and Globally-informed Token Pruning Framework for Vision TransformerTechnical
- V2VLoc: Robust GNSS-Free Collaborative Perception via LiDAR LocalizationTechnical
- VAEVQ: Enhancing Discrete Visual Tokenization Through Variational ModelingTechnical
- VALIANT: Prompt Instability for Active Learning in Black-Box Medical ImagingTechnical
- VBF++: Variational Bayesian Fusion with Context-Aware Priors and Recommendation-Guided Adversarial Refinement for Multimodal Video RecommendationTechnical
- VCGD: Visual Clue Guided Decoding with Caption Model for Mitigating Hallucination in Multimodal Large Language ModelsTechnical
- VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality EvaluationTechnical
- VEDA: Generation of 3D Molecules via Variance-Exploding Diffusion with AnnealingTechnical
- VFCionX: Bridging Large and Small Models for Robust Vulnerability-Fixing Commit IdentificationTechnical
- VGD: Value-Guided Diffusion Toward High-Utility Medical Image SegmentationTechnical
- VGGS: VGGT-guided Gaussian Splatting for Efficient and Faithful Sparse-View Surface ReconstructionTechnical
- VGGTFace: Topologically Consistent Facial Geometry Reconstruction in the WildTechnical
- VIL2C: Value-of-Information Aware Low-Latency Communication for Multi-Agent Reinforcement LearningTechnical
- VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy RobustnessTechnical
- VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary ReconstructionTechnical
- VITA: Variational Pretraining of Transformers for Climate-Robust Crop Yield ForecastingTechnical
- VK-Det: Visual Knowledge Guided Prototype Learning for Open-Vocabulary Aerial Object DetectionTechnical
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action ModelTechnical
- VLHSA: Vision-Language Hierarchical Semantic Alignment for Jigsaw Puzzle Solving with Eroded Gaps (Student Abstract)Technical
- VMChill: A Dataset for Fine-Grained Visual-Musical SynergyTechnical
- VORTEX: Aligning Task Utility and Human Preferences Through LLM-Guided Reward ShapingTechnical
- VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language ModelsTechnical
- VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose EstimationTechnical
- VPN: Visual Prompt NavigationTechnical
- VPSentry: Semi-supervised Video Polyp Segmentation via Sentry-guided Long-term Prototype Fusion with Correlation Dynamic PropagationTechnical
- VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement LearningTechnical
- VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement LearningTechnical
- VRAgent-R1: Boosting Video Recommendation with MLLM-based Agents via Reinforcement LearningTechnical
- VSPO: Validating Semantic Pitfalls in Ontology via LLM-Based CQ GenerationTechnical
- VTD-CLIP: Video-to-Text Discretization via Prompting CLIPTechnical
- VTinker: Guided Flow Upsampling and Texture Mapping for High-Resolution Video Frame InterpolationTechnical
- VaccineRAG: Boosting Multimodal Large Language Models’ Immunity to Harmful RAG SamplesTechnical
- Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image GenerationTechnical
- Value-Driven Memory-Augmented Generation for Agentic LLMs: Towards Structured and Adaptive Knowledge UtilizationTechnical
- Variance Computation for Weighted Model Counting with Knowledge Compilation ApproachTechnical
- Variance Reduction via Resampling and Experience ReplayTechnical
- Variation-Bounded Loss for Noise-Tolerant LearningTechnical
- Variational OOD State Correction for Offline Reinforcement LearningTechnical
- VasoMIM: Vascular Anatomy-Aware Masked Image Modeling for Vessel SegmentationTechnical
- Veli: Unsupervised Method and Unified Benchmark for Low-Cost Air Quality Sensor CorrectionTechnical
- Venom: Liquid Diffusion-Guided Gradient Inversion for Breaking Differential Privacy in Federated LearningTechnical
- Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language ModelsTechnical
- VeriFlow: Modeling Distributions for Neural Network VerificationTechnical
- VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across DomainsTechnical
- Versatile Vision-Language Model for 3D Computed TomographyTechnical
- ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMsTechnical
- ViDia2Std: A Parallel Corpus and Methods for Low-Resource Vietnamese Dialect-to-Standard TranslationTechnical
- ViG-RAG: Video-aware Graph Retrieval-Augmented Generation via Temporal and Semantic Hybrid ReasoningTechnical
- ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative PruningTechnical
- ViTE: Virtual Graph Trajectory Expert Router for Pedestrian Trajectory PredictionTechnical
- ViType: High-Fidelity Visual Text Rendering via Glyph-Aware Multimodal DiffusionTechnical
- Video Camera Trajectory Editing with Generative Rendering from Estimated GeometryTechnical
- Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music GenerationTechnical
- Video Mirror Detection with the Motion-in-Depth CueTechnical
- Video SimpleQA: Towards Factuality Evaluation in Large Video Language ModelsTechnical
- Video Spatial Reasoning with Object-Centric 3D RolloutTechnical
- VideoChat-A1: Thinking with Long Videos by Chain-of-Shot ReasoningTechnical
- VideoSeg-R1:Reasoning Video Object Segmentation via Reinforcement LearningTechnical
- VietCheckMed: Explainable Regulatory Compliance Checking for Medical Advertisements on Vietnamese Social MediaTechnical
- View-on-Graph: Zero-Shot 3D Visual Grounding via Vision-Language Reasoning on Scene GraphsTechnical
- Views Attention Fusion of Granular-ball Fuzzy Representations Split for Improved Multi-view ClusteringTechnical
- VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-useTechnical
- Virtual Multiplex Staining for Histological Images Using a Marker-Wise Conditioned Diffusion ModelTechnical
- VirtualEnv: A Platform for Embodied AI ResearchTechnical
- VisAssist: A Visually Impaired-Captured Video Question Answering Benchmark for Assistive SystemsTechnical
- Vision Transformers Are Circulant Attention LearnersTechnical
- Vision-G1: Towards General Reasoning Vision-Language Models via Reinforcement LearningTechnical
- Vision-Language Models Guided Graph Concept Reasoning for Interpretable Diabetic Retinopathy DiagnosisTechnical
- Vision-Language Reasoning for Geolocalization: A Reinforcement Learning ApproachTechnical
- Vision-MoR: Scaling Vision Transformer via Patch-Level Mixture-of-RecursionsTechnical
- Vision-Only Gaussian Splatting for Collaborative Semantic Occupancy PredictionTechnical
- Vision-language Incremental Learning with Dual Class-individual MemoryTechnical
- VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video GenerationTechnical
- Vista: Scene-Aware Optimization for Streaming Video Question Answering Under Post-Hoc QueriesTechnical
- Visual Bridge: Universal Visual Perception Representations GeneratingTechnical
- Visual-Friendly Concept Protection via Selective Adversarial PerturbationsTechnical
- VitalDiagnosis: AI-Driven Ecosystem for 24/7 Vital Monitoring and Chronic Disease ManagementTechnical
- VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive InteractionTechnical
- VoiceCloak: A Multi-Dimensional Defense Framework Against Unauthorized Diffusion-Based Voice CloningTechnical
- Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health UnderstandingTechnical
- Voting in Divisible Settings: A SurveyTechnical
- VulnBench: A Comprehensive Benchmark for Transformer-Based Vulnerability DetectionTechnical
- Vulnerability-Aware Robust Multimodal Adversarial TrainingTechnical
- W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree SearchTechnical
- WALKSAFE: Risk-aware Graph Random Walk with Bi-GRPO for LLM SafetyTechnical
- WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus ImagesTechnical
- WIET: Harmonizing Group-aware Model Weighting and Worker Allocation for Ensemble Temporal Prediction MaaSTechnical
- WRitEer: A Multi-Objective, Preference-Driven Multi-Agent Framework for Human-Like Advanced Text GenerationTechnical
- Walk Before You Dance: High-fidelity and Editable Dance Synthesis via Generative Masked Motion PriorTechnical
- Walking Further: Semantic-Aware Multimodal Gait Recognition Under Long-Range ConditionsTechnical
- Wasserstein-Aligned Hyperbolic Multi-View ClusteringTechnical
- Wasserstein-Aware Transfer: Class-Level Alignment for Robust Diffusion Model AdaptationTechnical
- WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM WatermarkingTechnical
- WaveC2R: Wavelet-Driven Coarse-to-Refined Hierarchical Learning for Radar RetrievalTechnical
- WaveDiST: A Wavelet Diffusion Transformer for Spatio-Temporal Estimation on Unobserved LocationsTechnical
- WaveEx: Accelerating Flow Matching-based Speech Generation via Wavelet-guided ExtrapolationTechnical
- WaveFormer: Frequency-Time Decoupled Vision Modeling with Wave EquationTechnical
- Wavefront-Constrained Passive Obscured Object DetectionTechnical
- Wavelet Enhanced Adaptive Frequency Filter for Sequential RecommendationTechnical
- Weakest Bidder Types and New Core-Selecting Combinatorial AuctionsTechnical
- Weakly-Supervised Image Forgery Localization via Vision-Language Collaborative Reasoning FrameworkTechnical
- Wearable Intelligence for Healthcare Robotics: From Brain Activity to Body MovementsTechnical
- Weather-Robust LiDAR Perception: Point Cloud Restoration from Adverse WeatherTechnical
- WeatherEdit: Controllable Weather Editing with 4D Gaussian FieldTechnical
- Weight Entropy-Maximised Evidential Metamodel for Uncertainty Quantification (Student Abstract)Technical
- WeightFlow: Learning Stochastic Dynamics via Evolving Weight of Neural NetworkTechnical
- Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM ReasoningTechnical
- WenetSpeech-Yue: A Large-Scale Cantonese Speech Corpus with Multi-dimensional AnnotationTechnical
- What Are They Filtering Out? An Experimental Benchmark of Filtering Strategies for Harm Reduction in Pretraining DatasetsTechnical
- What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference AlignmentTechnical
- What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic StudyTechnical
- What Voting Rules Actually Do: A Data-Driven Analysis of Multi-Winner VotingTechnical
- What You See Is What You Reach: Towards Spatial Navigation with High-Level Human InstructionsTechnical
- What to Ask Next? Probing the Imaginative Reasoning of LLMs with TurtleSoup PuzzlesTechnical
- What to Trust? A Trust-aware Knowledge-guided Method for Zero-shot Object State Understanding in VideosTechnical
- What, Whether and How? Unveiling Process Reward Models for Thinking with Images ReasoningTechnical
- What-Meets-Where: Unified Learning of Action and Contact Localization in ImagesTechnical
- When AI Meets AI: A Game-Theoretic Defense Framework Against AI Empowered Cyber ThreatsTechnical
- When Equal Isn’t Fair: Mitigating Over-Normalization in Large Language Models (Student Abstract)Technical
- When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?Technical
- When Genes Speak: A Semantic-Guided Framework for Spatially Resolved Transcriptomics Data ClusteringTechnical
- When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHFTechnical
- When Instinct Guides and Insight Grounds: Staged RL Training for LLM AgentsTechnical
- When Natural Strategies Meet Fuzziness and Resource-Bounded ActionsTechnical
- When Person Re-Identification Meets Event Camera: A Benchmark Dataset and an Attribute-Guided Re-Identification FrameworkTechnical
- When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM EditingTechnical
- When Proxy Agents Disagree, Do Humans Mirror? Manipulating Human Behavior in Moral Dilemmas Through AgentsTechnical
- When Reasoning Collapses: A Depth-Aware Probe into LLM Reasoning (Student Abstract)Technical
- When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language ModelsTechnical
- When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ ToxicityTechnical
- When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video RecommendationTechnical
- When Trackers Date Fish: A Benchmark and Framework for Underwater Multiple Fish TrackingTechnical
- When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language ModelsTechnical
- When the Domain Expert Has No Time and the LLM Developer Has No Clinical Expertise: Real-World Lessons from LLM Co-Design in a Safety-Net HospitalTechnical
- Where It Moves, It Matters: Referring Surgical Instrument Segmentation via MotionTechnical
- Where Norms and References Collide: Evaluating LLMs on Normative ReasoningTechnical
- Where and What Matters: Sensitivity-Aware Task Vectors for Many-Shot Multimodal In-Context LearningTechnical
- Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct PositionTechnical
- WhisperDiari: A Whisper-Based Speaker Diarization Framework in Token Space Leveraging Semantic and Speaker Information for Better Text AdaptabilityTechnical
- Whispering Agents: A Event-Driven Covert Communication Protocol for the Internet of AgentsTechnical
- Who Is Helping Whom? Analyzing Inter-Dependencies to Evaluate Cooperation in Human-AI TeamingTechnical
- Who Is a Better Matchmaker? Human vs. Algorithmic Judge Assignment in a High-Stakes Startup CompetitionTechnical
- Who Should I Trust? Explicit Confidence-Focused Multimodal Intent RecognitionTechnical
- Whole-Body Coordination for Dynamic Object Grasping with Legged ManipulatorsTechnical
- Whole-Field Action Sensing via Wearable Single-Channel EMG Sensors and Resource-Efficient Motion NetworkTechnical
- Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical StudyTechnical
- Why Isn’t Relational Learning Taking Over the World?Technical
- Wi-CBR: Salient-aware Adaptive WiFi Sensing for Cross-domain Behavior RecognitionTechnical
- Wikatoni: An Agentic AI System for Energy Engineering WorkflowsTechnical
- WikiREVIEW: A Multi-Perspective Review Framework for Automatic Wiki-Style Article GenerationTechnical
- Wikontic: A Tool for Building Knowledge Graphs from Text Aligned with the Wikidata OntologyTechnical
- WinMamba: Multi-Scale Shifted Windows in State Space Model for 3D Object DetectionTechnical
- WingBeats and Snapshots: Fusing Sound and Vision for Mosquito Monitoring (Student Abstract)Technical
- WorldAgen: Unified State-Action Prediction with Test-Time World Model TrainingTechnical
- WorldGrow: Generating Infinite 3D WorldTechnical
- WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous DrivingTechnical
- X-MoGen: Unified Motion Generation Across Humans and AnimalsTechnical
- X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and a Novel LLM-Consulted Explanation FrameworkTechnical
- X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-IdentificationTechnical
- X-SAM: From Segment Anything to Any SegmentationTechnical
- X2Edit: Revisiting Arbitrary-Instruction Image Editing Through Self-Constructed Data and Task-Aware Representation LearningTechnical
- XLinear: A Lightweight and Accurate MLP-Based Model for Long-Term Time Series Forecasting with Exogenous InputsTechnical
- YOLO-IOD: Towards Real Time Incremental Object DetectionTechnical
- You Don’t Need Pre-Built Graphs for RAG: Retrieval Augmented Generation with Adaptive Reasoning StructuresTechnical
- You Only Need One Stage: Novel-View Synthesis from a Single Blind Face ImageTechnical
- Your AI-Generated Image Detector Can Secretly Achieve SOTA Accuracy, If CalibratedTechnical
- Your Prompts Are Not Safe: Output-Free Membership Inference via Prompt Vectors in Vision-Language TuningTechnical
- Yours or Mine? Overwriting Attacks Against Neural Audio WatermarkingTechnical
- ZeRCP: Towards Communication-Efficient Collaborative Perception and Future Scene Prediction via Request-Free Spatial FilteringTechnical
- Zero-Reference Joint Low-Light Enhancement and Deblurring via Visual Autoregressive Modeling with VLM-Derived ModulationTechnical
- Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time TrainingTechnical
- Zero-Shot Robotic Manipulation via 3D Gaussian Splatting-Enhanced Multimodal Retrieval-Augmented GenerationTechnical
- Zero-Shot Vision Language Reasoning via Dual-layer Scene Graph Chain of Thoughts (Student Abstract)Technical
- Zero-shot Implicit Neural Manifold Representation (INMR) for Ultra-high Temporal Resolution Dynamic MRITechnical
- Zero-shot Recommendation: Towards Class Semantic Relation Learning for Inferring Labels of Unseen Micro-videosTechnical
- Zero-to-Hero: Empowering Video Appearance Transfer with Zero-Shot Initialization and Holistic RestorationTechnical
- ZipLJP: Zipped Information Processor for Legal Judgment PredictionTechnical
- Zo3T: Zero-Shot 3D-Aware Trajectory-Guided Image-to-Video Generation via Test-Time TrainingTechnical
- Zooming In on Fakes: A Novel Dataset for Localized AI-Generated Image Detection with Forgery Amplification ApproachTechnical
- anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task UnderstandingTechnical
- db-ECBS: Interaction-Aware Multirobot Kinodynamic Motion Planning (Abstract Reprint)Technical
- iCD: An Implicit Clustering Distillation Method for Structural Information Mining (Student Abstract)Technical
- iDT-diet: Toward Personalized Health Forecasting-An Intelligent Digital Twin Model for Diet-Influenced Biomarker Trajectories (Student Abstract)Technical
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM InferenceTechnical
- iSeal: Encrypted Fingerprinting for Reliable LLM Ownership VerificationTechnical
- mmJEPA-ECG: Cross-Posture Robust Contactless Electrocardiogram Monitoring via Millimeter Wave Radar SensingTechnical
- mmPred: Radar-based Human Motion Prediction in the DarkTechnical
- qa-FLoRA: Data-free query-adaptive Fusion of LoRAs for LLMsTechnical
- rMMEA: Robust Multi-Modal Entity Alignment with Missing and Noise Visual ModalityTechnical
- scCluBench: Comprehensive Benchmarking of Clustering Algorithms for Single-Cell RNA SequencingTechnical
- uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired DataTechnical
- vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMsTechnical
- xMHashSeg: Cross-modal Hash Learning for Training-free Unsupervised LiDAR Semantic SegmentationTechnical
- zkQML: Verifiable and Privacy-Preserving Inference for Quantum Machine Learning (Student Abstract)Technical
- Δt-Mamba3D: A Time‑Aware Spatio‑Temporal State‑Space Model for Breast Cancer Risk PredictionTechnical
- Ψ-Arena: Interactive Assessment and Optimization of LLM-based Psychological Counselors with Tripartite FeedbackTechnical
- ‘What Do Children Think About AI?’: Insights and Educational Implications from Primary School Students’ Perceptions of AITechnical
- “As Eastern Powers, I Will Veto.”: An Investigation of Nation-Level Bias of Large Language Models in International RelationsTechnical
- “Debate Guru”: Honing Public Speaking Skills Among Secondary School Students with AI Tutoring SystemsTechnical
AAAI accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.