AI 论文 · 2026-05
浏览 2026-05 发布的AI 论文内容,第 5 页,共 552 条。
- ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
- Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
- Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
- TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization
- PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset
- Toto 2.0: Time Series Forecasting Enters the Scaling Era
- ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions
- CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
- Stage-adaptive Token Selection for Efficient Omni-modal LLMs
- CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition
- Minimalist Visual Inertial Odometry
- Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory
- PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents
- Where Does Authorship Signal Emerge in Encoder-Based Language Models?
- Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
- Stitched Value Model for Diffusion Alignment
- Fast 4D Mesh Generation by Spatio-Temporal Attention Chains
- OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond
- optimize_anything: A Universal API for Optimizing any Text Parameter
- LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening
- GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
- Base Models Look Human To AI Detectors
- CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing
- MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
- Matérn Noise for Triangulation-Agnostic Flow Matching on Meshes
- Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
- MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
- PanoWorld: A Generative Spatial World Model for Consistent Whole-House Panorama Synthesis
- HL-OutPaint: Coarse-to-Fine Video Outpainting for High-Resolution Long-Range Videos
- π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
- A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
- It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs
- Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
- Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks
- SAGA: A Sequence-Adaptive Generative Architecture for Multi-Horizon Probabilistic Forecasting with Adaptive Temporal Conformal Prediction
- Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop
- Semantic Generative Tuning for Unified Multimodal Models
- EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
- Language-Switching Triggers Take a Latent Detour Through Language Models
- Forecasting Downstream Performance of LLMs With Proxy Metrics
- OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
- Lost in the Folds: When Cross-Validation Is Not a Deep Ensemble for Uncertainty Estimation
- RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting
- Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
- Context Memorization for Efficient Long Context Generation
- SENSE: Satellite-based ENergy Synthesis for Sustainable Environment
- See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
- Stable Audio 3
- Ethical Hyper-Velocity (EHV): A Provably Deterministic Governance-Aware JIT Compiler Architecture for Agentic Systems
- HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents
- Interactive Evaluation Requires a Design Science
- LatentUMM: Dual Latent Alignment for Unified Multimodal Models
- Harnessing LLM Agents with Skill Programs
- Learning from Language Feedback via Variational Policy Distillation
- Bug or Feature^2: Weight Drift, Activation Sparsity, and Spikes
- SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering
- Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
- Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
- MemForest: An Efficient Agent Memory System with Hierarchical Temporal Indexing
- Capturing LLM Capabilities via Evidence-Calibrated Query Clustering
- DynMuon: A Dynamic Spectral Shaping View of Muon
- S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination
- Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road
- Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps
- The Unlearnability Phenomenon in RLVR for Language Models
- EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers
- DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
- Look Before You Leap: Autonomous Exploration for LLM Agents
- Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
- PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
- Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models
- Unlocking Dense Metric Depth Estimation in VLMs
- Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design
- WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes
- FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization
- A Topology-Aware Spatiotemporal Handover Framework for Continuous Multi-UAV Tracking
- Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
- Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation
- CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage
- Efficient Image Synthesis with Sphere Latent Encoder
- RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably
- Active Learners as Efficient PRP Rerankers
- Video Models Can Reason with Verifiable Rewards
- ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing
- FFAvatar: Few-Shot, Feed-Forward, and Generalizable Avatar Reconstruction
- Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- PhysBrain 1.0 Technical Report
- ReactiveGWM: Steering NPC in Reactive Game World Models
- GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding
- Aligning Latent Geometry for Spherical Flow Matching in Image Generation
- From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
- Forgetting That Sticks: Quantization-Permanent Unlearning via Circuit Attribution
- EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration
- Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
- Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image
- Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning
- Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis
- Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces
- Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining