AI 论文 · 2026-05
浏览 2026-05 发布的AI 论文内容,第 3 页,共 552 条。
- BatteryMFormer: Multi-level Learning for Battery Degradation Trajectory Forecasting
- Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling
- Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement
- Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
- Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation
- RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models
- Is Position Bias in Dense Retrievers Built In-or Learned from Data?
- GradSentry: Gradient Spectral Entropy for Backdoor Sample Filtering in Large Language Model Fine-Tuning
- Beyond Holistic Models: Systematic Component-level Benchmarking of Deep Multivariate Time-Series Forecasting
- Recursive Flow Matching
- PRISM: Position-encoded Regressive Inverse Spectral Model for Multilayer Thin-Film Design
- The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence
- OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants
- Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization
- Cross-scale Aligned Supervision for Training GANs
- PANDO: Efficient Multimodal AI Agents via Online Skill Distillation
- Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows
- Lost in Translation? Exploring the Shift in Grammatical Gender from Latin to Occitan
- Advancing Creative Physical Intelligence in Large Multimodal Models
- ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence
- Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems
- CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations
- Unified Neural Scaling Laws
- LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
- Can LLMs Introspect? A Reality Check
- Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction
- TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction
- MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research
- From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
- Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
- Helix4D: Complex 4D Mesh Generation
- Reinforcing Few-step Generators via Reward-Tilted Distribution Matching
- On-Policy Adversarial Flow Distillation for Autoregressive Video Generation
- InstructSAM: Segment Any Instance with Any Instructions
- Language Models Need Sleep
- Pixel-Level Pavement Distress Assessment Using Instance Segmentation
- Channel-wise Vector Quantization
- Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World
- When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges
- Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals
- Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution
- SemBridge: Language Transfer in Sparse Encoders via Multilingual Semantic Bridges
- LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
- Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents
- Triplet-Block Diffusion RWKV
- How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?
- D^2-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing
- WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation
- Rethinking VLM Representation for VLA Initialization
- AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions
- CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
- DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
- ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement
- Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents
- MetaphorVU: Towards Metaphorical Video Understanding
- Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion
- Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning
- Not only where, But when: Temporal Scheduling for RLVR
- CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation
- Toward Native Multimodal Modeling: A Roadmap
- Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving
- NSF-SciFy: Mining the NSF Awards Database for Scientific Claims
- Geometry-Aware Image Flow Matching
- Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation
- Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference
- Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
- DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMs
- Growing a Neural Network in Breadth, Depth, and Time
- STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming Media
- SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
- WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models
- Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth
- Your Embedding Model is SMARTer Than You Think
- Learning High-Frequency Continuous Action Chunks in Latent Space
- Macaron-A2UI: A Model for Generative UI in Personal Agents
- CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
- ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison
- Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification
- Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems
- Can Predicted Dynamics Exist in the Physical World?
- VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
- Measuring the Depth of LLM Unlearning via Activation Patching
- ECHO: Terminal Agents Learn World Models for Free
- AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
- SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent
- Benchmarking Composed Image Retrieval for Applied Earth Observation
- SEAL: Synergistic Co-Evolution of Agents and Learning Environments
- QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks
- Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild
- When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
- SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
- Breaking the Chains of Probability: Neutrosophic Logic as a New Framework for Epistemic Uncertainty in Large Language Models
- SkillOpt: Executive Strategy for Self-Evolving Agent Skills
- Geo-Align: Video Generation Alignment via Metric Geometry Reward
- PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
- LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
- From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills
- SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
- ETCHR: Editing To Clarify and Harness Reasoning
- From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain