AI 论文 · 2026-06
浏览 2026-06 发布的AI 论文内容,第 1 页,共 818 条。
- AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer
- ASPIRE: Agentic /Skills Discovery for Robotics
- Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
- GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity
- PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
- AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation
- GEAR: Guided End-to-End AutoRegression for Image Synthesis
- QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
- SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
- Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
- When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors
- Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers
- TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
- InstanceControl: Controllable Complex Image Generation without Instance Labeling
- Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
- MuSViT: A Foundation Vision Model for Sheet Music Representation
- MemLearner: Learning to Query Context memory for Video World Models
- Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue
- AutoTrainess: Teaching Language Models to Improve Language Models Autonomously
- DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
- Xiaomi-GUI-0 Technical Report
- 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
- BlockPilot: Instance-Adaptive Policy Learning for Diffusion-based Speculative Decoding
- AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation
- FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
- SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
- Teaching LLMs to Recommend and Defer in Underrepresented Epilepsy Care
- TerraDiT-Ω: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive
- Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
- Multi-Block Diffusion Language Models
- GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving
- Generated Contents Enrichment
- PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
- LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents
- One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining
- DOPD: Dual On-policy Distillation
- Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
- SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
- Morphing into Hybrid Attention Models
- Orca: The World is in Your Mind
- Beyond IID: How General Are Tabular Foundation Models, Really?
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language
- The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction
- DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model
- TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark
- SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
- One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding
- Little Brains, Big Feats: Exploring Compact Language Models
- Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
- Walking in the Implicit: Interactive World Exploration via Neural Scene Representation
- CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion
- MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
- Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting
- Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning
- DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation
- SWE-Together: Evaluating Coding Agents in Interactive User Sessions
- SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
- Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis
- GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
- PoseShield: Neural Collision Fields for Human Self-Collision Resolution
- Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
- JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
- Geometric Stability of Neural Population Codes: Regional Variation, Behavioral Relevance, and Circuit Dependence
- One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
- OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
- Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
- Learning Transferable Dynamics Priors from Action to World Modeling
- Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
- Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- Hierarchical Experimentalist Agents
- MirrorPPR: Exemplar-Based Portrait Photo Retouching
- PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
- Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling
- Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR
- Learning to Trigger: Reinforcement Learning at the Large Hadron Collider
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- A Gravitational Interpretation of Fine-Tuning Reversion
- TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
- Dockerless: Environment-Free Program Verifier for Coding Agents
- Building to the Test: Coding Agents Deliver What You Check, Not What You Requested
- PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
- Towards Automating Scientific Review with Google's Paper Assistant Tool
- SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation
- GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems
- Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
- Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
- PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation
- MultiHashFormer: Hash-based Generative Language Models
- Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation
- ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
- Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
- Parameter-Efficient Quantum-Inspired Fast Weight Programmers for Traffic-Matrix Forecasting