AI 论文 · 2026-07
浏览 2026-07 发布的AI 论文内容,第 3 页,共 385 条。
- Phone Segmentation and Recognition through Phonological Activation Mapping
- Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
- Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
- Enhancing In-context Panoramic Generation via Geometric-aware Pretraining
- OpenCoF: Learning to Reason Through Video Generation
- Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
- ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
- SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
- A Quantized Native Runtime for On-Device Semantic Audio Generation
- DrugGen 2: A disease-aware language model for enhancing drug discovery
- Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
- MuScriptor: An Open Model for Multi-Instrument Music Transcription
- CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
- From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models
- Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- A Theory of Contrastive Learning with Natural Images
- Length Penalties Make Chain-of-Thought Less Monitorable
- KronQ: LLM Quantization via Kronecker-Factored Hessian
- Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
- DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
- A Sparse and Truncated State Vector Simulator for Peaked Circuits
- Principled Analysis of Deep Reinforcement Learning Evaluation and Design Paradigms
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
- From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
- Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
- MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
- Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
- Infinite Worlds with Versatile Interactions
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
- UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
- Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation
- Weak-to-Strong Generalization via Direct On-Policy Distillation
- SPEAR: A Simulator for Photorealistic Embodied AI Research
- PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence
- Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies
- AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
- Vision as Unified Multimodal Generation
- RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
- SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
- From Foundation to Application: Improving VLA Models in Practice
- VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification
- UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
- AlayaWorld: Long-Horizon and Playable Video World Generation
- PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution
- SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review
- RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
- PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
- Imagined Rollouts are Kinematic, Not Dynamic: A Diagnosis of Long-Horizon World-Model Failure
- TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
- Quantifying and Expanding the Theoretical Capacity of Late-Interaction Retrieval Models
- Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator
- Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
- RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
- Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES
- Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
- CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
- SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
- MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
- PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
- GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
- Multiplayer Interactive World Models with Representation Autoencoders
- TREK: Distill to Explore, Reinforce to Refine
- Vision Pretraining for Dense Spatial Perception
- Unified Audio Intelligence Without Regressing on Text Intelligence
- EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- KVpop -- Key-Value Cache Compression with Predictive Online Pruning
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- Trust Region Policy Distillation
- PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection
- Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
- Registers Matter for Pixel-Space Diffusion Transformers
- Benchmarking Sensor Robustness in Plasma Diagnostic Models: A Systematic Evaluation on TokaMark
- SceneFrom3D: Geometry-Conditioned Outdoor 3D Scene Generation via View Scheduling with Object-Level Control
- Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
- Wan-Streamer v0.2: Higher Resolution, Same Latency
- ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
- ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
- dOPSD: On-Policy Self-Distillation for Diffusion Language Models
- UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
- AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes
- Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization
- SiamJEPA: On the Role of Siamese Student Encoders in JEPA
- OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers