AI 论文 · 2026-07
浏览 2026-07 发布的AI 论文内容,第 2 页,共 385 条。
- Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models
- RoboTTT: Context Scaling for Robot Policies
- MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
- SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- BadWAM: When World-Action Models Dream Right but Act Wrong
- On-Policy Delta Distillation
- SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
- Video = World + Event Stream
- LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
- VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- WanSong v1.0 Technical Report
- VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
- Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
- xHC: Expanded Hyper-Connections
- Multi-Turn On-Policy Distillation with Prefix Replay
- RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
- Cura 1T: Specialized Model for Agentic Healthcare
- Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
- Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving
- KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
- MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
- Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
- VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
- From Pixels to States: Rethinking Interactive World Models as Game Engines
- GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
- Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code
- Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings
- AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
- OvisOCR2 Technical Report
- DeepLoop: Depth Scaling for Looped Transformers
- Discrete Diffusion Models: A Unified Framework from Tokenization to Generation
- Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
- Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation
- Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
- KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
- Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation
- Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
- AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow
- From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
- Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
- Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
- ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
- Self-Improvements in Modern Agentic Systems: A Survey
- PalmClaw: A Native On-Device Agent Framework for Mobile Phones
- UniVR: Thinking in Visual Space for Unified Visual Reasoning
- Tracing Agentic Failure from the Flow of Success
- Color Pass-Through via Camera-Display Coupling
- Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
- Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
- Let RGB Be the Language of Vision
- Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
- Rethinking the Evaluation of Harness Evolution for Agents
- ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams
- From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Latent-Identity Tuning in Text-to-Image Personalization Models
- Metacognition in LLMs: Foundations, Progress, and Opportunities
- Evidence-Backed Video Question Answering
- AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification
- MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning
- Motion4Motion: Motion Transfer Across Subjects at Inference
- Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
- MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
- Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
- Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
- LightMem-Ego: Your AI Memory for Everyday Life
- Multi-Agent LLMs Fail to Explore Each Other
- MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
- Qwen-Music Technical Report
- RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM
- MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models
- See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
- Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
- Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists
- AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
- SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow
- Predictive Divergence Masks for LLM RL
- Towards Autonomous and Auditable Medical Imaging Model Development
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- GRASP: GRanularity-Aware Search Policy for Agentic RAG
- SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
- GigaChat Audio: Time-aware Large Audio Language Model
- GigaAM Multilingual: Foundation Model for Underrepresented Languages
- Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
- CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation
- 4D Human-Scene Reconstruction from Low-Overlap Captures
- PanoWorld: Real-World Panoramic Generation
- Scalable Visual Pretraining for Language Intelligence
- OpenLongTail: Generative Scaling of Long-Tail Driving Data
- A Sovereign, Open-Source Foundation Model for German and English
- Self-Guided Test-Time Training for Long-Context LLMs
- REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation
- On Locality and Length Generalization in Visual Reasoning
- Video Generation Models are General-Purpose Vision Learners