AI 论文 · 2026-08
浏览 2026-08 发布的AI 论文内容,第 2 页,共 664 条。
- Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
- Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
- Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
- Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
- Generative Semantic Scene Completion
- Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
- RECAP-Forcing: Retaining Content Appearances for Long Video Generation
- AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
- J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
- PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models
- Procedura: Agentic 3D Modeling with Procedural Control
- VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
- Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
- Prefix Sliding for efficient test-time scaling
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models
- VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
- One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation
- Code World Model: Coding Agent as World Brain
- MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
- Skill Issue: Are Skills Language-Invariant in LLMs?
- TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
- LMSM: LLM Security Framework Inspired by Linux Security Modules
- RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval
- JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
- Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
- Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
- A Programming Paradigm for Spatiotemporal Composability
- CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval
- Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents
- VGI-Bench: Probing Visual Intelligence in Video Generation Models
- Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation
- GameWAM: A World Action Model for Video Games
- LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale
- D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation
- FrontierChallenge: Evaluating Scientific Workflow Completion
- Latent Action as Intention Enables Efficient Future Imagination for World Action Models
- From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms
- Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
- StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
- CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
- StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing
- MoTE: Mixture of Task Experts for Multi-Task Video Understanding
- TorchMorph: CUDA-accelerated Morphological Transforms
- Meta^n: Recursive Self-Improvement through Emergent Depth
- On-policy Distillation with Verifiable Reward
- Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
- On-Policy Self-Distillation in Diffusion Models
- When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows
- WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
- The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents
- Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
- Real-World Knowledge-Guided Change Data Synthesis for Remote Sensing
- MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation
- Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation
- PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control
- Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments
- WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
- Luce: Relightable Gaussians for 3D Asset Generation
- Best Practice Critic Optimization
- What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals
- Language Chain in Alignment: Cross-lingual Ranking Preference Optimization
- MARS: Multi-Specialist LLM Relay System for Competitive Programming
- AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
- Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
- Automata from Agent Traces: Failure and Next-Step Prediction
- ReWorld: An Interactive World Model with Long-Horizon Memory
- SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
- Prime Agent: A Self-Improving RLM Harness
- Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
- Towards a Densing Law for User Representation Learning at Billion-Scale Capacity
- Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
- Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning
- Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
- Apodex 1.1: Scaling Agentic Intelligence for Complex Work
- Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
- The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search
- LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
- EchoWM: Open and Enterable Omnimodal World Models
- CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
- CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
- From Generation to Simulation: How Far Are World Models from Being True Simulators?
- AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
- MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks
- The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models
- Better Retrieval, Worse Robustness:How Multi-hop RAG Amplifies Upstream ASR Errors
- Same Agent, Different Answers: A Repeat-Aware Audit of Corpus-Induced Answer Churn in Retrieval-Augmented QA
- RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling
- Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports
- Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders
- What AstroPT knows about galaxies, and what that can teach us about LLMs
- WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning
- ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts
- Length-Adaptive Decoding for Masked Diffusion Machine Translation
- AutoResearch: Insight In, Hallucination Out
- Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction
- FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling