AI 论文 · 2026-08
浏览 2026-08 发布的AI 论文内容,第 6 页,共 664 条。
- Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation
- AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
- The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows
- Energy-Guided Flow Matching
- iFAN: Inference-Aware Learning for Plain Mask Transformers
- Scaling Inherently Interpretable Language Models
- Characterizing the Quality Profile of AI-Generated C++ in Production
- Factorized Hypothesis Search for Evidence-to-Taxonomy Retrieval
- Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding
- Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events
- DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation
- CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
- HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
- MASS: Multiplayer World Models with Authoritative Shared State
- Continual Learning in Transition
- EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
- PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
- DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds
- Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers
- The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents
- Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval
- From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models
- OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction
- AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
- MameLoshnLM: Yiddish Language Model and Evaluation Benchmark
- On-Policy Delta Distillation for Multilingual Math Reasoning
- KVAE: Family of Tokenizers for Multimodal Generative Models
- Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation
- Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay
- GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
- StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding
- ChronoVision: Temporal Reasoning via Latent State Reconstruction
- SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
- Uncertainty-Aware World Model for Aerial Image-Goal Navigation
- EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal
- SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
- Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
- Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control
- PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say
- Recursive Synthesis for Long-Horizon Terminal Tasks
- Invisible Shortcuts: Why Vision Encoders Know Your Camera
- World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation
- WorldClaw: Agentic 3D Open-World Generation at Scale
- Small Foundation Models of Human Cognition and Behaviour
- When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents
- Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
- Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
- SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
- The Loss Does Not See the Basis, but Adam Does
- OPD-V: Visual On-Policy Self-Distillation with Modality Balance
- Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
- ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
- HelloWorld: Enabling Socially Interactive Characters in Video World Models
- BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
- Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
- WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models
- ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing
- Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning
- UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models
- When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents
- The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
- Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression
- FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory
- K-EXAONE 2.0 Technical Report
- ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
- SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap
- Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation
- Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models
- Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle
- CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
- Maglev: Sliding Recurrent Memory
- Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems
- OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents
- SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
- MatrAIx: Simulating the World with 8.3 Billion Persona Agents
- TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
- PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
- When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings
- Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
- JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
- ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
- UniWorld-Design: From Pixel Generation to Layer-Native Design
- Omega-S: A Functional Resilience Index for LLM Fine-Tuning
- ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
- Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers
- OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
- Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss
- GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
- LegalPincite: Multi-level Legal Information Retrieval Dataset
- When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills
- When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation
- SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
- ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels
- When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
- WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks
- LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
- DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
- Multi-Task Multi-Frame Visual Piano Transcription