AI 论文 · 2026-07
浏览 2026-07 发布的AI 论文内容,第 4 页,共 385 条。
- MANCE: Manifold Aware Concept Erasure
- TESSERA v2: Scaling Pixel-wise Earth Foundation Models
- Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs
- CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation
- CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
- Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
- Attending to Multimodal Generation One Token at a Time
- OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing
- MentalThink: Shaping Thoughts in Mental SVG World
- Perceptual Flow Matching for Few-Step Generative Modeling
- Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
- SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe
- Taste-aware music retrieval from audio embeddings
- Vidu S1: A Real-Time Interactive Video Generation Model
- PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
- Spectral Rewiring for Exploration, Purification, and Model Merging
- CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training
- Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
- Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
- Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment
- Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study
- PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction
- Automating the Design of Embodied Agent Architectures
- VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
- Gemma 4 Technical Report
- EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots
- GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
- WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory
- PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
- Program-as-Weights: A Programming Paradigm for Fuzzy Functions
- From SRA to Self-Flow: Data Augmentation or Self-Supervision?
- Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
- Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment
- Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
- OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers
- EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- ACID: Action Consistency via Inverse Dynamics for Planning with World Models
- Representation Distribution Matching for One-Step Visual Generation
- Optimizing Visual Generative Models via Distribution-wise Rewards
- AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition
- AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
- PACE: A Proxy for Agentic Capability Evaluation
- Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use
- VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
- Denser neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training
- WARP: Weight-Space Analysis for Recovering Training Data Portfolios
- AgenticDataBench: A Comprehensive Benchmark for Data Agents
- Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
- Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
- Video-Oasis: Rethinking Evaluation of Video Understanding
- Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
- NeuroCogMap Reveals Cognitive Organization of Large Language Models
- Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering
- RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules
- Scaling Laws for Grid-Based Approximate Nearest Neighbor Search in High Dimensions
- Measuring the Gap Between Human and LLM Research Ideas
- AutoMem: Automated Learning of Memory as a Cognitive Skill
- The State-Prediction Separation Hypothesis
- RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
- Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?
- Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- Autonomous Scientific Discovery via Iterative Meta-Reflection
- CausalMix: Data Mixture as Causal Inference for Language Model Training
- MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
- Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
- Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination
- Valdi: Value Diffusion World Models
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
- Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
- Multi-Turn Agentic Scientific Literature Search via Workflow Induction
- Cross-Domain Generalization Failure in Lightweight Intrusion Detection Models for IIoT Networks
- NoPA: Non-Parametric Online 3D Scene Graph Generation
- ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving
- Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
- When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
- Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs