AI 论文 · 2026-09
浏览 2026-09 发布的AI 论文内容,第 5 页,共 741 条。
- Training-Adaptive Convolutional Sparse Coding via Information Bottleneck for Robust Visual Representation
- TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection
- DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation
- UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
- ALPINE: Adaptive Localization for Parameter- and Sample-Efficient Few-Shot Learning
- BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
- Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
- GAVEL: Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning
- A Zeroth-Order Paradigm for LLM Preference Alignment
- PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection
- In-Context Robot Learning with VLM Agents
- ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
- ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks
- CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents
- FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection
- Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
- RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation
- PACT: Can Enterprise AI Assistants Be Trusted Under Pressure?
- ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models
- Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model
- Agora: Git as Shared Memory for Collective AutoResearch
- The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction
- Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX
- NanoForecast v0.5: Competitive Time Series Forecasting Through Training Pipeline Optimization
- Learning Steadily: Accumulating Relative Point Margin Scores for Face Image Quality Assessment
- Embedding Physics Priors in Robot Learning: A Survey
- TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
- Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control
- Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
- Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents
- Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
- EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents
- Modality-Autoregressive World-Action Models
- ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
- PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control
- Verifiable Social Reasoning for LLM Assistants
- LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence
- Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems
- EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset
- Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand
- RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation
- ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals
- AI for Games in the Foundation Model Era
- FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation
- Reasoning with Image Generation
- Register Tokens for Bounded-State Reasoning in Diffusion Language Models
- CADWorld: Computer-Use Benchmark for Long-Horizon Computer-Aided Design
- Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
- Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation
- Bellman Policy Optimization
- The Router Within: Eliciting Native Skill Routing from a Frozen LLM
- Disentangling Representation Evolution in Transformers through Directional Decomposition
- Discovery Foundation Models: Toward Open-Ended Discovery Intelligence
- Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
- HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses
- LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
- Atria Dawn: The Dawn of Agentic Superintelligence
- VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
- EvoOntology: A Self-Evolving Ontology Layer for Data Agents
- Kaininja: Extending Native 3D Generators to the Part Level
- ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs
- Assessing nnU-Net Generalization across Brain Tumor Populations in BraTS-GoAT 2026
- How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus
- BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender
- RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
- When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis
- HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
- HazardAuditor: From Executable Threats to Safer Computer-Use Agents
- Omni-Streaming Thinking
- MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
- Enabling Creative Exploration for Vibe Design Agents
- Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training
- Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
- PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
- Dream-RSI: Recursive Self-Improvement through Evolving Worlds
- ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement
- OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning
- Another Blueprint In The Wall: How to Ask Frontier AI Like a Kid?
- Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability Composition
- AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video
- SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization
- Flattening Every Memory Peak in Long-Context Mixture-of-Experts Training
- E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning
- SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops
- Convergent Emergence of In-Context Learning Across Modalities
- StepAudio 3 Realtime Technical Report
- Thought without systematicity? Evaluating reasoning models on rule induction tasks
- Realtime-Venus: A full-duplex interaction system with asynchronous delegation
- Training Specialist Models without Reasoning Trajectories for Domain Expert Distillation
- Drift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models
- StepAudio 3 Music Technical Report
- Building a Production Greek-English Speech Recognizer
- Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures
- Learning to Solve Hard Problems in RL for LLMs by Never Giving Up
- Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement
- ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
- SNAP3D: Physically Grounded 3D Parts for Assembly from a Single Image
- SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
- Expert-Space Exploration in MoE Reinforcement Learning
- Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model