Publications & Projects

37 works across 4 research areas

LLM & Agent

18 works
Qwen3.8-Max: A New Bar for Coding and Cowork
Long-Horizon Agent Large Language Model
Blog

Qwen3.8-Max: A New Bar for Coding and Cowork

Qwen Team, Alibaba Group

Qwen 3.8-Max scales to 2.4 trillion parameters with comprehensive improvements across coding, work, research, and long-horizon tasks.

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
Agentic AI Large Language Model
arXiv

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

Agents-A1 Team, Shanghai AI Lab

Open-source Agentic models specialized on Long-horizon tasks.

From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator
Agentic AI Distribution Shift
arXiv

From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator

Xiaohua Wang*, Jiakang Yuan*, Zisu Huang, Muzhao Tian, Changze Lv, Kaitao Song, Tao Chen, Xiaoqing Zheng

Graph-search-based end-to-end MLE task solver.

Segment-Aligned Policy Optimization for Multi-Modal Reasoning
Multimodal LLM Reinforcement Learning
ICML 2026

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li

A comprehensive benchmark specifically designed to evaluate the reasoning capability of MLLMs.

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges
Agentic AI Reinforcement Learning Reward Hacking
arXiv

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

Xiaohua Wang∗, Muzhao Tian∗, Yuqi Zeng∗, Zisu Huang∗, Jiakang Yuan∗, Bowen Chen∗, Jingwen Xu∗, Mingbo Zhou∗, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

System review of reward hacking.

Intern-S1-Pro: Scientific multimodal foundation model at trillion scale
Large Language Model Agentic AI
arXiv

Intern-S1-Pro: Scientific multimodal foundation model at trillion scale

Intern-S1 Team, Shanghai AI Lab

Intern-S1-Pro: one-trillion-parameter scientific multimodal foundation model.

InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery
Agentic AI Multi-Agent System Auto Research
arXiv

InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery

InternAgent Team, Shanghai AI Lab

InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery.

LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding
Agentic AI Long-Context
arXiv

LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding

Yichen Jiang, Jiakang Yuan, Chongjun Tu, Peng Ye, Tao Chen

A Multi-Agent System emulates LSTM’s hierarchical information flow and gated memory mechanisms for long-context understanding.

FlowSearch: Advancing Deep Research with Dynamic Structured Knowledge Flow
Agentic AI Deep Research
ACL 2026

FlowSearch: Advancing Deep Research with Dynamic Structured Knowledge Flow

Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang

A multi-agent system built upon the dynamic structured knowledge flow.

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction
Agentic AI Memory
ACL 2026

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction

Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng

A framework that allows users to dynamically regulate memory reliance.

AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
Agentic AI Machine Learning Engineering
arXiv

AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents

Shangheng Du, Xiangchao Yan, Dengyang Jiang, Jiakang Yuan, Yusong Hu, Xin Li, Liang He, Bo Zhang, Lei Bai

Graph-search-based end-to-end MLE task solver.

Chimera: Improving Generalist Model with Domain-Specific Experts
Multimodal LLM Domain Experts
ICCV 2025

Chimera: Improving Generalist Model with Domain-Specific Experts

Tianshuo Peng*, Mingsheng Li*, Jiakang Yuan, Hongbin Zhou, Renqiu Xia, Renrui Zhang, Lei Bai, Song Mao, Bin Wang, Aojun Zhou, Botian Shi, Tao Chen, Bo Zhang, Xiangyu Yue

A scalable and low-cost multi-modal pipeline to boost existing LMMs with domain-specific experts.

MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
Multimodal LLM Benchmark Reasoning
ICML 2026

MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs

Jiakang Yuan*, Tianshuo Peng*, Yilei Jiang, Yiting Lu, Renrui Zhang, Kaituo Feng, Chaoyou Fu, Tao Chen, Lei Bai, Bo Zhang, Xiangyu Yue

A comprehensive benchmark specifically designed to evaluate the reasoning capability of MLLMs.

InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification
Auto-Research Multi-Agent System
arXiv

InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification

Bo Zhang*, Shiyang Feng*, Xiangchao Yan*, Jiakang Yuan*, Zhiyin Yu, Xiaohan He, Songtao Huang, Shaowei Hou, Zheng Nie, Zhilong Wang, Jinyao Liu, Runmin Ma, Tianshuo Peng, Peng Ye, Dongzhan Zhou, Shufei Zhang, Xiaosong Wang, Yilan Zhang, Meng Li, Zhongying Tu, Xiangyu Yue, Wangli Ouyang, Bowen Zhou, Lei Bai

A unified closed-loop multi-agent framework for Automatic Scientific Research.

SurveyForge: On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey Writing
Auto-Research Survey Generation
ACL 2025

SurveyForge: On the Outline Heuristics, Memory-Driven Generation, and Multi-dimensional Evaluation for Automated Survey Writing

Xiangchao Yan*, Shiyang Feng*, Jiakang Yuan, Renqiu Xia, Bin Wang, Bo Zhang, Lei Bai

SurveyForge automatically generates and refines the content of surveys.

Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback
Auto-Research Agentic AI
ACL 2025

Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback

Jiakang Yuan, Xiangchao Yan, Shiyang Feng, Bo Zhang, Tao Chen, Botian Shi, Wanli Ouyang, Yu Qiao, Lei Bai, Bowen Zhou

A closed-loop auto-research framework that enables autonomous scientific research through thinking, practice, and feedback.

OmniCaptioner: One Captioner to Rule Them All
Image Captioning Multimodal LLM
arXiv

OmniCaptioner: One Captioner to Rule Them All

Yiting Lu*, Jiakang Yuan*, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Bo Zhang, Peng Gao

An all-in-one visual to text mapping tool.

GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
Multimodal LLM Geometric Reasoning
ICLR 2025

GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training

Renqiu Xia*, Mingsheng Li*, Hancheng Ye, Wenjie Wu, Hongbin Zhou, Jiakang Yuan, Tianshuo Peng, Xinyu Cai, Xiangchao Yan, Bin Wang, Conghui He, Botian Shi, Tao Chen, Junchi Yan, Bo Zhang

A multi-modal large model focusing on geometric understanding and reasoning tasks with formalized visual-language pre-training.

AIGC

2 works
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
Image Generation Diffusion Models
ICCV 2025

Lumina-Image 2.0: A Unified and Efficient Image Generative Framework

Qi Qin, Le Zhuo, Yi Xin, Ruoyi Du, Zhen Li, Bin Fu, Yiting Lu, Jiakang Yuan, Xinyue Li, Dongyang Liu, Xiangyang Zhu, Manyuan Zhang, Will Beddow, Erwann Millon, Victor Perez, Wenhai Wang, Conghui He, Bo Zhang, Xiaohong Liu, Hongsheng Li, Yu Qiao, Chang Xu, Peng Gao

State-of-the-art text-to-image generation model.

Training-Free Adaptive Diffusion with Bounded Difference Approximation Strategy
Diffusion Models Efficient Inference
NeurIPS 2024

Training-Free Adaptive Diffusion with Bounded Difference Approximation Strategy

Hancheng Ye*, Jiakang Yuan*, Renqiu Xia, Xiangchao Yan, Tao Chen, Junchi Yan, Botian Shi, Bo Zhang

AdaptiveDiffusion adaptively reduces noise prediction steps during denoising guided by third-order latent difference.

3D Vision & Autonomous Driving

12 works
Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models
embodied AI Test-Time Learning
ECCV 2026

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

Siyao Chen, Jiakang Yuan, Jiaxin Wang, Tao Chen

Test-time reinforcement learning for vision-language-action models.

MLG-Stereo: ViT Based Stereo Matching with Multi-Stage Local-Global Enhancement
Stereo Matching Vision Foundation Models
arXiv

MLG-Stereo: ViT Based Stereo Matching with Multi-Stage Local-Global Enhancement

Haoyu Zhang, Jingyi Zhou, Peng Ye, Jiakang Yuan, Lin Zhang, Feng Xu, Tao Chen

Unlocking the full potential of ViT-based stereo matching.

Bi3D++: Hybrid Bi-domain Active Learning for Cross-domain 3D Object Detection
3D Object Detection Domain Adaptation
T-PAMI 2026

Bi3D++: Hybrid Bi-domain Active Learning for Cross-domain 3D Object Detection

Jiakang Yuan, Xiangchao Yan, Botian Shi, Bo Zhang, Feng Xu, Yu Qiao, Tao Chen

A Bi-domain active learning approach which selects samples from both source and target domain to solve cross-domain 3D object detection.

SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations
3D Perception Pre-training
T-PAMI 2025

SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations

Jiakang Yuan, Bo Zhang, Tao Chen, Botian Shi, Yu Qiao

Scalable 3D pre-training via occupancy prediction for learning transferable 3D representations.

Consistency-aware Self-Training for Iterative-based Stereo Matching
Stereo Matching Self-Training
CVPR 2025

Consistency-aware Self-Training for Iterative-based Stereo Matching

Jingyi Zhou*, Peng Ye*, Haoyu Zhang, Jiakang Yuan (Project Leader), Qiang Rao, YangChenXu Liu, Cailin Wu, Feng Xu, Tao Chen

CST-Stereo achieves impressive results in various scenarios including in-domain, domain adaptive and domain generalization.

All-in-One: Transferring Vision Foundation Models into Stereo Matching
Stereo Matching Vision Foundation Models
AAAI 2025

All-in-One: Transferring Vision Foundation Models into Stereo Matching

Jingyi Zhou*, Haoyu Zhang*, Jiakang Yuan*, Peng Ye, Tao Chen, Hao Jiang, Meiya Chen, Yangyang Zhang

AIOStereo flexibly selects and transfers knowledge from multiple heterogeneous VFMs to a single stereo matching model. Rank 1st on Middlebury Stereo Evaluation.

3DET-Mamba: Causal Sequence Modelling for End-to-End 3D Object Detection
3D Object Detection State Space Model
NeurIPS 2024

3DET-Mamba: Causal Sequence Modelling for End-to-End 3D Object Detection

Mingsheng Li*, Jiakang Yuan*, Sijin Chen, Lin Zhang, Anyu Zhu, Xin Chen, Tao Chen

Exploit the potential of Mamba architecture on 3D scene-level perception for the first time.

Reg-TTA3D: Better Regression Makes Better Test-time Adaptive 3D Object Detection
3D Object Detection Test-Time Adaptation
ECCV 2024

Reg-TTA3D: Better Regression Makes Better Test-time Adaptive 3D Object Detection

Jiakang Yuan, Bo Zhang, Kaixiong Gong, Xiangyu Yue, Botian Shi, Yu Qiao, Tao Chen

A pseudo-label-based test-time adaptive 3D object detection method exploring a new task of test-time domain adaptive 3D detection.

ReSimAD: Zero-Shot 3D Domain Transfer for Autonomous Driving with Source Reconstruction and Target Simulation
Autonomous Driving Domain Adaptation
ICLR 2024

ReSimAD: Zero-Shot 3D Domain Transfer for Autonomous Driving with Source Reconstruction and Target Simulation

Bo Zhang*, Xinyu Cai*, Jiakang Yuan, Donglin Yang, Jianfei Guo, Xiangchao Yan, Renqiu Xia, Botian Shi, Min Dou, Tao Chen, Si Liu, Junchi Yan, Yu Qiao

A Reconstruction-Simulation-Perception scheme for alleviating domain shifts in autonomous driving.

AD-PT: Autonomous Driving Pre-Training with Large-scale Point Cloud Dataset
Autonomous Driving Pre-training
NeurIPS 2023

AD-PT: Autonomous Driving Pre-Training with Large-scale Point Cloud Dataset

Jiakang Yuan, Bo Zhang, Xiangchao Yan, Tao Chen, Botian Shi, Yikang Li, Yu Qiao

Build a large-scale pre-training point-cloud dataset with diverse data distribution, and learn generalizable representations.

Uni3D: A Unified Baseline for Multi-dataset 3D Object Detection
3D Object Detection
CVPR 2023

Uni3D: A Unified Baseline for Multi-dataset 3D Object Detection

Bo Zhang, Jiakang Yuan, Botian Shi, Tao Chen, Yikang Li, Yu Qiao

A unified baseline to tackle multi-dataset 3D object detection from data-level and semantic-level.

Bi3D: Bi-domain Active Learning for Cross-domain 3D Object Detection
3D Object Detection Domain Adaptation
CVPR 2023

Bi3D: Bi-domain Active Learning for Cross-domain 3D Object Detection

Jiakang Yuan, Bo Zhang, Xiangchao Yan, Tao Chen, Botian Shi, Yikang Li, Yu Qiao

A Bi-domain active learning approach which selects samples from both source and target domain to solve cross-domain 3D object detection.

Others

5 works
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
Agentic AI Multi-Agent System
arXiv

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit Team, Shanghai AI Lab

A unified benchmarking toolkit designed to evaluate AI models for science across a broad range of scientific disciplines and task capabilities.

Omniquality-R: Advanced Reward Models through All-Encompassing Quality Assessment
Image Quality Assesment Reinforcement Learning
ICML 2026

Omniquality-R: Advanced Reward Models through All-Encompassing Quality Assessment

Yiting Lu, Fengbin Guan, Yixin Gao, Yan Zhong, Xinge Peng, Jiakang Yuan, Yihao Liu, Bo Zhang, Xin Li, Zhibo Chen, Weisi Lin

A unified reward modeling framework that transforms multi-task quality reasoning into continuous and interpretable reward signals .

Sequential Token Merging: Revisiting Hidden States
Token Reduction Mamba
arXiv

Sequential Token Merging: Revisiting Hidden States

Yan Wen, Peng Ye, Lin Zhang, Baopu Li, Jiakang Yuan, Yaoxin Yang, Tao Chen

Novel sequential token reduction pipeline for Mamba.

Bidirectional Prototype-Reward co-Evolution for Test-Time Adaptation of Vision-Language Models
Vision-Language Models Test-Time Adaptation
T-MM 2025

Bidirectional Prototype-Reward co-Evolution for Test-Time Adaptation of Vision-Language Models

Xiaozhen Qiao, Peng Huang, Jiakang Yuan, Xianda Guo, Bowen Ye, Zhe Sun, Xuelong Li

Novel TTA framework for Vision-Language Models.

Learning Cross-Image Object Semantic Relation in Transformer for Few-Shot Fine-Grained Image Classification
Few-Shot Learning Vision Transformer
ACM'MM 2022

Learning Cross-Image Object Semantic Relation in Transformer for Few-Shot Fine-Grained Image Classification

Bo Zhang*, Jiakang Yuan*, Baopu Li, Tao Chen, Jiayuan Fan, Botian Shi

A Transformer-based double-helix model to achieve cross-image object semantic relation mining in a bidirectional and symmetrical manner.