37 works across 4 research areas
Qwen Team, Alibaba Group
Qwen 3.8-Max scales to 2.4 trillion parameters with comprehensive improvements across coding, work, research, and long-horizon tasks.
Agents-A1 Team, Shanghai AI Lab
Open-source Agentic models specialized on Long-horizon tasks.
Xiaohua Wang*, Jiakang Yuan*, Zisu Huang, Muzhao Tian, Changze Lv, Kaitao Song, Tao Chen, Xiaoqing Zheng
Graph-search-based end-to-end MLE task solver.
Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li
A comprehensive benchmark specifically designed to evaluate the reasoning capability of MLLMs.
Xiaohua Wang∗, Muzhao Tian∗, Yuqi Zeng∗, Zisu Huang∗, Jiakang Yuan∗, Bowen Chen∗, Jingwen Xu∗, Mingbo Zhou∗, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang
System review of reward hacking.
Intern-S1 Team, Shanghai AI Lab
Intern-S1-Pro: one-trillion-parameter scientific multimodal foundation model.
InternAgent Team, Shanghai AI Lab
InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery.
Yichen Jiang, Jiakang Yuan, Chongjun Tu, Peng Ye, Tao Chen
A Multi-Agent System emulates LSTM’s hierarchical information flow and gated memory mechanisms for long-context understanding.
Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang
A multi-agent system built upon the dynamic structured knowledge flow.
Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng
A framework that allows users to dynamically regulate memory reliance.
Shangheng Du, Xiangchao Yan, Dengyang Jiang, Jiakang Yuan, Yusong Hu, Xin Li, Liang He, Bo Zhang, Lei Bai
Graph-search-based end-to-end MLE task solver.
Tianshuo Peng*, Mingsheng Li*, Jiakang Yuan, Hongbin Zhou, Renqiu Xia, Renrui Zhang, Lei Bai, Song Mao, Bin Wang, Aojun Zhou, Botian Shi, Tao Chen, Bo Zhang, Xiangyu Yue
A scalable and low-cost multi-modal pipeline to boost existing LMMs with domain-specific experts.
Jiakang Yuan*, Tianshuo Peng*, Yilei Jiang, Yiting Lu, Renrui Zhang, Kaituo Feng, Chaoyou Fu, Tao Chen, Lei Bai, Bo Zhang, Xiangyu Yue
A comprehensive benchmark specifically designed to evaluate the reasoning capability of MLLMs.
Bo Zhang*, Shiyang Feng*, Xiangchao Yan*, Jiakang Yuan*, Zhiyin Yu, Xiaohan He, Songtao Huang, Shaowei Hou, Zheng Nie, Zhilong Wang, Jinyao Liu, Runmin Ma, Tianshuo Peng, Peng Ye, Dongzhan Zhou, Shufei Zhang, Xiaosong Wang, Yilan Zhang, Meng Li, Zhongying Tu, Xiangyu Yue, Wangli Ouyang, Bowen Zhou, Lei Bai
A unified closed-loop multi-agent framework for Automatic Scientific Research.
Xiangchao Yan*, Shiyang Feng*, Jiakang Yuan, Renqiu Xia, Bin Wang, Bo Zhang, Lei Bai
SurveyForge automatically generates and refines the content of surveys.
Jiakang Yuan, Xiangchao Yan, Shiyang Feng, Bo Zhang, Tao Chen, Botian Shi, Wanli Ouyang, Yu Qiao, Lei Bai, Bowen Zhou
A closed-loop auto-research framework that enables autonomous scientific research through thinking, practice, and feedback.
Yiting Lu*, Jiakang Yuan*, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Bo Zhang, Peng Gao
An all-in-one visual to text mapping tool.
Renqiu Xia*, Mingsheng Li*, Hancheng Ye, Wenjie Wu, Hongbin Zhou, Jiakang Yuan, Tianshuo Peng, Xinyu Cai, Xiangchao Yan, Bin Wang, Conghui He, Botian Shi, Tao Chen, Junchi Yan, Bo Zhang
A multi-modal large model focusing on geometric understanding and reasoning tasks with formalized visual-language pre-training.
Qi Qin, Le Zhuo, Yi Xin, Ruoyi Du, Zhen Li, Bin Fu, Yiting Lu, Jiakang Yuan, Xinyue Li, Dongyang Liu, Xiangyang Zhu, Manyuan Zhang, Will Beddow, Erwann Millon, Victor Perez, Wenhai Wang, Conghui He, Bo Zhang, Xiaohong Liu, Hongsheng Li, Yu Qiao, Chang Xu, Peng Gao
State-of-the-art text-to-image generation model.
Hancheng Ye*, Jiakang Yuan*, Renqiu Xia, Xiangchao Yan, Tao Chen, Junchi Yan, Botian Shi, Bo Zhang
AdaptiveDiffusion adaptively reduces noise prediction steps during denoising guided by third-order latent difference.
Siyao Chen, Jiakang Yuan, Jiaxin Wang, Tao Chen
Test-time reinforcement learning for vision-language-action models.
Haoyu Zhang, Jingyi Zhou, Peng Ye, Jiakang Yuan, Lin Zhang, Feng Xu, Tao Chen
Unlocking the full potential of ViT-based stereo matching.
Jiakang Yuan, Xiangchao Yan, Botian Shi, Bo Zhang, Feng Xu, Yu Qiao, Tao Chen
A Bi-domain active learning approach which selects samples from both source and target domain to solve cross-domain 3D object detection.
Jiakang Yuan, Bo Zhang, Tao Chen, Botian Shi, Yu Qiao
Scalable 3D pre-training via occupancy prediction for learning transferable 3D representations.
Jingyi Zhou*, Peng Ye*, Haoyu Zhang, Jiakang Yuan (Project Leader), Qiang Rao, YangChenXu Liu, Cailin Wu, Feng Xu, Tao Chen
CST-Stereo achieves impressive results in various scenarios including in-domain, domain adaptive and domain generalization.
Jingyi Zhou*, Haoyu Zhang*, Jiakang Yuan*, Peng Ye, Tao Chen, Hao Jiang, Meiya Chen, Yangyang Zhang
AIOStereo flexibly selects and transfers knowledge from multiple heterogeneous VFMs to a single stereo matching model. Rank 1st on Middlebury Stereo Evaluation.
Mingsheng Li*, Jiakang Yuan*, Sijin Chen, Lin Zhang, Anyu Zhu, Xin Chen, Tao Chen
Exploit the potential of Mamba architecture on 3D scene-level perception for the first time.
Jiakang Yuan, Bo Zhang, Kaixiong Gong, Xiangyu Yue, Botian Shi, Yu Qiao, Tao Chen
A pseudo-label-based test-time adaptive 3D object detection method exploring a new task of test-time domain adaptive 3D detection.
Bo Zhang*, Xinyu Cai*, Jiakang Yuan, Donglin Yang, Jianfei Guo, Xiangchao Yan, Renqiu Xia, Botian Shi, Min Dou, Tao Chen, Si Liu, Junchi Yan, Yu Qiao
A Reconstruction-Simulation-Perception scheme for alleviating domain shifts in autonomous driving.
Jiakang Yuan, Bo Zhang, Xiangchao Yan, Tao Chen, Botian Shi, Yikang Li, Yu Qiao
Build a large-scale pre-training point-cloud dataset with diverse data distribution, and learn generalizable representations.
Bo Zhang, Jiakang Yuan, Botian Shi, Tao Chen, Yikang Li, Yu Qiao
A unified baseline to tackle multi-dataset 3D object detection from data-level and semantic-level.
Jiakang Yuan, Bo Zhang, Xiangchao Yan, Tao Chen, Botian Shi, Yikang Li, Yu Qiao
A Bi-domain active learning approach which selects samples from both source and target domain to solve cross-domain 3D object detection.
SciEvalKit Team, Shanghai AI Lab
A unified benchmarking toolkit designed to evaluate AI models for science across a broad range of scientific disciplines and task capabilities.
Yiting Lu, Fengbin Guan, Yixin Gao, Yan Zhong, Xinge Peng, Jiakang Yuan, Yihao Liu, Bo Zhang, Xin Li, Zhibo Chen, Weisi Lin
A unified reward modeling framework that transforms multi-task quality reasoning into continuous and interpretable reward signals .
Yan Wen, Peng Ye, Lin Zhang, Baopu Li, Jiakang Yuan, Yaoxin Yang, Tao Chen
Novel sequential token reduction pipeline for Mamba.
Xiaozhen Qiao, Peng Huang, Jiakang Yuan, Xianda Guo, Bowen Ye, Zhe Sun, Xuelong Li
Novel TTA framework for Vision-Language Models.
Bo Zhang*, Jiakang Yuan*, Baopu Li, Tao Chen, Jiayuan Fan, Botian Shi
A Transformer-based double-helix model to achieve cross-image object semantic relation mining in a bidirectional and symmetrical manner.