Mixture of Specialized Vision Experts: Unlocking Complementary Visual Insights for Faithful MLLM Reasoning
ECCV 2026
MoSVE 融合不同视觉专家的互补信息,减少多模态大语言模型的幻觉,提升基于视觉证据的推理能力。
我目前是北京大学相机智能实验室的博士0年级学生,主要研究视频生成与世界模型,导师为施柏鑫教授。我近期正在开展自回归视频生成相关研究。
我欢迎相关领域的学术交流与合作,您可以通过邮箱联系我。业余时间,我喜欢游泳和摄影。

我的研究兴趣包括:世界模型、视频生成、多模态学习与表征学习等。
ECCV 2026
MoSVE 融合不同视觉专家的互补信息,减少多模态大语言模型的幻觉,提升基于视觉证据的推理能力。
ICML 2026
NOVA 通过跨尺度、跨层的熵引导 token 剪枝,无需额外训练即可加速视觉自回归生成。
CVPR 2026
Markov-VAR 将尺度预测建模为马尔可夫过程,以紧凑的历史信息减少对完整上下文的依赖,在降低显存开销的同时进一步提升生成质量。
ICASSP 2026 · 口头报告
EQ 探索面向视觉自回归生成的不确定性感知量化,利用熵识别预测中具有较高不确定性的尺度。
博士第 0 年 · 导师:施柏鑫教授
正式入学:2027 年 9 月
本科 · 海洋技术,计算机科学与技术(辅修)
2023 年 9 月至今
世界模型研究实习生
2026 年 9 月至今
算法实习生
2025 年 7 月至 10 月