Tongji University · Qidi College

在复杂现实中,
构建可靠的智能。

我是杨涵,同济大学启迪书院大二学生。以项目为起点,探索世界模型、流式语音智能与具身感知如何共同服务于真实场景中的理解、判断与行动。

当前身份
本科二年级
主要媒介
代码 · 模型 · 系统
杨涵的肖像照片YANG HAN / 2026RESEARCH × ENGINEERING
正在推进研究与项目实践
SCROLL TO EXPLORE

01 / ABOUT

以研究的严谨,
回应工程的真实。

我具备 C++ 与 Python 基础,偏好从问题的约束出发拆解系统:先看清场景,再设计数据、模型与评估闭环。在团队项目中,我既负责核心模块的推进,也重视让方案真正可验证、可迭代。

目前的兴趣收敛在安全关键智能系统、语音与多模态在线建模,以及面向空间任务的机器人感知。它们指向同一个问题:如何让智能系统在变化与不确定中持续做出可信的判断。

从感知到决策,从离线训练到在线响应——让模型能力在真实任务中闭环。

02 / FOCUS

正在探索的
三个方向

01

SAFETY-CRITICAL AI

安全关键决策

在自动驾驶失效等高风险场景中,借助世界模型与场景理解,寻找可解释、可评估的最小风险策略。

02

STREAMING INTELLIGENCE

流式语音智能

面向复杂多人对话,以空间信息与在线建模兼顾低延迟分离、说话人连续性与环境鲁棒性。

03

EMBODIED PERCEPTION

具身感知与行动

连接自然语言、视觉识别与机器人执行,让智能体能够理解空间任务,并在反馈中不断修正。

03 / SELECTED WORK

项目不是清单,
而是持续验证的现场。

以下项目涵盖世界模型、语音流式处理与机器人视觉;每一次实践都在把一个模糊的问题推进为可运行、可评估的系统。

012025.10 — 至今

国家级大学生创新创业训练项目

AegisDrive

面向自动驾驶失效接管的世界模型辅助最小风险决策系统

项目负责人 · 5 人团队

面向驾驶员不适合接管的自动驾驶失效场景,预测并生成风险最小化策略。负责完整舱外预测体系的设计与开发:摄像头数据结构化、大模型辅助场景描述、技能设计与训练,以及世界模型训练与评估。

  • 世界模型
  • 多模态场景理解
  • 风险决策
查看 GitHub 项目
022026.06 — 至今

AAAI 待投稿

匿名流式说话人分离

面向复杂多说话人场景的低延迟在线语音分离系统

共同第一作者

融合多通道空间信息与在线建模,构建匿名流式说话人分离系统;在控制响应延迟的同时,提升说话人连续性与复杂环境下的鲁棒性。

  • 在线建模
  • 多通道语音
  • 低延迟
032025.11 — 2026.04

“挑战杯”中国大学生创业计划竞赛项目

Voicecraft “言筑”

从自然语言指令到机器人空间搭建动作

视觉模块负责人 · 10 人团队

围绕机器人空间搭建任务,负责视觉识别算法、数据采集、模型训练与对齐、后训练优化等全链路开发;针对幻觉、决策偏差等 Bad Case 持续迭代系统表现。

  • 机器人视觉
  • 大模型 Agent
  • 模型对齐

04 / CAPABILITIES

从想法到
可验证的原型。

01

编程与系统实现

C++ · Python · 数据处理 · 原型开发

02

模型训练与评估

深度学习 · 视觉识别 · 世界模型 · 后训练优化

03

问题拆解与协作

项目推进 · 数据闭环 · Bad Case 迭代 · 团队协作

05 / CONTACT

让一个好问题,
成为下一次合作的开始。

欢迎围绕安全关键智能、流式语音、具身感知与机器人视觉交流,也期待能参与有挑战、有真实反馈的研究与工程实践。