01
后训练
围绕 CER 奖励、GRPO、监督约束与模型版本评测,探索面向长对话语音识别的质量优化。
01 / FOCUS
关注模型在数据、训练、推理与评测之间的完整链路,重视能够被清晰描述和复查的实验过程。
围绕 CER 奖励、GRPO、监督约束与模型版本评测,探索面向长对话语音识别的质量优化。
基于视觉编码、投影层与语言模型协同训练,完成图像理解与文本生成的对齐实验。
面向连续操控,将轨迹数据、观测状态、动作建模与在线强化学习评测连接为可运行的实验流程。
02 / SELECTED WORK
以下内容来自公开版履历,保留技术边界与指标口径。
结合 SuperPoint+LightGlue、guarded ICP、可靠性筛选、桥接边与位姿图优化完成算法设计与实验评估。在 WLI39 基准完成 39/39 拼接。
以 CLIP ViT-B/16、Qwen 与 MLP Projection 构建视觉语言对齐实验;经过两阶段训练,固定验证样本上的 PPL 从 10.2 降至 4.1。
完成 RoboTwin 轨迹转换与多模态状态对齐,训练连续双臂动作输出;参与并行环境采样、优势估计、PPO 更新、指标监控与失败回放。
围绕长对话识别构建 CER 奖励、错误位置加权、模型评测、语音切分与医学对话数据流程。