SPECIMEN NO. WCS-2026 · FIG.001 · 算法工程师 / 多模态

武淳晟

生成数据 · 评测体系 · 模型训练
质量与速度平衡,人工与 Agent 平衡。
10算法工程(2017– )
6主力项目 · 数据/评测/训练
0.84时序定位 mAP · 4B 超 8B 模型 2.5×
1890.01s 标注 · 开源评测集
4比赛排名(最好 10/254)
01 —

关于HELLO

十年算法工程师,从语音、NLP 一路走到多模态大模型。

我是武淳晟,算法工程师。2017 年入行,做过语音识别、口语评测与对话系统;近三年聚焦多模态大模型:合成数据生产、benchmark 评测体系、SFT 微调与模型压缩。

我的主线很清楚:数据生成与评估 → 训练 → 落地。喜欢把一件事情做成可复用的管线和口径——评测链路五层必须固定,因为「静默偏差比报错更危险」;数据生产必须带过滤与人工抽检,因为留存率与通过率才是质量的真相。

工作方式已经迁移到Agent 驱动:先定义目标,再让 agent 搜、改、试、回收,人负责目标定义与质量判断,把重复调参收敛为可执行、可回收的自动化流程。

数据闭环评测体系训练对齐规则与模型协同
FOCUS多模态数据 / 评测 / SFT
STACKPyTorch · Megatron-LM · vLLM · lmms-eval
AGENTopencode / codex / cursor 工作流
OPEN SOURCElmms-eval 贡献者
EDU硕士 · 计算机科学与技术
02 —

开源LAB

把评测口径、推理实现和回归验证串成可复用的流程,而不只是提交代码。

lmms-eval × JumpScore

EVALUATION FRAMEWORK · VIDEO TEMPORAL GROUNDING · 2024–2026

自建 JumpScore 评测闭环——189 条跳绳视频、0.01s 精度标注、mAP@δ 多粒度时序定位指标——并接入 lmms-eval 统一评测框架;同时为 LLaVA-OneVision-1.5 / 2.0 提供推理支持。

03 —

工作方法METHODS

四条能力线,彼此咬合:数据喂训练,评测验数据,Agent 提效一切。

M-01

数据生成与评估DATA

合成数据管线的设计者:出题、过滤、去重、组装全链路,用留存率和人工通过率控制质量,用 badcase 闭环驱动迭代。

双面投票风险分层验证badcase 种子闭环VLM 评分过滤
M-02

评测体系EVAL

benchmark 选型按能力维度映射;一致性排查做样本级 diff;反作弊设计(text-only 泄露 / 稀疏帧捷径 / 片尾泄露)必做。

口径五层固定样本级 diffanti-shortcut8 大问题簇
M-03

模型训练TRAIN

SFT / LoRA / 蒸馏压缩 / 分布式训练,训练与评估口径严格对齐;相信 dev−test gap 才是泛化信号,dev 绝对值是陷阱。

Megatron-LMFLCE 显存优化Vision LoRA防泄漏验证
M-04

Agent 工程化AGENT

把工作方式从手写驱动迁移到面向目标:先规划再实现、最小足够上下文、可执行可回收可验证的工作流。

opencode / codex省 token目标拆解自动回收
04 —

项目索引PROJECTS

六个主力项目,点击行展开。编号即目录:P-01 最新优先。

60 秒视频含 60–120 次起跳,要求每次定位误差 < 0.3s。从标注规范、数据集构建到分布式训练与开源评测接入的完整闭环。

  • 帧数是性能瓶颈:跳绳约 2 次/秒,128 帧下每次起跳仅 ~2 帧;扩到 960 帧覆盖全视频后,2B mAP 0.38 → 0.74,最严格 AP@0.1s 提升 3.6 倍。
  • 以小博大:4B 达 mAP 0.84,超 Qwen3-VL-8B 等 8B 模型 2.5 倍——领域微调 + 足够时间分辨率。
  • FLCE 显存优化:自研 Chunked Fused Linear Cross-Entropy,logits 峰值 39GB → 2.5GB,4B 从 TP=8 改 TP=1+DP=8,吞吐约 10 倍。
  • 防泄漏验证:训练/测试视频 md5 零重叠、时间戳序列零完全匹配,mAP 0.84 是真实泛化。
  • 训练:860 条 SFT、8×A100-80G(Megatron-LM + DeepSpeed);测试集开源为 JumpScore。
4B mAP 0.84 · AP@0.1s 0.771
显存峰值 15.6× 压缩(FLCE)
vs 8B 模型 2.5×(Qwen3-VL-8B 0.34)
标注精度 0.01s · 189 测试视频
SFTMegatron-LM时序定位开源

把通用长视频自动变成可评测的四选一 QA 集:贯通抽帧、出题、过滤、去重到组装,两条互补管线应对不同场景。

  • Pipeline A · 看帧出题:滑窗抽帧 → 多模态大模型出题 → 5 步双面投票过滤(text-only 剔除不看视频也能答的题 + video 验证),大规模多机分布式,gen/post 异步解耦。
  • Pipeline B · 看 caption 出题:大模型读全文出题 → 零成本规则筛选 → 风险分层视觉回验(E 选项抓幻觉、低风险 3 轮 / 高风险 5 轮全对)。
  • 吞吐优化 10/min → 101/min:修帧缓存路径 +90%、任务队列分片 +152%、worker 并发填满 +38%。
  • 提炼开源视频 bench「8 大问题簇」题型框架与反作弊检查(text-only 泄露 / 稀疏帧捷径 / 片尾泄露)。
人工通过率 92% / 95.1%(A / B 管线)
端到端吞吐 10×(10→101 / min)
覆盖规模 十万级 有题视频
数据管线分布式vLLM质量过滤

下游检测模型缺长尾人物(拐杖 / 轮椅 / 担架)样本:用图像编辑大模型在真实业务背景上「添加人物、保背景」批量合成,VLM 评分 + 双重校验自动过滤标注。

  • 八步全自动管线:VLM 场景分析出 position/clothing/action/bbox → 「Next Scene」prompt 约束编辑范围 → vllm-omni 批量生图 → Qwen3-VL-32B 0-100 评分 → 满分阈值筛选 → 双重 VLM 预标注校验。
  • 评分设计:「没生成」和「生成得差」解耦——缺失不扣分,姿态/结构问题才扣,满分阈值严格筛选。
  • 对标开源生图方案达其约 90% 综合性能(f1 0.698 vs 0.774),但全链路自动化、成本更低,适合大规模补量。
  • 工程排坑:多轮生图缓存变糊、LoRA 触发词失效、按类别差异化扩框(担架组上扩 30% 防漏检)。
端到端留存率 14.3%(一轮真实生产)
对标性能 ~90% f1 · 成本更低
单机产能 ~3.8k 张/天 · 多卡线性扩速
合成数据Qwen-Image-EditVLM 评分自动标注

一场控制变量实验回答三个问题:生图标注能否替代人工?同一工具交给不同角色差多少?badcase 数据闭环能否带来提升?

  • 反直觉结论:产品经理用生图工具效果最好(mAP50 0.831),算法人员反而最差(0.710)——domain knowledge 比技术能力更关键。
  • 结论直接支撑公司 AI 原生视觉产品的产品化决策:数据生产可下放到懂业务的业务侧 + 自动化流水线。
  • badcase 去重种子闭环:FP/FN 错例 → SigLIP2 特征 + UMAP 降维 + KMedoids 聚类 → 代表性种子定向再生成 → 回收再训练验证。
  • 数据规模扫描:最优管线 70% 数据量即达上限;细粒度诊断发现小目标 recall 卡 40%——堆量解决不了结构性短板。
最佳 mAP50 0.831 · 最差 0.710
数据上限 70% 数据量即达
闭环工具 SigLIP2+UMAP+KMedoids
实验设计YOLOv12badcase 闭环COCO

FFN 占模型约 2/3 参数与算力,是压缩最大靶点。这项工作不为证明它行,而是划清「结构压缩在哪里可行、注定失败」的边界。

  • 层敏感性:中间层替换 ΔPPL 仅 +3~10%,首层 +93%、末层 +49%——「中间层冗余、首末层关键」。
  • PPL 与准确率背离:末层 PPL +49% 但 cmmlu 零损失(83.2 vs 83.1);选层必须下游任务交叉验证。
  • 没有甜蜜点:安全区(1–3 层)FLOPs 只省 1–4%,提速区(11+ 层)省 14%+ 但精度指数崩溃——根因是推理 memory-bandwidth-bound。
  • SVD 零训练强基线 + NF4 量化对照;核心结论:结构压缩是量化的补充而非替代,只压 3–5 个最冗余中间层是唯一合理用法。
安全层预算 3–5 层 · 超出即崩
选对层后 PPL 波动 <0.01
评测对标 Qwen 官方口径 5 benchmark
模型压缩蒸馏lm-eval-harness消融

18 字段三层结构(主状态 / 时序动态 / 起止变化)的镜头语言生成式 SFT,30+ 实验沉淀出一套 dev−test gap 泛化诊断方法论。

  • Vision LoRA 夺冠机制:ViT 上加 rank16 小适配是唯一有效减 gap 机制——dev 0.6475 并非最高,但 gap +0.041 历史最小 → test 0.6066 反超夺冠。
  • dev 绝对值是陷阱,gap 才是泛化信号:首评曾按 dev 误判证伪,靠 submit 翻案。
  • hybrid 架构 fast path 提速 5.3×;训练后写 train_mode.json marker,推理自动恢复 flag,杜绝格式错配。
  • 系统性证伪:数据侧重采样、L3 拆分、focal loss 三条攻长尾路全死——L3 低分是任务难度天花板,非类别不平衡。
A 榜 0.6066 · 自留冠军
dev−test gap +0.041 历史最小
训练提速 5.3×(fast path)
多标签 SFTVision LoRA泛化诊断比赛
05 —

经历EXPERIENCE

三家公司,一条从语音到多模态的迁移线。

2023.10 — 至今

格灵深瞳算法工程师

多模态大模型方向:合成数据生产管线、视频 QA 评测集构建、benchmark 评测体系、SFT 微调与模型压缩;lmms-eval 开源贡献。

多模态数据管线评测SFT
2020.05 — 2023.09

天学网算法工程师

口语自动评测(核心业务,规则 + 模型 + 调分模块的评分系统);标点预测与不流利检测多任务建模(RoBERTa+CRF,标点 F1 73.24%、不流利 89.04%,已上线)。

口语评测NLP多任务上线
2017.07 — 2020.04

极限元算法工程师

ASR 语言模型定制化(医疗 / 金融 / 电力 / 机场场景,SRILM n-gram + 领域词典);银行外呼任务型对话系统(意图分类 + 槽位抽取 + FST 状态机)。

ASR对话系统N-gramFST
EDUCATION · 硕士中北大学 · 计算机科学与技术(2014–2017)
EDUCATION · 本科中北大学 · 信息管理与信息系统(2009–2013)
06 —

比赛ARENA

用比赛检验方法论的迁移能力。

19 / 367
芒果TV 影视镜头语言分析
A 榜 0.6066 · 自留冠军 · VLM SFT
29 / 664
CCKS2023 开放环境知识图谱构建与补全
初赛 · LLM 微调 / p-tuning
10 / 254
讯飞 中文语义病句识别与纠正
LLM 微调 / p-tuning
66 / 22667
天池 医学搜索 query 相关性判断
句子对分类
07 —

文章WRITING

把项目里的方法论写成可复用的笔记,整理中,将陆续发布。

2026.08
《VLM 图片 Benchmark 选型:MME / MMMU / MMBench / OCRBench / MMStar》
整理中
2026.08
《开源视频 Bench 的 8 大问题簇与反作弊设计》
整理中
2026.08
《评测链路的静默偏差:五层口径与样本级 diff 排查》
整理中
2026.08
《FFN 结构压缩:一条路的边界》
整理中