vm · 第一人称视频稠密转写 LoRA
配套推理代码:https://github.com/worldEngineDev/Anno-inference
把第一人称视频转成每 0.5 秒一条动作短语。本仓库只含 LoRA 适配器(16 MB); 底座是 Qwen/Qwen3.5-9B。
拉
huggingface-cli download HenghuiB/vm --local-dir ./checkpoints
用
见推理仓 README。要点:必须设 FPVA_NATFULL=1(这个 ckpt 训自 natfull 格式,
用别的格式评它会低约 14 点且不报错),推理需要约 70 GB 显存。
是什么
r1_natfull_step1500 —— 3.9 M LoRA 参数,挂 8 层注意力,
在 EPIC-KITCHENS-100 上训 1500 步。同批 26 条实验臂里最好的一个。
| 逐格名词正确率 | 变化点召回 | 覆盖 | |
|---|---|---|---|
| 49.92% | 59.9% | 98.6% | 本 ckpt |
| 45.58% | 62.6% | 96.6% | 同臂 step 3000(训更久更差) |
| 40.41% | 62.0% | 96.1% | 解冻视觉 projector |
已知边界
只在厨房第一人称视频上验过;逐格约 50% 正确率; 同一件事会在近义说法间换口(推理仓的事件通道能消掉一部分)。 详见推理仓 README。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support