vm · 第一人称视频稠密转写 LoRA

配套推理代码:https://github.com/worldEngineDev/Anno-inference

把第一人称视频转成每 0.5 秒一条动作短语。本仓库只含 LoRA 适配器(16 MB); 底座是 Qwen/Qwen3.5-9B

huggingface-cli download HenghuiB/vm --local-dir ./checkpoints

见推理仓 README。要点:必须设 FPVA_NATFULL=1(这个 ckpt 训自 natfull 格式, 用别的格式评它会低约 14 点且不报错),推理需要约 70 GB 显存。

是什么

r1_natfull_step1500 —— 3.9 M LoRA 参数,挂 8 层注意力, 在 EPIC-KITCHENS-100 上训 1500 步。同批 26 条实验臂里最好的一个。

逐格名词正确率 变化点召回 覆盖
49.92% 59.9% 98.6% 本 ckpt
45.58% 62.6% 96.6% 同臂 step 3000(训更久更差)
40.41% 62.0% 96.1% 解冻视觉 projector

已知边界

只在厨房第一人称视频上验过;逐格约 50% 正确率; 同一件事会在近义说法间换口(推理仓的事件通道能消掉一部分)。 详见推理仓 README。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support