京东开源实时视频AI模型,一张RTX 4090就能本地部署

📡 AI新闻 2026-07-26 约 19 分钟阅读

京东开源实时视频AI模型,一张RTX 4090就能本地部署 一场火灾发生的瞬间,监控系统自动发出警报。独居老人在家摔倒,AI 立刻通知远方亲人。视障人士外出,智能眼镜实时解读周围环境。 这些不是科幻片——它们是京东刚开源的一个模型,让 AI 真正能"边看边说"了。 传统多模态模型还活在"一问

京东开源实时视频AI模型,一张RTX 4090就能本地部署

一场火灾发生的瞬间,监控系统自动发出警报。独居老人在家摔倒,AI 立刻通知远方亲人。视障人士外出,智能眼镜实时解读周围环境。

这些不是科幻片——它们是京东刚开源的一个模型,让 AI 真正能"边看边说"了。


传统多模态模型还活在"一问一答"里

先说说现在的大模型都是怎么工作的。

你上传一张图片,它分析。你提一个问题,它回答。你丢一段视频,它总结。一切从用户发起开始,也在用户结束对话时停止。

这个模式在图文问答、内容复盘、知识检索里够用。但如果 AI 要走进真实世界——走进你家的厨房、工地的监控室、独居老人的客厅——问题就来了:

真实世界里,没人会每秒钟都问"现在怎么样了?"

一个正在冒烟的锅不会等你问才爆炸。一个蹒跚学步的孩子不会等你登录系统才走向危险区域。直播里一闪而过的商品信息,不会等你暂停回放。

京东这次开源的 JoyAI-VL-Interaction,干的就一件事:让 AI 在视觉世界里持续"在场",像人一样主动判断什么时候开口。


三重突破,重新定义"实时视频AI"

先看它到底变了什么。

第一层:主动判断,不是被动回答

传统模型等用户提问才处理画面。JoyAI-VL-Interaction 不一样——它持续观察视频流,每秒自己做一次判断:该说话?该沉默?该交给后台处理?

你说"裁判出示红牌时提醒我",它就安静地守着画面。红牌一出,立刻预警。不用你再问一句"刚才发生了什么"

第二层:实时响应,不是事后总结

常见的视频理解是先录完再分析。但安防预警、直播翻译、烹饪指导这些场景——晚几秒,质变。

JoyAI-VL-Interaction 检测到变化就能响应。官方数据显示,端到端延迟控制在亚秒级。

第三层:Agent 委托,前台后台分着干

这个设计很有意思:前台模型持续看画面、判断开口时机;遇到生成代码、调用工具、复杂推理时,丢给后台大模型处理。

结果传回来,前台自然接回对话。前台负责在场感,后台负责干重活——更像一个实时操作员 + 超级大脑的协作系统。


评测数据很硬,不只是概念

京东拿 58 个真实场景做了人工盲评,对比的是国内头部的豆包视频通话和 Google Gemini:

维度 vs 豆包 vs Gemini
监控预警 100% 100%
实时翻译 80% 100%
长程视觉记忆 77.8% 77.8%
总体胜率 77.6% 87.9%

注意一个细节:在"监控预警"这个场景,对两个对手都是 100% 胜率

这其实不难理解——豆包和 Gemini 本质上还是"回合制"产品,你问一句它答一句。而 JoyAI-VL-Interaction 的交互能力长在模型内部,不依赖外部触发。一个是等着被叫的佣人,一个是自己会看场的保安,出发点就不同。


开源的不是模型,是一整套系统

很多开源模型只给推理代码。开发者想用起来,还得自己处理视频接入、语音交互、记忆模块、前后端协同——每个环节都能卡死人。

京东这次给的是完整技术栈:模型权重 + 400 万条时间对齐交互数据 + 训练方案 + 可部署系统。支持摄像头、直播流、监控流等多种视频输入,ASR、TTS、后台模型、可视化界面全部可插拔替换。而且获得 vLLM-Omni day-0 支持,拉起来就能跑。

Apache 2.0 协议,GitHub 发布当天就冲了 500+ Star。


部署指南:一张 RTX 4090 就能玩

我专门去查了整个部署流程和硬件需求,结论是:普通玩家完全能跑,门槛没有想象的那么高。

硬件要求速览

配置项 最低要求 推荐配置
GPU RTX 3090(24GB) RTX 4090(24GB)或更高
显存 ~10GB(FP8 量化) ~17GB(BF16 全精度)
系统内存 16GB 32GB+
存储 20GB 可用空间 50GB+(含多模型下载)
操作系统 Linux(CUDA 12.x + 驱动 535+) Linux
Python 3.10+ 3.12

关于显存,关键技巧是 FP8 量化:vLLM 支持在线 FP8,主模型显存从 16.8GB 暴砍到 9.9GB(-41%)。一张 RTX 3090(24GB)轻松兜住,甚至 RTX 4070(12GB)都有戏。

但注意 FP8 的代价——单流推理比 BF16 慢了约 19%,因为显存带宽瓶颈下 FP8 的动态缩放有额外开销。延迟敏感场景优先 BF16,显存不够就上 FP8,能跑比跑快重要

三步部署走

官方整个技术栈包含 5 个组件:主模型推理、WebUI 界面、ASR 语音识别、TTS 语音合成、后台 Agent。但最小部署只需要 2 个,上手门槛很低:

# 第一步:下载代码和模型
git clone https://github.com/jd-opensource/JoyAI-VL-Interaction.git
cd JoyAI-VL-Interaction
./install/download-models.sh --core

# 第二步:安装依赖
./install/install.sh --with-all

# 第三步:启动服务
./services/scripts/run.sh minimal

装完在浏览器打开 https://127.0.0.1:8099,接上摄像头就能用。

如果要在普通显卡上跑,启动时加一行 vLLM 的 FP8 参数就能大幅省显存。也可以用 vLLM-Omni 的独立部署方式,单 GPU 加 --quantization fp8 即可。

完整部署 vs 最小部署

最小部署(2 服务):主模型推理 + WebUI,适合快速体验和开发调试

完整部署(5 服务):增加 ASR(语音输入)、TTS(语音输出)、后台 Agent(复杂任务委派),官方推荐 3 张 GPU 跑满

多数场景下,最小部署已经够用——用摄像头看现场、WebUI 打字交互,体验的就是"实时在场"这个核心能力。想加语音再扩展不迟。

Windows 玩家能不能跑?

官方只写了 Linux,但模型本身基于 vLLM,vLLM 官方支持 WSL2 + CUDA。实测大概率能走通,就是多一步 WSL 环境配置。


个人观点:京东悄悄在视频赛道上做局了

说句实在话——京东在 AI 圈的存在感一向不如百度阿里。但翻一下今年 timeline:

四个月,从文本到图像到视频生成再到视频实时交互——京东在视频 AI 这个方向上已经形成了一条完整的产品线。

而且 JD 有别人没有的优势:仓储、配送、直播、客服——京东有全球最大的物理运营网络之一。这些场景每天产生的实时视觉数据,就是 JoyAI-VL 系列的天然训练场。

我不觉得一个 8B 模型能立刻叫板豆包和 Gemini 的全部能力。但这条路径很清晰:先靠"在场感"在垂直场景建立优势,再靠场景数据反哺模型能力。

对开发者来说,这可能是目前最值得上手的实时交互框架之一。不需要你有巨量算力,一张 RTX 4090 + vLLM 就能搭起来。监控预警、老人看护、直播导购、AI 眼镜——这些方向目前还是蓝海。


你知道现在哪个视频互动方向最缺好用的开源方案吗?

评论区聊聊,我看看大家对"实时AI在场"这个方向怎么看。

相关文章
2026-07-26
OpenAI模型安全测试失控,自主黑入Hugging Face
2026-07-26
三星考虑向Mistral AI投资10亿欧元,估值200亿欧元
2026-07-26
OpenAI上调2030年算力支出至7500亿美元,拟建200亿美元数据中心

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论