京东开源实时视频视觉语言交互模型JoyAI-VL-Interaction

6月22日 16:40
作为全球首个全栈开源的视觉交互系统,该模型获得vLLM-Omni日级原生支持,旨在推动大模型从被动问答转向对实时视频流的持续观察与自主响应。

京东于6月22日正式开源JoyAI-VL-Interaction实时视频视觉语言交互模型,这是全球首个全栈开源的交互式视觉模型及其配套部署系统。该系统的发布标志着人工智能交互模式从传统的“用户上传后分析”或“一问一答”式被动响应,转变为能够持续观察实时视频流、自主判断介入时机并即时响应的主动模式。官方强调,该系统获得vLLM-Omni框架的day-0原生支持,允许开发者利用其构建具备长期记忆和复杂推理能力的实景AI助手。

在技术架构上,JoyAI-VL-Interaction实现了三重核心突破。首先是主动判断机制,模型不再依赖用户指令触发,而是持续读取摄像头、直播流或监控画面,自主识别关键事件(如火情预警、老人摔倒)并主动提醒,无异常时自动保持静默。其次是实时响应能力,系统直接面向正在发生的视频流进行处理,克服了传统技术需等待完整视频上传后复盘的延迟缺陷,满足安防、实时翻译及直播解说等对时效性要求极高的场景需求。三是前台观测与后台协作机制,当遇到代码生成、复杂推理或工具调用等高难度任务时,模型可将特定任务委托给后台Agent处理,前台模型则维持对现场的持续观察,待后台任务完成后无缝接续对话,实现观察与交互的并行工作流。

在扩展性与兼容性方面,该框架支持多种视频输入源及语音输入输出,其ASR、TTS、可视化界面、长期记忆模块及外部工具均可按需替换。开发者可接入自有业务系统与API,灵活定制安防监控、电商导购、AI眼镜及无障碍辅助等应用。根据京东公布的测试数据,在涵盖监控预警、实时翻译及时间感知等58个流式场景的真人盲评中,该模型在总体胜率及复杂视觉触发交互表现上领先同类产品。这一开源方案为科研探索及产业级应用提供了新的技术路径,推动了AI助手在物理世界中的实际落地。