京东开源实时视频视觉语言交互模型JoyAI-VL-Interaction
6月22日消息,京东近日开源实时视频视觉语言交互模型JoyAI-VL-Interaction,这也是全球首个全栈开源的interaction模型和系统,并获得vLLM-Omni的day-0原生支持。它让大模型从“一问一答”走向“边看边说”,开发者基于这套框架,可以快速搭建能持续观察、自主判断、即时响应的实景AI助手,有望推动AI在物理世界发挥巨大作用。

京东开源的JoyAI-VL-Interaction,就是让AI像人一样持续“在场”:边看、边记、边判断,并在关键时刻主动回应,或选择性地交接给后台Agent。相比传统模型,JoyAI-VL-Interaction有三重突破:
1、主动判断,而非被动回答。传统模型通常要等用户发起问题,才开始处理当前画面,而JoyAI-VL-Interaction可以持续观察视频流,自主判断什么时候该说话,什么时候该沉默。
2、实时响应,而非事后总结。传统视频理解更多是上传完整视频后再分析,但在安防预警、实时翻译、直播解说、操作指导等场景里,晚几秒,体验和价值都会不同。而JoyAI-VL-Interaction面向正在发生的视频流,画面变化时就能响应。
3、适时智能体委托,同时保持观察和交互。JoyAI-VL-Interaction还具备后台任务委派能力与相关机制。当模型遇到生成代码、调用工具、复杂推理等任务时,可以交给后台大模型或Agent。前台模型继续观察现场,后台模型处理复杂任务,结果返回后再自然接回对话。它更像一套“前台实时助手+后台智能大脑”的协作系统:前台负责在场,后台负责干重活,有机会开启AI与人类协作的新范式。
据介绍,JoyAI-VL-Interaction开源的是完整技术栈,包括模型权重、交互数据集、训练方案和完整可部署系统,可以帮助开发者更快从模型研究走向真实场景落地。JoyAI-VL-Interaction支持摄像头、直播流、监控流等多种视频输入,也支持语音输入输出、可视化界面、长期记忆、后台模型接口和vLLM部署方案。ASR、TTS、可视化界面、后台模型、外部工具和业务模块,都可以按需替换。开发者可以接入自己的语音服务、Agent、API、业务系统或前端界面。
2、电商号平台仅提供信息存储服务,如发现文章、图片等侵权行为,侵权责任由作者本人承担。
3、如对本稿件有异议或投诉,请联系:info@dsb.cn