genpark-multimodal-spatial-audio-visual-grounding-skill

源码

Real-time Multimodal Spatial Audio-Visual Grounding Engine (inspired by Meta Ray-Ban & Meta Muse). Fuses 2D/3D visual bounding boxes, user head-pose gaze vectors, and acoustic beamforming azimuth angles into cross-modal focal salience scores and resolves deictic spatial references.

⭐ 7AI 生成Python仓库 ↗更新于 2026-09-30收录于 2026-10-04

安装配置

查看源码仓库 →

相关服务器