genpark-multimodal-spatial-audio-visual-grounding-skill
源码Real-time Multimodal Spatial Audio-Visual Grounding Engine (inspired by Meta Ray-Ban & Meta Muse). Fuses 2D/3D visual bounding boxes, user head-pose gaze vectors, and acoustic beamforming azimuth angles into cross-modal focal salience scores and resolves deictic spatial references.