聆思CSK6大模型多模态语音交互开源SDK介绍

ID:1124148 · 发表于 2024-6-13 15:35

聆思CSK6大模型多模态SDK除了支持语音交互之外，还支持图像方面的交互，包括对图像的识别以及图片生成。用户可以通过语音交互、摄像头拍照作为交互入口，实现与大模型的多模态交互。

SDK主要包含以下功能：

●语音交互：支持按键录音或唤醒后通过语音与大模型进行对话

●拍照识图：支持通过摄像头拍摄图像并上传给大模型进行识别，支持依据识图内容进行提问

●图片生成：支持通过语音交互描述画面内容，令大模型生成图片并显示至套件屏幕上

语音交互模式支持的语音交互模式

多模态SDK支持三种交互方式，其特点如下：

模式	唤醒方式	交互方式
按键交互	按下屏幕麦克风图标或开发板K3按键	按住按键说话，松开提交
语音唤醒(单轮)	唤醒词 “小美小美”	听到提示音 “在呢” 后进行提问，每次提问均需要唤醒
语音唤醒(多轮)	唤醒词 “小美小美”	听到提示音 “在呢” 后进行提问，可持续对话，当超过20秒无语音输入时自动结束本次交互