跳转至

离在线大模型对话SDK版本介绍


CI13XX_SDK_LLM_AIoT_V3.0.19

版本 3.0.19

本次更新(离在线 CI130X_SDK_LLM_AIOT_V3.0.19 版本修改项):

核心更新: 本版本围绕降噪效果、VAD(语音检测)、AEC(回声消除)方案及系统稳定性进行了全面优化,并引入了多项新特性,以提升产品性能和成本效益。

1、 降噪模型升级

  • NN降噪模型升级为ANS1-061模型,云端asr识别提升10%左右。
  • 增加降噪强度系数可配置

2、 NN VAD升级

  • NN VAD算法升级:解决了上一版本远程触发困难的问题,能到5m人声触发;同时,进一步减少了噪声下的误触发。

  • 增加VAD有效性检测模式可选:

前置检测: 待确认语音有效后,回退缓存录音再上传。优点:减少云端无效数据的传输;缺点:实时不足。

后置检测: 实时上传语音,异步通知有效性检测结果,云端收到无效性结果关闭当前识别任务。

流式识别建议选择后置,非流式识别选择前置

3、 AEC算法升级

  • AEC后的残留更低,避免将播报声上传云端

  • 在音乐播报-20dB信回比下,识别提升15-20%左右;在tts合成人声播报下,识别提升5%左右

  • 新增双麦+AEC硬件方案:支持“数字双麦+模拟麦右通道”作为参考回路,相比传统模拟双麦方案,可节约一颗外部Codec成本。

  • 增加AEC维纳降噪系数可配

  • 提供与AEC相关的mic通道和参考通道ADC增益的检测和配置建议的工具,方便调试。

4、 识别性能与稳定性提升

  • 离线ASR模型从1.1MB PRO2模型升级1.1MB PRO5模型。PRO5模型相对PRO2模型采用了更高压缩比,模型参数扩大了一倍,识别效果更好;高噪声下能提升20%以上。
  • 平衡误识别率和识别率,误识别更低

5、 DOA算法升级

  • 支持GCC DOA,实时检测每句话或每个命令词说话人的角度;检测稳定性提升,但相比NN DOA 10度精度变为22.5度精度。
  • NN DOA 模型提升中,下一个版本集成进来。

CI13XX_SDK_LLM_AIoT_V2.2.7

版本 2.2.7

本次更新(离在线 CI130X_SDK_LLM_AIOT_2.2.7 版本修改项):

一、精简播放器(simple_audio_player)

  1. 修复精简播放器云端超时结束、以及播放结束后,误收到 02 0B 数据写入释放后的流缓存复位问题;增加判断条件,结束后限制写入。
  2. 修改精简播放器提前请求两帧播放数据,提高播放开始速度。
  3. 新增精简播放器流缓存申请失败的日志提示;删除开始播放时动态申请的 2K 内存;云端播报删除等待数据延时 25ms,统一在读取流缓存接口等待超时。
  4. 修改精简播放器开启动态 PA 的播报问题,以及开启动态 PA 的组合播报问题。
  5. 新增精简播放器 MP3 每帧大小判断,够一帧的大小才会拿去解码;适配 CBR(固定比特率)、VBR(可变比特率)和 ABR(平均比特率)三种模式。
  6. 解决精简播放器 ID3 头过大无法播报,以及无 ID3 头无法播报的问题。
  7. 精简版播放器 MP3 目前支持采样率 48kHz、码率 190kbps,高码率需要更多内存。
  8. 修复高码率 MP3 播放结束后出现滋滋声的问题。

二、VAD 与半双工

  1. 修改半双工下 VAD 期间收到播放数据、VAD 底层逻辑关闭,导致播放结束后才收到 VAD END 的问题,在云端播放开始时清除 VAD。
  2. 新增「VAD 期间识别到本地命令词,是否结束 VAD」的宏(LOCAL_REC_VAD_END_ENABLE)。
  3. IIS、HPOUT 工程增加 VAD 开关逻辑:可选上电开始检测或者唤醒后开始检测 VAD,并输出 VAD START 和 VAD END 串口指令。

三、算法

  1. DOA 增加输出角度:将计算得到的角度通过串口指令发送给 WIFI 端。
  2. AEC 修改 faiE bug、进入与 ALC 开关逻辑(新增 ci_ss_aec_alc_state 状态)。
  3. 修正所有板级单端差分以及数字增益,确保 REF 回路为单端、数字增益为 6.0。
  4. 增加自学习状态时,云端播报时退出自学习的逻辑。
  5. 增加命令词自学习:修复学习词条满后,再次学习没有进入学习模式也会开启 aec_mute 导致不能识别的问题,修改为学满后不关闭 AEC。
  6. opus 节约 10K 内存。
  7. 增加算力不足的打印。
  8. 自查问题修复:双麦使用 AEC 时,修改 alc_off_codec_adc_gain_mic 无法改变 AEC 处理时 mic 增益的问题。

四、工程与全局宏

  1. 新增 IIS_sample 支持双麦板子,播报在 WIFI 端做播报。
  2. IIS 工程增加通过指令开始播报的宏控制(IIS_DOWNLOAD_BY_CMD),HPOUT 工程增加上电后开始录音的宏控制(HPOUT_UPLOAD_IS_WAKEUP)。
  3. UART、IIS、HPOUT 工程增加上下行、串口通信、本地播报和云端播报的全局宏开关控制,可灵活配置。
  4. 语音模块串口增加注释(离在线目前不使用)。
  5. hpout 工程增加 IIS 采音。
  6. uart 工程增加 OTA 读取版本号指令。
  7. 修复 OTA 获取软件版本号指令 bug。
  8. 解决 IIS、hpout 采音开始 write 的前几秒会有丢帧问题。
  9. 修复 hpout 复位问题,板级文件 IIS1 output codec 数据单通道改为双通道。
  10. 解决上电收到 WIFI 串口、流缓存未初始化导致复位的问题。

五、OTA 与打包工具

  1. 更新 OTA 到 V4.1.12(参考 external\ota参考\启英泰伦OTA V4.1.X 使用和协议说明文档(软件版本V4.1.12);该目录在 V3.0.19 起更名为 external\ota_reference)。
  2. 更新 PACK_UPDATE_TOOL 版本到 4.0.7;更新 bootloader 默认禁用掉所有串口,解决串口频繁发数据频繁进串口中断导致 bootloader 无法起来的问题。

CI13XX_SDK_LLM_AIoT_V2.1.2

版本 2.1.2

本次更新:

  1. 新增offline_asr_llm_aiot_iis_sample示例工程,该工程主要通过iis输出算法处理后的音频到wifi芯片,为了匹配该工程,由于iis输出不能缓存和延时,所以方案不能进行VAD回退,无法使用VAD,唤醒后就开始上传音频,只能云端做VAD;下行IIS播放音频
  2. 修改本地识别逻辑,在识别到本地命令后,停止云端超时计时器
  3. 修复全双工VAD不停止在线播放、上行不压缩、下行MP3播放时,播放器播放下行MP3时,起VAD后,出现MP3解码错误的问题
  4. 修复默认播发器开启PLAYER_CONTROL_PA宏后,在线播放PA未开导致没声音的问题

CI13XX_SDK_LLM_AIoT_V2.0.5

版本 2.0.5

本次更新:

  1. 解决DOA+AEC+降噪算法组合内存分配导致开机卡死问题
  2. 对DOA功能进行升级,准确率:0-180度范围内准确率达到90%,DOA新增麦间距7cm、8cm的前端模型
  3. 新增offline_asr_llm_aiot_hpout_sample示例工程,该工程主要通过hpout输出算法处理后的音频到wifi芯片,为了匹配该工程,将串口上传工程offline_asr_alg_pro_sample更名为offline_asr_llm_aiot_uart_sample,由于hpout输出不能缓存和延时,所以方案不能进行VAD回退,无法使用VAD,唤醒后就开始上传音频,只能云端做VAD;该方案不做播报,播报功能需WIFI端实现,WIFI端需要将参考信号接入语音芯片的ref
  4. 新增能量统计接口(幅度值和DB值同时输出)
  5. 新增精简版播放器,当前统计节省15KB内存,通过宏USE_AUDIO_PLAYER_TYPE控制
  6. 新增精简播放器G722格式播放与压缩上传,并新增精简播放器下行PCM、G722+本地播报的方案选择
  7. 生产测试逻辑更新,通过指令直接测试micl、micr、refl、refr通道能量值

初始版本:CI13XX_SDK_LLM_AIoT_V1.0.10

该版本支持离线语音唤醒和命令词识别、VAD端点检测、离线语音上传、在线语音播放(mp3/pcm)、speex/opus编解码、OTA在线升级等功能