相关链接:
AI语音智能体架构解析(二)大模型(AI 的大脑)-CSDN博客
AI语音智能体架构解析(三)智控台(指挥中心)-CSDN博客
AI语音智能体架构解析(四)AI 语音终端(执行器官)-CSDN博客
AI语音智能体架构解析(五)小程序/APP(遥控器)-CSDN博客
推荐链接:
AI 应用 图文 解说 (一) -- 百度智能云 实现 语音 聊天-CSDN博客
AI 应用 图文 解说 (二) -- 百度智能云 ASR LIM TTS 语音AI助手程序 -CSDN博客
推荐链接:
开源 python 应用 开发(一)python、pip、pyAutogui、python opencv安装-CSDN博客
开源 python 应用 开发(二)基于pyautogui、open cv 视觉识别的工具自动化-CSDN博客
开源 python 应用 开发(三)python语法介绍-CSDN博客
开源 python 应用 开发(四)python文件和系统综合应用-CSDN博客
开源 python 应用 开发(五)python opencv之目标检测-CSDN博客
开源 python 应用 开发(七)数据可视化-CSDN博客
开源 python 应用 开发(十一)AI应用--百度智能云ASR短语音转文本-CSDN博客
开源 python 应用 开发(十二)AI应用--百度智能云Agent聊天-CSDN博客
开源 python 应用 开发(十三)AI应用--百度智能云TTS语音合成-CSDN博客
开源 python 应用 开发(十四)python快速建设网站-CSDN博客
推荐链接:
开源 Arkts 鸿蒙应用 开发(一)工程文件分析-CSDN博客
开源 Arkts 鸿蒙应用 开发(二)封装库.har制作和应用-CSDN博客
开源 Arkts 鸿蒙应用 开发(三)Arkts的介绍-CSDN博客
开源 Arkts 鸿蒙应用 开发(四)布局和常用控件-CSDN博客
开源 Arkts 鸿蒙应用 开发(五)控件组成和复杂控件-CSDN博客
推荐链接:
开源 java android app 开发(一)开发环境的搭建-CSDN博客
开源 java android app 开发(二)工程文件结构-CSDN博客
开源 java android app 开发(三)GUI界面布局和常用组件-CSDN博客
开源 java android app 开发(四)GUI界面重要组件-CSDN博客
开源 java android app 开发(五)文件和数据库存储-CSDN博客
开源 java android app 开发(六)多媒体使用-CSDN博客
开源 java android app 开发(七)通讯之Tcp和Http-CSDN博客
开源 java android app 开发(八)通讯之Mqtt和Ble-CSDN博客
开源 java android app 开发(九)后台之线程和服务-CSDN博客
开源 java android app 开发(十)广播机制-CSDN博客
开源 java android app 开发(十一)调试、发布-CSDN博客
开源 java android app 开发(十二)封库.aar-CSDN博客
推荐链接:
开源C# .net mvc 开发(一)WEB搭建_c#部署web程序-CSDN博客
开源 C# .net mvc 开发(二)网站快速搭建_c#网站开发-CSDN博客
开源 C# .net mvc 开发(三)WEB内外网访问(VS发布、IIS配置网站、花生壳外网穿刺访问)_c# mvc 域名下不可訪問內網,內網下可以訪問域名-CSDN博客
开源 C# .net mvc 开发(四)工程结构、页面提交以及显示_c#工程结构-CSDN博客
开源 C# .net mvc 开发(五)常用代码快速开发_c# mvc开发-CSDN博客
模块一:大模型(AI 的“大脑”)详细总结
模块一主要阐述了大语言模型(LLM)作为 AI 语音智能体核心“大脑”的关键作用。大模型负责理解和生成自然语言,是赋予智能设备“听懂人话、说人话”能力的核心引擎。
1. 大模型在语音智能体中的四大核心能力
大模型在语音交互链路中承担着四个维度的关键任务,通俗而言构成了智能体的“耳、脑、思、嘴”:
- ASR(语音识别)——“耳朵”:负责将用户的语音输入精准转换为文字。
- NLU(语义理解)——“大脑”:负责深度理解文字背后的含义与用户真实意图。
- LLM(对话生成)——“思考”:根据理解到的意图,结合上下文生成合理的回复内容。
- TTS(语音合成)——“嘴巴”:负责将生成的文字回复转化为自然流畅的语音进行播报。
2. 一次完整对话的工作流程
大模型驱动了一次对话的完整闭环链路,其标准工作流为:
用户说话 → ASR语音识别(转文字) → NLU语义理解(提取意图) → LLM生成回复(生成文本) → TTS语音合成(转为语音) → 播放回答。
例如:用户说“开灯”,系统识别为“开灯”,理解意图为“开灯”,生成回复“好的,已开灯”,合成语音后播放给用户。
3. 本项目对接的大模型云端平台
为了满足不同场景的需求,本项目的固件工程通过编译宏切换,支持对接四大主流云端大模型平台:
- 小智云(XiaoZhi):作为系统的默认云端平台,支持 MCP 协议与 WebSocket 通信。
- 七牛云(Qiniu):深度支持 MCP 协议,特别适用于智能马桶等外设控制场景。
- 酷旗云(COS):自带 SDK 库,支持茶吧机等设备的 MCP 控制。
- 讯飞云(Xunfei):提供强大的语音识别与合成能力,支持 SNTP 授时、鉴权及 WebSocket 通信。
大模型(AI 的大脑)&spm=1001.2101.3001.5002&articleId=163140543&d=1&t=3&u=a5d4ba63dc20427e9213e4c266aef3db)
86

被折叠的 条评论
为什么被折叠?



