教程
文章平均质量分 73
小白狮ww
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
当 Claude 思考链注入 Qwen3.5-9B:轻量化模型兼具推理质感
摘要:Emperor开源Qwythos-9B-Claude-Mythos-5-1M模型,解决本地大模型部署三大痛点。该模型基于Qwen3.5-9B深度训练,采用500M+高质量ClaudeMythos数据优化推理能力,在MMLU评测提升34分,数学推理提升30分。支持1M超长上下文处理,遵循工具调用规范,且无内容审查限制。用户可通过OpenBayes云平台快速部署,提供从克隆教程到运行Demo的完整指南,适用于技术文档分析、代码处理等专业场景。原创 2026-07-17 18:19:11 · 278 阅读 · 0 评论 -
DiffusionGemma 利用离散文本扩散与多画布并行去噪,生成速度大幅提升
DiffusionGemma 是 Google DeepMind 推出的高效文本生成模型,采用离散扩散和 MoE 架构(26B总参数 / 3.8B 活跃参数),实现块级并行生成而非传统逐 token 输出。其特色包括:单卡 H100 可达 1100+tokens/s 的极速生成、256K 长上下文支持、通过特殊标记触发逐步推理。原创 2026-06-26 17:04:59 · 205 阅读 · 0 评论 -
AutoFigure:让 AI 接管论文插图生成
西湖大学 ResearAI 团队推出的 AutoFigure(ICLR2026)为科研绘图提供了高效解决方案。该系统可根据文字描述或直接解析论文 PDF 自动生成符合发表标准的学术插图(如模型流程图),支持 SVG 矢量图和 mxGraphXML 格式输出,并具备生成-审稿迭代优化功能。原创 2026-06-26 14:41:52 · 249 阅读 · 0 评论 -
基于 Legged Gym 的强化学习:7 种机器人的 PPO 训练实践
LeggedGym 是一个基于 IsaacGym 的腿足机器人强化学习仿真框架,大幅降低了该领域的研究门槛。它将 PPO 等主流 RL 算法封装成统一接口,支持7种典型机器人控制任务(包括四足机器狗、双足机器人等),开发者只需专注奖励函数设计。通过 OpenBayes 平台可快速部署该环境,教程详细展示了从环境配置到 7 种机器人训练任务启动的全流程,包括二阶倒立摆、Anymal 系列四足机器人、Cassie 双足机器人等不同场景的训练方法,支持 GPU / CPU 运行和实时 3D 渲染观察训练过程。原创 2026-06-26 13:33:28 · 286 阅读 · 0 评论 -
3B 参数,毫秒级响应:LocateAnything 如何重新定义开放世界目标检测
NVIDIA 最新推出的 LocateAnything-3B 模型通过创新的 ParallelBoxDecoding 技术实现了视觉语言定位的效率突破。该技术采用并行预测替代传统逐 token 坐标生成,处理速度达到 12.7 框/秒,较自回归方法提升 10 倍,在开放目标检测、OCR、GUI 元素识别等场景中表现优异。模型支持图像/视频全域定位及自然语言指代,显著改善定位精度与效率。原创 2026-06-12 19:39:21 · 321 阅读 · 0 评论 -
600 + 语言背后:OmniVoice 如何重塑 AI 语音生成
AI语音技术已从基础语音合成进阶到跨语言音色克隆新阶段。小米 AILab 开源的 OmniVoice 模型突破传统 TTS 限制,支持600+语言统一建模,实现三大创新:1)3-10 秒音频即可克隆音色;2)通过自然语言指令自定义音色特征;3)跨语言语音克隆,保留原声说多国语言。该技术还支持方言、口音及长文本处理,适用于数字人、有声书等场景,推动 AI 语音跨越语言边界。用户可通过 OpenBayes 平台快速部署体验该模型。原创 2026-06-12 19:39:16 · 215 阅读 · 0 评论 -
个人学习助手 DeepTutor:把论文检索、做题和学习规划一次打通
当下AI学习工具竞争激烈,香港大学推出的DeepTutor实现了学习全流程自动化。这款工具依托多Agent架构整合多项学习功能,还兼备检索、查文献、代码运行等能力,是功能全面的智能学习助手。原创 2026-06-01 16:23:35 · 312 阅读 · 0 评论 -
告别只会对话的 Agent:OpenClaw 把「执行力」补上了
【摘要】OpenClaw 是一个集成模型、记忆与执行能力的 AI 系统,能够自动完成多步骤任务。与普通Agent不同,它通过统一运行环境实现任务闭环,用户只需输入指令,系统即可自主调用工具、执行流程。原创 2026-04-17 18:06:02 · 437 阅读 · 0 评论 -
当大模型开始「处理长上下文与多模态任务」:Gemma 4 31B it 的统一建模思路
摘要:Google DeepMind 推出的 Gemma-4-31B-it 模型在技术资料整理中展现出显著优势,其基于Gemini3 技术体系,强化了长上下文建模与推理能力。该模型支持 256K 上下文和图文输入,能一次性完成原本需要人工逐步推进的复杂任务,大幅提升工作效率。原创 2026-04-17 17:47:00 · 276 阅读 · 0 评论 -
3 秒出全纹理!TRELLIS.2 实现单图生成高分辨率 3D 资产
微软开源TRELLIS.2模型突破单图3D生成瓶颈,采用创新O-Voxel稀疏体素表示和16倍空间压缩技术,实现高质量3D资产快速生成。该模型支持PBR材质推理和多分辨率配置,解决传统方法几何粗糙、纹理不一致等问题,适用于3D内容生产、AR/VR等场景。用户可通过OpenBayes平台一键运行教程,上传图像即可生成并导出GLB格式3D资产。原创 2026-04-10 19:38:19 · 386 阅读 · 0 评论 -
Phi-4 Reasoning Vision 15B 让多模态图文推理进入「可落地、轻量、专业」新时代
微软发布的Phi-4ReasoningVision15B是一款突破性的多模态推理模型,采用150亿参数架构,实现图文信息的同步处理与联合推理。该模型创新性地融合SigLIP-2视觉编码器和Phi-4-Reasoning语言模型,支持高达3,600个视觉token的动态分辨率处理,可精准解析图表和界面元素。原创 2026-04-07 19:52:30 · 210 阅读 · 0 评论 -
160亿的参数,GLM-Image让AI绘图听懂人话
现在的 AI 画图工具,像极了手艺精湛却耳背的 Tony 老师——你说招牌写开业大吉,他画出一串连考古学家都破译不了的符号。开源,为了好用而不只是能用,由智谱华章以开源形式发布的 GLM-Image 打破「高性能=闭源收费」的潜规则。毕竟,我们要的不是抽卡式的运气游戏,而是能听懂复杂需求的靠谱搭档。页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。原创 2026-02-13 16:37:32 · 284 阅读 · 0 评论 -
要给 OCR 装个脑子吗?DeepSeek-OCR 2 让文档不再只是扫描
新设计的 DeepEncoder V2 架构引入了因果流机制:视觉编码器看完整个页面后,由专门的查询模块决定阅读顺序——标题优先于正文,表格注释紧跟数据,公式按逻辑展开而非按位置罗列。更实用的是,它输出的 Markdown 已经带着层级结构,省去了大量后期整理的功夫。当一个模型能够同时看懂版式、识别文字并直接输出结构化结果,文档数字化的目标就不再只是「能认字」,而是「能理解」。对于需要批量处理文档的场景,这意味着可用性的大幅提升。页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。原创 2026-02-06 18:29:23 · 291 阅读 · 0 评论 -
Ovis-Image:卓越的图像生成模型
你是否还在为无法得到自己心中想要的画面发愁?现在由 AIDC-AI 团队发布了 Ovis-Image 模型解决了大部分问题。原创 2026-01-30 18:49:39 · 273 阅读 · 0 评论 -
当 OCR 模型开始「理解整页文档」:HunyuanOCR 的端到端之路
腾讯混元团队推出的 HunyuanOCR,是一款 1B 参数的端到端 OCR 多模态模型,尝试在一个模型中同时完成文本定位、识别与结构理解,摆脱对传统流水线式拼接的依赖。在能力层面,HunyuanOCR 不仅具备高精度的文字识别与定位,还可以直接进行文档解析,自动恢复标题、段落和层级结构,并以 Markdown 等形式输出结果,使扫描文档能够直接进入编辑和二次处理流程。点击「继续执行」,等待分配资源。同时,模型支持从文档中抽取关键信息,用于合同、表单等场景,并能基于文档内容进行视觉问答。原创 2025-12-19 19:04:04 · 398 阅读 · 0 评论 -
abaqus 算例教程:考虑动水压力的 koyna 地震非线性动力响应分析
Abaqus 简介Abaqus 是一款功能强大的有限元分析 (FEA) 软件,广泛应用于工程模拟领域。它通过有限元方法对各种工程问题进行模拟和分析,能够处理从简单的线性问题到复杂的非线性问题。Abaqus 最初于 1978 年发布,由 Hibbitt, Karlsson & Sorensen, Inc.(HKS) 开发,后更名为 ABAQUS 公司,并于 2005 年被达索系统 (Dassault Systèmes) 收购。教程简介混凝土重力坝的抗震分析。原创 2025-12-19 18:49:00 · 742 阅读 · 0 评论 -
Matlab 教程:基于 RFUAV 系统使用 Matlab 处理无人机信号
在通信安全与频谱监测中,基于射频 (RF) 数据的无人机识别系统被广泛研究。RFUAV 项目通过频谱图分析、信噪比估计等手段,对无人机的 IQ 信号进行分析处理。本项目在 OpenBayes 平台上使用 MATLAB 实现 RFUAV 的关键流程,完成 .mat → .dat 数据转换、频谱图可视化、SNR 估计及分段裁剪等任务。该教程基于浙江理工大学、杭州电子科技大学等研究团队于 2025 年发布的论文「原创 2025-12-12 19:31:08 · 764 阅读 · 0 评论 -
挥手点亮圣诞:AI 3D 魔法树教程
但如果你想让节日过得更「有科技味儿」,今年有个更酷的选择——一棵能听懂你手势、会展示你的照片、还能随你指挥聚散旋转的「3D Christmas Tree」。如果你放入了更多照片(例如从默认的 31 张增加到 100 张),需要打开文件:dependencies.sh,将看到:export VITE_TOTAL_PHOTOS=31,修改数字「31」为你的图片数量,然后关闭容器再次启动即可。更有趣的是,你可以把自己的照片放进 photos 文件夹里:top.jpg 会出现在树顶,1.jpg、2.jpg ……原创 2025-12-11 18:51:52 · 1000 阅读 · 0 评论 -
当视觉模型开始「懂你所指」:SAM3 的能力远超你想象
对研究者、创作者乃至普通用户来说,SAM3 让「图像理解」第一次变得如此自然、灵活,也让视觉交互的可能性远远超出以往。方式——文本、示例与视觉提示——让模型能主动理解你的意图,并在图像与视频中执行高精度检测、分割与目标跟踪。若显示「Bad Gateway」,这表示模型正在初始化,由于模型较大,请等待约 2-3 分钟后刷新页面。,可在未见过的类别上直接工作,并将分割能力延伸到 3D 场景,用于空间预览、结构分析与创意编辑等任务。首先点击「公共教程」,找到「SAM3:视觉分割模型」,单击打开。原创 2025-12-08 17:13:41 · 983 阅读 · 0 评论 -
32B 参数还能本地跑?Flux.2-dev 这次是真的把「大模型」玩明白了
更让人惊讶的是,它明明有 32B 参数,却因为量化和推理优化做得非常激进,居然能在 RTX 5090,甚至更低显存的显卡上轻轻松松跑起来。能画、能改、能融合,角色风格还不跑偏,让整个创作流程变得快、稳、省心。的出现就像突然给你塞了一把真正能干活的 AI 瑞士军刀——一句话能画图,一张图能修改,几张参考图还能自动融合成统一风格,整套流程一个模型就走通了,再也不用东拼西凑。过去的开源图像模型有点像一柜子分科工具:这一个负责生成,那一个负责编辑,想让角色不崩还得再上个微调模型,流程又长又碎。原创 2025-12-08 17:01:57 · 757 阅读 · 0 评论 -
lammps 教程:npt 控温估计 FCC Cu 熔点
LAMMPS 全称为 Large-scale Atomic/Molecular Massively Parallel Simulator,是一种经典的分子动力学仿真代码,专注于材料建模。它旨在在并行计算机上高效运行,并且易于扩展和修改。LAMMPS 最初由美国能源部机构桑迪亚国家实验室开发,现在包括来自许多机构的许多研究小组和个人的贡献。LAMMPS 的大部分资金来自美国能源部 (DOE)。LAMMPS 是根据 GNU 公共许可证版本 2 (GPLv2) 的条款分发的开源软件。原创 2025-12-05 18:26:26 · 819 阅读 · 0 评论 -
给你一个新视角看世界——Depth-Anything-3
在五大数据集构成的几何基准上,DA3 对深度、几何、位姿、渲染四大指标全面刷新记录,甚至小模型版本都能打赢别人家大模型 —— 这性能,妥妥「打小怪兽像打蚊子」级别的。它的潜力也很让人上头:无论是机器人需要看清路、AR/VR 需要理解空间、无人机想认清地形,还是想把普通相机变成「会理解世界的 3D 传感器」,DA3 都能轻松胜任。换句话来说,DA3 就像给普通相机开了「空间透视外挂」,把原本平面的画面变成可理解、可计算的 3D 世界。容器状态显示为「运行中」后,点击「API 地址」,即可进入模型界面。原创 2025-12-01 10:37:32 · 811 阅读 · 0 评论 -
从几秒走向几分钟:长视频生成进入 LongCat 时刻
LongCat-Video 基于 136 亿参数的视频生成大模型,同时支持文字转视频、图片转视频和视频续写,让创意能够持续往前推进。它不是只会做几秒炫酷短片,而是从训练阶段就融入了长时序逻辑,让光影不飘、角色不丢、剧情不突兀,几分钟的视频也能顺畅连贯。效率方面也非常能打:720p、30fps 的长视频几分钟即可生成,再配合强化学习不断提升文本对齐、画质与动作一致性,让开源模型也能拥有行业级竞争力。首先点击「公共教程」,找到「LongCat-Video:美团开源的AI视频生成模型」,单击打开。原创 2025-12-01 10:26:03 · 1195 阅读 · 0 评论 -
LAMMPS 教程:以单晶铝为例,模拟材料单轴拉伸
LAMMPS(Large-scale Atomic/Molecular Massively Parallel Simulator)是一种经典的分子动力学仿真代码,专注于材料建模。它旨在在并行计算机上高效运行,并且易于扩展和修改。LAMMPS 最初由美国能源部机构桑迪亚国家实验室开发,现在包括来自许多机构的许多研究小组和个人的贡献。LAMMPS 的大部分资金来自美国能源部(DOE)。LAMMPS 是根据 GNU 公共许可证版本 2(GPLv2)的条款分发的开源软件。原创 2025-11-27 17:53:09 · 800 阅读 · 0 评论 -
DiffVox:让人声音效风格迁移进入「可控、轻量、专业」的新时代
模型在生成阶段会迭代搜索最符合目标风格的效果特征,使输出在听感上逼近专业混音棚的质感,同时具备可控性与可解释性。换句话说,DiffVox 并不是又一套「黑箱式音频效果器链」,而是一种能够在推理阶段重塑音色与效果分布的智能人声处理方案——让「让干声拥有目标混音质感」成为一件可控、轻量、且具专业水准的事。相比传统依赖离线训练或固定效果链的方案,DiffVox 无需复杂工程流程,也无需手动调参,即可实现跨风格的自动化人声重塑,为创作者提供轻量而一致的声音处理体验。点击「继续执行」,等待分配资源。原创 2025-11-21 09:07:15 · 754 阅读 · 0 评论 -
目标再多也不怕!YOLOv13 把复杂场景「看穿了」
它由清华大学、太原理工大学与西安交通大学团队于 2025 年 6 月发布,它在延续 YOLO 家族高效架构的基础上,引入超图增强表示、高阶语义感知、轻量化结构重构等关键技术,使模型在感知上下文关系、捕捉细粒度特征与处理复杂背景方面显著增强,实现了从图像到目标结构的更稳定、更精确的检测推理。换句话说,YOLOv13 并不是 YOLO 的一次常规升级,而是一套真正面向现实世界的「实时视觉解决方案」——让模型不仅跑得快,还能看得清、分得明、用得稳。页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。原创 2025-11-21 08:57:35 · 480 阅读 · 0 评论 -
VASP 教程:VASP 机器学习力场计算硅的声子谱
是一个计算机程序,用于从第一性原理进行原子尺度材料建模,例如电子结构计算和量子力学分子动力学。Phonopy()是一款用于在简谐和准简谐水平下计算声子能带结构、热学性质、群速度以及其他与声子相关物理量的 python 工具包。本次教程我们将使用自动化脚本来进行机器学习力场演示计算流程。原创 2025-11-21 08:39:43 · 865 阅读 · 0 评论 -
表格、公式、图像全搞定!MonkeyOCR 让 AI 真正「读懂」文档
与传统方法相比,MonkeyOCR 在处理复杂文档时表现尤为突出——平均性能提升 5.1%,在公式与表格解析上分别提升 15.0% 和 8.6%,多页文档推理速度达到 0.84 页/秒。在智能文档理解领域,如何让模型既能「看懂」复杂排版,又能「理清」逻辑结构,一直是技术难题。换句话说,MonkeyOCR 不只是识别文字的 OCR,它更像一个能「读懂文档逻辑」的智能解析引擎——让 AI 从看得见文字,迈向看得懂结构。容器状态显示为「运行中」后,点击「API 地址」,即可进入模型界面。原创 2025-11-13 17:55:23 · 655 阅读 · 0 评论 -
双人对话生成模型 MOSS 上线,支持零样本语音克隆
MOSS-TTSD 基于 Qwen3-1.7B-base 模型进行继续训练,采用离散化的语音序列建模方法,在约 100 万小时单说话人语音数据和 40 万小时对话语音数据上进行训练,因此它能够一次性生成长达数十分钟的连贯语音,更是为 AI 播客、有声书和虚拟角色配音打开了全新的大门。进入 Demo 界面后,首先选择界面语言,然后输入要合成的文本,输入模式选择「Single」则需上传包含一个角色的音频;点击「继续执行」,等待分配资源。,在「公共教程」页面,选择一键部署 「MOSS:文本到口语对话生成」教程。原创 2025-11-13 17:44:24 · 472 阅读 · 0 评论 -
模型不再是一整块!Hunyuan3D-Part 实现可控组件式 3D 生成
实际流程中,你可以先用混元 3D 生成整体模型,再用 Hunyuan3D-Part 一键拆分,例如汽车模型自动分成车身、轮组、车灯,或角色模型拆成身体与装备,方便绑定、替换和组合,直接用于游戏、数字资产甚至 3D 打印。这个阈值控制合并的强度。在 3D 创作里,「整体模型难拆难改」 是许多人都遇过的麻烦:模型看起来完整,但一旦想换个车轮、调下护甲、给角色换个头盔,就会发现——整个 Mesh 黏成一块,牵一发动全身。换句话说,它让过去「一体成型的 3D 模型」,变成了可以像乐高一样拆、改、拼的结构化模型。原创 2025-11-07 19:43:05 · 561 阅读 · 0 评论 -
北大 & UCLA 推出 ROCKET-2,AI 助力 3D 游戏零样本迁移
5.选择好之后,再次回到「Launch Rocket」,点击下方的「Setting Panel」选择模型,然后点击「Set」设置。登录 OpenBayes.com,在「公共教程」页面,选择一键部署 「ROCKET-2:3D 游戏零样本迁移」教程。待系统分配好资源,当状态变为「运行中」后,点击「API 地址」边上的跳转箭头,即可跳转至 Demo 页面。3.之后进入「Launch Rocket」点击「Reset」加载环境。页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。原创 2025-11-07 19:27:37 · 480 阅读 · 0 评论 -
VASP 教程:使用 VASP 进行机器学习力场训练
是一个计算机程序,用于从第一性原理进行原子尺度材料建模,例如电子结构计算和量子力学分子动力学。与从头算分子动力学(MD)结合使用的机器学习力场(Category:Machine-learned force fields - VASP Wiki),能够从第一性原理出发捕捉底层物理机制,同时仍能以相对较低的计算成本实现长时间模拟。通常,由于需要对电子进行量子力学处理,例如在密度泛函理论(DFT)框架下,单次从头算分子动力学步骤的计算成本极高。原创 2025-11-05 15:56:18 · 1295 阅读 · 0 评论 -
成品不再是终点:Paints-Undo 让绘画步骤可视化
该模型由 lllyasviel 在 2024 年发布,可以将一张完成的图像作为输入,推断出绘制时可能经历的关键阶段:打草稿、勾线、上色、细化、调整色彩,甚至构图思路的改变。「Operation Steps」:可以选择输出的关键帧次序,选择的次序越大,生成的图像越相似于原图。「FPS」:可以改变生成视频的帧率,默认为 4 帧,即每秒视频包含四张生成的图像。「CFG Scale」:可以控制生成图像的随机性,该值越小生成的图像随机性越高。「Prompts」:填写正面提示词,可以提升生成图像的质量和内容。原创 2025-11-05 09:02:46 · 535 阅读 · 0 评论 -
中科院团队发布首个国产类脑脉冲大模型 SpikingBrain-1.0,推理效率达百倍提速
瞬悉 1.0(SpikingBrain-1.0)」核心功能特点在于通过模仿大脑神经元的工作机制,在处理超长序列任务时,能实现惊人的效率和速度提升,同时大幅降低能耗和数据需求。其最新发布的「瞬悉1.0(SpikingBrain-1.0)」类脑脉冲大模型,借鉴大脑神经元的工作机制,成功绕过了传统 Transformer 架构的能效瓶颈,为长序列处理这一业界难题提供了全新的解决方案。登录 OpenBayes.com,在「公共教程」页面,选择一键部署 「瞬悉 1.0:基于内生复杂性的类脑脉冲大模型」教程。原创 2025-10-28 18:47:17 · 561 阅读 · 0 评论 -
dots.ocr 基于 1.7B 参数实现多语言文档处理,性能达 SOTA
在这个信息爆炸的时代,我们每天面对堆积如山的文档、报告和表格,如何让机器真正读懂这些复杂排版下的文字信息,始终是技术领域的核心挑战。传统的 OCR 解决方案往往需要多个模块拼凑而成,流程繁琐且容易出错,尤其是在处理多语言混排或复杂版式时,更是力不从心。点击「继续执行」,等待分配资源。登录 OpenBayes.com,在「公共教程」页面,选择一键部署 「dots.ocr:多语言文档解析模型」教程。待系统分配好资源,当状态变为「运行中」后,点击「API 地址」边上的跳转箭头,即可跳转至 Demo 页面。原创 2025-10-28 18:32:02 · 269 阅读 · 0 评论 -
清华联合字节推出 HuMo,实现三模态协同生成人物视频
如今文本生成图像与视频已不再是天方夜谭。然而,当大多数模型仍在为生成画面的清晰度与稳定性而努力时,一个更为棘手的挑战浮出水面:如何精准、一致地生成以「人物」为核心的高质量视频?对此,清华大学与字节跳动联合推出了一个名为 HuMo 的统一 HCVG 框架。它专为「创造人」而生,旨在攻克这一核心难题。HuMo-17B 真正实现了「三位一体」生成。它不再仅仅依赖文本指令,而是将文本、图像与音频三大模态融为一体,作为驱动视频生成的源泉。原创 2025-10-21 16:21:04 · 699 阅读 · 0 评论 -
LiveCC 首个视频解说大模型开源,比赛视频也能轻松拿捏!
新加坡国立大学 Show Lab 与字节跳动公司于 2025 年 4 月 25 日推出了 LiveCC 模型,这是一个专注于大规模流式语音转录的视频大语言模型项目,旨在通过创新的视频 - 自动语音识别(ASR)流式方法训练出首个具备实时评论能力的视频大语言模型。进入 Demo 页面后,首先上传一段视频,选择「Real-Time Commentary(实时字幕)」,按下回车开始运行。待系统分配好资源,当状态变为「运行中」后,点击「API 地址」边上的跳转箭头,即可跳转至 Demo 页面。原创 2025-10-21 15:56:47 · 508 阅读 · 0 评论 -
小米开源端到端语音模型 MiMo-Audio-7B-Instruct 语音智能与音频理解达 SOTA
想象一下,当语音模型不仅能听懂你的话,还能根据你所给出的例子进行举一反三,搞定全新的语音任务。小米最新推出的 MiMo-Audio-7B-Instruct 做到了这一点。这全都归功于它首次将大语言模型领域的「涌现」能力和「少样本学习」能力移植到了语音模型上。MiMo-Audio-7B-Instruct 基于创新预训练架构和上亿小时训练数据,打破了语音领域依赖大规模标注数据的瓶颈。在开源模型的语音智能与音频理解基准测试中均达到了 SOTA 水平。原创 2025-10-17 18:40:28 · 1120 阅读 · 0 评论 -
即时克隆!NeuTTS-Air 引领语音生成新路径
NeuTTS-Air 是 Neuphonic 公司于 2025 年 10 月发布的一款专为设备端语音生成(on-device TTS)设计的模型,系统基于 0.5B 参数 Qwen LLM 主干,融合 NeuCodec 音频编解码器,具备少样本语音学习能力,可在仅 3 秒参考音频的条件下克隆说话人音色,并实时生成自然语音。换句话说,NeuTTS-Air 并不是又一个「云端 TTS 模型」,而是一套能在本地完成语音克隆的端侧解决方案——让「 让 AI 说出你的声音」真正变成一件私有、即时、可控的事。原创 2025-10-15 18:32:44 · 669 阅读 · 0 评论 -
专为高效文档转换设计,Granite-Docling-258M 小体量干大事成为文档处理「小助手」
Granite-Docling-258M 能与 Docling 库无缝集成,提供强大的定制化和错误处理能力,适用企业级文档处理,是文档处理领域的强大工具。点击「继续执行」,等待分配资源。,在「公共教程」页面,选择一键部署 「Granite-docling-258M:轻量多模态文档处理模型」教程。待系统分配好资源,当状态变为「运行中」后,点击「API 地址」边上的跳转箭头,即可跳转至 Demo 页面。进入模型后,首先点击「Upload Image」上传一张图片,然后对图片提出问题,模型就会做出对应的回答。原创 2025-09-26 19:27:13 · 284 阅读 · 0 评论
分享