全球首款RISC-V 3D GPU即将亮相

RVGPU:一个基于RISC-V指令集实现的开源GPU RVGPU是一个基于RISC-V指令集实现的开源GPU项目,项目目标是提供一套完整的基于RISC-V指令集的开源GPU软硬件方案。rvgpu: 正在构建一套基于原生RISC-V指令集的GPU。目前已经发布 v0.2版本,可以支持简单的cuda程序在cmodel上运行。项目包含的代码仓库如下:rvgpu:项目的顶层仓库,通过git submodule的方式来管理所有子项目。rvgpu-cmodel:gpu的C模型,用来实现指令集、架构的仿真。 阅读详情

来源:内容由半导体行业观察(ID:icbank)编译自design-reus,谢谢。

据报道,超低功耗图形 IP 领导者 Think Silicon将在2022 年Embedded World上展示业界首款基于 RISC-V 的 GPU——NEOX™ G 系列和 A 系列。该公司还将推出 NEMA®|pico-VG,这是用于 MCU 驱动的 SoC 的 NEMA®|GPU 系列的最新产品,它支持丰富的矢量图形,并通过将 CPU 利用率降低高达 95% 来提高系统效率。

NEOX™ G 系列和 A 系列——智能 GPU 架构的新时代

NEOX™| G(图形)和 A(深度学习加速器)系列 IP 代表了智能 GPU 架构的新时代,可编程计算着色器在实时操作系统 (RTOS) 上运行并由轻量级图形和机器学习框架提供支持。通过使用相同硬件模块的可配置编程库,可以轻松针对图形、机器学习、视觉/视频处理和通用计算工作负载定制大量多线程系统。新产品作为一个 GPU 平台,将在 32 位 SoC 中实现,解决无数应用,包括下一代智能手表、增强现实 (AR) 眼镜、用于监控和娱乐的视频,以及用于销售点的智能显示器/交互终端。

NEMA®|pico-VG – 适用于功率、尺寸和成本受限产品的高性能图形

Think Silicon 的新型 NEMA®|pico-VG GPU 是最新添加的高性能和超低功耗图形,适用于电池驱动、功率受限的产品中的显示器。多核、矢量和 2.5D 光栅图形 GPU 在 0.21 平方毫米的微小硅片区域内支持 90-500MHz、70 fps 和 800x600 分辨率的时钟频率。在单个 IP 解决方案中结合硬件加速的矢量和光栅图形,使开发人员可以根据所显示的图形内容自由和灵活地选择最佳渲染技术。NEMA®|pico-VG 使用智能压缩算法来有效管理宝贵的内存空间,与纯软件解决方案相比,CPU 使用率最多可降低 95%。RTL 硬件模块和软件的结合使 NEMA®|pico-VG 成为智能手表、健身/GPS 追踪器和智能家居设备等功率、尺寸和成本受限产品中理想的高性能图形子系统。NEMA®|pico-VG 生产就绪型 RTL 预计将于 2022 年第四季度开始向客户发货。

“推出首款基于 RISC-V 的 GPU 是图形行业和 Think Silicon 的一个重要里程碑,”Think Silicon 的 IP 许可、销售和营销总监 Ulli Mueller 说。“我们的超低功耗、高性能图形解决方案旨在激发开发人员为各种产品和市场创造卓越的用户体验,同时显着降低能耗。我们期待在即将到来的嵌入式世界活动中展示我们的最新创新。”

在 Embedded World 上,Think Silicon 还将展出他们的 NEMA®|GUI-Builder,这是一种快速且易于学习的工具,使程序员能够通过使用拖放通用控件减少 SoC 平台 (MCU/MPU) 上的 GUI 开发时间和输入元素。NEMA®|GUI-Builder 通过利用 NEMA®|GPU 系列的强大 3D 功能,自动生成具有较小内存占用的功率和性能优化的 C 代码。NEMA®|GUI-Builder 包括 Think Silicon 的 NEMA®|GFX 软件 API 及其高效压缩技术 NEMA®|TSC,它也可以与非 Think Silicon GPU 一起使用。

RISC-V能改变GPU吗?

RISC-V能处理GPU的事务吗?这项工作正在进行中,可以通过创建一个具有自定义可编程性和可扩展性的小型区域高效设计来实现这一目标。

任何研究过GPU架构的人都知道这是矢量处理器的SIMD构造。它是一种超高效的并行处理器,已用于从运行模拟和出色的游戏到教导机器人如何获取AI以及帮助聪明的人操纵股票市场的所有事物。它甚至在我写这篇文章的时候检查我的语法。

但GPU领域已经成为一个私有领域,其内部工作是由AMD、Intel、Nvidia等开发者的IP和秘密武器所完成的。如果有一套新的图形指令设计为3D图形和媒体处理呢?嗯,可能有。

新的指令正在RISC-V基本向量指令集上构建。他们将根据核心RISC-V ISA的精神,添加对特定于图形的新数据类型的支持,作为分层扩展。支持向量,先验数学,像素和纹理以及Z / Frame缓冲区操作。它可以是融合的CPU-GPU ISA。lilibrary -RISC 3D组称它为RV64X (图1) ,因为指令将是64位长(32位将不足以支持一个健壮的ISA)。

7520d7c5fa75745ce1a12ecbdaf2809d.png

RV64X图形处理器除了专用的纹理单元和功能块外,还包括多个DSP。

该组织表示,他们的动机和目标是希望创造一个小型、高效的设计,具有自定义的可编程性和可扩展性。它应该提供低成本的IP所有权和开发,而不是与商业产品竞争。它可以在FPGA和ASIC目标上实现,并且是免费和开源的。最初的设计目标是低功耗微控制器,将兼容Khronos Vulkan,并支持其他api (OpenGL, DirectX等)。

  • GPU + RISC-V

目标硬件将有一个GPU功能单元和一个RISC-V核心。该组合以64位指令编码为标量指令的处理器的形式出现。关键在于编译器将从带前缀的标量操作码生成SIMD指令。其他功能包括可变问题、基于谓词的SIMD后端;分支跟踪;精确的异常;和矢量前端。设计将包括一个16位定点版本和一个32位浮点版本。前者适用于FPGA实现。

该团队说:“不需要使用RPC / IPC调用机制来将3D API调用发送到未使用的CPU内存空间或从未使用的CPU内存空间发送到GPU内存空间,反之亦然,”

“融合” CPU-GPU ISA方法的优势在于可以在微代码中使用标准图形管道,并且可以支持自定义着色器。甚至可以包括光线追踪扩展。

该设计将采用Vblock格式(来自Libre GPU的努力):

  • 这有点像VLIW(但不是真的)。

  • 指令块之前带有寄存器标记,这些标记为该块内的标量指令提供了额外的上下文。

  • 子块包括向量长度,旋转,向量/宽度覆盖和预测。

  • 所有这些都添加到标量操作码中!

  • 没有矢量操作码(也不需要任何操作码)。

  • 在矢量上下文中,它是这样的:如果标量操作码使用寄存器,并且该寄存器在矢量上下文中列出,则将激活矢量模式。

  • 激活会导致硬件级别的for循环发出多个连续的标量运算(而不只是一个)。

  • 实现者可以自由地以他们想要的任何方式来实现循环-SIMD,多问题,单执行;几乎任何东西。

RV32-V向量处理2到4个元素的8位,16位或32位/元素的向量操作。对于用于64位和128位固定和浮点XYZW点的常规3D图形渲染管线,还将有专门的指令。8、16、24和32位RGBA像素; 8位,每个组件16位UVW纹素;以及灯光和材质设置(Ia,ka,Id,kd,Is,ks等)。

属性向量表示为4×4矩阵。该系统将本地支持2×2和3×3矩阵。向量支持也可能适用于使用AI和机器学习应用程序中常见的8位整数数据类型的数值模拟。

设计中可以包含自定义光栅化器,例如样条线,SubDiv曲面和面片。该方法还允许包含自定义管线阶段,自定义几何/像素/帧缓冲阶段,自定义细分器和自定义实例化操作。

  • RV64X

RV64X参考实现包括:

  • 指令/数据SRAM缓存(32 kB)

  • 微码SRAM(8 kB)

  • 双功能指令解码器(实现RV32V和X的硬连线;用于自定义ISA的微编码指令解码器)

  • 四向量ALU(32位/ ALU-固定/浮动)

  • 136位寄存器文件(1k个元素)

  • 特殊功能单元

  • 纹理单位

  • 可配置的本地帧缓冲区

RV64X是可扩展的架构(图2)。它的融合方法是新的,对于自定义数据类型使用可配置寄存器也是如此。用户定义的基于SRAM的微代码可用于实现扩展,例如自定义光栅化器阶段,光线跟踪,机器视觉和机器学习。单一设计可以应用于独立的图形微控制器或具有可扩展着色器单元的多核解决方案。

1cc09e6546993d453f4a5d3b0a08fce6.png

RV64X可以从简单的低端设计(左)扩展到多核解决方案(右)。

RISC-V的图形扩展可以解决可伸缩性和多语言问题。这可以实现更高级别的用例,从而带来更多的创新。

  • 下一步是什么

RV64X规范仍在早期开发中,可能会发生变化。正在建立一个讨论论坛。近期目标是使用指令集模拟器构建示例实现。这将在使用开放源代码IP和设计为开放源代码项目的自定义IP的FPGA实现上运行。

首款集成3D GPURISC-V单板计算机:技术解析与开发指南 RISC-V作为一种开源指令集架构,正从微控制器领域向通用计算平台演进。其核心优势在于免授权费的设计自由度,使得芯片设计成本得以降低。这一特性为高性能、低成本的嵌入式解决方案提供了新的可能性,尤其在需要图形处理能力的边缘计算和桌面级应用中。GPU(图形处理单元)的集成是关键技术跨越,它通过专用硬件管线处理顶点着色、纹理映射等复杂任务,实现了从基础显示到流畅3D渲染的进化。结合开源驱动和图形栈(如Mesa 3D),RISC-V平台得以支持OpenGL ES等图形API,从而拓展至数字标牌、嵌入式人机界面(HM 阅读详情

相关推荐

一场关于未来“AI算力“的盛宴:Hot Chips 2025全景解读

每年夏末,全球最受关注的芯片大会之一——Hot Chips 热芯片大会,都会在美国斯坦福大学召开。今年的Hot Chips 2025于8月24日至26日在硅谷Memorial Auditorium隆重举办。历时三天,会议包括2场专题教程、2场重要主题演讲、一个高端讨论Panel、以及约25场技术报告,涵盖了从处理器设计、网络、光互连,到AI芯片、系统架构等领域。

AI_gurubar的博客 2848

NemaGFX 图形库使用文档

NemaGFX 图形库使用文档,NemaGFX 图形库使用文档,NemaGFX 图形库使用文档,NemaGFX 图形库使用文档

STM32U5 GPU2D图形加速系统深度解析与工程实践

嵌入式图形加速是现代MCU人机交互的核心能力,其本质依赖于硬件加速器(如GPU2D)、内存子系统(PSRAM/HyperRAM)、缓存一致性(DCACHE2)与统一地址映射的协同设计。原理上,通过AXI总线实现零拷贝DMA访问、同频时钟域保障时序确定性、内存池化分配满足物理地址可控性,从而释放2D图形渲染的高吞吐与低延迟价值。典型应用场景涵盖工业HMI、汽车仪表盘、医疗设备UI及TouchGFX等GUI框架加速。本文聚焦STM32U5平台,深入剖析GPU2D初始化、NemaGFX端口层实现、帧缓冲区配置、双

weixin_35829279的博客 237

NEMA_p GPU:2022年dc电源与VerilogSystemVerilog实现 v3.0

内容概要:本文深入探讨了NEMA_p GPU在2022年的直流(DC)电源设计及其基于Verilog/SystemVerilog的具体实现方法。文章详细介绍了GPU的关键组件如并行计算单元、内存控制器及时钟树的设计细节。并行计算单元采用独特的MAC运算方式,内存控制器利用SystemVerilog接口进行高效的数据传输,而时钟树则实现了动态时钟分频控制。此外,还展示了用于验证和测试的脚本技巧,强调了硬件工程师在设计过程中融入的独特创意和技术挑战。 适合人群:对GPU硬件设计感兴趣的电子工程专业学生、研究人员以及从事FPGA/ASIC开发的技术人员。 使用场景及目标:①理解现代GPU架构下各个关键模块的工作原理;②掌握SystemVerilog语言特性及其在实际项目中的应用;③学习如何通过巧妙的设计提升系统性能。 其他说明:文中不仅提供了具体的代码片段供读者参考,还分享了许多实用的经验和技巧,有助于加深对复杂硬件系统的认识。同时提醒开发者关注一些潜在的问题,比如跨时钟域通信中的亚稳态现象。

RISC V (RV32+RV64) 架构 整体介绍

riscv RTOS 基于rv32 的 freertos 基于rv64 的 rt-thread(非官方) 基于rv64 的 rt-thread(官方) [基于rv32 的 rt-thead(非官方)](-TODO

u011011827的博客 1万+

开源RISC-V或将重塑GPU格局

RISC-V一直以其开源特性而备受业界关注。不过,一直以来,RISC-V相关IP主要集中在CPU领域,而事实上,它也可以用在GPU领域。你我都知道,GPU领域几乎被一两家企业所统治,这是因为GPU领域生态是最大的壁垒。加之专利门槛极高,GPGPU(通用GPU)IP在图形处理领域一直不温不火。最近几年,业界开始探索通过扩展和改写RISC-V CPU指令集,来制造GPU

dpwkj的博客 707

GOTC 2023 全球开源技术峰会圆满落幕

​ 近日,全球开源技术峰会(GOTC)在上海张江科学会堂圆满落幕。GOTC 2023 是由开放原子开源基金会、Linux基金会亚太区、上海浦东软件园和开源中国联合发起的,面向全球开发者的一场盛大开源技术盛宴。 ​

csdn_linuxprobe的博客 137

美团以 20.65 亿人民币收购光年之外;OpenCV 4.8.0 发布|极客头条

「极客头条」—— 技术人员的新闻圈!

极客日报 1万+

“芯聚合肥 智链全球

2027中国(合肥)国际半导体与集成电路产业展览会将于5月18-20日在合肥滨湖国际会展中心举办。展会聚焦半导体全产业链,设置IC设计、制造、封测、材料设备、第三代半导体等七大展区,涵盖芯片设计、晶圆制造、先进封装、关键设备及材料等核心领域。上届吸引300余家知名企业参展,本届将全面升级,打造集技术展示、商贸对接、学术交流于一体的国际化平台,助力半导体产业协同创新。展会立足合肥"中国IC之都"产业优势,面向新能源汽车、AI算力、新型显示等应用领域,促进产业链上下游深度合作,推动半导体产业

2603_96771556的博客 201

GOTC 2023圆满落幕,openKylin带你玩转开源峰会

朱晨表示,截至目前,openKylin社区单位会员超200家,社区活跃用户超80万,社区开发者超3000名,并自主搭建超20个社区基础设施平台,实现从源码到镜像100%自主构建,以及社区开发过程自动化,有效降低社区贡献者的开发门槛,提升社区开发效率、代码和版本质量。,基于openKylin的开源实践历程,介绍了麒麟团队在内核、桌面环境、关键应用等领域的开源创新成果,并分享麒麟团队在开源技术研发、开源社区建设、开源人才培养等方面的实践经验。,展示开源项目、周边商品,交流开源技术、开源理念及开放协作方式。

openKylin的博客 249

RV32I-GPU:RV32I开源GPU

RV64X RV64X旨在创建和提供具有RISC-V派生架构的开源GPU。 ••••• 关于该项目 我们希望使小型公司能够开发专用的处理器和GPU,而无需支付专利使用费。 对于基于RISC-V的片上系统(SoC),有许多免费和商业IP构建块,但是该产品组合缺少图形选项,因此我们决定开发和提供基于RISC-V架构的开源GPU。 主要特点 RV64X设计的GPU使用基本的RV32I或RV64I内核,这些内核支持基于基本向量指令集的新指令。 最初,它将使用RV32I内核,随后,将使用RV64I内核替换它。 基本的RISC-V内核将支持: 新的图形和机器学习特定的数据类型,包括标量和矩阵; 向量/数学指令; 像素/纹理说明; 帧缓冲区指令; 一个特殊的寄存器集(具有可配置的136位向量寄存器); 一些特定于图形的指令; 图形核心将支持Vulkan API,但该小组致力于使其成为Di

美团以 20.65 亿人民币收购光年之外;ChatGPT 涉嫌信息盗窃被起诉;OpenCV 4.8.0 发布|极客头条...

「极客头条」—— 技术人员的新闻圈!CSDN 的读者朋友们早上好哇,「极客头条」来啦,快来看今天都有哪些值得我们技术人关注的重要新闻吧。整理 | 梦依丹出品 | CSDN(ID:CSDNnews)一分钟速览新闻点!美团以 20.65 亿人民币收购光年之外微信支付就校园支付费率过高致歉上海 AI 实验室开源全球首个医疗基础模型群网易游戏行业首推AI巡逻员,24 小时候护航未成年人暑期游戏安全RISC...

CSDN资讯 658

Oxmiq Labs Inc.™:重新架构GPU技术栈——从原子到智能体(From Atoms to Agents™)

OXMIQ持有Mihira的少数股权,并将通过为Mihira的电影级AI平台提供动力的核心智能体和GPU知识产权技术,继续支持其发展。经过两年的密集知识产权开发,该公司正式结束隐身模式亮相。Raja组建了一支世界级的GPU与AI架构师团队,团队成员累计拥有超过500年的行业经验,持有数百项专利,在过往任职的公司中总计创造了逾1000亿美元的收入。OXMIQ借鉴数十年的行业发展经验,秉持“软件优先”战略,通过兼容OXMIQ知识产权硅芯片及第三方GPU与AI加速器平台的综合软件栈,优先提升开发者体验。

美国商业资讯的博客 1063

汽车芯片,竞逐新周期

举个简单的例子,在Chiplet的系统级架构设计下,通过2.5D/3D堆叠等先进封装技术,使用10nm工艺制造出来的芯片可以达到7nm芯片的集成度,同时研发投入和一次性生产投入则比7nm芯片的投入要少的多。同时,芯片设计公司会根据不同的系统规格和应用场景,采用不同类型的IP进行组合,并搭配自主研发的定制IP。而在成本方面,以AMD为例,通过Chiplet的设计思路,除了能够降低40%的制造成本,还可以更加灵活地销售服务器芯片,根据需要添加和移除小芯片,并能针对不同的功能选项制定不同芯片的价格区间。

高工智能汽车 938

RISC-V技术变革:一颗芯片,CPU与GPU合二为一

RISC-V技术变革:一颗芯片,CPU与GPU合二为一

2203

图文移植LVGL9.3.0到STM32F429

最新LVGL V9.3 版本移植到STM32,对关键内容进行详细解释和说明。

butfly的专栏 7198

Vortex: 一种基于RISC-V指令集自定义扩展的开源GPGPU架构

关于开源gpgpu结构vortex的调研报告

wwzzwwzzjjjj的博客 7571

RV32/64 特权架构

唉,mepc, mcause,mtval 和 mstatus 这些控制寄存器只有一个副本,处理第二个中断的时候 如果软件不进行一些帮助的话,这些寄存器中的旧值会被破坏,导致数据丢失。可抢 占的中断处理程序可以在启用中断之前把这些寄存器保存到内存中的栈,然后在退出 之前,禁用中断并从栈中恢复寄存器。这两种新模式都比user mode有着更高的权限,有更多权限的模式通常可以使用权限较低的模式的所用功能,并且它们还有一些低权限模式下不可用的额外功能,例如处理中断和执行 I/O 的功能。

major的博客 1853
上一篇: FPGA基础之逻辑单元(LE or LC)的基本结构
下一篇: “福建舰”航母下水!这些顶尖高校,为国立功!
Hack电子
博客等级 码龄5年 0粉丝 29原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值