女娲算法,杀疯了!

提升AI Agent能力的上下文技术 模型能力决定Agent的天花板,上下文工程才是决定真实业务落地表现的地板。 阅读详情

今天分享一个「多模态」算法 NÜWA(女娲)。

ecc961a932edc6e004f2f6e8c26d3da5.png
8项典型的视觉生成任务

论文的开头,就放出了效果,NÜWA 包揽了 8 项经典的视觉生成任务的 SOTA。

论文表示,NÜWA 更是在文本到图像生成中“完虐” OpenAI DALL-E。

碾压各种对比的算法效果,杀疯了!

NÜWA 效果

我们先看下 NÜWA 这算法在 8 项经典的视觉生成任务中的表现。

Text-To-Image(T2I)

文字转图片任务,其实就是根据一段文字描述,生成对应描述的图片。

比如:

A dog with gogglesstaring at the camera.

一只戴着护目镜,盯着摄像机的狗。

f0d8cf440e91a6db6853e25dd6c7c269.png

还有更多效果:

59eb80e8e6d3bd52afa143c283e4541b.png

NÜWA 生成的效果看起来就没那么违和,从论文的效果看,很真实!

9afcf0034dd49ee9bb3a4f55e31303d4.png

效果非常 Amazing。

Sketch-To-Image (S2I)

草图转图片任务,就是根据草图的布局,生成对应的图片。

0b78bf1ac24bd5167d74f8a5fe473d14.png

比如:

在一张图片上,画个大致轮廓,就可以自动“脑补”图片。

de01efe45f81b31bdc960195bb1db4fd.png

这效果真是开了眼了,真实效果真如论文这般的话,那确实很强。

de3dd4591b69f7137bb3cd5c63ce6025.png

这个算法,可以用在很多有意思的场景。

Image Completion (I2I)

图像补全,如果一副图片残缺了,算法可以自动“脑补”出残缺的部分。

a39b6bdc4436565b96c17c1e10308572.png

好家伙,是不是又有一些大胆的想法了?

7191e1fbf0bd4d77a6ace4be32c324f3.png

这个遮挡还算可以,还有更细碎的。

8d37a2184b0a02ec37b12f287e8241b3.png

图片碎成这样,还能“脑补”出画面,我很期待代码。

Image Manipulation (TI2I)

图片处理,根据文字描述,处理图片。

比如:

有一副草原的图片,然后增加一段描述:

a horse is running on the grassland

一匹马奔跑在草原上,然后就可以生成对应的图片。

9167f515c19c71e0f9940c3c4aeace19.png

这惊人的理解力。

ed2b0930ed8abaf687973a9d8c92caf2.png

这让我想起来了 P 图吧大神,恶搞的作品。

03ac9d1d2768ee462d5ef62b23190238.png

有了这个算法,咱也可以试一试了,哈哈。

Video

这还不算完,除了上述的生成图片的四种效果,NÜWA 还可以生成视频!

8d8808a7d8b88b33a0167aa48ea02ead.png

对应的四种视频生成任务:

  • Text-To-Video (T2V)

  • Sketch-To-Video (S2V)

  • Sketch-To-Video (S2V)

  • Video Manipulation (TV2V)

既可以玩图片又可以玩视频。

bc0f7e351d1776b82e72a4751fa91ec9.gif

NÜWA 原理

NÜWA模型的整体架构包含一个支持多种条件的 adaptive 编码器和一个预训练的解码器,能够同时使图像和视频的信息。

对于图像补全、视频预测、图像处理和视频处理任务,将输入的部分图像或视频直接送入解码器即可。

ae4753efdf4fd7ca278e4c1babc83ee9.png

而编码解码器都是基于一个3D Nearby的自注意力机制(3DNA)建立的,该机制可以同时考虑空间和时间轴的上局部特性,定义如下:

b48602c96db02854253594285ec7b63b.png

W 表示可学习的权重,X 和 C 分别代表文本、图像、视频数据的 3D 表示。

3DNA 考虑了完整的邻近信息,并为每个 token 动态生成三维邻近注意块。注意力矩阵还显示出 3DNA 的关注部分(蓝色)比三维块稀疏注意力和三维轴稀疏注意力更平滑。

0fa01349dc2577ad19c3bdebd3c03954.png

更多细节,可以直接看论文:

论文地址:

https://arxiv.org/abs/2111.12417

NÜWA 代码

NÜWA 的代码还没有开源,不过 Github 已经建立。

Github:

https://github.com/microsoft/NUWA

作者表示,很快就会开源:

c875dd9f73aec28f4233bde471f599a8.png

公司有开源审批流程,代码也得梳理下,所以可以先 Star 上标记下,耐心等等。

微软亚研院和北大联合打造的一个多模态预训练模型 NÜWA,在首届微软峰会上亮相过。

这种应该不会鸽的~

总结

今年算是多模态 Transformer 大力发展的一年,从各种顶会的论文就能看出,各种多模态。


另外送一份算法进击指南给大家:70K Star 的《labuladong 的算法小抄》(作者 labuladong)。

先来给你们看看里面具体都有哪些内容:

7824a4461c4d3e6f9433a912c3cb6371.png

现在这本 PDF 免费分享给你,你可以扫描下方公众号回复 算法 来领取这本 PDF。

点击👆👆👆卡片,关注后回复【算法】,即可获取

推荐阅读:
入门: 最全的零基础学Python的问题  | 零基础学了8个月的Python  | 实战项目 |学Python就是这条捷径
干货:爬取豆瓣短评,电影《后来的我们》 | 38年NBA最佳球员分析 |   从万众期待到口碑扑街!唐探3令人失望  | 笑看新倚天屠龙记 | 灯谜答题王 |用Python做个海量小姐姐素描图 |碟中谍这么火,我用机器学习做个迷你推荐系统电影
趣味:弹球游戏  | 九宫格  | 漂亮的花 | 两百行Python《天天酷跑》游戏!
AI: 会做诗的机器人 | 给图片上色 | 预测收入 | 碟中谍这么火,我用机器学习做个迷你推荐系统电影
小工具: Pdf转Word,轻松搞定表格和水印! | 一键把html网页保存为pdf!|  再见PDF提取收费! | 用90行代码打造最强PDF转换器,word、PPT、excel、markdown、html一键转换 | 制作一款钉钉低价机票提示器! |60行代码做了一个语音壁纸切换器天天看小姐姐!|

年度爆款文案

点阅读原文,看200个Python案例!

告别WSL!实测AMD ROCm7预览版在Windows下跑ComfyUI,速度提升避坑全记录 本文详细记录了在Windows原生环境下部署AMD ROCm7+PyTorch+ComfyUI的全流程,相比WSL环境性能显著提升。涵盖硬件兼容性确认、开发环境配置、Python环境搭建、ComfyUI部署优化及性能对比测试,为AI绘图爱好者提供实用指南 阅读详情

相关推荐

<工控><PLC>汇川Easy521系列PLC汇川SV630N伺服进行EtherCat通讯的相关配置及指令编写

本系列是关于PLC相关的博文,包括PLC编程、PLC上位机通讯、PLC下位驱动、仪器仪表等通讯、PLC指令解析等相关内容。PLC品牌包括但不限于西门子、三菱等国外品牌,汇川、信捷等国内品牌。除了PLC为主要内容外,PLC相关元器件如触摸屏(HMI)、交换机等工控产品,如果有值得记录的内容,也会添加进来。

用沸腾的热血,支付我们的人生吧! 2万+

“AGI 五年内或将实现”:AI 教父 Bengio 呼吁中美达成共识,警惕 AI 沦为人类武器

三是目标,它必须有自己的目的。在题为《如何从失控的 AI “心智”中拯救人类的未来》的主旨演讲中,他直言:具备行动能力的 AI 一旦失控,可能引发系统性灾难,输家只会是全人类。那一刻,我下定了决心:我要调整我的研究方向,改变我所有的工作重心,把全部的精力投入到一个目标上——尽我所能去降低这项技术可能带来的风险。但也不免让人隐隐担忧:当我们满心期待 AGI 代的到来,畅想着 AI我们解决一切难题,另一个更棘手的问题也在浮现——如果有一天,它不再听从人类的指令,那该由谁来“踩刹车”?

AI科技大本营 6230

AI原生应用领域事实核查的风险防控

AI原生应用的核心是“用AI生成内容驱动交互”,但生成的内容可能包含事实错误(如“地球有三个月亮”)、过信息(如“2023年的新闻引用2020年的政策”)或偏向性误导(如“某产品评测刻意忽略负面评价”)。本文聚焦这些风险,覆盖大语言模型(LLM)为主的生成式AI应用,探讨如何从技术、流程、工具三方面防控事实错误。本文从“风险是什么→为什么会发生→如何防控”的逻辑展开:先通过生活案例理解事实错误的类型,再用“送快递”类比解释AI生成错误的原因,最后用“三道防线”讲解防控策略,包含代码示例和实战工具推荐。

AI架构师小马 1075

模型也会“越用越聪明”:AI模型私有化部署平台DLTM的版本管理持续迭代体系

有了版本,还要能“比”。

NVR安防视频技术 201

05 从零搭建 GPT 模型:LayerNorm、GELU 解码器堆叠

本文介绍从零搭建GPT模型的关键组件:LayerNorm对特征维归一化,GELU平滑激活,前馈网络扩展收缩,残差连接缓解梯度消失。随后组装TransformerBlock(多头注意力+前馈,Pre-LN),最终构建GPTModel并实现文本生成,附参数量核算。

元直的博客 518

AI代品牌防御的技术架构:从RAG引用漏斗到实监测系统的构建

AI替用户做判断,品牌争取的已经不是一次曝光,而是进入用户决策前的判断链条。这条链条的起点,就是AI回答中那一次提及——或那一次缺席。建立AI可见度防线,不是“要不要做”的问题,而是“什么候做、怎么做”的技术生存问题。对于技术团队而言,理解RAG的引用漏斗、构建实监测架构、实施原子化事实核验,是守护品牌数字资产不被AI幻觉投毒侵蚀的必经之路。

2601_95902086的博客 241

赛事 + 载体协同模式:创新创业生态发展的新范式探析

<think>我们只需要根据内容生成摘要,不超过150字。内容主要讲贵客松锦邻创享OPC社区联动,构建“赛事挖掘+载体孵化”协同模式,分析价值痛点。摘要需简洁概括。</think>贵客松锦邻创享OPC社区联动,构建“赛事发掘-生态承接-场景验证”链路,弥补赛事孵化割裂痛点。该模式延长创新价值链,对接产业资源,降低早期项目生存门槛,双向赋能。但需甄别项目,避免过度依赖外部资源。为创新创业生态提供实践样本。

2601_96656533的博客 373

AI 范式越迁:使用 XXL-BOOT SKILL 实现一句话直生业务

使用 XXL-BOOT SKILL 实现一句话直生业务,AI 自动完成需求澄清、数据建模、后端前端开发、菜单权限配置及联调验证,AI 范式及业务交付进入新代。

许雪里 322

工业机器视觉光源选型:常见光源分类不同波长的区别和用途

在机器视觉系统中,光源的作用并不只是“把物体照亮”,而是通过合理的照明结构、入射角度和波长选择,让待检测特征背景之间形成足够大的图像差异。 ## 1.1 机器视觉光源的选型维度 机器视觉光源的选型通常可以从两个维度理解: 1. 按光源结构分类:决定光从什么方向、以什么方式照射物体; 2. 按光源波长分类:决定不同材料对光的吸收、反射、透射和散射特性。

qq_43572400的博客 476

【架构专栏】2.7 多媒体 知识点

本文主要是对架构师考试大纲中的 第2章 计算机胸痛基础知识之 《2.7多媒体》知识点进行整理,主要包括多媒体的定义、分类、特征、多媒体系统的基本组成、多媒体技术应用、多媒体系统的关键技术。多媒体系统的关键技术包括4大分类:视音频技术、通信技术、数据压缩技术、虚拟现实 VR和增强现实AR。本文对计算机相关知识进行详细归纳,对相关同学有一定助。

weixin_42081167的博客 391

汽配、化学、医药企业如何做GEO优化?2026年垂直行业AI搜索引擎优化评估方法论选型实践

2026年国内GEO市场规模突破286亿元、行业渗透率从38%升至71%,但垂直行业(汽配、化学、医药)企业选型失败率仍高达47%。本文给出技术自研、合规风控、效果可验证三维度评估方法论,并对比五条GEO服务商技术路线,助企业提升在豆包、DeepSeek等AI搜索引擎中的被引用率获客效率。

2601_96363771的博客 684

深度学习-手写数字识别

代码逻辑非常清晰,完全按照深度学习的标准流程走:数据加载 -> 定义模型 -> 训练 -> 测试。首先导入代码所用到的相关模块代码root="data"是数据存放路径;train=True是加载训练集;transform=ToTensor()是将图片转换为pytorch能够处理的张量,并进行归一化。这是一种三层全连接神经网络(MLP):nn.Flatten()(展平层):MNIST 的原始图片是一个二维的 28×28 的像素矩阵。但全连接神经网络不认识二维数组,它只认一维的向量。所以第一件事就是把这 784

yyk33324的博客 272

从重复劳动到智能工作台:用活字格 AI Coding 优化产品周报月报制作效率

AI Coding 快速发展的今天,它带来的变化已经不只是“让开发者更快写代码”。更重要的是,AI Coding 正在在 AI Coding 快速发展的今天,它带来的变化已经不只是“让开发者更快写代码”。更重要的是,AI Coding 正在进入企业真实办公场景,助团队把大量高频、重复、格式进入企业真实办公场景,助团队把大量高频、重复、格式要求严格、但又必须持续交付的工作,转化为可配置、可复用、可沉淀的业务工具。对于活字格技术顾问而言,每周产品周报和每月产品月报的制作,就是一个非常典型的效率优化场景。

葡萄城技术团队博客 931

从虚拟数字人到AI数字人Agent:行业迎来根本性迭代?

"被驱动的形象""会办事的智能体",数字人行业正在换引擎过去两年,如果你在展厅见过一台会打招呼的数字人,大概率它的"灵魂"是提前录好的话术加关键词应答;如果你在直播间刷到过虚拟主播,背后很可能是真人动捕加"中之人"配音。这是"虚拟数字人"代的典型形态——形象是数字的,智能是有限的。而2026年的行业热词已经换成了"AI数字人Agent":具备自主对话、任务规划和工具调用能力的智能数字人已占全球新增部署量的41.2%,较一年前提升12个百分点。

2603_96433918的博客 1211

每日AI资讯(2026-09-02)

截至 2026-09-02。今天的三条主线都关于「门槛」:能入侵系统的模型 OpenAI 要先设发布护栏再放出来;Anthropic 把同一个模型按护栏松紧拆成两个卖;Vercel 那批顶级开源项目开始拒绝人类的路过式 PR。三分钟,扫完今天的新东西。

GIS老生,深入架构与AI,持续创作与分享。 425

AI 办公工具技术对比:Codex、Claude Code、WorkBuddy 的工程能力拆解

AI办公工具技术架构各异:Codex擅长云端批量并行代码任务;Claude Code深耕IDE本地定制开发;WorkBuddy聚焦腾讯系生态的本地工作流自动化。三者均属个人提效工具。企业级数字员工需具备双模操作、全栈私有化、字段级权限和任务闭环,技术赛道不同,应避免用个人工具解决企业问题。

2501_93684580的博客 1001

AI 前沿日报:2026年8月28日

Nvidia 以 129 亿美元正式收购 Hugging Face,顺带取得 llama.cpp 项目开发者团队版权;Micron 揭示 HBM 需 3 倍 DDR5 晶圆面积,解释 AI 内存短缺;OpenAI 下一代预训练"Bel"(大于 10T 参数)浮出水面;腾讯开源 Hy4-preview 770B MoE,盲测小幅超越 GLM-5.3 Kimi K3;Anthropic 发布模型硬件标准,将科学实验从数周缩短到数天……

johnsong2009的博客 523

如何利用 AI Coding 提效?从工具到思维的全面升级

AI Coding 工具仍在以月为单位迭代,今天的选择可能半年后就过。但那些真正提效的人,靠的不是某个具体工具,而是一套人机协作的思维方式把精力从「写代码」移到「定义问题、拆解任务、验收结果」;把小步迭代、测试驱动、上下文沉淀变成默认工作习惯;把 AI 当成一个需要训练和管理的协作者,而不是一个魔法按钮。工具终将趋同,能力分层会在人的层面重新拉开。现在开始转变思维的人,会在这场效率革命里拿到最多的复利。

2601_96493715的博客 332

AI代软件项目管理系列】6.AI软件项目,边界和责任怎么定?从“能做”到“可控执行”

AI 进入软件项目后,真正需要解决的不只是“能不能做”,而是“能做到哪一步、什么结果可以生效、最终由谁负责”。项目应围绕数据、工具、执行和输出四类边界进行治理:限制 AI 可访问的信息工具范围,按风险控制执行权限,并通过自动验证、人工审核和项目基线形成责任闭环。成熟的人机协同不是让 Agent 权限越大越好,而是在明确边界下提升执行效率,同保证结果可验证、过程可追溯、责任有人承担。

weixin_42258782的博客 354

大数据毕业设计实战|Data Insight Platform:用 FastAPI + ClickHouse 打低门槛全链路数据洞察平台

Data Insight Platform 以“低门槛、全链路、可追溯”为核心理念,打通了从数据上传、清洗、分析、挖掘到机器学习的一站式流程。平台的核心创新体现在:通过五大模块实现低门槛可视化分析;借助parent_id构建全链路血缘追溯;基于数据规模和用户并发的智能任务分发机制;引入 ClickHouse 加速大表分析并支持降级;扩展远程数据源接入实现 SQL 聚合下推。这些设计有效提升了系统的易用性、可追溯性性能。

2401_87177990的博客 679

airMAX_Sector_AM-2G16-90_QSG_airmax_max_AIR_sector_

airMAX_Sector_AM-2G16-90_QSG

上一篇: 强烈推荐10 个 Python IDE 和代码编辑器!
下一篇: 2021十大 Python 机器学习库
菜鸟学Python
博客等级 码龄9年 7561粉丝 571原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值