WM_GETINFO相关

DPO实战:如何用Hugging Face Trainer轻松实现直接偏好优化(附完整代码) 本文详细介绍了如何利用Hugging Face的DPOTrainer实现直接偏好优化(DPO),这是一种替代RLHF的大语言模型对齐方法。通过实战代码演示,文章阐述了DPO如何绕过复杂的奖励模型训练和强化学习,直接利用成对的偏好数据微调模型,并重点解析了其核心损失函数的设计与关键超参数beta的调节,帮助开发者快速上手这一高效且稳定的偏好对齐技术。 阅读详情

MINMAXINFO structure

typedef struct tagMINMAXINFO {
  POINT ptReserved;
  POINT ptMaxSize;
  POINT ptMaxPosition;
  POINT ptMinTrackSize;
  POINT ptMaxTrackSize;
} MINMAXINFO, *PMINMAXINFO, *LPMINMAXINFO;


ptMaxSize
Type: POINT
The maximized width (x member) and the maximized height (y member) of the window. For top-level windows, this value is based on the width of the primary monitor.

感觉这成员没有作用

 

ptMaxPosition
Type: POINT
The position of the left side of the maximized window (x member) and the position of the top of the maximized window (y member). For top-level windows, this value is based on the position of the primary monitor.
ptMinTrackSize
Type: POINT
The minimum tracking width (x member) and the minimum tracking height (y member) of the window. This value can be obtained programmatically from the system metrics SM_CXMINTRACK and SM_CYMINTRACK (see the GetSystemMetrics function).
ptMaxTrackSize
Type: POINT
The maximum tracking width (x member) and the maximum tracking height (y member) of the window. This value is based on the size of the virtual screen and can be obtained programmatically from the system metrics SM_CXMAXTRACK and SM_CYMAXTRACK (see the GetSystemMetrics function).

对于设置窗口的大小,需要用ptMinTrackSize, ptMaxTracksize即可

WM_GETMINMAXINFO message 里的解释:

Remarks
The maximum tracking size is the largest window size that can be produced by using the borders to size the window. The minimum tracking size is the smallest window size that can be produced by using the borders to size the window.

可见 ptMaxSize确实没有作用,可能在多屏幕里有用吧

简单例子:

case WM_GETMINMAXINFO:  //对lparam进行设置值

..............
break;

 

DPO直接偏好优化:替代RLHF的端到端对齐新范式 人类反馈对齐(HFA)是大语言模型安全可控落地的核心环节,其本质是将离散、主观的人类偏好转化为模型可学习的优化目标。传统RLHF通过奖励建模与强化学习两阶段实现,但面临标尺漂移、梯度污染和KL钝化等固有失真;而DPO(Direct Preference Optimization)回归第一性原理,将偏好建模为成对比较下的概率排序问题,直接以Bradley-Terry模型为理论基础,构建端到端可微分损失函数。它无需独立奖励模型、规避策略梯度估计偏差、天然兼容SFT后模型,显著降低工程复杂度与算力开销。在法律、医 阅读详情

相关推荐

S2H-DPO:基于难度感知的多图像视觉语言模型偏好优化框架详解

在人工智能领域,视觉语言模型(VLM)通过整合图像与文本信息,旨在实现跨模态的理解与生成。其核心原理在于利用大规模图文对进行预训练,学习将视觉特征与语言语义对齐。这一技术的价值在于能够处理复杂的多模态任务,如视觉问答、图像描述和跨模态检索。然而,传统训练方法对所有数据样本一视同仁,忽略了数据内在的难度差异,导致模型在简单样本上可能过拟合噪声,在困难样本上学习不足。S2H-DPO框架创新性地引入了难度感知机制,它根据样本对的复杂性和模糊性动态调整优化策略。该框架特别适用于多图像输入场景,例如多图问答和图像对比

wjxbj的博客 522

windows 消息之WM_GETMINMAXINFO

<br />对于这个消息,wParam 没有意义,lParam是指向MINMAXINFO结构体的指针。<br />主要是控制窗口显示时的大小(ptMaxSize),最大化时的位置(ptMaxPosition),鼠标控制窗口大小的最大(ptMaxTrackSize)、最小(ptMinTrackSize)位置。<br />下面是对应的代码:<br /> case WM_GETMINMAXINFO: MINMAXINFO *mminfo; mminfo=(PMINMAXINFO)lP

wang19870102的专栏 5213

DPO直接偏好优化:替代RLHF的轻量级对齐新范式

直接偏好优化(DPO)是一种无需奖励模型的LLM对齐技术,它将人类偏好信号直接建模为语言模型输出概率的相对差异,从根本上规避了RLHF中奖励建模失准、标注噪声放大与训练不稳定的固有缺陷。其核心原理基于Bradley-Terry模型与隐式奖励函数推导,通过端到端梯度更新实现更鲁棒、更低开销的策略优化。技术价值体现在训练稳定性提升、KL散度可控、显存与标注成本显著降低;典型应用于对话助手冷启动、游戏NPC风格调优、短视频脚本生成等快速迭代场景。本文聚焦DPO在7B/13B/34B模型上的工业级落地实践,涵盖数据

weixin_30388677的博客 394

WM_GETMINMAXINFO消息的使用

对于这个消息,wParam 没有意义,lParam是指向MINMAXINFO结构体的指针。 主要是控制窗口显示时的大小(ptMaxSize),最大化时的位置(ptMaxPosition),鼠标控制窗口大小的最大(ptMaxTrackSize)、最小(ptMinTrackSize)位置。

AC_Dream 3411

duilib 分屏显示bug

    在分屏窗口中最大化,点击任务栏切换最大,最小化,出现图1情况。图1Demo说明:从WindowImplBase派生出来的窗体,未重写父类方法。注意:分屏的显示器分辨率大于电脑主显示的分辨率。Bug原因:LPMINMAXINFO的结构体数据赋值错误。解决方法:修改两个地方LRESULT WindowImplBase::OnGetMinMaxInfo(UINT uMsg, WPARAM wPa...

HiZhanYue的博客 882

QT 阻止窗口放大

在做Qt程序界面开发过程中,测试按组合键win + up 使 界面放大了,为了阻止界面放大,保持原状,此时需要用到PMINMAXINFO: /* * Struct pointed to by WM_GETMINMAXINFO lParam */ typedef struct tagMINMAXINFO { POINT ptReserved; //保留参数 POINT ptMaxSize; ...

slfkj的博客 977

窗口最大化最大最小化关闭按钮超出屏幕 WM_GETMINMAXINFO

有的时候定制窗口,隐藏系统窗口的标题栏,自己绘制最大最小化和关闭按钮,这样当窗口最大化时会发现最顶部一小部分超出了屏幕区域 解决方法是处理WM_GETMINMAXINFO消息http://msdn.microsoft.com/en-us/library/windows/desktop/ms632626(v=vs.85).aspx 示例: else if(WM_GETMINMAXINFO ==

shang_1991的专栏 3639

LLaMA-Factory训练策略:SFT/RM/PPO/DPO/KTO全流程对比

LLaMA-Factory作为易于使用的大型语言模型(LLM)微调框架,支持多种训练策略,包括监督微调(SFT)、奖励模型(RM)训练、近端策略优化(PPO)、直接偏好优化(DPO)和知识微调优化(KTO)。本文将对比这些策略的核心原理、适用场景及实现方式,帮助用户选择合适的训练方案。 ## 训练策略概览 LLaMA-Factory的训练模块结构清晰,各策略对应独立实现。核心训练逻辑位于[sr

gitblog_01042的博客 1816

ms-swift + DPO训练:偏好对齐全流程演示

本文介绍了如何在星图GPU平台上自动化部署ms-swift镜像,高效开展大语言模型的DPO偏好对齐训练。基于该平台,用户可一键启动Qwen2.5-7B等模型的轻量微调流程,典型应用于中文对话响应优化——显著提升生成内容的质量、安全性和人类偏好一致性。

weixin_29097457的博客 774

DPO算法:大语言模型高效微调新方案

在自然语言处理领域,大语言模型(LLM)的微调是提升模型性能的关键环节。传统RLHF方法虽然有效,但存在计算资源消耗大、训练流程复杂等问题。DPO(Direct Preference Optimization)算法通过数学变换将强化学习目标转化为监督学习问题,显著提升了训练效率和内存利用率。该技术特别适用于对话系统、文本生成等场景,能实现3-5倍的训练加速,同时保持95%以上的RLHF性能表现。作为LLM微调的前沿方法,DPO与SFT(监督微调)的结合使用,可进一步提升模型效果的稳定性。

cuiji1279的博客 484

手写推理模型:从PyTorch原生实现SFT/PPO/DPO的底层逻辑

大语言模型推理优化本质上是计算图可控性与梯度流可解释性的工程问题。理解SFT监督信号建模、PPO优势估计原理和DPO隐式偏好学习,是突破黑盒训练瓶颈的关键。本文聚焦PyTorch原生实现路径,解析label masking如何影响推理能力习得、KL散度在策略约束中的双重物理意义,以及GQA与MoE协同降低显存带宽压力的技术本质。通过手写weighted cross-entropy、稳定GAE和数值鲁棒DPO loss,揭示loss函数设计背后的人类认知建模意图——如step权重1.2强化中间推理过程,而非仅

weixin_33850890的博客 346

S2H-DPO:基于难度感知的多图像视觉语言模型偏好优化方法详解

视觉语言模型(VLM)作为连接计算机视觉与自然语言处理的关键技术,旨在让模型理解图像内容并生成相关文本。其核心原理是通过大规模多模态数据预训练,学习图像与文本的联合表示。在模型优化阶段,直接偏好优化(DPO)是一种高效的方法,它通过直接比较“好回答”与“坏回答”来对齐模型与人类偏好,避免了复杂的强化学习流程,显著降低了训练成本。然而,在处理多图像输入时,传统DPO将所有样本视为同等难度,导致模型在简单任务上过拟合,在复杂任务上学习不足。S2H-DPO方法创新性地引入了难度感知机制,它首先利用参考模型计算每个

weixin_30835649的博客 409

【LLM面试专题】4.2 微调与对齐:RLHF与DPO

对齐过程中模型预训练能力的退化。深度好文能力退化程度原因数学推理中等(3-8%)对齐鼓励冗长解释,降低精确性代码生成轻微(1-3%)代码好坏客观,对齐干扰小事实问答轻微(0-2%)事实知识通常稳定创意写作严重(10-20%)对齐压制"风险"内容开放式对话显著(5-15%)模板化对话风格考点核心要点面试频度RLHF三阶段极高RM训练Bradley-Terry对比损失,只训相对排序高PPO Clip限制更新幅度在[1-eps, 1+eps]极高KL惩罚。

m0_50709695的博客 193

S2H-DPO:基于难度感知的多图像视觉语言模型偏好对齐优化

在人工智能领域,视觉语言模型(VLM)旨在实现图像与文本的跨模态理解与生成。其核心原理是通过大规模预训练,学习将视觉特征与语言语义进行对齐。这项技术的价值在于能够处理复杂的多模态任务,例如图像描述、视觉问答和跨模态推理。在实际应用中,当任务涉及同时处理多张图像并给出综合回答时,模型常面临信息融合与推理深度的挑战。本文聚焦于**直接偏好优化(DPO)** 这一主流对齐方法,并针对其处理**多图像指令**时“一刀切”优化的不足,深入探讨了引入难度感知机制的S2H-DPO方法。该方法通过动态评估样本难度并调整优化

weixin_34242509的博客 722

DMPO复现总结

论文项目实现面向个性化排序优化的直接多偏好优化(Direct Multi-Preference Optimization, DMPO)方法,旨在通过直接最大化正样本概率并最小化多个负样本概率,提升大语言模型(LLM)在推荐任务中的对齐能力与泛化性能。项目基于统一的微调框架,支持监督微调(SFT)、奖励建模(RM)、近端策略优化(PPO)与直接偏好优化(DPO)等训练阶段,并以DPO为核心在少样本场景下显著优于传统推荐方法与现有LLM推荐方案。

m0_69771726的博客 415

S2H-DPO:基于难度感知的视觉语言模型多图像偏好对齐优化框架

在人工智能领域,视觉语言模型(VLM)旨在理解和生成与图像相关的文本。其核心原理是通过大规模预训练,学习图像与文本的联合表示,从而具备跨模态推理能力。这一技术的价值在于能够处理复杂的多模态任务,如视觉问答和图像描述。然而,当模型面对多图像输入时,标准偏好优化方法往往失效,导致模型出现“选择困难症”,无法精准区分最佳答案。S2H-DPO框架通过引入难度感知机制,动态评估训练样本的复杂性,并对简单与困难样本采用差异化的优化策略。该框架有效解决了多图像场景下的偏好对齐难题,显著提升了模型在图像检索和视觉问答等应用

a1311010193的博客 451

强化学习/对齐(个人理解)

含义:不只预测下一个 token,而是训练 N 个独立的预测头,从相同的隐藏状态同时预测接下来的 N 个 token。对所有头的交叉熵损失取平均。含义:不缓存完整的 K 和 V 张量,而是将其压缩为低秩潜在向量 c_kv,推理时再即时解压。这大幅降低了推理时的 KV 缓存内存占用。含义:通过学习的路由器将每个 token 路由到 top-k 个专家,用 softmax 归一化的权重组合它们的输出,实现条件计算。含义:该损失通过将不可微的路由分数与可微的概率项结合,惩罚不均匀的 token 分布。

ydmyyh的博客 223

大模型面试核心:DPO推导与流式输出实现

大模型微调技术中的DPO(Direct Preference Optimization)通过将强化学习转化为监督学习,解决了传统RLHF中奖励模型训练不稳定的问题。其核心在于利用Bradley-Terry模型建立偏好概率,并通过数学技巧将策略表示为奖励函数的显式形式。在生产环境中,流式输出技术通过HTTP chunked encoding或WebSocket实现实时token传输,需要平衡网络延迟与带宽消耗。这些技术在大模型Agent系统和对话应用中至关重要,既能提升训练稳定性,又能改善用户体验。本文通过面

weixin_33946020的博客 422
上一篇: ifstream& operator>>函数无法获取空行和peek函数的用法
下一篇: 计算计算机的色彩数目
bsnry
博客等级 码龄15年 66粉丝 26原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值