<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>训练 on PlumePHP</title><link>https://plumephp.com/tags/%E8%AE%AD%E7%BB%83/</link><description>Recent content in 训练 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 30 Sep 2026 09:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/%E8%AE%AD%E7%BB%83/index.xml" rel="self" type="application/rss+xml"/><item><title>Embedding 深入：对比学习、双塔架构与向量检索工程</title><link>https://plumephp.com/ai-ml-embeddings-deep-dive/</link><pubDate>Tue, 29 Sep 2026 13:00:00 +0800</pubDate><guid>https://plumephp.com/ai-ml-embeddings-deep-dive/</guid><description>Embedding 深入：对比学习、双塔架构、难负样本、相似度度量与向量检索工程。</description></item><item><title>梯度下降与优化器实战：SGD、Momentum、Adam 的原理与选择</title><link>https://plumephp.com/ml-gradient-descent-optimizers/</link><pubDate>Wed, 30 Sep 2026 09:00:00 +0800</pubDate><guid>https://plumephp.com/ml-gradient-descent-optimizers/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;训练模型本质上是「把损失函数压到最低」——而压到最低的引擎就是&lt;strong&gt;梯度下降&lt;/strong&gt;。理解优化器，是理解训练一切模型的起点：为什么学习率一大就震荡、Adam 为什么总比 SGD 收敛快、为什么 2018 年后大家默认用 AdamW。本文从梯度下降的直觉出发，讲清 SGD、Momentum、AdaGrad、RMSProp、Adam、AdamW 六代优化器的演进逻辑，给出超参建议与选型矩阵，并附 PyTorch 实战对照。&lt;/p&gt;</description></item></channel></rss>