<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>推理平台 on PlumePHP</title><link>https://plumephp.com/tags/%E6%8E%A8%E7%90%86%E5%B9%B3%E5%8F%B0/</link><description>Recent content in 推理平台 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Mon, 28 Sep 2026 13:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/%E6%8E%A8%E7%90%86%E5%B9%B3%E5%8F%B0/index.xml" rel="self" type="application/rss+xml"/><item><title>Serverless 推理：无服务器 LLM 推理、冷启动优化与 GPU 弹性</title><link>https://plumephp.com/ai-serverless-inference/</link><pubDate>Mon, 28 Sep 2026 13:00:00 +0800</pubDate><guid>https://plumephp.com/ai-serverless-inference/</guid><description>&lt;p&gt;传统推理服务要「预置 GPU」——不管有没有流量，卡钱都在烧。Serverless 推理换个思路：&lt;strong&gt;没有调用就不跑，有调用就拉起，用完回收&lt;/strong&gt;，GPU 成本按「实际使用」计费。但「按需拉起」带来一个新敌人：&lt;strong&gt;冷启动&lt;/strong&gt;。几十 GB 的模型，从「没有实例」到「能回答第一个问题」，可能要好几分钟。本文把 Serverless 推理讲透：架构怎么搭、冷启动怎么砍、GPU 弹性怎么调度、什么时候该用（什么时候别用）。&lt;/p&gt;</description></item></channel></rss>