posts

LLM / AI 开发专题:从 API 调用到生产级智能应用

大语言模型(LLM)与 AI 应用开发完整专题:API 基础调用、Prompt 工程、RAG 检索增强生成、向量数据库、模型微调(LoRA/PEFT)、Agent 框架(LangChain/LlamaIndex/CrewAI)、推理部署优化(vLLM/量化)与 AI 安全治理。基于 Python 全栈实践。
全部文章 Game Golang SaaS Rust 游戏开发 客户端开发 GameDev Lua Indie 写作
llm

AI Agent 产品设计方法论:从交互范式到产品落地的完整框架

系统拆解 AI Agent 产品设计的完整方法论体系:从工具思维到 Agent 思维的范式迁移、五大核心组件 UX 设计、四种交互模式(Chat/Copilot/Autonomous/Hybrid)、分层记忆系统设计、可靠性工程与容错策略、多智能体编排的 UX 挑战、信任与可解释性设计。 涵盖 ReAct、Plan-and-Solve、Reflexion、DEPS 四大设计模式的适用场景,以及 Devin、AutoGPT、Claude Computer Use 三个经典案例的产品分析。 附 Agent 产品评估矩阵、自主度光谱模型与伦理安全护栏设计框架。

24 分钟阅读
AI Agent 产品设计 交互设计
llm

大模型本地部署与私有托管:从 Ollama 到 vLLM 生产级推理集群

全面指南:本地部署 LLM 的核心动机(隐私/成本/合规/延迟)、Ollama 一键部署与自定义 Modelfile、llama.cpp / llamafile CPU 推理优化、vLLM 生产级 GPU 服务、TGI 与 HuggingFace 生态集成、GGUF/AWQ/GPTQ/FP8 量化方案选型、LocalAI / LM Studio / GPT4All 自托管方案、CPU vs GPU 硬件需求与 VRAM 估算公式、OpenAI 兼容 API 集成模式、私有模型安全加固策略。包含完整 Docker Compose 模板、基准测试数据与实践命令。

14 分钟阅读
local llm ollama vllm
llm

LLM 商业化应用开发与产品化方法论:从价值验证到规模化盈利

系统性讲解大语言模型商业化路径:B2B SaaS / 内部工具 / 消费级应用的 PMF 验证、增强型与自动化型 AI 功能设计、四种定价模型对比、成本优化三板斧、AI 体验的置信度与人机协作设计、法律合规框架、MVP 到生产的评估与 A/B 测试体系,以及 Notion AI / GitHub Copilot / Intercom Fin 三大标杆案例的决策复盘。

13 分钟阅读
llm商业化 AI产品化 B2B SaaS
llm

模型上下文协议(MCP)完整指南:从 Anthropic 标准到 AI 应用互操作性革命

系统拆解 Model Context Protocol(MCP)的设计哲学、协议分层和核心概念:Resources、Prompts、Tools、Sampling。 涵盖 MCP 与 Function Calling、插件系统、API 网关的区别与互补关系。 附架构全景图、协议消息格式详解,以及 MCP 在 Claude Desktop、Cline、Continue 等客户端中的实际运行机制。

6 分钟阅读
MCP Model Context Protocol Anthropic
llm

多模态语音合成与识别:从 Whisper + TTS 到实时语音交互的 LLM 实践

系统拆解 LLM 语音技术栈:语音识别(ASR / Whisper)、语音合成(TTS / ElevenLabs / Coqui TTS)、语音活动检测(VAD)。 覆盖实时语音交互架构(流式识别 + 流式合成 + 打断机制)、多语言语音克隆、以及语音 Agent 的安全与隐私考量。 附完整的 Whisper API 集成、本地 TTS 部署、WebRTC 实时语音管道代码。

3 分钟阅读
语音识别 语音合成 Whisper
llm

多模态视频分析:从关键帧抽取到时序理解的 LLM 视频理解实战

系统拆解 LLM 视频理解的技术路径:关键帧提取、时序编码(Temporal Modeling)、视觉-时序联合推理。 覆盖 Gemini 1.5 Pro(原生视频)、GPT-4o(帧序列)、Claude(关键帧截图)、Video-LLaMA 四种实现方式。 附视频摘要生成、动作识别、异常检测、教育内容分析四个场景的完整代码与成本优化策略。

4 分钟阅读
视频分析 多模态视频 Video LLM
llm

多模态生成式 AI:从 DALL-E 3 到视频生成与图生图的生产实战

系统梳理多模态生成技术:文本到图像(DALL-E 3 / Midjourney / Stable Diffusion XL)、文本到视频(Sora / Runway Gen-3 / Pika / 可灵)、图像到图像(ControlNet / IP-Adapter / Img2Img)。 涵盖 Prompt 工程(图像/视频生成专用)、负面提示词策略、分辨率与纵横比选择、版权与伦理边界。 附完整的 API 调用代码、Ollama 本地 Stable Diffusion 部署、以及批量生成与后处理流水线。

4 分钟阅读
文生图 文生视频 DALL-E
llm

多模态图像理解:从 GPT-4o Vision 到开源视觉大模型的生产实践

系统拆解 LLM 视觉理解的技术栈:图像编码器(ViT/CLIP)、视觉-语言对齐(Projection Layer)、多帧处理与分辨率策略。 覆盖 GPT-4o Vision、Claude 3.5 Sonnet、Gemini 1.5 Pro、Qwen-VL、Llava 五大主流模型的能力对比与 API 调用方式。 附完整的视觉问答(VQA)、OCR 提取、图表分析、UI 自动化四种场景的 Python 代码实现。

4 分钟阅读
多模态图像 Vision LLM GPT-4o Vision
llm

人机协作模式(Human-in-the-Loop):让 Agent 在关键时刻停下来,等待人类确认

深度分析 Agent 系统中人类介入的必要性与设计模式:审批流(Approval)、审核反馈(Review)、接管仲裁(Override)、触发条件与降级策略。 涵盖人机协作的 UX 设计、上下文压缩技术、以及监管合规要求(金融/医疗/工业控制的关键决策审计)。 附完整的 HITL 审批队列实现、审计日志设计与多层级审批工作流代码。

4 分钟阅读
Human-in-the-Loop HITL 人机协作
llm

MCP 客户端集成实战:Claude Desktop、Cline、Continue 与自建 Agent 的完整配置

详细拆解 4 类 MCP Client 的接入方式:Claude Desktop(macOS/Windows)、Cline(VSCode 扩展)、Continue(IDE 插件)与自建 Python Agent。 涵盖配置文件格式、Server 注册、工具发现、权限管理、故障排查。 附完整的 JSON 配置模板、常见错误处理对照表、以及跨客户端兼容性的实践建议。

4 分钟阅读
MCP Client Claude Desktop Cline
llm

Agent 工具调用与 Function Calling:从零设计可控的外部能力接口

深度解析 LLM Agent 工具调用的实现原理:工具描述(Tool Schema)、参数推导、并行调用、结果消化。 涵盖 OpenAI Function Calling、Claude Tool Use、Google Function Declaration 三种主流标准,以及如何在 LangChain 中自定义工具。 附自定义工具注册器、Schema 验证、自动重试的完整代码实现。

4 分钟阅读
Function Calling Tool Use OpenAI Tools