category

Llm

共 14 篇文章。
全部文章SaaSGameRustLuaGameDev客户端开发游戏开发IndiePrd写作小说DeveloperProductsBusiness
llm

模型上下文协议(MCP)完整指南:从 Anthropic 标准到 AI 应用互操作性革命

系统拆解 Model Context Protocol(MCP)的设计哲学、协议分层和核心概念:Resources、Prompts、Tools、Sampling。 涵盖 MCP 与 Function Calling、插件系统、API 网关的区别与互补关系。 附架构全景图、协议消息格式详解,以及 MCP 在 Claude Desktop、Cline、Continue 等客户端中的实际运行机制。

6 分钟阅读
MCP Model Context Protocol Anthropic
llm

多模态语音合成与识别:从 Whisper + TTS 到实时语音交互的 LLM 实践

系统拆解 LLM 语音技术栈:语音识别(ASR / Whisper)、语音合成(TTS / ElevenLabs / Coqui TTS)、语音活动检测(VAD)。 覆盖实时语音交互架构(流式识别 + 流式合成 + 打断机制)、多语言语音克隆、以及语音 Agent 的安全与隐私考量。 附完整的 Whisper API 集成、本地 TTS 部署、WebRTC 实时语音管道代码。

3 分钟阅读
语音识别 语音合成 Whisper
llm

多模态视频分析:从关键帧抽取到时序理解的 LLM 视频理解实战

系统拆解 LLM 视频理解的技术路径:关键帧提取、时序编码(Temporal Modeling)、视觉-时序联合推理。 覆盖 Gemini 1.5 Pro(原生视频)、GPT-4o(帧序列)、Claude(关键帧截图)、Video-LLaMA 四种实现方式。 附视频摘要生成、动作识别、异常检测、教育内容分析四个场景的完整代码与成本优化策略。

4 分钟阅读
视频分析 多模态视频 Video LLM
llm

多模态生成式 AI:从 DALL-E 3 到视频生成与图生图的生产实战

系统梳理多模态生成技术:文本到图像(DALL-E 3 / Midjourney / Stable Diffusion XL)、文本到视频(Sora / Runway Gen-3 / Pika / 可灵)、图像到图像(ControlNet / IP-Adapter / Img2Img)。 涵盖 Prompt 工程(图像/视频生成专用)、负面提示词策略、分辨率与纵横比选择、版权与伦理边界。 附完整的 API 调用代码、Ollama 本地 Stable Diffusion 部署、以及批量生成与后处理流水线。

4 分钟阅读
文生图 文生视频 DALL-E
llm

多模态图像理解:从 GPT-4o Vision 到开源视觉大模型的生产实践

系统拆解 LLM 视觉理解的技术栈:图像编码器(ViT/CLIP)、视觉-语言对齐(Projection Layer)、多帧处理与分辨率策略。 覆盖 GPT-4o Vision、Claude 3.5 Sonnet、Gemini 1.5 Pro、Qwen-VL、Llava 五大主流模型的能力对比与 API 调用方式。 附完整的视觉问答(VQA)、OCR 提取、图表分析、UI 自动化四种场景的 Python 代码实现。

4 分钟阅读
多模态图像 Vision LLM GPT-4o Vision
llm

人机协作模式(Human-in-the-Loop):让 Agent 在关键时刻停下来,等待人类确认

深度分析 Agent 系统中人类介入的必要性与设计模式:审批流(Approval)、审核反馈(Review)、接管仲裁(Override)、触发条件与降级策略。 涵盖人机协作的 UX 设计、上下文压缩技术、以及监管合规要求(金融/医疗/工业控制的关键决策审计)。 附完整的 HITL 审批队列实现、审计日志设计与多层级审批工作流代码。

4 分钟阅读
Human-in-the-Loop HITL 人机协作
llm

MCP 客户端集成实战:Claude Desktop、Cline、Continue 与自建 Agent 的完整配置

详细拆解 4 类 MCP Client 的接入方式:Claude Desktop(macOS/Windows)、Cline(VSCode 扩展)、Continue(IDE 插件)与自建 Python Agent。 涵盖配置文件格式、Server 注册、工具发现、权限管理、故障排查。 附完整的 JSON 配置模板、常见错误处理对照表、以及跨客户端兼容性的实践建议。

4 分钟阅读
MCP Client Claude Desktop Cline
llm

Agent 工具调用与 Function Calling:从零设计可控的外部能力接口

深度解析 LLM Agent 工具调用的实现原理:工具描述(Tool Schema)、参数推导、并行调用、结果消化。 涵盖 OpenAI Function Calling、Claude Tool Use、Google Function Declaration 三种主流标准,以及如何在 LangChain 中自定义工具。 附自定义工具注册器、Schema 验证、自动重试的完整代码实现。

4 分钟阅读
Function Calling Tool Use OpenAI Tools