AI 工程实战
从 Agent、RAG 到本地部署与成本治理——一套面向开发者的 LLM 工程化系列,系统讲透怎么把大模型真正用起来、用在生产里。
AI 工程 · 技术随笔 · 随手记录
从 Agent、RAG 到本地部署与成本治理——一套面向开发者的 LLM 工程化系列,系统讲透怎么把大模型真正用起来、用在生产里。
从分层架构、Agent Loop、计划模式到工具集与 token 压缩,完整拆解一个真实桌面 AI 编程助手(WCode)是怎么设计出来的。
流式输出、Prompt 缓存、模型路由、量化与 token 压缩——系统讲解如何把 LLM 的账单和延迟都压下来,并附 WCode 实战。
提示注入、越狱、数据泄露、红队测试——拆解 LLM 特有的安全威胁,并给出最小权限、输出校验、隔离边界等可落地防御。
为什么要把模型跑在本地?GGUF、Ollama、llama.cpp、INT4/INT8 量化与端侧推理全解析,并结合本地 Qwen 实战经验。
图像、语音、视频如何被大模型理解?拆解 CLIP、视觉编码器与多模态 Agent,并看它如何"看图操作界面"。
Prompt、RAG、Fine-tuning 三者到底怎么选?本文给出清晰决策树、LoRA/QLoRA 简介与成本对比,帮你不再为"该不该微调"纠结。
上下文窗口越大越好吗?本文拆解 KV Cache 成本、注意力稀释、长文档的切分/摘要/Map-Reduce 与滑动窗口策略,并给出可运行示例。
裸的 function calling 远远不够。本文讲透工具 schema 设计、并行调用、错误重试、结果截断与安全边界,并给出可复用的执行器实现。
提示工程不止把话说清楚。本文拆解 RTCDF 框架、few-shot、结构化输出、思维链,以及最容易被忽视的提示注入防御。
一文讲透 AI Agent 的架构、规划推理、工具调用、记忆系统与多智能体协作,并附可运行的 ReAct 最小实现与工程落地经验。
从文档切分、Embedding、向量检索到重排与生成,手把手拆透 RAG 全链路,并附可运行的最小实现与常见陷阱。