研究与调研
围绕 Voice AI、Agent、RAG、知识系统与 AI Native 产品开展的技术调研、源码分析和方向判断。
这里收录的是需要查证、比较和形成判断的内容,而不是按步骤完成某个功能的教程。每篇调研尽量回答四个问题:它解决什么真实问题、核心实现是什么、适用边界在哪里,以及是否值得投入生产。
如何使用这个专题
做技术选型时先读调研报告,确定问题边界与风险;进入实现阶段后,再沿文中的相关链接转到 AI Engineering 或 RAG 专题。涉及快速变化的产品与框架时,以文章头部的资料核验日期为准。
生产系统研究
GraphRAG 什么时候有价值,什么时候只是复杂化系统
从查询类型、基线失败阶段、增量证据收益和治理成本出发,判断何时需要图,以及如何在 MySQL + Elasticsearch 上渐进落地。
实时语音中的打断、VAD 和 Turn Detection
区分语音活动、端点、轮次结束与真实打断,设计误打断恢复、播放截断和可评测的 Voice Agent 状态机。
RAG 系统的检索质量与可观测性
从 Retrieval Trace、First Evidence Loss、离线评测与线上诊断建立可归因的检索质量体系。
Voice Agent 如何把端到端延迟控制在 500ms
拆解端点检测、ASR、LLM、TTS、网络和播放链路,说明流式与可取消执行如何缩短关键路径。
Agent Memory 与 State:生产系统应该保存什么
区分事件、状态、检查点、长期记忆、知识库和文件资产,建立可恢复、可追溯的持久化模型。
Agent 评测:从最终答案走向完整 Trace
从结果、状态、轨迹、资源、副作用和安全六个维度评估 Agent,而不只检查最终回复。
WeKnora 技术实现
从源码分析文档入库、Chunk 数据模型、异步任务、混合检索和知识资产重建。
产品与方向调研
Vibe Coding 与 GEO 调研
讨论 AI Native 开发方式、内容结构化和生成式搜索可见性的变化。
Clawdbot:本地 Agent 与个人自动化
分析本地运行、消息入口、系统工具调用和个人自动化的产品边界。
ElevenLabs:Voice AI 与音频自动化
梳理语音合成、克隆、实时音频、API 工具链与内容生产场景。
LLM Wiki 与 RAG 海量知识检索调研
汇总企业知识库、Hybrid Search、GraphRAG、评测、安全与生产治理资料。
调研质量约定
| 项目 | 约定 |
|---|---|
| 证据来源 | 优先使用官方文档、源码、论文、版本说明和可复现实验。 |
| 时间边界 | 快速变化的内容标注核验日期,不把当前实现写成永久标准。 |
| 结论表达 | 区分事实、公开数据、工程推断和个人判断。 |
| 生产建议 | 明确适用场景、失败模式、迁移成本和仍需验证的部分。 |
调研不是采购结论
厂商价格、模型能力、开源项目状态和 API 约束都可能变化。正式选型前,应基于当前版本重新核验,并用自己的语言、网络、数据规模和延迟目标做小范围验证。