AI 功能到底怎么验收:一套从业务风险里长出来的测试集
「这个版本好像回答得更自然了」——没有测试集的 AI 产品,验收只能停在感觉层面。一个智能购车问答项目从零搭建测试集的全过程,和它带来的启发。
AI评测工程实践产品思考
Tag
「这个版本好像回答得更自然了」——没有测试集的 AI 产品,验收只能停在感觉层面。一个智能购车问答项目从零搭建测试集的全过程,和它带来的启发。
五个客户、五种困境、七条规律——从一线实战记录里长出来的 B 端 AI 落地认知,以及它带来的启发。
Coding Agent 的问题已经不是「能不能干活」,而是「能不能不迷路、不污染上下文、交付可验证的结果」。一套多智能体流水线的设计逻辑,和它带来的启发。
Agent 不是玄学,拆开就是四块积木。这篇文章把每一块拆开看,并回答一个更实际的问题:作为产品经理,你的设计动作落在哪。
朋友在一家传统车企做智能客服的大模型改造,从 RAG 问答一路做到多 Agent 协同。近距离围观了整个过程后,我把观察到的架构设计、安全边界和踩过的坑整理成了这篇笔记。