AI Agent流式输出:一个字一个字显示,用户不等急
Agent思考要3秒,用户盯着空白页面等。流式输出让LLM边生成边显示,用户体验好很多。
💡 你将学到
Agent思考要3秒,用户盯着空白页面等。流式输出让LLM边生成边显示,用户体验好很多。
等待3秒=流失30%用户
数据说话:页面加载超过3秒,30%的用户会离开。Agent的响应也一样——用户看到一片空白,第一反应是刷新页面。
流式输出原理
LLM生成文本时是一个token一个token出来的。传统方式等全部生成完再返回,流式方式边生成边推送。
FastAPI实现
from fastapi.responses import StreamingResponse
def stream_agent(query):
def generate():
for chunk in agent.stream(query):
yield f'data: {json.dumps({"text": chunk})}\n\n'
return StreamingResponse(generate(), media_type='text/event-stream')
前端接收
const eventSource = new EventSource('/agent/chat?q=' + query);
eventSource.onmessage = (e) => {
const data = JSON.parse(e.data);
document.getElementById('output').textContent += data.text;
};
效果
用户看到的不再是空白页面等3秒,而是第0.5秒就开始看到文字出现。感知速度提升6倍。
总结
流式输出改动不大,前后端各加几行代码。但用户体验从等半天变成实时显示。
相关文章
相关文章
2026-07-19
AI Agent规模化策略:从1个用户到100万用户
2026-08-11
MLOps工具盘点2026:覆盖全流程的12个开源项目
2026-07-17
AI Agent部分结果:一个工具挂了不影响整个任务
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
