AI Agent流式输出:一个字一个字显示,用户不等急

📘 教程 2026-07-17 约 2 分钟阅读

Agent思考要3秒,用户盯着空白页面等。流式输出让LLM边生成边显示,用户体验好很多。

💡 你将学到

Agent思考要3秒,用户盯着空白页面等。流式输出让LLM边生成边显示,用户体验好很多。

📜 目录

等待3秒=流失30%用户

数据说话:页面加载超过3秒,30%的用户会离开。Agent的响应也一样——用户看到一片空白,第一反应是刷新页面。

流式输出原理

LLM生成文本时是一个token一个token出来的。传统方式等全部生成完再返回,流式方式边生成边推送。

FastAPI实现

from fastapi.responses import StreamingResponse

def stream_agent(query):
    def generate():
        for chunk in agent.stream(query):
            yield f'data: {json.dumps({"text": chunk})}\n\n'
    return StreamingResponse(generate(), media_type='text/event-stream')

前端接收

const eventSource = new EventSource('/agent/chat?q=' + query);
eventSource.onmessage = (e) => {
    const data = JSON.parse(e.data);
    document.getElementById('output').textContent += data.text;
};

效果

用户看到的不再是空白页面等3秒,而是第0.5秒就开始看到文字出现。感知速度提升6倍。

总结

流式输出改动不大,前后端各加几行代码。但用户体验从等半天变成实时显示。

相关文章

相关文章
2026-07-19
AI Agent规模化策略:从1个用户到100万用户
2026-08-11
MLOps工具盘点2026:覆盖全流程的12个开源项目
2026-07-17
AI Agent部分结果:一个工具挂了不影响整个任务

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论