Vespa(7,037星)2026:面向向量搜索、排序和推荐的大数据服务引擎
Vespa(7,037星)是雅虎开源的服务引擎,用于大规模向量搜索、实时排序和推荐。本文教你部署并运行混合搜索。
💡 你将学到
Vespa(7,037星)是雅虎开源的服务引擎,用于大规模向量搜索、实时排序和推荐。本文教你部署并运行混合搜索。
直接给结论
vespa-engine/vespa(7,037星,Java)是一个开源大数据服务引擎——雅虎搜索排序背后的技术。它在一个系统里同时处理向量搜索、BM25和机器学习排序,支持实时写入,海量数据下查询延迟亚秒级。
Vespa的独特之处
- 混合搜索:一个查询里结合稠密向量和BM25
- 实时索引:写入后立即可搜
- ML排序:查询时用ONNX模型排序
- 服务级:为生产流量设计,不只是离线实验
本地部署
docker run --detach --name vespa --hostname vespa-container \n --publish 8080:8080 --publish 19071:19071 \n vespaengine/vespa
# 部署示例应用
vespa deploy sample-apps/vector-search
vespa query 'select * from doc where userQuery()' 'input.query(q)=embed(foo)'
Vespa CLI(brew install vespa-cli)驱动部署和查询工作流。
最小混合搜索schema
schema doc:
document doc:
field text type string { indexing: index }
field embedding type tensor<float>(x[384]) {
indexing: attribute | index
}
rank-profile hybrid inherits default {
first-phase {
expression: bm25(text) + cos(distance(field, embedding))
}
}
实用技巧
- 需要向量+关键词+学习排序一体化且规模化时,选Vespa。
- 从sample apps开始;生产环境用config server + content nodes架构。
- 用管理控制台的内置指标和日志监控。
FAQ
谁在用? 雅虎、Spotify等都在生产环境用它做搜索和推荐。
它是向量数据库吗? 它是完整的服务引擎:向量DB+搜索+排序一体化。
免费吗? 是——Apache-2.0开源。
相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
免费AI编程助手 2026 配置指南:VS Code 5分钟装 Continue、Copilot、Windsurf
