谷歌悄悄开源预测模型TimesFM,扔数据就能预测未来
🩺 Summary
谷歌悄悄开源预测模型TimesFM,扔数据就能预测未来 销售曲线。市场价格。网页流量。能源需求。加密货币波动。 这些看起来八竿子打不着的东西,有一个共同点:它们都是随时间变化的数据——时间序列。 过去你想预测这些东西,要么找统计学博士写公式,要么花几周时间训练模型。 谷歌 Research
📝 Details
谷歌悄悄开源预测模型TimesFM,扔数据就能预测未来
销售曲线。市场价格。网页流量。能源需求。加密货币波动。
这些看起来八竿子打不着的东西,有一个共同点:它们都是随时间变化的数据——时间序列。
过去你想预测这些东西,要么找统计学博士写公式,要么花几周时间训练模型。
谷歌 Research 前两天在 GitHub 上发了个东西,叫 TimesFM(Time Series Foundation Model),直接把这个门槛打到了地板上。
目前 GitHub 上已经拿了 21,000+ Star,爆了。
01. 1000 亿时间点训练出来的"时间直觉"
TimesFM 不是那种刚起步的玩具项目。
Google 拿它训练了 1000 亿个真实世界的时间点——主要来自 Google Trends 搜索趋势和 Wikipedia 浏览量数据。
这个规模什么概念?
- 每天记录一次,连续 2.7 亿年的数据量
- 横跨电商、金融、能源、社交网络几乎所有领域
- 能从数据里学到"时间的规律",而不只是记住特定场景
做完这些后,TimesFM 的模型参数只有 2 亿——连一个 7B 小模型的零头都不到。
参数小,意味着你能跑在普通电脑上。
02. 零样本预测:扔数据就能用
TimesFM 最离谱的能力,叫 zero-shot 预测。
不是你平时见的那种"换个场景要重新 fine-tune"。是直接从 HuggingFace 下载模型,给它你的数据,它就能预测接下来 12 步、24 步、甚至 1000 步的数据走向。
model = timesfm.TimesFM_2p5_200M_torch.from_pretrained(
"google/timesfm-2.5-200m-pytorch"
)
result = model.forecast(horizon=12, inputs=[your_data])
四行代码,搞定。
而且它不只是给出一个"预测值"。新版 2.5 加了一个 分位数预测头(30M 参数)——能告诉你预测区间的 10% 到 90% 置信范围。换句话说,它知道自己的预测有多不确定。
这个能力和 GPT-3.5 驱动的 llmtime 对比,TimesFM 虽然模型小了几个数量级,但在大部分基准测试上的表现 更好。
03. 它跟大语言模型有什么不一样?
这里有个很有意思的设计思路。
LLM 把文字切成 token,TimesFM 把时间序列切成 patch(一块连续的时间点)。输入 32 个时间点,预测 128 个时间点——输出 patch 比输入 patch 大 4 倍。
这跟 LLM 每一步只预测一个 token 完全不同。
Google 的直觉是:时间序列有规律可循,不需要像写文章那样逐字生成。一次看 128 步,更能抓住长期趋势。
这意味着什么?
传统的时间序列模型,每一步预测都会积累误差。输出越长,预测越飘。TimesFM 用"大步子"的方式,从架构层面减少了误差累积。
04. 最新 2.5 版本,降了又升
今年 3 月,TimesFM 更新到 2.5 版本,做了几件大事:
- 参数从 5 亿降到 2 亿 —— 更小了
- 上下文长度从 2048 提升到 16,000 —— 能看更长的历史
- 支持最长 1000 步预测 —— 配合分位数头
- 去掉了 frequency 标记 —— 不需要告诉模型数据是按天还是按月,它自己会判断
- 恢复了协变量支持(XReg) —— 外部因素也能作为输入
6 月又把 PyPI 包更新到了 timesfm=2.0.0,安装更方便了:
pip install timesfm[torch]
完成。
5 月还加了 LoRA 微调教程——虽然零样本已经够强,但如果你有特定业务数据,微调一下还能更好。
而且现在它已经嵌入到 Google BigQuery 和 Google Sheets 里——不懂代码的人,在 Excel 里也能用这个模型做预测。
05. 什么场景最值得用?
聊几个真实的场景:
场景 1:电商卖家 你手上有一年的 GMV 数据,想知道下个月备多少货。以前要用 ARIMA 或 Prophet 调参调半天。现在直接扔给 TimesFM,1 分钟出预测。
场景 2:个人投资者 你关注的加密货币历史价格。虽然不是专业的量化团队,但想看看"接下来可能的方向"。本地跑一个模型,不用联网,不用传数据给别人。
场景 3:自媒体 你正在追一条新闻的"搜索热度走势"。TimesFM 训练数据本身包含大量 Google Trends 数据,对这种场景的预测天然就有优势。
我推荐:如果你的数据量不大(几千条以内)、频次还在每天或每小时,直接上零样本模式,效果已经接近甚至超过传统的 supervised 模型。如果数据量大或者场景特殊,再加 LoRA 微调。
06. 个人观点:Google 的"悄悄放招"策略值得留意
TimesFM 不是 Google 突然发的玩意儿。
2024 年被 ICML 接收,2025 年 9 月推出 2.5,到现在安静地迭代了大半年——没有开发布会、没有 PR 通稿、没有跟风的营销文案。GitHub 就是这样默默地涨到了 2 万星。
这跟 Google 做产品的风格很像:TensorFlow、BERT、T5 都是先在学术圈放出,等社区自己爆炸,再到商业产品里铺开。
现在 TimesFM 已经进了 BigQuery、AlloyDB、Sheets——已经不只是开源玩具了。
但说实话,我觉得 TimesFM 最值钱的地方不是它精度多高,而是它把「预测」这件事平民化了。
一直以来,时间序列预测是统计学和数据科学家的地盘。你要懂 ARIMA、ETS、季节性分解,要调参、要查残差、要做白噪声检验。
TimesFM 告诉你:下载一个模型,输入数据,拿到结果。
对于大部分非核心的预测场景(看个趋势、做个粗略估算),这个精度已经够用。而那些真正需要精度的核心场景(风控、高频交易),本来也不会用通用模型。
能让 80% 的人省下 80% 的时间做预测,就是它最大的价值。
评论区来聊
你觉得时间序列预测"平民化"之后,会催生什么新玩法?
如果你是电商运营/产品经理/数据分析师,你会把 TimesFM 用在什么场景上?
欢迎评论区说说。
💬 Comments (0)