
Replicate
开发者工具
Replicate (Cloudflare)
付费API
关于
开源模型托管鼻祖,一行 API 运行数千个社区与官方模型,按秒计费用多少付多少,Cog 工具还能打包部署自己的模型
编辑评价
推荐长大成人的模型游乐场——还认了 Cloudflare 当靠山
Replicate 的核心承诺从第一天起就没变过:任何有意思的模型,一行代码,按实际运行的秒数付费。变的是它周围的一切。Cloudflare 的收购——2025 年末宣布、2026 年初完成——回应了在 Replicate 上构建的唯一严肃顾虑:一家靠融资续命的创业公司五年后还在不在?答案是在,而且它的模型目录正被接入 Workers AI 和全球最大的边缘网络之一。产品本身仍是 AI 界最好的「逛街体验」:数万个社区模型可在浏览器里直接试,FLUX、Veo 级视频与前沿 LLM 有官方端点,Cog 则悄悄统一了模型打包的行业习惯。毛边也还是熟悉的那些——冷启动对低频模型很扎手,社区模型质量像抽奖,按秒计费需要自律才能预估。要大规模专门跑 LLM,Together 和 Fireworks 是更锋利的工具。但作为发现、比较并上线生成式媒体与长尾模型的地方,Replicate 没有真正的对手——而且头一次,也没有「会不会倒闭」的风险了。
最适合
- •不建机器学习基础设施就要上线图像、视频或音频功能的产品团队
- •想在新模型爆火当周就上手比较的开发者
- •用 Cog 把模型发布成 API 的研究者
以下情况建议考虑替代方案
- •你要持续大规模跑 LLM 且延迟敏感(→ Together AI / Fireworks AI)
- •你想要最快的扩散推理与实时媒体 API(→ Fal.ai)
平台支持
网页版API
可用平台包括网页版和API。
核心功能
数万个社区模型,一行 API 代码即可运行
官方模型——FLUX、Seedream、Veo、Claude 级端点——按产出计价
Cog:开源工具,打包并发布你自己的模型
按秒计费的硬件,从 CPU 到 8x H100 集群
自动缩容到零——闲置模型不花一分钱
现已加入 Cloudflare,正与 Workers AI 及边缘网络整合
定价方案
free
没有常设免费档,但缩容到零的计费方式让试一个模型只花几美分——只为实际运行的秒数付费。
paid
社区模型按硬件秒数计费(CPU $0.36/小时、L40S $3.51/小时、H100 $5.49/小时,最高 8x H100 集群);官方模型按产出计价——如 FLUX 图像约 $0.003/张起,语言模型按 token。(对照官方定价页核实,2026-07-28。)
使用场景
一个下午就给产品加上图像、视频或音频生成
在下决心选定前,横跨几十个模型快速验证
用 Cog 把研究模型发布成生产可用的 API
跑偶发或突发的推理任务,不为闲置 GPU 买单
优点
模型多样性无可匹敌——GitHub 上火过的模型,这里多半找得到
缩容到零的计费对波动型负载是真公平
Cog 已成为机器学习模型打包的事实标准
有 Cloudflare 背书,创业公司能活多久的疑虑彻底消除
缺点
缩容到零的模型有冷启动,首个请求会多几秒延迟
社区模型的质量与维护水准参差不齐
按秒计硬件的费用比按 token 套餐更难预估
被收购后的路线图可能逐渐向 Cloudflare 生态倾斜
最新动态
2026 年:Cloudflare 完成对 Replicate 的收购——2025 年末宣布、2026 年初交割——品牌与 API 保持独立,同时把模型目录接入 Workers AI。FLUX、Seedream、Veo 级视频与前沿语言模型的官方端点持续扩充,按秒计费与缩容到零维持不变。