深度介绍
Fireworks AI详细介绍
⚡Serverless:按 token 计费且无冷启动
Serverless Inference 的定位是「几秒内开始用」:官方描述为零配置、无冷启动、按 token 计费,并提供后付费结算与 1 美元试用额度,适合先验证效果再决定规模。官方把这一档分为 Standard、Priority 与 Fast 三类服务等级,具体价格随模型而变化,并指向文档中的当期价目表。对请求量波动大、又不想提前买卡的应用,这一档免去了容量规划;代价是速率上限受共享池约束,高峰期可能触发限流,生产环境需要按自身峰值评估。
🖥按需部署:按 GPU 秒计费,不收起停费
On Demand Deployments 面向需要更快速度、更高速率上限与规模化成本的场景,官方口径是「按 GPU 秒付费,启动时间不额外收费」,并给出按分钟与按小时的报价。可选机型覆盖 H100 80GB、H200 141GB、B200 180GB、B300 288GB 与 GB300 288GB 等档位;官方另说明限定区域的部署按 1.5 倍计价,需要联系销售开通。对已经稳定跑量的服务,把共享池换成专属部署通常能同时降低单位成本与延迟波动,但闲置时间仍需付费,应先算清单卡利用率。
🎛托管微调:按训练 token 计价
Training 一档让用户用自有数据定制开源模型,官方给出的关键承诺是「微调模型与基座模型同价服务」,也就是微调不会带来额外的推理溢价。托管训练的计价按 1M 训练 token 分两档:监督微调(SFT)与偏好微调(DPO)价格不同,全参数微调又是另一档;官方按模型规模分四段定价,从 160 亿参数以下一直到 3000 亿参数以上。强化微调(RFT)则按 GPU 小时计费、按秒结算,与按需部署同价。文档还提醒:训练 token 可用「数据集 token 数 × 轮数」估算,带思考轨迹的多轮对话会把内容展开,从而抬高实际计费 token。
🔬Serverless 训练 API:只在计算时付费
官方另提供 Serverless Training API:接入共享的常驻训练池即可对指定模型做 LoRA 训练,官方强调无需自行开通资源、也没有空闲成本,只为 prefill、sample 与 train 的 token 付费。价目按模型列出,包含上下文长度与四类 token 单价,覆盖 GLM、Qwen、Kimi、DeepSeek 与 Muse 等型号;官方说明私有预览期间检查点存储免费,其他前沿模型会陆续加入目录。对偶发训练需求的团队,这种形态省掉了「为了跑一次微调而常备一台卡」的开销。
🧠Embeddings 按参数规模分档
向量化能力单列计价,按基座模型参数量分档:1.5 亿参数以内每百万输入 token 0.008 美元,1.5 亿至 3.5 亿参数为 0.016 美元,Qwen3 8B 则为 0.1 美元。这种分档方式对做检索与 RAG 的团队比较实用——可以先按语料规模与精度要求选档,再估算索引重建与查询的长期成本;官方文档另提供示例与 cookbook,便于把嵌入、检索与重排串成完整流程,而不必自己维护推理服务。
🧩面向具体场景的产品入口
官方按场景整理了入口:代码辅助、对话式 AI、Agent 系统、搜索、多模态与企业 RAG,并配有客户案例与演示站。这类组织的意义在于把「选模型、配参数、控成本」的经验固化下来:例如代码助手关注首 token 延迟与长上下文成本,RAG 关注嵌入与重排的组合,Agent 关注工具调用与结构化输出的稳定性。官方同时提供模型库、CLI(firectl)、API 参考与更新日志,接入路径比较完整,适合先照场景模板跑通再逐步替换细节。
🏢企业版与合规入口
对规模较大的组织,官方设有企业版入口,主打更快的速度、更低的成本与更高的速率上限,需要联系销售定制;另有 AI Native 与 Customers 页面用于介绍平台定位与客户情况,并单独提供信任中心(Trust Center)页面集中展示合规与安全材料。这类材料的价值在于采购评审阶段可以直接取证,而不必逐项向销售索取;涉及数据落地点、区域限制与专属容量的具体条款,仍应以合同与官方当期说明为准。
🎪生态活动与开发者资源
官网公告显示官方将举办首届会议 Forge 2026,用于集中发布产品与工程实践。开发者资源侧,官方提供模型库、以 firectl 为代表的命令行工具、API 参考、示例与 cookbook,以及按周期更新的 changelog;社区渠道包括 Discord、YouTube、LinkedIn 与 X。对准备长期使用的团队,判断平台是否值得投入,除了单价还要看文档更新频率与工具链完整度,这几项官方维护得比较齐。
产品特点
核心功能与独有价值
01微调模型与基座模型同价服务
官方明确承诺微调后的模型按与基座模型相同的价格服务,也就是说定制不会带来推理侧的溢价。对需要长期在自有数据上迭代的企业,这条规则直接影响总成本模型:微调的一次性训练费用之外,不会额外承担长期更高的调用单价。
02三档产品对应三种成本结构
Serverless 按 token、按需部署按 GPU 秒、托管训练按训练 token,官方把三档的价格口径分得很清,并分别给出价目表。用户可以先按用量特征选档,再在同一平台内从按量走向专属容量,而不必更换供应商与接口。
03训练侧提供共享池的免空闲方案
Serverless Training API 接入常驻共享训练池,官方称无开通流程、无空闲成本,只为 prefill、sample 与 train 的 token 付费。对训练需求偶发的团队,这避免了为跑一次微调而长期占用一张显卡,也把训练成本变成了可随用量伸缩的变量。
04价格按模型与规模分段公开
嵌入按参数量分三档、微调按模型规模分四段、按需部署按 GPU 型号列出每分钟与每小时价格,并标明区域限制按 1.5 倍计价。这种分段方式让预算测算更接近真实账单,而不是只给一个笼统的起步价。
最近动态
重要更新
首届会议 Forge 2026 公告
官网公告条显示官方将举办首届会议 Forge 2026 并开放报名入口。这类活动通常会同步发布新模型支持、推理优化与训练能力,可作为跟踪平台路线与工程实践的时间点。
按需部署价目覆盖到 GB300
截至 2026 年 9 月,官方按需部署价目列出 H100 80GB、H200 141GB、B200 180GB、B300 288GB 与 GB300 288GB 等机型,并同时给出每分钟与每小时价格,官方强调按 GPU 秒计费且启动时间不额外收费,限定区域部署按 1.5 倍计价。
Serverless 训练 API 处于私有预览
官方当前把 Serverless Training API 标为私有预览,接入共享训练池后可对目录内的 GLM、Qwen、Kimi、DeepSeek 与 Muse 等模型做 LoRA 训练,按 prefill、缓存 prefill、sample 与 train 四类 token 计价,预览期间检查点存储免费,官方称其他前沿模型会陆续加入。
Serverless 提供三类服务等级
官方把 Serverless 推理分为 Standard、Priority 与 Fast 三类等级,按 token 计费并提供后付费结算与 1 美元试用额度,具体模型价格指向官方文档的当期价目表。选等级时需要权衡延迟要求与单价,生产环境还应按峰值评估速率上限。
产品总结
Fireworks AI 是面向生成式 AI 的推理与训练平台,官方把产品分成三档。Serverless Inference 按 token 计费,官方描述为零配置、无冷启动、后付费结算并提供 1 美元试用额度,分 Standard、Priority 与 Fast 三类等级;On Demand Deployments 按 GPU 秒计费,官方强调启动时间不额外收费,可选的机型包括 H100 80GB、H200 141GB、B200 180GB、B300 288GB 与 GB300 288GB,限定区域部署按 1.5 倍计价;Training 一档用自有数据定制开源模型,官方承诺微调模型与基座模型同价服务。 训练相关的计价口径比较细:托管微调按 1M 训练 token 计费,SFT 与 DPO 以及全参数微调各有单价,并按模型规模分四段(160 亿参数以下、161 亿至 800 亿、800 亿至 3000 亿、3000 亿以上);强化微调按 GPU 小时计费、按秒结算,与按需部署同价。官方另提供 Serverless Training API,接入共享训练池做 LoRA 训练,无开通流程也无空闲成本,按 prefill、缓存 prefill、sample 与 train 四类 token 计价,当前标为私有预览且预览期间检查点存储免费。 向量化能力按基座模型参数量分档计费:1.5 亿参数以内每百万输入 token 0.008 美元,1.5 亿至 3.5 亿参数为 0.016 美元,Qwen3 8B 为 0.1 美元。开发者侧提供模型库、以 firectl 为代表的 CLI、API 参考、示例与 cookbook、changelog,以及 Discord 等社区渠道;场景入口按代码辅助、对话式 AI、Agent 系统、搜索、多模态与企业 RAG 分类,另有企业版与信任中心页面用于采购评审取证,官网公告显示将举办首届会议 Forge 2026。 使用前需要注意:Serverless 的单价随模型与服务等级变化,实际费率应以官方文档当期价目表为准,共享池的速率上限需要按自身峰值验证;按需部署虽然不收起停费,但闲置时间仍会计费,应先测算利用率;微调计费基于训练 token 总量,官方提示带思考轨迹的多轮对话会被展开从而增加计费 token,估算时应留出余量;限定区域、专属容量与企业条款需要单独沟通;模型权重来自不同厂商,商用前仍需分别核对许可。整体而言,它适合需要同时兼顾按量推理、专属容量与自有数据微调的团队。
- 产品类型
- 生成式 AI 推理与微调平台
- 支持平台
- Serverless 推理 API / 按需部署 / 托管微调 / Serverless 训练 API / 专用训练 API / Embeddings / CLI(firectl) / 模型库
- 资费模式
- 按 token、按训练 token 或按 GPU 秒计费:Serverless 按 token 并含 1 美元试用额度,按需部署按 GPU 秒计费并按分钟报价。
核验信息
参考文章与数据来源
本页事实来自 Fireworks AI 官方渠道:官网定价页(三档产品定位与计费口径、Embeddings 按参数量分档价格、托管微调按模型规模分段的 SFT/DPO 与全参数微调单价、Serverless Training API 的模型与四类 token 价目及私有预览说明、按需部署各机型每分钟与每小时价格与区域 1.5 倍计价说明)、官网导航与场景/企业页面(代码辅助、对话式 AI、Agent、搜索、多模态、企业 RAG、AI Native、企业版、Forge 2026 公告)与官方文档入口(入门、Serverless 价目、模型库、CLI、API、changelog、信任中心)。核验时间为 2026 年 9 月 22 日。价格随模型与服务等级调整较快,请以官方文档当期价目为准。
- 官网Fireworks AI 官网
- 官网定价(Serverless / 训练 / 按需部署)
- 官方文档官方文档(入门)
- 官方文档Serverless 价目表
- 官网模型库
- 更新日志更新日志
- 官方文档信任中心
用户体验调查
Fireworks AI介绍页面对您是否有帮助?