一个 API 覆盖 200+ 模型
官方的核心卖点是「用一个 API 访问 200+ AI 模型」,定价页把这些模型按 LLM、图像、音频、视频、AI 搜索与缓存分成若干类,每类下面直接列出上下文长度与输入输出单价。对同时要做文本、图像、语音的团队,这种组织方式省掉了为每种模态分别开户、分别计费的麻烦:同一套密钥与账单,按任务挑模型即可;代价是需要自己定期核对模型清单,因为上架与下架都比较频繁。
深度介绍
官方的核心卖点是「用一个 API 访问 200+ AI 模型」,定价页把这些模型按 LLM、图像、音频、视频、AI 搜索与缓存分成若干类,每类下面直接列出上下文长度与输入输出单价。对同时要做文本、图像、语音的团队,这种组织方式省掉了为每种模态分别开户、分别计费的麻烦:同一套密钥与账单,按任务挑模型即可;代价是需要自己定期核对模型清单,因为上架与下架都比较频繁。
定价页给每个模型列出上下文、输入价与输出价,多数还带一列缓存读取价(Cache Read)。可以举几个官方页面上的例子:DeepSeek V4.1 Flash 输入 0.3 美元、输出 1.2 美元、缓存读取 0.006 美元;DeepSeek V4 Pro 0813 为 1.32 / 3.96,缓存 0.044;DeepSeek V4 Flash 为 0.14 / 0.28,缓存 0.028;Llama 3.3 70B 为 0.135 / 0.4;Llama 4 Scout 为 0.18 / 0.59。缓存列的意义是系统提示词或固定前缀反复出现时能显著压低输入成本。
产品线里单独设有 Agent Sandbox,官方描述为「几分钟内启动安全的 Agent 沙箱」。对做 Agent 的团队,这一层解决的是「模型产出代码之后在哪跑」的问题:与其在自己的服务器上直接执行模型生成的代码,不如放进隔离沙箱,并配合超时与资源限制。官方把沙箱与 GPUs、Model APIs 并列放在主导航里,说明它是独立产品而非附属功能,计费也单独列档。
除按 token 的 API 外,官方提供 GPU 实例租用,定价页把它与 Serverless 端点、Dedicated 端点、Agent 沙箱并列为四个页签。两条路线的取舍很清楚:调用量波动或模型不固定时按 token 更划算,模型固定且利用率高时自己租卡更省。官方同时强调「按创业公司的预算定价」,也就是在这两条线上都把价格当卖点,而不是主推企业定制。
官方在定价页顶部写明,Batch 推理对支持的模型提供输入与输出 token 各 50% 的入门折扣,并在文档里单独给出 Batch API 的用法。对离线打分、数据清洗、内容批量生成这类不要求即时返回的任务,把请求攒成批处理是成本优化里最直接的一招;需要注意的是折扣只覆盖「支持的模型」,选型前应先确认目标模型是否在名单内。
模型接入分成 Serverless 端点与 Dedicated 端点两档:前者按 token 共享资源,适合起步与波动流量;后者提供专属容量,面向对稳定性与速率上限有要求的生产负载。这种分档与同类平台一致,差别在于官方把两档的价格都放在同一张定价页上分页签呈现,方便在同一界面里比较「按量」与「专属」的成本差,而不必分别询价。
除文本模型外,定价页覆盖图像、音频、视频模型,并单独设有 AI 搜索类目与缓存类目。对做内容生产或多模态应用的团队,这意味着生成图片、配音、视频与检索可以走同一平台的账务与密钥体系,减少跨供应商拼接;反过来也要注意不同模态的计费单位并不相同(按张、按秒、按字符、按 token 各有),做预算时要按各自单位分别估算。
官方定价页的标题句是「定价从想法无缝扩展到企业级」,配合首页的「为开发者打造、按创业公司的预算定价」,可以读出它的目标客户是预算有限但增长快的开发团队。这类平台的实用判断标准有三条:文档是否够细、模型上新是否跟得上、单位成本是否随时可查。Novita AI 在这三点上都把信息放在公开页面,适合先小流量试跑再决定是否加量。
产品特点
多数推理平台只卖模型调用,Novita AI 把 Agent Sandbox 与 GPUs、Model APIs 并列放在主导航与定价页签里,解决的是「模型生成的代码在哪里安全执行」。对 Agent 类应用,这比单纯降低 token 单价更有实际价值。
定价表为多数模型单列 Cache Read 价格,例如某模型输入 0.3 美元、缓存读取仅 0.006 美元。对系统提示词很长或前缀重复率高的应用,这一列直接影响账单,公开出来便于事前估算而非上线后才发现。
官方把「Batch 推理输入输出各五折」的入门优惠放在定价页顶部并附文档链接。批处理是成本优化最直接的手段之一,把它当作公开卖点,意味着这类任务被明确鼓励走批处理通道。
定价页用四个页签并列 Serverless 端点、Dedicated 端点、Agent 沙箱与 GPU,四类资源的价格结构放在一起,便于在「按 token」「专属容量」「沙箱执行」「自己租卡」之间直接比较,而不是分别谈商务。
最近动态
截至 2026 年 9 月,官方定价页以 Serverless Endpoints、Dedicated Endpoints、Agent Sandbox、GPUs 四个页签组织价格,模型价目按 LLM、图像、音频、视频、AI 搜索与缓存分类,每个模型列出上下文长度、输入价、输出价,多数另带缓存读取价。价格更新较快,请以当期页面为准。
官方在定价页顶部公告,Batch 推理对支持的模型提供输入与输出 token 各 50% 折扣,并链接到 Batch API 文档。该优惠适用于支持批处理的模型,是否覆盖目标模型需在文档中确认;对离线批量任务,这是最直接的成本优化路径之一。
官网主导航与定价页把 Agent Sandbox 与 Model APIs、GPUs 并列为独立入口,官方描述为「几分钟内启动安全的 Agent 沙箱」。对需要执行模型生成代码的 Agent 应用,这提供了与推理同平台的隔离执行环境,计费单列。
官网描述为「用一个 API 访问 200+ AI 模型,几分钟内启动安全的 Agent 沙箱与 GPU 实例」,并写明定位是「为开发者打造、按创业公司的预算定价」。这一定位意味着其价格策略面向中小团队,企业级定制需求需另行沟通。
Novita AI 官方定位是「面向开发者的 AI 与 Agent 云」,描述为「用一个 API 访问 200+ AI 模型,并在几分钟内启动安全的 Agent 沙箱与 GPU 实例」,同时强调「为开发者打造、按创业公司的预算定价」。产品线有四块,并且在定价页上以四个页签并列呈现:Serverless 端点、Dedicated 端点、Agent 沙箱与 GPU 实例。模型方面按 LLM、图像、音频、视频、AI 搜索与缓存分类,每一类下面直接标出上下文长度与单价。\n\n计费以每百万 token 为主,多数模型除输入价、输出价外还单列缓存读取价。官方页面上的例子包括:DeepSeek V4.1 Flash 输入 0.3 美元、输出 1.2 美元、缓存读取 0.006 美元;DeepSeek V4 Pro 0813 为 1.32 / 3.96,缓存 0.044;DeepSeek V4 Flash 为 0.14 / 0.28,缓存 0.028;DeepSeek OCR 2 为 0.03 / 0.03;Llama 3.1 8B Instruct 为 0.02 / 0.05;Llama 3.3 70B 为 0.135 / 0.4;Llama 4 Maverick 为 0.27 / 0.85;Llama 4 Scout 为 0.18 / 0.59。缓存读取价通常显著低于普通输入价,对固定前缀与长系统提示词场景影响很大。\n\n另有一项值得单独注意的优惠:官方在定价页顶部写明 Batch 推理对支持的模型提供输入与输出 token 各 50% 的入门折扣,并链接到 Batch API 文档。Agent 沙箱则解决「模型生成的代码在哪里执行」的问题,官方把它放在主导航与定价页的独立页签中,说明它是与推理并列的产品而非附属功能;GPU 实例则给模型固定、利用率高的团队一条按算力计费的路径。\n\n使用时需要注意:模型清单与价格更新频繁,预算应以当期页面与自身输入输出比例计算,并确认目标模型是否在 Batch 折扣覆盖范围内;缓存的收益取决于前缀重复率与缓存策略,不命中的请求按普通输入价计费;不同模态的计费单位不同(按 token、按张、按秒、按字符),需要分别估算;沙箱与 GPU 属于按资源计费的部分,闲置时间通常也在计费口径内;开放权重模型的许可与平台条款相互独立,商用前需分别核对。整体而言,它适合预算有限、需要同时用到多种模态模型并可能运行 Agent 代码的开发者团队。
核验信息
本页事实来自 Novita AI 官方渠道:官网首页(「AI & Agent Cloud for Developers」定位、200+ 模型与 Agent 沙箱、GPU 实例的描述)与官方定价页(Serverless 端点 / Dedicated 端点 / Agent 沙箱 / GPU 四个页签、按 LLM / 图像 / 音频 / 视频 / AI 搜索 / 缓存分类的模型价目与上下文长度、各模型的输入输出与缓存读取价、Batch 推理输入输出各五折的入门优惠公告及其文档链接),另有 Agent 沙箱页、官方文档与模型列表入口。核验时间为 2026 年 9 月 22 日。价格与模型阵容更新较快,Batch 折扣仅覆盖支持的模型,请以官方当期页面与文档为准。
Novita AI介绍页面对您是否有帮助?