Gemini 3.8 Flash 什么时候发布?最新消息、发布时间与 AI Coding 能力预测

截至 2026 年 9 月 2 日,Gemini 3.8 Flash 尚未官方发布。梳理周三发布传闻、内部代号 skimaki、发布窗口,以及相对 3.7 Flash 的 AI Coding 能力预测。

先给结论:截至 2026 年 9 月 2 日,Gemini 3.8 Flash 仍没有官方发布。AI Studio、Gemini API、Vertex AI 模型列表里没有可调用的 gemini-3.8-flash,DeepMind 模型卡仍停在 8 月 13 日 GA 的 Gemini 3.7 Flash。同一天,多家媒体和泄漏账号把「周三」写成公开日,内部代号 skimaki、生产部署「已完成」的说法也在转——这些是线索,不是发版说明。

8 月 28 日那篇《Gemini 3.8 Flash 发布窗口与 API JSON 前瞻》已经把 Structured Output / Function Calling 的兼容性讲过了;《Gemini 3.7 Flash 价格、API 与 JSON》是当前能调用的 Flash。这篇只补三件事:9 月 2 日前后的最新消息、发布时间怎么读、以及 3.8 在 AI Coding 上大概会往哪走。

发布了没有:2026-09-02 现状

可以当作核对清单:

  • 公开产品:未发布。AI Studio / Gemini API / Vertex AI 没有可调用的 3.8 Flash。
  • 模型 ID:不存在已文档化的 gemini-3.8-flash。把泄漏字符串写进生产配置会直接 404。
  • 价格与上下文:未披露。社区里「100 万 token 上下文」「只要 3.7 一半价钱」都没有官方出处。
  • 当前主力 Flash:仍是 gemini-3.7-flash,Intro 价 $0.75 / $3.75(每百万 input / output token)至 2026-12-31,2027-01-01 起标准价 $1.50 / $7.50。

所以「什么时候发布」的诚实答案是:Google 还没定公开日;今天是传闻中的周三,不是官方日历上的周三。下面把 9 月 1–2 日的新线索和 8 月已确认的节奏拆开,避免把「生产部署完成」当成 GA。

9 月最新消息与证据强度

按可信度从高到低排,而不是按「明天就要发」的热度。

时间消息强度
2026-08-13Gemini 3.7 Flash 正式 GA,官方模型卡与 Intro 价上线已确认
2026 Q2 财报Sundar Pichai 称 Flash 线目标接近「每月一更」已确认(节奏,不是 3.8 本身)
2026-08-27Business Insider:员工在内部编码平台 Jetski 使用「Gemini 3.8 Flash Preview」;Google 拒绝置评中高:有图、有具名报道,仍非正式发版
2026-08-10腾讯论文把「Gemini 3.8 Flash」写成评测裁判之一(3.7 发布前三天)弱:笔误或提前拿到内部名
2026-09-01泄漏称内部代号 skimaki、生产部署已完成,公开日指向 9 月 2 日周三弱到中:多家二手转述,无模型卡、无 API changelog
2026-09-02截至本文写作,官方渠道仍无 3.8 模型卡或可调用端点已确认(「没发」本身)

9 月 1 日那一波比 8 月 27 日多了三个新词:skimaki(内部代号)、生产部署已完成、周三公开。CryptoBriefing、4sAPI 等二次报道把它们写成「Google 将于 9 月 2 日揭晓」。值得记下的是:泄漏社区对 Flash 小版本的提前量,过去两轮并不差;但「部署完成」在 Google 内部可以只表示流量切到员工狗粮,不等于对外 Developer Preview。

早期试用反馈仍然只有一句主观评价:「已经明显好于 3.7 Flash」,并强调「完整评测还太早」。新增的技术方向更具体一些:减少啰嗦输出(Flash 线的老问题),以及修补 3.7 暴露的若干失败模式。这和「革命性换代」不是一回事——更像 3.6→3.7 那种两到三周的增量。

X 上更激进的说法(「Fable 5 级质量、Flash 级价格」「已完成数月合作伙伴测试」)仍然没有 DeepMind 模型卡或 API changelog。一篇论文里的一个「3.8」、一个匿名 Arena 模型,都不能当发布日历。

发布时间怎么推

Google 没有公布 3.8 的日期。能推的只有 Flash 线自己的间隔,再加上今天这条「周三」传闻:

  • Gemini 3.6 Flash:2026 年 7 月 21 日前后 GA。
  • Gemini 3.7 Flash:2026-08-13 GA,距 3.6 大约三周。
  • 3.8 Preview:8 月 27 日已在 Jetski 上,距 3.7 GA 仅 14 天。
  • Pichai 在 Q2 电话会:Flash 尽量做到接近月更。
  • 9 月 1 日泄漏:公开日指向 9 月 2 日(周三)。若按 3.7 的间隔,9 月 2–4 日也正好落在「三周左右」。

把这些叠在一起,对外窗口仍然是 2026 年 9 月上旬到中旬。今天(9 月 2 日)是窗口的左沿,不是截止日期。若周三没有模型卡,更合理的读法是「窗口还开着」,而不是「3.8 黄了」。内部 Preview 仍可能合回 3.7 的静默更新,或改名再出。

规划项目时,不要把 3.8 写成里程碑依赖。把 model 字符串做成配置,3.7 继续承担编码与 Agent 流量。等 AI Studio / DeepMind 模型卡出现再加一行 fallback。

为什么盯 AI Coding:Jetski 不是聊天窗口

3.8 的内部入口选在 Jetski——Google 自己的编码平台,而不是普通聊天框。这比任何「Fable 5 级」口号都更说明产品意图:Flash 线要当「写代码、修 Issue、跑 Agent」的默认引擎,用内部真实仓库做狗粮,再决定对外日期。

这也解释了发布节奏为什么被压到两到三周。旗舰(Gemini 4 预训练已于 2026-07-21 启动,没有发布窗口)走长周期;Flash 吃的是算法小改、后训练、工具课程和失败模式修补。Logan Kilpatrick 对 3.6→3.7 的表述就是「聪明的算法调整,不是整模重训」。3.8 大概率还是这一条路。

对写代码的人来说,这意味着两件事:第一,3.8 的胜负不在 Arena 闲聊分,而在补丁一次过、测试一次绿、工具少空转;第二,API 形状大概率不变,变的是同一套仓库任务上的成功率与总 token。上一篇已经说过 Structured Output 字段不会换;这篇把尺子换成编码任务。

3.7 Flash 已经兑现的编码分数

没有 3.8 的官方 bench,就不能编造百分比。能当基线的是 3.6 → 3.7 已经写进模型卡的编码与 Agent 分数:

指标3.6 Flash3.7 Flash(已确认)含义
FrontierCode 1.1 Main34.4%43.6%(+9.2pp)仓库级编码主集
DeepSWE v1.149.0%65.3%(+16.3pp)软件工程 Agent
AutomationBench17.0%30.4%(+13.4pp)多步自动化
WebDev Arena Elo—1588浏览器 UI / 交互实现
定位便宜快的通用 Flash编码与 Agent 的 workhorse3.8 若续这条线,应继续补短板

这些跳变不是闲聊润色。它们说明 Google 已经把 Flash 的训练预算压在「补丁、工具、多步」上。评估 3.8 时,应沿用同一套尺子:补丁编辑成功率、测试用例通过率、工具失败后的恢复、多轮指令一致性、以及跑完一个 Issue 的总 token。单轮回复是否「更聪明」不够用。

成本也不能只看百万 token 标价。Agent 编码会反复读文件、跑测试、自我修正,单次任务的总消耗经常是单轮问答的数倍。Flash 的竞争力在「完成一个 Issue 的总价 × 延迟」,不在 Arena 匿名分。3.7 的 Intro 价已经比 Claude Fable 5 的 $10 / $50 低一个数量级;3.8 就算再聪明一点,默认模型仍由「单次任务成本 × 重试次数」决定。

3.8 的 AI Coding 能力预测

下面是假设,不是跑分。依据只有三样:3.6→3.7 的方向、Jetski 狗粮、以及「少废话、修 3.7 的坑」这两条泄漏。

更可能兑现的

  • 输出更短、更像补丁:Flash 线一直被抱怨「先自我介绍再改三行」。若 3.8 真把 verbosity 压下去,编码场景会直接省 output token,也少污染 diff。这是最便宜、也最符合泄漏措辞的一跳。
  • 少一次无效 tool 来回:3.7 相对 3.6,DeepSWE / AutomationBench 的涨幅已经说明「多步」是主攻。下一跳若仍瞄准 workhorse,优先项是少选错工具、少漏 required、少对同一测试命令空转——而不是再堆 100 万 token 上下文。
  • 补丁一次过率略升:FrontierCode 从 34.4% 到 43.6% 之后,3.8 更像继续爬几个点,而不是突然对标旗舰。内部员工那句「明显好于 3.7」可以当成方向,不能外推成「Fable 5」。
  • API 形状不变:编码 Agent 仍用 tools.parameters 交 JSON 参数,需要结构化补丁时仍用 response_mime_type + Schema。3.8 作为 Flash 小版本,应先假设兼容;GA 当天换模型字符串,用同一套夹具回归。细节见《API JSON 前瞻》。
  • 价格留在 Flash 档:破坏「便宜、快、日调用几千次」会逼团队留在 3.7 Intro 价上。更合理的预测是单价仍落在 Flash,质量往 3.7 的编码短板补。

不太可能、或证据不足的

  • 「Fable 5 质量、Flash 价格」:没有官方 bench。3.7 自己也没跨到那个档;一次内部试用不能当价目表。
  • 全新的编码 API 或仓库级协议:从 2.5 到 3.7,换的是模型字符串和行为,不是字段名。3.8 没有理由先发明一套。
  • 靠 100 万 token 上下文赢编码:社区在传 3.8 沿用 1M 窗,但未证实;即便沿用,编码瓶颈也更常在工具循环和测试反馈,不在窗口广告。
  • 今天就能当生产默认模型:在模型卡出现之前,任何「周三已 GA」的配置变更都是事故。
from google import genai
from google.genai import types

# 3.8 未 GA 前不要把生产模型改成未文档化的 ID。
# 编码 Agent 的回归夹具应钉在仓库任务上,而不是聊天评分。
MODEL = "gemini-3.7-flash"

run_tests = types.FunctionDeclaration(
    name="run_tests",
    description="在指定路径运行测试并返回失败摘要",
    parameters={
        "type": "object",
        "properties": {
            "path": {"type": "string", "description": "测试目标,如 tests/test_parser.py"},
            "max_fail": {"type": "integer", "description": "最多返回几条失败"}
        },
        "required": ["path"],
    },
)

client = genai.Client()
response = client.models.generate_content(
    model=MODEL,
    contents="parser 在空对象上抛 KeyError,先跑 tests/test_parser.py 再给最小补丁。",
    config=types.GenerateContentConfig(
        tools=[types.Tool(function_declarations=[run_tests])],
    ),
)

这才是 3.8 该被比较的形状:同一条 Issue、同一组工具、同一份测试。看的是少几次 tool 来回、少一段废话、补丁是否还能 apply。和 Claude Fable 5 比「谁更聪明」没有意义。

编码工作流该怎么验收

3.8 一旦出现在官方列表,不要先看新闻稿,先跑自己的仓库。建议把夹具分成四格:

格子测什么3.8 该比 3.7 好在哪
补丁编辑给定失败测试,模型能否给出可 apply 的最小 diff一次通过率升、无关文件少动
工具循环读文件 → 改代码 → 跑测试 → 读失败少选错工具、少空转、少漏 required
指令跟随「只改 parser,不要重构」是否被遵守多轮后仍不跑偏
总账完成一个 Issue 的 input+output token 与墙钟时间更短输出应拉低总价;若 token 涨了,主观「更好」可能是亏的

工具参数仍是 JSON。模型填参通过、测试命令却跑飞,多半是 Schema 太松,不是 3.8「不够聪明」。落地仍建议两道闸:json.loads + 同一份 JSON Schema;路径、超时、最大失败条数自己写死。样例输出丢进 JSON 工具箱做本地 Diff,不上传——3.7 和未来的 3.8 用同一套夹具,才比较得了「是不是真的更稳」。相关流水线见《Tool Calling 与 JSON Schema 验证》《Tool Calling → MCP 数据流》。

开发者现在该做什么

  1. 生产继续钉在 3.7 Flash:gemini-3.7-flash 吃 Intro 价,把 default model 做成配置。不要预写 gemini-3.8-flash 或 skimaki。
  2. 先把编码回归夹具写完:10–30 个真实 Issue(补丁、测试、多轮约束)。3.8 一旦 GA,只换模型再跑一遍。
  3. 记录总 token,不只记录「感觉更好」:Agent 任务的账单在循环次数上,不在单轮标价。
  4. 缓存 System + tools:Agent 系统提示和工具列表走 Context Caching,3.7 Intro 期缓存读取约 $0.075 / 1M token。
  5. 预算按 2027 标准价算:即便 3.8 带着新 Intro 价,3.7 自己也会在 2027-01-01 翻倍。
  6. 只看官方渠道:DeepMind Flash 模型卡、Gemini API changelog、Vertex 模型列表。周三传闻和 Arena 匿名模型不当作排期。

常见问题 FAQ

Gemini 3.8 Flash 什么时候发布?

Google 尚未公布日期。泄漏把公开日指向 2026 年 9 月 2 日周三,且内部代号 skimaki、生产部署「已完成」。按 3.6 到 3.7 约三周、以及 CEO 所述的接近月更节奏,对外窗口仍是 9 月上旬到中旬。今天是窗口左沿,不是官方承诺,不能当项目截止日期。

现在能调用 gemini-3.8-flash 吗?

不能。截至 2026 年 9 月 2 日没有公开 API、SDK 模型 ID 或 DeepMind 模型卡。生产请使用 gemini-3.7-flash。

「生产部署已完成」是不是等于马上 GA?

不等于。内部部署可以只服务 Jetski 员工狗粮。Business Insider 证实的是 Preview,Google 拒绝置评。狗粮可能数周后 GA,也可能改名或合回 3.7。

3.8 的 AI Coding 会比 3.7 强多少?

没有官方 bench。能外推的是 3.6→3.7 已经兑现的编码 / Agent 方向,以及「少废话、修 3.7 的坑」。更可能看到更短补丁和更少无效 tool 来回,而不是突然达到 Fable 5。发布当天以模型卡和你自己的仓库夹具为准。

该不该等 3.8 再上编码 Agent?

不该等。工具 Schema、测试夹具和错误回灌与具体 Flash 小版本无关。先在 3.7 上把流水线跑通,3.8 来了只换模型字符串。

3.8 会换编码相关的 API 吗?

从 2.5 到 3.7 的惯例是模型 ID 变、请求字段不变。编码 Agent 继续用 tools.parameters;需要结构化补丁时继续用 response_schema / response_json_schema。先假设兼容,GA 当天再回归。

总结

Gemini 3.8 Flash 还没发布。2026 年 9 月 2 日能确认的是:3.7 Flash 在服役、Intro 价还在、内部 Preview 已在 Jetski 跑了一周,泄漏把今天写成公开日。按近两个月的 Flash 节奏,公开日更像「九月上旬这几天到中旬」,而不是等 Gemini 4。今天没有模型卡,就把「周三」当成窗口左沿,而不是截止日期。

AI Coding 上,3.8 更像 3.7 的短板修补:更短输出、更少空转、补丁一次过率略升。尺子用仓库任务,不用 Arena。JSON / Function Calling 的请求形状大概率不变——上一篇已经写过。今天把编码夹具和本地校验准备好,比追泄漏日历更有用。3.8 一旦出现在官方模型列表,用同一套 Issue 再跑一遍即可。