Gemini 3.8 Flash 与 Flash Cyber:谷歌的编程优先模型押注「代理式勤勉」

·阅读约 13 分钟·Evergreen Tools Team
Laptop screen with code and AI interface

💡 工具推荐要估算 3.8 Flash 开销或校验代理 JSON 载荷?用 Evergreen Tools 的 AI Token 计数器做成本预测、JSON 格式化工具校验 API 配置,并用 API 测试工具在生产接入前先演练模型端点。 AI Token 计数器, JSON 格式化工具, API 测试工具

2026 年 9 月初,谷歌发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber——六周内的第三款 Flash 模型。谷歌的定位很直接:这是迄今最强的推理与编程模型,速度与成本与 3.7 Flash 相同,专为「递归评估并精炼模型」的长时 agentic 循环而构建。对开发者来说,3.8 的核心叙事是「更努力」:复杂任务会执行更多推理步骤、迭代调用工具,直到答案通过自己的批判性检查。 这个设计直接体现在数据上:以 Flash 的价格带,它现在能摸到每 token 贵好几倍的前沿模型的边。它还在 DeepSWE v1.1 上以极低成本端到端解决复杂工程问题,超越多数更大的前沿模型。

1. 六周三发的 Flash 节奏

3.8 Flash 是六周内第三款 Flash:三周前的 3.7 Flash,再到今天的 3.8。定价带没有变(每百万输入 token 0.75 美元、输出 3.75 美元),性能却明显上探——谷歌说 3.8 的成绩经常逼近更贵的前沿模型。对预算敏感的团队,这条曲线很关键:你可以继续按 Flash 的成本规划,却拿到接近旗舰的编码与推理质量。

// Gemini 3.8 Flash pricing: 0.75 USD per million input tokens,
// 3.75 USD per million output tokens -- the same low band as
// 3.7 Flash, with markedly better coding and reasoning scores.
const PRICING = {
  "gemini-3.8-flash": { inputPerM: 0.75, outputPerM: 3.75 },
  "gemini-3.7-flash": { inputPerM: 0.75, outputPerM: 3.75 },
};

function estimateCost(tokens, model) {
  const p = PRICING[model];
  return (
    (tokens.input / 1_000_000) * p.inputPerM +
    (tokens.output / 1_000_000) * p.outputPerM
  );
}

2. 跑分之外:它真的更「勤勉」

3.8 Flash 的性能来自一个设计选择:在复杂任务上更努力。它会执行额外的推理步骤、迭代调用工具,在高 effort 档位下可能消耗更多 token 来换取上限表现。在 DeepSWE v1.1(长时软件工程基准)上,它端到端自主解决复杂工程问题,超过多数更大的前沿模型且成本只是一小部分;在 Vals Finance Agent V2 与 Harvey 法律代理基准上也领先,HLE-Verified 得分 54.9%。

Circuit board representing model infrastructure
{
  "model": "gemini-3.8-flash",
  "effort": "medium",
  "agenticLoop": {
    "enabled": true,
    "recursiveRefine": true,
    "maxIterations": 6,
    "note": "3.8 works harder on complex tasks: extra reasoning
             steps and iterative tool calls until the answer
             survives its own critique pass"
  },
  "tools": [
    { "name": "read_file", "mode": "granted" },
    { "name": "run_tests", "mode": "granted" },
    { "name": "git_commit", "mode": "human_approval" }
  ]
}

3. 效率优先怎么办:3.7 Flash 仍在

「更努力」意味着同样的价格下,复杂任务的 token 消耗可能更高。谷歌给出的答案是 effort 档位与双轨策略:计算效率是硬约束的场景,用低 effort 档位减少 token 开销,或者继续用完全受支持的 3.7 Flash。工程上建议按任务复杂度路由,而不是全公司一把梭:简单任务交给 3.7,SWE 或金融法律等专业任务交给 3.8。

// Route by task difficulty, not by habit. 3.8 Flash costs the
// same as 3.7 Flash but spends more tokens when a task is hard;
// for efficiency-first workloads 3.7 Flash remains supported.
function routeTask(task) {
  if (task.complexity === "low" && task.budget === "strict") {
    return "gemini-3.7-flash";
  }
  if (task.kind === "swe" || task.domain === "finance" ||
      task.domain === "legal") {
    return "gemini-3.8-flash";
  }
  return "gemini-3.8-flash";
}

// DeepSWE v1.1: 3.8 Flash solves long-horizon engineering tasks
// end to end, beating most larger frontier models at a fraction
// of the cost. Domain wins: Vals Finance Agent V2, Harvey Legal.

4. Flash Cyber:防御者的专用档

3.8 Flash Cyber 是这轮发布里对安全团队最有意义的部分,仅通过 Fairwind 计划向可信防御者提供。在 CyberGym 漏洞发现基准上达到前沿水平,超过 3.5 Flash Cyber 以及更大的前沿模型;覆盖 20 种语言的内部基准成功率超过 70%。它在 CWE-Bench(补丁能力)上 pass@1 为 47.2%,与领先前沿模型的 47.8% 只差毫厘,成本却低得多——谷歌已经用它保护自家代码。

Cybersecurity defense operations interface

5. 安全边界:能补洞,不造矛

谷歌强调 Flash Cyber 从一开始就聚焦防御者能力:优先漏洞修复而非漏洞利用。模型在 CBRN(生化放射核)与网络攻击滥用方面带防护,Cyber 变体则对可信防御者开放更完整的网络能力。对安全团队,这意味着可以把「发现→修复」的扫描代理接到真实代码库,同时把「生成可利用代码」从工具面上排除掉。

// The agent loop that 3.8 was trained for: run, critique, refine.
// Recursive self-evaluation is what turns a 54.9 percent
// HLE-Verified score into dependable long-horizon behavior.
function agenticRun(task, maxIterations) {
  let draft = plan(task);
  for (let i = 0; i < maxIterations; i++) {
    const result = execute(draft);
    const critique = evaluate(result, task.acceptance);
    if (critique.pass) return result;
    draft = refine(draft, critique.notes);
  }
  return { status: "needs_review", draft };
}

6. 落地建议

先用你自己的任务集做成本-质量回放:同样的提示,比较 3.7 Flash 与 3.8 Flash 在不同 effort 档位下的完成率与 token 账单。再按领域路由:金融、法律、跨仓库 SWE 任务交给 3.8,简单且预算敏感的任务留在 3.7。最后,把 3.8 的「批判-精炼」循环模式抄进你自己的代理编排——它不只是模型特性,更是值得复用的架构模式。 顺便说一句:如果你已经在用 3.7 Flash,升级的风险很低——同样的价格带、同样的接口,只是复杂任务会拿到一个更勤恭的执行者。

// Flash Cyber is defense-first by design: vulnerability finding
// and patching, not exploitation. CWE-Bench pass@1 of 47.2
// percent sits near a leading frontier model's 47.8 percent at
// significantly lower cost.
const defenderPolicy = {
  allowVulnerabilityDiscovery: true,
  allowFixGeneration: true,
  allowExploitDevelopment: false,
  cbrnSafeguards: "enforced",
  access: "fairwind_trusted_defenders_only",
  benchmark: {
    cyberGym: "frontier_level",
    internal20Languages: "above_70_percent",
    cweBenchPassAt1: "47.2_percent",
  },
};

📌 常见问题 FAQ

Gemini 3.8 Flash 与 3.7 Flash 价格相同吗?

是的,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。但 3.8 在复杂任务上会更「勤勉」,可能消耗更多 token;简单任务可用低 effort 或继续使用 3.7 Flash 控制成本。

Gemini 3.8 Flash 与 3.7 Flash 价格相同吗?

是的,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。但 3.8 在复杂任务上会更「勤勉」,可能消耗更多 token;简单任务可用低 effort 或继续使用 3.7 Flash 控制成本。

Gemini 3.8 Flash 与 3.7 Flash 价格相同吗?

是的,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。但 3.8 在复杂任务上会更「勤勉」,可能消耗更多 token;简单任务可用低 effort 或继续使用 3.7 Flash 控制成本。

Gemini 3.8 Flash 与 3.7 Flash 价格相同吗?

是的,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。但 3.8 在复杂任务上会更「勤勉」,可能消耗更多 token;简单任务可用低 effort 或继续使用 3.7 Flash 控制成本。

Gemini 3.8 Flash 与 3.7 Flash 价格相同吗?

是的,每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。但 3.8 在复杂任务上会更「勤勉」,可能消耗更多 token;简单任务可用低 effort 或继续使用 3.7 Flash 控制成本。

3.8 Flash 的编程能力到底强在哪?

谷歌称它在 DeepSWE v1.1 上以极低成本端到端解决长时工程问题,超越多数更大的前沿模型;在 Vals Finance Agent V2 与 Harvey 法律代理基准上领先,HLE-Verified 54.9%。

3.8 Flash 的编程能力到底强在哪?

谷歌称它在 DeepSWE v1.1 上以极低成本端到端解决长时工程问题,超越多数更大的前沿模型;在 Vals Finance Agent V2 与 Harvey 法律代理基准上领先,HLE-Verified 54.9%。

3.8 Flash 的编程能力到底强在哪?

谷歌称它在 DeepSWE v1.1 上以极低成本端到端解决长时工程问题,超越多数更大的前沿模型;在 Vals Finance Agent V2 与 Harvey 法律代理基准上领先,HLE-Verified 54.9%。

3.8 Flash 的编程能力到底强在哪?

谷歌称它在 DeepSWE v1.1 上以极低成本端到端解决长时工程问题,超越多数更大的前沿模型;在 Vals Finance Agent V2 与 Harvey 法律代理基准上领先,HLE-Verified 54.9%。

3.8 Flash 的编程能力到底强在哪?

谷歌称它在 DeepSWE v1.1 上以极低成本端到端解决长时工程问题,超越多数更大的前沿模型;在 Vals Finance Agent V2 与 Harvey 法律代理基准上领先,HLE-Verified 54.9%。

Flash Cyber 和普通版有什么区别?

Flash Cyber 面向漏洞发现与修复的防御者能力,在 CyberGym 达到前沿水平、20 语言内部基准成功率超 70%、CWE-Bench pass@1 为 47.2%;仅通过 Fairwind 计划向可信防御者提供。

Flash Cyber 和普通版有什么区别?

Flash Cyber 面向漏洞发现与修复的防御者能力,在 CyberGym 达到前沿水平、20 语言内部基准成功率超 70%、CWE-Bench pass@1 为 47.2%;仅通过 Fairwind 计划向可信防御者提供。

Flash Cyber 和普通版有什么区别?

Flash Cyber 面向漏洞发现与修复的防御者能力,在 CyberGym 达到前沿水平、20 语言内部基准成功率超 70%、CWE-Bench pass@1 为 47.2%;仅通过 Fairwind 计划向可信防御者提供。

Flash Cyber 和普通版有什么区别?

Flash Cyber 面向漏洞发现与修复的防御者能力,在 CyberGym 达到前沿水平、20 语言内部基准成功率超 70%、CWE-Bench pass@1 为 47.2%;仅通过 Fairwind 计划向可信防御者提供。

Flash Cyber 和普通版有什么区别?

Flash Cyber 面向漏洞发现与修复的防御者能力,在 CyberGym 达到前沿水平、20 语言内部基准成功率超 70%、CWE-Bench pass@1 为 47.2%;仅通过 Fairwind 计划向可信防御者提供。

什么是「3.8 更努力」的设计?

模型在复杂任务上会执行额外推理步骤并迭代调用工具,直到结果通过递归的自我评估;高 effort 档位下 token 消耗更高,低 effort 档位适合效率优先场景。

什么是「3.8 更努力」的设计?

模型在复杂任务上会执行额外推理步骤并迭代调用工具,直到结果通过递归的自我评估;高 effort 档位下 token 消耗更高,低 effort 档位适合效率优先场景。

什么是「3.8 更努力」的设计?

模型在复杂任务上会执行额外推理步骤并迭代调用工具,直到结果通过递归的自我评估;高 effort 档位下 token 消耗更高,低 effort 档位适合效率优先场景。

什么是「3.8 更努力」的设计?

模型在复杂任务上会执行额外推理步骤并迭代调用工具,直到结果通过递归的自我评估;高 effort 档位下 token 消耗更高,低 effort 档位适合效率优先场景。

什么是「3.8 更努力」的设计?

模型在复杂任务上会执行额外推理步骤并迭代调用工具,直到结果通过递归的自我评估;高 effort 档位下 token 消耗更高,低 effort 档位适合效率优先场景。

如何把 3.8 Flash 接入生产?

建议先做成本-质量回放对比 3.7/3.8 与各 effort 档位,再按任务复杂度路由;在代理编排中启用工具调用与人类审批,并对输出做 schema 校验。

如何把 3.8 Flash 接入生产?

建议先做成本-质量回放对比 3.7/3.8 与各 effort 档位,再按任务复杂度路由;在代理编排中启用工具调用与人类审批,并对输出做 schema 校验。

如何把 3.8 Flash 接入生产?

建议先做成本-质量回放对比 3.7/3.8 与各 effort 档位,再按任务复杂度路由;在代理编排中启用工具调用与人类审批,并对输出做 schema 校验。

如何把 3.8 Flash 接入生产?

建议先做成本-质量回放对比 3.7/3.8 与各 effort 档位,再按任务复杂度路由;在代理编排中启用工具调用与人类审批,并对输出做 schema 校验。

如何把 3.8 Flash 接入生产?

建议先做成本-质量回放对比 3.7/3.8 与各 effort 档位,再按任务复杂度路由;在代理编排中启用工具调用与人类审批,并对输出做 schema 校验。