Gemini 3.6 Flash和3.5 Flash-Lite正式可用于生产:外贸任务按难度分流
作者:AI 外贸 ·
Google官方release notes显示,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite在7月21日转为GA,最新模型文档在7月30日更新。3.6 Flash的官方定位是复杂agent、多模态推理和更少token;3.5 Flash-Lite则面向高吞吐数据分析、...
Google官方release notes显示,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite在7月21日转为GA,最新模型文档在7月30日更新。3.6 Flash的官方定位是复杂agent、多模态推理和更少token;3.5 Flash-Lite则面向高吞吐数据分析、文档抽取、路由和结构化JSON。两者都写明支持1M token上下文和64k最大输出。官方价格页显示,3.6 Flash为每百万输入token 1.50美元、输出7.50美元;3.5 Flash-Lite为输入0.30美元、输出2.50美元。
把它翻译成外贸工作语言:Flash-Lite适合每天大量进来的询盘语言识别、客户类型路由、邮件线程摘要、表格字段提取、商品资料去重和证书清单初筛;3.6 Flash适合需要读图、跨多个文件、调用搜索或内部工具、理解复杂客户要求的任务。比如客户发来一封英文邮件、一个PDF规格表和一张产品照片,第一步可以用Lite提取字段,只有字段冲突、规格关系复杂或需要查企业背景时,再把这条任务升级到3.6。这样做的好处是成本和延迟可控,也更容易知道哪一环出了错。
迁移不能只替换模型ID。Google文档明确提示,新模型弃用或忽略temperature、top_p、top_k,并不再接受预填充的model turn;未来模型可能直接返回400错误。外贸团队应先复制一份旧流程,做四项检查:固定JSON是否仍能解析,函数调用是否保留call_id和name,多轮会话是否用服务端previous interaction管理,失败时是否能回到人工队列。不要在生产环境直接改模型;先用100条已标注询盘做回归,把字段准确率、术语错误、人工修改时长、延迟、token费用和升级率逐项记录。
一个可执行的小试验是建三条路由:Lite处理所有简单分类;3.6处理抽样的复杂研究;无法确定的任务不让模型自行选择,而是进入人工复核。对报价、付款条件、交付时间、认证和出口限制,模型只能引用输入资料中的证据,不能根据常识补全。使用AI Studio或API时,密钥不要放浏览器前端;上传客户资料前做脱敏,Computer Use或其他工具调用要设域名白名单、操作日志和人工批准。Google官方benchmark与模型说明能证明功能和价格,不证明中文、德语、日语询盘在你的产品领域一定更准;本日报也没有把GA写成“外贸效果已验证”。
上线后的观察也要按语言和业务线拆开。英语询盘数量大,不代表德语或日语的术语质量也一样;一个模型在普通客服上表现稳定,也不代表能正确处理含单位、材质、等级和认证编号的工业品规格。建议每周保留一小批人工金标准,按国家、产品和任务类型重新抽检,达到阈值才扩大自动化范围。若模型输出需要销售人员大幅重写,就算API便宜,也未必真的降低总成本。
先把“能稳定提取”作为第一阶段目标,再追求更复杂的自动决策。