10秒看完全文要点
文|许英博 连一席
Nano Banana能做什么?Nano Banana为什么火了?Nano Banana对于AI行业有什么影响和启示?
▍Nano Banana能做什么?
Nano Banana,正式名称 Gemini 2.5 Flash Image,是谷歌DeepMind团队于2025年8月26日发布的图像生成与编辑模型(一个模型多种功能)。输入:1)文本 2)文本+图像 3)图像+图像 4)多轮文本+图像。输出:图像。
亮点一:单图生成效果提升。人物一致性、跨视角一致性能力增强。
亮点二:图像编辑效果提升。多轮迭代修改后,效果更好。只改变需要修改的部分,像素级编辑能力增强。
亮点三:文字渲染效果提升。英文字母生成错误率较低,中文相对较高。英文基本达到可用阶段,中文偶尔可用。
▍Nano Banana为什么火了?
1)用户体验超群:文生图模型综合性能第一。从评测榜单、用户调用量和实测情况看,Nano-Banana整体效果优于DALL-E。
2)生成更迅速:耗时更短。云平台:生成一张图片用时2.3s,DALL-E用时4.1s。实测综合用时:13s。参数规模小,参数量在4.5B~8B。
3)价格持平:价格为30美元/1M token($0.039/每张1024*1024图片),持平DALL-E的40美元/1M token ($0.04/每张1024*1024图片)。
4)便捷性更强:已集成到Gemini中,通过语言模型一站式解决用户需求。
▍Nano Banana对于AI行业有什么影响和启示?
模型侧:1)多模态领域(尤其是文生图)进展正在加速,未来1~2代文生图模型有望得到日常的广泛应用;2)原生多模态模型将成为下一个巨头必争之地。AI原生应用护城河进一步加固。文生图模型和语言模型将紧密结合,多轮指令修改是未来方向。
算力侧:多模态是未来Token调用量提升的强驱动力,1张图片=1290 output token。若人均每天生成5张图片,则日均贡献2.5万亿Token。
应用侧:多轮指令修改大幅降低应用门槛,未来修图像当今拍照一样容易。图片/视频等内容生成质量和效率进一步提升。
竞争格局:谷歌整体AI水平已非常接近OpenAI,局部上甚至胜出,如文生图、Google文档集成等服务。但对于传统工具可能形成降维打击。
后续展望:年底前有望迎来Gemini 3.0发布且展现更强能力。
▍风险因素:
1)中美关系超预期波动的风险;2)宏观经济恢复不及预期的风险;3)产业政策支持不达预期的风险;4)企业技术研发进展不及预期的风险;5)AI应用落地进程不及预期的风险;6)云厂商资本开支不达预期的风险;7)政府与企业IT支出不及预期的风险。
本文节选自中信证券研究部已于2025年9月16日发布的《AI Startup系列(2)—Nano Banana为什么爆火出圈?》报告,具体分析内容(包括相关风险提示等)请详见报告。