← 返回博客
Ai6 分钟

最近一个月,国产 AI 生图到底卷成什么样了

发布于 2026年9月27日
最近一个月,国产 AI 生图到底卷成什么样了

过去这一个月,中文社区和海外社区罕见地聊到了同一件事:国产 AI 生图模型。

9 月 20 日,阿里通义团队的 Qwen Image 2.1 在 Hacker News 上被推到首页,一个帖子拿到 739 分、将近 200 条评论。评论区不是客套。有人说"一个 70 亿参数的扩散模型,渲染中文字体居然比 Windows 还强",有人关心它到底怎么在本地跑起来,也有人直接说了一句"有点担心"——因为这么大的能力,目前没有任何水印。

这不是孤立事件。同一周,腾讯混元的新文生图模型也在 B 站被 UP 主拿去测评;字节的豆包图片处理教程在 B 站播放量过万。国产文生图工具正在从一个"能出图"的阶段,走到"真的有人在认真用"的阶段。下面聊聊我看到的几个信号。

70 亿参数,为什么值得说

大部分人不关心参数,只关心图好不好看。但 70 亿这个数字是整件事的关键。

主流闭源图像模型的参数动辄几十上百亿,还藏在 API 后面按次收费。Qwen Image 2.1 是开源权重,70 亿参数,一张消费级显卡就能在本地跑起来。这意味着你能在自己电脑上出图,不用按张付费,也没人记录你的提示词。

Tom's Hardware 的报道说,阿里声称这个模型跑分超过了 Google 的 Nano Banana 2.0,还和 OpenAI、Meta 的图像模型打得有来有回。厂商的跑分我一般打个问号,但能让机器学习圈子吵起来,本身就已经说明问题了。

中文社区真正在聊什么

我这几天翻了一下几个平台,发现中文社区讨论的方向和海外不太一样。

海外在争论开源闭源、要不要水印。中文社区更实际:怎么用、写什么提示词、能不能做写真。

B 站上,"豆包 AI 图片处理教程"这种视频播放量能到 1.7 万,弹幕和评论都在问具体操作步骤。"AI 科研绘图""AI 定制照片"这类需求也在冒头。百度搜索里,"AI 文生图提示词怎么写"是高频问题。这说明真正的主力用户不是玩票的,是拿它干活的人——做电商图、做学术配图、做个人写真。

提示词这件事,说穿了不复杂

把你脑子里想要的画面拆成几个具体要素:主体是什么、什么风格、什么光线、什么构图、不要什么。

别写"一张好看的图片",写"一个穿米色大衣的女生站在落地窗前,柔和的逆光,电影感,浅景深"。模型吃的是具体,不是形容词堆砌。想要啥风格,就把风格词放进去;不想要啥,用否定词明确说出来。多试几版,把满意的提示词存下来,这就是你自己的模板。

文字提示词转化为图像的过程

几个真实的应用场景

科研绘图是个被低估的方向。B 站有 UP 主专门教"AI 科研绘图 Figure 复刻",播放量能到几千上万。做论文配图、示意图的人,以前要么学一堆专业软件,要么花钱外包,现在能拿文生图出初稿再精修,效率完全不一样。

电商图是另一个大头。批量换背景、换姿势、做不同风格的展示图,这些用文生图和局部重绘比传统修图快得多。还有个人写真和"AI 定制照片",这个需求一直很旺盛,问题从来不是"能不能做",而是"做出来像不像、隐私怎么保证"。

AI 生成的电商产品图

普通用户该怎么选

这个问题没有标准答案,我按需求说:

如果只是随便玩、偶尔出张头像,豆包这类工具够用,不用折腾,打开就能用。如果是做电商图、批量出图,值得花点时间研究提示词和局部重绘,豆包、即梦都有对应的功能。如果你是技术向、想自己部署,那 Qwen Image 2.1 是最近最值得试的,开源、免费、一张显卡就能跑,中文渲染还是它的强项。

有一说一,国产文生图模型这两年进步是真的快,但"快"不等于"样样都强"。手指、文字、多主体一致性这些老毛病,各家都还有残留。别被跑分带节奏,先拿你自己的真实场景去试几张,比看一百篇评测都管用。

最后说一句水印

水印和溯源这个问题,海外吵得很凶,中文社区目前讨论得少,但这不代表它不重要。等 AI 生图彻底普及,一张图到底是不是人做的、谁做的,迟早会变成和"这个链接是不是诈骗"一样的基础问题。

到那时候,谁能把开源能力、易用性和诚实的出处标注一起做好,谁才是最后留下的那个。国产模型现在有了跑分、有了社区热度,接下来要比的,就是这些更"无聊"但更长久的东西。

相关文章