AI能做什么?
AI能做什么?
持续更新中,注意日期跟时效性。
全能翻译官、打杂小秘书、画画、原型、作曲、编程、二创视频……
文员
- 各类翻译、转化问题,如英译中、用小红书或微博风格重写、读取图片中的文字(OCR),目前Gemini这方面能力突出
- 处理“PPT视频课程”,现在Gemini已经可以处理Youtube视频,更能配合Chrome浏览器。
- NotebookLM,超越笔记
查找类
- 从一些资料中找出想要的段落,可以是比较模糊的语言。如果资料超过大模型上下文,选择国外NotebookLM、Codex;国内考虑WorkBuddy、ima.copilot;如果没超过大模型上下文,可以考虑用Gemini 3.5 Flash;
- 根据图片找出地理位置定位
- 找来源(目前Perplexity最强)
“套路文”编写
- 如角色扮演、公文、高考作文(例文)、社交媒体上的通稿等
检查
作画
教程是通用的。另外顶尖模型已经能很好理解中文要求,也不需要结构化的指令(如JSON)
- ChatGPT画图。GPT Image 2断档第一。GPT-Image-1.5可以生成透明背景图片,去掉背景能力是目前最强的(缺点是贵跟不算稳定);
- Gemini绘画【目前是Nano Banana Pro跟2】
- (带教程)与 Midjourney 对话:画猫
- (带教程)ImageFx
- (国产)豆包,随意提要求即可
顺带一提,ChatGPT跟Gemini绘图都有官方检测工具,就算经过一些简单处理,也能检测出来。ChatGPT是Verify OpenAI-generated images,Gemini则要自己去应用对话,附上图片,然后问一句“检测改图片是否AI图”。有趣的是,过于简单的图片,Gemini可能会拒绝检测,可能是怕被检测逆向水印算法。
视频
目前还是二创水平,复刻视频还不错。但还需要抽卡。最好会分镜跟剪辑。
详见视频生成模型,或者瞄一眼这篇花两天半肝出来的微动漫实战经验,另有仿真人的视频。
程序
目前Codex性价比较高,官方时常会重置额度。
Gemini Pro套餐中Antigravity已经降格为“不依赖Agent、活在IDE的程序员”,不推荐使用。
- 免费的AIStudio,可以玩玩里面的微型 App,也可以轻易复刻(图一)。目前3.1 Pro模型改为收费。
- 读大型仓库代码
示例项目
- 2026年7月,模型纪元
- 仿古打字机;
Manus做出旮旯给木生成器,大致过程可以参考让大模型参与网页应用设计;
- 迁到本地,模版化后做出想要照妖镜
- 这衣服像窗帘吗(模型已下架) 开源仓库 github.com/gantrol/isCurtain
作曲
能取代人吗?
大模型不像珍妮纺织机,一下子从生成一根棉线变成十根。更像是蒸汽机,提供“智能动力”。但这个动力用在哪、有没有用、浪不浪费、稳不稳定,是另一回事。
大模型是“智能发动机”。你要有“数据铁路”给它跑。
假设你的工作只跟电脑数据相关,任务难度也没超过大模型能力,数据到大模型的路也是通的,那么就相当危险。
但貌似没怎么看到这类工种。但有趣的是,因为AI裁员的消息不断——成功地把负面新闻变成略带正面的,换你、你也用这个借口。
大模型发展起来,从蒸汽机到内燃机,数据道路也畅通,甚至发明了新的“流水线”。会有不少工作。
那人呢?
- “Deepseek语文那么好,我为什么还要练写作”
- 决策,长期,审美,品味
- 如果奇点到了,躺平
小结
AI生成内容,都有浓烈的“自嗨”属性。喜欢的人在创作时简直停不下来。但外人不一定喜欢,甚至不少人认为AI生成内容很廉价。
这些内容可能不会占据原有生态位,但会演变出新玩法、新生态,大势不可挡。
目前大伙比较宽容的是各类二创、段子。而且这些领域,以前“产量”也不够,受众嗷嗷待哺。
对个人来说,大模型边界,即语言边界,也是表达及格线。