别再复制粘贴了:写给新手的 AI Agent 入门

大部分人用 AI 的方式还停在这一步:把内容复制进对话框,读它的回答,再把结果复制出来,自己去执行。
这中间所有的手都是你的。你是那个搬运工。
Agent 不一样,它自己有手。它能打开你的文件、读里面的内容、动手改、动手建新文件。能上网查,能把命令跑起来,能看到报错然后自己修。能一步接一步做下去直到做完,最后回来告诉你结果。
举个最简单的对比。同样一件事,把三十张发票整理成一张报销表。
- 聊天模式:你一张张打开发票,把金额抄进对话框,它帮你算总数,你再一个个填进表格。半小时。
- Agent 模式:你把发票扔进一个文件夹,说「读完这些发票,做一张带日期、商家、金额的表,最后一行合计」。它自己挨个打开、认字、填表、存盘。你去倒杯咖啡。
能力上限差不多,差别在于谁干活。这篇讲的就是怎么让它干。
先搞清楚你手上有没有 Agent
不是所有 AI 都能动手。判断方法很简单:看它能不能碰到你的东西。
- 网页版的对话框,通常只能聊天。你不给它,它什么也看不到
- 桌面端 / 终端里的助手(Claude Code、Cowork、Codex 这类),能读写你电脑上的文件、能执行命令,这是真 Agent
- 浏览器里的 Agent,能替你点开网页、填表单、翻页找信息
- 有些聊天产品里的「深度研究」「任务」模式,也是 Agent,只是活动范围限定在联网查资料
如果你现在用的只有聊天框,那下面这些事它做不了。先去装一个能碰到你文件的。
八件可以直接甩给它的活
挑的标准是:你自己做会烦躁,它做很快,做完你一眼就能看出来成没成。
1. 整理一个乱了三年的文件夹
从这件事开始,因为正反馈最直接,文件真的动了。
看一下我的下载文件夹,按类型和年份整理成子文件夹。先把你的整理方案列给我看,等我说开始再动手。
加粗那句话很重要,后面还会专门讲。看完方案觉得没问题,回一句「开始」,然后看着几百个文件各就各位。
2. 把一堆乱七八糟的文件变成一张表
发票、截图、聊天记录导出、几十个 PDF,只要信息在文件里,它就能自己读出来汇总。
这个文件夹里是这个月的外卖订单截图。读完做一张表:日期、店名、金额、支付方式,按日期排序,最后加一行合计和日均。存成 Excel 放在桌面。
它不会「告诉你怎么做」,而是直接给你一个能打开的 xlsx 文件。
3. 批量重命名、转格式、压缩
这类活的特点是不难,但手动做能把人做疯。
把这个文件夹里所有照片按「拍摄日期-序号」重命名,HEIC 全部转成 JPG,长边超过 2000 像素的缩到 2000,原图保留一份到 backup 子文件夹。
三百张照片,一次说清楚,一次做完。
4. 清出磁盘空间
扫描我的用户目录,找出所有超过 500MB 的文件和内容重复的文件,按占用空间从大到小列个清单,标上最后打开时间。先别删任何东西。
它给清单,你划勾,再让它删。这个分工比它自作主张删东西安全得多。
5. 让它查完资料,交一份带链接的简报
这是 Agent 和聊天差别最大的地方之一。它会自己搜、自己点开、发现不够再接着搜,而不是凭记忆答你。
帮我搞清楚今年小规模纳税人的增值税政策有没有变。要求:每个结论后面附上来源链接,优先官方网站,如果不同来源说法有冲突,把冲突单独列出来告诉我。
最后一句要求它报告冲突,比什么都管用。它一旦发现说法不一致就必须告诉你,不会挑一个顺嘴的说。
6. 做一个真的能跑起来的小东西
不用会编程。关键在于它会自己跑一遍、看到报错、自己改,直到能用。
做一个记账小网页:能输入日期金额和分类,数据存在本地,能看到本月合计和分类饼图。做完自己在浏览器里打开检查一遍,确认能正常添加和显示,有问题就改到好为止。
你要看的不是代码,是最后那个能打开、能用的东西。
7. 一条龙走完多步骤流程
单步的事聊天也能干,多步串起来才是 Agent 的主场。
这是今天的会议录音。转成文字,整理成纪要(结论 / 待办 / 风险三段),把待办拆成一条条带负责人和截止日期的清单,最后单独输出一份可以直接发群里的简短版本。
一次说完,它自己走完全程。
8. 把每周都要重复的活儿固定下来
做顺了一件事之后,把它变成常规操作:
以后每周五,把这周的工时表汇总成月度累计,检查有没有漏填的日期,缺哪天就列出来提醒我。
有些 Agent 能直接定时执行,不能的至少可以把这段话存成一句指令,下周直接复用。
五个让它真正靠谱的技巧
Agent 用得好不好,差距比聊天大得多,因为它会真的动手,做错了也是真的错。
一、给目标和验收标准,别给操作步骤。 说「把这些照片按日期归档,做完告诉我一共归了多少张、有没有读不出日期的」,比手把手教它先干什么后干什么要好。关键是让它知道什么叫做完了。有验收标准,它才会自己检查。
二、危险操作前,先让它说方案。 加一句「先把你打算做什么列出来,等我确认再动手」。删除、覆盖、批量改动、花钱的事,都值得多这一步。看方案花你三十秒,能省掉一场事故。
三、划一块地方给它折腾。
让它在副本上干活,或者专门建一个文件夹给它。如果是代码项目,先 git commit 一次,出问题一键回退。能一键撤销的活儿,才敢放手让它干。
四、让它自己验证,你再抽查。 「做完自己跑一遍确认没报错」「数一下条数对不对」「打开看看显示正常吗」,这类要求会让它自己发现问题、自己返工,效果非常明显。但它说完成了不等于真的完成了,你还是要抽查两条。
五、卡住的时候给反馈,别关掉重来。
「第三步错了,我们的日期格式是年在前」「这个文件夹别动」,它带着上下文继续改,比你重开一轮从头讲一遍强得多。如果同一件事你要说第三遍了,就把规矩写进一个说明文件,很多工具认 AGENTS.md,以后它自己会看。
它有手,所以要注意这几件事
比起聊天,Agent 的风险是实打实的。聊天最多是说错话,Agent 是真能把文件删了。
先备份,再放手。 尤其是第一次用、或者要动重要资料的时候。
它会自信地宣布「已完成」。 这是聊天时代「一本正经地编」的 Agent 版本。它可能只做了一半、跳过了报错、或者对着错的文件夹干了半天。验收这一步不能省,随机抽查两条比通读它的汇报有用。
权限给到刚好够用。 别把密码、密钥、支付方式随手交出去。浏览器 Agent 尤其要注意,网页上的文字它也会当成信息读进去,有人专门写好话术埋在页面里骗 Agent 执行。涉及钱和账号的操作,自己来。
长任务中途看一眼。 跑十分钟以上的活儿,早点发现跑偏,比等它做完再返工划算。
它做不到的照样做不到。 没有权限的系统进不去,没有联网的信息查不到,需要你本人身份验证的事替不了你。
今天就挑一件
别一次全试。挑第一件,整理一个你已经乱到不想打开的文件夹。这件事门槛最低,结果最直观,出事风险也最小,先让它给方案,你确认了再动手。
看着一堆文件在几十秒内各就各位,你就知道 Agent 和聊天差在哪了。剩下七件按你自己的需要挑。