从对话到执行

AI工具发展的四大趋势

Agentic
Coding
主动
执行
GUI
Agent
端侧
AI

Claude Code · OpenClaw · UI-TARS · Gemma 4 · YOLO

课堂报告 | 2026年4月

CONTENTS

目录

01
AI发展简史
从神经网络到大模型
02
四大趋势详解
当今AI工具发展方向
03
大学生应用
学习与生活的影响
04
总结与展望
AI Agent时代已来
01
PART ONE

AI发展简史

从神经网络到大模型

探索AI为何在近十年爆发?算法 × 数据 × 算力三者叠加的结果

第一章

AI为何在近十年爆发?

AI的"爆发"不是单点突破,而是算法架构、数据规模与计算系统三者叠加的结果。这三个要素相互促进,形成了AI发展的正反馈循环。

  • 算法突破:从深层网络到Transformer,提升并行与建模能力
  • 数据燃料:互联网与大规模标注/弱标注数据成为通用学习的燃料
  • 算力支撑:GPU/软件栈成熟降低训练门槛,推动深度学习成为主流
AI Technology
AI技术三要素:算法、数据、算力

第二章

关键里程碑时间线

每次范式跃迁都来自"可训练性/可扩展性/可落地性"的提升。从1943年的神经元模型到2026年的端侧AI,AI发展经历了数次重大技术革命。

  • 1943 McCulloch–Pitts提出神经元逻辑模型,为神经网络奠基
  • 1958 Rosenblatt提出感知机(Perceptron),开启可学习的线性分类器路线
  • 1986 反向传播(Backprop)让多层网络可训练,深度学习的"发动机"就位
  • 2012 AlexNet在ImageNet夺冠,深度学习在视觉领域破圈
Neural Network History
神经网络发展历程

第二章(续)

关键里程碑时间线

从2017年Transformer的提出到2026年Gemma 4的发布,大模型时代全面开启。规模化训练带来了能力涌现,AI进入了"黄金十年"。

  • 2017 Transformer提出"只用注意力"架构,训练更并行、可扩展
  • 2018-2020 GPT-1(117M)→GPT-2(1.5B)→GPT-3(175B),规模化带来通用能力跃迁
  • 2022 ChatGPT上线,推动"对话式产品"全民普及
  • 2026 Gemma 4等开源模型家族迭代,加速本地/端侧部署生态
AI Evolution
大模型时代的演进

第三章

从被动回答到主动执行:AI的三次跃迁

  • 2022 Chatbot时代: AI只能"被动应答"。以GPT-3为代表, 用于简单客服、 文案写作等场景用户需要持续输入Prompt, 拨一下才动一下AI是工具, 不是助手
  • 2023 Copilot时代: AI升级为"主动协作"。代码Copilot提升开发效率50%以上;Office Copilot深度融合Word、 Excel等办公场景;AI开始深度融入核心工作流
  • 2025 Agentic AI时代: AI"能理解、 会规划、 能协作、 敢行动"。从辅助者走向自主决策主体;数字员工上岗: 财务Agent自动审批流程;人形机器人走上春晚舞台
Transformer Architecture
Copilot

第四章

Agentic AI爆发的技术基础设施

模型能力突破Claude 3.5 Sonnet和GPT-4o的视觉理解精度达到"可用"门槛,AI能准确"看懂"屏幕截图

MCP协议2024年发布, 标准化了模型与工具的接入,为AI装上调用工具、执行命令的"手"

Computer Use API2024年10月Anthropic发布,开发者可通过API控制AI查看屏幕、移动光标、点击按钮

大上下文窗口2025-2026年模型在理解复杂指令和稳定输出格式上质的飞跃

ChatGPT AI
MCP
02
PART TWO

当今AI工具的四大趋势

从"回答问题"走向"执行任务"

AI工具正在从"生成内容"升级为"可执行系统",并沿四条路线加速演化

趋势总览

四大趋势全景图

趋势一:Agentic Coding
项目自动化:从"补全代码"到"交付变更"
趋势二:主动执行
从"人操作软件"到"人指挥、AI操作"
趋势三:GUI Agent
从RPA到"看图做事"的多模态代理
趋势四:端侧AI
从云端依赖到本地可控

趋势一(1/4)

完整项目自动化

新一代编程工具不再只是"写几行代码",而是能理解代码库、跨文件修改、跑测试并提交结果

传统IDE补全是"被动建议",而Agentic Coding是"主动执行"。它能分解复杂任务,多步骤执行,并在遇到错误时自我纠正。

  • 读懂代码库结构:理解项目架构和依赖关系
  • 跨文件重构:在多个文件间协调修改
  • 调用工具链:git/CI/测试无缝集成
  • 迭代到通过:自动修复错误直到成功
Coding Agent
AI编程助手自动化开发流程

趋势一(2/4)

Claude Code

Claude Code强调"agentic, not autocomplete",可在代码库中执行多步开发任务。

它不仅能生成代码,还能导航陌生代码追踪依赖、进行多文件重构,甚至运行测试并处理CI失败。

  • 大型项目快速上手:自动理解项目结构
  • 复杂重构迁移:跨文件协调修改
  • 自动修复测试失败:分析错误并修正
  • 用CLI工具完成交付动作:GitHub CLI集成
Claude Code
Claude Code端到端编码代理

趋势一(3/4)

从Skills到Harness

真正决定"能做多大事"的不只是模型参数与prompt,而是外部技能、协议与编排层(harness)

模型本身只是"大脑",而Skills是"手脚",Harness是"神经系统"。三者结合,AI才能真正"做事"。

  • Skills:工具把能力做成"可发现/可调用"的接口
  • Harness:编排层协调多个技能完成复杂任务
  • CLI/MCP:让Agent能像调用API一样操作真实系统
AI System
AI系统架构:Model → Skills → Harness

趋势一(4/4)

治理与边界

项目自动化的核心风险在于"错误的自动化更快",需要人类把关与安全策略。

当AI能够自动写代码、提交PR、甚至部署生产环境时,权限控制审计追踪变得至关重要。

主要风险

  • 权限过大:写文件/发版/访问密钥 → 必须最小权限+审计
  • 模型幻觉:生成看似正确但实际错误的代码 → 必须测试与review闭环
Security
AI安全与权限治理

趋势二(1/4)

从被动回答到主动执行

从"人操作软件"到"人指挥、AI操作"

  • OpenClaw:真正会做事的AI,管理邮件/日历/航班值机
  • bb-browser:浏览器就是API,直接复用登录态做自动化
  • 办公平台CLI化:飞书/钉钉/企业微信推出CLI工具
CLI Terminal
命令行:AI的母语

趋势二(2/4)

OpenClaw:真正会做事的AI

OpenClaw由奥地利开发者Peter Steinberger创造——"真正会做事的AI",管理邮件、日历、航班值机,甚至替你跟保险公司交涉。

利用Claude Code 4.6的长上下文能力、Programmatic Tool Calling (PTC)和skill工具使用机制。大量代码借助AI辅助生成——AI造AI,成为科技圈趣谈。

  • 2024年4月:萌生想法
  • 2025年11月:1小时原型
  • 2026年初:开源发布,数周内Stars突破24.8万
OpenClaw
OpenClaw:AI个人助手

趋势二(3/4)

bb-browser:浏览器就是API

核心理念翻转:不是让网站适配机器,而是让机器使用人的界面——直接复用真实浏览器的登录态做自动化。

支持三种接入:OpenClaw内置模式 | Chrome扩展独立模式 | MCP接入Claude Code/Cursor

  • 覆盖36个平台、103条社区命令
  • AI Agent自动抓包逆向、编写适配器
  • 20个Agent并发运行,边际成本趋近于零
1
AI Agent / CLI / MCP
用户接入层
2
Daemon → SSE
中间件通信层
3
Chrome Extension → CDP
浏览器控制层
4
真实浏览器
目标网站层

趋势二(4/4)

办公平台的CLI化革命

2026年3月,飞书、钉钉、企业微信在同一个月推出CLI工具——这不是巧合,而是AI时代的必然选择。

图形界面是为人类设计的:点击、滚动、拖拽。AI不需要看到按钮,CLI是AI的"母语"

  • 飞书 lark-cli:11个业务域,200+条命令,19个AI Agent Skills,MIT开源
  • 钉钉 dingtalk-workspace-cli:10,000+可用命令,Go编写的独立二进制
  • 企业微信 wecom-cli:瞄准10人及以下小团队,开源策略显示去中心化野心
Office CLI
办公平台CLI化浪潮

趋势三(1/3)

GUI Agent

GUI Agent以"屏幕截图→推理→动作(点击/输入)"实现跨应用自动化,比传统RPA(机器人流程自动化)更通用。

UI-TARS是字节跳动开发的原生GUI代理模型,仅以截图为输入并执行人类式交互(鼠标/键盘)。大量软件没有开放API,但都有GUI;GUI Agent可在"无API环境"完成任务。

  • Observe:截图感知当前界面状态
  • Think:推理规划下一步动作
  • Act:执行点击、输入等操作
GUI Automation
GUI Agent屏幕自动化

趋势三(2/3)

UI-TARS 技术要点

UI-TARS通过强化学习与系统化动作建模提升多步GUI任务表现,在OSWorld、AndroidWorld等基准上报告SOTA结果。

核心机制是坐标定位→动作序列→纠错重试。模型需要精确识别屏幕元素位置,规划合理的操作序列,并在失败时能够反思重试。

  • 感知增强:提升屏幕理解能力,准确识别UI元素
  • 统一动作空间:标准化点击、拖拽、输入等交互方式
  • System-2推理:深度思考决策,而非直觉反应
  • 反思式训练:在线轨迹迭代,从错误中学习
UI TARS
UI-TARS多模态界面理解

趋势三(3/3)

GUI Agent 局限与风险

GUI Agent的上限受限于权限、安全与可解释性;关键动作需Human-in-the-Loop。

当AI能够实际控制鼠标键盘时,安全风险急剧上升。误点支付按钮、泄露隐私信息、执行恶意操作——这些都需要严格的防护措施。

主要风险

  • 权限安全:系统级权限带来安全担忧,误点支付/泄露隐私
  • 界面变化:UI变化/反爬/弹窗导致失败,需要鲁棒定位
Security Risk
GUI Agent安全风险控制

趋势四(1/3)

端侧AI与低成本部署

端侧/本地模型让AI在隐私、时延、离线成本上更可控,推动"AI普惠"。

不是所有任务都需要GPT-4级别的能力。对于日常写作、简单问答、文档处理等任务,端侧模型已经足够,而且响应更快、成本更低、隐私更好。

  • 隐私:数据不必离开设备,适合个人笔记/医疗/企业内网
  • 低延迟:本地响应,无需等待网络传输
  • 离线可用:网络差也能用,真正随时随地
  • 低成本:减少云端调用与带宽费用
Edge AI
端侧AI设备部署

趋势四(2/3)

Gemma 4 开源模型家族

Gemma家族持续发布,2026年发布Gemma 4多种规模,为本地部署提供更多选择。

从E2B到31B,不同尺寸的模型适配不同的设备和使用场景。先小后大、量化优先是端侧部署的基本原则。

  • E2B/E4B:端侧设备,手机/嵌入式,轻量化推理
  • 26B/31B:笔记本/工作站,更强算力支持
  • LiteRT-LM:本地推理框架,优化大语言模型(LLM)在边缘设备上的部署表现
Gemma Model
Gemma 4多尺寸模型家族

趋势四(3/3)

YOLO 实时视觉

在目标检测等视觉任务上,小而专的模型(如YOLO)在实时性与部署效率上具有优势。

YOLOv10强调端到端实时检测,减少后处理(NMS-free训练/设计),提升延迟效率。对于实时性要求高的场景,小模型往往比大模型更合适。

应用场景

  • 安防:实时监控与告警
  • 工业质检:缺陷检测
  • 零售盘点:商品识别计数
YOLO Detection
YOLOv10实时目标检测

趋势总结

四大趋势的共同指向

AI正在成为"数字员工"而非"聊天工具"。四大趋势共同推动范式转移——从被动应答主动执行、从云端依赖本地可控、从单点功能系统级整合

趋势一:Agentic Coding
从"补全代码"到"交付变更"的项目自动化
趋势二:主动执行
AI从被动回答转向主动执行
趋势三:GUI Agent
从RPA到"看图做事"的多模态代理
趋势四:端侧AI
从云端依赖到本地可控
03
PART THREE

大学生应用指南

趋势对学习与生活的影响

可落地的实践建议与安全提醒

大学生视角

学习与科研

AI从"写作辅助"升级到"执行辅助",学习方式会从'搜-看-记'变成'提目标-让AI跑流程-你做判断'。

未来的学习者需要掌握"AI协作"能力——不是替代思考,而是放大能力。你需要学会提出好问题、验证AI输出、整合多源信息。

  • 课程项目:用Claude Code做项目脚手架/重构/测试
  • 学习管理:用OpenClaw管理日程与任务
  • 信息收集:用bb-browser/lark-cli做信息收集→结构化输出
Student Learning
AI辅助大学生学习科研

大学生视角

守住安全与诚信底线

当AI能操作软件与设备(GUI/CLI/Agent)时,效率提升的同时也放大了误操作与隐私风险

享受AI带来便利的同时,必须建立安全意识学术诚信。AI是工具,不是替代品。

  • 敏感动作人工确认:转账/下单/提交申请必须引入人类的实时判断、干预或反馈
  • 学术诚信:把AI当"助教/工具",保留过程记录与引用
  • 隐私策略:能本地就本地,能脱敏就脱敏
Security Ethics
AI使用安全与学术诚信

CONCLUSION

总结与展望

Claude Code的项目自动化,到OpenClaw的主动执行,再到CLI/GUI接口化与端侧AI,本质都是让AI更"能做事"。

AI Agent时代已来 —— 人类负责决策与创意,AI负责执行与实现

AI Future
AI Agent时代的人机协作

感谢聆听

Q & A

AI Agent时代已来
人类负责决策与创意

AI负责执行与实现