码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • 和AI一起搞事情#5:技能进阶与Claude Design初体验


    和AI一起搞事情#5:技能进阶与Claude Design初体验 话接上文,咱接着做中医小游戏。这一章我们会聊到: - 开发流程中的核心实践:重构、版本控制、进度管理 - 技能进阶:创建技能、测试技能、提高技能引用率 - Claude Design 使用体验
    合集 - DecryptPrompt(78)
    1.解密Prompt系列8. 无需训练让LLM支持超长输入:知识库 & unlimiformer & PCW & NBCE2023-06-132.解密Prompt系列6. lora指令微调扣细节-请冷静,1个小时真不够~2023-04-293.解密Prompt7. 偏好对齐RLHF-OpenAI·DeepMind·Anthropic对比分析2023-05-234.解密prompt系列5. APE+SELF=自动化指令集构建代码实现2023-04-105.解密Prompt系列4. 升级Instruction Tuning:Flan/T0/InstructGPT/TKInstruct2023-03-266.解密Prompt系列3. 冻结LM微调Prompt: Prefix-Tuning & Prompt-Tuning & P-Tuning2023-03-107.解密Prompt系列2. 冻结Prompt微调LM: T5 & PET & LM-BFF2023-02-248.解密Prompt系列1. Tunning-Free Prompt:GPT2 & GPT3 & LAMA & AutoPrompt2023-02-109.解密Prompt系列9. 模型复杂推理-思维链COT基础和进阶玩法2023-06-1610.解密Prompt系列14. LLM Agent之搜索应用设计:WebGPT & WebGLM & WebCPM2023-09-0111.解密Prompt系列10. 思维链COT原理探究2023-07-0112.解密Prompt系列11. 小模型也能COT-先天不足后天来补2023-07-1513.解密Prompt系列12. LLM Agent零微调范式 ReAct & Self Ask2023-07-2814.解密Prompt系列13. LLM Agent-指令微调方案: Toolformer & Gorilla2023-08-1715.解密Prompt系列15. LLM Agent之数据库应用设计:DIN & C3 & SQL-Palm & BIRD2023-09-1616.解密Prompt系列16. LLM对齐经验之数据越少越好?LTD & LIMA & AlpaGasus2023-10-0517.解密Prompt系列17. LLM对齐方案再升级 WizardLM & BackTranslation & SELF-ALIGN2023-10-1418.解密Prompt系列18. LLM Agent之只有智能体的世界2023-10-2819.解密Prompt系列19. LLM Agent之数据分析领域的应用:Data-Copilot & InsightPilot2023-11-1920.解密Prompt系列20. LLM Agent之再谈RAG的召回多样性优化2023-12-0321.解密Prompt系列21. LLM Agent之再谈RAG的召回信息密度和质量2023-12-1822.解密Prompt系列22. LLM Agent之RAG的反思:放弃了压缩还是智能么?2024-01-0123.解密Prompt系列23.大模型幻觉分类&归因&检测&缓解方案脑图全梳理2024-01-1524.解密prompt系列24. RLHF新方案之训练策略:SLiC-HF & DPO & RRHF & RSO2024-02-2225.解密prompt系列26. 人类思考vs模型思考:抽象和发散思维2024-03-1026.解密prompt系列25. RLHF改良方案之样本标注:RLAIF & SALMON2024-03-2527.解密prompt系列27. LLM对齐经验之如何降低通用能力损失2024-04-1328.解密Prompt系列28. LLM Agent之金融领域摸索:FinMem & FinAgent2024-05-0629.解密Prompt系列29. LLM Agent之真实世界海量API解决方案:ToolLLM & AnyTool2024-05-2330.解密Prompt系列30. LLM Agent之互联网冲浪智能体2024-05-2631.解密Prompt系列31. LLM Agent之从经验中不断学习的智能体2024-06-1132.解密Prompt系列32. LLM之表格理解任务-文本模态2024-06-2433.解密Prompt系列33. LLM之图表理解任务-多模态篇2024-07-0634.解密prompt系列34. RLHF之训练另辟蹊径:循序渐进 & 青出于蓝2024-07-2335.解密prompt系列35. 标准化Prompt进行时! DSPy论文串烧和代码示例2024-08-0536.解密Prompt系列36. Prompt结构化编写和最优化算法UNIPROMPT2024-08-1937.解密Prompt系列37. RAG之前置决策何时联网的多种策略2024-09-0338.解密Prompt系列38.多Agent路由策略2024-09-1839.解密prompt系列39. RAG之借助LLM优化精排环节2024-09-3040.解密prompt系列40. LLM推理scaling Law2024-10-1141.解密prompt系列41. GraphRAG真的是Silver Bullet?2024-10-2742.解密prompt系列42. LLM通往动态复杂思维链之路2024-11-1543.解密prompt系列43. LLM Self Critics2024-11-2544.解密prompt系列44. RAG探索模式?深度思考模式?2024-12-1445.解密Prompt45. 再探LLM Scalable Oversight -辩论、博弈哪家强2024-12-3046.解密prompt系列46. LLM结构化输出代码示例和原理分析2025-01-0447.解密prompt系列47. O1 Long Thought的一些特征分析2025-01-2248.解密prompt系列48. DeepSeek R1 & Kimi 1.5长思维链 - RL Scaling2025-02-1449.解密prompt系列49. 回顾R1之前的思维链发展路线2025-02-2450.解密prompt系列50. RL用于优化Agent行为路径的一些思路2025-03-1051.解密prompt系列51. R1实验的一些细节讨论2025-03-2552.解密prompt系列52. 闲聊大模型还有什么值得探索的领域2025-04-0953.解密prompt系列53. 再谈大模型Memory2025-04-2354.解密prompt系列54.Context Cache代码示例和原理分析2025-05-2755.解密prompt系列55.Agent Memory的工程实现 - Mem0 & LlamaIndex2025-06-1056.解密prompt系列56.Agent context Engineering - 单智能体代码剖析2025-07-1057.解密prompt系列57. Agent Context Engineering - 多智能体代码剖析2025-07-2258.解密prompt系列58. MCP - 工具演变 & MCP基础2025-08-0659.解密prompt系列59. MCP实战:从Low-Level到FastMCP的搭建演进2025-08-1860.解密prompt系列60. Agent实战:从0搭建Jupter数据分析智能体2025-09-0861.解密prompt系列61. 手搓代码沙箱与FastAPI-MCP实战2025-10-0962.解密prompt系列62. Agent Memory一览 - MATTS & CFGM & MIRIX2025-10-2063.解密prompt系列63. Agent训练方案:RStar2 & Early Experience etc2025-11-0464.解密Prompt系列64. Anthropic Skils的延伸思考2025-11-1765.解密Prompt系列65. 三巨头关于大模型内景的硬核论文2025-12-0166.解密Prompt系列66. 视觉Token爆炸→DeepSeek-OCR光学压缩2025-12-1567.解密Prompt系列67. 智能体的经济学:从架构选型到工具预算2025-12-3168.解密Prompt系列68. 告别逐词蹦字 - 重塑 Transformer 的推理范式01-1569.解密Prompt系列69. 从上下文管理到Runtime操作系统02-1370.和AI一起搞事情#1: opencode ×browser-use实战复盘03-1071.和AI一起搞事情#2:边剥龙虾&边做个中医技能来起号03-2672.和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录04-1473.和AI一起搞事情#4. 小白用claude code做游戏究竟能踩多少坑04-29
    74.和AI一起搞事情#5:技能进阶与Claude Design初体验05-13
    75.和AI一起搞事情#6. 如何实现AI生图文字可编辑?05-2776.和AI一起搞事情#7. 给游戏NPC接入Hermes?06-1577.解密Prompt系列70. 从 MLA 到 CSA,聊聊大模型 Attention 的“瘦身”与“闪送”07-0278.解密Prompt系列71. 从DSpark聊聊大模型 Decoding 提速的技术演化07-30
    收起

    话接上文,咱接着做中医小游戏。

    上一章我们重点聊了开发过程中好用的技能,这一章我们会聊到:

    • 开发流程中的核心实践:重构、版本控制、进度管理
    • 技能进阶:创建技能、测试技能、提高技能引用率
    • Claude Design 使用体验

    先汇报一下进度

    感觉越来越像4399小游戏了……

    本周新增功能:

    ✅ 背包系统:包括原始中药、中药饮片、方剂、书籍。其中原始中药部分已提供AI生图素材。

    背包.gif

    ✅ 辨证游戏壳子:舌诊 → 脉诊 → 问诊 → 辨证 → 选方
    (哈哈没看错, 我又又又重构了,把分散的小游戏整合成了一整个辨证游戏)

    辩证.gif

    ✅ 煎药游戏壳子:选方结束触发配伍煎药游戏,学习方剂配伍。

    煎药.gif

    ✅ Hermes Agent backend:AI对话层跑通,但未接入游戏。

    第一部分:聊聊开发流程

    【refactor】开发不是线性的,而是螺旋上升的

    当你反复多次修复相似的问题时,或许说明你该定义标准或者重新抽象了。

    举个例子:做游戏会有很多弹窗——游戏引导要弹窗,每个小游戏有弹窗。

    当我反复看到不同弹窗出现相同的问题时:

    • 弹窗大小不一,花里胡哨,毫无统一配色和风格
    • 文字溢出现象在多个弹窗反复出现
    • 多个弹窗只能打开没有退出按钮,或退出按钮无法点击

    这个时候就该重构、抽象了。

    我的做法还是superpowers的技能串联

    • Explore:先让AI分析当前现状,找出问题
    • brainstorming:给出重构和抽象设计
    • writing-plans:提供测试验收方案
    • subagent:进行重构开发

    图片

    但是!反过来,并不推荐AI一上来写代码就进行高度抽象。

    相反,上来的代码应该以简洁为主。

    这里推荐 andrej-karpathy-skills:simplicity-first 原则:

    先让代码跑起来,再让代码优雅起来。

    图片

    【PROGRESS.md】长线任务,进度跟踪是核心

    最初看到有人单独使用 TODO.md、PROGRESS.md,我当时觉得纯属多此一举:

    "又又又用产品经理管开发的方式来管AI了。直接把进度写到 CLAUDE.md 中,每次重启对话直接重新加载不行吗??"

    再一次证明,纸上谈兵终是浅。

    这里面最核心的一个问题,其实是我之前在"渐进式加载"这个技术本身一直没想明白的点:

    如果这个信息模型需要完全阅读,那还需要渐进式加载吗?

    我原本以为是不需要的。

    但这里遗漏了一个问题:

    模型在使用 read 工具读取文件时,默认一般会读取100行(不同Agent架构和工具会存在差异),核心是工具设计为了避免无用信息充斥模型上文,这样可以视获取信息决定是否继续读取。

    这就导致:当你提供给模型的文件过于庞大、又杂糅了太多信息时,模型会出现因为部分读取文件而带来信息遗漏。

    体现在:我把项目架构、已完成状态、进行中状态全部写入 CLAUDE.md 中。

    结果发现模型在update项目状态时:

    • 只更新了已完成
    • 但没有及时更新进行中状态
    • 导致反反复复围着一个任务来来回回地搞

    还有一次,在 CLAUDE.md 中写了好多遍进度跟踪,结果:

    • 有的位置显示该任务已完成
    • 有的显示进行中
    • 最后连AI自己也搞不明白究竟做完了没有

    所以我做了调整:

    1. PROGRESS.md:当前正在做的任务细分进度
    2. TODO.md:记录已完成信息
    3. 大幅缩减 CLAUDE.md 的篇幅,只保留最新项目架构、进度摘要

    初步试验,这个组合效果最好。

    等我再确认下这两个文件的颗粒度,感觉就可以搞到 precompact 的hook里面自动更新了——感觉比 compact 要好用,不做总结和摘要,只是单纯描述当前状态 + 下一步该做啥,类似条件马尔可夫的特性。

    image

    【一切皆版本控制】AI作为顶尖牛马工作更要留痕

    事实证明不论是人在工作中,还是AI在工作中留痕都是最重要的

    不论是 Git worktree,还是 branch 管理,其实都是为了:

    • 一切行动皆被记录
    • 一切状态都可回滚

    这一点对于AI来说尤其重要。尤其对于一些测试性功能:

    • A、B、C三个方案,不知道哪个好?
    • 让AI都开发一遍,直接用效果作为唯一对比标准

    但是!需要注意版本控制,绝对不要让测试性功能直接在主分支上哐哐造。

    因为上下文有限,所以你不要天真地以为可以根据上下文进行回滚——不可能的。

    只有Git提交记录是唯一真相源。

    所以不论是:测试性代码、设计文档、多版本对比、各种临时feature

    请一切皆留痕,一切皆用分支或 git worktree 进行管理。

    确认无误再合入主分支,如果效果不及预期直接废弃。

    这其实不是AI编程规范,人类编程规范也是如此。

    第二部分:技能进阶——创建、测试与引用

    【skill-creator】请把开发中每一次重复都变成技能

    请务必在开发中无数次想到该使用/skill-creator了

    上一章末尾就提到,需要批量制作素材。

    比如背包中,我需要批量生产中药素材,所以就顺带手做了个中药素材生成技能。

    于是我用 /skill-creator 这个meta技能来制作技能,支持:

    1. “先通过豆包同时生成4个或9个不同的中药组图“

    图片

    1. 对组图切割
    2. 通过多模态模型识别图片文字进行文件命名
    3. 代码自动扫描路径完成新素材的加入

    这样素材后续就能自动添加到游戏里了。
    图片

    但是!做不到全自动。

    因为很多中药比较少见,画出来错误比例很高——正确率也就70%。

    这里一定会有人说让AI做Verifier呀,哈哈哈那准确率更低,柴胡的图片,AI连续4次识别出4种不一样的作物....

    所以还是需要懂中医的人一张张来筛选!谁说AI完全替代人类的?那做错素材的锅谁来背?

    【skill-evaluator】没有通过检验的技能不是可用的技能

    之前提到,试用过Anthropic在 skill-creator 里面更新的技能评估模块。

    但个人使用体验感觉:evaluator的思路可借鉴,但不必完全使用。

    至于验证技能的必要性…… 直接看图片吧。

    如果你不验证,你会得到下面的药材素材图(哈哈哈,又是AI逗我开心的一天):

    人参

    至于技能的评估,说复杂也很简单:

    技能的测试要尽可能接近真实使用场景——也就是可能缺少上下文的情况下,也要实现:

    • 技能的有效触发
    • 完整流程的遵循

    因此 skill-evaluator 需要保证每个测试query都有干净完整的上下文。

    Anthropic 用子进程起命令行实现的,但我个人使用感觉:

    "与其在对话里用,不如直接脚本评估来得干净整洁。"

    还不受到对话执行时间、gateway超时时间的影响。

    总共几个步骤:

    • 创建测试query集
    • bash命令行遍历,每个query是一行claude 命令
    • 把中间所有Agent结果解析到md文件
    • 让AI直接批量评估结果

    简单、直接、高效。

    提高技能引用率

    好用的技能有不少,但在使用中往往都面临有效技能引用率不高的问题。

    比如:

    • 碰到bug修复,并无法自动触发systematic-debugging技能
    • 开始写规划文档,也无法触发writing-plans 技能

    如果把所有技能触发都手工命令触发的话,又偏离了让AI自主进行长运行时coding的思路。

    所以在开发流程中,有以下几个提高关键技能引用率的方案:

    方案1:链表式技能引用

    类似superpowers,在每个技能文档最后,明确 handoff 到下一个技能。

    image

    方案2:中心式引用(我当前的思路)

    在 CLAUDE.md 的核心开发原则中,通过中心式引用,告知AI在哪些位置需要触发什么技能。

    图片

    方案3:Hook中嵌入find skill
    我还看到有人在hook里面嵌入 find skill 技能,默认任务开始前先搜技能。

    但个人感觉:技能还是要符合开发者的习惯,并且要切实解决当前AI Coding存在的问题。

    完全自动化搜索并接入,并不一定是更好的方案。

    第三部分:Claude Design初体验

    该说不说,Claude Design来得太是时候了,完全补齐我缺失的审美和空间想象力。

    在做出Claude Design高仿技能前,先用Claude Design来画原型吧。

    先看对比图

    下面是文字描述直接转换成问诊对话框的效果。

    你说我没用设计技能?不巧我还真用了!

    并且我还对比了下不同对话框的风格,然后有了下面的效果……
    截图_选择区域_20260429154546

    嗯……一定是我审美有问题……嗯。

    下面是Claude Design的效果:

    图片

    (当然,在重复用了多次后发现:缺少更多人的输入的话,其实配色、效果会有些单一,可能技能有几套visual rule,覆盖了调色盘,视觉元素规范等)

    Claude Design的工作流程拆解

    先梳理下它的几个步骤:
    0. 首先claude design提供了很多的设计类型,覆盖prototype、slide-deck等等,每种设计类型背后应该有不同的Design.md的设计和必要template

    1. Brainstorming(设计澄清)

    对设计中的要点进行澄清,包括:

    • 风格
    • 配色
    • 元素
    • 动效
    • Tweaks:哪些元素你希望可以调整

    感觉就是 brainstorming 技能的UI版本。

    抛开低效的AI一问一答,直接用页面多项选择呈现。

    (这个技能应该有一个 tweaks 脚本或基类?,用于提供嵌入到HTML中的一些可变元素,比如不同风格、不同配色)

    截图_选择区域_20260504091210

    1. TaskList(任务拆分)

    拆分多个执行步骤,开始分步骤进行Coding。
    image

    1. Fork Verifier Agent(校验Agent)

    触发校验Agent对代码进行验收。

    中间应该也隐藏了类似 webapp-testing 的技能,因为我看页面打开了console,会根据报错进行修复。

    image

    1. Export:Claude提供了代码打包以及html等各种格式的下载。不过最核心的是直接handoff to claude code的功能。会把整个项目打包,并提供必要的README.md文件,直接提供Claude Code 可以直接开始工作的完整上下文。

    图片

    总结

    哈哈,说复杂流程也很简单。感觉核心在那个“handoff to claude code”的按钮,为了把从设计到coding上线的全流程都在Claude Code内闭环。open codesign等开源方案也出来很多了,后面看看在PPT上能不能魔改一个最适合本牛马的。

    当然,更复杂的"绘制草图""上传页面"之类的我还没用——毕竟你让我画,那也真的是画不出来一点

    所以反反复复回到那个观点:

    AI干掉了之前的边界,但并不会完全抹平人和人的差距。

    相反,AI更多解决了 Doing,而 Thinking、审美、创意 的部分还在人。

    并且AI无限放大了这部分的差异。

    写在最后

    下一章咱接着开发:hermes agent NPC对话、病案库、炮制游戏
    以及该聊聊hooks和多session状态传递 了。

  • 相关阅读:
    babel转换class时使用defineProperty导致的装饰器问题
    2022 百度之星程序设计大赛复赛 D.子序列2(动态dp/线段树维护矩阵)
    Linux-cut
    Bean的作用域和生命周期
    【软件测试】资深测试聊一聊,测试架构师是怎么样的,做一名成功的测试工程师......
    CSS 实现跳动的方块动画
    SpringBoot入门学习之基础篇(一)搭建和SpringBoot构成结构
    2023-09-21力扣每日一题
    高薪程序员&面试题精讲系列150之电商专题(上)-你们的电商项目有什么特色?是B2B还是B2C、还是C2C的?直播电商你了解吗?
    vue 虚拟dom和diff算法详解
  • 原文地址:https://www.cnblogs.com/gogoSandy/p/20027861
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号