$npx -y skills add zsyggg/paper-craft-skills --skill paper-comic论文方法图解——用视觉图解彻底讲清楚一篇论文到底做了什么、怎么做的。 自动分析论文核心方法,先推荐封面/概述图/机制细节图的生成方案,必须由用户确认范围、张数、语言、风格后再生成。 支持温暖笔记风和论文框架图风。
| 1 | # Paper Method Illustrated — 论文方法图解 |
| 2 | |
| 3 | 把论文的核心方法用视觉图解彻底讲清楚。 |
| 4 | |
| 5 | ## 与其他技能的本质区别 |
| 6 | |
| 7 | | | 传统paper-comic | baoyu-article-illustrator | **我们:方法图解** | |
| 8 | |---|---|---|---| |
| 9 | | 聊什么 | 什么都聊一点 | 为文章配装饰图 | **只聊方法细节** | |
| 10 | | 深度 | 一页讲很多→浅 | 一张图一段话→中 | **一张图讲透一个机制→深** | |
| 11 | | 页数 | 固定10页 | 按密度5-20张 | **先推荐封面/概述/细节图组合,用户确认后生成1-10张** | |
| 12 | | 重点 | 讲背景+故事 | 美化文章排版 | **可视化"怎么做"** | |
| 13 | |
| 14 | ## 快速开始 |
| 15 | |
| 16 | ```bash |
| 17 | /paper-comic /path/to/paper.pdf |
| 18 | /paper-comic https://arxiv.org/abs/2512.xxxxx |
| 19 | /paper-comic /path/to/paper.pdf --style sketchnote |
| 20 | /paper-comic /path/to/paper.pdf --style paper-figure --language English --pages 1 |
| 21 | ``` |
| 22 | |
| 23 | --- |
| 24 | |
| 25 | ## 图片生成:自动检测 |
| 26 | |
| 27 | 和paper-analyzer一样,不硬编码任何API。运行时自动检测: |
| 28 | |
| 29 | | 环境 | 自动使用 | |
| 30 | |------|---------| |
| 31 | | **Codex** | 内置 `imagegen` skill | |
| 32 | | **Claude Code** | 已安装的生图skill(如baoyu-image-gen) | |
| 33 | | **Cursor/其他** | 自动检测 → 没有则提示安装 | |
| 34 | |
| 35 | **不写死任何API key、token或endpoint在SKILL.md里。** |
| 36 | |
| 37 | --- |
| 38 | |
| 39 | ## 核心哲学 |
| 40 | |
| 41 | ### 我们只画三样东西 |
| 42 | |
| 43 | 1. **方法流程** — 输入→处理→输出,这方法到底怎么走的 |
| 44 | 2. **核心机制** — 最创新的那个部分,拆开来看内部构造 |
| 45 | 3. **关键结果** — 只放最重要的实验结果,不放灌水数据 |
| 46 | |
| 47 | ### 我们不画的东西 |
| 48 | |
| 49 | - ❌ 相关工作/背景介绍(那是paper-analyzer文字部分的事) |
| 50 | - ❌ 抽象的"灵感来源"(没有信息量的图 = 浪费) |
| 51 | - ❌ 文字就能说清楚的东西(一句话能讲完不需要画) |
| 52 | - ❌ 第N个消融实验的柱状图 |
| 53 | |
| 54 | ### 每一张图的标准 |
| 55 | |
| 56 | > 一个完全没读过论文的人,只看这张图+图上的标注文字,能不能理解这个机制? |
| 57 | |
| 58 | 能 → 通过。不能 → 拆成两张,或者加更多标注。 |
| 59 | |
| 60 | --- |
| 61 | |
| 62 | ## 生成前必须确认 |
| 63 | |
| 64 | 默认**不要直接生成图片**。先读论文、给出推荐方案,再向用户确认。 |
| 65 | |
| 66 | 只有当用户已经明确给出足够完整的生成意图时,才可以跳过确认,例如: |
| 67 | - “生成一张中文 sketchnote 方法总览图” |
| 68 | - “生成 4 张:封面、总览、两个机制细节,英文 paper-figure” |
| 69 | - “按你推荐的全部生成,中文,sketchnote” |
| 70 | |
| 71 | 如果用户只给了论文链接、只说了风格(如“sketchnote”)、或只说“生成图解”,仍然必须确认,因为**风格不等于范围/张数授权**。 |
| 72 | |
| 73 | 确认时必须覆盖: |
| 74 | |
| 75 | 1. **图片语言**:中文 / English / 双语 |
| 76 | 2. **生成范围**:只要封面图、只要方法总览图,还是概述图 + 若干机制细节图 + 结果图 |
| 77 | 3. **推荐张数**:基于论文复杂度给出建议,并说明为什么,如“我建议6张,因为这篇论文有整体架构、两个核心attention机制、编码器/解码器结构和关键实验结果” |
| 78 | 4. **视觉风格**:`sketchnote` 或 `paper-figure` |
| 79 | 5. **用途**:README/文章封面/小红书/演示文稿/论文阅读笔记(用途决定横竖比例和文字密度) |
| 80 | |
| 81 | 确认话术示例: |
| 82 | |
| 83 | > 我读完后建议生成6张:1张封面、1张方法总览、3张机制细节、1张关键结果。也可以只生成1张总览图,或者扩展到8张把每个机制讲更细。你想生成哪种范围?语言用中文/英文/双语?风格用 sketchnote 还是 paper-figure? |
| 84 | |
| 85 | 如果用户没有回答,不要继续生成。 |
| 86 | |
| 87 | --- |
| 88 | |
| 89 | ## 两种视觉风格 |
| 90 | |
| 91 | | 画风 | 视觉效果 | 适合场景 | 特点 | |
| 92 | |------|---------|----------|------| |
| 93 | | **sketchnote**(默认) | 温暖科研笔记风 | 讲清楚论文在做什么、视频宣传、知识分享 | 工整但有人味,允许小符号、小比喻、小视觉锚点,让人一眼理解 | |
| 94 | | **paper-figure** | 论文框架图风 | README首屏、论文解读文章、方法总览、技术展示 | 像顶会论文里的总览框架图,但更完整、更漂亮、更适合传播 | |
| 95 | |
| 96 | 默认推荐 **sketchnote**。当用户想要“像论文 Figure 一样专业”“方法框架图”“技术架构图”“放 README 第一屏很震撼”时,推荐 **paper-figure**。 |
| 97 | |
| 98 | ### sketchnote 风详细规范 |
| 99 | |
| 100 | - 明亮温暖的浅米白底(接近 #FFF8EA / #FAF4E6),像干净的手抄报纸或课堂讲义 |
| 101 | - 不要牛皮纸、旧羊皮纸、暗角、污渍、泛黄边缘或明显做旧纹理 |
| 102 | - 主体是黑色手绘线条+文字,有墨迹粗细变化 |
| 103 | - 重点概念用清爽的彩铅/马克笔质感强调(深蓝/珊瑚红/橄榄绿/柔和黄色),颜色轻快但不过饱和 |
| 104 | - 箭头和连线带有手绘的不完美感 |
| 105 | - 文字是手写体(英文可选手写风格,中文保持清晰可读) |
| 106 | - 整体像一份明亮、温暖、信息充实的研究手抄报,不是复古笔记、不是幼稚漫画 |
| 107 | - 可以加入少量帮助理解的趣味符号:放大镜、星号、便签、圈注、手绘小灯泡、简化小图标 |
| 108 | - 趣味元素必须服务理解,不能抢走方法图主体 |
| 109 | - 主体图解应占画面 75%-85%,避免大块空白;如果页面留白明显,优先增加局部放大框、小例子、维度标注或对比说明 |
| 110 | - 每一页右下角有"手写"页码 |
| 111 | |
| 112 | ### paper-figure 风详细规范 |
| 113 | |
| 114 | - 白底或极浅灰底,像 NeurIPS / Nature / Science 论文中的高质量方法总览图 |
| 115 | - 使用干净的矢量感模块:圆角矩形、矩阵小格、流程箭头、分组框、编号步骤 |
| 116 | - 配色克制但现代:黑/深灰为主,1-2个强调色(蓝、青、橙、紫任选其一到两种) |
| 117 | - 结构比原论文图更清楚:保留核心机制,重新组织布局,避免照抄原图 |
| 118 | - 可以有小型结果示意、矩阵热力图、token序列、模块堆叠、对比路径 |
| 119 | - 标注像论文图注中的短标签:精准、短、专业 |
| 120 | - 适合横版 16:9、4:3 或竖版 2:3;README 首屏优先横版或宽图 |
| 121 | |
| 122 | --- |
| 123 | |
| 124 | ## 工作流程 |
| 125 | |
| 126 | ### Step 1:分析论文 → 提取"可图解内容" |
| 127 | |
| 128 | 读完论文后,列出论文的所有内容点,然后**只保留需要图解的部分**: |
| 129 | |
| 130 | **必须图解(每个1-2页):** |
| 131 | - 方法的整体流程/架构(输入→各模块→输出) |
| 132 | - 每个核心创新机制(拆开看内部) |
| 133 | - 最有说服力的那个实验结果 |
| 134 | |
| 135 | **可选图解(如果方法复杂才加):** |
| 136 | - 方法的变体/扩展 |
| 137 | - 关键的数据处理流程 |
| 138 | - 与baseline的可视化对比 |
| 139 | |
| 140 | **不图解:** |
| 141 | - 相关工作(文字提一句就行) |
| 142 | - 多个类似的消融实验 |
| 143 | - 背景知识介绍 |
| 144 | |
| 145 | ### Step 2:给出推荐并确认需求 |
| 146 | |
| 147 | 先输出一个简短推荐,不要立刻生成: |
| 148 | |
| 149 | ```markdown |
| 150 | 我建议生成 6 张: |
| 151 | 1. 封面图:论文一句话贡献 + 视觉锚点 |
| 152 | 2. 方法总览图:解释整体输入、核心模块、输出 |
| 153 | 3. 核心机制A:拆开最重要的创新点 |
| 154 | 4. 核心机制B:解释训练/推理/数据流中的关键环节 |
| 155 | 5. 核心机制C:补足容易误解的内部细节 |
| 156 | 6. 关键结果图:用一张图说明为什么有效 |
| 157 | |
| 158 | 也可以: |
| 159 | - 只生成 1 张总览图 |
| 160 | - 生成 3 张:总览 + 2 张核心机制 |
| 161 | - 扩展到 8-10 张,把每个机制讲得更细 |
| 162 | |
| 163 | 请确认: |
| 164 | - 语言:中文 / English / 双语 |
| 165 | - 风格:sketchnote / paper-figure |
| 166 | - 范围:只要封面/总览,还是生成全部推荐图? |
| 167 | ``` |
| 168 | |
| 169 | 如果用户没有回答,不要继续生成。 |
| 170 | |
| 171 | ### Step 3:确定页数 |
| 172 | |
| 173 | 根据论文复杂度,AI只做**推荐**,最终由用户确认: |
| 174 | |
| 175 | | 论文复杂度 | 推荐页数 | 内容分配 | |
| 176 | |-----------|---------|---------| |
| 177 | | 封面/传播图 | 1页 | 一张封面或高层总览,讲清楚论文做了什么 | |
| 178 | | 快速理解 | 2-3页 | 总览+核心机制+结果 | |
| 179 | | 中等(2个核心方法) | 4-6页 | 封面/总览+2-3个机制+关键结果 | |
| 180 | | 复杂(3+个核心方法) | 6-10页 | 封面/总览+每个机制1页+对比/结果 | |
| 181 | |
| 182 | **规则**:最少1页,最多10页。宁少勿多——1张总览图讲清楚,比10张讲糊涂好。 |
| 183 | |
| 184 | ### Step 4:为每一页写详细的内容描述 |
| 185 | |
| 186 | 不是"生成prompt",而是先用自然语言描述清楚**这一页到底要表达什么**: |
| 187 | |
| 188 | ``` |
| 189 | 第3页:多头注意力机制的内部构造 |
| 190 | |
| 191 | 这一页要讲清楚:Q、K、V是怎么算出来的,它们之间怎么交互。 |
| 192 | |
| 193 | 画面布局(从左到右): |
| 194 | - 左侧:输入x,一个向量表示 |
| 195 | - 中间上方:三条线分别到三个方框(Linear_Q, Linear_K, Linear_V) |
| 196 | - 三个方框各产出Q、K、V三个矩阵 |
| 197 | - 中间核心区域:Q和K做点积→除以√dk→softmax→得到注意力权重 |
| 198 | - 权重和V相乘→输出 |
| 199 | - 右侧:多个这样的"头"并行排列,最后拼接 |
| 200 | |
| 201 | 关键标注: |
| 202 | - 每个方框旁标运算和维度(如"Linear_Q: x→Q(d×dk)") |
| 203 | - Q×K^T的计算用可视化的矩阵乘法图(小格图) |
| 204 | - softmax后的权重用颜色深浅表示(越深=越关注) |
| 205 | ``` |
| 206 | |
| 207 | **要求**:描述要具体到"这个箭头从哪到哪,这个方框里写什么字"。 |
| 208 | |
| 209 | 同时检查每页的信息密度: |
| 210 | - 如果只是大标题 + 少量模块,说明这一页太空,必须补充机制小例子、局部放大、输入输出维度或关键对比 |
| 211 | - 如果内容超过一页可读范围,拆成两页,不要把所有文字塞进同一张图 |
| 212 | - 封面图可以更概念化;机制细节图必须优先讲清楚“怎么做” |
| 213 | |
| 214 | ### Step 5:生成图片 |
| 215 | |
| 216 | 根据当前运行环境自动选择生图后端。为每一页创建prompt文件 → 用结构化prompt生成。 |
| 217 | |
| 218 | **结构化prompt格式**(参考但不照抄baoyu): |
| 219 | ``` |
| 220 | 【类型】流程分解图 |
| 221 | 【风格】sketchnote |
| 222 | 【语言】中文 |
| 223 | 【主题】多头注意力机制内部构造 |
| 224 | 【视觉结构】 |
| 225 | - 水平布局,从左到右5个区域 |
| 226 | - 每个区域用虚线框隔开 |
| 227 | - 关键路径用粗箭头连接 |
| 228 | |
| 229 | 【要标注的文字】 |
| 230 | 1. Input: x ∈ R^(n×d) |
| 231 | 2. Q = xW_Q ... (完整标注) |
| 232 | ... |
| 233 | |
| 234 | 【颜色限制】 |
| 235 | - 背景:明亮浅米白,不要泛黄旧纸 |
| 236 | - 主色:黑色手绘线条 |
| 237 | - 强调色:深蓝/珊瑚红/橄榄绿/柔和黄色,少量使用 |
| 238 | - 其他:保持清爽手抄报感,避免复古暗色 |
| 239 | |
| 240 | 【禁止】 |
| 241 | - 不要代码块 |
| 242 | - 不要照片写实 |
| 243 | - 不要3D渲染 |
| 244 | - 不要生成用户没有确认的额外页面 |
| 245 | - 不要旧羊皮纸、暗角、污渍、重纸纹、黄褐色复古调 |
| 246 | - 不要大面积空白;主体图解占画面75%-85% |
| 247 | ``` |
| 248 | |
| 249 | ### Step 6:输出 |
| 250 | |
| 251 | 生成 `[topic]-illu |