SuGPT-kexue
Health Warn
- License — License: NOASSERTION
- Description — Repository has a description
- Active repo — Last push 56 days ago
- Low visibility — Only 5 GitHub stars
Code Pass
- Code scan — Scanned 12 files during light audit, no dangerous patterns found
Permissions Pass
- Permissions — No dangerous permissions requested
No AI report is available for this listing yet.
Distill 苏剑林 (kexue.fm) 的 AI 博客思想为 AI Agent 可用的 skill + 69 篇全文语料库。L0-L5 思维程序、4 种推导 archetype、7 级证据门槛、15 条带前提的观点案例库。
SuGPT — 苏剑林 AI 思想 / 知识蒸馏库
把国内 AI/NLP 领域代表性博主 苏剑林(科学空间 kexue.fm) 的公开文章蒸馏成一个可被 AI Agent 直接查询的知识库,用于回答任何关于深度学习、生成模型、位置编码、优化器、注意力机制等话题的问题,并以苏神本人的思维路径和叙事风格给出答案。
📣 声明:本仓库仅用于个人学习与 AI 辅助问答。语料版权归苏剑林本人。
任何人如果对语料库有意见,如果侵犯隐私,请发 Issue,看到就会尽快修改。
三种玩法
推荐先安装完整 skill 套件,然后直接在 Cursor / Codex 里和 AI 对话。下面所有玩法都可以不使用 CLI;sugpt daily、sugpt vae 这类短句既可以当命令行入口,也可以直接作为 AI 对话里的触发词。CLI 只是给喜欢终端检索的人留的备用入口。
玩法 1:AI 客户端问答(核心用法)
# 一键安装(自动检测 Cursor / Codex,链接完整 skill 套件)
curl -fsSL https://raw.githubusercontent.com/tianming23/SuGPT-kexue/main/scripts/install.sh | bash
# 或手动
git clone https://github.com/tianming23/SuGPT-kexue.git ~/SuGPT-kexue
ln -s ~/SuGPT-kexue/skill ~/.cursor/skills-cursor/sugpt
ln -s ~/SuGPT-kexue/skill/daily-learn ~/.cursor/skills-cursor/daily-learn
ln -s ~/SuGPT-kexue/skill/video-learn ~/.cursor/skills-cursor/video-learn
ln -s ~/SuGPT-kexue/.codex-skills/sujianlin ~/.cursor/skills-cursor/sujianlin
在 AI 客户端问时,建议用明确触发词。普通技术问句(例如"DDPM 是什么?""RoPE 为什么能表示相对位置?")可能只会触发通用回答,不一定会启用本项目的 skill。
- "苏神在 RoPE 底数选择上有什么观点?" → 触发 sugpt(查语料)
- "苏神怎么看 DDPM?" → 触发 sugpt(查语料)
- "按 sugpt 查原文,解释 RoPE 为什么能表示相对位置" → 触发 sugpt(强触发)
- "用 Archetype A 推导一下 RoPE 的基本形式" → 触发 sujianlin(按思维程序推导)
- "/sujianlin 用 Archetype D 讲一下 Muon" → 手动选择 sujianlin
- "来个今日 AI 话题考考我" → 触发 daily-learn(主动抽题对话)
- "把这个 AI 视频蒸馏成 ideas.md" → 触发 video-learn(视频思想蒸馏)
安装后主要用法就是和 AI 对话。大多数时候不必每次手动选择 skill,但要在问题里给出足够明确的触发信号,例如"苏神 / 科学空间 / kexue.fm / 按 sugpt 查原文 / 用 Archetype / daily-learn / video-learn"。如果客户端支持手动选择,也可以直接输入 /sujianlin、/sugpt 等选择对应 skill。刚安装或更新后,需要新开对话或重启客户端让它重新扫描。
玩法 2:主动学习(让 AI 考你)
安装 daily-learn 后,可以直接在 AI 对话里说:
sugpt daily
sugpt vae
来个今日 AI 话题考考我
按 daily-learn 模式带我学扩散模型
它会主动抛一个问题,引导你回答、纠错、再推进,而不是一上来把答案灌完。
5 种对话模式:
- 📘 explain 讲解:先抛反直觉结论,再让你猜原因
- 🤔 socratic 苏格拉底:一步步引导你推出结论
- ⚔️ challenge 挑战:抛一个反直觉观点让你判断
- 🔗 unify 串联:问"两个看似无关的方法本质等价吗"
- ❓ quiz 问答:直接抛问题让你作答
玩法 3:命令行检索(可选)
如果你只是想快速查资料,也可以用 sugpt CLI:
sugpt "RoPE" # 关键词
sugpt topic "扩散模型" # 主题
sugpt read 8265 # 按 ID 读全文
sugpt daily # 随机抽一个学习话题
完整安装指南:INSTALL.md。贡献指南:CONTRIBUTING.md。更新记录:CHANGELOG.md。
它是什么
这是一个**"人 → 语料 → Skill"** 的蒸馏管线:
苏剑林公开博客 (kexue.fm)
↓ [RSS feeds + WebSearch 抓取]
原始 HTML / Markdown 缓存
↓ [正则解析 + 清洗]
corpus/articles/<id>.md ← 54 篇 Tier-1 代表作全文
corpus/articles_index.json ← 350 篇 AI 文章摘要索引
↓ [主题归类 + 倒排]
corpus/INDEX.json ← 主搜索索引
corpus/TOPICS.json ← 主题 → 文章倒排
corpus/by_topic/<topic>.md ← 12 个主题浏览页
↓ [Skill 封装]
skill/SKILL.md ← AI 会用它检索语料并按苏神风格作答
~/.codex/skills/sujianlin/ ← 配套的"风格模仿" skill(纯方法论)
为什么要这么做
- 可复现的知识:每个回答都能指向具体文章 ID 与 URL,不是靠模型记忆"好像苏神说过…"。
- 风格可控:苏神独特的推导路径(先恒等式→求最简解→从二维推广)+ 大白话类比(拆楼建楼、砖瓦水泥)是稀缺资产,把它做成 skill 让任何 AI Agent 都能复用。
- 深度覆盖前沿:从 2017 年的 VAE、GAN,到 2025 年的 Muon、MLA、MoE、一致性模型,单点即入口,一切自然串起。
目录结构
SuGPT/
├── README.md ← 本文件
├── INSTALL.md ← 安装指南
├── CONTRIBUTING.md ← 贡献指南
├── CHANGELOG.md ← 版本演进(v0.1 → v0.2.1)
├── LICENSE ← MIT(脚本/skill)+ 语料归属说明
├── corpus/
│ ├── videos/ ← v0.2.4 新增:精选视频语料
│ │ ├── CURATED_VIDEOS.md ← 视频清单 + 蒸馏标准
│ │ ├── 3b1b/ ← 3Blue1Brown(Transformer / Attention)
│ │ ├── deepia/ ← Deepia(AE / VAE / CNN)
│ │ ├── karpathy/ ← Andrej Karpathy(build GPT / intro LLM)
│ │ └── silver/ ← David Silver RL Course(填补 RL 盲区)
│ ├── INDEX.json ← 主索引(362 篇)
│ ├── TOPICS.json ← 14 主题倒排
│ ├── articles_index.json ← RSS 抽取原始索引(带 400 字摘要)
│ ├── tier1_final.json ← Tier-1 清单(69 篇带全文)
│ ├── articles/ ← 69 篇 Tier-1 全文 markdown
│ ├── by_topic/ ← 14 主题浏览页(位置编码、扩散模型、注意力机制、
│ │ 优化器、MoE、VAE/流模型、GAN、多模态、LoRA、
│ │ Softmax/分类、BERT/预训练、概率/信息论基础、
│ │ 方法论自述、其他 AI)
│ └── raw/feeds/ ← 35 页 RSS feed 原始快照
├── scripts/
│ ├── parse_feeds.py ← RSS → articles_index.json
│ ├── select_articles.py ← 粗筛 224 篇
│ ├── tier1_final.py ← 精选 85 篇
│ ├── extract_articles.py ← 缓存 HTML → markdown 全文
│ ├── build_index.py ← 建 INDEX / TOPICS / by_topic
│ ├── search.py ← 命令行检索工具
│ ├── daily.py ← ☕ 每日话题选择器(主动学习入口)
│ ├── install.sh ← 一键安装脚本
│ └── refresh.sh ← 定期刷新脚本
├── bin/
│ └── sugpt ← 简洁命令行入口
├── skill/
│ ├── SKILL.md ← sugpt skill(语料检索 + 观点归因)
│ ├── daily-learn/
│ │ └── SKILL.md ← 主动引导学习 skill(5 种对话模式)
│ └── video-learn/
│ └── SKILL.md ← v0.2.4 新增:视频思想蒸馏 skill
└── .codex-skills/
└── sujianlin/
├── SKILL.md ← sujianlin skill v2.3(思维程序 + L7 视频锚点)
├── SKILL.v1.md.bak ← v1 归档
├── SKILL.v2.md.bak ← v2 归档
└── SKILL.v2.1.md.bak ← v2.1 归档
主题覆盖(362 篇 × 16 主题)
| 主题 | 总数 | 其中全文 |
|---|---|---|
| 其他 AI 零散话题 | 126 | 2 |
| 优化器 / 学习率 / Scaling Law | 53 | 16 |
| 扩散模型(DDPM / DDIM / Flow / Score / 一致性) | 41 | 16 |
| BERT / 预训练 | 30 | 0 |
| 位置编码 / RoPE / 长度外推 | 26 | 14 |
| GAN / WGAN | 21 | 4 |
| 注意力机制 / MHA/MLA/线性 Attention | 20 | 8 |
| VAE / 流模型 | 20 | 4 |
| 概率/信息论基础(v0.2.1) | 20 | 12 |
| 基础数学工具(v0.2.2 新增)—— Lipschitz / SVD / 伪逆 / Fokker-Planck | 15 | 6 |
| 最小熵原理 / NLP 基础(v0.2.2 新增) | 15 | 3 |
| Softmax / 分类 / 损失函数 | 12 | 4 |
| MoE | 7 | 5 |
| 多模态 / 图文 | 5 | 5 |
| LoRA / 微调 | 3 | 2 |
| 方法论自述(v0.2.1) | 3 | 3 |
覆盖苏神 2011-04 到 2026-04 十五年创作期,其中 AI 部分跨越 2017-04 至今。
使用方式
命令行检索(给人看的)
# 按关键词搜标题+摘要
sugpt RoPE 底数
# 列一个主题下全部文章
sugpt topic "扩散模型"
# 按 ID 读完整正文
sugpt read 8265
# 全文 grep(找苏神在哪些篇文章里提过某概念)
sugpt grep "拆楼"
# 限制条数
sugpt RoPE -n 5
旧脚本入口仍然保留:python3 scripts/search.py ... 和 python3 scripts/daily.py ... 都可以继续用。
AI Agent 问答(核心用法)
把完整 skill 套件链接或复制到你的 AI Agent 能识别的 skills 目录下。注意:daily-learn 和 video-learn 要作为顶层 skill 暴露,不能只藏在 sugpt 目录里面,否则部分客户端不会自动发现。
# Cursor: 直接用 workspace 路径
mkdir -p ~/.cursor/skills-cursor
ln -s /Users/hh/SuGPT/skill ~/.cursor/skills-cursor/sugpt
ln -s /Users/hh/SuGPT/skill/daily-learn ~/.cursor/skills-cursor/daily-learn
ln -s /Users/hh/SuGPT/skill/video-learn ~/.cursor/skills-cursor/video-learn
ln -s /Users/hh/SuGPT/.codex-skills/sujianlin ~/.cursor/skills-cursor/sujianlin
# Codex CLI: 放到 ~/.codex/skills/
mkdir -p ~/.codex/skills
ln -s /Users/hh/SuGPT/skill ~/.codex/skills/sugpt
ln -s /Users/hh/SuGPT/skill/daily-learn ~/.codex/skills/daily-learn
ln -s /Users/hh/SuGPT/skill/video-learn ~/.codex/skills/video-learn
ln -s /Users/hh/SuGPT/.codex-skills/sujianlin ~/.codex/skills/sujianlin
然后就可以这样问。推荐写法是带触发词:
- 用户:"苏神在 RoPE 底数 10000 上有什么观点?"
- 用户:"按 sugpt 查原文,DDPM 为什么叫渐变模型而不是扩散?"
- 用户:"参考科学空间,解释 MLA 相比 GQA 好在哪里。"
- 用户:"按苏神风格讲一下 Muon 优化器。"
- 用户:"/sujianlin 用 Archetype D 讲一下 Muon。"
不推荐只写下面这种泛化技术问句,因为它们不一定会触发本项目 skill:
- 用户:"DDPM 是什么?"
- 用户:"RoPE 为什么能表示相对位置?"
AI 会:
- 先跑
search.py定位相关文章 - 读对应
corpus/articles/<id>.md全文 - 按苏神风格(先类比 → 恒等式 → 推导 → 分析 → 追问)组织答案
- 每个论点后附
[archives/XXXX]引用
默认回答会按“教学解释”展开,不只是列提纲;除非你明确说“简短 / 一句话 / TL;DR / 只要结论”。
配套的风格 Skill
还有一个更纯粹的风格模仿 skill 放在 ~/.codex/skills/sujianlin/SKILL.md,只传方法论不带语料。两者可以配合使用:
- 查事实 用
sugpt(本库) - 仿风格 用
sujianlin(~/.codex/skills/sujianlin/) - 主动学习 用
daily-learn - 视频入库/蒸馏 用
video-learn
Tier-1 全文清单(85 篇)
位置编码 / Transformer 升级之路(11)
- 8130, 8265, 8338, 9431, 9675, 9859, 9948, 10040, 10091, 10122, 10347, 10907, 11111
扩散模型漫谈(13)
- 9119, 9152, 9164, 9181, 9209, 9228, 9262, 9280, 9467, 9668, 10633, 10958, 11428
MoE 环游记(5)
- 10699, 10735, 10757, 10815, 10945
Muon / MuP(6)
- 10592, 10739, 11126, 11340, 11416, 11654
VAE / Flow(3)
- 5253, 5776, 5807
注意力机制(3)
- 7546, 9019, 11033
闭门造车多模态(3)
- 9984, 10197, 10352
LoRA(2)
- 10226, 10266
Softmax / 分类(2)
- 6992, 7359
优化器细节(3)
- 10542, 10563, 10657
GAN(1)
- 8244
概率/信息论基础(v0.2.1 新增,8 篇)
- 3534, 3552, 3567 熵三部曲
- 5239 从最大似然到 EM 算法
- 8829 概率分布的熵归一化
- 9070 logsumexp 不等式
- 10145 通向概率分布之路:盘点 Softmax 及替代品
- 10588 从 Hessian 近似看自适应学习率优化器
优化器补充(v0.2.1 新增,3 篇)
- 4647 浅谈激活函数设计
- 7094 6 个派生优化器简介
- 9512 Tiger 优化器(苏神自创)
- 9660 梯度流:探索通向最小值之路
方法论自述(v0.2.1 新增,3 篇,非 AI 分类)
- 1324 《教材如何写》(反例训练、先直观后严格)
- 2498 《如何看费曼的讲义和朗道的教程?》(越复杂越简单)
- 3086 [转载] 做数学一定要是天才吗?(陶哲轩,苏神背书)
动力学视角优化器系列(v0.2.2 新增,3 篇)
- 5655《从动力学角度看优化算法(一):SGD 到动量加速》—— SGD ≡ 欧拉解;Momentum ≡ 牛顿二阶
- 6234《从动力学角度看优化算法(二):自适应学习率算法》
- 6261《从动力学角度看优化算法(三):一个更整体的视角》
最小熵原理系列(v0.2.2 新增,3 篇)
- 5448《最小熵原理(一):无监督学习的原理》—— 苏神提出的方法论框架
- 5476《最小熵原理(二):词库构建》
- 5577《最小熵原理(三):句模板与语言结构》
基础数学工具(v0.2.2 新增,5 篇)
- 6051《Lipschitz 约束:泛化与生成模型》—— L2 正则 ≡ F 范数 ≡ L 约束的等价链
- 10366《低秩近似之路(一):伪逆》
- 10407《低秩近似之路(二):SVD》
- 4208《SVD 分解(一):自编码器与人工智能》
- 9461《测试函数法推导连续性方程和 Fokker-Planck 方程》
GAN 基础理论(v0.2.2 新增,2 篇)
- 6016《f-GAN 简介:GAN 模型的生产车间》
- 7210《Designing GANs:又一个 GAN 生产车间》
Transformer 基础(v0.2.2 新增,3 篇)
- 8231《Transformer 升级之路 1:Sinusoidal 位置编码追根溯源》
- 8620《浅谈 Transformer 的初始化、参数化与标准化》
- 8823《从熵不变性看 Attention 的 Scale 操作》
如何更新
苏神持续在更新,建议每季度跑一次刷新:
# 1. 重新抓 RSS(35 页)—— 需要 WebFetch 工具或手动 curl
# 把最新的 feed 保存到 corpus/raw/feeds/tmp_*.xml
# 2. 一键刷新
bash scripts/refresh.sh
refresh.sh 会自动依次运行 parse_feeds → tier1_final → extract_articles → build_index,并在结尾打印最新统计。
技术限制与诚实说明
- 正文不是 100% 忠实于原 HTML:WebFetch 抓下来的是 markdown 化后的页面,再经过
scripts/extract_articles.py做了一次清洗(去导航、去评论、去 footer、截断废话)。核心推导、公式、代码都保留,但可能丢失部分图片说明与版式。 - LaTeX 公式是字符串级别保留:形式上还是
\begin{equation}...\end{equation},渲染依赖你的查看器。Cursor / VSCode 的 markdown 预览可以装 KaTeX 插件。 - 1 篇摘要代替全文:id=7359《Softmax+交叉熵推广到多标签分类》因为苏神站点对 WebSearch/WebFetch 有速率限制抓不下来,用了 WebSearch 聚合摘要 + 公开社区笔记凑了一份"摘要版",在
corpus/articles/7359.md顶部有content_type: summary标注。 - 版权说明:苏神博客允许转载并要求附原文链接。本语料库仅供个人学习 / AI 辅助问答使用,严禁商用、严禁未注明出处再发布。每篇 markdown 顶部都保留了原文 URL。
License & 致谢
- 本项目的脚本与 skill 代码:MIT
- 语料库内容:版权归苏剑林 / 科学空间,仅供个人研究使用,请尊重作者付出
- 致谢:苏剑林老师九年如一日的公开写作是中文 AI 圈最宝贵的财富之一 🙏
Reviews (0)
Sign in to leave a review.
Leave a reviewNo results found