xiaohongshu-content-collector
Health Pass
- License — License: MIT
- Description — Repository has a description
- Active repo — Last push 0 days ago
- Community trust — 22 GitHub stars
Code Fail
- network request — Outbound network request in background.js
- network request — Outbound network request in bridge.js
- exec() — Shell command execution in mcp/server.mjs
- process.env — Environment variable access in mcp/server.mjs
- rm -rf — Recursive force deletion command in package.sh
- network request — Outbound network request in popup/settings.js
Permissions Pass
- Permissions — No dangerous permissions requested
No AI report is available for this listing yet.
Chrome 扩展:小红书/RedNote 笔记被动采集 + 多模态 AI 分析(爆款拆解·仿写·标签建议·视觉诊断) + 多格式/训练集导出,本地存储,内置防风控。支持 OpenRouter/Qwen 等模型列表一键刷新。
小红书内容收集器 (XHS Collector)
🎬 演示
📺 浏览小红书 → 自动采集 → 一键多模态 AI 爆款拆解 → 多格式导出(全程本地存储,数据零外传)

⚠️ 免责声明
本插件仅用于AI vibe coding 私人学习,切勿滥用,如果被小红书风控封号,不负赔偿责任!!!!酌情使用!!!!
✨ 功能特性
📊 智能数据采集
- 被动拦截采集 - 自动拦截小红书 API 请求,无需主动爬取
- 多场景支持 - 支持推荐流、搜索、详情页、用户主页
- DOM 补充扫描 - 结合 DOM 扫描,确保数据完整性
- 去重存储 - 自动去重,避免重复收集
🤖 AI 多模态分析
- 多供应商支持 - OpenRouter、Anthropic、OpenAI、Google AI、Qwen(通义千问)、DeepSeek、MiniMax、自定义端点
- 国内API支持 - 新增Qwen、DeepSeek、MiniMax等国内AI服务商
- 🔄 模型列表动态刷新 - OpenRouter / Qwen 支持一键从官方拉取全部最新可用模型并合并进下拉(本地缓存 7 天),随测试连接自动更新;内置模型已更新至 2026-08 现役新一代
- 图文分析 - 同时分析文字内容和图片视觉风格
- 🎬 视频截帧分析 - 自动截取视频多帧画面(默认6帧,可配置2-12帧),AI 逐帧分析叙事结构和画面质量
- 多种分析模式 - 内容分析、仿写文案、爆款潜力、标签建议、视觉诊断等
- 视频专属分析 - 完播率诊断、仿拍脚本生成、爆款对标分析
- 批量分析 - 选择多条帖子一键批量 AI 分析,支持内容分析、爆款识别、标签分析
- 自动分析 - 自动浏览结束后自动触发 AI 分析,无需手动操作
- 分析历史 - 所有 AI 分析结果自动保存,支持查看、复制、删除
- 自定义 Prompt - 在设置中添加自定义分析模板,支持批量分析选择自定义 Prompt
- 实时分析 - 在浏览器中直接进行 AI 分析
🛡️ 智能风控规避
- 频率控制 - 滑动时间窗口统计,智能限流
- 行为模拟 - 模拟真实用户行为(随机滚动、暂停、疲劳效应)
- 可配置参数 - 灵活调整频率限制和行为参数
📤 多格式导出
- JSON - 完整的结构化数据
- JSONL - 逐行格式,便于处理
- Markdown - 可读性强的文档格式
- 训练数据 - 适合 AI 模型微调的格式
💾 存储容量管理
- 容量监控 - 实时显示存储使用量和容量百分比
- 容量预警 - 接近上限(80%)和达到上限时自动提示
- 多种清理方式 - 按时间、按导出状态、按数量灵活清理数据
- 导出标记 - 导出后自动标记,支持清理已导出数据
⚙️ 可视化配置
- 设置界面 - 完整的可视化设置页面
- 分步引导 - 清晰的步骤标识,引导用户完成配置
- API分类 - 推荐(海外)、国内、自定义三大分类
- 快速预设 - 保守安全、均衡模式、快速采集、无限图片
- 智能校验 - 只在API配置改变时要求测试,优化用户体验
- 实时生效 - 配置修改后立即生效
- 帮助支持 - 内置使用教程、问题反馈、GitHub链接
🔌 生态集成(MCP)
- MCP 接口 - 本地语料一键暴露成 MCP server,让 Claude / Cursor / Cline 直接检索、统计,并用「爆款拆解 / 仿写 / 标签 / 选题 / 博主画像」视角分析你的笔记(详见下文 🔌 MCP 集成)
🧠 支持的 AI 模型(2026-08 现役,内置清单可一键刷新)
内置精选常用模型;设置页点「🔄 刷新模型列表」即可从官方 /models 拉取该供应商全部可用模型(本地缓存 7 天),出新模型无需等发版。
OpenRouter 内置(均为多模态,除标注外)
- Google Gemini 3.7 Flash(默认)、Gemini 3.1 Pro
- Anthropic Claude Opus 5、Sonnet 5、Haiku 4.5
- OpenAI GPT-5.6 Luna、GPT-5.5、GPT-5.4 Mini
- Qwen3.8 Max、Qwen3.7 Flash、Llama 4 Scout、DeepSeek V4 Flash(仅文本)
Qwen(通义千问 / 百炼)
- Qwen VL Max / VL Plus(多模态)、Qwen Max / Plus / Turbo(文本);填 API Key 后点刷新可拉取百炼全部最新模型。
其它供应商:Anthropic(Claude 官方)、OpenAI、Google AI、DeepSeek、MiniMax、自定义 OpenAI 兼容端点。
🚀 安装指南
方法 1:从 Release 安装(推荐)
下载安装包
- 前往 Releases 页面
- 下载最新版本的
xhs-collector-beta-v1.2.1.zip - 或直接下载:xhs-collector-beta-v1.2.1.zip
解压文件
- 将下载的 zip 文件解压到本地文件夹
加载到 Chrome
- 打开 Chrome 浏览器
- 访问
chrome://extensions/ - 开启右上角的"开发者模式"
- 点击"加载已解压的扩展程序"
- 选择解压后的文件夹
验证安装
- 在扩展列表中看到"小红书内容收集器 (公测版)"
- 图标显示在浏览器工具栏
方法 2:从源码安装
克隆项目
git clone https://github.com/fancyyan/xiaohongshu-content-collector.git cd xiaohongshu-content-collector加载到 Chrome
- 按照方法 1 的步骤 3-4 加载到 Chrome
🎯 快速开始
第一步:配置 API(可选)
如果你想使用 AI 分析功能,需要配置 API:
打开设置页面
- 点击浏览器工具栏的插件图标
- 点击右上角的 ⚙️ 设置 按钮
选择 API 供应商
- 推荐(海外):OpenRouter(支持多模型)、Anthropic、OpenAI、Google AI
- 国内:Qwen 通义千问(支持多模态)、DeepSeek(仅文本)、MiniMax(仅文本)
- 自定义:自定义 API 端点
- 推荐使用 OpenRouter(支持多种模型,性价比高)或 Qwen(国内访问快)
- 获取 API Key:
配置 API
- 输入 API Key
- 选择 AI 模型(推荐:Gemini 3.7 Flash,或点「🔄 刷新模型列表」拉取全部最新模型)
- 点击"保存"
第二步:开始收集
访问小红书
- 打开 https://www.xiaohongshu.com/
- 正常浏览内容
自动收集
- 插件会自动拦截并收集浏览过的内容
- 无需任何操作,被动收集
查看统计
- 点击插件图标查看收集统计
- 查看已收集的帖子数量
第三步:使用 AI 分析(可选)
打开 AI 面板
- 在小红书页面,点击右下角的 AI 分析按钮
- 🤖(详情页)、📈(信息流)、👤(博主主页)
选择分析类型
- 内容分析、仿写文案、爆款潜力等
- 点击对应按钮开始分析
查看结果
- AI 会分析文字和图片内容
- 结果可以复制或保存为文件
第四步:导出数据
打开 Popup
- 点击插件图标
选择导出格式
- JSON、JSONL、Markdown、训练数据
- 点击对应按钮导出
保存文件
- 选择保存位置
- 文件会自动下载
📖 使用文档
自动浏览功能
功能说明:
自动滚动页面,模拟真实用户浏览行为,自动收集内容。
使用方法:
- 打开插件 Popup
- 选择滚动速度(慢速/正常/快速)
- 设置最大滚动次数
- 点击"开始自动浏览"
注意事项:
- 建议使用"正常"或"慢速"模式
- 不要设置过大的滚动次数
- 可以随时点击"停止"按钮
AI 分析功能
支持的分析类型:
详情页分析(图文):
- 📊 内容分析 - 分析主题、风格、受众等
- ✍️ 仿写文案 - 模仿风格写新文案
- 🔥 爆款潜力 - 评估爆款可能性
- 🏷️ 标签建议 - 推荐精准标签
- 🎨 视觉诊断 - 分析图片风格和构图
视频笔记分析(v1.2.0 新增):
- 🎬 视频分析 - 场景描述、拍摄风格、叙事结构
- 🔥 完播率诊断 - 开头钩子、节奏分析、跳出风险点
- ✍️ 仿拍脚本 - 分镜脚本、拍摄建议、可复用模板
- 🏷️ 标签建议 - 基于视频画面推荐精准话题标签
- 📊 爆款对标 - 封面帧选择建议、与爆款差距分析
信息流分析:
- 📈 趋势洞察 - 分析热门主题和趋势
- 🎯 选题推荐 - 推荐有潜力的选题
- 🏆 爆文拆解 - 拆解高互动帖子
- 📊 数据报告 - 生成数据分析报告
博主主页分析:
- 👤 博主画像 - 分析定位和风格
- 📐 运营策略 - 分析运营方法
- 🔥 爆款复盘 - 总结爆款规律
- 🎯 对标建议 - 推荐对标方向
配置说明
图片数量限制:
- 详情页:默认 6 张(建议 3-15)
- 信息流:默认 8 张(建议 5-20)
- 博主主页:默认 8 张(建议 5-30)
- 设置为 0 表示无限制
视频截帧数量(v1.2.0 新增):
- 默认 6 帧,范围 2-12 帧
- 帧数越多分析越细致,但消耗 Token 更多
频率控制:
- 每分钟最大请求数:默认 25(建议 15-35)
- 5分钟最大请求数:默认 80(建议 50-120)
- 最小请求间隔:默认 2500ms(建议 2000-4000)
滚动行为:
- 向上滚动概率:默认 10%(建议 5-20%)
- 长暂停概率:默认 15%(建议 10-30%)
- 疲劳阈值:默认 50/100 次
🔧 高级功能
自定义 API 端点
如果你有自己的 API 服务:
- 在设置页面选择"自定义"供应商
- 输入 API 端点 URL
- 输入 API Key
- 确保 API 兼容 OpenAI 格式
快速预设
保守安全(推荐新手):
- 图片:6/8/8 张
- 频率:20次/分钟,60次/5分钟
- 间隔:3000ms
均衡模式(默认):
- 图片:6/8/8 张
- 频率:25次/分钟,80次/5分钟
- 间隔:2500ms
快速采集(有风险):
- 图片:10/15/15 张
- 频率:35次/分钟,100次/5分钟
- 间隔:2000ms
无限图片:
- 图片:无限制
- 频率:25次/分钟,80次/5分钟
- 间隔:2500ms
🔌 MCP 集成(让 Claude / Cursor 查你的小红书语料)
把你在插件里本地采集的小红书语料,通过 MCP 暴露给 AI agent,让 Claude Desktop / Cursor / Cline 能检索、统计,并用插件自带的「爆款拆解 / 仿写 / 标签 / 选题 / 博主画像」视角分析你的笔记。语料仅限你本机已采集的公开笔记,API Key 不会进文件。
零依赖:仅 Node 内置模块,无需
npm install。仓库mcp/下提供 server、样本语料与开发文档。
三步接入
导出语料:在插件 Popup「数据导出」选 JSON,存到本地(如
~/xhs-corpus.json)。配置客户端(把
<REPO>换成本仓库克隆路径,<CORPUS>换成上一步路径):Claude Desktop(
~/Library/Application Support/Claude/claude_desktop_config.json):{ "mcpServers": { "xhs": { "command": "node", "args": ["<REPO>/mcp/server.mjs", "--corpus", "<CORPUS>"] } } }Cursor(
.cursor/mcp.json)、Cline(cline_mcp_settings.json):同样的mcpServers结构。直接问你的 AI:
- 「用
search_notes找 3 条讲防晒的小红书笔记,再用「爆款拆解」各拆一遍」 - 「我库里互动最高的博主是谁?给它做博主画像」
- 「本周采集的笔记最常出现的标签有哪些?」
- 「用
每次工具调用都会重读语料文件——重新导出后无需重启,agent 立刻看到新数据。
完整工具 / 资源 / prompt 清单与本地调试见 mcp/README.md。
❓ 常见问题
Q: 插件安全吗?会不会泄露数据?
A: 完全安全。所有数据都存储在本地浏览器的 IndexedDB 中,不会上传到任何服务器。API Key 也是加密存储在本地。
Q: 视频分析会上传原始视频吗?
A: 不会。截帧在浏览器本地通过 <canvas> 完成,只将截取的 JPEG 图片发给 AI 分析,原始视频文件完全不上传。
Q: 视频截帧数量设置多少合适?
A: 默认 6 帧适合大多数视频。想省 Token 可以设 2-4 帧;视频较长、想分析节奏细节可以设 8-12 帧。
Q: 会不会被小红书封号?
A: 插件采用被动拦截方式,模拟真实用户行为,并有智能频率控制。正常使用不会触发风控。建议使用保守配置。
Q: 不配置 API Key 可以使用吗?
A: 可以。数据收集功能不需要 API Key。只有 AI 分析功能需要配置 API。
Q: 支持哪些 AI 模型?
A: 支持多个供应商的模型:
- 海外:OpenRouter、Anthropic、OpenAI、Google AI
- 国内:Qwen(通义千问,支持多模态)、DeepSeek(仅文本)、MiniMax(仅文本)
- 推荐使用 OpenRouter 的 Gemini 3.7 Flash(多模态、性价比高)或 Qwen VL Max(国内访问快,支持多模态),两者均可在设置页点「🔄 刷新模型列表」拉取全部最新模型
Q: 模型下拉里的模型比较旧,怎么更新?
A: OpenRouter 与 Qwen 供应商在设置页提供「🔄 刷新模型列表」按钮。OpenRouter 免鉴权可直接刷新;Qwen 填写并测试 API Key 后即可刷新。点击后从官方 /models 拉取该供应商全部可用模型并合并进下拉(本地缓存 7 天),以后出新模型无需等版本更新。
Q: 如何导出数据?
A: 点击插件图标,在"数据导出"部分选择格式(JSON/JSONL/Markdown/训练数据),点击对应按钮即可导出。
Q: 自动浏览会不会太快触发风控?
A: 不会。插件有智能频率控制和行为模拟,会自动调整速度。建议使用"正常"或"慢速"模式。
Q: 可以同时在多个标签页使用吗?
A: 可以,但建议一次只在一个标签页使用自动浏览功能,避免请求过于频繁。
Q: 数据存储在哪里?
A: 存储在浏览器的 IndexedDB 中,路径:Chrome DevTools → Application → IndexedDB → xhs_collector
Q: 如何清空数据?
A: 点击插件图标,在底部点击"清空数据"按钮。注意:此操作不可撤销。
Q: API 费用大概多少?
A: 取决于使用的模型和图片数量。使用 Gemini 3.7 Flash 等新一代多模态模型 + 默认图片数量,成本极低,每 100 次分析通常 $0.5 以内。
🛠️ 技术架构
核心技术
- Manifest V3 - Chrome 扩展最新标准
- Content Scripts - 页面注入和数据拦截
- Service Worker - 后台数据处理
- IndexedDB - 本地数据存储
- Chrome Storage API - 配置同步
文件结构
xhs-collector/
├── manifest.json # 扩展配置文件
├── background.js # Service Worker
├── injector.js # API 拦截脚本(MAIN world)
├── bridge.js # 桥接脚本(ISOLATED world)
├── ai-panel.css # AI 面板样式
├── onboarding.html / .js # 首次使用引导页
├── lib/storage.js # IndexedDB 封装
├── popup/ # Popup 与设置界面
│ ├── popup.html / .css / .js
│ └── settings.html / .css / .js
├── icons/ # 图标资源
└── package.sh # 打包脚本
🤝 贡献指南
欢迎贡献代码、报告问题或提出建议!
报告问题
- 前往 Issues 页面
- 描述问题和复现步骤
- 附上截图或错误信息
提交代码
- Fork 本项目
- 创建特性分支 (
git checkout -b feature/AmazingFeature) - 提交更改 (
git commit -m 'Add some AmazingFeature') - 推送到分支 (
git push origin feature/AmazingFeature) - 开启 Pull Request
📄 许可证
本项目采用 MIT 许可证 - 查看 LICENSE 文件了解详情。
🙏 致谢
- 感谢 OpenRouter 提供多模型 API 支持
- 感谢所有贡献者和用户的支持
📮 联系方式
- 问题反馈:GitHub Issues
- 功能建议:GitHub Discussions
- 邮箱:[email protected]
⭐ 如果这个项目对你有帮助,请给个 Star!
Made with ❤️ by Fancy Yan
Reviews (0)
Sign in to leave a review.
Leave a reviewNo results found