xiaohongshu-content-collector

mcp
Guvenlik Denetimi
Basarisiz
Health Gecti
  • License — License: MIT
  • Description — Repository has a description
  • Active repo — Last push 0 days ago
  • Community trust — 22 GitHub stars
Code Basarisiz
  • network request — Outbound network request in background.js
  • network request — Outbound network request in bridge.js
  • exec() — Shell command execution in mcp/server.mjs
  • process.env — Environment variable access in mcp/server.mjs
  • rm -rf — Recursive force deletion command in package.sh
  • network request — Outbound network request in popup/settings.js
Permissions Gecti
  • Permissions — No dangerous permissions requested

Bu listing icin henuz AI raporu yok.

SUMMARY

Chrome 扩展:小红书/RedNote 笔记被动采集 + 多模态 AI 分析(爆款拆解·仿写·标签建议·视觉诊断) + 多格式/训练集导出,本地存储,内置防风控。支持 OpenRouter/Qwen 等模型列表一键刷新。

README.md

小红书内容收集器 (XHS Collector)

Version
License
Chrome
GitHub stars
Last Commit
Made with Vibe Coding

一个智能的小红书内容收集和分析工具,支持自动采集、AI 多模态分析、数据导出等功能。

功能特性安装指南快速开始使用文档常见问题

English Documentation

🎬 演示

📺 浏览小红书 → 自动采集 → 一键多模态 AI 爆款拆解 → 多格式导出(全程本地存储,数据零外传)

演示:浏览小红书 → 自动采集 → AI 爆款拆解 → 导出


⚠️ 免责声明

本插件仅用于AI vibe coding 私人学习,切勿滥用,如果被小红书风控封号,不负赔偿责任!!!!酌情使用!!!!

✨ 功能特性

📊 智能数据采集

  • 被动拦截采集 - 自动拦截小红书 API 请求,无需主动爬取
  • 多场景支持 - 支持推荐流、搜索、详情页、用户主页
  • DOM 补充扫描 - 结合 DOM 扫描,确保数据完整性
  • 去重存储 - 自动去重,避免重复收集

🤖 AI 多模态分析

  • 多供应商支持 - OpenRouter、Anthropic、OpenAI、Google AI、Qwen(通义千问)、DeepSeek、MiniMax、自定义端点
  • 国内API支持 - 新增Qwen、DeepSeek、MiniMax等国内AI服务商
  • 🔄 模型列表动态刷新 - OpenRouter / Qwen 支持一键从官方拉取全部最新可用模型并合并进下拉(本地缓存 7 天),随测试连接自动更新;内置模型已更新至 2026-08 现役新一代
  • 图文分析 - 同时分析文字内容和图片视觉风格
  • 🎬 视频截帧分析 - 自动截取视频多帧画面(默认6帧,可配置2-12帧),AI 逐帧分析叙事结构和画面质量
  • 多种分析模式 - 内容分析、仿写文案、爆款潜力、标签建议、视觉诊断等
  • 视频专属分析 - 完播率诊断、仿拍脚本生成、爆款对标分析
  • 批量分析 - 选择多条帖子一键批量 AI 分析,支持内容分析、爆款识别、标签分析
  • 自动分析 - 自动浏览结束后自动触发 AI 分析,无需手动操作
  • 分析历史 - 所有 AI 分析结果自动保存,支持查看、复制、删除
  • 自定义 Prompt - 在设置中添加自定义分析模板,支持批量分析选择自定义 Prompt
  • 实时分析 - 在浏览器中直接进行 AI 分析

🛡️ 智能风控规避

  • 频率控制 - 滑动时间窗口统计,智能限流
  • 行为模拟 - 模拟真实用户行为(随机滚动、暂停、疲劳效应)
  • 可配置参数 - 灵活调整频率限制和行为参数

📤 多格式导出

  • JSON - 完整的结构化数据
  • JSONL - 逐行格式,便于处理
  • Markdown - 可读性强的文档格式
  • 训练数据 - 适合 AI 模型微调的格式

💾 存储容量管理

  • 容量监控 - 实时显示存储使用量和容量百分比
  • 容量预警 - 接近上限(80%)和达到上限时自动提示
  • 多种清理方式 - 按时间、按导出状态、按数量灵活清理数据
  • 导出标记 - 导出后自动标记,支持清理已导出数据

⚙️ 可视化配置

  • 设置界面 - 完整的可视化设置页面
  • 分步引导 - 清晰的步骤标识,引导用户完成配置
  • API分类 - 推荐(海外)、国内、自定义三大分类
  • 快速预设 - 保守安全、均衡模式、快速采集、无限图片
  • 智能校验 - 只在API配置改变时要求测试,优化用户体验
  • 实时生效 - 配置修改后立即生效
  • 帮助支持 - 内置使用教程、问题反馈、GitHub链接

🔌 生态集成(MCP)

  • MCP 接口 - 本地语料一键暴露成 MCP server,让 Claude / Cursor / Cline 直接检索、统计,并用「爆款拆解 / 仿写 / 标签 / 选题 / 博主画像」视角分析你的笔记(详见下文 🔌 MCP 集成)

🧠 支持的 AI 模型(2026-08 现役,内置清单可一键刷新)

内置精选常用模型;设置页点「🔄 刷新模型列表」即可从官方 /models 拉取该供应商全部可用模型(本地缓存 7 天),出新模型无需等发版。

OpenRouter 内置(均为多模态,除标注外)

  • Google Gemini 3.7 Flash(默认)、Gemini 3.1 Pro
  • Anthropic Claude Opus 5、Sonnet 5、Haiku 4.5
  • OpenAI GPT-5.6 Luna、GPT-5.5、GPT-5.4 Mini
  • Qwen3.8 Max、Qwen3.7 Flash、Llama 4 Scout、DeepSeek V4 Flash(仅文本)

Qwen(通义千问 / 百炼)

  • Qwen VL Max / VL Plus(多模态)、Qwen Max / Plus / Turbo(文本);填 API Key 后点刷新可拉取百炼全部最新模型。

其它供应商:Anthropic(Claude 官方)、OpenAI、Google AI、DeepSeek、MiniMax、自定义 OpenAI 兼容端点。

🚀 安装指南

方法 1:从 Release 安装(推荐)

  1. 下载安装包

  2. 解压文件

    • 将下载的 zip 文件解压到本地文件夹
  3. 加载到 Chrome

    • 打开 Chrome 浏览器
    • 访问 chrome://extensions/
    • 开启右上角的"开发者模式"
    • 点击"加载已解压的扩展程序"
    • 选择解压后的文件夹
  4. 验证安装

    • 在扩展列表中看到"小红书内容收集器 (公测版)"
    • 图标显示在浏览器工具栏

方法 2:从源码安装

  1. 克隆项目

    git clone https://github.com/fancyyan/xiaohongshu-content-collector.git
    cd xiaohongshu-content-collector
    
  2. 加载到 Chrome

    • 按照方法 1 的步骤 3-4 加载到 Chrome

🎯 快速开始

第一步:配置 API(可选)

如果你想使用 AI 分析功能,需要配置 API:

  1. 打开设置页面

    • 点击浏览器工具栏的插件图标
    • 点击右上角的 ⚙️ 设置 按钮
  2. 选择 API 供应商

  3. 配置 API

    • 输入 API Key
    • 选择 AI 模型(推荐:Gemini 3.7 Flash,或点「🔄 刷新模型列表」拉取全部最新模型)
    • 点击"保存"

第二步:开始收集

  1. 访问小红书

  2. 自动收集

    • 插件会自动拦截并收集浏览过的内容
    • 无需任何操作,被动收集
  3. 查看统计

    • 点击插件图标查看收集统计
    • 查看已收集的帖子数量

第三步:使用 AI 分析(可选)

  1. 打开 AI 面板

    • 在小红书页面,点击右下角的 AI 分析按钮
    • 🤖(详情页)、📈(信息流)、👤(博主主页)
  2. 选择分析类型

    • 内容分析、仿写文案、爆款潜力等
    • 点击对应按钮开始分析
  3. 查看结果

    • AI 会分析文字和图片内容
    • 结果可以复制或保存为文件

第四步:导出数据

  1. 打开 Popup

    • 点击插件图标
  2. 选择导出格式

    • JSON、JSONL、Markdown、训练数据
    • 点击对应按钮导出
  3. 保存文件

    • 选择保存位置
    • 文件会自动下载

📖 使用文档

自动浏览功能

功能说明:
自动滚动页面,模拟真实用户浏览行为,自动收集内容。

使用方法:

  1. 打开插件 Popup
  2. 选择滚动速度(慢速/正常/快速)
  3. 设置最大滚动次数
  4. 点击"开始自动浏览"

注意事项:

  • 建议使用"正常"或"慢速"模式
  • 不要设置过大的滚动次数
  • 可以随时点击"停止"按钮

AI 分析功能

支持的分析类型:

详情页分析(图文):

  • 📊 内容分析 - 分析主题、风格、受众等
  • ✍️ 仿写文案 - 模仿风格写新文案
  • 🔥 爆款潜力 - 评估爆款可能性
  • 🏷️ 标签建议 - 推荐精准标签
  • 🎨 视觉诊断 - 分析图片风格和构图

视频笔记分析(v1.2.0 新增):

  • 🎬 视频分析 - 场景描述、拍摄风格、叙事结构
  • 🔥 完播率诊断 - 开头钩子、节奏分析、跳出风险点
  • ✍️ 仿拍脚本 - 分镜脚本、拍摄建议、可复用模板
  • 🏷️ 标签建议 - 基于视频画面推荐精准话题标签
  • 📊 爆款对标 - 封面帧选择建议、与爆款差距分析

信息流分析:

  • 📈 趋势洞察 - 分析热门主题和趋势
  • 🎯 选题推荐 - 推荐有潜力的选题
  • 🏆 爆文拆解 - 拆解高互动帖子
  • 📊 数据报告 - 生成数据分析报告

博主主页分析:

  • 👤 博主画像 - 分析定位和风格
  • 📐 运营策略 - 分析运营方法
  • 🔥 爆款复盘 - 总结爆款规律
  • 🎯 对标建议 - 推荐对标方向

配置说明

图片数量限制:

  • 详情页:默认 6 张(建议 3-15)
  • 信息流:默认 8 张(建议 5-20)
  • 博主主页:默认 8 张(建议 5-30)
  • 设置为 0 表示无限制

视频截帧数量(v1.2.0 新增):

  • 默认 6 帧,范围 2-12 帧
  • 帧数越多分析越细致,但消耗 Token 更多

频率控制:

  • 每分钟最大请求数:默认 25(建议 15-35)
  • 5分钟最大请求数:默认 80(建议 50-120)
  • 最小请求间隔:默认 2500ms(建议 2000-4000)

滚动行为:

  • 向上滚动概率:默认 10%(建议 5-20%)
  • 长暂停概率:默认 15%(建议 10-30%)
  • 疲劳阈值:默认 50/100 次

🔧 高级功能

自定义 API 端点

如果你有自己的 API 服务:

  1. 在设置页面选择"自定义"供应商
  2. 输入 API 端点 URL
  3. 输入 API Key
  4. 确保 API 兼容 OpenAI 格式

快速预设

保守安全(推荐新手):

  • 图片:6/8/8 张
  • 频率:20次/分钟,60次/5分钟
  • 间隔:3000ms

均衡模式(默认):

  • 图片:6/8/8 张
  • 频率:25次/分钟,80次/5分钟
  • 间隔:2500ms

快速采集(有风险):

  • 图片:10/15/15 张
  • 频率:35次/分钟,100次/5分钟
  • 间隔:2000ms

无限图片:

  • 图片:无限制
  • 频率:25次/分钟,80次/5分钟
  • 间隔:2500ms

🔌 MCP 集成(让 Claude / Cursor 查你的小红书语料)

把你在插件里本地采集的小红书语料,通过 MCP 暴露给 AI agent,让 Claude Desktop / Cursor / Cline 能检索、统计,并用插件自带的「爆款拆解 / 仿写 / 标签 / 选题 / 博主画像」视角分析你的笔记。语料仅限你本机已采集的公开笔记,API Key 不会进文件。

零依赖:仅 Node 内置模块,无需 npm install。仓库 mcp/ 下提供 server、样本语料与开发文档。

三步接入

  1. 导出语料:在插件 Popup「数据导出」选 JSON,存到本地(如 ~/xhs-corpus.json)。

  2. 配置客户端(把 <REPO> 换成本仓库克隆路径,<CORPUS> 换成上一步路径):

    Claude Desktop~/Library/Application Support/Claude/claude_desktop_config.json):

    {
      "mcpServers": {
        "xhs": {
          "command": "node",
          "args": ["<REPO>/mcp/server.mjs", "--corpus", "<CORPUS>"]
        }
      }
    }
    

    Cursor.cursor/mcp.json)、Clinecline_mcp_settings.json):同样的 mcpServers 结构。

  3. 直接问你的 AI

    • 「用 search_notes 找 3 条讲防晒的小红书笔记,再用「爆款拆解」各拆一遍」
    • 「我库里互动最高的博主是谁?给它做博主画像」
    • 「本周采集的笔记最常出现的标签有哪些?」

每次工具调用都会重读语料文件——重新导出后无需重启,agent 立刻看到新数据。

完整工具 / 资源 / prompt 清单与本地调试见 mcp/README.md

❓ 常见问题

Q: 插件安全吗?会不会泄露数据?

A: 完全安全。所有数据都存储在本地浏览器的 IndexedDB 中,不会上传到任何服务器。API Key 也是加密存储在本地。

Q: 视频分析会上传原始视频吗?

A: 不会。截帧在浏览器本地通过 <canvas> 完成,只将截取的 JPEG 图片发给 AI 分析,原始视频文件完全不上传。

Q: 视频截帧数量设置多少合适?

A: 默认 6 帧适合大多数视频。想省 Token 可以设 2-4 帧;视频较长、想分析节奏细节可以设 8-12 帧。

Q: 会不会被小红书封号?

A: 插件采用被动拦截方式,模拟真实用户行为,并有智能频率控制。正常使用不会触发风控。建议使用保守配置。

Q: 不配置 API Key 可以使用吗?

A: 可以。数据收集功能不需要 API Key。只有 AI 分析功能需要配置 API。

Q: 支持哪些 AI 模型?

A: 支持多个供应商的模型:

  • 海外:OpenRouter、Anthropic、OpenAI、Google AI
  • 国内:Qwen(通义千问,支持多模态)、DeepSeek(仅文本)、MiniMax(仅文本)
  • 推荐使用 OpenRouter 的 Gemini 3.7 Flash(多模态、性价比高)或 Qwen VL Max(国内访问快,支持多模态),两者均可在设置页点「🔄 刷新模型列表」拉取全部最新模型

Q: 模型下拉里的模型比较旧,怎么更新?

A: OpenRouter 与 Qwen 供应商在设置页提供「🔄 刷新模型列表」按钮。OpenRouter 免鉴权可直接刷新;Qwen 填写并测试 API Key 后即可刷新。点击后从官方 /models 拉取该供应商全部可用模型并合并进下拉(本地缓存 7 天),以后出新模型无需等版本更新。

Q: 如何导出数据?

A: 点击插件图标,在"数据导出"部分选择格式(JSON/JSONL/Markdown/训练数据),点击对应按钮即可导出。

Q: 自动浏览会不会太快触发风控?

A: 不会。插件有智能频率控制和行为模拟,会自动调整速度。建议使用"正常"或"慢速"模式。

Q: 可以同时在多个标签页使用吗?

A: 可以,但建议一次只在一个标签页使用自动浏览功能,避免请求过于频繁。

Q: 数据存储在哪里?

A: 存储在浏览器的 IndexedDB 中,路径:Chrome DevTools → Application → IndexedDB → xhs_collector

Q: 如何清空数据?

A: 点击插件图标,在底部点击"清空数据"按钮。注意:此操作不可撤销。

Q: API 费用大概多少?

A: 取决于使用的模型和图片数量。使用 Gemini 3.7 Flash 等新一代多模态模型 + 默认图片数量,成本极低,每 100 次分析通常 $0.5 以内。


🛠️ 技术架构

核心技术

  • Manifest V3 - Chrome 扩展最新标准
  • Content Scripts - 页面注入和数据拦截
  • Service Worker - 后台数据处理
  • IndexedDB - 本地数据存储
  • Chrome Storage API - 配置同步

文件结构

xhs-collector/
├── manifest.json          # 扩展配置文件
├── background.js          # Service Worker
├── injector.js            # API 拦截脚本(MAIN world)
├── bridge.js              # 桥接脚本(ISOLATED world)
├── ai-panel.css           # AI 面板样式
├── onboarding.html / .js  # 首次使用引导页
├── lib/storage.js         # IndexedDB 封装
├── popup/                 # Popup 与设置界面
│   ├── popup.html / .css / .js
│   └── settings.html / .css / .js
├── icons/                 # 图标资源
└── package.sh             # 打包脚本

🤝 贡献指南

欢迎贡献代码、报告问题或提出建议!

报告问题

  • 前往 Issues 页面
  • 描述问题和复现步骤
  • 附上截图或错误信息

提交代码

  1. Fork 本项目
  2. 创建特性分支 (git checkout -b feature/AmazingFeature)
  3. 提交更改 (git commit -m 'Add some AmazingFeature')
  4. 推送到分支 (git push origin feature/AmazingFeature)
  5. 开启 Pull Request

📄 许可证

本项目采用 MIT 许可证 - 查看 LICENSE 文件了解详情。


🙏 致谢

  • 感谢 OpenRouter 提供多模型 API 支持
  • 感谢所有贡献者和用户的支持

📮 联系方式


⭐ 如果这个项目对你有帮助,请给个 Star!

Made with ❤️ by Fancy Yan

Yorumlar (0)

Sonuc bulunamadi