把公域讨论变成可分析的样本库

围绕研究议题设一组关键词,抖音、小红书的公开内容和评论定时进入飞书多维表格 —— 样本随时间自然积累,分析随时可以开始。

一个课题周期里,样本怎么来

手工按阶段:研究样本靠人工检索截图,规模上不去也难复现;舆论热点转瞬即逝,想回头补数据已经搜不到了;采回来的数据格式散乱,清洗比采集还费时间。交给数小探:建库 → 采样 → 清洗 → 分析,每一步的口径都写在任务里,换个人跑结果一样。

字段怎么来

全部来自平台公开页面上可见的内容:标题、正文、互动计数、发布者、发布时间、原文链接。没有推断字段,没有我们自己算出来的指标。

什么情况会缺

内容被删除或限流时采不到;互动计数是采集时刻的快照,不是终值;平台改版期间可能有短暂缺口,任务失败会通知你。

重复样本怎么去

按「标题 + 原文链接」去重:同一条内容在多个关键词下被采到,表里只保留一行,但采集时间戳保留最早的一次。

开题前一周

把研究问题拆成三组关键词,各建一个任务。从今天开始每天存,时间序列是研究里最贵的东西。

热点过去之后

事件当周的讨论已经沉下去、搜不到了 —— 但那周的样本在表里,带发布时间与原文链接,随时可以回去看。

写方法一节的时候

时间窗、关键词、去重规则都在任务配置里,抄下来就是方法描述。审稿人要复现,给他同一套配置。

变量名与是否可回溯

变量 / 来源 / 可回溯。content_text — 正文全文或摘要 — 是(原文链接);likes / comments / saves — 采集时刻的互动计数 — 否(快照);author — 发布者昵称 + 主页 — 是;published_at — 平台显示的发布时间 — 是;captured_at — 客户端写入时间 — 是;keyword — 命中的关键词 — 是;url — 原文链接 — 是。

我们不做的加工

只采公开可见内容,不采私域、不采需要额外授权的后台;不承诺情感判断的准确率:AI 标注是辅助,不是结论,分歧样本要人工看;除去重之外不做任何清洗:不改字、不合并近义、不删「无关」样本 —— 那是你的方法学,不是我们的;不提供采集之外的统计分析,导出后进 SPSS、Python 都是你的事

你可能还在找

小红书采集模板、抖音采集模板、让我们代采、开放能力

采集公开数据合规吗?

数小探只采集平台上公开可见的内容,且在你本机以你的账号会话执行,频率受套餐配额约束。数据用途由你负责,建议遵守目标平台的服务条款与研究伦理规范。

教育科研有优惠吗?

高校科研场景请通过「数据服务」页面联系我们,说明用途后我们会给出教育科研方案。

需要写代码吗?

不需要。选应用、填关键词、设定时都是界面操作;导出后的分析用你熟悉的工具即可。