文本处理 本地计算 开箱即用 内置示例 不留痕迹

Markdown 字数统计

统计 Markdown 文稿:总字符、去格式正文字数(汉字 + 英文单词)、标题/链接/图片/代码块/列表项/引用/表格行数量,并按 300 字每分钟估算阅读时长。写公众号、博客投稿字数校对都适用。

写公众号、博客投稿或论文时,字数要求常是硬指标且口径各不相同:有的按「正文字数」算(汉字数与英文单词数相加),有的按字符数算(含标点与空格)。这个工具统计时剔除 Markdown 格式标记(井号、星号、链接方括号等),只计真正的正文,同时给出标题、链接、图片、代码块、列表项等结构元素数量。

需要注意「字数」与「字符数」不是一回事:字数按中文一个字、英文一个词计,字符数把每个字母、标点与空格都算 1,不少平台的字数上限用的是字符数。阅读时长按 300 字每分钟估算,仅作参考,实际取决于内容难度。

使用步骤

  1. 粘贴 Markdown 原文,统计实时更新,无需点按钮。
  2. 看「去格式正文字数」确认是否符合投稿要求,再对照结构元素统计检查排版完整性。
  3. 严格卡平台限制时以字符数为准;算稿费或作业字数时以正文汉字加英文单词数为准。
  4. 与 Word 统计不一致时,先确认对比口径是否相同(是否含标点、是否含代码块)。

计算原理与示例

正文字数怎么统计

粘贴 Markdown 原文即可实时统计;正文字数会剔除 #、**、[]() 等格式标记,只计汉字与英文单词。

阅读时长怎么估算

阅读时长按混合 300 字每分钟估算,不足 1 分钟记 1 分钟。

代码块怎么处理

代码块内容不计入正文字数,但会单独统计代码块与行内代码的数量。

代码示例

JavaScript 剥掉格式标记后再计数

// 粗口径:先去掉常见 Markdown 标记,再按中文单字与英文单词计数
const stripMd = (s) => s
  .replace(/```[\s\S]*?```/g, '')          // 围栏代码块
  .replace(/`[^`]*`/g, '')                  // 行内代码
  .replace(/!?\[[^\]]*\]\([^)]*\)/g, '')  // 链接与图片
  .replace(/^\s{0,3}#{1,6}\s+/gm, '')       // 标题标记
  .replace(/[*_~>|-]/g, '');                // 强调与列表符号

const count = (s) => {
  const t = stripMd(s);
  const cn = (t.match(/[\u4e00-\u9fa5]/g) || []).length;
  const en = (t.match(/[A-Za-z]+/g) || []).length;
  return cn + en;
};

count('# 标题\n\n正文 **加粗** 内容');

Shell 批量核对多篇稿件

# 统计目录下每篇 md 的汉字数与英文词数
for f in posts/*.md; do
  cn=$(grep -o '[\u4e00-\u9fa5]' "$f" | wc -l | tr -d ' ')
  en=$(grep -oE '[A-Za-z]+' "$f" | wc -l | tr -d ' ')
  printf "%-30s 汉字 %5s  英文词 %5s\n" "$(basename "$f")" "$cn" "$en"
done

常见问题

为什么和 Word 统计的字数不一样?

Word 统计的是所有字符(含格式符号),这里统计的是去掉 Markdown 标记后的正文(汉字数 + 英文单词数)。投稿字数要求一般按正文算,更接近平台审核口径。

表格和代码块怎么算?

表格行的 | 分隔符不计入正文,但表格行数会单独统计;围栏代码块(```)的内容不计入正文字数,行内代码只统计数量。

支持哪些 Markdown 语法识别?

识别 # 标题、[文字](链接)、![]() 图片、**加粗**、*斜体*、~~删除线~~、> 引用、- 列表、| 表格、``` 代码块和 `行内代码`。

Markdown 正文字数怎么统计才准确?

应先把语法符号剥离:去掉 #、*、反引号、[]() 等标记,去掉代码块和 URL,再统计汉字与英文单词,这样得到的是「正文净字数」。稿费、平台原创字数都按这个口径算更合理。

公众号文章多少字合适?

常见经验值是 1200~2500 字:太短信息量不足,太长完读率会下降。1500 字左右按每分钟 300 字约需 5 分钟读完,适合通勤场景阅读。具体仍以账号定位和读者习惯为准。

代码块和链接为什么通常不计入正文字数?

因为它们不属于叙述性正文。稿费、平台原创字数、阅读时长估算都只关心正文内容,而代码块和长 URL 会显著虚高字数。本工具会单独列出代码块、链接、图片的数量,方便你核对。

阅读时长是怎么估算的?

按每分钟 300 个「阅读字数」(汉字 + 英文单词)估算,这是中文默读的常见经验值;朗读或演讲语速约每分钟 180~200 字,比默读慢。含大量代码或表格的文章实际阅读时间会更长。

延伸阅读

来自本站原创文章,讲清这个工具背后的算法与口径。