Markdown 字数统计
统计 Markdown 文稿:总字符、去格式正文字数(汉字 + 英文单词)、标题/链接/图片/代码块/列表项/引用/表格行数量,并按 300 字每分钟估算阅读时长。写公众号、博客投稿字数校对都适用。
写公众号、博客投稿或论文时,字数要求常是硬指标且口径各不相同:有的按「正文字数」算(汉字数与英文单词数相加),有的按字符数算(含标点与空格)。这个工具统计时剔除 Markdown 格式标记(井号、星号、链接方括号等),只计真正的正文,同时给出标题、链接、图片、代码块、列表项等结构元素数量。
需要注意「字数」与「字符数」不是一回事:字数按中文一个字、英文一个词计,字符数把每个字母、标点与空格都算 1,不少平台的字数上限用的是字符数。阅读时长按 300 字每分钟估算,仅作参考,实际取决于内容难度。
- —
- —
- —
- —
- —
- —
- —
- —
- —
- —
- —
- —
- —
这个工具解决你的问题了吗?
提交后会把工具名、你的输入与当前结果发送到服务器;请勿填写身份证号、手机号等隐私信息。
AI 助手 会结合你当前的输入与结果回答
追问会再次把当前输入与结果发送到服务器;请勿填写隐私信息。
使用步骤
- 粘贴 Markdown 原文,统计实时更新,无需点按钮。
- 看「去格式正文字数」确认是否符合投稿要求,再对照结构元素统计检查排版完整性。
- 严格卡平台限制时以字符数为准;算稿费或作业字数时以正文汉字加英文单词数为准。
- 与 Word 统计不一致时,先确认对比口径是否相同(是否含标点、是否含代码块)。
计算原理与示例
正文字数怎么统计
粘贴 Markdown 原文即可实时统计;正文字数会剔除 #、**、[]() 等格式标记,只计汉字与英文单词。
阅读时长怎么估算
阅读时长按混合 300 字每分钟估算,不足 1 分钟记 1 分钟。
代码块怎么处理
代码块内容不计入正文字数,但会单独统计代码块与行内代码的数量。
代码示例
JavaScript 剥掉格式标记后再计数
// 粗口径:先去掉常见 Markdown 标记,再按中文单字与英文单词计数
const stripMd = (s) => s
.replace(/```[\s\S]*?```/g, '') // 围栏代码块
.replace(/`[^`]*`/g, '') // 行内代码
.replace(/!?\[[^\]]*\]\([^)]*\)/g, '') // 链接与图片
.replace(/^\s{0,3}#{1,6}\s+/gm, '') // 标题标记
.replace(/[*_~>|-]/g, ''); // 强调与列表符号
const count = (s) => {
const t = stripMd(s);
const cn = (t.match(/[\u4e00-\u9fa5]/g) || []).length;
const en = (t.match(/[A-Za-z]+/g) || []).length;
return cn + en;
};
count('# 标题\n\n正文 **加粗** 内容');
Shell 批量核对多篇稿件
# 统计目录下每篇 md 的汉字数与英文词数
for f in posts/*.md; do
cn=$(grep -o '[\u4e00-\u9fa5]' "$f" | wc -l | tr -d ' ')
en=$(grep -oE '[A-Za-z]+' "$f" | wc -l | tr -d ' ')
printf "%-30s 汉字 %5s 英文词 %5s\n" "$(basename "$f")" "$cn" "$en"
done
常见问题
为什么和 Word 统计的字数不一样?
Word 统计的是所有字符(含格式符号),这里统计的是去掉 Markdown 标记后的正文(汉字数 + 英文单词数)。投稿字数要求一般按正文算,更接近平台审核口径。
表格和代码块怎么算?
表格行的 | 分隔符不计入正文,但表格行数会单独统计;围栏代码块(```)的内容不计入正文字数,行内代码只统计数量。
支持哪些 Markdown 语法识别?
识别 # 标题、[文字](链接)、![]() 图片、**加粗**、*斜体*、~~删除线~~、> 引用、- 列表、| 表格、``` 代码块和 `行内代码`。
Markdown 正文字数怎么统计才准确?
应先把语法符号剥离:去掉 #、*、反引号、[]() 等标记,去掉代码块和 URL,再统计汉字与英文单词,这样得到的是「正文净字数」。稿费、平台原创字数都按这个口径算更合理。
公众号文章多少字合适?
常见经验值是 1200~2500 字:太短信息量不足,太长完读率会下降。1500 字左右按每分钟 300 字约需 5 分钟读完,适合通勤场景阅读。具体仍以账号定位和读者习惯为准。
代码块和链接为什么通常不计入正文字数?
因为它们不属于叙述性正文。稿费、平台原创字数、阅读时长估算都只关心正文内容,而代码块和长 URL 会显著虚高字数。本工具会单独列出代码块、链接、图片的数量,方便你核对。
阅读时长是怎么估算的?
按每分钟 300 个「阅读字数」(汉字 + 英文单词)估算,这是中文默读的常见经验值;朗读或演讲语速约每分钟 180~200 字,比默读慢。含大量代码或表格的文章实际阅读时间会更长。
延伸阅读
来自本站原创文章,讲清这个工具背后的算法与口径。