这几日我已经逐步完成了我的博客的重新搭建, 熟悉了Markdown的写作流程, 对主题也进行了一些修改, 甚至自学了一下PHP😂. 慢慢的我开始关注起了我的网站在搜索引擎中的索引量...
前提声明我没有学习过任何SEO的知识以下内容只是我在建站过程中的一些探索心得, 我的博客文章并不多, 但基本所有都是原创文章. 但我不是那么的在意访问人数有多少, 只是觉得要是别人遇到的问题我刚好遇到过爬了坑要是别人能在搜索引擎上很快的搜索到我的解决方案, 是不是一切都那么的简单加轻松愉快啦...😊 so 探索吧.
以下优化经验来自于谷歌搜索参考文档
检查已经被搜索引擎索引的页面
在所有搜索引擎中可以在搜索框使用 site:{你的域名} 如 site:nenufm.com 查看当前网站已经被索引的页面. site: 查询是一个搜索运算符,您可以使用它请求来自运算符中指定的特定网域、网址或网址前缀的搜索结果。当然基本所有搜索引擎都会有一个站长后台, 你在这里搜索它也会提示你, 你是否是这个网站的站长,让你进入站长后台进行管理... 站长后台的坑我之后再说.
问题思考
在搜索结果中我发现以下几个在我想法之外的问题.
搜索结果界面包含隐私政策页面
我搜索了以下每个网站都有隐私政策页面, Wordpress也会生成一个/privacy-policy页面, 这是大概是每个网站所必须要求的界面吧. 但是我不希望它出现在我网站搜索结果里面. 我设想了一个场景比如在百度上有人搜索 留声与视 这个关键词出现了一个结果 隐私政策 - 留声与视 我觉得稍微有那么一点诡异.
搜索结果包含分类,标签页面
我不太清楚是因为我的网站文章内容太少,还是我写作的时候喜欢打标签,分类,在我搜索本站的搜索结果中我看到了搜索结果靠后的大量本站的标签页.我认为...🤣 至少现在我觉得, 分类或者标签都是用来用户在站点里面查找同类文章用的, 在搜索结果中往往不太适合. 更多的我希望用户是直接搜索到我博客的具体文章, 而不是搜索了之后跳转到一个拥有很多文章的分类或者是标签. 或许分类确实有用, 等之后文章多起来了我或许会希望它出现在搜索结果中.但现在暂时不用.
搜索优化
对于以上问题我开始的想法是在 robots.txt 直接屏蔽掉有关路径. 但我在谷歌搜索文档中看到以下提示警告
google search docs robots: robots.txt 文件规定了搜索引擎抓取工具可以访问您网站上的哪些网址。 此文件主要用于避免您的网站收到过多请求;它并不是一种阻止 Google 抓取某个网页的机制。若想阻止 Google 访问某个网页,请使用 noindex 禁止将其编入索引,或使用密码保护该网页。
似乎 robots.txt 里面所屏蔽的是直接让搜索引擎不去理解这个目录下面的所有内容, 属于非常强烈激烈的声明, Google的意思robots.txt更像是在爬虫阶段就直接禁止了, 爬虫就会直接中断爬取对应地址的链接. 数据没有进入搜索引擎进行分析. 例如如果我直接在 robots.txt 屏蔽了 /privacy-policy 路径的访问搜索引擎会认为我的网站没有隐私政策页面. 而我希望的只是它不显示在搜索结果里面而已.
这是我原始的 robots.txt
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Sitemap: https://nenufm.com/sitemap.xml在文档中我看到这么一段描述
资源文件: 如果您认为在加载网页时跳过诸如不重要的图片、脚本或样式文件之类的资源不会对网页造成太大影响,您可以使用 robots.txt 文件屏蔽此类资源。不过,如果缺少此类资源会导致 Google 抓取工具更难解读网页,请勿屏蔽此类资源,否则 Google 将无法有效分析有赖于此类资源的网页。
我暂时性的认为在 robots.txt 中屏蔽 主题和插件里面的内容或许不是一个很好的方案. 最后我将robots.txt 文件修改为了这个样子, 只屏蔽了 Wordpress 的后台页面.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://nenufm.com/sitemap.xml建议的优化方案
在 google search docs block-indexing章节中搜索引擎更建议使用 noindex 方案, 其中支持在文档头里面添加 <meta name="robots" content="noindex" /> 或者在http响应头里添加X-Robots-Tag: noindex, 在响应头里添加个人觉得过于复杂. 最后我在分类,标签页中都添加了如下代码. 阻止搜索引擎索引.
<!doctype html>
<html>
<head>
...
<meta name="robots" content="noindex" />
...
</head>
</html>
<meta name="robots" content="noindex, nofollow" />对于隐私页面我在原本我在网上拷贝的备案填写信息中发现了一些配置在 google search docs qualify-outbound-links
<!-- 备案页面声明 希望 Google 不跟踪您网站上的出站链接,或不从您的网站上抓取链接页-->
<a href="https://beian.miit.gov.cn" target="_blank" rel="nofollow noopener">蜀ICP备16022835号-1</a>
<!-- noindex 不索引当前页面, nofollow 不索引出站链接 -->
<a href="https://nenufm.com/privacy-policy" target="_blank" rel="noindex, nofollow">隐私政策</a>对于整个文档我也修改优化了一下 添加了 lang="zh" 声明中文页面, 主打一个别人也有我也要有的原则.😂 印象中好像在哪里看到过对于全球化搜索引擎页面最好声明语言类型.
<!doctype html>
<html lang="zh">
...
</html>2023-10-30 补记
最后我给分类页和标签页加上了 noindex。这些页面仍然保留在博客里,方便读者按主题浏览,也允许搜索引擎继续访问其中的文章链接,但它们本身不再进入搜索结果。
当时站内文章不多,搜索结果里却出现了大量分类和标签页面。它们的内容高度重复,又挤在具体文章前后,对读者没有多少帮助,也会分散原本应该落到文章上的搜索入口。相比彻底禁止爬虫访问,我真正想做的只是让搜索引擎收录文章,而不是把每个分类和标签都当成一个独立结果。
2026 年重新检查:从 WordPress 迁移到 Next.js 之后
几年后,博客已经从 WordPress 迁移到 Next.js,公开文章也有了 75 篇。我原以为站点地图、canonical、robots 和结构化数据都配好了,接下来只要等搜索引擎慢慢收录。实际并非如此:Google Search Console 能看到网站,但真正从搜索获得展示的文章仍然很少;Bing Webmaster Tools 还提醒我,一篇本地 AI 编程文章的搜索摘要太短。
只改被点名的页面很容易,但我更想知道它是不是孤例,于是重新检查了全部公开文章。
摘要要让人知道文章能解决什么
早期文章的摘要有些只有一句泛泛的介绍,有些又长得像正文开头。更麻烦的是,迁移过程中曾经留下两份摘要,同一篇文章在后台看到的是新内容,搜索页面拿到的却可能还是旧版本。
整理后,每篇文章只保留一份公开摘要。技术文章尽量在 120 至 160 个字符内交代三个问题:文章在处理什么、适合谁看、正文能提供什么。这个长度只是写作时的参考,不是必须卡住的考试分数。
生活随笔和诗歌不适合这样处理。它们本来就不是问题解答,硬塞进一段“主题、价值和要点”,读起来只会像宣传文案。这次仍有 6 篇生活文章保留了短摘要,我没有为了让统计数字好看而继续补字。
看起来像标题,不一定真的是标题
页面上的文章标题一直很醒目,我以前也就默认它没有问题。检查网页结构后才发现,视觉上的大字不一定是搜索引擎理解的一级标题;有些正文又重复写了一遍标题,或者把普通章节也写成一级标题。
现在每篇文章只保留一个明确的 H1,下面再按内容使用 H2 和 H3。这个调整对页面外观影响不大,却让文章的主题和章节关系清楚了许多。
旧链接和短文章要逐篇判断
从 WordPress 迁移过来的文章中还留着一些旧地址。它们即使暂时还能跳转,也会让搜索引擎多绕一步,读者复制的还是已经废弃的链接。我把能够确认对应关系的旧链接改成了现在的文章地址。
短文章则不能只看字数。SQL Server 和 Gradle 文章的说明不长,但有完整的样例数据、查询过程和配置代码,它们并不缺内容。另一些文章确实只有一句结论,读者看完仍然不知道怎么操作,我才补上判断步骤、验证方法和容易踩到的边界。
这次整理让我重新划清了一条线:短不等于薄,长也不等于有用。关键还是读者能不能从文章中得到一个完整答案。
搜索控制台的数据不会马上变化
文章整理完并不意味着 Google 或 Bing 会立即重新抓取。搜索控制台里的汇总数字有延迟,“已排除”也不一定代表故障,其中可能包含主动不参与搜索的分类页、标签页、Feed 和旧地址。
相比反复盯着总数,我现在更关心具体页面:它能不能被抓取,canonical 是否正确,是否允许索引,站点地图有没有提交,以及搜索引擎最后选择了哪个版本。把这些问题分开看,才能知道网站是真的有故障,还是还在等待下一次抓取。
首页已经收录,但不代表站名一定能搜到
2026 年 7 月 30 日,我又专门检查了一次首页。Search Console 显示首页已经被 Google 收录,抓取成功,允许索引,Google 选择的 canonical 也是 https://nenufm.com/。站点地图读取成功,人工处置措施和安全问题也都没有异常。
但我直接搜索“留声与视”时,第一页仍然没有首页。Google 更倾向于把这个词理解成声音、影像或影视作品。加上域名搜索“留声与视 nenufm”之后,首页才排在第一条;单独搜索“nenufm”,首页当时排在第二条。
这次检查让我真正分清了收录和排名。收录表示页面已经进入 Google 的系统,不等于它会在每个看似相关的关键词下出现。Google 对搜索过程的说明也把抓取、索引和呈现搜索结果分成了不同阶段。以后再遇到“搜不到”,先检查具体网址的索引状态,再判断是技术故障还是查询匹配问题。
关于页不该和分类页一起 noindex
排查首页时,我发现 /about 一直带着 noindex,也没有进入站点地图。分类页和标签页内容重复,继续保持 noindex 没有问题;关于页不同,它本来就负责说明这个网站是谁、写什么以及为什么存在。
更尴尬的是,关于页还保留着旧的网站简介:“从未如此简单有趣。”这句话放在当年的博客里没什么问题,现在却无法说明网站已经在写 AI、软件开发、互联网见闻和日常生活。
最后我让关于页恢复索引并加入站点地图,删除重复的摘要字段,也重新写了开头和网站简介。现在它先说明“留声与视”是一个个人博客,再介绍作者、写作方向和建站原因。这里没有堆关键词,只是把原本含糊的信息说清楚。
文章里的作者链接应该指向哪里
关于页整理好以后,我又开始琢磨文章标题下面的作者链接。它直接指向 /about,会不会让搜索引擎分不清网站和作者的关系?我一度想改成 /about#联系,让链接直接落到联系方式。
查过文档后发现,重点并不在这个锚点。联系章节说明的是怎样找到作者,不是作者是谁;#联系 也只是把读者带到同一个页面中的某个位置。真正能把文章和作者介绍页明确关联起来的是文章的结构化数据。
Google 明确建议使用 author.url 指向能够唯一说明作者身份的个人介绍页、作者页或 About 页面。Google Article 结构化数据指南中的这条建议对我很重要,因为 /about 原本就同时承担了介绍作者和网站的作用,没有必要再为作者单独造一个页面。
我保留了页面上“作者:太阳”到 /about 的链接,同时在每篇文章的 BlogPosting JSON-LD 中加入作者地址:
{
"author": {
"@type": "Person",
"name": "太阳",
"url": "https://nenufm.com/about"
}
}这样,可见链接负责让读者进入介绍页,author.url 则告诉搜索引擎这个 Person 对应哪个页面。结构化数据中的网站发布者仍然是 Organization,作者仍然是 Person,两者没有混在一起。
中文标题不是越大越清楚
我以前觉得标题越大,主题就越醒目。实际把中文文章放到页面上看,效果正好相反:几十个笔画复杂的汉字使用接近 48 像素的粗黑字体以后,整行更像一块黑色画面,眼睛反而不容易快速认出每个字。
这次把文章主标题控制在约 30 像素,正文二级和三级标题分别控制在约 24 和 20 像素,字重也从特别粗改成普通粗体。关于页还有一处“关于”的重复:顶部导航、面包屑和正文标题连续出现三次。我删掉了一级固定页面里没有实际导航价值的面包屑,只保留当前导航状态和 H1。
这些调整不是为了直接换取搜索排名。H1、H2 和 H3 的结构原本已经正确,变化主要发生在阅读体验上。页面首先要让人愿意读,SEO 才有继续讨论的意义。
总结
本文讨论搜索引擎优化(SEO)探究个人建站在搜索引擎优化方面的一些问题, 参考搜索文档谈谈我自己对网站搜索优化的一些见解. 在过程中学习site,robots,meta noindex 相关技巧对网站进行配置. 之前我安装过 Yoast SEO, All in One SEO 等插件我觉得好像似乎这些插件把 SEO 这个问题给搞复杂了在文档中 Google 也讨论过这个问题. 搜索引擎优化也有它比较适合匹配的点. 但是在小型建站中个人觉得没必要使用那么复杂的优化手段, 比如 在SEO插件中非常看重的关键字标签也就是页面中的 meta keywords 节点, 在搜索引擎的文档中明确说明了只读取标题以及meta description 描述,keywords是毫无作用的.
当然以上只是我个人看法, 也只是参考了一些文档提出一些见解. 刚开始建立网站对于搜索引擎的优化我依旧在学习阶段. 这篇文章我会慢慢更新总结. 本站优化搜索总的目的只有一个要是别人能在搜索引擎上很快的搜索到我的解决方案, 那么愿一切从未如此简单有趣.😸