外贸独立站上线后最尴尬的情况是:网站做好了,Google 却像不知道它存在。问题往往不在内容质量,而在技术层没给爬虫留路。下面这份清单按三个阶段排列,每一项都可以直接对照勾选。

一、上线前:让爬虫进得来

1. robots.txt 别挡住自己

最常见的自伤是测试期写了 Disallow: /,上线忘了删。检查方式很简单:

1
curl -s https://你的域名/robots.txt

内容应该是显式放行、并指向 sitemap:

1
2
3
4
User-agent: *
Allow: /

Sitemap: https://你的域名/sitemap.xml

如果你想被 AI 搜索引擎引用,还需要显式放行 AI 检索爬虫(见后文第 19 项)。

2. 确认没有 noindex 漏网

noindexDisallow 更隐蔽——页面能抓取但不进索引。上线前在源码里搜一遍:

1
grep -r "noindex" public/

只允许确实不想被收录的页面(后台、搜索结果页、薄内容页)带这个标记。

3. sitemap.xml 要能生成且内容正确

静态站点常见错误是 sitemap 里全是首页。检查条目数是否与文章数接近:

1
curl -s https://你的域名/sitemap.xml | grep -c "<loc>"

4. canonical 指向自己

每个页面都应该有唯一且自指的 canonical:

1
<link rel="canonical" href="https://你的域名/当前页面路径/">

分页页、带参数页(?utm_source=...)尤其要小心——它们的 canonical 应指向规范版本,避免同一内容被算成多份。

5. URL 结构定下来就别再改

改 URL 等于把已有的收录和权重全部推倒。新站上线前是唯一零成本决定 URL 的时机。建议:

做法 评价
/产品名/ 短横线分隔英文 ✅ 推荐
/post/12345.html 纯数字 ⚠️ 能收录但无关键词信号
/产品名-中文/ 中文路径 ⚠️ 可用,分享时会被转义成一长串
同一内容两个 URL ❌ 典型重复内容

6. 移动端可用

Google 早已是移动优先索引。用手机真机点一遍,重点看:字号是否要放大才能读、按钮是否点得中、有没有横向滚动条。

二、上线时:把信号交出去

7. 提交 sitemap 到 Search Console

这是最高优先级的一步。进入 Search Console → 左侧「Sitemaps」→ 输入 sitemap.xml → 提交。提交后 24 小时内一般能看到「已发现网址数」。

8. 用 URL 检查工具手动催一次

新站等自然抓取可能要好几天。在 Search Console 顶部搜索框粘贴首页 URL → 回车 → 点「请求编入索引」。每天有配额,优先催首页和栏目页。

9. 验证 www 与非 www 只有一个是主域

https://example.comhttps://www.example.com 必须 301 到同一个。否则权重被劈成两半。

10. HTTP 强制跳 HTTPS

1
2
3
4
5
server {
listen 80;
server_name example.com;
return 301 https://example.com$request_uri;
}

11. 404 真的返回 404

不少单页应用会把不存在的路径返回 200 + 首页内容。这会让 Google 把无穷多个 URL 当成有效页面。检查:

1
curl -s -o /dev/null -w "%{http_code}\n" https://你的域名/不存在的页面

期望输出 404

12. 页面速度:先解决三件事

不必追求满分,先把最大的三块处理掉:

  1. 图片:压缩 + 转 WebP + 写上宽高(防布局跳动)
  2. 首屏字体:用 font-display: swap
  3. 第三方脚本:统计、客服、广告一律加 deferasync

三、上线后:内容与持续运营

13. 每页一个主关键词,写进 title 前 30 字

title 是权重最高的页面级信号。公式:

1
主关键词 - 修饰词 | 品牌名

长度控制在 60 字符内(中文约 30 字),超出会被截断。

14. description 不是排名因素,但决定点击率

它不参与排名,但会显示在搜索结果里。写成一句完整的话,包含主关键词 + 一个行动理由,长度 120–155 字符。

15. 一篇内容只解决一个问题

外贸站最容易犯的错是把「注册 + 下载 + 使用 + 收款」塞进一篇文章。搜索引擎无法判断这篇到底该排哪个词,读者也找不到重点。拆成多篇,互相内链

16. 内链要有描述性锚文本

不要用「点击这里」。用「关键词调研的完整流程」这类能说明目标页主题的锚文本。

17. 结构化数据补全

至少给文章页补 ArticleBlogPosting,字段包含:

  • headline / description
  • datePublished / dateModified
  • author / publisher
  • image(1200×630 的 PNG/JPG)
  • mainEntityOfPage

用 Google 的 Rich Results Test 验证一遍,别让 JSON 里留语法错误——一个逗号就能让整块结构化数据失效。

18. 图片 alt 写人话

alt="图片[1]-首页-网站名" 这种自动生成的 alt 没有任何信息量。写成对图片内容的客观描述,兼顾无障碍与图片搜索。

19. 放行 AI 检索爬虫

如果你希望内容被 ChatGPT、Claude、Perplexity 引用,robots.txt 里显式放行:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

注意:放行只是必要条件。如果你的站点挂在 Cloudflare 后面,还要回面板确认没在挑战这些爬虫——它们在边缘被拦下的话,robots.txt 写得再对也没用,因为它们根本读不到。

20. 监测收录而不是只盯排名

前 3 个月重点看两个指标:

  • 已编入索引的页面数:应该逐步接近你提交的 URL 数
  • 覆盖率报告里的「已发现 – 尚未编入索引」:长期居高不下说明抓取预算被浪费在低质量页面上

21. 清掉重复与薄内容

这是新站最容易忽略的一步。典型来源:

  • 每个标签、每个分类都生成了独立页面,而其中很多只有一两篇文章
  • 站内搜索结果的每一组参数都生成了可访问 URL
  • 同一篇内容因为迁移产生了两份

处理原则是不要直接删(会产生 404),而是:

1
2
seo_noindex: true
sitemap: false

保留 URL 可访问性,同时让它退出索引。

小结

按投入产出比排序,新站最该先做的四件事是:

  1. 提交 sitemap + 手动请求收录
  2. 清掉薄内容页的索引
  3. 每页写对 title / description
  4. 补结构化数据

这四件做完,通常两到四周内就能看到第一批自然搜索曝光。