転載記事のcanonicalは効く?別ドメインで元記事を守る手順
自社ブログの記事を、note や業界メディアにも載せたい。でも、転載先のほうが検索で上に出てしまったら困る。——そこで「転載先に元記事を指す canonical を入れてもらえば安心」と考えがちです。
答えを先に書きます。別ドメインをまたぐ canonical そのものは Google がサポートしています。ただし、転載(シンジケーション)の用途では、今は推奨されていません。 転載先を検索結果から確実に外したいなら、転載先ページに noindex を入れてもらうのが一番確かな手段です。それができないときに、canonical・要約転載・公開の時差を順に検討します。
「別ドメインの canonical」は何のための仕組みだったか
Google がクロスドメインの rel="canonical" への対応を発表したのは、2009年の検索セントラル ブログです。想定していた主な場面は、サーバー側でリダイレクトを設定できない環境で、新しいドメインへ引っ越すケースでした。この場合、優先してインデックスしてほしいドメインの URL を、別ドメインをまたいで canonical で指定できる、という説明です。
同じ記事には、運用上の注意もいくつか書かれています。
- canonical はヒントであって絶対的な命令ではない。ただし Google は可能な範囲で従おうとする。
- 2つのページは同一でなくてよいが、似ている必要がある。小さな違いは問題ない。
- 旧サイトのすべての URL をトップページに向けるのは問題を起こしうる。URL ごとに対応させるのが最善。
ここまでは今でも通用する話です。
問題はこの記事の冒頭です。現在、ページの先頭には「この投稿は古くなっている可能性がある」という注記があり、特に rel="canonical" はシンジケートされたコンテンツには推奨されなくなったと明記されています。本文のよくある質問では「配信先が canonical を使うかは当事者同士に任せる」と書かれていますが、その部分は冒頭の注記で上書きされた、と読むのが自然です。
つまり、引っ越しには使える。転載には頼らない。この線引きが出発点です。
なぜ転載では canonical だけに頼れないのか
理由は、canonical の性質にあります。
Google の正規化のドキュメントは、リダイレクトやサイトマップ、rel="canonical" などで希望を伝えられるとしたうえで、Google はサイト側とは異なるページを正規として選ぶことがあると書いています。正規の指定は「ヒントであり、ルールではない」という位置づけです。
自社サイト内の重複なら、ほかのシグナル(内部リンク、サイトマップ、リダイレクト)も自分でそろえられます。ところが転載では、転載先のページは他社の管理下です。内部リンクもサイトマップも、こちらからは触れません。そのため、こちらが望む正規 URL と、Google が選ぶ正規 URL がずれたときに、自社側で打てる手が少ないことがあります。
一方の noindex は性質が違います。noindex のドキュメントによると、Googlebot がページをクロールしてタグかヘッダーを読み取ると、他のサイトからリンクされているかどうかにかかわらず、そのページを Google 検索結果から完全に除外します。ヒントではなく、除外の指示です。
だから、転載先が検索結果に出ること自体を防ぎたいなら、noindex のほうが目的に合います。
転載の手段を優先順に並べた判断表
転載先にお願いできることは、媒体によって違います。上から順に「できるか」を確かめ、できた時点で採用するのが基本の流れです(この優先順位は、上の公式の記述をもとにした当編集部の整理です)。
| 優先 | 手段 | 期待できること | 向いている場面 | 注意点 |
|---|---|---|---|---|
| 1 | 転載先ページに noindex | 転載先が Google 検索結果から外れる | 提携メディアが記事ごとに meta タグを設定できる | 転載先が robots.txt でブロックしていると noindex が読まれない |
| 2 | 転載先ページに元記事を指す canonical | 元記事が正規として選ばれることを期待できる(保証はない) | noindex は断られたが、canonical なら入れてもらえる | ヒントなので、転載先が正規に選ばれることがある。全文がほぼ同じであることが前提 |
| 3 | 要約だけ転載し、全文は元記事へリンク | 転載先と元記事が「同じ内容」になりにくい | note など、タグを自由に設定できない媒体 | 要約が薄いと転載先の読者に価値がない。リンクだけで正規化される保証はない |
| 4 | 元記事を先に公開し、時間をおいて転載 | 元記事が先にクロールされる余地をつくる | どの手段とも組み合わせられる | これだけで転載先が正規に選ばれないとは言えない |
1つめがいちばん確実で、4つめは単独では弱い。表の下に行くほど「効くかもしれない」の度合いが下がる、と考えてください。
canonical を2番目に置いたのは、公式に転載向けとして推奨されなくなったからです。使ってはいけない、という意味ではありません。それでも noindex を断られた場合に、何もしないよりは意図を伝えられる手段として残しています。
転載先のHTMLを確かめる5ステップ
「設定しました」と言われても、実際の出力は確かめておきます。転載先の URL は自社の Search Console のプロパティではないので、URL 検査ツールでは調べられません。ヘルプにも、検査する URL は現在のプロパティ内のものである必要があると書かれています。転載先は HTML を直接見て、自社の元記事は URL 検査ツールで見る、という分担になります。
-
転載先 URL の HTML を取得する。 ブラウザで「ページのソースを表示」を開くか、ターミナルで次を実行します。
curl -sL https://media.example.jp/articles/123 | grep -i -E 'rel="canonical"|name="(robots|googlebot)"' -
noindex の有無を確かめる。
<meta name="robots" content="noindex">(Google だけならname="googlebot")が<head>内に出ていれば OK です。HTTP ヘッダーで指定する媒体もあるので、curl -sIL <転載先URL> | grep -i x-robots-tagも確認します。 -
canonical の向き先を確かめる。 canonical を使う場合は、
hrefが自社の元記事の絶対 URLになっているかを見ます。正規 URL を指定する方法のドキュメントは、相対パスより絶対パスを使うよう勧めています。転載先自身の URL を指す canonical(自己参照)が残っていると、意図と逆の指定になるので要注意です。 -
転載先の robots.txt を確かめる。
https://<転載先ドメイン>/robots.txtを開き、転載記事のパスがブロックされていないかを見ます。noindex のドキュメントは、robots.txt でブロックされているとクローラーが noindex を読めず、ページが検索結果に出ることがあると注意しています。noindex を頼む場合は、ブロックされていないことが前提です。 -
自社の元記事を URL 検査ツールで調べる。 インデックス済みの情報の「Google が選択した正規 URL」が、元記事自身になっているかを確かめます。ヘルプによると、正規 URL はインデックス済みのデータでしか判断できず、ライブテストでは予測できません。転載直後ではなく、転載先がクロールされた頃合いを見て確認します。
5つめで元記事以外の URL が選ばれていたら、判断表の上の手段に切り替えられないかを転載先に相談します。
ワークスルー:ノウハウ記事を2つの媒体に展開する
例として、リフォーム会社の自社ブログで「外壁塗装の見積書の読み方」という記事を公開し、提携している住宅系メディアと note の2か所に展開する場面を通してみます。
提携メディアの場合。 寄稿の条件を決める段階で、転載ページに noindex を入れられるかを確認します。入れられるなら判断表の1を採用。公開後、ステップ1〜4で HTML と robots.txt を確かめます。もし「noindex は媒体の方針で入れられない。canonical なら可能」と返ってきたら、2に下がります。その場合は全文をほぼそのまま載せ、canonical が元記事の絶対 URL を指していることをステップ3で確かめます。
note の場合。 記事ごとに <head> へ任意のタグを書けない媒体では、1も2も使えないことがあります。媒体ごとに設定項目は違うので、ヘルプや設定画面と、実際に出力された HTML の両方で確認してください。使えなければ3の要約転載に切り替え、見積書のチェック項目のうち3つだけを紹介して「全項目の解説は元記事へ」とリンクを置きます。あわせて4のとおり、自社ブログでの公開から間をあけて投稿します。
最後に元記事を確認する。 両方の転載先が公開されてしばらくしたら、ステップ5で自社記事を URL 検査ツールにかけます。「Google が選択した正規 URL」が自社記事なら、この時点では意図どおりです。
この例では、提携メディアは1か2、note は3と4の組み合わせになりました。1つの記事でも、媒体ごとに使える手段が違う。だから判断表は媒体単位で当てはめます。
よくある誤解:「元記事へのリンクがあれば大丈夫」
本文に「この記事は〇〇からの転載です」とリンクを置けば、Google が自動で元記事を優先してくれる、と思われがちです。
正規 URL を指定する方法のドキュメントは、正規化の目的の1つとして、個々の URL が持つリンクなどのシグナルを1つの URL にまとめることを挙げています。リンクは判断材料の1つにはなりえます。ただ、Google がどの URL を正規に選ぶかは複数の要因で決まり、サイト側の希望と違うページが選ばれることもあります。リンク1本で元記事が選ばれる保証はありません。
リンクは読者のために必ず置く。そのうえで、検索結果の扱いは noindex か canonical で別に手当てする。この2つは役割が違います。
転載前の自己点検リスト
転載の依頼を出す前に、次を埋めてみてください。1つでも「わからない」があれば、転載先に確認してから公開します。
- 転載先は、記事ごとに
noindexを設定できるか - できない場合、元記事を指す canonical なら設定できるか
- どちらもできない場合、要約転載に切り替えられるか
- 転載先の robots.txt は、転載記事のパスをブロックしていないか
- 公開後に HTML を確認する担当者と日付を決めたか
- 自社の元記事を URL 検査ツールで確認する日を決めたか
自社サイト内の重複を整理する考え方は 重複コンテンツで本当に問題なのは評価の分散 に、canonical を書いても別の URL が正規に選ばれるときの切り分けは canonicalが効かない原因の切り分け にまとめています。
出典
