數位引擎文章

SEO電子報第六十九期 – 2022.11.16~2022.11.30

這期我最喜歡的內容有兩個,分別是第一條Google大方談論他們較為人所知的演算法,官方的整理還是最值得信賴的資料來源。另一個是第五條的AI應用,看到當下有久違的眼睛為之一亮,希望大家也會有一樣感覺!

這期我最喜歡的內容有兩個,分別是第一條Google大方談論他們較為人所知的演算法,官方的整理還是最值得信賴的資料來源。另一個是第五條的AI應用,看到當下有久違的眼睛為之一亮,希望大家也會有一樣感覺!


[官方] 細數Google的排名演算法

Google最近新增了一份文檔,記錄了Google幾個著名的搜尋排名系統 - 包括 BERT、Helpful Content "System"...等等。在同時發布的公告中,Danny說"update"這個字造成很多誤會,例如判斷內容是否有用的系統過去叫做Helpful Content "Update",但當這個系統(system)進行更新(update)時,就會變成 helpful content update update,念起來很繞口,所以以後統一用system來稱呼之。

文檔中列出的著名系統包括以下, 如果有不熟悉的名詞推薦過去看一看介紹! 在最下面的也可以看到幾個已退役(或被併入進現存系統)的著名系統,包括panda system, pagespeed system, etc.

  • BERT
  • Crisis information systems
  • Deduplication systems
  • Exact match domain system
  • Freshness systems
  • Helpful content system
  • Link analysis systems and PageRank
  • Local news systems
  • MUM
  • Neural matching
  • Original content systems
  • Removal-based demotion systems
  • Page experience system
  • Passage ranking system
  • Product reviews system
  • RankBrain
  • Reliable information systems
  • Site diversity system
  • Spam detection systems
Site Diversity System 通常會將子網域與主站視為同一個網站
文中特別強調 PageRank 僅是用來衡量網頁彼此連結的眾多「連結分析系統 (Link Analysis Systems)」之一

連結: Google搜尋排名系統指南 / 相關公告


[新聞] GSC新增Shopping Tab Listings功能

在GSC中的「Shopping」區,符合資格的網站將會在接下來幾週開始陸續看到一個新的「Shopping tab listing」,可以透過這裡註冊Merchant Center帳號。完成這個步驟,商家就無需提交產品feed,僅需確保網頁上的商品結構化資料保持更新狀態,就能讓產品出現在Shopping tab (shopping.google.com)上。

根據幫助文檔中的說明,符合資格的定義是當Google偵測到產品結構化資料,並認定網站是個販售實體商品的網站。

新的 Shopping Tab Listings 讓站長能輕易註冊 Merchant Center 帳號並讓商品出現在 Shopping Tab 中
已有 Merchant Center 帳號的畫面

連結: 公告 / GSC中的新報表 - Merchant Listings


[摘要] SMX Next訪談Google搜尋VP

本次SMX Next邀請到 HJ (a.k.a. Hyung-Jin Kim, VP Search at Google) 擔任主講嘉賓。分享主題是【What’s now and next with Google Search: Algorithm updates, E-A-T, and more】,筆者摘選以下重點分享給大家。

圖片: Hyung-Jin Kim 為 SMX Next 2022 主講嘉賓,與談人為 Barry Schwartz

第一點:「E-A-T 原則」(Expertise, Authoritativeness, and Trustworthiness) 適用於所有搜尋情境
大家常把 E-A-T 原則跟 YMYL 內容(your money, your life)放在一起談,甚至Google官方的《搜尋引擎評量指南》都特別表明了兩者的關聯性,但 HJ 告訴我們 E-A-T 原則廣泛地被應用在所有搜尋情境和搜尋字詞。這不難理解,不僅是健康或醫療領域,幾乎所有產業都能以專業性(Expertise)、權威性(Authoritativeness),和可信度(Trustworthiness)三項指標來評斷網站的內容能否幫助到使用者。

E-A-T在2014年被寫進《搜尋引擎評量指南》,到了2018年開始被廣泛討論,但Google從2009年左右就已經將它應用在搜尋引擎上了!

第二點:搜尋品質團隊 (Search Quality team) 也會「感情用事」
搜尋品質團隊 (Google 內專門研究、調整搜尋結果排名的部門) 平時非常依賴資料、各項指標,還有各種新技術來優化排名系統。但他們有時也要站在使用者的角度,進行主觀的調整。

第三點:「第一手資料」或「第一手使用經驗」在一篇好內容中扮演著關鍵角色。
雖然講座中還有很多很棒的takeways,但筆者仍想再次強調原生內容和優質內容的重要性,這也是近幾次評論演算法更新的一大重點。 HJ 以他自身為例,如果他今天想找一個新的網球拍,他期望看到網友「真的花時間使用並實測產品」後的內容分享,而非「蒐集其他網頁上的資訊拼湊成一篇、最後憑空下總結」的內容。

除了以上三點,其中還有滿多小知識值得一聽(例如Google在這幾年如何在終極目標不變的情況下更新許多新的技術如BERT),可以看看這篇SEL(SMX主辦單位)自己整理的重點摘要,或是直接線上觀看完整講座(需註冊),本講座沒有任何簡報,可以當Podcast聽。

連結:SEL整理7大重點摘要 / SMX Next 2022所有議程 / 延伸閱讀:熊貓演算法走入歷史,進化為浣熊演算法


[分享] 四種網站連結(Sitelinks)的呈現方式

Sitelinks 是影響搜尋外觀很大的加分項,Brodie Clark整理了四種Sitelinks,版面最大的通常會因搜尋品牌名稱而出現,使用者能透過連結到訪站內其他頁面:

圖:Internal Sitelinks (Branded)案例

Jump-To Sitelinks 則需要透過埋設文字錨點,來讓Google產生連結,使用者能透過連結到同頁面上的其他段落:

圖:文字錨點

筆者將此四種Sitelinks整理製表成下圖,較簡單明瞭:

圖:四種Sitelinks及其因素統整

比較特別的是Scroll-To Sitelinks,它幾乎是靠搜尋引擎自己去了解文意,並針對搜尋字詞產生合適的連結,點擊後即可跳至該頁相關內容位置。Scroll-To Sitelinks的url語法就是chrome反白文字右鍵的「複製醒目顯示文字的連結」,但筆者試了幾則都沒遇到,如果有讀者遇到這種sitelink,可以到slack群跟大家分享!

連結:原推文


[工具] 使用GPT-3找出內容題材 (+免費Google Sheet模板)

相信大家對於AI的各種工具可能會有些疲乏,但這次的應用真的相當聰明,是之前沒有考慮過的角度。流程要看下面這個影片會比較清楚,但概念上來說就是 (1.)下載GSC資料;(2.) 找出網站的文章,以及其排名的關鍵字;(3.) 爬出每篇文章的標題;(4.) 將標題與排名字用GPT-3的模型做比較,判斷相關性分數;(5.) 推薦一個文章大綱。

按照這個思路,若相關性分數低,那可能代表有機會為該關鍵字寫一篇專門的內容,或將原本的文章以該關鍵字做個延伸。

示意: 腳本判斷出該篇文章中雖然在"how long should i run to lose weight"這個字有排名,但與標題的相關性不高
示意: GPT-3的腳本會接著提議一個針對該關鍵字的文章大綱

連結: 文章介紹 / Twitter討論串&影片介紹


[好文] SEO指標和報告心法

作者將SEO常用到的指標,從與商業利益最遙遠的技術面指標(technical metrics),到老闆們愛看的流量與營收指標(traffic & revenue metrics),分為四大類。文章中另外講述了不同種類的指標所適合的族群,SEO人員在報告時應該根據受眾的不同而選擇不同的指標,並且不要預期不同指標種類的關係顯而易見。

SEO的指標分類

文章的後段列了幾個在分析數據時可以自省的問題,以及在組織中做報告的原則。篇幅不長,但卻是很值得參考的思路和框架,推薦給大家!

連結: 原文


[研究] JS網站需要將近9倍的時間才能被Google完全抓取

我們都知道 Google 能爬取 JavaScript (JS) 生成的網頁,但爬取的情況跟純HTML網頁相同嗎?有沒有時間差異?國外一間公司Onely做了這項實驗,結果顯示,純HTML網站,相較於JS生成的網站,被Google抓取的速度差了將近9倍。

圖:HTML花了36小時爬取完畢;JS花了313小時,差了快要9倍。

實驗方法大致如下,首先創了兩套頁面 (純HTML & JS生成內容),每一套從第一頁開始會分別在內容中插入連到第二頁的文字連結,透過這種方式接續連到第七頁,唯一差別是第二套網站的內容和連結都是由JS產生。作者想以此方式了解Google對於不同生成網頁方式的爬取時長。

這個實驗簡單但周詳,儘管Google曾說過JS的渲染通常可以在5秒內完成,但這次的實驗認為若網站倚賴JS來生成內容&連結,那將大大降低網頁被抓取的速度,因此JS還是應該考慮使用server side rendering等技術。

連結:研究原文


[工具] 辨識內容是否為AI生成的3項工具

過去介紹過不少AI生成內容的工具和應用 (例如: 寫手怎麼38秒內生出文章),這次換個角度,介紹怎麼判斷一段內容是否為AI所生成。

原文由 Glenn Gabe 所分享三個AI文章辨識工具 - Writer’s AI content detector tool, GPT-2 Output Detector Demo, Giant Language Model Test Room (GLTR.io)

前兩個工具非常直覺,輸入一段文字並按下分析,就會跳出一個分數,代表內容為真人撰寫的機率有多高。

圖:筆者拿了 Glenn Gabe 自己的文章第一段來測試

第三個GLTR.io相較複雜些,雖也是一鍵分析,但有提供比對細節。從結果可以看到文字呈現不同顏色的網底。每個字詞比對前一個字,若該字詞很容易依據前一字詞就被預測出來,即顯示為綠色,依序依照能被預測出來的機率分別顯示綠>黃>紅>紫,藉此判斷該文章為AI生成的機率有多高。此網站上還有依據不同演算法生成範例文字,以及紐約時報等真人文章供測試,很好玩。

圖:GLTR 的介面

以上工具僅供參考,並不是測出來AI成份低就會取得好排名(反之亦然),若大家用AI工具輔助內容產出,記得還是要人工再次校閱。

連結:Glenn原文


[影片] 將20年老網站轉移至React

在 YouTube 查看原始影片

這個影片裡Martin請來了一位來賓(Roxana Stingu),分享將有一個近3億網頁的20年老網站,搬遷至React+SPA (single page application)框架的過程以及過程中遇到的問題。

分享者遇到的問題是在某些網頁上,Googlebot看到的和使用者在瀏覽器上看到的結果不同,他們嘗試控制可能的變因(ex: 切換user-agent、換瀏覽器...等),都看到不同結果,最後才發現網頁可能根據瀏覽器的cookies內容而改動。Martin說雖然不常見(cookies通常用在較無關痛癢的內容上,ex:「已看過的內容」),但的確是有趣的

對於這種規模和複雜程度的網站變動,原本預期有更棘手的狀況和分享,可惜影片中並沒有進一步分享,但cookies也值得筆記的一個檢查方向。


[摘要] 關於Redirect的兩三事

在 YouTube 查看原始影片

這集Podcast由John和Martin兩人聊Redirect (轉址),其中有幾個比較不常聽到的觀念值得筆記。

1.) Martin提到301/302除了本質概念上的差異,也會在實務上影響瀏覽器的行為,例如大部分的瀏覽器都會cache 301的紀錄

2.) 301/302與308/307的差異在於後者可以用在post request的轉址 (例如API),但其差異對SEO並不重要,要永久轉址的話使用307或308都可以。

3.) 如果只是換網域這種類型的變化,那非常簡單,Google很快就可以知道發生了什麼事;但若為網站合併或分割這種複雜的變動,那儘管轉址有做好也不要訝異看到很大的波動。

4.) GSC中的網址檢測工具,會顯示最終網址的狀態,很多人反映這相當令人困惑,John也承認的確如此,尤其對於要測試轉址是否成功的人來說。

連結: 逐字稿


現在的世界有一個角落在白紙革命、另一個角落在世足大賽,想想還真是五味雜陳