從搜尋引擎到 RAG:重新理解資訊檢索
從早期研究搜尋引擎的挫折,到用 RAG 重新接觸文件拆分、查詢改寫與重排序,這是一則把 AI 學習連回資訊檢索的個人記錄。
把適合長期保存的社群內容整理成可閱讀、可搜尋、也能繼續更新的筆記。
從早期研究搜尋引擎的挫折,到用 RAG 重新接觸文件拆分、查詢改寫與重排序,這是一則把 AI 學習連回資訊檢索的個人記錄。
一則比較偏個人的記錄,談 AI 帶來的不安、朋友分享工具的影響,以及真正開始動手理解之後心態如何改變。
一則記錄電商產品描述實驗的社群貼文,從提示詞、範例學習到 LoRA 微調,整理出不同方法的成本與控制力。
整理一份 2023 年的技術 SEO 問題清單,並把轉址、圖片替代文字、速度、標題、內部連結與索引等問題放回實際優化順序中。
保存一則關於 cloaking 的 SEO 實驗摘要,重點不在模仿黑帽手法,而在理解實驗變因、流量變化與不能過度解讀的因果關係。
保存 2023 年記錄 Core Web Vitals 指標轉換的說明,從使用者互動到下一個畫面繪製,理解 INP 想測量的體驗問題。
一則記錄 ChatGPT 開始普及後,如何用自然語言產生瀏覽器書籤工具的社群貼文,並連回網站既有的 Bookmarklet 文章。
整理 ChatGPT 普及初期的 SEO 使用案例,從提示詞、技術 SEO、內容分析到跨語言閱讀,保留當時工具生態剛開始變化的觀察。
摘要一篇電商分類頁優化文章的重點,說明 PLP 不應為了 SEO 堆疊無關文字,而要用內容、導覽與測試一起服務購買決策。
保存一份以 Search Console 網址檢查工具確認 JavaScript 內容是否被渲染的實務筆記,並連回搜尋引擎抓取與索引的基礎文章。
從「已檢索但尚未建立索引」的案例出發,提醒索引問題不一定只發生在單一網址,也可能與整個網站的品質與結構有關。
整理網址結尾斜線、HTTP/HTTPS、www 與非 www 版本的差異,並說明 canonical、轉址、內部連結與 sitemap 應該共同指向同一版本。
從電商空白分類頁的討論出發,整理 noindex 與 soft 404 的差異,以及內容、內部連結和商品變化如何成為重新檢查的訊號。
保存 2021 年 Core Web Vitals 上線前整理的官方問答,聚焦 LCP、FID、CLS 的資料計算方式與排名影響邊界。
整理 Search Console 檢索統計資料中的發現與重新整理概念,將爬蟲行為連回 sitemap、重複網址與網站被植入頁面的排查。
保存一則工作案例,說明 Dynamic Serving 依 User-Agent 回傳不同 HTML 時,為什麼 HTTP 的 Vary: User-Agent 可能成為重要的快取訊號。
一則把 prefetch、使用者行為資料與機器學習放在一起討論的歷史筆記,重點是預取應該建立在機率與成本的平衡上。
保存 Google 20 週年時對搜尋未來的三個觀察:從單一答案走向搜尋旅程、從查詢走向主動探索,以及從文字走向更視覺化的資訊發現。
重新整理圖片替代文字的正確用途,說明 alt text 同時服務可及性、內容理解與圖片搜尋,而不是把關鍵字塞進每一張圖片。
一則從購物流程出發的分析筆記,說明如何把轉換流程拆成步驟,再用流失位置找出最值得優化的頁面。
2018 年的一則基礎觀念分享,從加密、資料完整性與伺服器驗證三個角度說明為什麼整個網站都應該使用 HTTPS。
用一個簡化的網頁請求流程,理解 Request Headers、Response Headers 與 2XX、3XX、4XX、5XX 狀態碼如何描述資源的結果。
保存一則早期觀察:Google 可能從頁面其他內容拼湊搜尋結果摘要,並說明 meta description 應該和頁面實際內容一起規劃。