數位引擎筆記 · Facebook 保存

從搜尋引擎到 RAG:重新理解資訊檢索

從早期研究搜尋引擎的挫折,到用 RAG 重新接觸文件拆分、查詢改寫與重排序,這是一則把 AI 學習連回資訊檢索的個人記錄。

來源註記

這篇內容保留 Facebook 貼文的原始脈絡,部分工具、介面與外部連結可能已經改變。

這則貼文記錄我重新接觸資訊檢索的過程。

早期曾經因為覺得搜尋引擎的技術知識太龐大而放棄深入研究,後來開始用大型語言模型實作 RAG,才重新遇到文件拆分、查詢改寫與重排序等問題。

這些名詞不是 RAG 才突然出現的新技術,而是搜尋與資訊檢索長期累積的問題,在新的應用場景中重新被看見。

這也和網站既有的 Passage Retrieval 文章形成一個很好的前後呼應:一邊是搜尋結果如何理解文件中的段落,另一邊是應用程式如何把文件整理成可以被模型檢索的知識。

原始貼文也提到 Jeff Dean 分享的早期 Google Search 演講,以及一份由 AI 協助整理的摘要。

這裡保存的是學習脈絡,不把原始摘要當成今日搜尋引擎或 RAG 系統的完整技術規格。

Keep exploring

延伸閱讀

網站文章

片段資訊檢索(Passage Retrieval)介紹

Google的片段資訊檢索,應用在全球每種語言的搜尋上,影響約7%的搜尋結果。究竟改了什麼,SEO該如何應對,歡迎閱讀。

網站文章

SEO搜尋引擎原理 - 爬蟲抓取篇

檢索是搜尋引擎的第一步,爬蟲有個網址,前去拜訪,然後發現更多的網址,如此循環下去。看似簡單的過程卻有很多的SEO細節。

網站文章

SEO電子報第五十九期 – 2022.06.16~2022.06.30

在整理這期電子報時,有相當多看到為之一亮的內容,尤其推薦information gain, screaming frog on cloud, 和SEO技能樹,希望大家在讀的時候跟我有一樣的感覺! 如果沒有特別受到啟發,一定是我摘要的不夠好,推薦找個時間閱讀原文~