Skip to content

LLM Wiki

一種使用 LLM 建構個人知識庫的模式。

這是一份想法文件,設計為可直接複製貼上到你的 LLM Agent(例如 OpenAI Codex、Claude Code、OpenCode / Pi 等)。它的目標是傳達高層次的概念,實際的具體實作將由你的 Agent 與你合作完成。

核心想法

大多數人使用 LLM 處理文件的方式是 RAG:你上傳一組文件,LLM 在查詢時檢索相關片段,然後生成答案。這種做法可行,但 LLM 每次都在從零開始重新發現知識——沒有累積。當你問一個需要綜合五份文件的微妙問題時,LLM 每次都要重新尋找和拼湊相關片段。沒有什麼東西被建立起來。NotebookLM、ChatGPT 檔案上傳、以及大多數 RAG 系統都是這樣運作的。

這裡的想法不同。與其只在查詢時從原始文件中檢索,LLM 增量地建立並維護一份持續存在的維基——一份結構化、互相連結的 Markdown 文件集,位於你和原始資料之間。當你加入新的資料來源時,LLM 不只將其索引以供後續檢索——它會讀取資料、提取關鍵資訊,並將其整合到現有的維基中——更新實體頁面、修訂主題摘要、記錄新資料與舊主張之間的矛盾、強化或挑戰持續演進的綜述。知識被編譯一次,然後保持更新,而不是每次查詢時重新推導。

這是關鍵的區別:維基是一份持久、複利增長的產物。 交叉引用已經存在。矛盾已經被標記。綜述已經反映了你讀過的所有內容。你加入的每份資料和提出的每個問題都會讓維基變得更加豐富。

你永遠(或幾乎不)親自撰寫維基——LLM 負責撰寫和維護一切。你負責策展、探索、提出對的問題。LLM 做所有苦工——總結、交叉引用、歸檔、簿記——這些讓知識庫隨著時間變得真正有用的工作。實際上,我一邊開著 LLM Agent,一邊開著 Obsidian。LLM 根據我們的對話進行編輯,我即時瀏覽結果——跟隨連結、檢查圖譜檢視、閱讀更新後的頁面。Obsidian 是 IDE,LLM 是程式設計師,維基是程式碼庫。

這個模式可以應用在許多不同的場景。幾個例子:

  • 個人:追蹤自己的目標、健康、心理、自我提升——歸檔日記、文章、播客筆記,隨著時間建構出關於自己的結構化圖像。
  • 研究:在數週或數月內深入研究一個主題——閱讀論文、文章、報告,增量地建構一份包含持續演化論點的全面維基。
  • 讀書:逐章歸檔,為角色、主題、情節線及其關聯建構頁面。到最後你會擁有豐富的伴讀維基。想像一下像 Tolkien Gateway 這樣的粉絲維基——由志願者社群多年建立的數千個相互連結的頁面,涵蓋角色、地點、事件、語言。你可以邊閱讀邊為自己建立這樣的東西,由 LLM 完成所有交叉引用和維護工作。
  • 商業/團隊:由 LLM 維護的內部維基,由 Slack 對話、會議記錄、專案文件、客戶通話餵養。可能有人類在 loop 中審查更新。維基保持更新,因為 LLM 做了團隊中沒有人想做的維護工作。
  • 競爭分析、盡職調查、旅遊規劃、課程筆記、興趣深入探索——任何需要隨著時間累積知識並將其組織起來而非散落的場景。

架構

共有三層:

原始資料(Raw Sources)——你策展的來源文件收藏。文章、論文、圖片、數據檔案。這些是不可修改的——LLM 會讀取它們但不會修改它們。這是你的事實來源。

維基(The Wiki)——一個由 LLM 生成的 Markdown 文件目錄。摘要、實體頁、概念頁、比較表、總覽、綜述。LLM 完全擁有這一層。它建立頁面、在新資料到來時更新它們、維護交叉引用、並保持一切一致。你閱讀它;LLM 撰寫它。

規範(The Schema)——一份文件(例如 Claude Code 的 CLAUDE.md 或 Codex 的 AGENTS.md),告訴 LLM 維基的結構、慣例、以及在攝入資料、回答問題或維護維基時應遵循的工作流程。這是關鍵的設定檔——它讓 LLM 成為有紀律的維基維護者,而非普通的聊天機器人。你和 LLM 隨著使用經驗共同演化這份文件。

營運

攝入(Ingest)。你將新的資料來源放入原始資料集,並告訴 LLM 處理它。一個範例流程:LLM 讀取資料來源,與你討論關鍵重點,在維基中撰寫摘要頁面,更新索引,更新維基中相關的實體頁和概念頁,並在日誌中追加一筆記錄。單一資料來源可能觸及 10-15 個維基頁面。我個人偏好一次處理一個來源,並保持參與——我閱讀摘要、檢查更新、引導 LLM 應該強調什麼。但你也可以一次批次攝入多個來源,減少監督。由你來發展適合你風格的工作流程,並將其記錄在 Schema 中以供未來使用。

查詢(Query)。你對維基提出問題。LLM 搜尋相關頁面、閱讀它們、並合成附有引用的答案。答案可以根據問題的不同而採取不同形式——Markdown 頁面、比較表格、投影片(Marp)、圖表(matplotlib)、畫布。重要的洞見:好的答案可以被存回維基成為新的頁面。 你要求的比較、分析、發現的連結——這些都是有價值的,不該消失在對話歷史中。這樣,你的探索和攝入的資料來源一樣,都會在知識庫中產生複利。

健康檢查(Lint)。定期請 LLM 對維基進行健康檢查。尋找:頁面之間的矛盾、被新資料取代的過時主張、沒有入站連結的孤立頁面、被提及但缺少獨立頁面的重要概念、遺漏的交叉引用、可透過網路搜尋填補的資料缺口。LLM 擅長建議新的問題方向和新資料來源。這能讓維基在成長過程中保持健康。

索引與日誌

兩個特殊文件幫助 LLM(和你)在維基成長時導航。它們有不同的用途:

index.md 是面向內容的。它是維基中所有內容的目錄——每個頁面附有連結、一行摘要、以及可選的元資料(如日期或來源數量)。按類別組織(實體、概念、來源等)。LLM 在每次攝入時更新它。在回答查詢時,LLM 先讀取 index 來找到相關頁面,然後深入閱讀它們。這在中等規模(約 100 個來源、數百個頁面)下效果出奇地好,避免了基於嵌入向量的 RAG 基礎設施需求。

log.md 是按時間順序的。這是一份只增不減的記錄,記錄了何時發生了什麼——攝入、查詢、健康檢查。一個有用的技巧:如果每筆記錄都以一致的前綴開頭(例如 ## [2026-04-02] ingest | 文章標題),日誌就可以用簡單的 Unix 工具解析——grep "^## \[" log.md | tail -5 給出最後 5 筆記錄。日誌提供了維基演進的時間線,幫助 LLM 了解近期做了什麼。

可選:CLI 工具

在某個時間點,你可能想建立一些小工具來幫助 LLM 更有效地操作維基。搜尋引擎是最明顯的——在小規模下 index 檔案就夠了,但隨著維基增長,你需要真正的搜尋。qmd 是一個不錯的選擇:它是一個 Markdown 檔案本地搜尋引擎,採用 BM25/向量混合搜尋和 LLM 重排序,全部在本地執行。它既有 CLI(讓 LLM 可以 shell out 使用)也有 MCP 伺服器(讓 LLM 可以將其作為原生工具使用)。你也可以自己建立更簡單的東西——需要時 LLM 可以幫你 vibe-code 一個簡單的搜尋腳本。

技巧與提示

  • Obsidian Web Clipper 是一個瀏覽器擴充,可將網頁文章轉換為 Markdown。對於快速將資料納入原始資料集非常有用。
  • 將圖片下載到本地。 在 Obsidian 設定 → 檔案與連結中,將「附件資料夾路徑」設為固定目錄(例如 raw/assets/)。然後在設定 → 快速鍵中,搜尋「下載」找到「下載目前檔案的附件」並綁定快速鍵(例如 Ctrl+Shift+D)。剪輯文章後,按下快速鍵,所有圖片就會下載到本地磁碟。這是可選的但很有用——它讓 LLM 可以直接檢視和引用圖片,而不依賴可能失效的 URL。請注意,LLM 無法一次性地原生讀取包含行內圖片的 Markdown——解決方法是讓 LLM 先讀取文字,然後分別檢視部分或全部引用的圖片以獲得額外上下文。這有點笨拙但效果還不錯。
  • Obsidian 的圖譜檢視是查看維基形狀的最佳方式——什麼連結了什麼、哪些頁面是樞紐、哪些是孤島。
  • Marp 是一種基於 Markdown 的投影片格式。Obsidian 有對應的外掛。適合直接從維基內容生成簡報。
  • Dataview 是一個 Obsidian 外掛,可對頁面 frontmatter 執行查詢。如果你的 LLM 為維基頁面添加了 YAML frontmatter(標籤、日期、來源數量),Dataview 可以生成動態表格和清單。
  • 維基只是一個 Markdown 檔案的 Git 倉庫——免費獲得版本歷史、分支和協作能力。

為什麼這有效

維護知識庫最繁瑣的部分不是閱讀或思考——而是書卷工作。更新交叉引用、保持摘要更新、記錄新資料何時與舊主張矛盾、維護數十個頁面的一致性。人類放棄維基是因為維護負擔增長得比價值還快。LLM 不會厭倦、不會忘記更新交叉引用、可以在一次操作中觸及 15 個檔案。維基保持維護狀態是因為維護成本趨近於零。

人類的工作是策展來源、引導分析、提出好問題、思考這一切意味著什麼。LLM 的工作是其他所有事。

這個想法在精神上與 Vannevar Bush 的 Memex(1945)相關——一個個人化、有策展的知識儲存裝置,文件之間具有聯想軌跡。Bush 的願景比後來的網路更接近這個概念:私人的、主動策展的、文件之間的連結與文件本身同樣有價值。他無法解決的是由誰來做維護。LLM 處理了這部分。

備註

這份文件刻意保持抽象。它描述的是想法,而非具體實作。確切的目錄結構、Schema 慣例、頁面格式、工具——全都取決於你的領域、偏好和所選的 LLM。上述所有內容都是可選且模組化的——選擇有用的部分,忽略不需要的。例如:你的資料可能只有文字,因此完全不需要圖片處理。你的維基可能小到只需要 index 檔案,不需要搜尋引擎。你可能不在乎投影片,只想要 Markdown 頁面。你可能想要完全不同的輸出格式組合。正確的使用方式是將這份文件分享給你的 LLM Agent,並與之合作,打造一個符合你需求的版本。這份文件唯一的任務是傳達這個模式。你的 LLM 可以解決剩下的部分。