Google NotebookLM 以影片來源、中文分析與英文逐字稿三欄整理 AI 代理研究

NotebookLM 可以抓無字幕 YouTube 逐字稿嗎?實測免費匯出

YouTube 影片沒有字幕,NotebookLM 還能抓中文逐字稿嗎?

Google 官方說明寫得很明確,Gemini Notebook 僅支援「含有字幕(使用者上傳或自動生成)」的公開 YouTube 影片。這裡最容易誤解的地方,是 YouTube 播放器前台看不到 CC 按鈕,不代表影片一定沒有自動生成字幕。

我把一支前台沒有可見字幕的公開影片加入 NotebookLM,來源成功完成處理,也生成了完整的 transcript.md。畫面顯示「此逐字稿源自影片的自動語音辨識(STT)」,但這句話只能證明文字源自語音辨識,無法單獨判定是 YouTube 的自動字幕,還是 Gemini Notebook 另外執行的語音辨識。

所以這次實測能證明的是「沒有可見字幕,仍可能成功匯入」,不能進一步宣稱 Gemini Notebook 一定會直接對影片執行語音辨識。NotebookLM 已於 2026 年 7 月更名為 Gemini Notebook,本文為保留既有搜尋習慣,兩個名稱會交替使用。

實測結果:沒有可見字幕,NotebookLM 仍成功產生逐字稿

這次測試使用的是 RIVER 遊戲頻道的公開 YouTube 影片,片長 14 分 31 秒,影片頁面沒有可見字幕。我直接把網址加入 NotebookLM,來源完成處理後,再請它建立逐字稿文件,最後得到完整的 Markdown 內容。

  • NotebookLM 成功加入 YouTube 影片來源。
  • 工作室成功生成 transcript.md
  • 畫面標示逐字稿來自自動語音辨識(STT),但沒有標示語音辨識由哪一個服務執行。
  • 逐字稿包含日文譯名造成的同音異字,這是自動語音辨識常見的錯字特徵,不能用來判斷是哪個服務產生逐字稿。
  • 抽查逐字稿開頭與結尾,內容沒有被截斷。

因此實務上不要只看 YouTube 播放器有沒有顯示 CC 按鈕。想先檢查公開字幕軌,可以執行 yt-dlp --list-subs "影片網址",看到 automatic captions 就代表 YouTube 有自動字幕。即使查不到公開字幕軌,也可以先交給 NotebookLM 嘗試,明確匯入失敗後,再考慮 Whisper 或其他替代路徑。

Gemini Notebook 將 YouTube 影片生成逐字稿的實測畫面

為什麼這條路比較快

一般雲端轉錄流程,通常要先下載影片或抽出音訊,再把檔案上傳給語音模型,等待模型辨識後才能匯出。

NotebookLM 的差別,是可以直接從公開 YouTube 網址建立來源,省掉本機下載與重新上傳。

一般轉錄流程

  1. 下載影片或音訊。
  2. 必要時轉換檔案格式。
  3. 上傳到雲端語音辨識服務。
  4. 等待轉錄。
  5. 匯出逐字稿。

NotebookLM 流程

  1. 貼上公開 YouTube 網址。
  2. 等待 NotebookLM 完成來源處理。
  3. 匯出完整逐字稿。

如果直接搬移一支 500MB 影片,網路下載速度是 100Mbps、上傳速度是 20Mbps,理論下載約 40 秒、上傳約 200 秒,合計接近 4 分鐘。不過 Whisper 實務上通常會先用 yt-dlp -f bestaudio 抽取音訊,不需要下載與上傳完整影片。以 23 分鐘內容約 20MB 的簡化情境估算,下載加上傳通常不到 30 秒,實際時間仍會受音訊格式、網路速度與服務排隊影響。

因此 Gemini Notebook 的主要優勢不是固定省下 4 分鐘,而是少做抽取音訊、上傳檔案與管理另一套轉錄服務。這只是簡化的情境估算,不是每個人的固定速度。

不用 Gemini API,現有免費額度內新增成本是 0 元

這條流程不需要申請 Gemini API Key,也沒有另外呼叫 Gemini API。

以這次實測來說,在 NotebookLM 現有免費額度內,新增成本是 0 元。

如果改走 OpenAI Whisper API,官方價格是每分鐘 0.006 美元,30 分鐘約 0.18 美元。本機 Whisper 沒有 API 費,但會消耗自己的電腦運算與等待時間。Whisper 的費用其實不高,NotebookLM 真正的優勢仍是省掉下載、上傳與另外管理 API 的步驟。

要注意的是,「這次新增成本是 0 元」不等於永久免費或無限制。NotebookLM 免費版有來源數量與功能額度,Google 也可能調整規則。

GitHub 上四個相關專案,定位與維護量級差很多

我接著比較 GitHub 上幾個名稱很像的專案,差別不在於能不能輸出文字,而在於逐字稿究竟是從 NotebookLM 匯出,還是先用其他工具抓字幕。

teng-lin/notebooklm-py

這次採用的方案,它會直接操作 NotebookLM,把 YouTube 網址加入來源,等來源完成處理後,再用 source fulltext 取回完整文字,不依賴 yt-dlpyoutube-transcript-api 擷取字幕。查核時約有 1.9 萬顆 GitHub 星星,是四個專案中規模與維護活動明顯最高的核心工具。

curara81/notebooklm-toolkit

這是建構在 notebooklm-py 之上的衍生工具,適合批次匯入,但逐字稿功能實際使用 yt-dlp 下載人工或自動字幕,並不是從 NotebookLM 取回 fulltext。它的 README 仍指定 notebooklm-py v0.3.x,查核時只有 2 顆星、1 個 commit,而核心套件已更新到 0.8.x,導入前要先自行確認相容性,不宜把它視為與核心套件同量級的平行選項。

akshayonly/youtube-to-notebooklm

使用 youtube-transcript-api 擷取字幕,再整理成適合交給 NotebookLM 的文字檔。它是替 NotebookLM 準備字幕,不是透過 NotebookLM 產生逐字稿。

FrancescoLavelli/Notebooklm-Youtube-Transcript-Extractor

同樣使用 youtube-transcript-api 擷取字幕,屬於 NotebookLM 的前處理工具。查核時為 0 顆星、3 個 commits,適合參考簡單實作,不建議把它當成持續維護的完整方案。

所以最後我選擇 notebooklm-py,因為它符合我要的完整路徑:讓 AI Agent 直接把 YouTube 加入 NotebookLM,再把 NotebookLM 已處理的文字匯出。想進一步理解 Skill、MCP 與 API 的角色差異,可以閱讀《Skill、MCP、API 是什麼?三者差別與三層架構一次看懂》

把它做成 AI Agent 可以重複執行的 Skill

手動在 NotebookLM 貼網址已經很省事,但如果經常處理影片,還可以把流程交給 AI Agent。安裝開源 Skill 後,Agent 能建立筆記本、加入影片、等待來源處理、匯出 Markdown,再檢查逐字稿開頭與結尾。

npx skills add teng-lin/notebooklm-py

之後只要貼上 YouTube 網址,給 Agent 一句指令:

用 NotebookLM 抓完整逐字稿。

這就是 AI 分身從聊天走向實際交付工作的具體例子,不是只請模型回答問題,而是讓它照固定流程操作工具、保存成果並驗證結果。

官方規則怎麼讀,這次實測又能證明什麼

Google 官方說明目前寫的是,僅支援含有字幕「使用者上傳或自動生成」的公開 YouTube 影片。YouTube 自動字幕本來就是語音辨識產物,所以看到 STT 字樣,不能直接推論 Gemini Notebook 另外對影片跑了一次語音辨識。

另一方面,我在 2026 年 9 月 5 日對這支測試影片執行 yt-dlp --list-subs,工具回報沒有公開自動字幕或字幕軌,youtube-transcript-api 也回報字幕已停用。這代表公開工具目前抓不到字幕,但仍不能證明 Google 內部是否存在未公開的自動字幕軌,也不能證明 Gemini Notebook 一定自行執行 STT。

最準確的結論是,官方文件的文字本身沒有漏掉自動字幕,這次實驗則無法確定逐字稿究竟來自 YouTube 內部字幕,還是 Gemini Notebook 的其他處理流程。前台沒有 CC、公開工具查不到字幕,以及 NotebookLM 能匯入,三件事都應分開陳述。

對使用者來說,正確策略很簡單:不論有沒有字幕,都先試 NotebookLM,失敗再切換替代方案。

  • 影片必須能被 NotebookLM 存取,私人影片、年齡限制或區域限制可能失敗。
  • 上傳時間在 72 小時內的影片可能無法匯入。
  • 自動語音辨識仍會出現人名、專有名詞與同音異字錯誤,正式使用前要校對。
  • notebooklm-py 是社群開源專案,不是 Google 官方 API,Google 改版後可能需要更新。
  • 免費版每個筆記本最多可加入 50 個來源,每個來源最多 50 萬字,YouTube 影片長度不受限制,但字幕檔案不得超過 50 萬字,額度與規則仍可能調整。

最後的總結

NotebookLM 抓 YouTube 逐字稿的價值,不只是少付幾毛錢,而是把一開始就不需要做的步驟刪掉。

以前先下載影片、抽音訊、上傳、再等待模型轉錄,現在可以先貼網址,讓 NotebookLM 直接處理。

這次實測能證明的是,沒有可見字幕不等於不能處理,不能據此判定逐字稿一定由 Gemini Notebook 自行進行 STT。

我的固定工作流因此改成:公開 YouTube 一律先交給 NotebookLM,成功就匯出 fulltext 並抽查開頭與結尾,只有 NotebookLM 明確失敗,才改用本機 Whisper。



參考資料

常見問題 FAQ

NotebookLM 可以抓沒有可見字幕的 YouTube 影片嗎?

有可能。YouTube 前台沒有顯示 CC,不代表一定沒有自動字幕,這次測試影片即使公開工具查不到字幕軌,NotebookLM 仍成功匯入。這項結果不能單獨證明 NotebookLM 自行執行 STT,最有效的做法仍是先直接嘗試,明確匯入失敗後再改用 Whisper。

這個流程需要 Gemini API Key 嗎?

不需要。影片來源處理由 NotebookLM 完成,開源 notebooklm-py 負責自動加入來源與匯出 fulltext,不必另外呼叫 Gemini API。

NotebookLM 抓逐字稿是完全免費嗎?

在現有免費額度內,這次實測新增成本是 0 元,但不能解讀成永久免費或無限制。免費版每個筆記本最多 50 個來源,每個來源最多 50 萬字,Google 也可能調整規則。

NotebookLM 和 Whisper 應該先用哪一個?

公開 YouTube 建議先用 NotebookLM,因為可以省掉抽取音訊、上傳與 API 管理。若影片因權限、區域、上架時間或服務限制而匯入失敗,再改用本機 Whisper。

Similar Posts