AI 術語學習

成分句法分析 是什麼?

成分句法分析(Constituency Parsing)的定義、完整說明、相關概念與資料來源。

英文
Constituency Parsing
內容定位
完整解說 alternate
最後更新
2026-06-23

將句子分解為層級詞組結構,建構樹形解析樹以顯示詞語與詞組的組成與支配關係。

成分句法分析(Constituency Parsing)是將自然語言句子分解為層級成分的過程,是理解句子語法結構的經典方法。

基本概念

成分與詞組(Constituents & Phrases)

成分指能作為一個單位被移動、替代或刪除的詞語或詞組。例如「那個在山頂上的紅房子」可作為單個成分被替代為「它」,顯示這整個短語是一個成分。

常見詞組類型(按詞性表示):

  • NP(名詞短語):"the quick brown fox"
  • VP(動詞短語):"saw the cat"
  • AP(形容詞短語):"very happy"
  • PP(介詞短語):"in the house"
  • S(句子):完整的主謂結構

解析樹(Parse Tree)

S(句子)為根,逐層分解:

         S
       / | \
      NP VP NP
     /|   \  |
    Det N  V Det N
    |  |  |  |  |
   The cat saw a mouse

詞性標註(Part-of-Speech Tagging)與基礎成分

成分分析依賴準確的詞性標籤(名詞、動詞、形容詞等),現代系統多併行進行。

分析方法的演進

  1. 文法規則導向(1960-1990) 手工撰寫上下文無關文法(CFG)規則,精度高但規則爆炸、維護困難。

  2. 概率上下文無關文法(PCFG, 1990-2010) 為每條文法規則賦予機率,使用 CKY(Cocke-Kasami-Younger)演算法進行最大機率分析。

  • 優點:訓練簡單,計算高效
  • 缺點:無法精確捕捉長距離依賴、詞彙選擇的條件機率
  1. 詞典化 PCFG(Lexicalized PCFG, 2000-2010) Klein & Manning 等引入詞彙條件,改進機率估計,但計算複雜度上升。

  2. 神經網路分析器(2015 年後)

  • 轉移系統分析器(Transition-Based):貪心地進行 shift、left-arc、right-arc 操作逐步構造解析樹。特點是高效但可能錯過全局最優。
  • 圖分析器(Graph-Based):計算所有可能樹的分數,選擇最高分者,保證全局最優但計算耗時。
  • 基於 Span 的分析器:直接預測每個跨度(span)是否為成分及其標籤,無需約束樹結構,計算簡便。
  1. Transformer 時代(2019 至今) BERT、GPT 等預訓練模型提供強大的上下文表徵,結合簡單解碼層(如雙仿射分類器預測跨度成分性)。

重要特性

覆蓋性與分析歧義

多數句子在不同分析方法下有多個合法解析樹。例如「I saw the man with the telescope":

  • 讀法 1:(我用望遠鏡看那個人)
  • 讀法 2:(我看那個拿著望遠鏡的人)

處理方法:(1)返回概率最高的單一分析;(2)返回 k-best 解析;(3)建造分析森林(packed forest)隱式表示所有解析。

評估指標

  • Unlabeled Recall / Precision:忽略詞組標籤,只判斷邊界正確性
  • Labeled Recall / Precision:同時考慮標籤
  • 括號交叉率(Crossing Brackets):預測樹與黃金樹的結構衝突數
  • 現代最佳模型在 PTB(Penn Treebank)標準測試集上達 96%+ F1

應用場景

  1. 語法檢查與語言教育 識別句子的語法結構,檢測違反文法規則的成分組合。

  2. 文本簡化與改寫 分析複雜句結構,識別可簡化或重組的成分(如從句)。

  3. 機器翻譯 源語言的成分結構可指導譯文的詞序與成分組合。

  4. 語義角色標注(SRL) 成分結構幫助定位論元邊界與層級關係。

  5. 信息擷取與文件理解 識別主句與從句,提取關鍵成分。

  6. 風格與可讀性分析 較複雜的成分結構(深樹、長成分)通常對應更複雜的句式。

成分分析 vs. 依存分析

特性 成分分析 依存分析
節點 詞組與詞語 詞語
邊 成分支配 修飾與依存
層級 多層(詞→小短語→大短語→句) 扁平(單層詞語依存)
直觀性 符合文法教學,易於人工檢驗 對語義應用更直觀
計算複雜度 通常較高(指數級) 通常較低(多項式級)

當代挑戰

  1. 長句與複雜結構 Tree 深度增加導致分析難度指數上升;深層變壓器模型的長序列注意力也面臨性能下降。

  2. 跨語言標準不一 不同語言的成分結構習慣差異大,難以建立通用標準。中文的分析標準與英文差異顯著。

  3. 領域與風格適應 新聞語料與社群媒體文本的成分分析模型準度差異大,領域遷移需額外微調。

  4. 稀有現象處理 協調結構(coordination)、省略、非標準文法等邊界案例仍是難題。

實踐建議

  1. 對於應用,評估是否需要完整成分樹(資訊擷取、風格分析)還是依存結構(SRL、翻譯)足夠。
  2. 使用預訓練模型的成分分析往往足夠(spaCy、Stanford CoreNLP、Berkeley Neural Parser),除非領域特性特殊。
  3. 進行人工評審時,重點檢查長成分、協調結構、從句邊界等易錯項。
  4. iPAS 考試中,成分分析通常在理解複雜句式、教育應用等場景出現,掌握基本分析方法有助於解題。

閱讀這頁時的常見誤區

只背中英文對照,無法判斷術語的適用情境。先確認定義,再對照完整說明與相關概念,頁面中的考試比重或出題方向,必須和下方標示的資料來源一起閱讀。

常見問題

資料來源

  • AITerms.tw 術語資料庫,最後更新:2026-06-23。