arXiv:2605.28131cs.CL2026-05

学来的语法主干不比规则主干更能提升分句精度。

Better heads do not guarantee better binarized constituency parsing

  • 用模型学习主干结构替代规则,提升内在头预测能力
  • 虽在CTB数据集上略有整体提升,但标点敏感指标下降
  • 跨语料库迁移时性能更不稳定,凸显语言合理性非最优

我们重新审视了带标点感知的句法树二叉化方法,探究依赖诱导的主干结构是否能改善二叉化解析器的监督效果。尽管学习得到的主干在内在头预测任务中显著优于规则方法,但在去二叉化后并未带来稳定解析性能提升。特别是在标点敏感的宏平均F1指标上,学习主干表现反而劣于规则二叉化,尽管在CTB数据集上整体略有增益。跨语料库迁移中也出现类似不稳定性。结果表明,语言学上合理的主干结构并不一定在作为二叉化控制信号时最优。本文呈现了一个负向结论:更好的头预测并不意味着更好的标点敏感句法解析。

原文摘要 · Abstract (English)

We revisit punctuation-aware tree binarization for constituency parsing and ask whether dependency-induced headedness improves binary parser supervision. Although learned heads substantially outperform rule-based heads in intrinsic head prediction, they do not yield consistent parsing gains after debinarization. In particular, punctuation-conditioned evaluation shows that learned headedness underperforms rule-based binarization in macro-average punctuation-sensitive $F_1$, despite a small overall gain on CTB. Similar instability appears under cross-treebank transfer. These results suggest that \ycc{linguistically grounded} headedness is not necessarily parser-optimal when used as a binarization control signal. The paper presents a negative result: better head prediction does not imply better punctuation-sensitive constituency parsing.

句法分析二叉化标点敏感

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。