日本語の自動検査、指摘190件のうち58%が誤検出だった

textlintの技術文書向けプリセットを労働法の解説サイトへそのまま当てたところ、190件の指摘のうち111件が誤検出でした。規則を切った判断と、その理由を全部並べます。

日本語の文章を機械で検査したくなり、textlint と技術文書向けのプリセットを 記事57本へ当てています。既定の設定のまま実行すると190件出ました。

1件ずつ読んだ結果が、次の内訳です。

誤検出111件
直したもの75件
意図した表現で残した4件
指摘190件の内訳

58%が誤検出です。 ここで「190件も問題がある」と受け取って 一括で直していたら、正しい文章のほうを壊していました。

誤検出111件の内訳は、法令用語73件、対句13件、文中の「である」12件、 記事の題材9件、桁区切りなど4件です。

誤検出111件の中身

73件は、言い換えられない法令用語

一番多かったのは「漢字が7つ以上続いてはいけない」という規則でした。 73件出て、73件とも制度の正式名称でした。

回数語
20月平均所定労働時間
14変形労働時間制
7労働基準監督署
6地域別最低賃金
4労働条件通知書

「月平均の所定労働時間」と中黒や仮名を挟めば規則は通ります。 ただし条文や行政の資料と表記がずれ、検索から来る人が使う語ともずれます。 規則を通すために正しさを落とすことになるので、規則のほうを切りました。

27件は、文中の「である」を文末と取り違えていた

敬体と常体の混在を見る規則です。プリセットの既定では12件、 設定を変えて見直すと27件になり、27件とも敬体の文でした。

拾われていたのは文末ではなく、文の途中に出る形でした。

どちらも語尾は「ません」「です」で、混在していません。 strict: false にして文末だけを見るようにすると0件になりました。

同じ間違いを、以前この手で書いた検査でもしています。 除外語に「でした」を入れて「ました」を入れ忘れ、丁寧語の過去形を 全部ひろって「混在17%」と報告しました。正しく測ると2.6%でした。 文末を見ているつもりで文中を数えているという点まで同じです。

13件は、対句を重複と見ていた

同じ助詞が一文に2回出るのを拾う規則が、並立の「も」「でも」を含めていました。

重複ではなく対句です。片方を削ると意味が変わります。 この2語だけ除外し、残る「が」「に」「は」「で」「と」は直す対象に残しました。

9件は、記事の題材そのものだった

全角と半角の変換を説明する記事には、濁点が分離した「カ゛」や 半角カナを実例として載せています。並べ替えの記事には全角の英字が出てきます。

これらは誤りではなく、その記事が説明している対象です。 規則どおりに直すと、何の話をしているのか分からなくなります。

いま読んでいるこの記事も、同じ状況にあります。 上の段落に「カ゛」と 書いた時点で検査が反応するので、ここだけ外したうえで理由を書き添えました。

その文字列は、直す対象か題材か

題材その箇所だけ検査から外す。理由をその場に書く
対象直す。同じ間違いを繰り返すなら規則で止める
指摘を受けたとき、まず決めること

残る4件は桁区切りと三点リーダ

直した75件は、たしかに読みにくかった

誤検出が多いからといって、道具が役に立たないわけではありません。 残る75件は、自分では気づけなかったものでした。

種類件数例
助詞の重複568時間が7時間59分になるような誤差が出ることがある
冗長表現8説明を行い/置換を実行する/することができます
文末の句点5箇条書きの前置きが読点で終わっていた
算用数字との不統一4「一つ」4件に対し「1つ」30件が同じサイトに混在

助詞の重複は、書いているときには聞こえません。 声に出すと分かるものの、記事57本を音読する運用は続きません。

ページのほうでは、こちらが文を切っていた

記事だけでなく、販売ページや案内文(.astro)も対象にしました。 読む人が最初に見るのは、記事ではなくページのほうだからです。

最初は1行を1つの文として渡しました。204件出て、その大半が 「文末が。で終わっていません」でした。

残業代、有給、労働時間を調べる人は、すでに悩みを数字へ落とし込んでいます。
結果を見た直後に貴社の相談・予約・資料請求を表示し、        ← ここで切れる
<strong>ホームページを「読む場所」から…</strong>

文が壊れていたのではなく、こちらが折り返しの途中で切っていました。 区切るべきなのは行ではなくタグの境目です。そちらで切り直すと9件になりました。

行番号にも同じことが起きていました。複数行にわたる式を空白へ潰していたため、 潰した改行のぶんだけ行がずれ、最大20行違う場所を指していました。 指摘の中身は正しいのに、示す場所だけが違うという状態です。

導入して分かったこと

日本語の検査は、入れれば文章がよくなる道具ではありませんでした。 規則が自分の題材に合っているかを、1件ずつ判断する作業が先にあります。

その判断は一度やれば設定として残り、次からは書いた直後に指摘が出ます。 切った規則には、なぜ切ったのかを設定ファイルへ書き添えました。 書いておかないと、半年後の自分が「厳しくしたほうがよさそうだ」と戻し、 また同じ73件を眺めることになるからです。

関連する記事

最終更新日: