日本語の自動検査、指摘190件のうち58%が誤検出だった
textlintの技術文書向けプリセットを労働法の解説サイトへそのまま当てたところ、190件の指摘のうち111件が誤検出でした。規則を切った判断と、その理由を全部並べます。
日本語の文章を機械で検査したくなり、textlint と技術文書向けのプリセットを 記事57本へ当てています。既定の設定のまま実行すると190件出ました。
1件ずつ読んだ結果が、次の内訳です。
58%が誤検出です。 ここで「190件も問題がある」と受け取って 一括で直していたら、正しい文章のほうを壊していました。
誤検出111件の内訳は、法令用語73件、対句13件、文中の「である」12件、 記事の題材9件、桁区切りなど4件です。
誤検出111件の中身
73件は、言い換えられない法令用語
一番多かったのは「漢字が7つ以上続いてはいけない」という規則でした。 73件出て、73件とも制度の正式名称でした。
| 回数 | 語 |
|---|---|
| 20 | 月平均所定労働時間 |
| 14 | 変形労働時間制 |
| 7 | 労働基準監督署 |
| 6 | 地域別最低賃金 |
| 4 | 労働条件通知書 |
「月平均の所定労働時間」と中黒や仮名を挟めば規則は通ります。 ただし条文や行政の資料と表記がずれ、検索から来る人が使う語ともずれます。 規則を通すために正しさを落とすことになるので、規則のほうを切りました。
27件は、文中の「である」を文末と取り違えていた
敬体と常体の混在を見る規則です。プリセットの既定では12件、 設定を変えて見直すと27件になり、27件とも敬体の文でした。
拾われていたのは文末ではなく、文の途中に出る形でした。
8:30は8.5であって8.3ではありません。- 深夜であることは「いつ働いたか」の話だからです。
どちらも語尾は「ません」「です」で、混在していません。
strict: false にして文末だけを見るようにすると0件になりました。
同じ間違いを、以前この手で書いた検査でもしています。 除外語に「でした」を入れて「ました」を入れ忘れ、丁寧語の過去形を 全部ひろって「混在17%」と報告しました。正しく測ると2.6%でした。 文末を見ているつもりで文中を数えているという点まで同じです。
13件は、対句を重複と見ていた
同じ助詞が一文に2回出るのを拾う規則が、並立の「も」「でも」を含めていました。
- 1か月ぶんでも1年ぶんでも貼り付けられます
- 時間外でもあり深夜でもある
- 精度も速度も悪化した
重複ではなく対句です。片方を削ると意味が変わります。 この2語だけ除外し、残る「が」「に」「は」「で」「と」は直す対象に残しました。
9件は、記事の題材そのものだった
全角と半角の変換を説明する記事には、濁点が分離した「カ゛」や 半角カナを実例として載せています。並べ替えの記事には全角の英字が出てきます。
これらは誤りではなく、その記事が説明している対象です。 規則どおりに直すと、何の話をしているのか分からなくなります。
いま読んでいるこの記事も、同じ状況にあります。 上の段落に「カ゛」と 書いた時点で検査が反応するので、ここだけ外したうえで理由を書き添えました。
その文字列は、直す対象か題材か
残る4件は桁区切りと三点リーダ
- 半角コンマの数を数える規則が、
1,050円の桁区切りと1, 2, 3, 10という並び順の実例を拾っていた - 同じ語の連続を見る規則が、三点リーダ「……」を拾っていた。 2つ重ねるのが日本語の組版の作法で、1つに減らすほうが誤り
直した75件は、たしかに読みにくかった
誤検出が多いからといって、道具が役に立たないわけではありません。 残る75件は、自分では気づけなかったものでした。
| 種類 | 件数 | 例 |
|---|---|---|
| 助詞の重複 | 56 | 8時間が7時間59分になるような誤差が出ることがある |
| 冗長表現 | 8 | 説明を行い/置換を実行する/することができます |
| 文末の句点 | 5 | 箇条書きの前置きが読点で終わっていた |
| 算用数字との不統一 | 4 | 「一つ」4件に対し「1つ」30件が同じサイトに混在 |
助詞の重複は、書いているときには聞こえません。 声に出すと分かるものの、記事57本を音読する運用は続きません。
ページのほうでは、こちらが文を切っていた
記事だけでなく、販売ページや案内文(.astro)も対象にしました。
読む人が最初に見るのは、記事ではなくページのほうだからです。
最初は1行を1つの文として渡しました。204件出て、その大半が 「文末が。で終わっていません」でした。
残業代、有給、労働時間を調べる人は、すでに悩みを数字へ落とし込んでいます。
結果を見た直後に貴社の相談・予約・資料請求を表示し、 ← ここで切れる
<strong>ホームページを「読む場所」から…</strong>
文が壊れていたのではなく、こちらが折り返しの途中で切っていました。 区切るべきなのは行ではなくタグの境目です。そちらで切り直すと9件になりました。
行番号にも同じことが起きていました。複数行にわたる式を空白へ潰していたため、 潰した改行のぶんだけ行がずれ、最大20行違う場所を指していました。 指摘の中身は正しいのに、示す場所だけが違うという状態です。
導入して分かったこと
日本語の検査は、入れれば文章がよくなる道具ではありませんでした。 規則が自分の題材に合っているかを、1件ずつ判断する作業が先にあります。
その判断は一度やれば設定として残り、次からは書いた直後に指摘が出ます。 切った規則には、なぜ切ったのかを設定ファイルへ書き添えました。 書いておかないと、半年後の自分が「厳しくしたほうがよさそうだ」と戻し、 また同じ73件を眺めることになるからです。
関連する記事
- 通っている検査が、狙いと違うものを測っていた9件
静的サイト2つに自動検査を16本書いた10日間で、9件は「書いたつもりの対象」と「実際に測っていた対象」がずれていました。全部が緑のまま守られていなかった事例を、気づいた経緯つきで並べます。
- AIアプリの更新履歴は「見分けがつくこと」を書く
自動更新されるAIアプリでは、利用者は不具合が直ったのか古い版を掴んでいるのかを区別できません。8日間で38回更新したアプリで、更新履歴の書き方をどう変えたかを書きます。
最終更新日: