単語頻度カウンター
テキストを分析して、最も頻繁に使用される単語とその分布を見つけます。
単語頻度を分析するために、以下にテキストを貼り付けてください:
単語頻度カウンター の使い方
- 1
テキストを貼り付ける
分析したい内容を入力ボックスに入力するか貼り付けます。入力するそばからカウントが始まります。
- 2
設定を調整する
「Minimum Word Length」を設定して短い単語をスキップし、「the」や「and」のような一般的なストップワードを除外するかどうかを選びます。
- 3
頻度表を確認する
各単語をそのカウントと割合とともに確認し、さらにテキスト全体の総単語数と一意の単語数も把握します。
- 4
並べ替え・絞り込み・コピーする
頻度順またはアルファベット順に並べ替え、特定の用語に絞り込んでから、「Copy Results」をクリックして一覧をエクスポートします。
単語頻度分析を読み解く
単語頻度から何が分かるのか
単語頻度のカウントは、テキストを個々の単語に分割し、それぞれが何回現れるかを集計して、順位をつけます。その結果は、あなたの文章の指紋のようなものです。最も頼りにしている単語が上位に浮かび上がってきます。1,000 語の記事で「customer」が 30 回、「however」が 22 回出てくると分かれば、あなたの主題と、書いている最中には気づかなかったかもしれない文体の癖が、たちどころに明らかになります。
このツールは各単語が全体に占める割合も示すので、長さの異なるテキストを対等に比較できます。3% の単語は、ページ上の 33 語に 1 語の割合だということです。このたった 1 つの数字が、キーワード分析にも、文体の点検にも、基本的なテキストマイニングにも、共通の土台となります。
大文字・小文字の統一と、単語のまとめ方
このカウンターは大文字・小文字を区別しないので、「Apple」「apple」「APPLE」は 3 つではなく 1 つの項目にまとめられます。これが重要なのは、文頭に来る単語は大文字で、文中では小文字で現れるからです。統一しなければ、その本当の頻度は 2 つの行に分かれてしまい、実際より小さく見えてしまいます。
まとめは、大文字・小文字を統一したあとの正確なつづりに基づくものであり、意味に基づくものではない点に注意してください。「Run」「runs」「running」は異なる文字列なので、3 つの別々の単語として数えられます。文字どおりのトークンではなく概念を調べたいなら、関連する語形を頭の中で足し合わせるか、共通の語幹で絞り込んだ一覧を検索しましょう。
ストップワードと最小単語長フィルター
どんな英文でも最も多く現れる単語は、機能語です。「the」「a」「and」「of」「to」などです。そのままにしておくと、これらが一覧の上位を占め、本当に意味を担う単語を覆い隠してしまいます。「Common Words Excluded」をオンにすると、こうしたストップワードが取り除かれて内容語が浮かび上がります。キーワードやトピックの分析ではたいてい、これが望むものです。
「Minimum Word Length」設定は、2 つ目の、もっと大ざっぱなフィルターです。これを 4 文字や 5 文字に上げると、除外リストに載っていないものも含め、短い埋め草の語とほとんどのストップワードが一気に落ちます。すべてのトークンが気になるときは低い最小値を、実質的な用語だけが欲しいときはより高い値を使いましょう。2 つのフィルターは重ねて使えるので、組み合わせることもできます。
SEO のためのキーワード密度
キーワード密度とは、ある単語の頻度をパーセンテージで表したもので、このツールはそれをカウントされた単語 ― 入力欄のスペース区切りのトークンすべてではなく、最小単語長と一般的な単語のフィルターを適用したあとに残った用語 ― に占める割合として報告します。狙っているフレーズの主要な単語が 1% から 2% あたりに収まっていれば、不自然に見せることなく、そのトピックとの関連性を示せます。公式の理想的な数値はありません。この数字は健全性の確認であって、操作して狙う目標ではありません。
本当の危険は、過剰な最適化です。キーワードを 5% や 6% に達するまで繰り返すと、人間には不自然に読め、検索エンジンのスパム判定に引っかかって、順位を上げるどころか下げかねません。パーセンテージの列は、キーワードが存在し目立っていることを確認するために使い、そこで止めましょう。現代の検索は、単なる繰り返しよりも、自然な言葉と関連する用語をはるかに高く評価します。
文章の癖を見つける
どんな書き手にも、つい使いすぎる一握りの単語があります。頻度分析は、それらを客観的にあぶり出します。よくある犯人は「just」「really」「actually」「very」「that」のほか、「however」や「moreover」といったお気に入りの接続表現です。これらの 1 つが、とりわけストップワードを取り除いたうえで上位の結果に現れたら、語彙に変化をつけるべきだという明確な合図です。
これは強力な自己推敲の手立てです。書き上げた原稿を分析にかけ、一般的な単語を除外して、上位 20 語に目を通しましょう。主題の中心ではないのに不自然なほど頻繁に現れるものは、頼りすぎている口癖の語です。たとえいくつか削るだけでも、文章は引き締まり、残った使い方がより強く響くようになります。
コンテンツ分析とテキストマイニング
推敲にとどまらず、頻度の一覧は手軽なテキストマイニングの一形態でもあります。競合の記事を貼り付ければ、上位の内容語が、相手がどのテーマを強調しているかを明かします。アンケートの回答や製品レビューを放り込めば、上位に上がってくる単語が、顧客が最も気にかけていることを指し示し、読んでいては見つけるのに時間のかかる不満や称賛を浮かび上がらせます。
同じやり方は、文字起こし、サポートのチケット、調査メモにも使えます。分析は即座に、しかも非公開で行われるので、すばやく試行錯誤できます。気になる用語に絞り込んで本当のカウントを確認し、アルファベット順に並べ替えて語形の揺れを見つけ、それから表をスプレッドシートにコピーして、複数の文書をまたいだより深い比較を行う、といった具合です。
結果の読み方
まずは合計から始めましょう。Total Words はカウントされたトークンの総数、Unique Words はそのうち異なる単語がいくつあるかです。両者の比率は、語彙の豊かさを示唆します。総数に対してユニーク単語数が少ないと、表現が繰り返しがちであることをうかがわせるからです。次に、順位づけされた表を上から下へ読みます。頻度が最も高い内容語が、事実上のあなたのトピックです。
並べ替えは意図を持って使いましょう。頻度順に並べ替えて主要な用語を見つけ、次にアルファベット順に並べ替えて、離れて並んでいる単数形と複数形のような、ほぼ重複した語を見つけます。フィルターボックスは、ブランド名が何回現れるかといった、特定の問いに答えるのに最適です。これらの操作を組み合わせれば、のっぺりした一覧が、テキストを的確に診断する道具へと変わります。
よくある質問
各単語の割合はどのように計算されますか?
「the」や「a」のような一般的な単語を無視できますか?
「Minimum Word Length」設定は何をしますか?
単語は大文字・小文字を区別して数えますか?
テキストは分析のためにアップロードされますか?
関連ツール
こちらの便利なツールもどうぞ