Lindera SudachiDict

辞書バージョン

このリポジトリには SudachiDict 20260723(small + core + notcore レキシコン)が含まれています。

辞書フォーマット

辞書フォーマットおよび品詞タグの詳細については、SudachiDict のドキュメントを参照してください。

IndexName (Japanese)Name (English)Notes
0表層形Surface
1左文脈IDLeft context ID
2右文脈IDRight context ID
3コストCost
4見出し(解析結果表示用)Display surface
5品詞大分類Part-of-speech
6品詞中分類Part-of-speech subcategory 1
7品詞小分類Part-of-speech subcategory 2
8品詞細分類Part-of-speech subcategory 3
9活用型Conjugation type
10活用形Conjugation form
11読みReading
12正規化表記Normalized form
13辞書形IDDictionary form word ID
14分割タイプSplit modeA/B/C
15A単位分割情報Split references (A)
16B単位分割情報Split references (B)
17語構成Word structure
18同義語グループIDSynonym group IDs

[!NOTE] 見出し(解析結果表示用)が品詞カラムより前のインデックス 4 に位置するため、 トークン詳細(details)の先頭は、IPADIC や UniDic のような品詞ではなく見出しに なります。先頭の詳細を品詞タグとして位置ベースで読み取るトークンフィルタ (japanese_stop_tagsjapanese_keep_tagsjapanese_compound_word)は、 この辞書では期待どおりにマッチしません。token.get("part_of_speech") のような スキーマを認識するアクセスは正しく動作します。詳細は lindera/lindera#997 を参照してください。

ユーザー辞書フォーマット (CSV)

簡易版

IndexName (Japanese)Name (English)Notes
0表層形Surface
1品詞大分類Part-of-speech
2読みReading

詳細版

詳細版は上記の辞書フォーマット(19 カラム)に従います。

IndexName (Japanese)Name (English)Notes
0-18-Same as the dictionary format
19--19 以降は自由に拡張可能です。

API リファレンス

API リファレンスは以下の URL から参照できます: