部品
どの部品も参照実装と突き合わせて検証し、入力サイズごとに計測しています。選んで、コピーして、証拠ごと持ち帰ってください。
AI
LLM 周辺のデータ処理:チャンク分割、正規化、重複除去、トークン計測。
サンプルデータ
File Hash
BLAKE3 と SHA-256 によるストリーミングハッシュ。ファイルの改ざん確認や、データセット内の完全一致の重複検出に使えます。
- 比較対象
- hashlib
- 最大
- 5.7× 速い
MinHash
MinHash シグネチャによる近似重複検出。datasketch とビット単位で同じ結果を返します。トークン集合どうしの Jaccard 類似度を一定のメモリ量で推定し、RAG のコーパスや学習データの重複除去に使えます。
- 比較対象
- datasketch
- 最大
- 19× 速い
サンプルデータ
Text Chunker
RAG 向けの再帰的なテキスト分割。段落・文・単語の境目で文書を区切り、指定した大きさと重なり幅のチャンクにします。
- 比較対象
- langchain-text-splitters
- 最大
- 26× 速い
サンプルデータ
Token Counter
OpenAI 互換のエンコーディング(cl100k_base、o200k_base)で BPE トークン数を数えます。トークンの一覧は作りません。
- 比較対象
- tiktoken
- 最大
- 1.7× 速い
サンプルデータ
Unicode Normalize
テキスト処理のための Unicode の整形。NFC/NFKC 正規化、空白のまとめ、見えない文字の除去を行います。
- 比較対象
- unicodedata
- 最大
- 2.2× 速い
セキュリティ
ログのパース、パターンマッチ、ハッシュ計算、バイナリ解析。
サンプルデータ
Byte Entropy
バイナリをずらしながら区切った窓ごとにシャノンエントロピーを計算し、圧縮や暗号化された部分を見つけます。
- 比較対象
- scipy.stats.entropy
- 最大
- 35× 速い
サンプルデータ
File Hash
BLAKE3 と SHA-256 によるストリーミングハッシュ。ファイルの改ざん確認や、データセット内の完全一致の重複検出に使えます。
- 比較対象
- hashlib
- 最大
- 5.7× 速い
サンプルデータ
Log Parse
syslog(RFC 3164 / 5424)と一般的な Web サーバーのアクセスログを、構造化されたレコードに変換します。
- 比較対象
- re
- 最大
- 20× 速い
サンプルデータ
Multi-pattern Match
Aho–Corasick 法で数千のパターンを1回の走査で照合します。ログや通信内容から侵害の痕跡(IOC)を探すのに使えます。
- 比較対象
- pyahocorasick
- 最大
- 5.0× 速い