文本相似度計算器

&#Text Similarity

Text Similarity is available directly in your browser, with no data uploaded.

📐 工作原理與說明

提供多種文本相似度度量:餘弦相似度(向量空間,TF 或字元 n-gram,∈[0,1]);Jaccard(交集÷並集);Levenshtein 編輯距離(最少插入/刪除/替換次數,越小越像);漢明距離(等長串對應位差異數)。

  • 中英文均可;短文本建議用字元級 n-gram 或編輯距離。
  • 餘弦=1 表示方向完全一致,編輯距離=0 表示完全相同。
  • 純前端計算,資料不上傳。
0 字元
0 字元
📚 工具介紹與使用幫助

文本相似度計算器是一款純前端線上工具,支援多種經典演算法同時計算兩段文本的相似程度,所有資料在瀏覽器本地處理,不上傳伺服器。

🎯 功能特點

👤 使用場景

常見問題

各種相似度演算法有什麼區別?
餘弦相似度基於詞頻向量夾角,適合長文本;Jaccard 基於集合交併比,適合短文本;萊文斯坦距離衡量字元編輯代價,精確但計算量大;漢明距離僅適用於等長字串的逐位比較。
中文文本應該選擇哪種分詞方式?
建議使用"按字元"模式,每個漢字作為獨立 token。對於英文文本,使用"按單詞"模式效果更好。N-gram 模式適合需要捕捉相鄰字元組合特徵的場景。
漢明距離為什麼顯示不適用?
漢明距離僅適用於兩段等長字串的逐位對比。如果兩段文本長度不同,該指標無法計算,這是演算法本身的限制。

📚 深度解析:文本相似度計算器

💡 常見使用場景

標準化使用示例
以一組典型輸入為例:先按業務口徑補充必要欄位,執行工具並記錄輸出;再對比另一組邊界輸入,檢查工具在異常輸入下是否給出穩定提示,便於快速形成操作 SOP。

❓ 常見問題(FAQ)

該工具適用於哪些 it 場景?
只要資料可對映到本工具支援的引數結構,就可用於日常分析、篩選、校驗等流程;多數情況下適合前置評估和結果複核。
結果可信度如何保證?
工具預設按前端可見規則即時計算,不依賴外部服務;如有偏差,建議結合歷史基準值做交叉確認。
⚠️ 使用說明與注意事項