ENGLISH  |   聯絡我們  |   中央研究院
首頁 簡介 徵求授權對象 制式契約 研發人員專頁 相關網站 育成暨萌芽中心 聯絡我們
  首頁 -> 徵求授權對象 列印本頁 網站更新日期: 
具有新詞辨識能力的中文斷詞系統

本院覽號:05T- 891002

創作人:陳克健、馬偉雲(中央研究院 詞庫小組 )

智財權:專門技術

摘要:

詞是最小有意義且可以自由使用的語言單位。任何語言處理的系統都必須先能分辨文本中的詞才能進行進一步的處理,例如機器翻譯、語言分析、語言了解、資訊抽取。因此中文自動分詞的工作成了語言處理不可或缺的技術。

本系統整合了分詞及線上新詞辨識技術,為唯一具有新詞辨識能力並附加詞類標記的選擇性功能之中文斷詞系統。此一系統包含一個約拾萬詞的詞彙庫及附加詞類、詞頻、詞類頻率、雙連詞類頻率等資料。分詞依據為此一詞彙庫及定量詞、重疊詞等構詞規律及線上辨識的新詞,並解決分詞歧義問題。除了基本詞彙庫外,使用者可依需要附加領域專屬詞庫。一般文件若不考慮新詞平均切分正確率達99%以上。詞類標記為選擇性功能,可附加文本中切分詞的詞類解決詞類歧義,正確率在95%以上。分詞用詞典俱可擴充性,使用者可依據不同領域文件,補充領域詞典做為分詞之用。

可能的應用範圍:

一、資訊檢索
二、機器翻譯
三、語言分析
四、語言了解
五、訊息抽取
六、自然語言人機介面

此項發明的優點:

由於中文詞集是一個開放集合,不存在任何一個詞典或方法可以盡列所有的中文詞。當處理不同領域的文件時,領域相關的特殊詞彙或專有名詞,常常造成分詞系統因為參考詞彙的不足而產生錯誤的切分。為了解決這個問題,最有效的方法是補充領域詞典加強詞彙的搜集。因此新的詞彙或關鍵詞的自動抽取成為分詞的先期準備步驟。領域關鍵詞彙多出現在該領域的文件中而少出現在其它領域,因此抽取關鍵詞時多利用此特性。高頻的關鍵詞比較容易抽取,少數低頻的新詞不容事先搜集,必須線上辨識。構詞律、詞素、詞彙及詞彙共現訊息,為線上新詞辨識依據。此一問題至今尚未有完整的解答,部分的研究成果包括人名、地名、公司名辨識,未知詞偵測,複合詞構詞律等。

本系統整合了分詞及線上新詞辨識技術,為唯一具有新詞辨識能力並附加詞類標記的選擇性功能之中文斷詞系統。

智財技轉處聯絡人:翁嘉煌 chweng@gate.sinica.edu.tw 02-27872509

95年度中央研究院最佳網站
資訊科學研究所
讀者喜好文章深度偵測技術
中文剖析系統
Micro Air Pollution Sensing System (MAPS)
中文知識表達系統-廣義知網
補助審查專案管理系統
臺北歷史地圖散步
國際電腦漢字及異體字知識庫
Bounty Workers - 線上微型案件媒合平台
次世代定序線上分析平台1.0版
中文詞知識庫
中文分詞語料庫
快速全域最佳樣板比對演算法
用於自然語言事件辨識的方法跟電腦程式產品
個人化的網頁瀏覽系統
自半結構化主文中摘取資料之系統及方法
結合即時視訊與螢幕展示的同步遠距教學系統
數位化浮水印
電腦系統主要圖框處理裝置
視訊資料之編碼與解碼
XML文件編輯器
資料庫檢索方法與系統
行動網路代理器
可容忍幾何處理的數位影像赫序方法與系統
供多人共同操作單一電腦螢幕之主動是操作控制權轉移裝置及方法
非對稱數位影像浮水印技術
檢索輸入法
基於中文字型架構之反向人機辨識碼之辨識方法
建立迴路電力資訊模型之方法
電腦輔助影像故事創作系統
影像放大方法
高速列車用移動路由器系統及其無縫換手控制方法
基於高斯多項組合模型之音樂標籤自動標記技術
基於同質段落偵測與分類器集成之音樂標籤自動標記技術
使用LIBOR Market Model與Proportional Hazard Model的雙因子Monte Carlo評價法
客製化並納入專家觀點的投資組合建議模組
金融商品評價模組
中文句結構樹資料庫
語意分析暨文件分類技術
「應用群體運算之位置感知服務平台」(PLASH)
SQLMR 雲端資料庫管理系統
紀錄片穩定化技術
視訊監控系統
ASQA 中研院開放式中文問答系統
資料隱私保護軟體 Cellsecu
數位典藏影音資料庫
中文電腦缺字解決方案(漢字構形資料庫)
具有新詞辨識能力的中文斷詞系統
漢語平衡語料庫
線上會議註冊管理系統
多媒體及文件辨識、檢索與管理系統
多媒體及文件辨識、檢索與管理系統

  智財技轉處  Copyright © 2005 智財技轉處 版權所有
  11529 台北市南港區研究院路二段128號  |  電話:+886-2-2787-2554  |  傳真:+886-2-2651-8049  |