조직 보유 파일(PDF·Excel·Word 등)을 넣으면, 어느 분류항목인지 판단하고 CDM을 추출·매핑하여 데이터모델이 어떻게 갱신돼야 하는지를 분석적으로 보여줍니다.
정형 파일은 컬럼 헤더를, 비정형 문서는 LLM concept 모드로 김치 도메인 개념
(김치유형·원재료·미생물·공정·발효/품질·지역·시대·문헌)을 추출합니다.
추출된 용어를 국제 표준 온톨로지 ID로 해석(entity linking)하고 표준명·동의어를 획득합니다. 이 결과가 매칭·판정·중복제거를 동시에 개선하므로 가장 앞단에서 1회 수행 + 캐시합니다.
후보를 대표개념(CDM) 510개와 유사도로 비교합니다. 어휘 유사도(오프라인) 기본,
sentence-transformers 설치 시 다국어 임베딩 유사도 자동 사용.
NCBIChEBIFoodOn
동의어가 매칭 정확도를 높입니다.
임계값으로 적합(유지)·대체(보정)·추가(신규) 를 판정하고, LLM이 모호한 항목을 근거와 함께 재판정합니다.
① 각 개념을 가장 가까운 중분류(CM)에 배정 → "이 파일이 어느 분류항목인가" ② 적합/대체/추가 매핑 ③ default → real 데이터모델 Before/After 제안. FoodOn 신규 개념의 상위개념 배정 보조 + 외부 표준 ID 배지 표시.
CDM 엔티티 → owl:Class, 변수 → 데이터/객체 속성, 중복 변수 → 공유 클래스
(Ingredient·Region·Microorganism)로 통합.
NCBIChEBIFoodOn
공유 클래스에 외부 IRI를 skos:exactMatch/subClassOf로 링크.
문서에서 음식(김치) 레코드를 추출해 개체(Dish·Ingredient·Region·Document)로 적재.
NCBIChEBI
그라운딩된 개체에 owl:sameAs/skos:exactMatch로 외부 IRI 부착.
Competency Question(SPARQL)으로 "이 질문에 답이 되는가"를 검증. 그라운딩 도입 시 "미생물 개체의 NCBI taxid 연결률" 같은 품질 지표 추가 가능.
연계는 성격이 다른 두 작업으로 나눠 삽입합니다. (A) 그라운딩/정규화 → [0.5] 입력부(표준 ID·동의어로 매칭·판정 개선), (B) IRI 링크 → [4·5] 출력부(클래스/개체에 IRI 부착 → 상호운용·교차추론).
L. plantarum)을 단일 taxid로 통합CHEBI:28358 등 표준 식별| 외부 온톨로지 | 대상 분류항목(CM) | 공유클래스 | 그라운딩(0.5) | 데이터모델(3) | 온톨로지(4·5) |
|---|---|---|---|---|---|
| NCBI Taxonomy | KIM-02-07, 04-04/05 | Microorganism | ◎ 핵심 | 배지 | skos:exactMatch / taxonID |
| ChEBI | KIM-04-06, 05-01 | Metabolite (신규) | ◎ 핵심 | 배지 | skos:exactMatch |
| FoodOn | KIM-01 · 02 · 03 | Ingredient / KimchiType / Process | ○ | ◎ 상위배정 | rdfs:subClassOf / broadMatch |
onto/skeleton.py는 아직 taxonomy 스키마 미지원(보완 필요),
② 추출기 .docx(Word) 미지원(python-docx 추가 예정).