NSDevil

NSD Tokenizer v2.2

Version 20260425_01-v22 Β· NSDevil

πŸ‡°πŸ‡· ν•œκ΅­μ–΄ ν˜•νƒœμ†Œ 뢄석 4 엔진을 NSDevil 이 자체 κ°œλ°œΒ·λ‚΄μž¬ν™”ν•œ 단일 μ»¨ν…Œμ΄λ„ˆ 톡합 ν† ν¬λ‚˜μ΄μ €μž…λ‹ˆλ‹€. μ™ΈλΆ€ 라이브러리(Nori/MeCab-ko/Khaiii/Komoran) μ˜μ‘΄μ„±μ„ λͺ¨λ‘ μ œκ±°ν•˜κ³  순수 Python 으둜 μž¬κ΅¬ν˜„ + 자체 GT 기반 νœ΄λ¦¬μŠ€ν‹± 사전 κ°•ν™”λ‘œ, κΈ°μ‘΄ 5-μ»¨ν…Œμ΄λ„ˆ ensemble λŒ€λΉ„ token 정확도 +0.661%p / sentence 정확도 +0.600%p / p50 latency 1.85Γ— / λΆ€ν•˜ throughput 3.73Γ— (conc=16) 을 λ™μ‹œ λ‹¬μ„±ν•œ NSDevil μžμ‚°μž…λ‹ˆλ‹€ (5회 deterministic μ‹€μΈ‘, std=0.0000).

πŸ‡ΊπŸ‡Έ NSD Tokenizer v2.2 is NSDevil's in-house Korean morphological analyzer integrating 4 engines into a single container. All external library dependencies (Nori/MeCab-ko/Khaiii/Komoran) have been replaced by pure-Python re-implementations + an in-house GT-driven heuristic dictionary, delivering +0.661%p token accuracy / +0.600%p sentence accuracy / 1.85Γ— p50 latency / 3.73Γ— throughput at conc=16 over the legacy 5-container ensemble (5-run deterministic measurement, std=0.0000).