키워드 밀도 — 한국어는 영어 도구로 셀 수 없습니다
키워드 밀도는 글 전체 낱말 중 특정 낱말이 차지하는 비율입니다. 영어라면 띄어쓰기로 자르면 끝이지만, 한국어는 '서울을'과 '서울이'와 '서울은'이 전부 다른 낱말로 잡힙니다. 그러면 실제로 다섯 번 쓴 낱말이 한 번씩 다섯 개로 흩어집니다.
밀도를 보는 이유는 두 가지입니다. 하나는 글이 무엇에 관한 것인지 스스로 확인하는 것입니다. 맛집 글을 썼는데 상위 키워드에 '그리고'와 '있습니다'만 있다면 주제가 흐려진 것입니다. 다른 하나는 반대로 같은 낱말을 너무 몰아넣지 않았는지 보는 것입니다.
그런데 한국어에서는 세는 일 자체가 먼저 문제입니다. 조사가 낱말에 붙어 다니기 때문입니다.
조사를 떼지 않으면 숫자가 흩어집니다
'서울에서 서울을 서울이 서울은 서울' 이라는 문장에는 서울이 다섯 번 나옵니다. 그런데 띄어쓰기로만 자르면 서울에서·서울을·서울이·서울은·서울, 다섯 개의 서로 다른 낱말이 한 번씩 나온 것이 됩니다. 상위 키워드에는 아무것도 안 올라옵니다.
이 도구는 조사를 떼고 셉니다. 긴 조사부터 확인하는데, '에서'를 먼저 떼지 않으면 '서울에서'가 '서울에'로 잘못 남기 때문입니다. 결과는 서울 5회, 밀도 100%입니다.
같은 낱말로 묶이는 형태
왼쪽은 글에 쓰인 그대로, 오른쪽은 집계에 들어가는 형태입니다.
| 글에 쓴 형태 | 집계 |
|---|---|
| 서울이, 서울을, 서울은, 서울도 | 서울 |
| 서울에서, 서울에게, 서울으로 | 서울 |
| 맛집의, 맛집과, 맛집만 | 맛집 |
| 추천합니다, 추천했다 | 그대로 (어미는 떼지 않음) |
몇 퍼센트가 적당한가
정해진 숫자는 없습니다. 한때 2~3%가 적정선이라는 말이 널리 퍼졌지만 검색 엔진이 그런 기준을 밝힌 적은 없습니다. 구글은 오히려 키워드를 억지로 채워 넣는 것을 문제로 보고, 자연스럽게 쓰라고만 말합니다.
그래서 이 숫자는 목표가 아니라 점검용으로 쓰는 편이 낫습니다. 특정 낱말이 10%를 넘으면 사람이 읽기에 어색할 가능성이 높고, 반대로 주제어가 상위 열 개 안에 없으면 글이 무엇에 관한 것인지 흐릿하다는 신호입니다.
네이버 검색을 목표로 쓴다면 밀도보다 제목과 첫 문단에 주제어가 들어갔는지가 더 중요합니다. 밀도는 본문을 다 쓴 뒤에 한 번 확인하는 정도로 충분합니다.
한 글자 낱말과 흔한 낱말은 순위에서 뺍니다
'이', '그', '저', '수', '것' 같은 한 글자 낱말과 'the', 'in' 같은 영어 기능어는 어느 글에서나 상위를 차지합니다. 그게 상위 목록을 채우면 정작 봐야 할 낱말이 밀려납니다.
그래서 이런 낱말은 순위에서 뺍니다. 다만 전체 낱말 수에는 포함합니다. 글에 실제로 있는 낱말이니 빼 버리면 밀도가 부풀려집니다. 두 글자 이상만 순위에 오릅니다.
일본어와 중국어는 어떻게 세나
일본어와 중국어는 띄어쓰기가 없어서 자를 자리가 보이지 않습니다. 정확히 하려면 형태소 분석이 필요하고, 그건 사전과 모델이 있어야 하는 일이라 브라우저 안에서 하기 어렵습니다.
이 도구는 문자 종류가 바뀌는 자리에서 자릅니다. 한자 덩어리, 가타카나 덩어리, 히라가나 덩어리를 각각 하나로 봅니다. '東京カメラ' 는 東京 과 カメラ 로 나뉩니다. 완벽하지는 않지만 명사를 잡아내는 데는 대체로 맞습니다. 히라가나만으로 된 조사나 어미는 순위에서 뺍니다.
자주 묻는 질문
두 낱말, 세 낱말짜리 구문도 볼 수 있나요?
네. 한 낱말·두 낱말·세 낱말을 따로 셉니다. '서울 맛집' 처럼 검색어로 실제로 쓰이는 형태는 두 낱말 쪽에서 확인하는 편이 낫습니다.
CSV 로 내보낸 파일이 엑셀에서 깨집니다.
이제 깨지지 않습니다. 파일 앞에 UTF-8 표시(BOM)를 붙여서 내보내기 때문에 한국어 윈도우의 엑셀도 제대로 읽습니다.
'추천합니다' 와 '추천했다' 가 따로 세어집니다.
맞습니다. 조사는 떼지만 용언의 어미는 떼지 않습니다. 어미를 떼려면 어간을 판별해야 하고, 그건 사전 없이 하면 틀리는 경우가 많아서 그대로 둡니다.
글이 서버로 전송되나요?
아니요. 세는 일은 전부 브라우저 안에서 일어납니다.
