Analýza klíčových slov: Přesnost vs. časová náročnost

Pokud kladete důraz na přesnost analýzy klíčových slov, narazíte na problém s velkou časovou investicí, kterou vyžaduje klasifikace. Existují triky, jak postup zrychlit hromadnými úpravami, ovšem ztratíte jistotu a přesnost. Otázka zní: Jak zkontrolovat kvalitu klasifikace?

Míra potřebné přesnosti při analýze je daná cílem. Jestliže vás zajímají trendy, nejhledanější produkty a jejich kategorizace, stačí věnovat se slovům, která se vyskytují nejčastěji. Ovšem je-li vaším cílem najít např. nová neotřelá témata pro své články, měli byste jít hlouběji.

Při práci na analýze pro nejmenovaného mobilního operátora jsem si vytipoval vhodné fráze a pročistil na základě hledanosti. Stále zbývalo 1300 slovních spojení. Klasifikace řádek po řádku by mohla zabrat přes 10 hodin.

Hromadná klasifikace

Řádky jsem filtroval dle výskytu frekventovaných slov (řetězců) a ty pak hromadně zařazoval do příslušných dimenzí. Např. každá klíčová fráze se slovem „zdarma” patří do kategorie „cena”, každý „mobil” patří do sloupce „produkty” jako „mobilní telefon“ atp.

Celý proces trval zhruba 3 hodiny. Kontrolou řádek po řádku bych uspořený čas zase vyplýtval, proto jsem hledal jinou možnost kontroly.

Hypotéza

Všiml jsem si, že počet slov ve frázi se obvykle rovná počtu dimenzí, ve kterých je zařazena. Např. spojení “modrý dotykový smartphone” patří do 3 dimenzí: barva, technologie a produkt. Často jsem narážel také na dvojslovné názvy pro jeden předmět, především “mobilní telefon”.

Rozhodl jsem se tedy vycházet z předpokladu, že počet slov bude roven počtu dimenzí, nebo bude o jedna vyšší.

Kontrola

Kontrolu jsem prováděl v programu MS Excel. Nejprve jsem potřeboval znát počet slov každé fráze, na to bohužel standardní funkce neexistuje. Nechal jsem tedy přepočítat mezery mezi slovy a přičetl 1.

Vzorec: Počet slov klíčové fráze

= DÉLKA(fráze)-DÉLKA(DOSADIT(fráze;” “;””))+1

Dále jsem zjistil počet dimenzí, které jsou prázdné, a odečetl od celkového počtu.

Vzorec: Počet dimenzí

= (celkový počet dimenzí)-COUNTIF(pole všech dimenzí;””)

Pak už stačilo jen zjistit rozdíl. 18 frází bylo o 5 slov delší, všechny jsem následně zařadil minimálně do dvou dalších dimenzí. 71 frází bylo o 4 slova delší a 111 frází o 3 slova. Většinu z nich jsem dále zařazoval.

Cíl splněn

Cílem pochopitelně nebylo dosáhnout naprosté rovnosti. Některé fráze obsahovaly nadbytečná slova, jiné naopak měly zápornou hodnotu, protože počet dimenzí převyšoval jejich délku.

Celá kontrola zabrala zhruba 1,5 hodiny. V celkovém součtu jsem tedy strávil 4,5 hodiny prací, kterou bych jinak musel dělat ručně přibližně 3x déle. A kromě obecného přehledu o trendech analýza poskytla přesnější výsledky.

Cíl splněn!