Ako funguje detekcia AI textu

Sedem detektorov, sedem rôznych otázok. Čo každý z nich meria, z čoho vychádza a kde má hranice.

DetekciaGPT pošle text naraz siedmim detektorom a skóre každého z nich ukáže zvlášť, na stupnici od 0 do 100. Päť z nich beží priamo u nás a každý meria jednu vlastnosť: odchýlku od vašich skorších textov, vernosť šablóne zvoleného typu textu, frázy typické pre AI, strojový rytmus viet a skryté znaky. Ďalšie dva sú samostatné modely, OpenAI a ZeroGPT. Do jedného čísla ich nezlučujeme, pretože každý meria inú vlastnosť textu a ich rozpor je sám osebe informácia. K číslam patrí farebná mapa textu a vety, ktoré jednotlivé detektory označili. Žiadny detektor AI textu nemá stopercentnú presnosť, takže výsledok je podklad, nie verdikt.

Čo sa s textom stane pred detekciou

Najprv sa rozpozná jazyk textu — čeština, slovenčina, angličtina, alebo nemčina — podľa písmen typických pre daný jazyk a najbežnejších slov. Podľa jazyka sa vyberajú zoznamy fráz, ukážky na porovnanie aj meradlá štýlu. Pri iných jazykoch nemá časť detektorov s čím porovnávať a výsledok je len orientačný.

Potom sa z textu vyradia časti, ktoré autor nepísal vlastnými slovami alebo ktoré majú predpísanú podobu: zoznam literatúry, citácie, poznámky pod čiarou, popisy obrázkov a tabuliek, obsah, abstrakt v inom jazyku, poďakovanie, čestné vyhlásenie, opakované záhlavie strán a pri e-mailoch a listoch oslovenie, podpis a citovaná predchádzajúca správa. Keby zostali, skreslili by skóre. Typ textu, ktorý vyberiete, určuje, čo sa vyradí a podľa akej šablóny sa text posúdi.

Sedem detektorov

Všetkých sedem beží súčasne. Keď niektorý neodpovie, ostatné čísla platia ďalej a chýba len to jedno.

Odchýlka štýlu

Ako veľmi sa štýl textu líši od vašich skorších textov. Porovnáva vlastnosti, ktoré človek vedome takmer nemení: dĺžku viet a slov a ich rozptyl, bohatosť slovnej zásoby, podiel dlhých a krátkych slov, interpunkciu, podiel veľkých písmen, diakritiky a číslic a početnosť najbežnejších slov jazyka. Úseky, ktoré sa odchyľujú najviac, sa zvýraznia fialovo.

Z čoho vychádza:Vaše vlastné texty v rovnakom jazyku: až päťdesiat posledných kontrol rovnakého typu textu a nahrané vzorové texty, ktoré majú dvojnásobnú váhu. Kontroly, pri ktorých ZeroGPT, Frázy AI alebo samotná Odchýlka štýlu prekročili 50, sa do základne nepočítajú, aby sa neučila z textov od AI.

Hranica:Nabehne až od šiestich textov dlhších ako 250 znakov. Meria zmenu štýlu, nie AI — iný štýl môže mať aj iný dôvod, napríklad spoluautora, inú tému alebo dôkladnú korektúru.

Šablóna typu

Ako presne text sedí na osnovu typu, ktorý ste vybrali. Sleduje rovnako dlhé odseky, rozsekanie na veľa krátkych odsekov, odrážky s rovnako dlhými položkami, nadpisy, riadky v tvare „Pojem: vysvetlenie“, výpočty po troch, hashtagy a nedostatok konkrétnych údajov, ako sú čísla a vlastné mená.

Z čoho vychádza:Pravidlá pre desať typov textu: esej, odborná práca, úvaha, rozprávanie, blog, príspevok, recenzia, e-mail, motivačný list a správa. Každý typ váži signály inak — pri eseji hrajú hlavnú úlohu rovnomerné odseky, výpočty po troch a všeobecnosť, pri správe nadpisy, odrážky a krátke odseky.

Hranica:Nula neznamená, že písal človek, a človek, ktorý píše podľa prísnej osnovy, napríklad správu alebo odbornú prácu, môže vyjsť vysoko. Pri nemčine sa nedostatok konkrétnych údajov nemeria, pretože sa v nej všetky podstatné mená píšu s veľkým písmenom.

Frázy AI

Koľko je v texte obratov a formátovania typických pre jazykové modely — napríklad „v dnešnej dobe“, „je dôležité si uvedomiť“ alebo „v neposlednom rade“, ale aj dlhé pomlčky, šípky, tučné zvýraznenie, nadpisy a tabuľky v markdowne alebo emoji. Nájdené frázy sa zvýraznia žlto.

Z čoho vychádza:Zoznam viac než 5 600 fráz v češtine, slovenčine, angličtine a nemčine, v ktorom silné frázy majú dvojnásobnú váhu. Nálezy sa prepočítavajú na sto slov, takže dlhší text nevyjde vyššie len preto, že je dlhší.

Hranica:Vidí len to, čo je na zozname. Človek, ktorý píše ustáleným úradným štýlom, môže vyjsť vysoko, a text od AI, z ktorého niekto frázy vyškrtal, nízko. Jedna fráza nič nedokazuje, rozhoduje ich hustota.

Strojový dojem

Ako strojovo pôsobí stavba textu. Z polovice ho určuje to, ako podobne dlhé sú vety, z tridsiatich percent ošúchané obraty a z dvadsiatich percent slová a trojice slov, ktoré sa v texte opakujú.

Z čoho vychádza:Štatistika samotného textu, bez porovnania s inými textami. Rovnaké číslo ukazuje humanizácia, takže je vidieť, ako sa strojový dojem po prepise zmenil.

Hranica:Krátky text má málo viet na to, aby sa rytmus dal spoľahlivo zmerať. Strohý odborný alebo úradný štýl s podobne dlhými vetami môže pôsobiť strojovo, aj keď ho písal človek.

Skryté znaky

Neviditeľné znaky, ktoré sa prenesú kopírovaním: nulové medzery, riadiace a smerové znaky, nezvyčajné druhy medzier a písmená s diakritikou zložené z dvoch znakov. Pri nahranom súbore navyše hľadá podpísaný záznam o pôvode podľa štandardu C2PA.

Z čoho vychádza:Počet takých znakov na tisíc znakov textu. Niektoré z nich sa v bežnom písaní nevyskytujú vôbec a jediný stačí na 100. Na 100 vyjde aj súbor, ktorého záznam o pôvode s platným podpisom uvádza, že obsah vytvorila AI.

Hranica:Nula neznamená, že písal človek — stačí text prepísať alebo vložiť ako obyčajný text a znaky zmiznú. Niektoré z nich naopak vznikajú aj bez AI, napríklad pri kopírovaní z PDF.

OpenAI

Jazykový model OpenAI prečíta text ako celok a odhadne, aká jeho časť pochádza od AI. Vráti aj vety, ktoré ho k tomu viedli, a tie sa zvýraznia modro.

Z čoho vychádza:Porovnanie s ukážkami. Model dostane osem textov rovnakého typu a jazyka, o ktorých sa vie, že ich napísala AI, a k nim ukážky ľudského písania z jazykových korpusov. Rovnaký text dostane vždy rovnaké ukážky. Dlhý text sa posudzuje po častiach do dvanástich tisíc znakov a výsledok sa váži ich dĺžkou.

Hranica:Je to úsudok iného jazykového modelu, nie meranie, a môže sa mýliť oboma smermi. Pri texte na hrane sa jeho odhad môže medzi dvoma kontrolami mierne líšiť.

ZeroGPT

Samostatný detektor služby ZeroGPT. Vráti podiel textu, ktorý považuje za AI, a vety, ktoré označil; tie sa zvýraznia červeno.

Z čoho vychádza:Vlastný model služby ZeroGPT. Dlhší text sa posiela po častiach do dvanástich tisíc znakov a výsledok sa váži ich dĺžkou.

Hranica:Ako skóre počíta a na akých textoch sa učil, služba nezverejňuje, takže jeho číslo sa nedá vysvetliť zvnútra. Je to ďalší nezávislý pohľad popri ostatných, nie rozhodca.

Ako čítať výsledok

Každé číslo sa číta zvlášť a hovorí len to, čo meria jeho detektor. Šesťdesiat pri Frázach AI znamená hustý výskyt typických obratov, nie že šesťdesiat percent textu napísala AI. Keď sa detektory zhodnú na rovnakých pasážach, máte silnejší podklad. Keď každý ukazuje inam, text je hraničný a rozhodnutie treba oprieť o niečo ďalšie.

Farby v texte ukazujú, kto čo označil: fialovo úseky s najväčšou odchýlkou od vášho štýlu, žlto frázy AI, modro vety od OpenAI a červeno vety od ZeroGPT. Keď rovnaký alebo upravený text kontrolujete znova, pri číslach sa ukáže aj zmena oproti minulej kontrole.

Spoľahlivosť klesá pri krátkych textoch, pri prekladoch, pri textoch nerodených hovoriacich a pri textoch, ktoré AI len upravila. Výsledok je preto podklad na rozhovor alebo na ďalšie overenie, nie dôkaz.

Skúste to na vlastnom texte

Vložte text alebo nahrajte súbor a pozrite sa na skóre aj na konkrétne vety, ktoré vyšli podozrivo.

Spustiť detekciu