Imaginează-ți că vrei să îți populezi automat catalogul cu date de produs extrase de pe alte site-uri, dar printre rezultate apar și recenzii semnate cu nume complet și adresă de email. În acel moment, proiectul tău de crawling nu mai este doar despre titluri și prețuri — a intrat pe teritoriul GDPR.
GDPR se aplică oricărei colectări de date cu caracter personal, indiferent dacă datele respective sunt publice pe internet sau nu; faptul că o informație poate fi văzută de oricine pe un site nu îi elimină automat statutul de dată personală și nu îți dă, prin sine, dreptul de a o prelua și stoca.
Acest ghid explică ce sunt datele cu caracter personal în contextul unui proiect de crawling, ce temei legal ai nevoie pentru a le prelucra, ce categorii de date sunt de regulă sigure de colectat, cum reduci riscul prin anonimizare și filtrare, și când un proiect de colectare la scară mare necesită o evaluare de impact (DPIA) înainte de a porni.
Ce este o dată cu caracter personal, conform GDPR
Regulamentul General privind Protecția Datelor definește datele cu caracter personal ca orice informație referitoare la o persoană fizică identificată sau identificabilă — direct (nume, CNP, adresă de email personală) sau indirect, prin combinarea mai multor elemente care, împreună, permit identificarea unei persoane (de exemplu, o combinație de oraș, ocupație și dată de naștere).
În practică, un proiect de crawling poate întâlni date personale în locuri neaparente: recenzii ale clienților semnate cu nume real, comentarii pe bloguri, profiluri publice de utilizatori, adrese de email listate în secțiuni de contact personal sau fotografii care includ fețe identificabile.
Denumirile de firmă, codurile de produs, prețurile, descrierile tehnice sau imaginile de catalog nu sunt, de regulă, date cu caracter personal, pentru că nu se referă la o persoană fizică identificabilă — acesta este motivul pentru care majoritatea proiectelor de crawling orientate spre eCommerce au un risc GDPR redus, dacă rămân strict pe acest tip de date.
Date publice pe internet vs date colectabile legal: de ce nu sunt același lucru
O confuzie frecventă este ideea că „dacă e public pe internet, pot să-l copiez”. GDPR nu funcționează așa: publicarea unei date personale de către o persoană sau de către un terț nu constituie automat un consimțământ pentru ca altcineva să o colecteze, să o stocheze și să o prelucreze în alt scop.
Diferența practică este între a vizualiza o informație și a o prelucra sistematic. Un vizitator uman care citește o recenzie pe un site nu „prelucrează” acea dată în sensul GDPR; un script de crawling care extrage automat mii de recenzii cu nume și le stochează într-o bază de date proprie, pentru un scop diferit de cel inițial, face exact acest lucru.
De aceea, întrebarea corectă pentru un proiect de crawling nu este „este public?”, ci „am un temei legal pentru a colecta și stoca această dată în scopul meu specific?”.
Ce temei legal poți invoca pentru un proiect de crawling
GDPR cere un temei legal explicit pentru orice prelucrare de date cu caracter personal. Pentru proiectele de crawling orientate spre business (monitorizare preturi, populare catalog, cercetare de piață), temeiurile relevante sunt de obicei:
- Interes legitim — cel mai frecvent invocat pentru colectare de date de produs sau de piață, dar necesită o evaluare de echilibru (balancing test) între interesul tău de business și impactul asupra persoanei vizate; acest temei nu este automat valabil dacă datele colectate sunt sensibile sau volumul este mare.
- Consimțământ — rar aplicabil în crawling, pentru că persoana vizată nu știe, de regulă, că datele ei sunt colectate de un terț printr-un script automat.
- Executarea unui contract — relevant doar dacă persoana vizată are deja o relație contractuală directă cu compania care colectează datele, ceea ce rareori este cazul într-un proiect de crawling extern.
Recomandarea practică pentru majoritatea proiectelor de crawling este să eviți complet colectarea de date cu caracter personal, decât dacă există un motiv de business clar și un temei legal documentat înainte de a începe proiectul — este mai simplu și mai sigur să filtrezi datele personale la sursă decât să construiești un temei legal solid pentru fiecare categorie de date colectată.
Categorii de date: ce este de regulă sigur vs ce necesită atenție
Tabelul de mai jos sintetizează, orientativ, riscul GDPR pentru categoriile de date întâlnite frecvent în proiectele de crawling pentru eCommerce și cercetare de piață.
| Categorie de date | Risc GDPR | Recomandare practică |
|---|---|---|
| Titlu, preț, cod produs, descriere tehnică | Redus | Colectare standard, fără măsuri suplimentare |
| Imagini de catalog (produs, ambalaj) | Redus | Colectare standard, verifică doar drepturile de autor |
| Recenzii cu nume complet sau username identificabil | Mediu-ridicat | Exclude câmpul de autor sau anonimizează înainte de stocare |
| Adrese de email sau numere de telefon listate public | Ridicat | Exclude explicit din scriptul de crawling |
| Fotografii cu persoane identificabile | Ridicat | Exclude sau anonimizează (blurare); necesită analiză separată |
Această clasificare este orientativă; riscul real depinde de scopul concret al proiectului, de volumul de date și de modul în care datele sunt folosite după colectare.
Cum reduci riscul GDPR direct în scriptul de crawling
Cea mai eficientă protecție împotriva unor probleme GDPR este să nu colectezi deloc datele personale, nu să le colectezi și să le protejezi ulterior. Câțiva pași practici, aplicabili direct în etapa de construire a scriptului:
- Definește explicit, înainte de a scrie scriptul, exact ce câmpuri de date sunt necesare scopului proiectului (de exemplu, doar titlu, preț, cod, imagine).
- Exclude din regulile de extragere orice câmp care ar putea conține nume, email, telefon sau alte identificatori personali, chiar dacă apar accidental în pagina sursă.
- Dacă extragi recenzii sau comentarii pentru analiză de sentiment, elimină sau anonimizează autorul înainte de stocare, nu după.
- Nu stoca adrese IP, cookie-uri sau alte identificatori tehnici ai vizitatorilor site-ului sursă — acestea nu sunt de obicei relevante pentru scopul unui proiect de date de produs.
- Documentează intern scopul proiectului, categoriile de date colectate și temeiul legal folosit, înainte de a lansa colectarea la scară.
- Stabilește o perioadă de retenție clară pentru datele colectate și un proces de ștergere după expirarea scopului.
Când ai nevoie de o evaluare de impact (DPIA) pentru un proiect de crawling
Pentru majoritatea proiectelor de crawling axate pe date de produs, o evaluare formală de impact asupra protecției datelor (DPIA) nu este necesară, pentru că riscul asupra persoanelor vizate este redus. GDPR recomandă o DPIA atunci când prelucrarea implică un risc ridicat pentru drepturile și libertățile persoanelor vizate — de exemplu, monitorizare sistematică la scară mare a persoanelor sau prelucrarea de categorii speciale de date.
Semnale care ar trebui să declanșeze o discuție despre DPIA, nu neapărat concluzia fermă că e obligatorie:
- Proiectul colectează, chiar și incidental, un volum mare de profiluri de persoane identificabile (nu doar produse).
- Datele colectate ar putea fi combinate cu alte seturi de date pentru a crea profiluri detaliate ale unor persoane.
- Sursa colectată include categorii speciale de date (sănătate, opinii politice, date biometrice).
Pentru aceste scenarii, recomandarea este consultarea unui responsabil cu protecția datelor (DPO) sau a unui specialist juridic înainte de a proiecta scriptul de colectare, nu după ce datele au fost deja extrase.
GDPR vs robots.txt: două verificări diferite, ambele necesare
Robots.txt și GDPR răspund la întrebări diferite și nu se pot substitui una pe alta. Robots.txt îți spune ce pagini un site permite tehnic să fie accesate de roboți; GDPR îți spune ce faci legal cu datele personale găsite pe acele pagini, indiferent dacă accesul tehnic a fost permis sau nu.
Un proiect de crawling corect verifică ambele: respectă directivele din robots.txt (detaliate în ghidul HappyWeb despre robots.txt și crawling legal) și, separat, filtrează sau documentează temeiul legal pentru orice dată cu caracter personal întâlnită în procesul de colectare.
Întrebări frecvente despre GDPR și crawling
Este legal să colectez date de produs (preț, titlu, cod) prin crawling?
Da, de regulă. Datele de produs nu sunt, în general, date cu caracter personal, deci nu intră direct sub incidența GDPR. Rămân relevante alte verificări, precum robots.txt și Termenii și Condițiile site-ului țintă.
Pot colecta recenzii de la clienți dacă sunt publice pe site?
Poți colecta conținutul recenziei, dar trebuie să tratezi cu atenție numele autorului sau alte identificatori personali asociați — cel mai sigur este să elimini sau să anonimizezi autorul înainte de stocare, chiar dacă recenzia este public vizibilă.
Ce se întâmplă dacă colectez accidental date personale printr-un script de crawling?
Recomandarea este să șteargă imediat datele respective din setul colectat și să ajustezi regulile scriptului pentru a exclude acele câmpuri pe viitor; documentează incidentul intern, mai ales dacă proiectul are volum mare de date.
GDPR se aplică și dacă compania mea nu este din Uniunea Europeană?
Da, dacă prelucrarea vizează date ale unor persoane aflate în Uniunea Europeană, GDPR se poate aplica indiferent de locul unde este stabilită compania care colectează datele.
Am nevoie de consimțământul persoanei pentru orice dată personală colectată prin crawling?
Nu neapărat consimțământ explicit, dar ai nevoie de un temei legal valid, documentat înainte de colectare. Pentru majoritatea proiectelor de business, cea mai sigură cale este să eviți complet colectarea datelor personale, nu să te bazezi pe un temei legal greu de justificat ulterior.
Concluzie: filtrează la sursă, nu remediază după colectare
Un proiect de crawling conform GDPR nu înseamnă evitarea completă a oricărei colectări de date, ci excluderea explicită a datelor cu caracter personal care nu sunt necesare scopului tău de business. Definirea clară a câmpurilor necesare, filtrarea lor direct în scriptul de colectare și documentarea temeiului legal transformă un proiect riscant într-unul care poate fi apărat, dacă este verificat.
Vrei un proiect de crawling construit cu filtrare GDPR inclusă de la etapa de planificare? Discută proiectul tău cu echipa HappyWeb sau vezi serviciul complet de preluare date online prin crawling.
Surse
- GDPR.eu — Ce este GDPR: gdpr.eu/what-is-gdpr.
- GDPR — Articolul 4, definiția datelor cu caracter personal: gdpr-info.eu/art-4-gdpr.
- GDPR — Articolul 6, temeiuri legale de prelucrare: gdpr-info.eu/art-6-gdpr.
- Serviciul HappyWeb de preluare date online prin crawling: happyweb.ro/servicii/servicii-servicii-preluare-date-online-crawling.
Notă: informațiile despre aspecte legale din acest articol au caracter orientativ și nu constituie consultanță juridică. Pentru proiecte de crawling cu volum mare de date sau surse sensibile, recomandăm consultarea unui responsabil cu protecția datelor (DPO) sau a unui specialist juridic înainte de a lansa colectarea.
Imagine generată cu AI, folosită în scop ilustrativ.
Scrie un comentariu