Załóżmy, że budujesz produkt analizujący rynek. Chcesz połączyć statystyki z portalu otwartych danych, informacje o osobach z publicznego rejestru i katalog prywatnej firmy. Wszystko można obejrzeć bez logowania. Zespół potrafi pobrać dane i ma już pomysł na trening modelu.
Technicznie jesteście blisko. Prawnie trzeba jeszcze ustalić, co wolno zrobić z każdym źródłem. Odpowiedź HTTP 200 niestety nie jest licencją.
Publiczna dostępność danych nie daje automatycznie prawa do ich dowolnego komercyjnego wykorzystania. Znaczenie mają zasady prawne dotyczące konkretnego źródła, prawa do treści i bazy, warunki dostępu oraz dane osobowe. Trening AI wymaga dodatkowo sprawdzenia zasad eksploracji tekstów i danych, czyli TDM.
W skrócie
- Otwarte dane sektora publicznego mogą służyć komercyjnemu produktowi, ale trzeba sprawdzić zakres ustawy i warunki konkretnego zbioru.
- Publiczny rejestr nie daje automatycznie prawa do kopiowania całości, budowania profili osób czy marketingu.
- Prywatna baza dostępna w sieci może być chroniona prawem autorskim, prawem do bazy i warunkami umownymi.
- RODO nadal dotyczy danych osobowych z publicznych źródeł.
- Wyjątek TDM może pozwalać na określone kopie do analizy, ale nie daje ogólnego prawa do sprzedaży datasetu.
Stan weryfikacji: 5 października 2026 r. Tekst rozdziela wspólne ramy UE i ich polskie wykonanie; warunki konkretnego API lub rejestru trzeba sprawdzić osobno.
Najpierw rozpoznaj źródło danych
Otwarty dataset, publiczny rejestr i prywatna strona to trzy różne punkty wyjścia. W naszym produkcie każdy wymaga osobnego sprawdzenia, nawet jeśli wszystkie trafiają do jednego pipeline’u.
| Źródło | Co sprawdzić przed użyciem? | Czego nie zakładać? |
|---|---|---|
| Otwarte dane sektora publicznego | Zakres ponownego wykorzystania, warunki, źródło, opłaty i prawa osób trzecich | Że każda informacja urzędu jest objęta takim samym zezwoleniem |
| Publiczny rejestr | Ustawę regulującą rejestr, sposób dostępu, reuse, API i dane osobowe | Że dostęp do pojedynczego wpisu pozwala pobrać i sprzedać całą bazę |
| Prywatna baza lub strona | Prawa autorskie, ochronę bazy, licencję, regulamin i TDM | Że brak logowania oznacza zgodę na kopiowanie |
Czy otwarte dane można wykorzystać w płatnym produkcie?
Tak, ponowne wykorzystywanie informacji sektora publicznego może mieć cel komercyjny. Trzeba jednak ustalić, czy konkretny zbiór i planowane użycie są objęte tymi przepisami. Podstawę w Polsce daje ustawa o otwartych danych z 11 sierpnia 2021 r., wdrażająca dyrektywę 2019/1024.
Ponowne wykorzystanie oznacza użycie informacji do innego celu niż zadanie publiczne, dla którego je wytworzono. Może obejmować aplikację, analizę czy usługę dla klientów. Zależnie od sytuacji możesz skorzystać z opublikowanych informacji albo złożyć wniosek o ich udostępnienie do ponownego wykorzystania.
Punktem wyjścia jest wykorzystanie bez warunków i bez opłat. Ustawa przewiduje jednak dopuszczalne warunki, np. wskazanie źródła, czasu pozyskania i przetworzenia, oraz wyjątki od bezpłatności. Dodatkowe koszty przygotowania określonego udostępnienia mogą mieć znaczenie; biblioteki, muzea i archiwa mają osobne rozwiązania. Dane badawcze też mają własny zakres, m.in. związany z publicznym finansowaniem i wcześniejszym udostępnieniem.
Dla naszego produktu oznacza to: przy zbiorze statystyk sprawdź metadane i warunki. Zapisz, czy wolno go przekształcać i udostępniać dalej, co trzeba przypisać źródłu i czy ktoś trzeci ma prawa do części materiału. Informacje chronione, prywatność i prawa osób trzecich ograniczają zakres reuse. Sam fakt przechowywania materiału przez urząd nie usuwa tych ograniczeń.
API i dane o wysokiej wartości
API określa sposób pobierania danych. Uprawnienie do ich wykorzystania wynika z właściwych przepisów i warunków, nie z samego istnienia endpointu.
Dla konkretnych zbiorów o wysokiej wartości rozporządzenie wykonawcze 2023/138 ustanawia dodatkowe wymogi: m.in. udostępnienie bezpłatnie, w formacie do odczytu maszynowego, przez API i, tam gdzie wskazuje to załącznik, do pobrania zbiorczego. Trzeba uwzględnić zakres i wyjątki tego reżimu. Lista nie obejmuje automatycznie wszystkich publicznych rejestrów. Komisja wyjaśnia zasady dostępu do takich zbiorów.
Publiczny rejestr: dostęp i reuse trzeba sprawdzić osobno
Możliwość wyszukania wpisu w rejestrze nie rozstrzyga wszystkich dalszych zastosowań. Ustal ustawę dotyczącą rejestru, zakres udostępnianych danych, drogę uzyskania większego zbioru i zasady dalszego użycia.
Wskazywany czasem jako ogólna podstawa dostępu art. 15 ustawy o informatyzacji ma określonych adresatów i cel. Zapewnia nieodpłatny dostęp podmiotom publicznym oraz innym podmiotom realizującym zadania publiczne, w zakresie niezbędnym do tych zadań. Dane uzyskane tą drogą służą ich realizacji.
Dla komercyjnego produktu istotny jest ust. 4: przekazanie danych do ponownego wykorzystania w innym celu odsyła do ustawy o otwartych danych. Art. 15 nie jest więc samodzielnym zezwoleniem na komercyjne scrapowanie dowolnego rejestru.
Aktualny tekst ustawy pokazuje również przyszłe brzmienie ust. 2 z wyraźnym odniesieniem do API, wchodzące w życie 23 lutego 2027 r. Nie traktuj go jako przepisu obowiązującego już w październiku 2026 r. Nie rozszerza ono też celu tego trybu dostępu na dowolny biznes.
Wracając do naszego produktu: wykorzystanie informacji o osobach z rejestru wymaga osobnego uzasadnienia i analizy RODO. Uprawnienie do pobrania danych oraz podstawa ich dalszego przetwarzania muszą pasować do tego, co aplikacja rzeczywiście robi.
Prywatna baza: czy niechronione fakty można po prostu skopiować?
Pojedynczy fakt może nie być chroniony prawem autorskim, a cała baza nadal może podlegać ochronie. Trzeba rozdzielić prawa do treści, twórczego doboru lub układu oraz ochronę inwestycji w bazę.
Twórczy dobór lub układ może być utworem na podstawie prawa autorskiego, art. 3. Osobne prawo, określane jako sui generis, chroni bazę spełniającą warunki istotnego nakładu inwestycyjnego. Daje producentowi kontrolę nad pobieraniem i wtórnym wykorzystaniem całości lub istotnej części. Podstawę stanowią dyrektywa 96/9/WE i polska ustawa o ochronie baz danych.
Nie każda tabela jest taką chronioną bazą. Nakład trzeba ocenić. TSUE w sprawie C-203/02, British Horseracing Board, odróżnia nakład na pozyskanie, weryfikację lub prezentację zawartości od nakładu na samo stworzenie danych.
Istotna część nie ma uniwersalnego progu w rodzaju „10% wierszy”. Liczy się ilość, ale także jakość i nakład dotyczący pobieranej części. Powtarzające się, systematyczne pobieranie małych porcji też może naruszać ochronę. Pobieranie danych scraperem w mniejszych batchach nie rozstrzyga legalności.
Jest również ważna granica uprawnień producenta: zgodny z prawem użytkownik publicznie udostępnionej bazy ma ustawowe prawo do nieistotnych części, z ograniczeniami dotyczącymi normalnego korzystania i interesów producenta. Sprzeczne postanowienia umowne są nieważne w zakresie wskazanym w art. 7 polskiej ustawy. To nadal nie jest prawo do odtworzenia całości po kawałku ani wyłączenie RODO.
Przy prywatnym katalogu z naszego przykładu sprawdź więc ochronę, warunki korzystania i zakres planowanego pobrania. Regulamin nie jest ustawą, ale jego znaczenia nie można pominąć; trzeba uwzględnić zawarcie umowy i obowiązujące wyjątki. Licencja API na wewnętrzną analizę może mieć inny zakres niż licencja pozwalająca sprzedawać bazę klientom.
Dane osobowe: publikacja w sieci nie wyłącza RODO
Jeżeli można zidentyfikować osobę, publiczne źródło nie zwalnia firmy z ustalenia celu, podstawy i zasad przetwarzania. Złączenie kilku zbiorów może stworzyć profil znacznie bardziej szczegółowy niż pojedynczy wpis.
Jeśli opierasz się na prawnie uzasadnionym interesie, trzeba określić interes, wykazać niezbędność i ocenić, jak ten interes wypada wobec praw i uzasadnionych oczekiwań osób. „Dane były w internecie” jest jednym z faktów do oceny, nie całym testem. EDPB w opinii 28/2024 o modelach AI analizuje m.in. wpływ publicznej dostępności i uzasadnionych oczekiwań na tę ocenę.
Przy danych pozyskanych pośrednio dochodzi obowiązek informacyjny z art. 14 RODO. Co do zasady informację trzeba przekazać w rozsądnym terminie, najpóźniej w ciągu miesiąca; wcześniejsza komunikacja z osobą lub ujawnienie danych może przyspieszyć termin. Wyjątki mają warunki. Duża liczba rekordów sama nie uzasadnia pominięcia informacji. Przy powoływaniu się na niewspółmierny wysiłek potrzebna jest ocena i właściwe zabezpieczenia, w tym publiczne udostępnienie informacji.
Ustal też zakres danych, czas przechowywania, aktualizacje i obsługę sprzeciwu. Przy profilowaniu oceń jego skutki oraz dodatkowe obowiązki, w tym zasady decyzji podejmowanych wyłącznie automatycznie, gdy są spełnione ich przesłanki. Dane szczególnych kategorii, np. o zdrowiu, wymagają osobnej przesłanki z art. 9. Wyjątek dotyczący danych wyraźnie upublicznionych przez osobę nie obejmuje automatycznie informacji opublikowanej przez kogoś innego.
Dostępny publicznie kontakt nie przesądza też o dopuszczalności każdego kanału marketingowego. Prawo do przetwarzania danych i wymagane zgody na komunikację trzeba sprawdzić osobno. W Polsce tę drugą warstwę reguluje m.in. art. 398 Prawa komunikacji elektronicznej.
Czy można trenować AI na publicznym zbiorze?
Czasem tak, ale publiczny dostęp nie wystarcza. Trening komercyjnego modelu trzeba ocenić pod kątem dostępu, reuse, praw autorskich, praw do bazy, danych osobowych i warunków wykorzystania. Następnie sprawdzić, czy określone czynności mieszczą się w TDM.
TDM to automatyczna analiza tekstów lub danych w celu uzyskania informacji, np. wzorców i korelacji. Dyrektywa DSM 2019/790, art. 3 i 4, rozdziela dwa mechanizmy:
- Badania naukowe uprawnionych organizacji i instytucji dziedzictwa kulturowego. Mają własny zakres podmiotowy, cele i zabezpieczenia. Startup nie staje się uprawnioną organizacją badawczą przez nazwanie projektu „research”.
- Ogólny TDM, również komercyjny. Wymaga zgodnego z prawem dostępu i działa pod warunkiem, że uprawniony nie zastrzegł praw w odpowiedni sposób. Dla treści publicznie dostępnych online istotna jest maszynowo czytelna forma zastrzeżenia.
W Polsce ogólny mechanizm obejmują art. 26³ prawa autorskiego i art. 8a ustawy o ochronie baz danych. Przepisy przewidują wyraźne zastrzeżenie dostosowane do udostępnienia; przy publicznym dostępie online wymagają formatu do odczytu maszynowego wraz z metadanymi. Kopie można przechowywać w celu TDM tak długo, jak jest to konieczne. Badania naukowe mają odrębne zasady w art. 26² i art. 8b.
To nie daje ogólnej licencji na sprzedaż źródłowego datasetu ani publikację chronionych treści w odpowiedziach modelu. Brak zastrzeżenia TDM nie tworzy też podstawy przetwarzania danych osobowych. Nie rozstrzygaj skuteczności opt-out wyłącznie na podstawie jednej flagi w robots.txt; sprawdź sposób i treść zastrzeżenia w konkretnym źródle.
Jeśli firma jest dostawcą modelu ogólnego przeznaczenia, czyli GPAI, dochodzą obowiązki z AI Act dotyczące polityki zgodności z prawem autorskim i publicznego podsumowania treści treningowych. Nie dotyczą automatycznie każdego użytkownika AI. Komisja wyjaśnia zakres obowiązków GPAI, w tym zachowanie tych wymagań również przy określonych modelach open source. AI Act nie udziela licencji do danych.
Sprawdź też datę wprowadzenia modelu na rynek. Obowiązki GPAI stosuje się od 2 sierpnia 2025 r., ale dla modeli wprowadzonych wcześniej dostawcy mają czas na dostosowanie do 2 sierpnia 2027 r. Ten okres przejściowy nie zastępuje praw do materiału treningowego. Wynika z aktualnego AI Act, art. 111 i 113.
Jak sprawdzić dataset bez zatrzymywania całego projektu?
Wróćmy do produktu z początku. Zamiast jednego pola „publiczne: tak” w dokumentacji przygotuj kartę każdego źródła:
- Źródło i dostęp. Kto prowadzi zbiór, jaki reżim prawny działa i skąd wynika prawo dostępu? Zapisz wersję warunków i datę pobrania.
- Planowane użycie. Analiza wewnętrzna, płatny produkt, udostępnienie danych klientom czy trening? Sprawdź warunki, przypisanie źródła, prawa do bazy oraz wielkość i sposób pobierania.
- Dane osobowe. Które pola identyfikują osoby, po co ich potrzebujesz, jaka jest podstawa i jak poinformujesz osoby, ograniczysz zakres danych, ustalisz czas przechowywania i obsłużysz ich prawa?
- AI/TDM. Czy masz zgodny z prawem dostęp, czy istnieje zastrzeżenie, na czym opierasz kopie i jak długo je przechowujesz? Czy twoja rola uruchamia obowiązki GPAI?
Możesz rozpocząć od statystyk bez danych osobowych, jeśli warunki pozwalają na zamierzone użycie. Źródło z rejestru i prywatny katalog pozostaw poza tą częścią pipeline’u do czasu sprawdzenia. Połączenie danych nie usuwa ograniczeń, które miały ich poszczególne źródła.
Taką dokumentację warto połączyć z AI governance i ustaleniami w umowie z dostawcą AI, jeśli dataset lub trening trafia do zewnętrznego dostawcy.
W ramach obsługi prawnej produktów SaaS możemy sprawdzić źródła razem z przepływem danych i planem produktu. Prześlij listę źródeł i opis zastosowania. Ważne jest, co firma chce zrobić z danymi, a nie tylko to, skąd da się je pobrać.
Główne źródła
- Ustawa o otwartych danych, dyrektywa 2019/1024 i rozporządzenie 2023/138: reuse i dane o wysokiej wartości.
- Ustawa o informatyzacji, art. 15: zakres dostępu do rejestrów dla zadań publicznych i odesłanie dla innych celów.
- Dyrektywa 96/9/WE, ustawa o ochronie baz danych i TSUE C-203/02: nakład, pobieranie i wtórne wykorzystanie.
- Prawo autorskie i dyrektywa DSM: struktura bazy oraz TDM.
- RODO i opinia EDPB 28/2024: dane osobowe, uzasadniony interes i modele AI.
- AI Act, aktualny tekst skonsolidowany oraz Komisja o obowiązkach GPAI: polityka praw autorskich i przejrzystość treści treningowych.