Przejdź do treści

Źródła danych

Strona dokumentuje wszystkie zbiory danych wykorzystywane przez surname.pl. Dla każdego źródła podajemy bezpośredni adres, licencję oraz datę ostatniego pobrania. Skrótowe zestawienie licencji oraz opis oznaczeń etymologii znajdziesz na stronie Metodologia.

Rejestr źródeł

Pełny rejestr zbiorów danych wykorzystywanych w surname.pl wraz z URL, licencją i datą pobrania
DatasetAdres źródłaLicencjaData pobrania
Nazwiska występujące w rejestrze PESEL — nazwiska męskiehttps://dane.gov.pl/pl/dataset/1681CC0 1.02026-04-06
Nazwiska występujące w rejestrze PESEL — nazwiska żeńskiehttps://dane.gov.pl/pl/dataset/1681CC0 1.02026-04-07
Nazwiska występujące w rejestrze PESEL — rozkład wojewódzki (męskie i żeńskie)https://dane.gov.pl/pl/dataset/1681CC0 1.02026-07-22
Wikidata SPARQL (P734 — nazwisko)https://www.wikidata.org/wiki/Property:P734CC0 1.02026-04-07
Etymologia LLM (Claude) — sztuczna inteligencja/metodologia (wewnętrzne)wygenerowane na potrzeby projektu2026-04-18
Język pochodzenia LLM (Claude Haiku) — sztuczna inteligencja/metodologia (wewnętrzne)wygenerowane na potrzeby projektu2026-04-22
Granice województw (GeoJSON — click_that_hood)https://github.com/codeforamerica/click_that_hoodMIT2026-04-27
Amazon Polly (synteza mowy, głos Ewa)https://aws.amazon.com/polly/wygenerowane na potrzeby projektu2026-04-30

Dane o nazwiskach pochodzą z publicznego zbioru danych «Nazwiska występujące w rejestrze PESEL», udostępnianego na portalu dane.gov.pl przez Ministerstwo Cyfryzacji (licencja CC0 1.0).

Do czego używamy każdego źródła

Poniżej krótki opis funkcji, jaką każde z powyższych źródeł pełni w pipeline surname.pl. Ten rozdział uzupełnia tabelę o kontekst pipeline’owy — przydatny dla badaczy weryfikujących pochodzenie konkretnej informacji.

Nazwiska występujące w rejestrze PESEL — nazwiska męskie
Zasób «nazwiska męskie» (stan na 2026-01-20) publicznego zbioru danych udostępnionego na portalu dane.gov.pl. Dane zasilają liczbę «mężczyzn w Polsce» na każdej stronie nazwiska, ranking ogólnopolski oraz listy alfabetyczne. Plik źródłowy liczy 408 182 wiersze; po sprowadzeniu pisowni do jednolitej postaci (wielkość liter, znaki diakrytyczne) baza zawiera 390 648 nazwisk.
Nazwiska występujące w rejestrze PESEL — nazwiska żeńskie
Zasób «nazwiska żeńskie» (stan na 2026-01-20) tego samego publicznego zbioru danych, 420 082 wiersze. Wykorzystywany do liczby «kobiet w Polsce» na każdej stronie oraz do walidacji form żeńskich generowanych algorytmicznie (-ski → -ska, -cki → -cka).
Nazwiska występujące w rejestrze PESEL — rozkład wojewódzki (męskie i żeńskie)
Dwa zasoby (męski i żeński, stan na 2026-01-20) z liczbą nosicieli w podziale na 16 województw według województwa zameldowania na pobyt stały. Zasilają wykres rozkładu regionalnego i mapę na każdej stronie nazwiska oraz listy nazwisk rzadkich w danym regionie. Zakres: 28 416 813 osób, czyli 79% z 35 947 925 nosicieli — źródło obejmuje wyłącznie osoby zameldowane na pobyt stały i nie publikuje liczebności równych 1 w podziale na województwa, więc suma wojewódzka jest z założenia niższa od liczby nosicieli.
Wikidata SPARQL (P734 — nazwisko)
Lista znanych osób noszących dane nazwisko (z linkami do haseł Wikipedii) zaciągana z punktu końcowego SPARQL po właściwości P734. Pojawia się jako sekcja «Znani nosiciele» na stronach nazwisk.
Etymologia LLM (Claude) — sztuczna inteligencja
Etymologia opracowana indywidualnie przez model językowy Claude na podstawie analizy rdzenia, przyrostka i kontekstu lingwistycznego — 10 465 nazwisk. Pozostałe nazwiska mają opis algorytmiczny, złożony z rozpoznanego rdzenia i przyrostka. Oba rodzaje są wyraźnie oznaczone na stronie nazwiska; żaden nie jest weryfikacją źródłową.
Język pochodzenia LLM (Claude Haiku) — sztuczna inteligencja
Klasyfikator języka pochodzenia (np. polski, niemiecki, ukraiński, łaciński) dla 50 000 najczęstszych nazwisk. Zasila etykietę «Język pochodzenia» na stronach nazwisk oraz filtry hub-pages (rdzenie, przyrostki).
Granice województw (GeoJSON — click_that_hood)
Rzeczywiste kontury 16 województw Polski (po reformie z 1999 roku) z otwartego zbioru click_that_hood, uproszczone i zrzutowane do jednego bazowego pliku SVG. Wykorzystywane przez mapę rozkładu regionalnego na stronach nazwisk.
Amazon Polly (synteza mowy, głos Ewa)
Nagrania wymowy generowane maszynowo dla 10 000 najczęstszych nazwisk (silnik Standard, głos polski «Ewa»). Odtwarzacz pojawia się wyłącznie na stronach, dla których plik został wygenerowany. To synteza mowy, nie nagranie lektora.

Aktualność danych

Daty w kolumnie «Data pobrania» odnoszą się do momentu pobrania źródłowych plików do lokalnego pipeline’u (nie zaś do daty publikacji datasetu przez wydawcę). Wpisy starsze niż 6 miesięcy są oznaczone etykietą nieaktualne; ich obecność oznacza, że planowane jest odświeżenie zbioru. Daty nie są zaokrąglane ani fałszowane — odświeżenie pliku w pipeline pociąga za sobą bezpośrednią aktualizację tej strony.

Skrótowe zestawienie licencji oraz opis oznaczeń etymologii znajdziesz na stronie Metodologia. Kontekst projektu — kto stoi za serwisem i jaka jest jego motywacja — opisany jest na stronie O nas.