Metodologia
Strona dokumentuje wszystkie zewnętrzne źródła danych wykorzystywane w serwisie surname.pl, ich licencje oraz sposób, w jaki oznaczamy treści zweryfikowane wobec generowanych algorytmicznie. Pełniejszy rejestr datasetów wraz z bezpośrednimi linkami do plików źródłowych znajdziesz na stronie Źródła danych.
Źródła danych i licencje
| Dataset | Licencja | Data pobrania |
|---|---|---|
| Nazwiska występujące w rejestrze PESEL — częstość | CC0 1.0 | 2026-04-06 |
| Nazwiska występujące w rejestrze PESEL — rozkład wojewódzki | CC0 1.0 | 2026-04-07 |
| Wikidata (P734 — nazwisko) | CC0 1.0 | 2026-04-07 |
| Etymologia LLM (Claude) | wygenerowane na potrzeby projektu | 2026-04-18 |
Daty w kolumnie «Data pobrania» odnoszą się do momentu pobrania źródłowych plików. Publiczny zbiór danych «Nazwiska występujące w rejestrze PESEL», udostępniany na portalu dane.gov.pl przez Ministerstwo Cyfryzacji, zawiera stan na styczeń 2026.
Skąd pochodzą etymologie
Żadna etymologia w serwisie nie jest weryfikacją źródłową opartą na literaturze onomastycznej. Import haseł z Wiktionary został rozważony i odrzucony — jakość materiału dla nazwisk okazała się zbyt niska, by go publikować. Pod każdą etymologią znajduje się etykieta wskazująca, w jaki sposób powstała:
- Etymologia wygenerowana · AI — przygotowana przez model językowy na podstawie rdzenia, przyrostka i kontekstu lingwistycznego. Obejmuje 10 465 nazwisk. Ma charakter orientacyjny i może zawierać nieścisłości.
- Etymologia algorytmiczna (szara kropka) — wynik automatycznej analizy budowy nazwiska (rdzeń i przyrostek), bez udziału modelu językowego. Obejmuje pozostałe nazwiska i jest z natury mniej dokładna.
Dzięki etykiecie czytelnik od razu wie, czy ma do czynienia z opisem opracowanym przez model językowy, czy z wynikiem analizy budowy nazwiska.