Lilith Lilith.

Złota zasada: Zbiór danych nie jest aktywem, jeśli zespół nie potrafi powiedzieć, skąd pochodzi, do czego wolno go użyć, jak został zmieniony i które modele z niego korzystały.

Czym jest łańcuch dostaw danych AI

To pełna droga od pozyskania danych przez trening i ewaluację aż po retencję oraz usunięcie. Obejmuje źródła, umowy i zgody, pobieranie, anotację, filtry, deduplikację, wersjonowanie, uprawnienia oraz zapis tego, który model użył którego wydania.

To ważniejsze niż hasło „więcej danych”. Dwa zbiory o rozmiarze terabajta mogą mieć przeciwną wartość. Jeden ma udokumentowane pochodzenie, sensowne pokrycie i jasne prawa. Drugi jest mieszaniną kopii, danych osobowych i treści na niejasnych warunkach. Model nie rozstrzygnie tej różnicy za organizację.

Otwarty internet nie jest po prostu „wyczerpany”. Nadal rośnie, a projekty takie jak Common Crawl tworzą jego rozległe migawki. Trudniej natomiast pozyskać nowy, jakościowy, różnorodny językowo i prawnie użyteczny materiał bez duplikatów. Część treści jest za kontem lub paywallem, część blokuje automatyczny dostęp, a coraz większa część może pochodzić od modeli.

Pozyskanie i pochodzenie

Każde źródło powinno mieć kartę: właściciel lub opiekun, URL albo system źródłowy, data i metoda pozyskania, warunki umowy, dozwolone cele, ograniczenia dalszego użycia, retencja i osoba odpowiedzialna. Do kupionego archiwum dołącz umowę. Dla webu zachowaj czas pobrania i obowiązujące wtedy warunki. Dla danych wewnętrznych zapisz system i proces, który je wytworzył.

Pochodzenie to nie jeden link, lecz łańcuch transformacji. Dokument mógł przejść przez OCR, tłumaczenie, anonimizację, klasyfikator jakości i korektę człowieka. Każdy etap może zmienić sens i status prawny. Datasheets for Datasets proponuje trwały wzorzec dokumentowania motywacji, składu, zbierania, preprocessingu, dystrybucji, utrzymania i ograniczeń.

Licencja, zgoda i podstawa prawna to różne rzeczy

  • Licencja określa, na co pozwala właściciel praw. Creative Commons rozróżnia między innymi uznanie autorstwa, użycie niekomercyjne i obowiązek zachowania tej samej licencji.
  • Zgoda to pozwolenie konkretnej osoby na określone użycie jej danych. Gdy stanowi podstawę przetwarzania, musi spełniać wymagania i może zostać wycofana.
  • Podstawa prawna uzasadnia przetwarzanie danych osobowych. Zgoda jest tylko jedną z możliwości, a publiczna dostępność nie oznacza dowolności.
  • Regulamin platformy reguluje relację z usługą i może ograniczać automatyczne pobieranie widocznych treści.
  • Akceptowalność etyczna jest osobnym testem. Zbiór możliwy do obrony prawnej może naruszać rozsądne oczekiwania ludzi lub szkodzić wrażliwej społeczności.

Prawa oceniaj dla konkretnego celu i jurysdykcji, nie jednym polem „legal”. Spory wydawców i twórców z firmami AI pokazują, że dane są częścią modelu biznesowego. Otwarte modele potrzebują przejrzystości, lecz licencje źródeł mogą ograniczać redystrybucję. System zamknięty nie usuwa problemu, tylko utrudnia niezależny audyt.

Czyszczenie, deduplikacja i jakość

Czyszczenie nie jest kosmetyką. Pipeline usuwa zwykle błędne kodowanie, szablony, spam, malware, sekrety, dane osobowe, krótkie urywki i treści spoza domeny. Filtry mogą jednak po cichu wycinać języki mniejszościowe, dialekty lub trudne przypadki. Mierz to, co przechodzi i odpada, według języka, źródła i istotnej grupy.

Usuwaj dokładne i podobne kopie między zbiorem treningowym, walidacyjnym i testowym. Inaczej model zapamiętuje powtórzenia, a benchmark mierzy wyciek zamiast generalizacji. Badanie Deduplicating Training Data Makes Language Models Better łączy duplikaty z memorowaniem i zniekształconą oceną. Zachowuj hashe, reguły podobieństwa, progi i mapę usunięć oraz wersję filtra.

Dane syntetyczne są narzędziem, nie perpetuum mobile

Pomagają w rzadkich przypadkach, kontrolowanych wariantach, symulacji, self-play i ewaluacjach bezpieczeństwa. Mogą ograniczyć pracę na wrażliwych rekordach. Nie są jednak automatycznie anonimowe ani poprawne. Generator może odtworzyć dane osobowe, błędy, stereotypy i artefakty własnego treningu.

„Model collapse” nie oznacza, że każdy syntetyczny przykład szkodzi. Praca AI models collapse when trained on recursively generated data pokazuje ryzyko, gdy kolejne generacje zastępują pierwotny rozkład wynikami modeli. Obroną jest zachowanie wysokiej jakości danych rzeczywistych, zapis generatora i promptu, niezależna kontrola, filtrowanie, oznaczenie pochodzenia oraz testy na ludzkich danych niewidzianych przez generator.

Multimodalność i świat fizyczny

Tekst jest jedną gałęzią. Obraz, mowa, wideo, robotyka i systemy autonomiczne potrzebują kamer, mikrofonów, sensorów, telemetrii, map, scen 3D i śladów działań. Dochodzą kalibracja sprzętu, synchronizacja czasu, geometria anotacji i bezpieczeństwo fizyczne.

Nagranie z fabryki może jednocześnie zawierać twarze pracowników, tajemnice przedsiębiorstwa i niebezpieczne zdarzenie. Demonstracja robota jest związana z konkretną maszyną i otoczeniem. Zapisuj urządzenie, miejsce, czas, kalibrację, anotatora, zgody, warunki i martwe pola. C2PA daje przydatny wzorzec technicznego pochodzenia mediów, ale nie dowodzi prawdziwości ani nie nadaje praw treningowych.

Prywatność, bezpieczeństwo, lineage i audyt

Minimalizuj dane przed zapisaniem, nie dopiero przed wydaniem modelu. Oddziel identyfikatory, szyfruj transmisję i magazyn, stosuj role i dostęp czasowy, loguj eksporty oraz wymuszaj usuwanie. Zasady GDPR obejmują ograniczenie celu, minimalizację, poprawność, retencję, integralność i rozliczalność.

Dataset jest też powierzchnią ataku. Można wprowadzić poisoning, prompt injection ukryty w dokumencie, złośliwy plik lub sekret przeznaczony do późniejszego wydobycia. Trzymaj surowe dane jako niezmienne i odizolowane, uruchamiaj transformacje w sandboxie, skanuj pliki, zatwierdzaj źródła i monitoruj przesunięcia rozkładu.

Lineage powinien łączyć źródło → wersja raw → transformacja → wydanie datasetu → trening → model. Każdy węzeł potrzebuje stabilnego ID, czasu, właściciela, hasha, konfiguracji i wersji wejściowych. Po wycofaniu zgody albo zgłoszeniu błędu przez dostawcę zespół potrafi wskazać modele i zdecydować o retreningu, unlearningu lub wycofaniu wersji.

Dostawcy i infrastruktura full-stack

Dostawca sprzedaje nie tylko pliki, lecz także ciągły dostęp, anotatorów, taksonomię, QA i czasem ewaluacje. Lock-in powstaje, gdy nie można zobaczyć źródeł, wyeksportować etykiet, przejąć schematu albo odtworzyć filtrów. Umowa powinna obejmować prawo audytu, podwykonawców, usuwanie, incydenty, zmianę licencji, eksport, zakończenie usługi i odpowiedzialność za błędne etykiety.

Łączy to dane z całą infrastrukturą AI. Model, compute, storage, katalog, anotacja, ewaluacje i governance nie są niezależnymi zakupami. Model open-weight bez audytowalnych danych nie tworzy w pełni otwartego systemu. Zamknięte API z dobrymi kontrolami może być operacyjnie bezpieczniejsze, ale skupia zaufanie w providerze. Open kontra closed oceniaj warstwa po warstwie.

Praktyczny plan

  1. Zdefiniuj cel i zakazane użycia. Co model ma robić, a czego nie wolno wnioskować?
  2. Załóż rejestr źródeł. Właściciel, pochodzenie, licencja, podstawa prawna, zgoda, jurysdykcja, retencja i kontakt.
  3. Oddziel raw, curated i release. Raw pozostaje niezmienny, każda transformacja ma wersję.
  4. Dodaj bramkę wejściową. Malware, sekrety, PII, format, jakość, język, wiek i dozwolony cel.
  5. Deduplikuj między splitami. Sprawdzaj benchmark contamination i zachowuj mapę podobieństw.
  6. Mierz reprezentację. Języki, modalności, źródła, okresy i grupy narażone na ryzyko.
  7. Oznaczaj syntetyki. Generator, wersja, prompt, seed, filtry, kontrola i udział w miksie.
  8. Wymagaj datasheetu i lineage. Brak dokumentacji oznacza brak dostępu do treningu.
  9. Ogranicz dostęp i przećwicz incydent. Czy umiesz wyeksportować, usunąć i prześledzić zbiór?
  10. Uruchamiaj ewaluacje przed wydaniem. Jakość, bias, privacy leakage, bezpieczeństwo i zmiany licencji.

Typowe błędy

  • „Publiczne znaczy wolne”: widoczność nie jest licencją, zgodą ani podstawą prawną.
  • Jeden wielki lake bez lineage: po problemie nie wiadomo, które modele ucierpiały.
  • Deduplikacja tylko w jednym pliku: kopie między źródłami i benchmarkami zostają.
  • Nieoznaczone syntetyki: nie da się zmierzyć ani usunąć wadliwego generatora.
  • Filtry jakości tylko dla angielskiego: inne języki znikają po cichu.
  • Dostawca jako czarna skrzynka: tani start, drogi audyt i bolesne wyjście.
  • Privacy review po treningu: dane są już w checkpointach i backupach.
  • Dokumentacja bez egzekwowania: datasheet istnieje, ale job przyjmuje dowolną ścieżkę.

Źródła i dalsza lektura

Co zapamiętać

Przewagą nie jest największa sterta danych. Jest nią zdolność zbudowania i obrony miksu, odtworzenia transformacji, usunięcia wadliwego źródła i pomiaru skutków. Dobry łańcuch łączy prawa, jakość, bezpieczeństwo i ewaluacje modelu w jednym audytowalnym przepływie. Jeśli na pytanie „skąd model to wie?” zespół odpowiada tylko „z naszego datasetu”, nie ma łańcucha dostaw. Ma pudełko.