Excel wczytany 5 razy szybciej, baza na 100 tysięcy zapisów i prosta metoda, która pokonała sieć neuronową

Cotygodniowa dawka linków, czyli archiwum newslettera Dane i Analizy

W tym numerze wracają rzeczy, które da się zmierzyć. Przepisanie 1000 drobnych plików na 6 większych skróciło zapytania do danych o 31 do 63%, a zmiana jednego ustawienia przy wczytywaniu Excela zbija czas z 18,65 do 3,74 sekundy. Jeden z autorów sprawdził, czy sieć neuronowa wykryje nietypowe dane lepiej niż prosta klasyczna metoda. Nie wykryła, nawet gdy dane ułożył pod nią.

Drugi wątek to asystenci AI i to, co wolno im robić. Znajdziesz trzy podejścia: jak ograniczyć agenta, żeby ukryte w tekście polecenie nie zrobiło szkody, jak nauczyć automatycznego recenzenta kodu zasad firmy i jak dawać asystentowi tylko wybrane notatki zamiast całego dysku. Pasuje do nich tekst o tym, że platforma AI klikana ręcznie w panelu psuje się tak samo jak każda inna.

Dalej są teksty o danych i infrastrukturze: kontrola jakości danych przed wysłaniem ich do raportów, koszty różnych sposobów zapisywania wyników, baza, która przyjmuje 100 tysięcy zapisów na sekundę bez dzielenia na serwery, siedem błędów w ustawieniach chmury i pytanie, czy NGINX nadal jest domyślnym wyborem. Na koniec raporty trzymane jak kod oraz spór o to, czy programowanie z agentem zostawia miejsce dla analityków danych.


ai agent

Asystent AI bez dostępu do całego dysku

Asystent AI z dostępem do całego dysku i poczty dostaje więcej uprawnień, niż potrzebuje, a trudno przewidzieć, co z nimi zrobi. Autor wybrał odwrotne podejście: Claude’owi i ChatGPT podaje tylko wybrane notatki i opisy projektów, trzymane w osobnych folderach w Obsidianie. Pokazuje, jak ten układ wygląda w praktyce. Odpowiedzi wychodzą trafniejsze, a ryzyko wycieku mniejsze.

Barierki architektoniczne dla agentów AI

Agent AI czyta strony internetowe, zagląda do firmowych danych i wysyła maile, więc ukryte w tekście polecenie może zrobić szkodę. Autor zamiast prosić model o ostrożność, zawęża mu pole działania: w jednym ze wzorców model tylko wybiera akcję z gotowej, dozwolonej listy. Opisuje wdrożenie w firmie. Żaden wzorzec nie daje pełnej ochrony, a każdy kosztuje elastyczność.

Code reviewer AI z pamięcią

Automatyczny recenzent kodu zgłasza drobiazgi, bo nie zna zasad firmy i przy każdej zmianie zaczyna od zera. Zespół dał mu pamięć: wzorce zatwierdzone przez programistów, dopasowane do obszaru kodu, na przykład płatności. Recenzent wyłapuje teraz brak zabezpieczenia przed podwójnym obciążeniem klienta. Nowe reguły trafiają do pamięci dopiero po akceptacji człowieka.

ai ml

Autoenkoder kontra PCA

Sieci neuronowe mają wykrywać nietypowe dane lepiej niż klasyczna metoda PCA, bo łapią zależności, których ta nie widzi. Autor sprawdził to na dwóch zestawach, w tym na danych ułożonych specjalnie pod sieć. Klasyczna metoda wygrała nawet tam: 0,318 do 0,302 w mierze F1. Na łatwych danych obie zrównały się na 0,885.

Podobieństwo kosinusowe i rzut wektora

Popularna miara podobieństwa mówi, czy dwa wektory (liczbowe opisy treści) wskazują w tę samą stronę, ale nie mówi, jak duży jest wpływ jednego na drugi. Autor pokazuje rzut wektora, czyli operację, która zachowuje kierunek i dodaje informację o wielkości. Rozpisuje wzór krok po kroku. Ta sama operacja stoi za mechanizmem attention w modelach językowych.

Personalizacja Airbnb bez user_id

System rekomendacji nic nie wie o nowym gościu ani o kimś, kto odrzucił ciasteczka. Airbnb zamiast profilu użytkownika bierze zbiorczą aktywność grup około tysiąca osób z podobnej lokalizacji. W gęstych miastach dzieli te grupy, w rzadko zaludnionych obszarach je powiększa. Konwersja wzrosła, najbardziej wśród anonimowych i dawno nieobecnych użytkowników.

architektura

Iluzja low-code w platformach AI

Kupiony panel z formularzami sprawia wrażenie dojrzałej platformy AI, a pod spodem działa zwykły kod, który psuje się jak każdy inny. Autor przekonuje, że infrastrukturę danych i agentów trzeba budować przez automatyczne, wersjonowane wdrożenia, a nie klikać w panelu. Ręczne ustawienia dają kruche procesy, luki w bezpieczeństwie i ukryty dług techniczny.

YAML, XML czy JSON: gdzie który wygrywa

Zespoły spierają się, czy wybrać XML, JSON czy YAML, a ważniejsze jest, do czego dany format służy. Kai Waehner opisuje historię i mocne strony każdego: XML w starszych systemach firmowych, JSON w komunikacji między aplikacjami, YAML w konfiguracji. Radzi oddzielić zapis danych od sprawdzania ich poprawności. Przy agentach AI dochodzi koszt tokenów.

Jak myśli architekt danych?

Analitycy pytają kolegów, którym tabelom ufać, a każda zmiana w systemie przerzuca pracę na zespoły korzystające z danych. Ananth Packkildurai wskazuje pięć miejsc, gdzie narasta tarcie: znajdowanie danych, ich publikacja, definicje wskaźników, migracje i awarie. Dla każdego proponuje twardą gwarancję zamiast wiedzy z korytarza, na przykład dane z właścicielem i obiecaną świeżością.

bazy danych

100 tysięcy zapisów na sekundę w Postgresie

Gdy baza przyjmuje coraz więcej zapisów, pada propozycja rozbicia jej na wiele serwerów. Autor pokazuje, że jedna instancja PostgreSQL może przyjąć 100 tysięcy zapisów na sekundę. Wąskim gardłem jest domyślne potwierdzanie każdej transakcji na dysku, które da się zastąpić zapisem asynchronicznym i grupowaniem operacji. Rozbicie na serwery ma własną cenę: transakcje rozproszone i trudne migracje.

ciekawostki

Twórca RoR o programowaniu z agentami

Twórca Ruby on Rails mówi, że przeszedł na emeryturę jako programista, bo kod piszą za niego agenci AI. DHH pokazuje na Rails World 2026, jak to wygląda w praktyce: jego zespół przepisuje aplikację HEY na 6 aplikacji natywnych, a serwer na Rusta, którego szczerze nie znosi. Tłumaczy też, kiedy web nadal ma sens i czemu zamiast chatbotów woli linię poleceń dla własnego agenta.

data engineering

Materializacje w dbt a koszty

Sposób zapisywania wyników w dbt decyduje, ile zapłacisz za moc obliczeniową hurtowni i jak szybko ruszą raporty. Autor porównuje pięć strategii i pokazuje, gdzie która pasuje w potoku danych. Widoki nie zajmują miejsca, ale przy zagnieżdżeniach spowalniają raporty, a pełne tabele przy dużych wolumenach drenują budżet. Przyrostowe przeliczanie wchodzi, gdy zaczyna brakować czasu.

Bramki jakości danych w pipeline

Harmonogram zadań świeci na zielono, a do hurtowni trafiły niepełne dane i nikt tego nie zauważył. Autor wstawia w potok bramkę kontrolną: reguły sprawdzają unikalność, braki i typy wartości oraz nagłe odchylenia liczby wierszy. Gdy test nie przejdzie, potok staje przed wysyłką danych do raportów. Sprawdzanie tylko nowych porcji danych trzyma koszty w ryzach.

Kompaktowanie Iceberga: z 1000 plików do 6

Dane zapisywane co chwilę rozpadają się na tysiące drobnych plików, a system zapytań musi każdy z nich osobno otworzyć. Autor połączył 1000 plików (50 mln wierszy) w 6 większych i zmierzył trzy typowe zapytania. Czas spadł o 31 do 63%, na przykład z 1,58 s do 0,57 s. Przepisanie tabeli też kosztuje, więc przy rzadko czytanych danych może się nie zwrócić.

devops

NGINX w 2027: nadal domyślny wybór?

NGINX przez lata był standardowym wyborem do kierowania ruchem w sieci i obsługi szyfrowanych połączeń. W środowiskach opartych o Kubernetes jego rolę zaczynają przejmować nowsze narzędzia, projektowane pod automatyczną konfigurację. Tekst zestawia klasyczny NGINX z tymi alternatywami. Stawką jest, czy sprawdzona prostota wystarczy przy wielu małych usługach.

Siedem błędów w S3 prowadzących do wycieku

Wycieki danych z chmury Amazona najczęściej wynikają z błędów w ustawieniach, na przykład z publicznego dostępu do plików zostawionego po testach. Autor wymienia siedem takich pomyłek i pokazuje jedno ustawienie na poziomie całego konta, które blokuje publiczny dostęp nawet wtedy, gdy ktoś źle skonfiguruje pojedynczy zasób. Publiczne pliki mają być wyjątkiem, zatwierdzanym i kontrolowanym.

find, xargs i GNU parallel zamiast pętli for

Przetworzenie 40 tysięcy plików PDF zwykłą pętlą w terminalu trwało ponad 30 godzin, choć można to zrobić w niecałe pięć. Autor pokazuje, że pętla działa na jednym rdzeniu procesora, myli się przy spacjach w nazwach plików i zawiesza na jednym uszkodzonym dokumencie. Zastępuje ją trzema narzędziami linuksowymi, które wykorzystują wszystkie rdzenie, ubijają zawieszone zadania i wznawiają pracę.

management

Data science po erze vibe codingu

Agent AI napisze działający program w kilka minut, a nikt nie musi rozumieć, co trafiło na produkcję. Autor odpowiada na tezę o końcu data science: łatwe generowanie kodu nie zastępuje projektowania danych ani nadzoru nad modelami. Martwi go zwłaszcza rezygnacja z pomiarów, czyli ocena “u mnie działa” zamiast formalnych metryk jakości.

python

Excel w Pandas 5 razy szybciej

Wczytanie arkusza Excela z 400 tysiącami wierszy w Pandas trwa ponad 18 sekund, a bezpośrednio przez openpyxl 28 sekund i pożera 1,5 GB pamięci. Autor porównał osiem narzędzi do czytania Excela. Zmiana jednego argumentu (engine calamine) skraca czas do 3,74s przy tym samym wyniku, a Polars kończy w 1,51s. Dodatkowo - gdy arkusz ma formuły i scalone komórki, narzędzia zwracają trzy różne liczby wierszy.

wizualizacja danych

Dashboardy jako kod w dbt Charts

Dashboard w narzędziu BI zmienia się kliknięciem, bez historii zmian i przeglądu, a po przebudowie danych może cicho przestać działać. dbt Charts zapisuje wykresy jako pliki w repozytorium, więc podlegają tym samym przeglądom i testom co kod. Polecenia sprawdzają poprawność i pokazują, które kolumny dotknie zmiana. Definicje wskaźników biznesowych zostają w warstwie semantycznej dbt.