Hipoteza
Co dokładnie chcemy sprawdzić i jaka różnica byłaby istotna.
Ta część serwisu opisuje sposób przygotowania i dokumentowania eksperymentów dotyczących modeli, RAG, automatyzacji i infrastruktury. Nie jest katalogiem wyników bez kontekstu.
Co dokładnie chcemy sprawdzić i jaka różnica byłaby istotna.
Model, runtime, sprzęt, dane i parametry istotne dla wyniku.
Jawna metryka, powtórzenia i zapis wyników.
Wniosek wraz z ograniczeniami i zakresem, którego dotyczy.
Jakość odpowiedzi, retrieval, kontekst, regresja i zachowanie przy braku danych.
Duplikaty, retry, timeouty, błędne wejścia, stan procesu i ręczne przejęcie.
Latencja, przepustowość, pamięć, nasycenie, długie obciążenie i odtwarzanie po awarii.
Kontrakty danych, zmiany schematu, błędy zależności i odporność przepływu.
Wynik liczbowy powinien być publikowany razem z warunkami potrzebnymi do jego interpretacji. Szczegółowy standard opisuje metodologia benchmarków.