From 3ea2489f45765d8d656928ac61664656b20eac76 Mon Sep 17 00:00:00 2001 From: sysops Date: Fri, 28 Aug 2026 10:52:27 +0200 Subject: [PATCH 1/2] QA-08: tenant-router (TEN-06) + ratelimit (API-03) + apiserver (API-01) auf api-05-basis portiert --- internal/apiserver/context.go | 20 +++ internal/apiserver/errors.go | 31 +++++ internal/apiserver/middleware.go | 56 +++++++++ internal/apiserver/server.go | 37 ++++++ internal/apiserver/server_test.go | 149 +++++++++++++++++++++++ internal/ratelimit/middleware.go | 64 ++++++++++ internal/ratelimit/middleware_test.go | 136 +++++++++++++++++++++ internal/ratelimit/ratelimit.go | 126 +++++++++++++++++++ internal/ratelimit/ratelimit_test.go | 168 ++++++++++++++++++++++++++ internal/tenant/router.go | 136 +++++++++++++++++++++ internal/tenant/router_test.go | 160 ++++++++++++++++++++++++ 11 files changed, 1083 insertions(+) create mode 100644 internal/apiserver/context.go create mode 100644 internal/apiserver/errors.go create mode 100644 internal/apiserver/middleware.go create mode 100644 internal/apiserver/server.go create mode 100644 internal/apiserver/server_test.go create mode 100644 internal/ratelimit/middleware.go create mode 100644 internal/ratelimit/middleware_test.go create mode 100644 internal/ratelimit/ratelimit.go create mode 100644 internal/ratelimit/ratelimit_test.go create mode 100644 internal/tenant/router.go create mode 100644 internal/tenant/router_test.go diff --git a/internal/apiserver/context.go b/internal/apiserver/context.go new file mode 100644 index 0000000..9ed7ca9 --- /dev/null +++ b/internal/apiserver/context.go @@ -0,0 +1,20 @@ +package apiserver + +import "context" + +type contextKey int + +const requestContextKey contextKey = iota + +// RequestContext ist der Tenant-/Benutzerkontext, den die Middleware-Kette +// fuer nachgelagerte Handler bereitstellt (Akzeptanzkriterium 3). +type RequestContext struct { + UserID string + TenantSlug string +} + +// FromContext liest den von der Middleware gesetzten Kontext. +func FromContext(ctx context.Context) (RequestContext, bool) { + rc, ok := ctx.Value(requestContextKey).(RequestContext) + return rc, ok +} diff --git a/internal/apiserver/errors.go b/internal/apiserver/errors.go new file mode 100644 index 0000000..2d952bf --- /dev/null +++ b/internal/apiserver/errors.go @@ -0,0 +1,31 @@ +// Package apiserver implementiert Core API-01: das REST-Grundgerüst mit +// URL-Versionierung, einheitlichem Fehlerformat und Middleware-Kette +// (Auth, Tenant-/Benutzerkontext, Logging). +package apiserver + +import ( + "encoding/json" + "net/http" +) + +// errorBody ist das EINE Fehlerschema fuer alle Endpunkte unter /api/{version}/ +// (Akzeptanzkriterium 2). +type errorBody struct { + Error struct { + Code string `json:"code"` + Message string `json:"message"` + } `json:"error"` +} + +// WriteError schreibt einen Fehler im einheitlichen Schema. code ist ein +// stabiler, maschinenlesbarer Bezeichner (z.B. "unauthenticated"), message +// ein fuer Menschen lesbarer deutscher Text. +func WriteError(w http.ResponseWriter, status int, code, message string) { + var body errorBody + body.Error.Code = code + body.Error.Message = message + + w.Header().Set("Content-Type", "application/json") + w.WriteHeader(status) + _ = json.NewEncoder(w).Encode(body) +} diff --git a/internal/apiserver/middleware.go b/internal/apiserver/middleware.go new file mode 100644 index 0000000..1587071 --- /dev/null +++ b/internal/apiserver/middleware.go @@ -0,0 +1,56 @@ +package apiserver + +import ( + "context" + "log/slog" + "net/http" + "time" + + "gitea.perlbach24.de/scripte/nexarch/internal/auth" +) + +// authAndTenantContext prueft die Session (wiederverwendet auth.TokenIssuer.Verify +// aus IAM-02 — keine zweite JWT-Implementierung) und setzt bei Erfolg +// RequestContext fuer nachgelagerte Handler (Akzeptanzkriterium 3). Anders +// als auth.RequireAuth (Klartext-Fehler) antwortet diese Middleware im +// einheitlichen API-01-Fehlerschema (Akzeptanzkriterium 2), damit ALLE +// Endpunkte unter /api/{version}/ dasselbe Format liefern, auch bei +// Auth-Fehlern. +func authAndTenantContext(issuer *auth.TokenIssuer, next http.HandlerFunc) http.HandlerFunc { + return func(w http.ResponseWriter, r *http.Request) { + cookie, err := r.Cookie(auth.CookieName) + if err != nil { + WriteError(w, http.StatusUnauthorized, "unauthenticated", "nicht angemeldet") + return + } + + claims, err := issuer.Verify(cookie.Value) + if err != nil { + WriteError(w, http.StatusUnauthorized, "unauthenticated", "nicht angemeldet") + return + } + + rc := RequestContext{UserID: claims.UserID, TenantSlug: claims.TenantSlug} + next(w, r.WithContext(context.WithValue(r.Context(), requestContextKey, rc))) + } +} + +type statusRecorder struct { + http.ResponseWriter + status int +} + +func (s *statusRecorder) WriteHeader(code int) { + s.status = code + s.ResponseWriter.WriteHeader(code) +} + +// loggingMiddleware protokolliert jede Anfrage strukturiert. +func loggingMiddleware(next http.HandlerFunc) http.HandlerFunc { + return func(w http.ResponseWriter, r *http.Request) { + rec := &statusRecorder{ResponseWriter: w, status: http.StatusOK} + start := time.Now() + next(rec, r) + slog.Info("api-anfrage", "method", r.Method, "path", r.URL.Path, "status", rec.status, "dauer", time.Since(start)) + } +} diff --git a/internal/apiserver/server.go b/internal/apiserver/server.go new file mode 100644 index 0000000..bd0c0a7 --- /dev/null +++ b/internal/apiserver/server.go @@ -0,0 +1,37 @@ +package apiserver + +import ( + "net/http" + + "gitea.perlbach24.de/scripte/nexarch/internal/auth" +) + +// Server registriert versionierte API-Routen (Akzeptanzkriterium 1: unter +// /api/{version}/...) und verdrahtet fuer jede Route dieselbe Middleware- +// Kette (Logging -> Auth+Tenantkontext -> Handler). +type Server struct { + mux *http.ServeMux + issuer *auth.TokenIssuer +} + +func NewServer(issuer *auth.TokenIssuer) *Server { + return &Server{mux: http.NewServeMux(), issuer: issuer} +} + +// Handle registriert pattern unter der angegebenen Version, z.B. +// Handle("v1", "/things", h) -> erreichbar unter /api/v1/things. Verschiedene +// Versionen sind unabhaengige Pfade — eine neue Version beeintraechtigt +// bestehende nicht (Akzeptanzkriterium 1 / Pruefung 3). +func (s *Server) Handle(version, pattern string, h http.HandlerFunc) { + full := "/api/" + version + pattern + s.mux.HandleFunc(full, loggingMiddleware(authAndTenantContext(s.issuer, h))) +} + +// HandleV1 ist die Kurzform fuer die aktuelle Hauptversion. +func (s *Server) HandleV1(pattern string, h http.HandlerFunc) { + s.Handle("v1", pattern, h) +} + +func (s *Server) Handler() http.Handler { + return s.mux +} diff --git a/internal/apiserver/server_test.go b/internal/apiserver/server_test.go new file mode 100644 index 0000000..6375976 --- /dev/null +++ b/internal/apiserver/server_test.go @@ -0,0 +1,149 @@ +package apiserver + +import ( + "encoding/json" + "net/http" + "net/http/httptest" + "testing" + + "gitea.perlbach24.de/scripte/nexarch/internal/auth" +) + +func newTestServer() (*Server, *auth.TokenIssuer) { + issuer := auth.NewTokenIssuer("test-secret-nur-fuer-tests") + return NewServer(issuer), issuer +} + +func withAuthCookie(req *http.Request, token string) *http.Request { + req.AddCookie(&http.Cookie{Name: auth.CookieName, Value: token}) + return req +} + +// Akzeptanzkriterium 1: API unter versioniertem Pfad erreichbar. +func TestHandleV1_RegistersUnderVersionedPath(t *testing.T) { + srv, issuer := newTestServer() + srv.HandleV1("/things", func(w http.ResponseWriter, r *http.Request) { + w.WriteHeader(http.StatusOK) + }) + + token, err := issuer.Issue("user-1", "acme") + if err != nil { + t.Fatalf("issue: %v", err) + } + + req := withAuthCookie(httptest.NewRequest(http.MethodGet, "/api/v1/things", nil), token) + rec := httptest.NewRecorder() + srv.Handler().ServeHTTP(rec, req) + if rec.Code != http.StatusOK { + t.Fatalf("status = %d, want 200", rec.Code) + } +} + +// Akzeptanzkriterium 2 + Pruefung 1 (Stichprobe): mehrere Endpunkte liefern +// bei fehlerhafter Anfrage dasselbe Fehlerschema. +func TestErrorFormat_ConsistentAcrossEndpoints(t *testing.T) { + srv, _ := newTestServer() + srv.HandleV1("/endpunkt-a", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) }) + srv.HandleV1("/endpunkt-b", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) }) + + for _, path := range []string{"/api/v1/endpunkt-a", "/api/v1/endpunkt-b"} { + req := httptest.NewRequest(http.MethodGet, path, nil) // ohne cookie -> 401 + rec := httptest.NewRecorder() + srv.Handler().ServeHTTP(rec, req) + + if rec.Code != http.StatusUnauthorized { + t.Fatalf("%s: status = %d, want 401", path, rec.Code) + } + var body errorBody + if err := json.Unmarshal(rec.Body.Bytes(), &body); err != nil { + t.Fatalf("%s: fehlerantwort nicht im erwarteten json-schema: %v (body: %s)", path, err, rec.Body.String()) + } + if body.Error.Code == "" || body.Error.Message == "" { + t.Fatalf("%s: erwartet nicht-leeren code/message, habe %+v", path, body) + } + } +} + +// Akzeptanzkriterium 3 + Pruefung 2: Middleware-Kette setzt Tenant-/ +// Benutzerkontext zuverlaessig, nachweislich fuer mehrere Endpunkte. +func TestMiddleware_SetsRequestContextForEveryEndpoint(t *testing.T) { + srv, issuer := newTestServer() + + var gotA, gotB RequestContext + srv.HandleV1("/kontext-a", func(w http.ResponseWriter, r *http.Request) { + gotA, _ = FromContext(r.Context()) + w.WriteHeader(http.StatusOK) + }) + srv.HandleV1("/kontext-b", func(w http.ResponseWriter, r *http.Request) { + gotB, _ = FromContext(r.Context()) + w.WriteHeader(http.StatusOK) + }) + + token, err := issuer.Issue("user-42", "tenant-x") + if err != nil { + t.Fatalf("issue: %v", err) + } + + for path, got := range map[string]*RequestContext{"/api/v1/kontext-a": &gotA, "/api/v1/kontext-b": &gotB} { + req := withAuthCookie(httptest.NewRequest(http.MethodGet, path, nil), token) + rec := httptest.NewRecorder() + srv.Handler().ServeHTTP(rec, req) + if rec.Code != http.StatusOK { + t.Fatalf("%s: status = %d, want 200", path, rec.Code) + } + if got.UserID != "user-42" || got.TenantSlug != "tenant-x" { + t.Fatalf("%s: request-context unerwartet: %+v", path, *got) + } + } +} + +// Akzeptanzkriterium 1 + Pruefung 3: eine neue v2-Route laesst sich anlegen, +// ohne v1 zu beeintraechtigen. +func TestVersioning_V2DoesNotAffectV1(t *testing.T) { + srv, issuer := newTestServer() + srv.HandleV1("/things", func(w http.ResponseWriter, r *http.Request) { + w.Write([]byte("v1-antwort")) + }) + srv.Handle("v2", "/things", func(w http.ResponseWriter, r *http.Request) { + w.Write([]byte("v2-antwort")) + }) + + token, err := issuer.Issue("user-1", "acme") + if err != nil { + t.Fatalf("issue: %v", err) + } + + reqV1 := withAuthCookie(httptest.NewRequest(http.MethodGet, "/api/v1/things", nil), token) + recV1 := httptest.NewRecorder() + srv.Handler().ServeHTTP(recV1, reqV1) + if recV1.Body.String() != "v1-antwort" { + t.Fatalf("v1 antwort = %q, want v1-antwort", recV1.Body.String()) + } + + reqV2 := withAuthCookie(httptest.NewRequest(http.MethodGet, "/api/v2/things", nil), token) + recV2 := httptest.NewRecorder() + srv.Handler().ServeHTTP(recV2, reqV2) + if recV2.Body.String() != "v2-antwort" { + t.Fatalf("v2 antwort = %q, want v2-antwort", recV2.Body.String()) + } + + // v1 nach dem Anlegen von v2 erneut pruefen — unveraendert. + reqV1Again := withAuthCookie(httptest.NewRequest(http.MethodGet, "/api/v1/things", nil), token) + recV1Again := httptest.NewRecorder() + srv.Handler().ServeHTTP(recV1Again, reqV1Again) + if recV1Again.Body.String() != "v1-antwort" { + t.Fatalf("v1 antwort nach v2-anlage = %q, want weiterhin v1-antwort", recV1Again.Body.String()) + } +} + +func TestAuthAndTenantContext_RejectsInvalidToken(t *testing.T) { + srv, _ := newTestServer() + srv.HandleV1("/geschuetzt", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) }) + + req := withAuthCookie(httptest.NewRequest(http.MethodGet, "/api/v1/geschuetzt", nil), "kaputtes.token.hier") + rec := httptest.NewRecorder() + srv.Handler().ServeHTTP(rec, req) + if rec.Code != http.StatusUnauthorized { + t.Fatalf("status = %d, want 401", rec.Code) + } +} diff --git a/internal/ratelimit/middleware.go b/internal/ratelimit/middleware.go new file mode 100644 index 0000000..0828267 --- /dev/null +++ b/internal/ratelimit/middleware.go @@ -0,0 +1,64 @@ +package ratelimit + +import ( + "fmt" + "math" + "net/http" + + "gitea.perlbach24.de/scripte/nexarch/internal/apiserver" +) + +// KeyFunc bestimmt den Rate-Limit-Schluessel fuer eine Anfrage — typischerweise +// der Tenant-Slug aus apiserver.RequestContext, siehe KeyByTenant. Als +// eigenstaendiger Typ austauschbar (z.B. spaeter API-Token-basiert), ohne +// internal/apiserver aendern zu muessen (Kein Umbau angrenzender Bereiche). +type KeyFunc func(r *http.Request) (string, bool) + +// KeyByTenant liest den Tenant aus dem von internal/apiserver.authAndTenantContext +// gesetzten RequestContext (IAM-02/API-01) — dieselbe Middleware-Kette, +// keine zweite Authentifizierung. +func KeyByTenant(r *http.Request) (string, bool) { + rc, ok := apiserver.FromContext(r.Context()) + if !ok || rc.TenantSlug == "" { + return "", false + } + return rc.TenantSlug, true +} + +// Middleware setzt sich VOR den eigentlichen Handler (nach Auth+Tenant- +// Kontext, siehe KeyByTenant) und lehnt Anfragen ueber dem konfigurierten +// Limit mit 429 + Retry-After ab (Akzeptanzkriterium 3). +func Middleware(store *Store, keyFn KeyFunc, next http.HandlerFunc) http.HandlerFunc { + return func(w http.ResponseWriter, r *http.Request) { + key, ok := keyFn(r) + if !ok { + // Kein Schluessel ermittelbar (z.B. kein Tenant-Kontext) — die + // Auth-Pruefung selbst ist Sache von authAndTenantContext, hier + // wird nur nicht limitiert, wenn schon kein Kontext vorliegt. + next(w, r) + return + } + + result, err := store.Allow(r.Context(), key) + if err != nil { + apiserver.WriteError(w, http.StatusInternalServerError, "rate_limit_error", "rate-limit-pruefung fehlgeschlagen") + return + } + + w.Header().Set("X-RateLimit-Limit", fmt.Sprintf("%d", result.Limit)) + w.Header().Set("X-RateLimit-Remaining", fmt.Sprintf("%d", result.Remaining)) + + if !result.Allowed { + retryAfterSeconds := int(math.Ceil(result.RetryAfter.Seconds())) + if retryAfterSeconds < 1 { + retryAfterSeconds = 1 + } + w.Header().Set("Retry-After", fmt.Sprintf("%d", retryAfterSeconds)) + apiserver.WriteError(w, http.StatusTooManyRequests, "rate_limit_exceeded", + "zu viele anfragen, bitte spaeter erneut versuchen") + return + } + + next(w, r) + } +} diff --git a/internal/ratelimit/middleware_test.go b/internal/ratelimit/middleware_test.go new file mode 100644 index 0000000..cadf761 --- /dev/null +++ b/internal/ratelimit/middleware_test.go @@ -0,0 +1,136 @@ +package ratelimit + +import ( + "context" + "net/http" + "net/http/httptest" + "os" + "testing" + "time" + + "github.com/jackc/pgx/v5/pgxpool" + + "gitea.perlbach24.de/scripte/nexarch/internal/apiserver" + "gitea.perlbach24.de/scripte/nexarch/internal/auth" +) + +func setupMiddlewareTest(t *testing.T) (*apiserver.Server, *auth.TokenIssuer, *Store, func()) { + t.Helper() + adminDSN := os.Getenv("TEST_ADMIN_DSN") + if adminDSN == "" { + t.Skip("TEST_ADMIN_DSN nicht gesetzt, Integrationstest uebersprungen") + } + ctx := context.Background() + + pool, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("pool: %v", err) + } + if _, err := pool.Exec(ctx, ` + CREATE TABLE IF NOT EXISTS rate_limit_configs ( + key TEXT PRIMARY KEY, limit_value INT NOT NULL, window_seconds INT NOT NULL + ); + CREATE TABLE IF NOT EXISTS rate_limit_counters ( + key TEXT NOT NULL, window_start TIMESTAMPTZ NOT NULL, count INT NOT NULL DEFAULT 0, + PRIMARY KEY (key, window_start) + ); + `); err != nil { + t.Fatalf("schema: %v", err) + } + + issuer := auth.NewTokenIssuer("test-secret-nur-fuer-tests") + srv := apiserver.NewServer(issuer) + store := NewStore(pool) + + cleanup := func() { pool.Close() } + return srv, issuer, store, cleanup +} + +// Akzeptanzkriterium 3 + Pruefung 2: Ueberschreitung liefert 429 mit +// Retry-After-Header, ueber die vollstaendige Middleware-Kette (Auth -> +// Tenant-Kontext -> Rate-Limit -> Handler) hinweg. +func TestMiddleware_Returns429WithRetryAfterOnExceeded(t *testing.T) { + srv, issuer, store, cleanup := setupMiddlewareTest(t) + defer cleanup() + ctx := context.Background() + + tenantSlug := newTestKey() + if err := store.SetLimit(ctx, tenantSlug, 1, time.Minute); err != nil { + t.Fatalf("setlimit: %v", err) + } + + called := 0 + srv.HandleV1("/limited", Middleware(store, KeyByTenant, func(w http.ResponseWriter, r *http.Request) { + called++ + w.WriteHeader(http.StatusOK) + })) + + token, err := issuer.Issue("user-1", tenantSlug) + if err != nil { + t.Fatalf("issue: %v", err) + } + + req1 := httptest.NewRequest(http.MethodGet, "/api/v1/limited", nil) + req1.AddCookie(&http.Cookie{Name: auth.CookieName, Value: token}) + rec1 := httptest.NewRecorder() + srv.Handler().ServeHTTP(rec1, req1) + if rec1.Code != http.StatusOK { + t.Fatalf("1. anfrage: status = %d, want 200", rec1.Code) + } + + req2 := httptest.NewRequest(http.MethodGet, "/api/v1/limited", nil) + req2.AddCookie(&http.Cookie{Name: auth.CookieName, Value: token}) + rec2 := httptest.NewRecorder() + srv.Handler().ServeHTTP(rec2, req2) + if rec2.Code != http.StatusTooManyRequests { + t.Fatalf("2. anfrage: status = %d, want 429", rec2.Code) + } + if rec2.Header().Get("Retry-After") == "" { + t.Fatal("erwartet gesetzten Retry-After-Header bei 429") + } + if called != 1 { + t.Fatalf("handler wurde %d mal aufgerufen, want genau 1 (2. anfrage haette nicht durchgereicht werden duerfen)", called) + } +} + +// Akzeptanzkriterium 1: das Limit ist pro Tenant konfigurierbar — ein +// anderer Tenant (anderer Key) bleibt von der Ausschoepfung unberuehrt. +func TestMiddleware_DifferentTenantsHaveIndependentLimits(t *testing.T) { + srv, issuer, store, cleanup := setupMiddlewareTest(t) + defer cleanup() + ctx := context.Background() + + tenantA := newTestKey() + tenantB := newTestKey() + if err := store.SetLimit(ctx, tenantA, 1, time.Minute); err != nil { + t.Fatalf("setlimit a: %v", err) + } + if err := store.SetLimit(ctx, tenantB, 1, time.Minute); err != nil { + t.Fatalf("setlimit b: %v", err) + } + + srv.HandleV1("/limited2", Middleware(store, KeyByTenant, func(w http.ResponseWriter, r *http.Request) { + w.WriteHeader(http.StatusOK) + })) + + tokenA, _ := issuer.Issue("user-a", tenantA) + tokenB, _ := issuer.Issue("user-b", tenantB) + + // Tenant A schoepft sein Limit aus. + reqA := httptest.NewRequest(http.MethodGet, "/api/v1/limited2", nil) + reqA.AddCookie(&http.Cookie{Name: auth.CookieName, Value: tokenA}) + recA := httptest.NewRecorder() + srv.Handler().ServeHTTP(recA, reqA) + if recA.Code != http.StatusOK { + t.Fatalf("tenant a, 1. anfrage: status = %d, want 200", recA.Code) + } + + // Tenant B ist von der Ausschoepfung bei A unberuehrt. + reqB := httptest.NewRequest(http.MethodGet, "/api/v1/limited2", nil) + reqB.AddCookie(&http.Cookie{Name: auth.CookieName, Value: tokenB}) + recB := httptest.NewRecorder() + srv.Handler().ServeHTTP(recB, reqB) + if recB.Code != http.StatusOK { + t.Fatalf("tenant b haette trotz ausgeschoepftem limit von tenant a erlaubt sein muessen, status = %d", recB.Code) + } +} diff --git a/internal/ratelimit/ratelimit.go b/internal/ratelimit/ratelimit.go new file mode 100644 index 0000000..e7a45a2 --- /dev/null +++ b/internal/ratelimit/ratelimit.go @@ -0,0 +1,126 @@ +// Package ratelimit implementiert Core API-03: eine zentrale Rate-Limiting- +// Schicht fuer die gesamte Core-API mit GETEILTEM, EXTERNEM Zustand in +// Postgres — kein In-Process-Zaehler (siehe "Bekannte Fehler vermeiden" im +// Ticket: dasselbe Risiko wie bei IAM-07s In-Memory-Lockout). Fixed-Window- +// Algorithmus: einfach, korrekt unter nebenlaeufigem Zugriff (atomares +// UPSERT wie internal/usage.Store.Increment), und fuer ein API-Gateway +// ausreichend praezise — kein Sliding-Window-Overhead noetig. +package ratelimit + +import ( + "context" + "fmt" + "time" + + "github.com/jackc/pgx/v5" + "github.com/jackc/pgx/v5/pgxpool" +) + +// DefaultLimit/DefaultWindow gelten fuer jeden Schluessel (Tenant oder +// API-Token), fuer den keine eigene Konfiguration existiert +// (Akzeptanzkriterium 1: "konfigurierbar", nicht "verpflichtend konfiguriert"). +const ( + DefaultLimit = 100 + DefaultWindow = time.Minute +) + +// Config ist das je Schluessel konfigurierbare Limit. +type Config struct { + Limit int + Window time.Duration +} + +// Store haelt Konfiguration UND Zaehlerstand in Postgres — beides ueber +// dieselbe Verbindung erreichbar, damit mehrere Dienstinstanzen denselben +// Zustand sehen (Akzeptanzkriterium 2). +type Store struct { + pool *pgxpool.Pool +} + +func NewStore(pool *pgxpool.Pool) *Store { + return &Store{pool: pool} +} + +// SetLimit setzt die Konfiguration fuer EINEN Schluessel (z.B. einen +// Tenant-Slug oder eine API-Token-ID) — wirkt sich nicht auf andere +// Schluessel aus (Akzeptanzkriterium 1 / Pruefung 3). +func (s *Store) SetLimit(ctx context.Context, key string, limit int, window time.Duration) error { + _, err := s.pool.Exec(ctx, ` + INSERT INTO rate_limit_configs (key, limit_value, window_seconds) + VALUES ($1, $2, $3) + ON CONFLICT (key) DO UPDATE SET limit_value = $2, window_seconds = $3 + `, key, limit, int(window.Seconds())) + if err != nil { + return fmt.Errorf("rate-limit-konfiguration speichern: %w", err) + } + return nil +} + +func (s *Store) getConfig(ctx context.Context, key string) (Config, error) { + var limit, windowSeconds int + err := s.pool.QueryRow(ctx, ` + SELECT limit_value, window_seconds FROM rate_limit_configs WHERE key = $1 + `, key).Scan(&limit, &windowSeconds) + if err != nil { + if err == pgx.ErrNoRows { + return Config{Limit: DefaultLimit, Window: DefaultWindow}, nil + } + return Config{}, fmt.Errorf("rate-limit-konfiguration lesen: %w", err) + } + return Config{Limit: limit, Window: time.Duration(windowSeconds) * time.Second}, nil +} + +// Result ist der Ausgang einer Allow-Pruefung (Akzeptanzkriterium 3). +type Result struct { + Allowed bool + Limit int + Remaining int + RetryAfter time.Duration +} + +// Allow erhoeht den Zaehler fuer (key, aktuelles Zeitfenster) ATOMAR ueber +// ein einziges UPSERT (dasselbe Muster wie internal/usage.Store.Increment) +// und vergleicht das Ergebnis gegen die konfigurierte Grenze — kein +// Lesen-Erhoehen-Schreiben in Go, damit zwei Dienstinstanzen, die +// gleichzeitig gegen dieselbe Datenbank inkrementieren, sich niemals +// gegenseitig ueberschreiben (Akzeptanzkriterium 2 / Pruefung 1). +func (s *Store) Allow(ctx context.Context, key string) (Result, error) { + cfg, err := s.getConfig(ctx, key) + if err != nil { + return Result{}, err + } + + windowSeconds := int64(cfg.Window.Seconds()) + if windowSeconds <= 0 { + windowSeconds = int64(DefaultWindow.Seconds()) + } + now := time.Now().UTC() + windowStart := time.Unix((now.Unix()/windowSeconds)*windowSeconds, 0).UTC() + windowEnd := windowStart.Add(time.Duration(windowSeconds) * time.Second) + + var count int + err = s.pool.QueryRow(ctx, ` + INSERT INTO rate_limit_counters (key, window_start, count) + VALUES ($1, $2, 1) + ON CONFLICT (key, window_start) DO UPDATE + SET count = rate_limit_counters.count + 1 + RETURNING count + `, key, windowStart).Scan(&count) + if err != nil { + return Result{}, fmt.Errorf("rate-limit-zaehler erhoehen: %w", err) + } + + remaining := cfg.Limit - count + if remaining < 0 { + remaining = 0 + } + if count > cfg.Limit { + return Result{ + Allowed: false, + Limit: cfg.Limit, + Remaining: 0, + RetryAfter: windowEnd.Sub(now), + }, nil + } + return Result{Allowed: true, Limit: cfg.Limit, Remaining: remaining}, nil +} diff --git a/internal/ratelimit/ratelimit_test.go b/internal/ratelimit/ratelimit_test.go new file mode 100644 index 0000000..2dcc86e --- /dev/null +++ b/internal/ratelimit/ratelimit_test.go @@ -0,0 +1,168 @@ +package ratelimit + +import ( + "context" + "fmt" + "os" + "sync" + "sync/atomic" + "testing" + "time" + + "github.com/jackc/pgx/v5/pgxpool" +) + +func setupTest(t *testing.T) (*pgxpool.Pool, func()) { + t.Helper() + adminDSN := os.Getenv("TEST_ADMIN_DSN") + if adminDSN == "" { + t.Skip("TEST_ADMIN_DSN nicht gesetzt, Integrationstest uebersprungen") + } + ctx := context.Background() + + pool, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("pool: %v", err) + } + if _, err := pool.Exec(ctx, ` + CREATE TABLE IF NOT EXISTS rate_limit_configs ( + key TEXT PRIMARY KEY, limit_value INT NOT NULL, window_seconds INT NOT NULL + ); + CREATE TABLE IF NOT EXISTS rate_limit_counters ( + key TEXT NOT NULL, window_start TIMESTAMPTZ NOT NULL, count INT NOT NULL DEFAULT 0, + PRIMARY KEY (key, window_start) + ); + `); err != nil { + t.Fatalf("schema: %v", err) + } + + cleanup := func() { pool.Close() } + return pool, cleanup +} + +func newTestKey() string { + return fmt.Sprintf("test-key-%d", time.Now().UnixNano()) +} + +// Akzeptanzkriterium 3 + Pruefung 2: Ueberschreitung des Limits wird +// nachweislich erkannt. +func TestAllow_RejectsAfterLimitExceeded(t *testing.T) { + pool, cleanup := setupTest(t) + defer cleanup() + store := NewStore(pool) + ctx := context.Background() + key := newTestKey() + + if err := store.SetLimit(ctx, key, 3, time.Minute); err != nil { + t.Fatalf("setlimit: %v", err) + } + + for i := 0; i < 3; i++ { + res, err := store.Allow(ctx, key) + if err != nil { + t.Fatalf("allow %d: %v", i, err) + } + if !res.Allowed { + t.Fatalf("anfrage %d haette erlaubt sein muessen, limit=3", i) + } + } + + res, err := store.Allow(ctx, key) + if err != nil { + t.Fatalf("allow (4.): %v", err) + } + if res.Allowed { + t.Fatal("4. anfrage haette abgelehnt werden muessen (limit=3)") + } + if res.RetryAfter <= 0 { + t.Fatalf("erwartet positive retry-after-dauer, habe %v", res.RetryAfter) + } +} + +// Akzeptanzkriterium 1 / Pruefung 3: Konfigurationsaenderung wirkt sich +// NICHT auf andere Schluessel (Tenants) aus. +func TestSetLimit_DoesNotAffectOtherKeys(t *testing.T) { + pool, cleanup := setupTest(t) + defer cleanup() + store := NewStore(pool) + ctx := context.Background() + keyA := newTestKey() + keyB := newTestKey() + + if err := store.SetLimit(ctx, keyA, 1, time.Minute); err != nil { + t.Fatalf("setlimit a: %v", err) + } + + resA1, _ := store.Allow(ctx, keyA) + resA2, _ := store.Allow(ctx, keyA) + if !resA1.Allowed || resA2.Allowed { + t.Fatalf("key a: erwartet erlaubt,abgelehnt, habe %v,%v", resA1.Allowed, resA2.Allowed) + } + + // keyB hat keine eigene Konfiguration -> DefaultLimit, unbeeinflusst von keyA. + resB, err := store.Allow(ctx, keyB) + if err != nil { + t.Fatalf("allow b: %v", err) + } + if !resB.Allowed { + t.Fatal("key b haette trotz limit-ueberschreitung bei key a erlaubt sein muessen") + } + if resB.Limit != DefaultLimit { + t.Fatalf("key b limit = %d, want default %d", resB.Limit, DefaultLimit) + } +} + +// Akzeptanzkriterium 2 + Pruefung 1: zwei "Dienstinstanzen" (zwei +// unabhaengige Pools/Store-Objekte) gegen dieselbe Datenbank setzen +// dasselbe Limit korrekt durch — kein In-Process-Zustand kann das leisten. +func TestAllow_TwoInstancesShareStateCorrectly(t *testing.T) { + adminDSN := os.Getenv("TEST_ADMIN_DSN") + if adminDSN == "" { + t.Skip("TEST_ADMIN_DSN nicht gesetzt, Integrationstest uebersprungen") + } + pool, cleanup := setupTest(t) + defer cleanup() + + ctx := context.Background() + pool2, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("zweiter pool (simuliert zweite instanz): %v", err) + } + defer pool2.Close() + + storeInstance1 := NewStore(pool) + storeInstance2 := NewStore(pool2) + + key := newTestKey() + const limit = 20 + if err := storeInstance1.SetLimit(ctx, key, limit, time.Minute); err != nil { + t.Fatalf("setlimit: %v", err) + } + + const totalRequests = 50 + var allowedCount int64 + var wg sync.WaitGroup + for i := 0; i < totalRequests; i++ { + wg.Add(1) + store := storeInstance1 + if i%2 == 0 { + store = storeInstance2 // Haelfte der Anfragen "kommt" von der zweiten Instanz + } + go func(s *Store) { + defer wg.Done() + res, err := s.Allow(ctx, key) + if err != nil { + t.Errorf("allow: %v", err) + return + } + if res.Allowed { + atomic.AddInt64(&allowedCount, 1) + } + }(store) + } + wg.Wait() + + if allowedCount != limit { + t.Fatalf("erlaubte anfragen ueber beide instanzen = %d, want exakt %d (geteilter zustand)", allowedCount, limit) + } +} diff --git a/internal/tenant/router.go b/internal/tenant/router.go new file mode 100644 index 0000000..4b2053b --- /dev/null +++ b/internal/tenant/router.go @@ -0,0 +1,136 @@ +package tenant + +import ( + "container/list" + "context" + "errors" + "fmt" + "sync" + + "github.com/jackc/pgx/v5/pgxpool" +) + +// ErrMissingTenantContext wird geliefert, wenn keine Tenant-Kennung +// uebergeben wurde — es gibt bewusst keinen impliziten Default-Tenant +// (TEN-06 Akzeptanzkriterium 3). +var ErrMissingTenantContext = errors.New("tenant: kein tenant-kontext angegeben") + +// ErrUnknownTenant wird geliefert, wenn die Tenant-Kennung in der Registry +// nicht existiert. +var ErrUnknownTenant = errors.New("tenant: unbekannter tenant") + +// Router loest den Tenant-Kontext (Slug, aus dem JWT-Claim von API-05) in +// eine wiederverwendbare Verbindung zur richtigen Tenant-Datenbank auf. +// Ein LRU-verwalteter Cache begrenzt die Zahl gleichzeitig offener +// pgxpool.Pool-Instanzen, damit die Zahl offener Postgres-Verbindungen NICHT +// linear mit der Mandantenzahl waechst (Akzeptanzkriterium 2). +type Router struct { + registry *Registry + maxOpen int + + mu sync.Mutex + order *list.List // vorne = zuletzt benutzt + items map[string]*list.Element // slug -> element mit *routerEntry +} + +type routerEntry struct { + slug string + pool *pgxpool.Pool +} + +func NewRouter(registry *Registry, maxOpen int) *Router { + if maxOpen < 1 { + maxOpen = 1 + } + return &Router{ + registry: registry, + maxOpen: maxOpen, + order: list.New(), + items: make(map[string]*list.Element), + } +} + +// Resolve liefert einen wiederverwendeten Pool fuer den angegebenen Tenant. +// Ist der Tenant bereits im Cache, wird KEINE neue Verbindung aufgebaut +// (Akzeptanzkriterium 2 / Pruefung 3). +func (r *Router) Resolve(ctx context.Context, tenantSlug string) (*pgxpool.Pool, error) { + if tenantSlug == "" { + return nil, ErrMissingTenantContext + } + + r.mu.Lock() + if el, ok := r.items[tenantSlug]; ok { + r.order.MoveToFront(el) + pool := el.Value.(*routerEntry).pool + r.mu.Unlock() + return pool, nil + } + r.mu.Unlock() + + // Registry-Lookup und Verbindungsaufbau bewusst ausserhalb des Locks, + // damit ein langsamer Verbindungsaufbau nicht alle anderen Tenants blockiert. + t, err := r.registry.GetBySlug(ctx, tenantSlug) + if err != nil { + return nil, fmt.Errorf("%w: %s", ErrUnknownTenant, tenantSlug) + } + + pool, err := pgxpool.New(ctx, t.DBDSN) + if err != nil { + return nil, fmt.Errorf("verbindung zu tenant %q aufbauen: %w", tenantSlug, err) + } + + r.mu.Lock() + defer r.mu.Unlock() + + // Zwischen Unlock oben und hier koennte ein paralleler Aufruf denselben + // Tenant bereits eingefuegt haben — dann die eigene, ueberzaehlige + // Verbindung wieder schliessen und die vorhandene verwenden. + if el, ok := r.items[tenantSlug]; ok { + r.order.MoveToFront(el) + existing := el.Value.(*routerEntry).pool + pool.Close() + return existing, nil + } + + el := r.order.PushFront(&routerEntry{slug: tenantSlug, pool: pool}) + r.items[tenantSlug] = el + + if r.order.Len() > r.maxOpen { + r.evictOldest() + } + + return pool, nil +} + +// evictOldest schliesst den am laengsten nicht genutzten Pool. Muss mit +// gehaltenem r.mu aufgerufen werden. +func (r *Router) evictOldest() { + oldest := r.order.Back() + if oldest == nil { + return + } + entry := oldest.Value.(*routerEntry) + r.order.Remove(oldest) + delete(r.items, entry.slug) + entry.pool.Close() +} + +// OpenCount liefert die aktuelle Zahl offen gehaltener Tenant-Pools — +// dient Tests/Monitoring, um AC2 nachzuweisen. +func (r *Router) OpenCount() int { + r.mu.Lock() + defer r.mu.Unlock() + return r.order.Len() +} + +// Close schliesst alle offen gehaltenen Tenant-Pools, z.B. beim +// Herunterfahren des Core-Prozesses. +func (r *Router) Close() { + r.mu.Lock() + defer r.mu.Unlock() + for el := r.order.Front(); el != nil; el = el.Next() { + el.Value.(*routerEntry).pool.Close() + } + r.order.Init() + r.items = make(map[string]*list.Element) +} diff --git a/internal/tenant/router_test.go b/internal/tenant/router_test.go new file mode 100644 index 0000000..e6f0482 --- /dev/null +++ b/internal/tenant/router_test.go @@ -0,0 +1,160 @@ +package tenant + +import ( + "context" + "errors" + "fmt" + "os" + "strings" + "testing" + + "github.com/jackc/pgx/v5/pgxpool" +) + +func newTestRouterSetup(t *testing.T, tenantCount int) (*Router, []Tenant, func()) { + t.Helper() + adminDSN := os.Getenv("TEST_ADMIN_DSN") + if adminDSN == "" { + t.Skip("TEST_ADMIN_DSN nicht gesetzt, Integrationstest uebersprungen") + } + ctx := context.Background() + + adminPool, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("admin pool: %v", err) + } + registryPool, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("registry pool: %v", err) + } + if _, err := registryPool.Exec(ctx, ` + CREATE TABLE IF NOT EXISTS tenants ( + id UUID PRIMARY KEY DEFAULT gen_random_uuid(), + slug TEXT NOT NULL UNIQUE, + name TEXT NOT NULL, + db_name TEXT NOT NULL UNIQUE, + db_dsn TEXT NOT NULL, + status TEXT NOT NULL DEFAULT 'active', + created_at TIMESTAMPTZ NOT NULL DEFAULT now() + )`); err != nil { + t.Fatalf("registry-schema: %v", err) + } + + registry := NewRegistry(registryPool) + dsnTemplate := strings.Replace(adminDSN, "/postgres?", "/%s?", 1) + provisioner := NewProvisioner(adminPool, registry, dsnTemplate) + + var tenants []Tenant + var slugs []string + for i := 0; i < tenantCount; i++ { + slug := fmt.Sprintf("router_t%d", i) + slugs = append(slugs, slug) + tn, err := provisioner.Provision(ctx, slug, slug) + if err != nil { + t.Fatalf("provision %s: %v", slug, err) + } + tenants = append(tenants, tn) + } + + router := NewRouter(registry, 2) // klein gewaehlt, um Eviction im Test zu erzwingen + + cleanup := func() { + router.Close() + for _, slug := range slugs { + _, _ = adminPool.Exec(ctx, fmt.Sprintf(`DROP DATABASE IF EXISTS %q`, dbNameForSlug(slug))) + } + _, _ = registryPool.Exec(ctx, `DELETE FROM tenants WHERE slug = ANY($1)`, slugs) + registryPool.Close() + adminPool.Close() + } + return router, tenants, cleanup +} + +// Akzeptanzkriterium 1: Verbindung wird zuverlaessig anhand des Tenant-Kontexts aufgeloest. +func TestRouter_ResolvesCorrectTenantDatabase(t *testing.T) { + router, tenants, cleanup := newTestRouterSetup(t, 2) + defer cleanup() + ctx := context.Background() + + pool, err := router.Resolve(ctx, tenants[0].Slug) + if err != nil { + t.Fatalf("resolve: %v", err) + } + var dbName string + if err := pool.QueryRow(ctx, `SELECT current_database()`).Scan(&dbName); err != nil { + t.Fatalf("current_database: %v", err) + } + if dbName != tenants[0].DBName { + t.Fatalf("current_database() = %q, want %q", dbName, tenants[0].DBName) + } +} + +// Akzeptanzkriterium 3 + Pruefung 2: fehlender/unbekannter Tenant-Kontext +// wird explizit abgewiesen statt irgendeine Verbindung zu liefern. +func TestRouter_RejectsMissingOrUnknownTenant(t *testing.T) { + router, _, cleanup := newTestRouterSetup(t, 1) + defer cleanup() + ctx := context.Background() + + if _, err := router.Resolve(ctx, ""); !errors.Is(err, ErrMissingTenantContext) { + t.Fatalf("erwartet ErrMissingTenantContext, habe %v", err) + } + if _, err := router.Resolve(ctx, "nie-registrierter-slug"); !errors.Is(err, ErrUnknownTenant) { + t.Fatalf("erwartet ErrUnknownTenant, habe %v", err) + } +} + +// Akzeptanzkriterium 2 + Pruefung 3: Verbindungswiederverwendung nachweislich +// gemessen — zweiter Resolve-Aufruf liefert exakt denselben Pool, kein +// erneuter Verbindungsaufbau. +func TestRouter_ReusesConnectionForSameTenant(t *testing.T) { + router, tenants, cleanup := newTestRouterSetup(t, 1) + defer cleanup() + ctx := context.Background() + + first, err := router.Resolve(ctx, tenants[0].Slug) + if err != nil { + t.Fatalf("resolve 1: %v", err) + } + second, err := router.Resolve(ctx, tenants[0].Slug) + if err != nil { + t.Fatalf("resolve 2: %v", err) + } + if first != second { + t.Fatal("erwartet identische pool-instanz bei wiederholtem resolve, habe unterschiedliche") + } +} + +// Akzeptanzkriterium 2 + Pruefung 1: Lasttest mit mehr simulierten Mandanten +// als maxOpen — die Zahl gleichzeitig offener Tenant-Pools bleibt begrenzt +// (LRU-Eviction), waechst also NICHT linear mit der Mandantenzahl. +func TestRouter_BoundsOpenConnectionsUnderLoad(t *testing.T) { + const tenantCount = 6 + router, tenants, cleanup := newTestRouterSetup(t, tenantCount) + defer cleanup() + ctx := context.Background() + + for _, tn := range tenants { + if _, err := router.Resolve(ctx, tn.Slug); err != nil { + t.Fatalf("resolve %s: %v", tn.Slug, err) + } + if router.OpenCount() > 2 { + t.Fatalf("OpenCount() = %d, erwartet <= maxOpen (2) nach jedem Resolve", router.OpenCount()) + } + } + + if router.OpenCount() != 2 { + t.Fatalf("erwartet genau maxOpen=2 offene pools nach %d tenants, habe %d", tenantCount, router.OpenCount()) + } + + // Evictete Tenants sind wieder ganz normal ueber die Registry aufloesbar + // (Cache-Miss fuehrt zu neuem, funktionierendem Pool, kein Fehlerzustand). + pool, err := router.Resolve(ctx, tenants[0].Slug) + if err != nil { + t.Fatalf("resolve nach eviction: %v", err) + } + var one int + if err := pool.QueryRow(ctx, `SELECT 1`).Scan(&one); err != nil { + t.Fatalf("query nach re-resolve: %v", err) + } +} From 14516b4adf7b8a3bd260b898db78d33cd0df08fb Mon Sep 17 00:00:00 2001 From: sysops Date: Fri, 28 Aug 2026 10:54:05 +0200 Subject: [PATCH 2/2] QA-08: last-leistungstest (jwt-verifikation, connection-pooling, rate-limiting unter mehrmodul-last) --- internal/loadtest/loadtest_test.go | 257 +++++++++++++++++++++++++++++ 1 file changed, 257 insertions(+) create mode 100644 internal/loadtest/loadtest_test.go diff --git a/internal/loadtest/loadtest_test.go b/internal/loadtest/loadtest_test.go new file mode 100644 index 0000000..289d53c --- /dev/null +++ b/internal/loadtest/loadtest_test.go @@ -0,0 +1,257 @@ +// Package loadtest implementiert Core QA-08: Last- und Leistungstests fuer +// die drei Mechanismen, die unter realistischer Mehrmodul-Last (sechs +// gleichzeitig zugreifende Fachmodule: DMS/Mail/Archive/Workflow/AI/Connect) +// am ehesten unter Druck geraten — JWT-Verifikationspfad (API-05), +// Tenant-Connection-Pooling (TEN-06) und Rate-Limiting (API-03). Jeder Test +// dokumentiert einen Zielwert UND das tatsaechlich gemessene Ergebnis +// (Ticket-Vorgabe: "Pruefen heisst messen. Behauptungen ohne Messprotokoll +// gelten nicht als erledigt."). +package loadtest + +import ( + "context" + "crypto/ed25519" + "fmt" + "os" + "sort" + "sync" + "sync/atomic" + "testing" + "time" + + "github.com/jackc/pgx/v5/pgxpool" + + "gitea.perlbach24.de/scripte/nexarch/internal/moduletrust" + "gitea.perlbach24.de/scripte/nexarch/internal/ratelimit" + "gitea.perlbach24.de/scripte/nexarch/internal/tenant" +) + +const simulatedModuleCount = 6 // DMS, Mail, Archive, Workflow, AI, Connect + +// Akzeptanzkriterium 1 + Pruefung 1: definierte Ziel-Latenz fuer +// JWT-Verifikation unter Last aus sechs gleichzeitig zugreifenden Modulen. +// +// Zielwert: p95 < 10ms je Verify()-Aufruf. Begruendung des Zielwerts: +// Verify() ist eine rein lokale Operation gegen einen bereits im Speicher +// zwischengespeicherten Schluesselsatz (StaleCache, siehe API-05) — es +// findet kein Netzwerk-Roundtrip zu Core statt, daher ist ein niedriger +// Millisekunden-Zielwert realistisch, nicht willkuerlich hoch angesetzt. +func TestLoad_JWTVerificationLatencyUnderSixModuleLoad(t *testing.T) { + km, err := moduletrust.NewKeyManager() + if err != nil { + t.Fatalf("keymanager: %v", err) + } + if _, err := km.Rotate(); err != nil { + t.Fatalf("rotate: %v", err) + } + + verifier := moduletrust.NewVerifier(time.Minute, func(ctx context.Context) (map[string]ed25519.PublicKey, error) { + return km.PublicKeySet(), nil + }) + + const requestsPerModule = 200 + totalRequests := simulatedModuleCount * requestsPerModule + + tokens := make([]string, totalRequests) + for i := 0; i < totalRequests; i++ { + tok, err := km.Issue("user-1", fmt.Sprintf("tenant-%d", i%50), 5*time.Minute) + if err != nil { + t.Fatalf("issue: %v", err) + } + tokens[i] = tok + } + + latencies := make([]time.Duration, totalRequests) + var wg sync.WaitGroup + for module := 0; module < simulatedModuleCount; module++ { + wg.Add(1) + go func(moduleIdx int) { + defer wg.Done() + for i := 0; i < requestsPerModule; i++ { + idx := moduleIdx*requestsPerModule + i + start := time.Now() + if _, err := verifier.Verify(context.Background(), tokens[idx]); err != nil { + t.Errorf("verify: %v", err) + return + } + latencies[idx] = time.Since(start) + } + }(module) + } + wg.Wait() + + sort.Slice(latencies, func(i, j int) bool { return latencies[i] < latencies[j] }) + p95 := latencies[int(float64(len(latencies))*0.95)] + max := latencies[len(latencies)-1] + + t.Logf("JWT-Verifikation unter Last: %d module x %d anfragen = %d gesamt. p95=%s, max=%s, ziel=p95<10ms", + simulatedModuleCount, requestsPerModule, totalRequests, p95, max) + + if p95 >= 10*time.Millisecond { + t.Fatalf("p95-latenz = %s, ziel war unter 10ms", p95) + } +} + +// Akzeptanzkriterium 2 + Pruefung 2: Connection-Pooling bleibt unter der +// Postgres-Verbindungsobergrenze bei simulierter Vielzahl an Mandanten. +// +// Zielwert: bei 200 simulierten Mandanten, auf die sechs Module gleichzeitig +// zugreifen, bleiben NIE mehr als maxOpen=20 Pools gleichzeitig offen (LRU- +// Verdraengung greift) — weit unter einer typischen Postgres +// max_connections-Grenze (Default 100). +func TestLoad_ConnectionPoolingStaysUnderLimitWithManySimulatedTenants(t *testing.T) { + adminDSN := os.Getenv("TEST_ADMIN_DSN") + if adminDSN == "" { + t.Skip("TEST_ADMIN_DSN nicht gesetzt, Integrationstest uebersprungen") + } + ctx := context.Background() + pool, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("pool: %v", err) + } + defer pool.Close() + + if _, err := pool.Exec(ctx, ` + CREATE TABLE IF NOT EXISTS tenants ( + id UUID PRIMARY KEY DEFAULT gen_random_uuid(), slug TEXT NOT NULL UNIQUE, name TEXT NOT NULL, + db_name TEXT NOT NULL UNIQUE, db_dsn TEXT NOT NULL, status TEXT NOT NULL DEFAULT 'active', + created_at TIMESTAMPTZ NOT NULL DEFAULT now() + ); + `); err != nil { + t.Fatalf("schema: %v", err) + } + + registry := tenant.NewRegistry(pool) + const simulatedTenants = 200 + const maxOpen = 20 + + prefix := fmt.Sprintf("qa08_%d", time.Now().UnixNano()) + slugs := make([]string, simulatedTenants) + for i := 0; i < simulatedTenants; i++ { + slug := fmt.Sprintf("%s_%d", prefix, i) + slugs[i] = slug + // DSN muss nur SYNTAKTISCH gueltig sein — pgxpool.New verbindet + // erst lazy bei tatsaechlicher Nutzung, fuer diesen Lasttest zaehlt + // ausschliesslich die Zahl offener *Pool-Objekte*, nicht ob die + // referenzierte Datenbank real existiert. + dsn := fmt.Sprintf("postgresql://nexarch_test:unused@localhost:5432/%s?sslmode=disable", slug) + if _, err := pool.Exec(ctx, ` + INSERT INTO tenants (slug, name, db_name, db_dsn) VALUES ($1, $1, $1, $2) + `, slug, dsn); err != nil { + t.Fatalf("tenant %s anlegen: %v", slug, err) + } + } + t.Cleanup(func() { + _, _ = pool.Exec(context.Background(), `DELETE FROM tenants WHERE slug LIKE $1`, prefix+"%") + }) + + router := tenant.NewRouter(registry, maxOpen) + defer router.Close() + + var maxObservedOpen int64 + var wg sync.WaitGroup + for module := 0; module < simulatedModuleCount; module++ { + wg.Add(1) + go func(moduleIdx int) { + defer wg.Done() + for i := 0; i < simulatedTenants; i++ { + slug := slugs[(i+moduleIdx*37)%simulatedTenants] // module-uebergreifend gemischter zugriff + if _, err := router.Resolve(context.Background(), slug); err != nil { + t.Errorf("resolve %s: %v", slug, err) + return + } + if current := int64(router.OpenCount()); current > atomic.LoadInt64(&maxObservedOpen) { + atomic.StoreInt64(&maxObservedOpen, current) + } + } + }(module) + } + wg.Wait() + + t.Logf("connection-pooling unter last: %d simulierte mandanten, %d module, max. gleichzeitig beobachtete offene pools = %d (ziel: <= %d)", + simulatedTenants, simulatedModuleCount, maxObservedOpen, maxOpen) + + if maxObservedOpen > int64(maxOpen) { + t.Fatalf("max. beobachtete offene pools = %d, ziel war <= %d", maxObservedOpen, maxOpen) + } + if router.OpenCount() > maxOpen { + t.Fatalf("finale offene pools = %d, ziel war <= %d", router.OpenCount(), maxOpen) + } +} + +// Akzeptanzkriterium 3 + Pruefung 3: Rate-Limiting funktioniert korrekt +// unter Mehrinstanz-Last (mehrere "Core-Instanzen" mit geteiltem Postgres- +// Zustand) aus sechs gleichzeitig zugreifenden Modulen, nicht nur im +// Einzelinstanz-Test (der bereits in API-03 abgedeckt ist). +// +// Zielwert: bei konfiguriertem Limit=500 und insgesamt 1200 Anfragen ueber +// DREI simulierte Core-Instanzen (separate Pools/Store-Objekte) hinweg +// werden EXAKT 500 Anfragen erlaubt — kein Overcounting durch fehlende +// Koordination zwischen den Instanzen, kein Undercounting durch verlorene +// Updates. +func TestLoad_RateLimitingCorrectAcrossMultipleInstancesUnderSixModuleLoad(t *testing.T) { + adminDSN := os.Getenv("TEST_ADMIN_DSN") + if adminDSN == "" { + t.Skip("TEST_ADMIN_DSN nicht gesetzt, Integrationstest uebersprungen") + } + ctx := context.Background() + + const instanceCount = 3 + pools := make([]*pgxpool.Pool, instanceCount) + stores := make([]*ratelimit.Store, instanceCount) + for i := 0; i < instanceCount; i++ { + p, err := pgxpool.New(ctx, adminDSN) + if err != nil { + t.Fatalf("pool %d: %v", i, err) + } + defer p.Close() + if i == 0 { + if _, err := p.Exec(ctx, ` + CREATE TABLE IF NOT EXISTS rate_limit_configs ( + key TEXT PRIMARY KEY, limit_value INT NOT NULL, window_seconds INT NOT NULL + ); + CREATE TABLE IF NOT EXISTS rate_limit_counters ( + key TEXT NOT NULL, window_start TIMESTAMPTZ NOT NULL, count INT NOT NULL DEFAULT 0, + PRIMARY KEY (key, window_start) + ); + `); err != nil { + t.Fatalf("schema: %v", err) + } + } + pools[i] = p + stores[i] = ratelimit.NewStore(p) + } + + key := fmt.Sprintf("qa08-key-%d", time.Now().UnixNano()) + const limit = 500 + if err := stores[0].SetLimit(ctx, key, limit, time.Minute); err != nil { + t.Fatalf("setlimit: %v", err) + } + + const totalRequests = 1200 // simulierte last aus sechs modulen ueber drei instanzen, deutlich ueber dem limit von 500 + var allowedCount int64 + var wg sync.WaitGroup + for i := 0; i < totalRequests; i++ { + wg.Add(1) + instance := stores[i%instanceCount] // request "kommt" reihum von einer der drei core-instanzen + go func(s *ratelimit.Store) { + defer wg.Done() + res, err := s.Allow(ctx, key) + if err != nil { + t.Errorf("allow: %v", err) + return + } + if res.Allowed { + atomic.AddInt64(&allowedCount, 1) + } + }(instance) + } + wg.Wait() + + t.Logf("rate-limiting unter mehrinstanz-last: %d anfragen ueber %d instanzen, limit=%d, tatsaechlich erlaubt=%d", + totalRequests, instanceCount, limit, allowedCount) + + if allowedCount != limit { + t.Fatalf("erlaubte anfragen ueber alle instanzen = %d, ziel war exakt %d (geteilter, korrekter zustand)", allowedCount, limit) + } +}