Compare commits

..
Author SHA1 Message Date
sysops d0b6fb8ce5 docs(archive): QA-04 Protokoll um drei Gegenzeichnungsbedingungen ergaenzt
Rotations-Kohaerenz explizit als NICHT geloest markiert, Nachhol-
Pruefung als solche gekennzeichnet (kein archaeologisches Protokoll),
Zwei-Namen-Unterschrift (Umsetzung + Gegenzeichnung). Bedingungen des
Betreibers erfuellt, Gegenzeichnung erteilt.
2026-08-30 01:21:35 +02:00
sysops 480aa52941 docs(archive): QA-04 Pruefgate Backup & Restore
Realer Restore-Testlauf (DB+Objekt) und Reconciliation frisch auf 131
ausgeloest, beide sauber (kein Fund). Fuenf offene Restrisiken
schriftlich benannt (Rotations-Kohaerenz, BAK-04-Rollenrechte fuer
produktive Mandanten, Storage-Provider-Grenze aus BAK-08, Core
FDN-03/FDN-09-Wiring-Luecke, leerer Testbestand). Unterschrift steht
aus - kann nicht durch das System selbst erfolgen.
2026-08-30 00:55:53 +02:00
sysops 004c6fab62 docs(archive): BAK-07 dokumentiert fehlende Rotations-Kohaerenz
Nutzerfrage: DB- und Objekt-Rotation laufen unabhaengig, kein Test/
Invariant stellt sicher, dass aeltester erreichbarer Snapshot und
aelteste erreichbare DB-Generation zeitlich zusammenpassen. Aktuell
identische keep-Werte sind Zufall, kein erzwungenes Verhalten - als
Folgepunkt dokumentiert, nicht Teil des Tickets.
2026-08-30 00:54:02 +02:00
sysops 823a14ae12 feat(archive): BAK-07 gestaffelte Aufbewahrungsfrist fuer Backup-Snapshots
internal/backup.PruneTiered: reine GFS-Funktion (Tag/Woche/Monat) fuer
Datenbank-Generationen, behaelt strukturell immer die neueste Generation
(Sicherheitsnetz gegen Legal-Hold-Kollision). internal/objectbackup.
PruneTiered: duenner Wrapper um restics native --keep-daily/-weekly/
-monthly-Staffelung. Beide CLIs nutzen die Staffelung, wenn konfiguriert,
bleiben sonst abwaertskompatibel zur flachen "letzte N"-Regel. Real
gegen zeitversetzt erzeugte restic-Snapshots getestet (Fund: restics
--time-Flag erwartet eigenes Format, nicht RFC3339), Pruning-Sicherheit
nach dem Loeschen alter Snapshots ueber vollstaendigen Restore +
restic check --read-data bewiesen. Beide Rotationswege real ueber
systemd auf 131 ausgeloest.
2026-08-30 00:49:23 +02:00
sysops 80b0ca9176 feat(archive): BAK-04 Tenant-Backup & -Restore einzelner Mandant
internal/tenantbackup: datenbank-scharfes pg_dump/pg_restore statt
BAK-01s Cluster-weitem pg_basebackup - bei Modell C (TEN-01, physisch
isolierte DB je Mandant) wuerde ein Cluster-Restore zwangslaeufig ALLE
Mandanten ueberschreiben. Objekt-Seite nutzt BAK-02 direkt (Mandanten
haben eigene Buckets/Pfad-Roots). Eigene Postgres-Rolle
nexarch_tenantbackup (CREATEDB, kein Superuser, getrennt von
nexarch_backup). Zwei-Tenant-Isolation real in beide Richtungen
bewiesen (Markerwert-Nachweis), JSONL-Protokoll fuer Sicherung UND
Restore. Realer End-zu-Ende-Lauf ueber tenantbackup-cli auf 131.
2026-08-30 00:41:48 +02:00
sysops c761cf9b93 feat(archive): BAK-06 Restore-Testverfahren
internal/restoretest wiederholt BAK-03s eigene Pruefdiskt als
Produktcode: echter Restore der neuesten Sicherung, echter Kurzstart
einer isolierten Postgres-Instanz, echte SELECT-1-Abfrage; Objekt-Seite
echter restic-Restore + Inhaltspruefung. JSONL-Historie (append-only),
sichtbare Warnung ueber denselben OPS-05-Pull-Weg wie BAK-08, eigenes
/metrics-Modul (archive-restoretest). Zwei reale Defekte gefunden und
behoben: Unix-Socket-Pfadlaenge unter tief verschachtelten Testpfaden,
restic-stderr-Vermischung beim JSON-Parsen unter dem Dienstnutzer.
Real auf 131 verdrahtet und ausgeloest (beide Testarten erfolgreich,
End-zu-Ende ueber OPS-03 bestaetigt).
2026-08-30 00:31:34 +02:00
27 changed files with 2150 additions and 0 deletions
+27
View File
@@ -36,6 +36,16 @@ func loadConfig() backup.Config {
return cfg
}
func envInt(name string, def int) int {
v := os.Getenv(name)
if v == "" {
return def
}
n := def
_, _ = fmt.Sscanf(v, "%d", &n)
return n
}
func latestManifest(backupDir string) (string, error) {
generations, err := backup.ListGenerations(backupDir)
if err != nil {
@@ -91,6 +101,23 @@ func main() {
fmt.Printf("inkrementelle sicherung %q erstellt und verifiziert: %s\n", incID, newManifest)
case "rotate":
// BAK-07: gestaffelte Aufbewahrungsfrist (KeepDaily/Weekly/Monthly),
// falls konfiguriert - ersetzt die flache "letzte N"-Regel
// (NEXARCH_BACKUP_KEEP_GENERATIONS), bleibt aber abwaertskompatibel,
// wenn keine Staffelung gesetzt ist.
policy := backup.RetentionPolicy{
KeepDaily: envInt("NEXARCH_BACKUP_KEEP_DAILY", 0),
KeepWeekly: envInt("NEXARCH_BACKUP_KEEP_WEEKLY", 0),
KeepMonthly: envInt("NEXARCH_BACKUP_KEEP_MONTHLY", 0),
}
if policy.KeepDaily > 0 || policy.KeepWeekly > 0 || policy.KeepMonthly > 0 {
removed, err := backup.PruneRotate(cfg.BackupDir, policy)
if err != nil {
log.Fatalf("gestaffelte rotation fehlgeschlagen: %v", err)
}
fmt.Printf("gestaffelte rotation abgeschlossen, %d generation(en) entfernt: %v\n", len(removed), removed)
return
}
keep := 7
if v := os.Getenv("NEXARCH_BACKUP_KEEP_GENERATIONS"); v != "" {
_, _ = fmt.Sscanf(v, "%d", &keep)
+25
View File
@@ -25,6 +25,17 @@ func loadConfig() objectbackup.Config {
return cfg
}
func envInt(name string, def int) int {
v := os.Getenv(name)
if v == "" {
return def
}
if n, err := strconv.Atoi(v); err == nil {
return n
}
return def
}
func main() {
if len(os.Args) < 2 {
log.Fatal("aufruf: objectbackup-cli <backup <quellverzeichnis>|check|rotate>")
@@ -58,6 +69,20 @@ func main() {
fmt.Println("verifikation (mit vollstaendigem lesen) erfolgreich")
case "rotate":
// BAK-07: gestaffelte Aufbewahrungsfrist, falls konfiguriert -
// ersetzt die flache "letzte N"-Regel, bleibt abwaertskompatibel.
policy := objectbackup.RetentionPolicy{
KeepDaily: envInt("NEXARCH_OBJECTBACKUP_KEEP_DAILY", 0),
KeepWeekly: envInt("NEXARCH_OBJECTBACKUP_KEEP_WEEKLY", 0),
KeepMonthly: envInt("NEXARCH_OBJECTBACKUP_KEEP_MONTHLY", 0),
}
if policy.KeepDaily > 0 || policy.KeepWeekly > 0 || policy.KeepMonthly > 0 {
if err := objectbackup.PruneTiered(ctx, cfg, policy); err != nil {
log.Fatalf("gestaffelte rotation fehlgeschlagen: %v", err)
}
fmt.Println("gestaffelte rotation abgeschlossen")
return
}
keep := 7
if v := os.Getenv("NEXARCH_OBJECTBACKUP_KEEP_SNAPSHOTS"); v != "" {
if n, err := strconv.Atoi(v); err == nil {
+71
View File
@@ -0,0 +1,71 @@
// restoretest-cli ist der Aufrufpunkt fuer BAK-06 (systemd-Timer,
// regelmaessiger Zeitplan) - fuehrt einen vollstaendigen Restore-Test
// (Datenbank UND Objekt-Storage) gegen die jeweils neueste Sicherung in
// eine isolierte Testumgebung durch und protokolliert das Ergebnis.
package main
import (
"context"
"log"
"os"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restoretest"
)
func main() {
testRoot := os.Getenv("NEXARCH_RESTORETEST_DIR")
logPath := os.Getenv("NEXARCH_RESTORETEST_LOG")
if testRoot == "" || logPath == "" {
log.Fatal("NEXARCH_RESTORETEST_DIR und NEXARCH_RESTORETEST_LOG muessen gesetzt sein")
}
if err := os.MkdirAll(testRoot, 0o750); err != nil {
log.Fatalf("testverzeichnis anlegen: %v", err)
}
ctx := context.Background()
failed := false
dbCfg := backup.Config{
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
BackupDir: os.Getenv("NEXARCH_BACKUP_DIR"),
}
pgCfg := restoretest.PgConfig{TestPort: envOr("NEXARCH_RESTORETEST_PG_PORT", "55433")}
dbResult := restoretest.RunDatabaseTest(ctx, dbCfg, pgCfg, testRoot)
logResult(logPath, dbResult)
if !dbResult.Success {
failed = true
}
objCfg := objectbackup.Config{
RepoDir: os.Getenv("NEXARCH_OBJECTBACKUP_REPO_DIR"),
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
}
objResult := restoretest.RunObjectTest(ctx, objCfg, testRoot)
logResult(logPath, objResult)
if !objResult.Success {
failed = true
}
if failed {
os.Exit(1)
}
}
func logResult(logPath string, r restoretest.Result) {
log.Printf("restoretest %s: quelle=%s erfolg=%t detail=%s", r.Kind, r.Source, r.Success, r.Detail)
if err := restoretest.AppendHistory(logPath, r); err != nil {
log.Fatalf("protokoll schreiben: %v", err)
}
}
func envOr(key, fallback string) string {
if v := os.Getenv(key); v != "" {
return v
}
return fallback
}
+70
View File
@@ -0,0 +1,70 @@
// restoretest-metrics stellt BAK-06s Testlauf-Historie unter /metrics
// bereit - dauerhafter Prozess getrennt vom Oneshot-restoretest-cli
// (Pull-Modell, Core OPS-03 scrapt, kein Push - dieselbe Begruendung wie
// BAK-08s scrub-metrics).
package main
import (
"fmt"
"log"
"net/http"
"os"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restoretest"
)
func main() {
logPath := os.Getenv("NEXARCH_RESTORETEST_LOG")
if logPath == "" {
log.Fatal("NEXARCH_RESTORETEST_LOG muss gesetzt sein")
}
addr := os.Getenv("NEXARCH_RESTORETEST_METRICS_LISTEN_ADDR")
if addr == "" {
addr = ":8091"
}
mux := http.NewServeMux()
mux.HandleFunc("/metrics", func(w http.ResponseWriter, r *http.Request) {
history, err := restoretest.ReadHistory(logPath)
if err != nil {
http.Error(w, err.Error(), http.StatusInternalServerError)
return
}
// Historie ist append-only (siehe AppendHistory) - die Anzahl
// fehlgeschlagener Eintraege waechst daher von selbst monoton,
// kein separater Zaehlerstand noetig (gueltiger Prometheus-Counter).
var failuresTotal int
lastSuccess := map[restoretest.Kind]float64{restoretest.KindDatabase: -1, restoretest.KindObjects: -1}
for _, res := range history {
if !res.Success {
failuresTotal++
}
if res.Success {
lastSuccess[res.Kind] = 1
} else {
lastSuccess[res.Kind] = 0
}
}
w.Header().Set("Content-Type", "text/plain; version=0.0.4")
body := fmt.Sprintf(
"# HELP nexarch_archive_restore_test_failures_total Anzahl seit Einrichtung fehlgeschlagener Restore-Testlaeufe (BAK-06).\n"+
"# TYPE nexarch_archive_restore_test_failures_total counter\n"+
"nexarch_archive_restore_test_failures_total %d\n"+
"# HELP nexarch_archive_restore_test_last_success Letzter Testlauf erfolgreich (1) oder fehlgeschlagen (0), -1 wenn noch kein Lauf, je Art.\n"+
"# TYPE nexarch_archive_restore_test_last_success gauge\n"+
"nexarch_archive_restore_test_last_success{kind=\"database\"} %g\n"+
"nexarch_archive_restore_test_last_success{kind=\"objects\"} %g\n",
failuresTotal, lastSuccess[restoretest.KindDatabase], lastSuccess[restoretest.KindObjects])
if _, err := w.Write([]byte(body)); err != nil {
log.Printf("restoretest-metrics: antwort schreiben: %v", err)
}
})
mux.HandleFunc("/healthz", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) })
log.Printf("restoretest-metrics: listening on %s", addr)
if err := http.ListenAndServe(addr, mux); err != nil {
log.Fatalf("http server: %v", err)
}
}
+146
View File
@@ -0,0 +1,146 @@
// tenantbackup-cli ist der Aufrufpunkt fuer BAK-04: Sicherung/
// Wiederherstellung EINES einzelnen Mandanten (Datenbank UND
// Objekt-Storage-Root), unabhaengig vom Gesamt-Backup (BAK-01/BAK-02)
// planbar - eigener systemd-Timer, eigenes Log.
package main
import (
"context"
"flag"
"fmt"
"log"
"os"
"time"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/tenantbackup"
)
func main() {
if len(os.Args) < 2 {
usage()
os.Exit(2)
}
logPath := os.Getenv("NEXARCH_TENANTBACKUP_LOG")
if logPath == "" {
logPath = "/var/nexarch-archiv/tenantbackup.log"
}
switch os.Args[1] {
case "backup":
runBackup(logPath, os.Args[2:])
case "restore":
runRestore(logPath, os.Args[2:])
default:
usage()
os.Exit(2)
}
}
func usage() {
fmt.Fprintln(os.Stderr, "usage: tenantbackup-cli backup <tenant-db> <objekt-storage-root>")
fmt.Fprintln(os.Stderr, " tenantbackup-cli restore <tenant-db> <ziel-db> <dump-datei> [<snapshot-id> <objekt-ziel-verzeichnis>]")
}
func dbConfig() tenantbackup.Config {
return tenantbackup.Config{
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
BackupDir: os.Getenv("NEXARCH_TENANTBACKUP_DIR"),
}
}
func objConfig(tenantDB string) objectbackup.Config {
return objectbackup.Config{
RepoDir: os.Getenv("NEXARCH_TENANTBACKUP_OBJECT_REPO_ROOT") + "/" + tenantDB,
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
}
}
func runBackup(logPath string, args []string) {
fs := flag.NewFlagSet("backup", flag.ExitOnError)
if err := fs.Parse(args); err != nil {
os.Exit(2)
}
if fs.NArg() != 2 {
usage()
os.Exit(2)
}
tenantDB, storageRoot := fs.Arg(0), fs.Arg(1)
ctx := context.Background()
genID := time.Now().UTC().Format("20060102T150405Z")
dbCfg := dbConfig()
dumpPath, err := tenantbackup.Backup(ctx, dbCfg, tenantDB, genID)
logEntry(logPath, tenantbackup.OpBackupDB, tenantDB, "", dumpPath, err)
if err != nil {
log.Fatalf("datenbank-sicherung: %v", err)
}
if err := tenantbackup.Verify(ctx, dbCfg, dumpPath); err != nil {
log.Fatalf("datenbank-sicherung verifizieren: %v", err)
}
objCfg := objConfig(tenantDB)
if err := objectbackup.InitRepo(ctx, objCfg); err != nil {
log.Fatalf("objekt-repository initialisieren: %v", err)
}
summary, err := objectbackup.Backup(ctx, objCfg, storageRoot)
logEntry(logPath, tenantbackup.OpBackupObj, tenantDB, storageRoot, summary.SnapshotID, err)
if err != nil {
log.Fatalf("objekt-storage-sicherung: %v", err)
}
fmt.Printf("tenantbackup: tenant=%s db-dump=%s objekt-snapshot=%s\n", tenantDB, dumpPath, summary.SnapshotID)
}
func runRestore(logPath string, args []string) {
fs := flag.NewFlagSet("restore", flag.ExitOnError)
if err := fs.Parse(args); err != nil {
os.Exit(2)
}
if fs.NArg() < 3 {
usage()
os.Exit(2)
}
tenantDB, targetDB, dumpPath := fs.Arg(0), fs.Arg(1), fs.Arg(2)
ctx := context.Background()
dbCfg := dbConfig()
err := tenantbackup.CreateEmptyDatabase(ctx, dbCfg, targetDB)
if err == nil {
err = tenantbackup.Restore(ctx, dbCfg, dumpPath, targetDB)
}
logEntry(logPath, tenantbackup.OpRestoreDB, tenantDB, dumpPath, targetDB, err)
if err != nil {
log.Fatalf("datenbank-restore: %v", err)
}
fmt.Printf("tenantbackup restore: tenant=%s ziel-db=%s ergebnis=ok\n", tenantDB, targetDB)
if fs.NArg() < 5 {
return
}
snapshotID, objTarget := fs.Arg(3), fs.Arg(4)
objCfg := objConfig(tenantDB)
err = objectbackup.Restore(ctx, objCfg, snapshotID, objTarget)
logEntry(logPath, tenantbackup.OpRestoreObj, tenantDB, snapshotID, objTarget, err)
if err != nil {
log.Fatalf("objekt-storage-restore: %v", err)
}
fmt.Printf("tenantbackup restore: tenant=%s objekt-ziel=%s ergebnis=ok\n", tenantDB, objTarget)
}
func logEntry(logPath string, op tenantbackup.Operation, tenantID, source, target string, err error) {
result := "ok"
if err != nil {
result = err.Error()
}
entry := tenantbackup.LogEntry{
Timestamp: time.Now().UTC(), Operation: op, TenantID: tenantID,
Source: source, Target: target, Result: result,
}
if logErr := tenantbackup.AppendLog(logPath, entry); logErr != nil {
log.Fatalf("protokoll schreiben: %v", logErr)
}
}
+123
View File
@@ -0,0 +1,123 @@
# BAK-04 Prüfprotokoll: Tenant-Backup & -Restore (einzelner Mandant)
Voraussetzung BAK-03 erledigt, siehe eigenes Protokoll.
## Grundsatzentscheidung: eigenes Verfahren, NICHT auf BAK-01/BAK-03 aufgesetzt
Nutzer-Rückfrage vor Implementierungsbeginn bestätigte einen realen
Architekturkonflikt: `pg_basebackup` (BAK-01) sichert den GESAMTEN
Postgres-Cluster. Bei Modell C (TEN-01: eine physisch isolierte
Datenbank je Mandant) liegen ALLE Mandanten-Datenbanken im selben
Cluster — ein Restore der BAK-01-Sicherung würde zwangsläufig ALLE
Mandanten gleichzeitig überschreiben, das Gegenteil von
Mandanten-Isolation. `internal/tenantbackup` verwendet daher ein
DATENBANK-SCHARFES logisches Verfahren (`pg_dump -Fc`/`pg_restore` für
GENAU EINE benannte Datenbank), keine physische Cluster-Sicherung.
Objekt-Storage-Seite: da jeder Mandant bereits einen eigenen
Bucket/Pfad-Root hat (`STORAGE-KONZEPT.md` Abschnitt 3), genügt ein
`objectbackup`-Aufruf pro Mandanten-Root — keine neue Objekt-Storage-Logik
nötig, das bestehende BAK-02-Paket direkt wiederverwendet.
## Zweite Rückfrage geklärt: OPS-03/`metrics_sources` kennt keine
## Tenant-Label-Dimension auf Schema-Ebene
`metrics_sources` ist `module_name TEXT PRIMARY KEY, metrics_url TEXT`
ein Eintrag pro DIENST, kein Tenant-Feld. Labels (z. B. `tenant="..."`)
sind ein Prometheus-Textformat-Konzept INNERHALB der von einem Dienst
exportierten Metrik, nicht Teil von `metrics_sources`. Ein
`tenant_restore_failed_total{tenant="..."}`-Export wäre daher technisch
möglich, ohne OPS-03s Schema zu ändern (derselbe Mechanismus wie
BAK-06s `{kind="database"}`-Labels). **Bewusst nicht umgesetzt** in
diesem Ticket: BAK-04s Akzeptanzkriterien fordern "vollständig
protokolliert" (JSONL-Log, siehe unten), keine OPS-05-Alarmierung — eine
`/metrics`-Anbindung wäre zusätzlicher Scope über das Ticket hinaus und
bleibt als dokumentierter, leicht nachziehbarer Folgeschritt offen
(gleiches Muster wie zuvor bei BAK-05s Meldeweg-Frage).
## Reale Betriebsrollen-Grenze gefunden (dokumentiert, nicht verschwiegen)
Die für BAK-04 nötige Postgres-Rolle braucht `CREATEDB` (isolierte
Zieldatenbanken anlegen) — bewusst NICHT `nexarch_backup` erweitert
(jene Rolle hat nur `REPLICATION`, Prinzip geringster Rechte aus BAK-01).
Neue, eigene Rolle `nexarch_tenantbackup` angelegt. Beim ersten echten
Restore-Versuch schlug `pg_restore` mit `permission denied for schema
public` fehl (Versuch, Tabellen auf den URSPRÜNGLICHEN Tenant-Eigentümer
umzueignen) — behoben mit `pg_restore --no-owner` (Standardpraxis beim
Restore in eine andere Umgebung/Rolle, Eigentümerschaft ist für den
Restore-Nachweis irrelevant). Für PRODUKTIVE Mandanten-Datenbanken (nach
echter TEN-01-Provisionierung) muss `nexarch_tenantbackup` je Mandant
Lesezugriff erhalten (z. B. Rollenmitgliedschaft) — hier für den
Testnachweis exemplarisch für `dms_tenant_test` eingerichtet, echte
Automatisierung dieses Zugriffs ist TEN-01/TEN-07-Folgearbeit.
## Umsetzung
- `internal/tenantbackup.Backup``pg_dump -Fc` für genau eine
Datenbank.
- `internal/tenantbackup.Verify``pg_restore -l`, volle
Inhaltslisten-Prüfung (nicht nur Dateikopf).
- `internal/tenantbackup.CreateEmptyDatabase` — schlägt fehl, wenn
Zieldatenbank bereits existiert (kein stiller Overwrite, dieselbe
Disziplin wie BAK-03s `internal/restore`).
- `internal/tenantbackup.Restore``pg_restore --no-owner`.
- `internal/tenantbackup.AppendLog`/`ReadLog` — JSONL,
Sicherung UND Restore beide protokolliert (Akzeptanzkriterium 3).
- `cmd/tenantbackup-cli``backup <tenant-db> <storage-root>` /
`restore <tenant-db> <ziel-db> <dump> [<snapshot-id> <objekt-ziel>]`.
## Prüfungen
| # | Prüfung | Ergebnis |
|---|---|---|
| 1 | Sicherung von Tenant A enthält keine Datensätze von Tenant B (Stichprobe) | **bestanden**`TestBackupRestore_RecoversExactTenantData`: Tenant A mit eindeutigem Markerwert gesichert und in isolierte Zieldatenbank wiederhergestellt, Markerwert stimmt exakt; strukturell ist ein Cross-Tenant-Leck ausgeschlossen, weil `pg_dump` ausschließlich mit der EINEN übergebenen Datenbankverbindung spricht (Modell C, TEN-01) |
| 2 | Wiederherstellung von Tenant A in eine Testumgebung verändert Tenant B dort nicht | **bestanden**`TestRestore_DoesNotAffectOtherTenant`: reales zweites Tenant-DB mit eigenem Markerwert angelegt, nach Restore von Tenant A unverändert (Markerwert UND Datenbank-Existenz geprüft) |
| 3 | Tenant-Sicherung und -Restore vollständig protokolliert | **bestanden**`TestLog_BackupAndRestoreFullyLogged`; real auf 131: `tenantbackup.log` zeigt beide Operationen (`backup_database`, `backup_objects`, `restore_database`, `restore_objects`) mit Zeitstempel/Quelle/Ziel/Ergebnis |
Zusätzlich: `TestVerify_DetectsCorruptedDump` (absichtlich beschädigtes
Dump-Archiv wird erkannt).
## Echte Verdrahtung auf 192.168.1.131
- `tenantbackup-cli` gebaut nach `/opt/nexarch-archive/bin/`
- Eigene Postgres-Rolle `nexarch_tenantbackup` (`CREATEDB`, kein
Superuser) angelegt — getrennt von `nexarch_backup` (Prinzip
geringster Rechte)
- `/etc/nexarch/archive-tenantbackup.env` (0600)
- Realer End-zu-Ende-Lauf über `tenantbackup-cli` (nicht nur Testcode):
Sicherung von `dms_tenant_test` (DB-Dump + Objekt-Snapshot eines
Demo-Verzeichnisses) → Restore in isolierte Zieldatenbank
(`dms_tenant_test_restore_demo`) UND isoliertes Zielverzeichnis →
Objektinhalt real gelesen und bestätigt (`demo-tenant-objekt-inhalt`)
→ Protokolldatei zeigt alle vier Operationen korrekt → Testartefakte
anschließend entfernt (Zieldatenbank gedroppt, Demo-Verzeichnisse
gelöscht)
- `nexarch-archive-tenantbackup.{service,timer}.tmpl` als Vorlage
bereitgestellt (unabhängiger Zeitplan, Akzeptanzkriterium 3) — bewusst
NICHT auf einen festen Mandanten scharf geschaltet installiert, da
TEN-01s echte Tenant-Registry auf 192.168.1.131 noch nicht produktiv
befüllt ist (nur die Test-Tenant-DB `dms_tenant_test` existiert); reale
Aktivierung pro Mandant folgt, sobald eine echte Registry-Abfrage dafür
vorliegt (dokumentierter, kein stiller Gap)
## Build/Test-Ergebnis (192.168.1.131, `make check`)
```
go build ./... -> clean
go vet ./... -> clean
golangci-lint run ./... -> 0 issues
go test ./... -p 1 -count=1 -> 7/7 Pakete mit Tests ok (backup, objectbackup, reconcile, restore, restoretest, scrub, tenantbackup), 0 Fehlschläge
```
`internal/tenantbackup`-Tests brauchen eine eigene Rolle mit `CREATEDB`
(`TEST_TENANTBACKUP_PG_USER`, NICHT `TEST_BACKUP_PG_USER` — bewusst
getrennt, siehe Betriebsrollen-Hinweis oben): 4/4 Tests bestanden.
## Gesamtergebnis
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
Pflichtprüfungen real erfüllt — sowohl testgetrieben (echte
Zwei-Tenant-Isolation in beide Richtungen bewiesen) als auch über einen
echten CLI-Lauf auf 192.168.1.131. Ein architektonischer Fund vor
Implementierungsbeginn (Cluster- vs. Datenbank-scharfe Sicherung) und
zwei reale Betriebsdefekte (fehlende Rollenrechte, `pg_restore`-
Eigentümerkonflikt) dokumentiert, nicht stillschweigend umgangen.
+110
View File
@@ -0,0 +1,110 @@
# BAK-06 Prüfprotokoll: Restore-Testverfahren
Voraussetzung BAK-03 erledigt, siehe eigenes Protokoll.
## Grundsatzentscheidung: Produktcode statt Testcode für den echten Nachweis
Produkt-DNA: "Wiederherstellung ist Routine, nicht Ausnahmefall
regelmäßig getestet." Ein reiner Dateiexistenz-Check hätte diese
Forderung nicht erfüllt (dieselbe Disziplin wie überall sonst in diesem
Projekt: "jede Prüfung tatsächlich durchführen"). `internal/restoretest`
übernimmt daher exakt die Prüftiefe, die BAK-03s eigener Test bewiesen
hat — tatsächlicher Restore, tatsächlicher Kurzstart einer isolierten
Postgres-Instanz, tatsächliche `SELECT 1`-Abfrage — als WIEDERHOLBAREN
Produktcode statt einmaligen Testcode, damit es unbeaufsichtigt auf
Zeitplan laufen kann.
Historie: append-only JSONL-Datei (Akzeptanzkriterium 2/Pflichtprüfung
3). Sichtbare Warnung (Akzeptanzkriterium 3): derselbe OPS-05-Pull-Weg
wie BAK-08 (`nexarch_archive_restore_test_failures_total`, Counter) —
bewusst als EIGENES `/metrics`-Modul (`archive-restoretest`) registriert,
nicht in BAK-08s `scrub-metrics` verbaut (kein Umbau angrenzender,
bereits fertiger Bereiche).
## Drei reale Defekte während der Implementierung gefunden und behoben
1. **Unix-Socket-Pfadlänge:** Postgres begrenzt Socket-Pfade auf 107
Byte — ein unter `t.TempDir()` verschachtelter Pfad reißt dieses
Limit leicht. Fix: eigenes, kurzes Socket-Verzeichnis
(`os.MkdirTemp("", ...)`), nicht unter dem Testverzeichnis.
2. **`restic snapshots --json` unter dem systemd-Dienstnutzer
`nexarch`:** ohne beschreibbares `HOME` schreibt restic eine Warnung
("unable to open cache: ...") nach STDERR — `CombinedOutput()` hätte
sie vor das JSON-Array gemischt und das Parsen gebrochen. Fix: nur
`cmd.Output()` (stdout), stderr separat für Fehlermeldungen.
3. Beide Defekte wurden NICHT beim ersten laufenden Testdurchlauf
sichtbar, sondern erst beim ECHTEN systemd-Lauf unter dem
`nexarch`-Dienstnutzer (Defekt 2) bzw. bei tief verschachtelten
Go-Testpfaden (Defekt 1) — Beleg dafür, warum sowohl automatisierte
Tests als auch ein realer Deploy-Lauf nötig sind, keines allein hätte
beide gefunden.
## Umsetzung
- `internal/restoretest.RunDatabaseTest` — neueste Generation ermitteln
(`backup.ListGenerations`), `backup.Restore` in isoliertes
Testverzeichnis, Kurzstart via `pg_ctl`, `SELECT 1` über echte
Verbindung, danach `pg_ctl stop`.
- `internal/restoretest.RunObjectTest` — neuesten Snapshot ermitteln,
`objectbackup.Restore` in isoliertes Testverzeichnis, Inhalt real
geprüft (nicht nur Exit-Code).
- `internal/restoretest.AppendHistory`/`ReadHistory` — JSONL,
append-only.
- `cmd/restoretest-cli` — Oneshot, beide Testarten, Exit-Code 1 bei
Fehlschlag.
- `cmd/restoretest-metrics` — dauerhafter `/metrics`-Endpunkt, Zähler
aus der Historie abgeleitet (append-only ⇒ Fehlschlagszahl von selbst
monoton, kein separater Zählerstand nötig).
## Prüfungen
| # | Prüfung | Ergebnis |
|---|---|---|
| 1 | Geplanter Testlauf gegen aktuelle Sicherung erfolgreich durchgeführt und protokolliert | **bestanden**`TestRunDatabaseTest_SucceedsAgainstRealBackup`, `TestRunObjectTest_SucceedsAgainstRealSnapshot`; real auf 131: `systemctl start nexarch-archive-restoretest.service` → beide Testarten `erfolg=true`, in `history.log` protokolliert |
| 2 | Absichtlich beschädigte Sicherung lässt den Testlauf sichtbar fehlschlagen | **bestanden**`TestRunDatabaseTest_DetectsCorruptedBackup`: `base.tar.gz` durch Datenmüll ersetzt, `RunDatabaseTest` liefert `Success=false` mit aussagekräftigem Detail |
| 3 | Protokollhistorie zeigt mehrere zurückliegende Testläufe nachvollziehbar an | **bestanden**`TestHistory_ShowsMultiplePastRunsInOrder`: drei Einträge angehängt, in exakt derselben Reihenfolge gelesen |
## Echte Verdrahtung auf 192.168.1.131
- `restoretest-cli`, `restoretest-metrics` gebaut nach
`/opt/nexarch-archive/bin/`
- `/etc/nexarch/archive-restoretest.env` (0600)
- `nexarch-archive-restoretest.timer` installiert/aktiviert (wöchentlich
So. 07:00 UTC), `nexarch-archive-restoretest-metrics.service`
installiert/aktiviert (dauerhaft) — beide `systemctl status`: aktiv
- `Environment=PATH=...` im Service ergänzt um
`/usr/lib/postgresql/17/bin` (Debian verlinkt `pg_ctl`/
`pg_combinebackup` nicht ins Standard-PATH)
- **Reales `INSERT` in `metrics_sources`** (Core-Registry-DB):
`('archive-restoretest', 'http://127.0.0.1:8091/metrics')`
- **End-to-End über OPS-03 bestätigt**: `curl http://127.0.0.1:8085/metrics`
zeigt `nexarch_module_archive_restoretest_nexarch_archive_restore_test_*`
mit den realen Werten (`failures_total=0`,
`last_success{kind="database"}=1`, `last_success{kind="objects"}=1`)
- Realer Lauf via `systemctl start nexarch-archive-restoretest.service`:
beide Testarten erfolgreich, Journal zeigt Details, `/metrics` und
OPS-03-Aggregation stimmen überein
## Build/Test-Ergebnis (192.168.1.131, `make check`)
```
go build ./... -> clean
go vet ./... -> clean
golangci-lint run ./... -> 0 issues
go test ./... -p 1 -count=1 -> 6/6 Pakete mit Tests ok (backup, objectbackup, reconcile, restore, restoretest, scrub), 0 Fehlschläge
```
Hinweis wie bei BAK-03: die Datenbank-Restore-Tests
(`TestRunDatabaseTest_*`) brauchen `pg_ctl`/`pg_combinebackup` im PATH
und laufen NICHT als root — separat als `postgres`-Systemnutzer
verifiziert (7/7 `internal/restoretest`-Tests bestanden), im normalen
root-`make check`-Lauf werden sie mit klarer Meldung übersprungen.
## Gesamtergebnis
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
Pflichtprüfungen real erfüllt — sowohl testgetrieben als auch über einen
echten, unbeaufsichtigten systemd-Lauf mit OPS-03/OPS-05-Sichtbarkeit
nachgewiesen. Zwei während der Implementierung gefundene reale Defekte
(Unix-Socket-Pfadlänge, restic-stderr-Vermischung unter dem
Dienstnutzer) behoben und dokumentiert.
+112
View File
@@ -0,0 +1,112 @@
# BAK-07 Prüfprotokoll: Aufbewahrungsfrist für Backup-Snapshots
Voraussetzung BAK-01, BAK-02 erledigt, siehe eigene Protokolle.
## Grundsatzentscheidung: restic-native Staffelung für Objekte, eigene GFS-Funktion für DB-Generationen
Objekt-Storage (BAK-02): restic beherrscht gestaffelte Aufbewahrung
bereits nativ (`forget --keep-daily/--keep-weekly/--keep-monthly`) —
kein Eigenbau, `internal/objectbackup.PruneTiered` ist ein dünner
Wrapper (dieselbe Disziplin wie beim ursprünglichen
restic-statt-Eigenbau-Entscheid in BAK-02).
Datenbank-Generationen (BAK-01): `pg_basebackup` kennt keine
Staffelung, daher `internal/backup.PruneTiered` als reine Funktion
(GFS-Prinzip: je Granularität Tag/Woche/Monat wird pro Zeitfenster die
NEUESTE Generation behalten, bis die konfigurierte Fensteranzahl
erreicht ist) — ohne Dateisystemzugriff testbar, `PruneRotate` führt die
tatsächliche Löschung anhand des Ergebnisses aus (analog zu BAK-01s
bestehendem `Rotate`).
Beide Policies sind über Umgebungsvariablen konfigurierbar
(`NEXARCH_BACKUP_KEEP_DAILY/WEEKLY/MONTHLY`,
`NEXARCH_OBJECTBACKUP_KEEP_DAILY/WEEKLY/MONTHLY`), nicht hart codiert
(Ticket-Vorgabe). Bestehende flache "letzte N"-Rotation
(`NEXARCH_*_KEEP_GENERATIONS`/`KEEP_SNAPSHOTS`) bleibt als Fallback
erhalten, falls keine Staffelung gesetzt ist — kein Bruch für bestehende
Deployments.
## Sicherheitsnetz für Akzeptanzkriterium 3 (Legal-Hold-Kollision)
`internal/backup.PruneTiered` behält STRUKTURELL immer die neueste
Generation, unabhängig von der konfigurierten Staffelung — ein
Dokument, das in der neuesten (immer behaltenen) Sicherung enthalten
ist, bleibt also immer wiederherstellbar, unabhängig von einer
laufenden RET-03/CMP-06-Aufbewahrungssperre (die dieses Ticket, Archive
BAK-Modul, ohnehin nicht direkt anfasst — Sperren sind DMS/RET-Eigentum,
kein Import-Ziel für Archive per "kein Umbau angrenzender Bereiche").
Für Objekt-Storage ist die äquivalente Eigenschaft restics eigene
Garantie: `forget --prune` entfernt niemals Datenblöcke, die ein
BEHALTENER Snapshot noch referenziert (Content-defined Chunking +
Referenzzählung) — real bewiesen, nicht nur behauptet (siehe Prüfung 3).
## Umsetzung
- `internal/backup.RetentionPolicy`/`PruneTiered` (`retention.go`) —
reine GFS-Funktion.
- `internal/backup.PruneRotate` (`rotate.go`) — führt `PruneTiered`
tatsächlich gegen das Sicherungsverzeichnis aus.
- `internal/objectbackup.RetentionPolicy`/`PruneTiered` (`restic.go`) —
Wrapper um restics native Staffelung.
- `cmd/backup-cli rotate` / `cmd/objectbackup-cli rotate` — nutzen die
gestaffelte Policy, wenn konfiguriert, sonst weiterhin die flache
Regel (Abwärtskompatibilität).
## Prüfungen
| # | Prüfung | Ergebnis |
|---|---|---|
| 1 | Prune-Test mit simulierten Snapshots über mehrere Altersstufen ergibt korrekte Staffelung | **bestanden**`TestPruneTiered_KeepsCorrectStaggering` (Datenbank, reine Funktion, simulierte Generationen über Tage/Wochen/Monate) UND `TestPruneTiered_KeepsCorrectStaggering_RealSnapshots` (Objekt-Storage, ECHTE restic-Snapshots mit erzwungenem Zeitstempel `restic backup --time`, `KeepDaily=3` reduziert 10 reale Snapshots korrekt auf 3) |
| 2 | Automatisierte Löschung abgelaufener Snapshots im Test nachgewiesen | **bestanden**`TestPruneRotate_DeletesOnlyExpiredGenerations`: reales Verzeichnis, abgelaufene Generation tatsächlich vom Dateisystem entfernt, aktuelle unangetastet; real auf 131: `backup-cli rotate` und `objectbackup-cli rotate` über systemd ausgelöst, Journal zeigt „gestaffelte rotation abgeschlossen“ |
| 3 | Legal-Hold-Test bestätigt, dass Pruning nicht mit Dokumenten-Retention kollidiert | **bestanden**`TestPruneTiered_AlwaysKeepsNewest` (Datenbank-Sicherheitsnetz: neueste Generation immer behalten, selbst bei Policy 0/0/0) UND `TestPruneTiered_KeptSnapshotStillFullyRestorable` (Objekt-Storage, real: 5 ältere Snapshots eines Dokuments weggeprunt, verbleibender Snapshot danach vollständig und inhaltlich korrekt wiederhergestellt, zusätzlich `restic check --read-data` bestätigt Datenintegrität nach dem Pruning) |
Zusätzlich: `TestPruneTiered_DeterministicForIdenticalInput`.
## Echte Verdrahtung auf 192.168.1.131
- `backup-cli`, `objectbackup-cli` neu gebaut mit der gestaffelten
Rotations-Logik
- `/etc/nexarch/archive-backup.env` und
`/etc/nexarch/archive-objectbackup.env` um
`KEEP_DAILY=14`/`KEEP_WEEKLY=12`/`KEEP_MONTHLY=12` ergänzt
- Beide `*-rotate.service` real über `systemctl start` ausgelöst —
Journal bestätigt den neuen Pfad ("gestaffelte rotation
abgeschlossen"/"... entfernt: [...]"), nicht mehr die alte flache
Regel
## Build/Test-Ergebnis (192.168.1.131, `make check`)
```
go build ./... -> clean
go vet ./... -> clean
golangci-lint run ./... -> 0 issues
go test ./... -p 1 -count=1 -> 7/7 Pakete mit Tests ok, 0 Fehlschläge
```
## Bekannte Lücke: keine Kohärenz zwischen DB- und Objekt-Rotation
Beide Rotationswege laufen als UNABHÄNGIGE systemd-Timer mit eigener
Kadenz und eigener Policy-Auswertung — nichts stellt sicher, dass der
älteste noch erreichbare restic-Snapshot und die älteste noch
erreichbare DB-Generation denselben Zeitpunkt abdecken. Die aktuelle
Konfiguration (`KEEP_DAILY=14`/`KEEP_WEEKLY=12`/`KEEP_MONTHLY=12` auf
beiden Seiten identisch) ist eine ZUFÄLLIGE Übereinstimmung, kein
getestetes oder erzwungenes Invariant — ein restic-Snapshot ohne
zeitlich passende DB-Generation wäre ein inkonsistenter Restore-Punkt
(Objekte ohne zugehörige `file_revisions`-Metadaten oder umgekehrt).
Nicht Teil dieses Tickets (BAK-07 fordert nur je Sicherungsart eine
konfigurierbare Staffelung, kein Cross-Artefakt-Alignment) — als
dokumentierter Folgepunkt festgehalten, nicht stillschweigend
übergangen: ein künftiges Ticket müsste entweder die Policies fest
koppeln oder bei Restore-Zeitpunkt-Wahl (BAK-03) explizit warnen, wenn
kein zeitlich passendes Gegenstück mehr existiert.
## Gesamtergebnis
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
Pflichtprüfungen real erfüllt — sowohl mit simulierten (Datenbank) als
auch mit tatsächlich zeitversetzt erzeugten, realen restic-Snapshots
(Objekt-Storage). Ein realer Formatfehler beim Testaufbau gefunden und
behoben (restics `--time`-Flag erwartet sein eigenes Format, nicht
RFC3339). Beide Rotations-Wege real über systemd auf 192.168.1.131
ausgelöst, nicht nur isolierter Testcode.
+64
View File
@@ -0,0 +1,64 @@
# QA-04 Abnahmeprotokoll: Prüfgate Backup & Restore
Voraussetzung BAK-04, BAK-05, BAK-06, BAK-07 alle Fertig, siehe
jeweilige Prüfprotokolle. Gate fasst deren Ergebnisse zusammen und
fordert einen ZUSÄTZLICHEN, eigenständigen Nachweis: ein realer
Restore-Lauf plus Reconciliation, ausgeführt als Abnahme-Handlung,
nicht nur als Entwicklungs-Test.
## Prüfungen
| # | Prüfung | Zielwert | Messwert | Bewertung |
|---|---|---|---|---|
| 1 | Realer Restore-Testlauf erfolgreich und protokolliert | Beide Restore-Arten (DB + Objekt) laufen ohne Fehler, real gegen 192.168.1.131 | **Nachhol-Prüfung** (dedizierter Abnahme-Lauf für dieses Gate, NICHT identisch mit BAK-06s eigenem Entwicklungstest): `systemctl start nexarch-archive-restoretest.service` (2026-08-29 22:54:53 UTC): DB-Restore `erfolg=true` (Quelle `20260829T222054Z`), Objekt-Restore `erfolg=true` (Quelle `4af7bf18`); Ergebnis in `/var/nexarch-archiv/restoretest/history.log` protokolliert | **bestanden** |
| 2 | Reconciliation nach dem Testlauf liefert einen sauberen Bericht | `missing_in_storage`/`orphaned_in_storage` beide leer | **Nachhol-Prüfung**, im selben Abnahme-Durchgang direkt nach Prüfung 1 ausgelöst: `systemctl start nexarch-archive-reconcile.service` (2026-08-29 22:55:02 UTC): `{"missing_in_storage": null, "orphaned_in_storage": null, "existing_in_storage": null}` | **bestanden** |
| 3 | Offene Restrisiken sind schriftlich benannt | Vollständige, ehrliche Liste (siehe unten) | 5 Punkte identifiziert und dokumentiert | **bestanden** |
## Offene Restrisiken (Akzeptanzkriterium/Pflichtprüfung 3)
1. **Keine Kohärenz zwischen DB- und Objekt-Rotation** (BAK-07). Beide
Rotationswege laufen unabhängig, ohne Garantie, dass der älteste noch
erreichbare restic-Snapshot und die älteste noch erreichbare
DB-Generation zeitlich zusammenpassen. Aktuell identische
Keep-Werte sind Zufall, kein erzwungenes Invariant. **Ausdrücklich
NICHT gelöst**: ein Restore-Punkt ist nur dann belastbar, wenn zum
selben Zeitpunkt sowohl ein restic-Snapshot als auch eine
DB-Generation existieren — das ist aktuell nicht sichergestellt.
2. **BAK-04-Rollenrechte nicht automatisiert für produktive Mandanten.**
`nexarch_tenantbackup` braucht je Mandant manuell/administrativ
eingerichteten Lesezugriff (Rollenmitgliedschaft), bis TEN-01/TEN-07
dies automatisiert bereitstellen. Aktuell nur für die Test-Tenant-DB
eingerichtet.
3. **BAK-08 deckt keine Storage-Provider-Lücke.** Der Scrub-Job erkennt
Abweichungen nur bei Objekten, die gelesen und erneut geprüft werden
können — ersetzt keine storage-seitige WORM-/Versionierungsstrategie
und keine Zugriffs-/Audit-Logs des Storage-Providers. Bei extern
eingebundenem, nicht-kompatiblem Kunden-Storage (Betriebsmodus 3,
ohne Versioning/Object Lock/Audit-Logs) bleibt eine technisch nicht
schließbare Lücke (aus dem BAK-08-Ticket selbst übernommen, hier
erneut benannt statt stillschweigend vorausgesetzt).
4. **Core FDN-03/FDN-09-Wiring-Lücke** (aus früheren Prüfprotokollen
bekannt, nicht Archive-Scope): Core-seitige Handler für Speicher-
Nutzungsmeldung und Tenant-KEK-Abruf existieren, sind aber in keinem
laufenden Core-Dienst registriert. Betrifft indirekt BAK-08s
OPS-05-Anbindung (funktioniert unabhängig davon, aber der breitere
Meldeweg für Speicher-Nutzung bleibt lückenhaft).
5. **`existing_in_storage`/Reconciliation-Basis aktuell leer im
Testsystem.** Der saubere Bericht dieses Gates (Prüfung 2) beweist
Abwesenheit von Abweichungen, nicht Abdeckung eines befüllten
Bestands — `dms_tenant_test` enthält aktuell keine Testdaten (von
früheren Testläufen geleert). Ein Gate-Wiederholungslauf mit echtem
Datenbestand vor Produktivbetrieb wird empfohlen.
## Gesamtergebnis
**Bestanden.** Alle drei Prüfungen real durchgeführt und dokumentiert.
Fünf Restrisiken benannt, keines davon blockiert die Freigabe der
Backup-Funktionen, alle sind entweder bereits als Folgeticket-Kandidaten
dokumentiert (1, 4) oder liegen strukturell außerhalb des
Archive-Moduls (2, 3) bzw. sind ein Hinweis für den Produktivbetrieb (5).
## Unterschriften
- **Umsetzung:** Claude (Agent), 2026-08-30 — alle Prüfungen durchgeführt, Protokoll erstellt.
- **Gegenzeichnung geprüft:** Betreiber, 2026-08-30 — unter den drei Bedingungen (Rotations-Kohärenz als offenes Restrisiko benannt, Nachhol-Prüfung explizit gekennzeichnet, Zwei-Namen-Unterschrift) bestätigt.
+89
View File
@@ -0,0 +1,89 @@
package backup
import (
"fmt"
"sort"
"time"
)
// RetentionPolicy ist BAK-07s gestaffelte Aufbewahrungsfrist für
// Datenbank-Sicherungsgenerationen — unabhängig von RET-02s
// Dokumenten-Retention (Akzeptanzkriterium 1). Ein Feldwert 0 bedeutet
// "diese Stufe nicht anwenden", dieselbe Konvention wie
// objectbackup.RetentionPolicy (BAK-02), damit beide Backup-Arten
// gleich konfiguriert werden.
type RetentionPolicy struct {
KeepDaily int
KeepWeekly int
KeepMonthly int
}
// PruneTiered wählt aus generations (IDs im NewGenerationID-Format) die
// zu BEHALTENDEN nach gestaffelter GFS-Regel: je Granularität
// (Tag/Woche/Monat) wird pro Zeitfenster die NEUESTE Generation
// behalten, bis die konfigurierte Anzahl Fenster erreicht ist — reine
// Funktion, keine Dateisystem-/Netzwerkzugriffe, dadurch ohne echte
// Infrastruktur testbar (Rotate in rotate.go führt die tatsächliche
// Löschung anhand des Ergebnisses aus).
//
// Sicherheitsnetz für Akzeptanzkriterium 3 ("mindestens ein aktueller
// Snapshot bleibt erhalten"): die NEUESTE Generation wird IMMER
// behalten, unabhängig von der konfigurierten Staffelung — selbst bei
// versehentlich auf 0 gesetzter Policy geht nie die letzte Sicherung
// verloren.
func PruneTiered(generations []string, policy RetentionPolicy) (keep, remove []string) {
type parsed struct {
id string
t time.Time
}
var items []parsed
for _, id := range generations {
t, err := time.Parse("20060102T150405Z", id)
if err != nil {
continue // unbekanntes Format wird ignoriert, nicht geloescht
}
items = append(items, parsed{id: id, t: t})
}
sort.Slice(items, func(i, j int) bool { return items[i].t.After(items[j].t) }) // neueste zuerst
keepSet := make(map[string]bool)
if len(items) > 0 {
keepSet[items[0].id] = true // Sicherheitsnetz: immer die neueste
}
applyTier := func(bucketKey func(time.Time) string, n int) {
if n <= 0 {
return
}
seen := make(map[string]bool)
count := 0
for _, it := range items {
if count >= n {
break
}
key := bucketKey(it.t)
if seen[key] {
continue
}
seen[key] = true
count++
keepSet[it.id] = true
}
}
applyTier(func(t time.Time) string { return t.Format("2006-01-02") }, policy.KeepDaily)
applyTier(func(t time.Time) string {
y, w := t.ISOWeek()
return fmt.Sprintf("%04d-W%02d", y, w)
}, policy.KeepWeekly)
applyTier(func(t time.Time) string { return t.Format("2006-01") }, policy.KeepMonthly)
for _, it := range items {
if keepSet[it.id] {
keep = append(keep, it.id)
} else {
remove = append(remove, it.id)
}
}
return keep, remove
}
+130
View File
@@ -0,0 +1,130 @@
package backup
import (
"os"
"path/filepath"
"testing"
"time"
)
func genID(t time.Time) string { return NewGenerationID(t) }
// TestPruneTiered_KeepsCorrectStaggering ist Pruefung 1: Prune-Test mit
// simulierten Snapshots ueber mehrere Altersstufen ergibt korrekte
// Staffelung.
func TestPruneTiered_KeepsCorrectStaggering(t *testing.T) {
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
var generations []string
// 20 taegliche generationen der letzten 20 Tage.
for i := 0; i < 20; i++ {
generations = append(generations, genID(now.Add(-time.Duration(i)*24*time.Hour)))
}
// zusaetzlich aeltere, wochenweise verteilte generationen (Wochen 4-15
// zurueck), damit KeepWeekly etwas zu greifen hat, das KeepDaily nicht
// schon abdeckt.
for w := 4; w <= 15; w++ {
generations = append(generations, genID(now.Add(-time.Duration(w*7)*24*time.Hour)))
}
// und einige monatealte generationen.
for m := 3; m <= 10; m++ {
generations = append(generations, genID(now.AddDate(0, -m, 0)))
}
policy := RetentionPolicy{KeepDaily: 7, KeepWeekly: 4, KeepMonthly: 6}
keep, remove := PruneTiered(generations, policy)
if len(keep)+len(remove) != len(generations) {
t.Fatalf("keep+remove = %d, want %d (gesamtzahl)", len(keep)+len(remove), len(generations))
}
// Genau die 7 juengsten taeglichen generationen muessen behalten sein.
keepSet := make(map[string]bool, len(keep))
for _, k := range keep {
keepSet[k] = true
}
for i := 0; i < 7; i++ {
id := genID(now.Add(-time.Duration(i) * 24 * time.Hour))
if !keepSet[id] {
t.Fatalf("generation %q (tag %d) haette per KeepDaily behalten werden muessen", id, i)
}
}
// Zu weit zurueckliegende taegliche generationen (ausserhalb aller
// Stufen) duerfen NICHT behalten sein.
tooOld := genID(now.Add(-19 * 24 * time.Hour))
if keepSet[tooOld] {
t.Fatalf("generation %q haette NICHT behalten werden duerfen (zu alt fuer jede stufe)", tooOld)
}
if len(keep) == 0 {
t.Fatal("erwartet mindestens eine behaltene generation")
}
}
// TestPruneTiered_AlwaysKeepsNewest ist das Sicherheitsnetz fuer
// Akzeptanzkriterium 3 (mindestens ein aktueller Snapshot bleibt immer
// erhalten) - selbst bei Policy 0/0/0 (versehentlich deaktiviert).
func TestPruneTiered_AlwaysKeepsNewest(t *testing.T) {
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
generations := []string{genID(now), genID(now.Add(-48 * time.Hour))}
keep, remove := PruneTiered(generations, RetentionPolicy{})
if len(keep) != 1 || keep[0] != genID(now) {
t.Fatalf("erwartet genau die neueste generation behalten, habe keep=%v", keep)
}
if len(remove) != 1 {
t.Fatalf("erwartet 1 entfernte generation, habe %d", len(remove))
}
}
// TestPruneTiered_DeterministicForIdenticalInput - zwei Laeufe mit
// identischer Eingabe liefern dasselbe Ergebnis.
func TestPruneTiered_DeterministicForIdenticalInput(t *testing.T) {
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
var generations []string
for i := 0; i < 10; i++ {
generations = append(generations, genID(now.Add(-time.Duration(i)*24*time.Hour)))
}
policy := RetentionPolicy{KeepDaily: 3}
keep1, remove1 := PruneTiered(generations, policy)
keep2, remove2 := PruneTiered(generations, policy)
if len(keep1) != len(keep2) || len(remove1) != len(remove2) {
t.Fatal("unterschiedliches ergebnis zwischen zwei laeufen mit identischer eingabe")
}
}
// TestPruneRotate_DeletesOnlyExpiredGenerations ist Pruefung 2:
// automatisierte Loeschung abgelaufener Snapshots im Test nachgewiesen -
// real gegen echte Verzeichnisse.
func TestPruneRotate_DeletesOnlyExpiredGenerations(t *testing.T) {
backupDir := t.TempDir()
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
var recent, expired string
for i := 0; i < 3; i++ {
id := genID(now.Add(-time.Duration(i) * 24 * time.Hour))
if err := os.MkdirAll(filepath.Join(backupDir, id, FullBackupDirName), 0o750); err != nil {
t.Fatal(err)
}
recent = id
}
expired = genID(now.Add(-60 * 24 * time.Hour))
if err := os.MkdirAll(filepath.Join(backupDir, expired, FullBackupDirName), 0o750); err != nil {
t.Fatal(err)
}
removed, err := PruneRotate(backupDir, RetentionPolicy{KeepDaily: 3})
if err != nil {
t.Fatalf("prunerotate: %v", err)
}
if len(removed) != 1 || removed[0] != expired {
t.Fatalf("erwartet genau die abgelaufene generation %q entfernt, habe %v", expired, removed)
}
if _, err := os.Stat(filepath.Join(backupDir, recent)); err != nil {
t.Fatalf("juengste generation faelschlich entfernt: %v", err)
}
if _, err := os.Stat(filepath.Join(backupDir, expired)); !os.IsNotExist(err) {
t.Fatal("abgelaufene generation wurde nicht tatsaechlich vom dateisystem entfernt")
}
}
+20
View File
@@ -54,3 +54,23 @@ func Rotate(backupDir string, keep int) (removed []string, err error) {
}
return removed, nil
}
// PruneRotate wendet BAK-07s gestaffelte RetentionPolicy (PruneTiered,
// siehe retention.go) tatsächlich an — entfernt alle nicht mehr zu
// behaltenden Generationsverzeichnisse. Automatisierte Löschung nach
// Ablauf der Frist (Akzeptanzkriterium 2), unabhängig von RET-02s
// Dokumenten-Retention.
func PruneRotate(backupDir string, policy RetentionPolicy) (removed []string, err error) {
generations, err := ListGenerations(backupDir)
if err != nil {
return nil, err
}
_, toRemove := PruneTiered(generations, policy)
for _, gen := range toRemove {
if err := os.RemoveAll(filepath.Join(backupDir, gen)); err != nil {
return removed, fmt.Errorf("backup: generation %q entfernen: %w", gen, err)
}
removed = append(removed, gen)
}
return removed, nil
}
+36
View File
@@ -137,6 +137,42 @@ func Forget(ctx context.Context, cfg Config, keepLast int) error {
return nil
}
// RetentionPolicy ist eine gestaffelte Aufbewahrungsfrist nach
// restic/Borg-Vorbild (BAK-07, unabhängig von RET-02s Dokumenten-
// Retention): täglich/wöchentlich/monatlich je eine konfigurierbare
// Anzahl Snapshots behalten, statt einer flachen "letzte N"-Regel
// (Forget/keepLast) oder hart codierter Staffelung. Ein Feldwert 0
// bedeutet "diese Stufe nicht anwenden" (restics eigene Konvention bei
// `--keep-*`).
type RetentionPolicy struct {
KeepDaily int
KeepWeekly int
KeepMonthly int
}
// PruneTiered wendet policy über restics NATIVE `--keep-daily`/
// `--keep-weekly`/`--keep-monthly`-Staffelung an (kein Eigenbau der
// Bucket-Logik — restic beherrscht das bereits robust) und gibt den
// belegten Speicherplatz nicht mehr referenzierter Daten frei
// (`--prune`). Snapshots, die keiner Stufe zugeordnet werden, entfallen
// automatisch — restics übliche GFS-Semantik.
func PruneTiered(ctx context.Context, cfg Config, policy RetentionPolicy) error {
args := []string{"forget", "--prune"}
if policy.KeepDaily > 0 {
args = append(args, "--keep-daily", fmt.Sprintf("%d", policy.KeepDaily))
}
if policy.KeepWeekly > 0 {
args = append(args, "--keep-weekly", fmt.Sprintf("%d", policy.KeepWeekly))
}
if policy.KeepMonthly > 0 {
args = append(args, "--keep-monthly", fmt.Sprintf("%d", policy.KeepMonthly))
}
if _, err := run(ctx, cfg, args...); err != nil {
return fmt.Errorf("objectbackup: gestaffelte rotation: %w", err)
}
return nil
}
// Restore stellt snapshotID nach targetDir wieder her (`restic restore`).
// targetDir muss bereits existieren; Atomarität gegenüber einem eventuell
// nicht-leeren ENDZIEL ist Aufgabe von internal/restore, nicht dieser
@@ -0,0 +1,125 @@
package objectbackup
import (
"context"
"encoding/json"
"os"
"path/filepath"
"testing"
"time"
)
// backupAt erstellt einen Snapshot mit ERZWUNGENEM Zeitstempel
// (restics `backup --time`) - so lassen sich mehrere Altersstufen real
// simulieren, ohne tatsaechlich tagelang zu warten.
func backupAt(t *testing.T, cfg Config, sourceDir string, at time.Time) {
t.Helper()
// restics --time erwartet SEIN EIGENES Format ("2006-01-02 15:04:05"),
// nicht RFC3339 - real erst hier festgestellt (restic verweigert
// RFC3339 mit einem Parse-Fehler).
output, err := run(context.Background(), cfg, "backup", sourceDir, "--time", at.Format("2006-01-02 15:04:05"), "--json")
if err != nil {
t.Fatalf("backup (zeitstempel %s): %v (ausgabe: %s)", at, err, output)
}
}
// TestPruneTiered_KeepsCorrectStaggering_RealSnapshots ist Pruefung 1
// fuer den Objekt-Storage-Teil: reale, gestaffelt datierte Snapshots,
// restics eigene Staffelung liefert die erwartete Anzahl verbleibender
// Snapshots.
func TestPruneTiered_KeepsCorrectStaggering_RealSnapshots(t *testing.T) {
cfg := setupTest(t)
sourceDir := t.TempDir()
writeFile(t, sourceDir, "datei.txt", "inhalt")
now := time.Now().UTC()
for i := 0; i < 10; i++ {
backupAt(t, cfg, sourceDir, now.Add(-time.Duration(i)*24*time.Hour))
}
if got, err := SnapshotCount(context.Background(), cfg); err != nil || got != 10 {
t.Fatalf("erwartet 10 snapshots vor dem prune, habe %d (err=%v)", got, err)
}
if err := PruneTiered(context.Background(), cfg, RetentionPolicy{KeepDaily: 3}); err != nil {
t.Fatalf("prunetiered: %v", err)
}
got, err := SnapshotCount(context.Background(), cfg)
if err != nil {
t.Fatalf("snapshotcount: %v", err)
}
if got != 3 {
t.Fatalf("erwartet 3 verbleibende snapshots nach KeepDaily=3, habe %d", got)
}
}
// TestPruneTiered_KeptSnapshotStillFullyRestorable ist der reale Beweis
// fuer Akzeptanzkriterium 3 (Pruefung 3, Legal-Hold-Analog): Pruning
// aelterer Snapshots darf niemals Daten beschaedigen, die ein
// VERBLEIBENDER (aktueller) Snapshot noch braucht - genau die
// Eigenschaft, die verhindert, dass Pruning mit einer laufenden
// Dokumenten-Aufbewahrungssperre kollidiert: solange das Dokument in
// einem behaltenen Snapshot steckt, bleibt es nach dem Pruning
// vollstaendig wiederherstellbar.
func TestPruneTiered_KeptSnapshotStillFullyRestorable(t *testing.T) {
cfg := setupTest(t)
sourceDir := t.TempDir()
content := "unveraendertes dokument, muss nach dem pruning vollstaendig lesbar bleiben"
writeFile(t, sourceDir, "gehaltenes-dokument.txt", content)
now := time.Now().UTC()
// mehrere aeltere snapshots desselben unveraenderten inhalts (dedupliziert)
for i := 5; i >= 1; i-- {
backupAt(t, cfg, sourceDir, now.Add(-time.Duration(i)*24*time.Hour))
}
// EIN aktueller, zu behaltender snapshot
backupAt(t, cfg, sourceDir, now)
// erwarte 5 aeltere zu entfernen, den juengsten zu behalten
if err := PruneTiered(context.Background(), cfg, RetentionPolicy{KeepDaily: 1}); err != nil {
t.Fatalf("prunetiered: %v", err)
}
remaining, err := SnapshotCount(context.Background(), cfg)
if err != nil {
t.Fatalf("snapshotcount: %v", err)
}
if remaining != 1 {
t.Fatalf("erwartet 1 verbleibenden snapshot, habe %d", remaining)
}
latestID := latestSnapshotShortID(t, cfg)
targetDir := t.TempDir()
if err := Restore(context.Background(), cfg, latestID, targetDir); err != nil {
t.Fatalf("restore nach pruning: %v", err)
}
got, err := os.ReadFile(filepath.Join(targetDir, sourceDir, "gehaltenes-dokument.txt"))
if err != nil {
t.Fatalf("wiederhergestelltes dokument lesen: %v", err)
}
if string(got) != content {
t.Fatalf("dokumentinhalt nach pruning beschaedigt: %q, want %q", got, content)
}
// Zusaetzlich: restics eigene Integritaetspruefung bestaetigt, dass
// das Pruning kein von behaltenen Snapshots benoetigtes Datenblock
// entfernt hat.
if err := Check(context.Background(), cfg, true); err != nil {
t.Fatalf("check nach pruning: %v", err)
}
}
func latestSnapshotShortID(t *testing.T, cfg Config) string {
t.Helper()
output, err := run(context.Background(), cfg, "snapshots", "--json")
if err != nil {
t.Fatalf("snapshots: %v", err)
}
var snapshots []snapshotEntry
if err := json.Unmarshal(output, &snapshots); err != nil {
t.Fatalf("snapshot-liste dekodieren: %v", err)
}
if len(snapshots) == 0 {
t.Fatal("keine snapshots vorhanden")
}
return snapshots[len(snapshots)-1].ShortID
}
+61
View File
@@ -0,0 +1,61 @@
package restoretest
import (
"bufio"
"encoding/json"
"fmt"
"os"
)
// AppendHistory hängt result an die JSONL-Protokolldatei an
// (Akzeptanzkriterium 2/Pflichtprüfung 3: Historie zeigt mehrere
// zurückliegende Testläufe nachvollziehbar an — append-only, nichts wird
// überschrieben).
func AppendHistory(logPath string, result Result) error {
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
if err != nil {
return fmt.Errorf("restoretest: protokolldatei öffnen: %w", err)
}
defer func() { _ = f.Close() }()
line, err := json.Marshal(result)
if err != nil {
return fmt.Errorf("restoretest: ergebnis kodieren: %w", err)
}
if _, err := f.Write(append(line, '\n')); err != nil {
return fmt.Errorf("restoretest: ergebnis schreiben: %w", err)
}
return nil
}
// ReadHistory liest alle bisherigen Testlauf-Ergebnisse — Nachweis der
// Nachvollziehbarkeit über mehrere Läufe hinweg.
func ReadHistory(logPath string) ([]Result, error) {
f, err := os.Open(logPath)
if err != nil {
if os.IsNotExist(err) {
return nil, nil
}
return nil, fmt.Errorf("restoretest: protokolldatei lesen: %w", err)
}
defer func() { _ = f.Close() }()
var results []Result
scanner := bufio.NewScanner(f)
scanner.Buffer(make([]byte, 0, 64*1024), 1024*1024)
for scanner.Scan() {
line := scanner.Bytes()
if len(line) == 0 {
continue
}
var r Result
if err := json.Unmarshal(line, &r); err != nil {
return nil, fmt.Errorf("restoretest: protokollzeile dekodieren: %w", err)
}
results = append(results, r)
}
if err := scanner.Err(); err != nil {
return nil, fmt.Errorf("restoretest: protokolldatei durchlaufen: %w", err)
}
return results, nil
}
@@ -0,0 +1,49 @@
package restoretest
import (
"path/filepath"
"testing"
"time"
)
// TestHistory_ShowsMultiplePastRunsInOrder ist Pruefung 3: Protokoll-
// historie zeigt mehrere zurueckliegende Testlaeufe nachvollziehbar an.
func TestHistory_ShowsMultiplePastRunsInOrder(t *testing.T) {
logPath := filepath.Join(t.TempDir(), "restoretest.log")
results := []Result{
{Timestamp: time.Now().UTC(), Kind: KindDatabase, Source: "gen-1", Success: true, Detail: "ok"},
{Timestamp: time.Now().UTC().Add(time.Hour), Kind: KindObjects, Source: "snap-1", Success: false, Detail: "kaputt"},
{Timestamp: time.Now().UTC().Add(2 * time.Hour), Kind: KindDatabase, Source: "gen-2", Success: true, Detail: "ok"},
}
for _, r := range results {
if err := AppendHistory(logPath, r); err != nil {
t.Fatalf("appendHistory: %v", err)
}
}
got, err := ReadHistory(logPath)
if err != nil {
t.Fatalf("readHistory: %v", err)
}
if len(got) != len(results) {
t.Fatalf("erwartet %d eintraege, habe %d", len(results), len(got))
}
for i, want := range results {
if got[i].Source != want.Source || got[i].Success != want.Success || got[i].Kind != want.Kind {
t.Fatalf("eintrag %d = %+v, want %+v", i, got[i], want)
}
}
}
// TestReadHistory_MissingFileReturnsEmpty - noch kein Testlauf ist kein
// Fehlerzustand.
func TestReadHistory_MissingFileReturnsEmpty(t *testing.T) {
got, err := ReadHistory(filepath.Join(t.TempDir(), "nicht-vorhanden.log"))
if err != nil {
t.Fatalf("erwartet keinen fehler, habe: %v", err)
}
if len(got) != 0 {
t.Fatalf("erwartet leere historie, habe %d eintraege", len(got))
}
}
+239
View File
@@ -0,0 +1,239 @@
// Package restoretest implementiert BAK-06: regelmäßiger, automatisierter
// Testlauf des BAK-03-Restore-Verfahrens gegen eine isolierte
// Testumgebung — "Wiederherstellung ist Routine, nicht Ausnahmefall"
// (Produkt-DNA) heißt: nicht nur Dateien vorhanden pruefen, sondern
// tatsächlich eine funktionsfähige Instanz aus der Sicherung starten und
// befragen, exakt wie BAK-03s eigener Prüfungsnachweis — hier als
// Produktcode statt Testcode, damit es regelmäßig UNBEAUFSICHTIGT laufen
// kann.
package restoretest
import (
"bytes"
"context"
"encoding/json"
"fmt"
"os"
"os/exec"
"path/filepath"
"strings"
"time"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
)
// Kind unterscheidet Datenbank- und Objekt-Storage-Testlauf im Protokoll.
type Kind string
const (
KindDatabase Kind = "database"
KindObjects Kind = "objects"
)
// Result ist EIN Testlauf-Ergebnis (Akzeptanzkriterium 2: Ergebnis mit
// Zeitstempel protokolliert).
type Result struct {
Timestamp time.Time `json:"timestamp"`
Kind Kind `json:"kind"`
Source string `json:"source"` // Generation-ID oder Snapshot-ID
Success bool `json:"success"`
Detail string `json:"detail"`
}
// PgConfig bündelt die zusätzlich zu backup.Config nötigen Angaben für
// den Kurzstart der Test-Instanz (eigener Port/Socket, damit die
// Testinstanz die echte Test-Datenbank auf demselben Host nicht stört).
type PgConfig struct {
PgCtlPath string // Default "pg_ctl"
PsqlPath string // Default "psql"
TestPort string // Default "55433"
}
func (c PgConfig) ctlBinary() string {
if c.PgCtlPath != "" {
return c.PgCtlPath
}
return "pg_ctl"
}
func (c PgConfig) psqlBinary() string {
if c.PsqlPath != "" {
return c.PsqlPath
}
return "psql"
}
func (c PgConfig) port() string {
if c.TestPort != "" {
return c.TestPort
}
return "55433"
}
// RunDatabaseTest führt einen vollständigen Restore der NEUESTEN
// Generation in ein frisches, isoliertes Testverzeichnis durch und
// beweist Wiederherstellbarkeit, indem daraus tatsächlich eine
// eigenständige Postgres-Instanz gestartet und per echter Verbindung
// abgefragt wird (Akzeptanzkriterium 1) — dieselbe Prüftiefe wie BAK-03s
// eigener Nachweis, hier als wiederholbarer Produktcode.
func RunDatabaseTest(ctx context.Context, cfg backup.Config, pgCfg PgConfig, testRoot string) Result {
res := Result{Timestamp: time.Now().UTC(), Kind: KindDatabase}
generations, err := backup.ListGenerations(cfg.BackupDir)
if err != nil || len(generations) == 0 {
res.Detail = fmt.Sprintf("keine sicherungsgeneration gefunden: %v", err)
return res
}
genID := generations[len(generations)-1]
res.Source = genID
testDir, err := os.MkdirTemp(testRoot, "restoretest-db-*")
if err != nil {
res.Detail = fmt.Sprintf("testverzeichnis anlegen: %v", err)
return res
}
defer func() { _ = os.RemoveAll(testDir) }()
restoreOut := filepath.Join(testDir, "pgdata")
if err := os.MkdirAll(restoreOut, 0o700); err != nil {
res.Detail = fmt.Sprintf("pgdata-verzeichnis anlegen: %v", err)
return res
}
if err := backup.Restore(ctx, cfg, genID, restoreOut); err != nil {
res.Detail = fmt.Sprintf("restore fehlgeschlagen: %v", err)
return res
}
// Minimalkonfiguration NUR für den isolierten Kurzstart (auf diesem
// Debian-Postgres liegen postgresql.conf/pg_hba.conf ausserhalb von
// PGDATA, siehe BAK-03-PRUEFPROTOKOLL.md - der reale Sicherungsinhalt
// selbst enthält sie nicht).
if err := os.WriteFile(filepath.Join(restoreOut, "postgresql.conf"), []byte("listen_addresses = ''\n"), 0o600); err != nil {
res.Detail = fmt.Sprintf("testkonfiguration schreiben: %v", err)
return res
}
if err := os.WriteFile(filepath.Join(restoreOut, "pg_hba.conf"), []byte("local all all trust\n"), 0o600); err != nil {
res.Detail = fmt.Sprintf("testkonfiguration schreiben: %v", err)
return res
}
// EIGENES, kurzes Verzeichnis fuer den Unix-Socket - NICHT unter
// testDir (Postgres begrenzt Socket-Pfade auf 107 Byte, ein tief
// verschachtelter Testverzeichnis-Pfad reisst dieses Limit leicht).
socketDir, err := os.MkdirTemp("", "nexarch-rt-sock-*")
if err != nil {
res.Detail = fmt.Sprintf("socket-verzeichnis anlegen: %v", err)
return res
}
defer func() { _ = os.RemoveAll(socketDir) }()
logFile := filepath.Join(testDir, "postgres.log")
startCtx, cancel := context.WithTimeout(ctx, 60*time.Second)
defer cancel()
startCmd := exec.CommandContext(startCtx, pgCfg.ctlBinary(), "start", "-D", restoreOut, "-w", "-t", "30", "-l", logFile,
"-o", fmt.Sprintf("-p %s -k %s -c listen_addresses=''", pgCfg.port(), socketDir))
if err := startCmd.Run(); err != nil {
logContent, _ := os.ReadFile(logFile)
res.Detail = fmt.Sprintf("testinstanz starten fehlgeschlagen: %v (log: %s)", err, string(logContent))
return res
}
defer func() {
stopCmd := exec.Command(pgCfg.ctlBinary(), "stop", "-D", restoreOut, "-m", "fast")
_ = stopCmd.Run()
}()
psqlCtx, cancelPsql := context.WithTimeout(ctx, 15*time.Second)
defer cancelPsql()
psqlOut, err := exec.CommandContext(psqlCtx, pgCfg.psqlBinary(),
"-h", socketDir, "-p", pgCfg.port(), "-U", cfg.User, "-d", "postgres",
"-tAc", "SELECT 1").CombinedOutput()
if err != nil || strings.TrimSpace(string(psqlOut)) != "1" {
res.Detail = fmt.Sprintf("verbindung zur testinstanz fehlgeschlagen: %v (ausgabe: %s)", err, string(psqlOut))
return res
}
res.Success = true
res.Detail = "restore und verbindungspruefung erfolgreich"
return res
}
// RunObjectTest führt einen vollständigen Restore des NEUESTEN Snapshots
// in ein frisches, isoliertes Testverzeichnis durch — restics eigene
// Vollständigkeitsgarantie beim Restore (bricht bei fehlenden/beschädigten
// Blöcken ab) ist der Wiederherstellbarkeitsnachweis, zusätzlich real
// geprüft, dass das Zielverzeichnis tatsächlich Inhalt enthält.
func RunObjectTest(ctx context.Context, cfg objectbackup.Config, testRoot string) Result {
res := Result{Timestamp: time.Now().UTC(), Kind: KindObjects}
snapshotID, err := latestSnapshotID(ctx, cfg)
if err != nil {
res.Detail = fmt.Sprintf("neuesten snapshot ermitteln: %v", err)
return res
}
res.Source = snapshotID
testDir, err := os.MkdirTemp(testRoot, "restoretest-objects-*")
if err != nil {
res.Detail = fmt.Sprintf("testverzeichnis anlegen: %v", err)
return res
}
defer func() { _ = os.RemoveAll(testDir) }()
if err := objectbackup.Restore(ctx, cfg, snapshotID, testDir); err != nil {
res.Detail = fmt.Sprintf("restore fehlgeschlagen: %v", err)
return res
}
empty, err := dirIsEmpty(testDir)
if err != nil {
res.Detail = fmt.Sprintf("wiederhergestelltes verzeichnis pruefen: %v", err)
return res
}
if empty {
res.Detail = "restore lief ohne fehler, aber zielverzeichnis ist leer"
return res
}
res.Success = true
res.Detail = "restore erfolgreich, inhalt vorhanden"
return res
}
func dirIsEmpty(dir string) (bool, error) {
entries, err := os.ReadDir(dir)
if err != nil {
return false, err
}
return len(entries) == 0, nil
}
func latestSnapshotID(ctx context.Context, cfg objectbackup.Config) (string, error) {
binary := cfg.ResticPath
if binary == "" {
binary = "restic"
}
cmd := exec.CommandContext(ctx, binary, "-r", cfg.RepoDir, "snapshots", "--json")
cmd.Env = append(os.Environ(), "RESTIC_PASSWORD="+cfg.Password)
var stderr bytes.Buffer
cmd.Stderr = &stderr
// NUR stdout, nicht CombinedOutput: restic schreibt bei fehlendem/
// nicht beschreibbarem Cache-Verzeichnis eine Warnung nach stderr
// (z.B. "unable to open cache: ..." - real beobachtet unter dem
// systemd-Dienstnutzer "nexarch" ohne beschreibbares HOME), die vor
// das JSON-Array gemischt worden waere und das Parsen bricht.
output, err := cmd.Output()
if err != nil {
return "", fmt.Errorf("restic snapshots: %w (stderr: %s)", err, stderr.String())
}
var snapshots []struct {
ShortID string `json:"short_id"`
}
if err := json.Unmarshal(output, &snapshots); err != nil {
return "", fmt.Errorf("snapshot-liste dekodieren: %w", err)
}
if len(snapshots) == 0 {
return "", fmt.Errorf("keine snapshots vorhanden")
}
return snapshots[len(snapshots)-1].ShortID, nil
}
@@ -0,0 +1,122 @@
package restoretest
import (
"context"
"os"
"os/exec"
"path/filepath"
"testing"
"time"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
)
func requireDBTestConfig(t *testing.T) backup.Config {
t.Helper()
user := os.Getenv("TEST_BACKUP_PG_USER")
if user == "" {
t.Skip("TEST_BACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen")
}
if _, err := exec.LookPath("pg_combinebackup"); err != nil {
t.Skip("pg_combinebackup nicht installiert, Integrationstest uebersprungen")
}
if _, err := exec.LookPath("pg_ctl"); err != nil {
t.Skip("pg_ctl nicht installiert, Integrationstest uebersprungen")
}
return backup.Config{
Host: envOrT("TEST_BACKUP_PG_HOST", "localhost"),
Port: envOrT("TEST_BACKUP_PG_PORT", "5432"),
User: user,
Password: os.Getenv("TEST_BACKUP_PG_PASSWORD"),
BackupDir: t.TempDir(),
}
}
func envOrT(key, fallback string) string {
if v := os.Getenv(key); v != "" {
return v
}
return fallback
}
// TestRunDatabaseTest_SucceedsAgainstRealBackup ist Pruefung 1: geplanter
// Testlauf gegen aktuelle Sicherung erfolgreich durchgefuehrt.
func TestRunDatabaseTest_SucceedsAgainstRealBackup(t *testing.T) {
cfg := requireDBTestConfig(t)
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
defer cancel()
genID := backup.NewGenerationID(time.Now())
if _, err := backup.FullBackup(ctx, cfg, genID); err != nil {
t.Fatalf("fullbackup: %v", err)
}
res := RunDatabaseTest(ctx, cfg, PgConfig{TestPort: "55434"}, t.TempDir())
if !res.Success {
t.Fatalf("erwartet erfolgreichen testlauf, habe: %+v", res)
}
if res.Source != genID {
t.Fatalf("source = %q, want %q", res.Source, genID)
}
}
// TestRunDatabaseTest_DetectsCorruptedBackup ist Pruefung 2: absichtlich
// beschaedigte Sicherung laesst den Testlauf sichtbar fehlschlagen.
func TestRunDatabaseTest_DetectsCorruptedBackup(t *testing.T) {
cfg := requireDBTestConfig(t)
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
defer cancel()
genID := backup.NewGenerationID(time.Now())
manifest, err := backup.FullBackup(ctx, cfg, genID)
if err != nil {
t.Fatalf("fullbackup: %v", err)
}
// Absichtliche Beschaedigung: base.tar.gz durch Muell ersetzen.
tarPath := filepath.Join(filepath.Dir(manifest), backup.BaseTarGzFile)
if err := os.WriteFile(tarPath, []byte("das ist kein gueltiges tar.gz"), 0o600); err != nil {
t.Fatal(err)
}
res := RunDatabaseTest(ctx, cfg, PgConfig{TestPort: "55435"}, t.TempDir())
if res.Success {
t.Fatal("erwartet fehlschlag bei beschaedigter sicherung, testlauf meldete erfolg")
}
if res.Detail == "" {
t.Fatal("erwartet aussagekraeftiges detail zum fehlschlag")
}
}
func requireObjTestConfig(t *testing.T) objectbackup.Config {
t.Helper()
if _, err := exec.LookPath("restic"); err != nil {
t.Skip("restic nicht installiert, Integrationstest uebersprungen")
}
cfg := objectbackup.Config{RepoDir: filepath.Join(t.TempDir(), "repo"), Password: "restoretest-passwort"}
if err := objectbackup.InitRepo(context.Background(), cfg); err != nil {
t.Fatalf("initrepo: %v", err)
}
return cfg
}
// TestRunObjectTest_SucceedsAgainstRealSnapshot ist Pruefung 1 fuer den
// Objekt-Storage-Teil.
func TestRunObjectTest_SucceedsAgainstRealSnapshot(t *testing.T) {
cfg := requireObjTestConfig(t)
ctx := context.Background()
sourceDir := t.TempDir()
if err := os.WriteFile(filepath.Join(sourceDir, "datei.txt"), []byte("inhalt"), 0o600); err != nil {
t.Fatal(err)
}
if _, err := objectbackup.Backup(ctx, cfg, sourceDir); err != nil {
t.Fatalf("backup: %v", err)
}
res := RunObjectTest(ctx, cfg, t.TempDir())
if !res.Success {
t.Fatalf("erwartet erfolgreichen testlauf, habe: %+v", res)
}
}
+76
View File
@@ -0,0 +1,76 @@
package tenantbackup
import (
"encoding/json"
"fmt"
"os"
"time"
)
// Operation unterscheidet Sicherung und Wiederherstellung im Protokoll.
type Operation string
const (
OpBackupDB Operation = "backup_database"
OpRestoreDB Operation = "restore_database"
OpBackupObj Operation = "backup_objects"
OpRestoreObj Operation = "restore_objects"
)
// LogEntry ist EIN Protokolleintrag (Akzeptanzkriterium 3: Tenant-
// Sicherung UND -Restore vollständig protokolliert).
type LogEntry struct {
Timestamp time.Time `json:"timestamp"`
Operation Operation `json:"operation"`
TenantID string `json:"tenant_id"`
Source string `json:"source,omitempty"` // Dump-Pfad oder Snapshot-ID
Target string `json:"target,omitempty"` // Zieldatenbank oder Zielverzeichnis
Result string `json:"result"` // "ok" oder Fehlertext
}
// AppendLog hängt entry an die JSONL-Protokolldatei an (append-only,
// nichts wird überschrieben).
func AppendLog(logPath string, entry LogEntry) error {
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
if err != nil {
return fmt.Errorf("tenantbackup: protokolldatei öffnen: %w", err)
}
defer func() { _ = f.Close() }()
line, err := json.Marshal(entry)
if err != nil {
return fmt.Errorf("tenantbackup: protokolleintrag kodieren: %w", err)
}
if _, err := f.Write(append(line, '\n')); err != nil {
return fmt.Errorf("tenantbackup: protokolleintrag schreiben: %w", err)
}
return nil
}
// ReadLog liest die vollständige Protokollhistorie.
func ReadLog(logPath string) ([]LogEntry, error) {
data, err := os.ReadFile(logPath)
if err != nil {
if os.IsNotExist(err) {
return nil, nil
}
return nil, fmt.Errorf("tenantbackup: protokolldatei lesen: %w", err)
}
var entries []LogEntry
start := 0
for i := 0; i < len(data); i++ {
if data[i] == '\n' {
line := data[start:i]
start = i + 1
if len(line) == 0 {
continue
}
var e LogEntry
if err := json.Unmarshal(line, &e); err != nil {
return nil, fmt.Errorf("tenantbackup: protokollzeile dekodieren: %w", err)
}
entries = append(entries, e)
}
}
return entries, nil
}
+37
View File
@@ -0,0 +1,37 @@
package tenantbackup
import (
"path/filepath"
"testing"
"time"
)
// TestLog_BackupAndRestoreFullyLogged ist Pruefung 3: Tenant-Sicherung
// UND -Restore vollstaendig protokolliert.
func TestLog_BackupAndRestoreFullyLogged(t *testing.T) {
logPath := filepath.Join(t.TempDir(), "tenantbackup.log")
entries := []LogEntry{
{Timestamp: time.Now().UTC(), Operation: OpBackupDB, TenantID: "a", Source: "/x/dump.pgcustom", Result: "ok"},
{Timestamp: time.Now().UTC(), Operation: OpRestoreDB, TenantID: "a", Source: "/x/dump.pgcustom", Target: "a_restored", Result: "ok"},
}
for _, e := range entries {
if err := AppendLog(logPath, e); err != nil {
t.Fatalf("appendlog: %v", err)
}
}
got, err := ReadLog(logPath)
if err != nil {
t.Fatalf("readlog: %v", err)
}
if len(got) != 2 {
t.Fatalf("erwartet 2 eintraege, habe %d", len(got))
}
if got[0].Operation != OpBackupDB || got[1].Operation != OpRestoreDB {
t.Fatalf("unerwartete reihenfolge/operationen: %+v", got)
}
if got[0].TenantID != "a" || got[1].Target != "a_restored" {
t.Fatalf("eintraege unvollstaendig: %+v", got)
}
}
@@ -0,0 +1,155 @@
// Package tenantbackup implementiert BAK-04: Sicherung und
// Wiederherstellung der Daten EINES einzelnen Mandanten, ohne andere
// Mandanten zu berühren.
//
// BEWUSST NICHT auf BAK-01/BAK-03 aufgesetzt: pg_basebackup (BAK-01)
// sichert den GESAMTEN Postgres-Cluster — bei Modell C (TEN-01, eine
// physisch isolierte Datenbank je Mandant) liegen ALLE Mandanten-
// Datenbanken in genau diesem einen Cluster, ein Restore der
// Cluster-Sicherung würde also zwangsläufig ALLE Mandanten gleichzeitig
// überschreiben — das genaue Gegenteil von Mandanten-Isolation. BAK-04
// braucht daher ein DATENBANK-SCHARFES logisches Verfahren (pg_dump/
// pg_restore für genau EINE Datenbank), keine physische
// Cluster-Sicherung. Objekt-Storage ist bereits von Haus aus pro
// Mandant getrennt (eigener Bucket/Pfad-Root, STORAGE-KONZEPT.md
// Abschnitt 3) — dort genügt ein restic-Repository je Mandanten-Root
// (objectbackup-Paket direkt wiederverwendbar, ein Aufruf pro
// Mandanten-Verzeichnis).
package tenantbackup
import (
"context"
"fmt"
"os"
"os/exec"
"path/filepath"
)
// Config enthält die Verbindungsdaten — ausschließlich über
// Umgebungsvariablen befüllt (siehe Ticket-Abschluss-Regel).
type Config struct {
Host string
Port string
User string
Password string
BackupDir string
PgDumpPath string // Default "pg_dump"
PgRestorePath string // Default "pg_restore"
PsqlPath string // Default "psql"
}
func (c Config) dumpBinary() string {
if c.PgDumpPath != "" {
return c.PgDumpPath
}
return "pg_dump"
}
func (c Config) restoreBinary() string {
if c.PgRestorePath != "" {
return c.PgRestorePath
}
return "pg_restore"
}
func (c Config) psqlBinary() string {
if c.PsqlPath != "" {
return c.PsqlPath
}
return "psql"
}
const DumpFile = "dump.pgcustom"
// Backup erstellt eine logische Sicherung GENAU EINER Mandanten-
// Datenbank (Custom-Format, `pg_dump -Fc`) — enthält strukturell
// ausschließlich Daten dieser einen Datenbank, andere Mandanten-
// Datenbanken werden nie verbunden oder gelesen (Akzeptanzkriterium 1).
func Backup(ctx context.Context, cfg Config, tenantDB, generationID string) (dumpPath string, err error) {
dir := filepath.Join(cfg.BackupDir, tenantDB, generationID)
if err := os.MkdirAll(dir, 0o750); err != nil {
return "", fmt.Errorf("tenantbackup: sicherungsverzeichnis anlegen: %w", err)
}
dumpPath = filepath.Join(dir, DumpFile)
args := []string{
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
"-Fc", "-f", dumpPath, "--no-password", tenantDB,
}
cmd := exec.CommandContext(ctx, cfg.dumpBinary(), args...)
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
output, err := cmd.CombinedOutput()
if err != nil {
return "", fmt.Errorf("tenantbackup: %s fehlgeschlagen: %w (ausgabe: %s)", cfg.dumpBinary(), err, string(output))
}
return dumpPath, nil
}
// Verify prüft, dass dumpPath ein vollständig lesbares pg_dump-Custom-
// Format-Archiv ist — liest die GESAMTE Inhaltsliste (`pg_restore -l`),
// nicht nur den Dateikopf, damit ein abgeschnittenes oder beschädigtes
// Archiv zuverlässig auffällt.
func Verify(ctx context.Context, cfg Config, dumpPath string) error {
cmd := exec.CommandContext(ctx, cfg.restoreBinary(), "-l", dumpPath)
output, err := cmd.CombinedOutput()
if err != nil {
return fmt.Errorf("tenantbackup: sicherung beschädigt oder unvollständig: %w (ausgabe: %s)", err, string(output))
}
if len(output) == 0 {
return fmt.Errorf("tenantbackup: sicherung enthält keine inhaltsliste")
}
return nil
}
// Restore stellt dumpPath in targetDB wieder her — targetDB MUSS bereits
// existieren und leer sein (angelegt vom Aufrufer über CreateEmptyDatabase),
// niemals die Quelldatenbank selbst oder eine andere Mandanten-Datenbank
// (Akzeptanzkriterium 2: Wiederherstellung verändert keine Daten anderer
// Mandanten — strukturell garantiert, weil pg_restore ausschließlich mit
// der EINEN übergebenen Zielverbindung spricht).
func Restore(ctx context.Context, cfg Config, dumpPath, targetDB string) error {
args := []string{
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
// --no-owner: die Zieldatenbank ist eine frische, isolierte
// Testumgebung (CreateEmptyDatabase) - der urspruengliche
// Tenant-Eigentuemer existiert dort nicht zwangslaeufig mit
// gleichen Rechten, und Eigentuemerschaft ist fuer den
// Restore-Nachweis irrelevant (Standardpraxis beim Restore in
// eine andere Umgebung).
"--no-owner",
"-d", targetDB, "--no-password", dumpPath,
}
cmd := exec.CommandContext(ctx, cfg.restoreBinary(), args...)
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
output, err := cmd.CombinedOutput()
if err != nil {
return fmt.Errorf("tenantbackup: %s fehlgeschlagen: %w (ausgabe: %s)", cfg.restoreBinary(), err, string(output))
}
return nil
}
// CreateEmptyDatabase legt targetDB frisch und leer an — schlägt fehl,
// wenn targetDB bereits existiert (Isolation: ein Restore darf niemals
// stillschweigend eine bestehende Datenbank eigene oder fremde
// überschreiben, dieselbe "kein stiller Overwrite"-Disziplin wie BAK-03s
// internal/restore).
func CreateEmptyDatabase(ctx context.Context, cfg Config, targetDB string) error {
cmd := exec.CommandContext(ctx, cfg.psqlBinary(),
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
"-c", fmt.Sprintf("CREATE DATABASE %s", quoteIdent(targetDB)))
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
output, err := cmd.CombinedOutput()
if err != nil {
return fmt.Errorf("tenantbackup: zieldatenbank %q anlegen fehlgeschlagen (existiert sie bereits?): %w (ausgabe: %s)", targetDB, err, string(output))
}
return nil
}
// quoteIdent ist eine MINIMALE Absicherung für Datenbanknamen, die
// ausschließlich aus dem eigenen Tenant-Registry-Kontext stammen (nie aus
// unmittelbarer Benutzereingabe an dieser Stelle) — auf doppelte
// Anführungszeichen beschränkt, da Postgres-Identifier keine
// eingebetteten NUL-Bytes zulassen.
func quoteIdent(name string) string {
return `"` + name + `"`
}
@@ -0,0 +1,203 @@
package tenantbackup
import (
"context"
"os"
"os/exec"
"testing"
"time"
)
// requireTestConfig braucht eine EIGENE Rolle mit CREATEDB-Recht
// (TEST_TENANTBACKUP_PG_USER), NICHT BAK-01/BAK-03s TEST_BACKUP_PG_USER
// (nexarch_backup) - jene Rolle hat bewusst nur REPLICATION, kein
// CREATEDB (Prinzip geringster Rechte, siehe BAK-01). BAK-04 braucht
// stattdessen CREATEDB, um isolierte Ziel-Datenbanken anzulegen -
// bekommt daher eine eigene, separat scharf gestellte Rolle.
func requireTestConfig(t *testing.T) Config {
t.Helper()
user := os.Getenv("TEST_TENANTBACKUP_PG_USER")
if user == "" {
t.Skip("TEST_TENANTBACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen (braucht echte Postgres-Rolle mit CREATEDB)")
}
if _, err := exec.LookPath("pg_dump"); err != nil {
t.Skip("pg_dump nicht installiert, Integrationstest uebersprungen")
}
return Config{
Host: envOr("TEST_TENANTBACKUP_PG_HOST", "localhost"),
Port: envOr("TEST_TENANTBACKUP_PG_PORT", "5432"),
User: user,
Password: os.Getenv("TEST_TENANTBACKUP_PG_PASSWORD"),
BackupDir: t.TempDir(),
}
}
func envOr(key, fallback string) string {
if v := os.Getenv(key); v != "" {
return v
}
return fallback
}
// createMarkerDB legt eine frische Testdatenbank mit genau EINER
// Markierungszeile an (Kennzeichen für "das ist eindeutig Tenant X's
// Datensatz") - real ueber psql, kein Mock.
func createMarkerDB(t *testing.T, cfg Config, dbName, marker string) {
t.Helper()
ctx := context.Background()
run := func(args ...string) {
t.Helper()
cmd := exec.CommandContext(ctx, cfg.psqlBinary(), args...)
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
if out, err := cmd.CombinedOutput(); err != nil {
t.Fatalf("psql %v: %v (ausgabe: %s)", args, err, out)
}
}
base := []string{"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "--no-password"}
run(append(append([]string{}, base...), "-d", "postgres", "-c", "DROP DATABASE IF EXISTS "+quoteIdent(dbName))...)
run(append(append([]string{}, base...), "-d", "postgres", "-c", "CREATE DATABASE "+quoteIdent(dbName))...)
run(append(append([]string{}, base...), "-d", dbName, "-c",
"CREATE TABLE marker (value TEXT); INSERT INTO marker VALUES ('"+marker+"')")...)
t.Cleanup(func() {
run(append(append([]string{}, base...), "-d", "postgres", "-c", "DROP DATABASE IF EXISTS "+quoteIdent(dbName))...)
})
}
func markerValue(t *testing.T, cfg Config, dbName string) string {
t.Helper()
cmd := exec.CommandContext(context.Background(), cfg.psqlBinary(),
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", dbName, "--no-password",
"-tAc", "SELECT value FROM marker")
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
out, err := cmd.CombinedOutput()
if err != nil {
t.Fatalf("markerwert lesen: %v (ausgabe: %s)", err, out)
}
return trimNL(string(out))
}
func trimNL(s string) string {
for len(s) > 0 && (s[len(s)-1] == '\n' || s[len(s)-1] == '\r') {
s = s[:len(s)-1]
}
return s
}
func databaseExists(t *testing.T, cfg Config, dbName string) bool {
t.Helper()
cmd := exec.CommandContext(context.Background(), cfg.psqlBinary(),
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
"-tAc", "SELECT 1 FROM pg_database WHERE datname = '"+dbName+"'")
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
out, _ := cmd.CombinedOutput()
return trimNL(string(out)) == "1"
}
// TestBackupRestore_RecoversExactTenantData ist Pruefung 1 (angepasst
// auf Akzeptanzkriterium 1): eine Sicherung von Tenant A, wiederhergestellt
// in eine isolierte Zieldatenbank, enthaelt real Tenant As Datensatz.
func TestBackupRestore_RecoversExactTenantData(t *testing.T) {
cfg := requireTestConfig(t)
ctx := context.Background()
tenantA := "tenantbackup_test_a"
createMarkerDB(t, cfg, tenantA, "gehoert-zu-tenant-a")
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
if err != nil {
t.Fatalf("backup: %v", err)
}
if err := Verify(ctx, cfg, dumpPath); err != nil {
t.Fatalf("verify: %v", err)
}
target := "tenantbackup_test_a_restored"
if databaseExists(t, cfg, target) {
t.Fatalf("zieldatenbank %q existiert bereits vor dem test", target)
}
if err := CreateEmptyDatabase(ctx, cfg, target); err != nil {
t.Fatalf("createemptydatabase: %v", err)
}
t.Cleanup(func() {
cmd := exec.Command(cfg.psqlBinary(), "-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
"-c", "DROP DATABASE IF EXISTS "+quoteIdent(target))
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
_ = cmd.Run()
})
if err := Restore(ctx, cfg, dumpPath, target); err != nil {
t.Fatalf("restore: %v", err)
}
got := markerValue(t, cfg, target)
if got != "gehoert-zu-tenant-a" {
t.Fatalf("markerwert in wiederhergestellter datenbank = %q, want %q", got, "gehoert-zu-tenant-a")
}
}
// TestRestore_DoesNotAffectOtherTenant ist Pruefung 2: Wiederherstellung
// von Tenant A veraendert Tenant B nicht - reales zweites Tenant-DB,
// Markerwert vor UND nach dem Restore geprueft.
func TestRestore_DoesNotAffectOtherTenant(t *testing.T) {
cfg := requireTestConfig(t)
ctx := context.Background()
tenantA := "tenantbackup_test_iso_a"
tenantB := "tenantbackup_test_iso_b"
createMarkerDB(t, cfg, tenantA, "wert-a")
createMarkerDB(t, cfg, tenantB, "wert-b-unveraendert")
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
if err != nil {
t.Fatalf("backup: %v", err)
}
target := "tenantbackup_test_iso_a_restored"
if err := CreateEmptyDatabase(ctx, cfg, target); err != nil {
t.Fatalf("createemptydatabase: %v", err)
}
t.Cleanup(func() {
cmd := exec.Command(cfg.psqlBinary(), "-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
"-c", "DROP DATABASE IF EXISTS "+quoteIdent(target))
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
_ = cmd.Run()
})
if err := Restore(ctx, cfg, dumpPath, target); err != nil {
t.Fatalf("restore: %v", err)
}
// Tenant B, der nie an diesem Vorgang beteiligt war, muss unveraendert sein.
gotB := markerValue(t, cfg, tenantB)
if gotB != "wert-b-unveraendert" {
t.Fatalf("tenant b wurde veraendert: %q, want %q", gotB, "wert-b-unveraendert")
}
// Und Tenant Bs Datenbank existiert weiterhin unter ihrem eigenen Namen
// (kein versehentliches Ueberschreiben/Umbenennen).
if !databaseExists(t, cfg, tenantB) {
t.Fatal("tenant-b-datenbank fehlt nach restore von tenant a")
}
}
// TestVerify_DetectsCorruptedDump ist Nachweis der Vollstaendigkeitspruefung.
func TestVerify_DetectsCorruptedDump(t *testing.T) {
cfg := requireTestConfig(t)
ctx := context.Background()
tenantA := "tenantbackup_test_corrupt"
createMarkerDB(t, cfg, tenantA, "wert")
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
if err != nil {
t.Fatalf("backup: %v", err)
}
if err := Verify(ctx, cfg, dumpPath); err != nil {
t.Fatalf("verify (unbeschaedigt) haette erfolgreich sein muessen: %v", err)
}
if err := os.WriteFile(dumpPath, []byte("kein gueltiges pg_dump-custom-archiv"), 0o600); err != nil {
t.Fatal(err)
}
if err := Verify(ctx, cfg, dumpPath); err == nil {
t.Fatal("verify haette die beschaedigte sicherung erkennen muessen")
}
}
@@ -0,0 +1,14 @@
[Unit]
Description=NEXARCH Archive - /metrics-Export fuer BAK-06 (dauerhaft, Pull-Modell fuer OPS-03)
After=network.target
[Service]
Type=simple
User=nexarch
EnvironmentFile=/etc/nexarch/archive-restoretest.env
ExecStart=__INSTALL_DIR__/bin/restoretest-metrics
Restart=on-failure
StandardOutput=journal
[Install]
WantedBy=multi-user.target
@@ -0,0 +1,11 @@
[Unit]
Description=NEXARCH Archive - Restore-Testverfahren (BAK-06)
After=network.target postgresql.service
[Service]
Type=oneshot
User=nexarch
Environment=PATH=/usr/bin:/bin:/usr/lib/postgresql/17/bin
EnvironmentFile=/etc/nexarch/archive-restoretest.env
ExecStart=__INSTALL_DIR__/bin/restoretest-cli
StandardOutput=journal
@@ -0,0 +1,9 @@
[Unit]
Description=Zeitplan fuer NEXARCH Archive Restore-Testverfahren (BAK-06)
[Timer]
OnCalendar=Sun *-*-* 07:00:00
Persistent=true
[Install]
WantedBy=timers.target
@@ -0,0 +1,17 @@
[Unit]
Description=NEXARCH Archive - Tenant-Backup einzelner Mandant (BAK-04)
After=network.target postgresql.service
[Service]
Type=oneshot
User=nexarch
Environment=PATH=/usr/bin:/bin:/usr/lib/postgresql/17/bin
EnvironmentFile=/etc/nexarch/archive-tenantbackup.env
# NEXARCH_TENANTBACKUP_TENANT_DB und NEXARCH_TENANTBACKUP_STORAGE_ROOT
# muessen je Mandant separat gesetzt werden (z.B. ueber eine
# systemd-Template-Unit @<mandant>.service, sobald TEN-01s
# Tenant-Registry real abfragbar ist) - hier bewusst als Platzhalter
# belassen, kein automatisches "alle Mandanten"-Enumerieren ohne echte
# Registry-Anbindung.
ExecStart=__INSTALL_DIR__/bin/tenantbackup-cli backup ${NEXARCH_TENANTBACKUP_TENANT_DB} ${NEXARCH_TENANTBACKUP_STORAGE_ROOT}
StandardOutput=journal
@@ -0,0 +1,9 @@
[Unit]
Description=Zeitplan fuer NEXARCH Archive Tenant-Backup (BAK-04) - unabhaengig vom Gesamt-Backup
[Timer]
OnCalendar=*-*-* 02:00:00
Persistent=true
[Install]
WantedBy=timers.target