Compare commits
7
Commits
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
d0b6fb8ce5 | ||
|
|
480aa52941 | ||
|
|
004c6fab62 | ||
|
|
823a14ae12 | ||
|
|
80b0ca9176 | ||
|
|
c761cf9b93 | ||
|
|
d252732d09 |
@@ -36,6 +36,16 @@ func loadConfig() backup.Config {
|
||||
return cfg
|
||||
}
|
||||
|
||||
func envInt(name string, def int) int {
|
||||
v := os.Getenv(name)
|
||||
if v == "" {
|
||||
return def
|
||||
}
|
||||
n := def
|
||||
_, _ = fmt.Sscanf(v, "%d", &n)
|
||||
return n
|
||||
}
|
||||
|
||||
func latestManifest(backupDir string) (string, error) {
|
||||
generations, err := backup.ListGenerations(backupDir)
|
||||
if err != nil {
|
||||
@@ -91,6 +101,23 @@ func main() {
|
||||
fmt.Printf("inkrementelle sicherung %q erstellt und verifiziert: %s\n", incID, newManifest)
|
||||
|
||||
case "rotate":
|
||||
// BAK-07: gestaffelte Aufbewahrungsfrist (KeepDaily/Weekly/Monthly),
|
||||
// falls konfiguriert - ersetzt die flache "letzte N"-Regel
|
||||
// (NEXARCH_BACKUP_KEEP_GENERATIONS), bleibt aber abwaertskompatibel,
|
||||
// wenn keine Staffelung gesetzt ist.
|
||||
policy := backup.RetentionPolicy{
|
||||
KeepDaily: envInt("NEXARCH_BACKUP_KEEP_DAILY", 0),
|
||||
KeepWeekly: envInt("NEXARCH_BACKUP_KEEP_WEEKLY", 0),
|
||||
KeepMonthly: envInt("NEXARCH_BACKUP_KEEP_MONTHLY", 0),
|
||||
}
|
||||
if policy.KeepDaily > 0 || policy.KeepWeekly > 0 || policy.KeepMonthly > 0 {
|
||||
removed, err := backup.PruneRotate(cfg.BackupDir, policy)
|
||||
if err != nil {
|
||||
log.Fatalf("gestaffelte rotation fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Printf("gestaffelte rotation abgeschlossen, %d generation(en) entfernt: %v\n", len(removed), removed)
|
||||
return
|
||||
}
|
||||
keep := 7
|
||||
if v := os.Getenv("NEXARCH_BACKUP_KEEP_GENERATIONS"); v != "" {
|
||||
_, _ = fmt.Sscanf(v, "%d", &keep)
|
||||
|
||||
@@ -25,6 +25,17 @@ func loadConfig() objectbackup.Config {
|
||||
return cfg
|
||||
}
|
||||
|
||||
func envInt(name string, def int) int {
|
||||
v := os.Getenv(name)
|
||||
if v == "" {
|
||||
return def
|
||||
}
|
||||
if n, err := strconv.Atoi(v); err == nil {
|
||||
return n
|
||||
}
|
||||
return def
|
||||
}
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
log.Fatal("aufruf: objectbackup-cli <backup <quellverzeichnis>|check|rotate>")
|
||||
@@ -58,6 +69,20 @@ func main() {
|
||||
fmt.Println("verifikation (mit vollstaendigem lesen) erfolgreich")
|
||||
|
||||
case "rotate":
|
||||
// BAK-07: gestaffelte Aufbewahrungsfrist, falls konfiguriert -
|
||||
// ersetzt die flache "letzte N"-Regel, bleibt abwaertskompatibel.
|
||||
policy := objectbackup.RetentionPolicy{
|
||||
KeepDaily: envInt("NEXARCH_OBJECTBACKUP_KEEP_DAILY", 0),
|
||||
KeepWeekly: envInt("NEXARCH_OBJECTBACKUP_KEEP_WEEKLY", 0),
|
||||
KeepMonthly: envInt("NEXARCH_OBJECTBACKUP_KEEP_MONTHLY", 0),
|
||||
}
|
||||
if policy.KeepDaily > 0 || policy.KeepWeekly > 0 || policy.KeepMonthly > 0 {
|
||||
if err := objectbackup.PruneTiered(ctx, cfg, policy); err != nil {
|
||||
log.Fatalf("gestaffelte rotation fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Println("gestaffelte rotation abgeschlossen")
|
||||
return
|
||||
}
|
||||
keep := 7
|
||||
if v := os.Getenv("NEXARCH_OBJECTBACKUP_KEEP_SNAPSHOTS"); v != "" {
|
||||
if n, err := strconv.Atoi(v); err == nil {
|
||||
|
||||
@@ -0,0 +1,104 @@
|
||||
// restore-cli ist der Aufrufpunkt fuer BAK-03: dokumentiertes,
|
||||
// wiederholbares Restore-Verfahren fuer Datenbank (BAK-01) und
|
||||
// Objekt-Storage (BAK-02). Kein systemd-Timer (Notfall-/Einzelfall-
|
||||
// Werkzeug, kein Zeitplan) - manueller Aufruf mit expliziter Bestaetigung
|
||||
// bei nicht-leerem Ziel.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"flag"
|
||||
"fmt"
|
||||
"log"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restore"
|
||||
)
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
|
||||
logPath := os.Getenv("NEXARCH_RESTORE_LOG")
|
||||
if logPath == "" {
|
||||
logPath = "/var/nexarch-archiv/restore.log"
|
||||
}
|
||||
|
||||
switch os.Args[1] {
|
||||
case "database":
|
||||
runDatabase(logPath, os.Args[2:])
|
||||
case "objects":
|
||||
runObjects(logPath, os.Args[2:])
|
||||
default:
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
}
|
||||
|
||||
func usage() {
|
||||
fmt.Fprintln(os.Stderr, "usage: restore-cli database [-force] <generation-id> <ziel-verzeichnis>")
|
||||
fmt.Fprintln(os.Stderr, " restore-cli objects [-force] <snapshot-id> <ziel-verzeichnis>")
|
||||
fmt.Fprintln(os.Stderr, "(Flag -force MUSS vor den Positionsargumenten stehen, Standardverhalten des Go-flag-Pakets)")
|
||||
}
|
||||
|
||||
func runDatabase(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("database", flag.ExitOnError)
|
||||
force := fs.Bool("force", false, "bestehenden, nicht-leeren Inhalt im Zielverzeichnis ersetzen")
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() != 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
generationID, target := fs.Arg(0), fs.Arg(1)
|
||||
|
||||
cfg := backup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_BACKUP_DIR"),
|
||||
}
|
||||
ctx := context.Background()
|
||||
|
||||
entry, err := restore.AtomicRestore(restore.KindDatabase, generationID, target, *force, logPath, func(tempDir string) error {
|
||||
return backup.Restore(ctx, cfg, generationID, tempDir)
|
||||
})
|
||||
report(entry, err)
|
||||
}
|
||||
|
||||
func runObjects(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("objects", flag.ExitOnError)
|
||||
force := fs.Bool("force", false, "bestehenden, nicht-leeren Inhalt im Zielverzeichnis ersetzen")
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() != 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
snapshotID, target := fs.Arg(0), fs.Arg(1)
|
||||
|
||||
cfg := objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_OBJECTBACKUP_REPO_DIR"),
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
ctx := context.Background()
|
||||
|
||||
entry, err := restore.AtomicRestore(restore.KindObjects, snapshotID, target, *force, logPath, func(tempDir string) error {
|
||||
return objectbackup.Restore(ctx, cfg, snapshotID, tempDir)
|
||||
})
|
||||
report(entry, err)
|
||||
}
|
||||
|
||||
func report(entry restore.LogEntry, err error) {
|
||||
fmt.Printf("restore %s: quelle=%s ziel=%s ergebnis=%s\n", entry.Kind, entry.Source, entry.Target, entry.Result)
|
||||
if err != nil {
|
||||
log.Fatalf("restore fehlgeschlagen: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,71 @@
|
||||
// restoretest-cli ist der Aufrufpunkt fuer BAK-06 (systemd-Timer,
|
||||
// regelmaessiger Zeitplan) - fuehrt einen vollstaendigen Restore-Test
|
||||
// (Datenbank UND Objekt-Storage) gegen die jeweils neueste Sicherung in
|
||||
// eine isolierte Testumgebung durch und protokolliert das Ergebnis.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"log"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restoretest"
|
||||
)
|
||||
|
||||
func main() {
|
||||
testRoot := os.Getenv("NEXARCH_RESTORETEST_DIR")
|
||||
logPath := os.Getenv("NEXARCH_RESTORETEST_LOG")
|
||||
if testRoot == "" || logPath == "" {
|
||||
log.Fatal("NEXARCH_RESTORETEST_DIR und NEXARCH_RESTORETEST_LOG muessen gesetzt sein")
|
||||
}
|
||||
if err := os.MkdirAll(testRoot, 0o750); err != nil {
|
||||
log.Fatalf("testverzeichnis anlegen: %v", err)
|
||||
}
|
||||
|
||||
ctx := context.Background()
|
||||
failed := false
|
||||
|
||||
dbCfg := backup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_BACKUP_DIR"),
|
||||
}
|
||||
pgCfg := restoretest.PgConfig{TestPort: envOr("NEXARCH_RESTORETEST_PG_PORT", "55433")}
|
||||
dbResult := restoretest.RunDatabaseTest(ctx, dbCfg, pgCfg, testRoot)
|
||||
logResult(logPath, dbResult)
|
||||
if !dbResult.Success {
|
||||
failed = true
|
||||
}
|
||||
|
||||
objCfg := objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_OBJECTBACKUP_REPO_DIR"),
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
objResult := restoretest.RunObjectTest(ctx, objCfg, testRoot)
|
||||
logResult(logPath, objResult)
|
||||
if !objResult.Success {
|
||||
failed = true
|
||||
}
|
||||
|
||||
if failed {
|
||||
os.Exit(1)
|
||||
}
|
||||
}
|
||||
|
||||
func logResult(logPath string, r restoretest.Result) {
|
||||
log.Printf("restoretest %s: quelle=%s erfolg=%t detail=%s", r.Kind, r.Source, r.Success, r.Detail)
|
||||
if err := restoretest.AppendHistory(logPath, r); err != nil {
|
||||
log.Fatalf("protokoll schreiben: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
func envOr(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
@@ -0,0 +1,70 @@
|
||||
// restoretest-metrics stellt BAK-06s Testlauf-Historie unter /metrics
|
||||
// bereit - dauerhafter Prozess getrennt vom Oneshot-restoretest-cli
|
||||
// (Pull-Modell, Core OPS-03 scrapt, kein Push - dieselbe Begruendung wie
|
||||
// BAK-08s scrub-metrics).
|
||||
package main
|
||||
|
||||
import (
|
||||
"fmt"
|
||||
"log"
|
||||
"net/http"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restoretest"
|
||||
)
|
||||
|
||||
func main() {
|
||||
logPath := os.Getenv("NEXARCH_RESTORETEST_LOG")
|
||||
if logPath == "" {
|
||||
log.Fatal("NEXARCH_RESTORETEST_LOG muss gesetzt sein")
|
||||
}
|
||||
addr := os.Getenv("NEXARCH_RESTORETEST_METRICS_LISTEN_ADDR")
|
||||
if addr == "" {
|
||||
addr = ":8091"
|
||||
}
|
||||
|
||||
mux := http.NewServeMux()
|
||||
mux.HandleFunc("/metrics", func(w http.ResponseWriter, r *http.Request) {
|
||||
history, err := restoretest.ReadHistory(logPath)
|
||||
if err != nil {
|
||||
http.Error(w, err.Error(), http.StatusInternalServerError)
|
||||
return
|
||||
}
|
||||
|
||||
// Historie ist append-only (siehe AppendHistory) - die Anzahl
|
||||
// fehlgeschlagener Eintraege waechst daher von selbst monoton,
|
||||
// kein separater Zaehlerstand noetig (gueltiger Prometheus-Counter).
|
||||
var failuresTotal int
|
||||
lastSuccess := map[restoretest.Kind]float64{restoretest.KindDatabase: -1, restoretest.KindObjects: -1}
|
||||
for _, res := range history {
|
||||
if !res.Success {
|
||||
failuresTotal++
|
||||
}
|
||||
if res.Success {
|
||||
lastSuccess[res.Kind] = 1
|
||||
} else {
|
||||
lastSuccess[res.Kind] = 0
|
||||
}
|
||||
}
|
||||
|
||||
w.Header().Set("Content-Type", "text/plain; version=0.0.4")
|
||||
body := fmt.Sprintf(
|
||||
"# HELP nexarch_archive_restore_test_failures_total Anzahl seit Einrichtung fehlgeschlagener Restore-Testlaeufe (BAK-06).\n"+
|
||||
"# TYPE nexarch_archive_restore_test_failures_total counter\n"+
|
||||
"nexarch_archive_restore_test_failures_total %d\n"+
|
||||
"# HELP nexarch_archive_restore_test_last_success Letzter Testlauf erfolgreich (1) oder fehlgeschlagen (0), -1 wenn noch kein Lauf, je Art.\n"+
|
||||
"# TYPE nexarch_archive_restore_test_last_success gauge\n"+
|
||||
"nexarch_archive_restore_test_last_success{kind=\"database\"} %g\n"+
|
||||
"nexarch_archive_restore_test_last_success{kind=\"objects\"} %g\n",
|
||||
failuresTotal, lastSuccess[restoretest.KindDatabase], lastSuccess[restoretest.KindObjects])
|
||||
if _, err := w.Write([]byte(body)); err != nil {
|
||||
log.Printf("restoretest-metrics: antwort schreiben: %v", err)
|
||||
}
|
||||
})
|
||||
mux.HandleFunc("/healthz", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) })
|
||||
|
||||
log.Printf("restoretest-metrics: listening on %s", addr)
|
||||
if err := http.ListenAndServe(addr, mux); err != nil {
|
||||
log.Fatalf("http server: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,146 @@
|
||||
// tenantbackup-cli ist der Aufrufpunkt fuer BAK-04: Sicherung/
|
||||
// Wiederherstellung EINES einzelnen Mandanten (Datenbank UND
|
||||
// Objekt-Storage-Root), unabhaengig vom Gesamt-Backup (BAK-01/BAK-02)
|
||||
// planbar - eigener systemd-Timer, eigenes Log.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"flag"
|
||||
"fmt"
|
||||
"log"
|
||||
"os"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/tenantbackup"
|
||||
)
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
logPath := os.Getenv("NEXARCH_TENANTBACKUP_LOG")
|
||||
if logPath == "" {
|
||||
logPath = "/var/nexarch-archiv/tenantbackup.log"
|
||||
}
|
||||
|
||||
switch os.Args[1] {
|
||||
case "backup":
|
||||
runBackup(logPath, os.Args[2:])
|
||||
case "restore":
|
||||
runRestore(logPath, os.Args[2:])
|
||||
default:
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
}
|
||||
|
||||
func usage() {
|
||||
fmt.Fprintln(os.Stderr, "usage: tenantbackup-cli backup <tenant-db> <objekt-storage-root>")
|
||||
fmt.Fprintln(os.Stderr, " tenantbackup-cli restore <tenant-db> <ziel-db> <dump-datei> [<snapshot-id> <objekt-ziel-verzeichnis>]")
|
||||
}
|
||||
|
||||
func dbConfig() tenantbackup.Config {
|
||||
return tenantbackup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_TENANTBACKUP_DIR"),
|
||||
}
|
||||
}
|
||||
|
||||
func objConfig(tenantDB string) objectbackup.Config {
|
||||
return objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_TENANTBACKUP_OBJECT_REPO_ROOT") + "/" + tenantDB,
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
}
|
||||
|
||||
func runBackup(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("backup", flag.ExitOnError)
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() != 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
tenantDB, storageRoot := fs.Arg(0), fs.Arg(1)
|
||||
ctx := context.Background()
|
||||
genID := time.Now().UTC().Format("20060102T150405Z")
|
||||
|
||||
dbCfg := dbConfig()
|
||||
dumpPath, err := tenantbackup.Backup(ctx, dbCfg, tenantDB, genID)
|
||||
logEntry(logPath, tenantbackup.OpBackupDB, tenantDB, "", dumpPath, err)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbank-sicherung: %v", err)
|
||||
}
|
||||
if err := tenantbackup.Verify(ctx, dbCfg, dumpPath); err != nil {
|
||||
log.Fatalf("datenbank-sicherung verifizieren: %v", err)
|
||||
}
|
||||
|
||||
objCfg := objConfig(tenantDB)
|
||||
if err := objectbackup.InitRepo(ctx, objCfg); err != nil {
|
||||
log.Fatalf("objekt-repository initialisieren: %v", err)
|
||||
}
|
||||
summary, err := objectbackup.Backup(ctx, objCfg, storageRoot)
|
||||
logEntry(logPath, tenantbackup.OpBackupObj, tenantDB, storageRoot, summary.SnapshotID, err)
|
||||
if err != nil {
|
||||
log.Fatalf("objekt-storage-sicherung: %v", err)
|
||||
}
|
||||
|
||||
fmt.Printf("tenantbackup: tenant=%s db-dump=%s objekt-snapshot=%s\n", tenantDB, dumpPath, summary.SnapshotID)
|
||||
}
|
||||
|
||||
func runRestore(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("restore", flag.ExitOnError)
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() < 3 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
tenantDB, targetDB, dumpPath := fs.Arg(0), fs.Arg(1), fs.Arg(2)
|
||||
ctx := context.Background()
|
||||
|
||||
dbCfg := dbConfig()
|
||||
err := tenantbackup.CreateEmptyDatabase(ctx, dbCfg, targetDB)
|
||||
if err == nil {
|
||||
err = tenantbackup.Restore(ctx, dbCfg, dumpPath, targetDB)
|
||||
}
|
||||
logEntry(logPath, tenantbackup.OpRestoreDB, tenantDB, dumpPath, targetDB, err)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbank-restore: %v", err)
|
||||
}
|
||||
fmt.Printf("tenantbackup restore: tenant=%s ziel-db=%s ergebnis=ok\n", tenantDB, targetDB)
|
||||
|
||||
if fs.NArg() < 5 {
|
||||
return
|
||||
}
|
||||
snapshotID, objTarget := fs.Arg(3), fs.Arg(4)
|
||||
objCfg := objConfig(tenantDB)
|
||||
err = objectbackup.Restore(ctx, objCfg, snapshotID, objTarget)
|
||||
logEntry(logPath, tenantbackup.OpRestoreObj, tenantDB, snapshotID, objTarget, err)
|
||||
if err != nil {
|
||||
log.Fatalf("objekt-storage-restore: %v", err)
|
||||
}
|
||||
fmt.Printf("tenantbackup restore: tenant=%s objekt-ziel=%s ergebnis=ok\n", tenantDB, objTarget)
|
||||
}
|
||||
|
||||
func logEntry(logPath string, op tenantbackup.Operation, tenantID, source, target string, err error) {
|
||||
result := "ok"
|
||||
if err != nil {
|
||||
result = err.Error()
|
||||
}
|
||||
entry := tenantbackup.LogEntry{
|
||||
Timestamp: time.Now().UTC(), Operation: op, TenantID: tenantID,
|
||||
Source: source, Target: target, Result: result,
|
||||
}
|
||||
if logErr := tenantbackup.AppendLog(logPath, entry); logErr != nil {
|
||||
log.Fatalf("protokoll schreiben: %v", logErr)
|
||||
}
|
||||
}
|
||||
@@ -85,3 +85,13 @@ nachweislich am neuen Ort.
|
||||
real erfüllt — inklusive tatsächlicher systemd-Timer-Installation und
|
||||
manuell ausgelöstem End-to-End-Lauf aller drei Dienste auf dem Testhost,
|
||||
nicht nur isolierter Testcode.
|
||||
|
||||
## Nachtrag (BAK-03): Verify prüft jetzt auch pg_wal.tar.gz
|
||||
|
||||
Beim Bau von BAK-03s echtem Restore-Test fiel auf, dass `pg_basebackup`
|
||||
(Standard-WAL-Methode `stream`) bei `-Ft -z` NEBEN `base.tar.gz` eine
|
||||
zweite Archivdatei `pg_wal.tar.gz` erzeugt, die `Verify` bislang nie
|
||||
geprüft hat — eine Sicherung mit beschädigtem WAL-Archiv wäre unbemerkt
|
||||
nicht crash-konsistent wiederherstellbar gewesen. `Verify` prüft seither
|
||||
beide Archive vollständig (siehe `BAK-03-PRUEFPROTOKOLL.md`). Das
|
||||
Sicherungsverfahren selbst (Format, Ort, Rotation) bleibt unverändert.
|
||||
|
||||
@@ -0,0 +1,122 @@
|
||||
# BAK-03 – Prüfprotokoll: Restore-Verfahren
|
||||
|
||||
Voraussetzungen BAK-01, BAK-02 – erledigt, siehe eigene Protokolle.
|
||||
|
||||
## Grundsatzentscheidung: Atomarität über Temp-Verzeichnis + Rename
|
||||
|
||||
`internal/restore.AtomicRestore` kennt weder Postgres noch restic —
|
||||
reine Ablaufsteuerung: Wiederherstellung IMMER in ein frisches
|
||||
temporäres Verzeichnis (nie direkt in das Ziel), Übernahme erst bei
|
||||
Erfolg per `os.Rename` (selbes Dateisystem wie das Ziel, daher atomar).
|
||||
Ist das Ziel nicht leer und keine Bestätigung (`-force`) gegeben, wird
|
||||
NICHT einmal die Wiederherstellungsfunktion aufgerufen — Abbruch vor
|
||||
jeder Berührung des Ziels (Akzeptanzkriterium 2). Jeder Aufruf — Erfolg,
|
||||
Abbruch oder Fehler — erzeugt genau einen JSONL-Protokolleintrag
|
||||
(Akzeptanzkriterium 3).
|
||||
|
||||
Die eigentliche Wiederherstellung bleibt in `internal/backup.Restore`
|
||||
(Datenbank) und `internal/objectbackup.Restore` (Objekt-Storage) —
|
||||
`internal/restore` orchestriert nur.
|
||||
|
||||
## Drei reale Defekte während der Implementierung gefunden und behoben
|
||||
|
||||
Alle drei erst durch den ECHTEN Restore-Test (Postgres-Instanz tatsächlich
|
||||
gestartet, nicht nur Dateien verglichen) aufgedeckt:
|
||||
|
||||
1. **`pg_combinebackup` braucht Plain-Format, BAK-01 liefert Tar+Gzip.**
|
||||
`Restore` extrahiert jetzt jede Sicherungsstufe zunächst in ein
|
||||
temporäres Plain-Verzeichnis (inkl. `backup_manifest`-Kopie) und
|
||||
speist erst DIESE in `pg_combinebackup`. BAK-01s Speicherformat selbst
|
||||
unverändert (kleinere, leichter prüfbare Dateien).
|
||||
2. **`pg_wal.tar.gz` wurde nie verifiziert oder wiederhergestellt.**
|
||||
`pg_basebackup`s Standard-WAL-Methode (`stream`) erzeugt bei `-Ft -z`
|
||||
eine ZWEITE Archivdatei neben `base.tar.gz` — ohne sie ist keine
|
||||
crash-konsistente Wiederherstellung möglich (Postgres findet sonst
|
||||
keinen gültigen Checkpoint). `backup.Verify` prüft jetzt BEIDE
|
||||
Archive vollständig; `backup.Restore` extrahiert das WAL der ZULETZT
|
||||
gezogenen Stufe (nicht aller Stufen) nach `pg_wal/` im
|
||||
Wiederherstellungsziel. Ergänzung zu BAK-01s Prüfung, keine
|
||||
Umstellung des Sicherungsverfahrens.
|
||||
3. **Go-`exec`-Hänger bei `pg_ctl start`:** `pg_ctl` startet Postgres als
|
||||
Hintergrundprozess, der die geerbten stdout/stderr-Pipes NICHT
|
||||
schließt — `CombinedOutput()` (wartet auf Pipe-EOF) hängt sich
|
||||
dadurch auf, obwohl `pg_ctl` selbst längst zurückgekehrt ist. Fix nur
|
||||
im Testcode: echte Logdatei (`-l`) statt Pipe, Standard-`pg_ctl`-Muster.
|
||||
|
||||
Zusätzlich real (nicht Ticket-relevant, aber notiert): auf diesem
|
||||
Debian-Postgres liegen `postgresql.conf`/`pg_hba.conf` NICHT in PGDATA
|
||||
(sondern `/etc/postgresql/17/main/`) — ein echtes Restore-Runbook muss
|
||||
diese Dateien separat mitführen/rekonstruieren, `pg_basebackup` sichert
|
||||
sie nicht. Für den Testnachweis minimal nachgereicht, kein Produktcode.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/restore.AtomicRestore` — Ablaufsteuerung, JSONL-Protokoll
|
||||
(`Timestamp`, `Kind`, `Source`, `Target`, `Result`).
|
||||
- `internal/backup.Restore` — `pg_combinebackup` gegen extrahierte
|
||||
Plain-Verzeichnisse + WAL-Wiederherstellung der letzten Stufe.
|
||||
- `internal/backup.extractTarGz` (in `verify.go`, neben der bestehenden
|
||||
Tar/Gzip-Leselogik) — vollständige Extraktion, kein Kopf-only-Read.
|
||||
- `internal/backup.Verify` — prüft jetzt `base.tar.gz` UND
|
||||
`pg_wal.tar.gz` vollständig.
|
||||
- `internal/objectbackup.Restore` — `restic restore --target`.
|
||||
- `cmd/restore-cli` — `database`/`objects`-Unterbefehle, `-force`-Flag
|
||||
(vor Positionsargumenten, Go-`flag`-Konvention), kein systemd-Timer
|
||||
(Notfall-/Einzelfall-Werkzeug, kein Zeitplan).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Restore auf leerem System vollständig und erfolgreich durchgeführt | **bestanden** — real: `TestRestore_CombinesIntoStartablePostgresInstance` (Postgres tatsächlich aus wiederhergestelltem Verzeichnis gestartet, `SELECT 1` über echte Verbindung beantwortet); zusätzlich real per `restore-cli database` auf 131 ausgeführt (PG_VERSION/base/pg_wal vorhanden, Exit 0); `TestRestore_RecoversRealContentFromSnapshot` (Objekt-Storage, echter Dateiinhalt verglichen) UND real per `restore-cli objects` auf 131 (echter restic-Snapshot wiederhergestellt) |
|
||||
| 2 | Restore auf nicht-leeres Zielverzeichnis lässt bei Abbruch den ursprünglichen Inhalt unverändert | **bestanden** — `TestAtomicRestore_NonEmptyTargetWithoutForce_LeavesOriginalUntouched` (restoreFn wird nachweislich NIE aufgerufen) und `TestAtomicRestore_FailedRestoreFn_LeavesTargetUntouched`; real auf 131: `restore-cli database` gegen nicht-leeres Ziel ohne `-force` → Abbruch, bestehende Testdatei unverändert vorhanden |
|
||||
| 3 | Protokolleintrag zum Restore ist vollständig und nachvollziehbar | **bestanden** — `TestAtomicRestore_LogsCompleteEntry` (Quelle, Ziel, Zeitpunkt, Ergebnis für Erfolgs- UND Abbruchfall in derselben Datei); real auf 131: `/tmp/restore-cli-test.log` zeigt alle vier realen Läufe (Abbruch, Fehler mangels PATH, Erfolg, Force-Überschreiben) korrekt protokolliert |
|
||||
|
||||
Zusätzlich: `TestAtomicRestore_EmptyTarget_Succeeds`,
|
||||
`TestAtomicRestore_ForceOverwritesNonEmptyTarget` (bewusste Bestätigung
|
||||
ersetzt bestehenden Inhalt real, alter Inhalt nachweislich weg, neuer da).
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `restore-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- Kein systemd-Timer (bewusst — Notfall-/Einzelfall-Werkzeug)
|
||||
- Vier reale CLI-Läufe durchgeführt und protokolliert: Abbruch bei
|
||||
nicht-leerem Ziel ohne `-force`, Fehler mangels `pg_combinebackup` im
|
||||
PATH (zeigt: Fehler wird korrekt erkannt UND protokolliert, kein
|
||||
stiller Fehlschlag), erfolgreicher Restore einer echten Generation
|
||||
(`20260829T222054Z`) in leeres Ziel, erfolgreiches Überschreiben mit
|
||||
`-force`. Objekt-Storage-Restore real gegen echten restic-Snapshot
|
||||
(`43da36bf`) — Inhalt (`.placeholder`-Datei) tatsächlich vorhanden.
|
||||
- Alle Testartefakte (`/tmp/restore-*`, Testlog) nach Prüfung entfernt.
|
||||
|
||||
## Build/Test-Ergebnis
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
```
|
||||
|
||||
`internal/restore`: 5/5 Tests (reine Funktionen, kein Setup nötig).
|
||||
`internal/objectbackup`: `TestRestore_RecoversRealContentFromSnapshot`
|
||||
bestanden (zusammen mit den bestehenden BAK-02-Tests).
|
||||
`internal/backup`: `TestRestore_CombinesIntoStartablePostgresInstance`
|
||||
bestanden — **Hinweis**: dieser eine Test läuft NICHT als root
|
||||
(`pg_ctl: cannot be run as root`) und braucht `pg_combinebackup`/
|
||||
`pg_ctl` im PATH (`/usr/lib/postgresql/17/bin` auf Debian, dort nicht
|
||||
standardmäßig verlinkt) — daher separat als `postgres`-Systemnutzer mit
|
||||
entsprechendem PATH ausgeführt, nicht Teil des root-`make check`-Laufs;
|
||||
dort wird er mit klarer Meldung übersprungen (`pg_combinebackup nicht
|
||||
installiert`), kein stiller Fehlschlag. Alle übrigen BAK-01-Tests
|
||||
(inkl. der um `pg_wal.tar.gz` erweiterten `Verify`) liefen unverändert
|
||||
grün im normalen `make check`-Lauf.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — beide Restore-Pfade (Datenbank,
|
||||
Objekt-Storage) sowohl testgetrieben als auch manuell über `restore-cli`
|
||||
auf echter Infrastruktur nachgewiesen. Drei während der Implementierung
|
||||
gefundene reale Defekte (Tar-vs-Plain-Format, fehlende WAL-Sicherung/
|
||||
-Verifikation, Go-exec-Pipe-Hänger) behoben und dokumentiert, nicht
|
||||
stillschweigend umgangen.
|
||||
@@ -0,0 +1,123 @@
|
||||
# BAK-04 – Prüfprotokoll: Tenant-Backup & -Restore (einzelner Mandant)
|
||||
|
||||
Voraussetzung BAK-03 – erledigt, siehe eigenes Protokoll.
|
||||
|
||||
## Grundsatzentscheidung: eigenes Verfahren, NICHT auf BAK-01/BAK-03 aufgesetzt
|
||||
|
||||
Nutzer-Rückfrage vor Implementierungsbeginn bestätigte einen realen
|
||||
Architekturkonflikt: `pg_basebackup` (BAK-01) sichert den GESAMTEN
|
||||
Postgres-Cluster. Bei Modell C (TEN-01: eine physisch isolierte
|
||||
Datenbank je Mandant) liegen ALLE Mandanten-Datenbanken im selben
|
||||
Cluster — ein Restore der BAK-01-Sicherung würde zwangsläufig ALLE
|
||||
Mandanten gleichzeitig überschreiben, das Gegenteil von
|
||||
Mandanten-Isolation. `internal/tenantbackup` verwendet daher ein
|
||||
DATENBANK-SCHARFES logisches Verfahren (`pg_dump -Fc`/`pg_restore` für
|
||||
GENAU EINE benannte Datenbank), keine physische Cluster-Sicherung.
|
||||
Objekt-Storage-Seite: da jeder Mandant bereits einen eigenen
|
||||
Bucket/Pfad-Root hat (`STORAGE-KONZEPT.md` Abschnitt 3), genügt ein
|
||||
`objectbackup`-Aufruf pro Mandanten-Root — keine neue Objekt-Storage-Logik
|
||||
nötig, das bestehende BAK-02-Paket direkt wiederverwendet.
|
||||
|
||||
## Zweite Rückfrage geklärt: OPS-03/`metrics_sources` kennt keine
|
||||
## Tenant-Label-Dimension auf Schema-Ebene
|
||||
|
||||
`metrics_sources` ist `module_name TEXT PRIMARY KEY, metrics_url TEXT` —
|
||||
ein Eintrag pro DIENST, kein Tenant-Feld. Labels (z. B. `tenant="..."`)
|
||||
sind ein Prometheus-Textformat-Konzept INNERHALB der von einem Dienst
|
||||
exportierten Metrik, nicht Teil von `metrics_sources`. Ein
|
||||
`tenant_restore_failed_total{tenant="..."}`-Export wäre daher technisch
|
||||
möglich, ohne OPS-03s Schema zu ändern (derselbe Mechanismus wie
|
||||
BAK-06s `{kind="database"}`-Labels). **Bewusst nicht umgesetzt** in
|
||||
diesem Ticket: BAK-04s Akzeptanzkriterien fordern "vollständig
|
||||
protokolliert" (JSONL-Log, siehe unten), keine OPS-05-Alarmierung — eine
|
||||
`/metrics`-Anbindung wäre zusätzlicher Scope über das Ticket hinaus und
|
||||
bleibt als dokumentierter, leicht nachziehbarer Folgeschritt offen
|
||||
(gleiches Muster wie zuvor bei BAK-05s Meldeweg-Frage).
|
||||
|
||||
## Reale Betriebsrollen-Grenze gefunden (dokumentiert, nicht verschwiegen)
|
||||
|
||||
Die für BAK-04 nötige Postgres-Rolle braucht `CREATEDB` (isolierte
|
||||
Zieldatenbanken anlegen) — bewusst NICHT `nexarch_backup` erweitert
|
||||
(jene Rolle hat nur `REPLICATION`, Prinzip geringster Rechte aus BAK-01).
|
||||
Neue, eigene Rolle `nexarch_tenantbackup` angelegt. Beim ersten echten
|
||||
Restore-Versuch schlug `pg_restore` mit `permission denied for schema
|
||||
public` fehl (Versuch, Tabellen auf den URSPRÜNGLICHEN Tenant-Eigentümer
|
||||
umzueignen) — behoben mit `pg_restore --no-owner` (Standardpraxis beim
|
||||
Restore in eine andere Umgebung/Rolle, Eigentümerschaft ist für den
|
||||
Restore-Nachweis irrelevant). Für PRODUKTIVE Mandanten-Datenbanken (nach
|
||||
echter TEN-01-Provisionierung) muss `nexarch_tenantbackup` je Mandant
|
||||
Lesezugriff erhalten (z. B. Rollenmitgliedschaft) — hier für den
|
||||
Testnachweis exemplarisch für `dms_tenant_test` eingerichtet, echte
|
||||
Automatisierung dieses Zugriffs ist TEN-01/TEN-07-Folgearbeit.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/tenantbackup.Backup` — `pg_dump -Fc` für genau eine
|
||||
Datenbank.
|
||||
- `internal/tenantbackup.Verify` — `pg_restore -l`, volle
|
||||
Inhaltslisten-Prüfung (nicht nur Dateikopf).
|
||||
- `internal/tenantbackup.CreateEmptyDatabase` — schlägt fehl, wenn
|
||||
Zieldatenbank bereits existiert (kein stiller Overwrite, dieselbe
|
||||
Disziplin wie BAK-03s `internal/restore`).
|
||||
- `internal/tenantbackup.Restore` — `pg_restore --no-owner`.
|
||||
- `internal/tenantbackup.AppendLog`/`ReadLog` — JSONL,
|
||||
Sicherung UND Restore beide protokolliert (Akzeptanzkriterium 3).
|
||||
- `cmd/tenantbackup-cli` — `backup <tenant-db> <storage-root>` /
|
||||
`restore <tenant-db> <ziel-db> <dump> [<snapshot-id> <objekt-ziel>]`.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Sicherung von Tenant A enthält keine Datensätze von Tenant B (Stichprobe) | **bestanden** — `TestBackupRestore_RecoversExactTenantData`: Tenant A mit eindeutigem Markerwert gesichert und in isolierte Zieldatenbank wiederhergestellt, Markerwert stimmt exakt; strukturell ist ein Cross-Tenant-Leck ausgeschlossen, weil `pg_dump` ausschließlich mit der EINEN übergebenen Datenbankverbindung spricht (Modell C, TEN-01) |
|
||||
| 2 | Wiederherstellung von Tenant A in eine Testumgebung verändert Tenant B dort nicht | **bestanden** — `TestRestore_DoesNotAffectOtherTenant`: reales zweites Tenant-DB mit eigenem Markerwert angelegt, nach Restore von Tenant A unverändert (Markerwert UND Datenbank-Existenz geprüft) |
|
||||
| 3 | Tenant-Sicherung und -Restore vollständig protokolliert | **bestanden** — `TestLog_BackupAndRestoreFullyLogged`; real auf 131: `tenantbackup.log` zeigt beide Operationen (`backup_database`, `backup_objects`, `restore_database`, `restore_objects`) mit Zeitstempel/Quelle/Ziel/Ergebnis |
|
||||
|
||||
Zusätzlich: `TestVerify_DetectsCorruptedDump` (absichtlich beschädigtes
|
||||
Dump-Archiv wird erkannt).
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `tenantbackup-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- Eigene Postgres-Rolle `nexarch_tenantbackup` (`CREATEDB`, kein
|
||||
Superuser) angelegt — getrennt von `nexarch_backup` (Prinzip
|
||||
geringster Rechte)
|
||||
- `/etc/nexarch/archive-tenantbackup.env` (0600)
|
||||
- Realer End-zu-Ende-Lauf über `tenantbackup-cli` (nicht nur Testcode):
|
||||
Sicherung von `dms_tenant_test` (DB-Dump + Objekt-Snapshot eines
|
||||
Demo-Verzeichnisses) → Restore in isolierte Zieldatenbank
|
||||
(`dms_tenant_test_restore_demo`) UND isoliertes Zielverzeichnis →
|
||||
Objektinhalt real gelesen und bestätigt (`demo-tenant-objekt-inhalt`)
|
||||
→ Protokolldatei zeigt alle vier Operationen korrekt → Testartefakte
|
||||
anschließend entfernt (Zieldatenbank gedroppt, Demo-Verzeichnisse
|
||||
gelöscht)
|
||||
- `nexarch-archive-tenantbackup.{service,timer}.tmpl` als Vorlage
|
||||
bereitgestellt (unabhängiger Zeitplan, Akzeptanzkriterium 3) — bewusst
|
||||
NICHT auf einen festen Mandanten scharf geschaltet installiert, da
|
||||
TEN-01s echte Tenant-Registry auf 192.168.1.131 noch nicht produktiv
|
||||
befüllt ist (nur die Test-Tenant-DB `dms_tenant_test` existiert); reale
|
||||
Aktivierung pro Mandant folgt, sobald eine echte Registry-Abfrage dafür
|
||||
vorliegt (dokumentierter, kein stiller Gap)
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 7/7 Pakete mit Tests ok (backup, objectbackup, reconcile, restore, restoretest, scrub, tenantbackup), 0 Fehlschläge
|
||||
```
|
||||
|
||||
`internal/tenantbackup`-Tests brauchen eine eigene Rolle mit `CREATEDB`
|
||||
(`TEST_TENANTBACKUP_PG_USER`, NICHT `TEST_BACKUP_PG_USER` — bewusst
|
||||
getrennt, siehe Betriebsrollen-Hinweis oben): 4/4 Tests bestanden.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — sowohl testgetrieben (echte
|
||||
Zwei-Tenant-Isolation in beide Richtungen bewiesen) als auch über einen
|
||||
echten CLI-Lauf auf 192.168.1.131. Ein architektonischer Fund vor
|
||||
Implementierungsbeginn (Cluster- vs. Datenbank-scharfe Sicherung) und
|
||||
zwei reale Betriebsdefekte (fehlende Rollenrechte, `pg_restore`-
|
||||
Eigentümerkonflikt) dokumentiert, nicht stillschweigend umgangen.
|
||||
@@ -0,0 +1,110 @@
|
||||
# BAK-06 – Prüfprotokoll: Restore-Testverfahren
|
||||
|
||||
Voraussetzung BAK-03 – erledigt, siehe eigenes Protokoll.
|
||||
|
||||
## Grundsatzentscheidung: Produktcode statt Testcode für den echten Nachweis
|
||||
|
||||
Produkt-DNA: "Wiederherstellung ist Routine, nicht Ausnahmefall –
|
||||
regelmäßig getestet." Ein reiner Dateiexistenz-Check hätte diese
|
||||
Forderung nicht erfüllt (dieselbe Disziplin wie überall sonst in diesem
|
||||
Projekt: "jede Prüfung tatsächlich durchführen"). `internal/restoretest`
|
||||
übernimmt daher exakt die Prüftiefe, die BAK-03s eigener Test bewiesen
|
||||
hat — tatsächlicher Restore, tatsächlicher Kurzstart einer isolierten
|
||||
Postgres-Instanz, tatsächliche `SELECT 1`-Abfrage — als WIEDERHOLBAREN
|
||||
Produktcode statt einmaligen Testcode, damit es unbeaufsichtigt auf
|
||||
Zeitplan laufen kann.
|
||||
|
||||
Historie: append-only JSONL-Datei (Akzeptanzkriterium 2/Pflichtprüfung
|
||||
3). Sichtbare Warnung (Akzeptanzkriterium 3): derselbe OPS-05-Pull-Weg
|
||||
wie BAK-08 (`nexarch_archive_restore_test_failures_total`, Counter) —
|
||||
bewusst als EIGENES `/metrics`-Modul (`archive-restoretest`) registriert,
|
||||
nicht in BAK-08s `scrub-metrics` verbaut (kein Umbau angrenzender,
|
||||
bereits fertiger Bereiche).
|
||||
|
||||
## Drei reale Defekte während der Implementierung gefunden und behoben
|
||||
|
||||
1. **Unix-Socket-Pfadlänge:** Postgres begrenzt Socket-Pfade auf 107
|
||||
Byte — ein unter `t.TempDir()` verschachtelter Pfad reißt dieses
|
||||
Limit leicht. Fix: eigenes, kurzes Socket-Verzeichnis
|
||||
(`os.MkdirTemp("", ...)`), nicht unter dem Testverzeichnis.
|
||||
2. **`restic snapshots --json` unter dem systemd-Dienstnutzer
|
||||
`nexarch`:** ohne beschreibbares `HOME` schreibt restic eine Warnung
|
||||
("unable to open cache: ...") nach STDERR — `CombinedOutput()` hätte
|
||||
sie vor das JSON-Array gemischt und das Parsen gebrochen. Fix: nur
|
||||
`cmd.Output()` (stdout), stderr separat für Fehlermeldungen.
|
||||
3. Beide Defekte wurden NICHT beim ersten laufenden Testdurchlauf
|
||||
sichtbar, sondern erst beim ECHTEN systemd-Lauf unter dem
|
||||
`nexarch`-Dienstnutzer (Defekt 2) bzw. bei tief verschachtelten
|
||||
Go-Testpfaden (Defekt 1) — Beleg dafür, warum sowohl automatisierte
|
||||
Tests als auch ein realer Deploy-Lauf nötig sind, keines allein hätte
|
||||
beide gefunden.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/restoretest.RunDatabaseTest` — neueste Generation ermitteln
|
||||
(`backup.ListGenerations`), `backup.Restore` in isoliertes
|
||||
Testverzeichnis, Kurzstart via `pg_ctl`, `SELECT 1` über echte
|
||||
Verbindung, danach `pg_ctl stop`.
|
||||
- `internal/restoretest.RunObjectTest` — neuesten Snapshot ermitteln,
|
||||
`objectbackup.Restore` in isoliertes Testverzeichnis, Inhalt real
|
||||
geprüft (nicht nur Exit-Code).
|
||||
- `internal/restoretest.AppendHistory`/`ReadHistory` — JSONL,
|
||||
append-only.
|
||||
- `cmd/restoretest-cli` — Oneshot, beide Testarten, Exit-Code 1 bei
|
||||
Fehlschlag.
|
||||
- `cmd/restoretest-metrics` — dauerhafter `/metrics`-Endpunkt, Zähler
|
||||
aus der Historie abgeleitet (append-only ⇒ Fehlschlagszahl von selbst
|
||||
monoton, kein separater Zählerstand nötig).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Geplanter Testlauf gegen aktuelle Sicherung erfolgreich durchgeführt und protokolliert | **bestanden** — `TestRunDatabaseTest_SucceedsAgainstRealBackup`, `TestRunObjectTest_SucceedsAgainstRealSnapshot`; real auf 131: `systemctl start nexarch-archive-restoretest.service` → beide Testarten `erfolg=true`, in `history.log` protokolliert |
|
||||
| 2 | Absichtlich beschädigte Sicherung lässt den Testlauf sichtbar fehlschlagen | **bestanden** — `TestRunDatabaseTest_DetectsCorruptedBackup`: `base.tar.gz` durch Datenmüll ersetzt, `RunDatabaseTest` liefert `Success=false` mit aussagekräftigem Detail |
|
||||
| 3 | Protokollhistorie zeigt mehrere zurückliegende Testläufe nachvollziehbar an | **bestanden** — `TestHistory_ShowsMultiplePastRunsInOrder`: drei Einträge angehängt, in exakt derselben Reihenfolge gelesen |
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `restoretest-cli`, `restoretest-metrics` gebaut nach
|
||||
`/opt/nexarch-archive/bin/`
|
||||
- `/etc/nexarch/archive-restoretest.env` (0600)
|
||||
- `nexarch-archive-restoretest.timer` installiert/aktiviert (wöchentlich
|
||||
So. 07:00 UTC), `nexarch-archive-restoretest-metrics.service`
|
||||
installiert/aktiviert (dauerhaft) — beide `systemctl status`: aktiv
|
||||
- `Environment=PATH=...` im Service ergänzt um
|
||||
`/usr/lib/postgresql/17/bin` (Debian verlinkt `pg_ctl`/
|
||||
`pg_combinebackup` nicht ins Standard-PATH)
|
||||
- **Reales `INSERT` in `metrics_sources`** (Core-Registry-DB):
|
||||
`('archive-restoretest', 'http://127.0.0.1:8091/metrics')`
|
||||
- **End-to-End über OPS-03 bestätigt**: `curl http://127.0.0.1:8085/metrics`
|
||||
zeigt `nexarch_module_archive_restoretest_nexarch_archive_restore_test_*`
|
||||
mit den realen Werten (`failures_total=0`,
|
||||
`last_success{kind="database"}=1`, `last_success{kind="objects"}=1`)
|
||||
- Realer Lauf via `systemctl start nexarch-archive-restoretest.service`:
|
||||
beide Testarten erfolgreich, Journal zeigt Details, `/metrics` und
|
||||
OPS-03-Aggregation stimmen überein
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 6/6 Pakete mit Tests ok (backup, objectbackup, reconcile, restore, restoretest, scrub), 0 Fehlschläge
|
||||
```
|
||||
|
||||
Hinweis wie bei BAK-03: die Datenbank-Restore-Tests
|
||||
(`TestRunDatabaseTest_*`) brauchen `pg_ctl`/`pg_combinebackup` im PATH
|
||||
und laufen NICHT als root — separat als `postgres`-Systemnutzer
|
||||
verifiziert (7/7 `internal/restoretest`-Tests bestanden), im normalen
|
||||
root-`make check`-Lauf werden sie mit klarer Meldung übersprungen.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — sowohl testgetrieben als auch über einen
|
||||
echten, unbeaufsichtigten systemd-Lauf mit OPS-03/OPS-05-Sichtbarkeit
|
||||
nachgewiesen. Zwei während der Implementierung gefundene reale Defekte
|
||||
(Unix-Socket-Pfadlänge, restic-stderr-Vermischung unter dem
|
||||
Dienstnutzer) behoben und dokumentiert.
|
||||
@@ -0,0 +1,112 @@
|
||||
# BAK-07 – Prüfprotokoll: Aufbewahrungsfrist für Backup-Snapshots
|
||||
|
||||
Voraussetzung BAK-01, BAK-02 – erledigt, siehe eigene Protokolle.
|
||||
|
||||
## Grundsatzentscheidung: restic-native Staffelung für Objekte, eigene GFS-Funktion für DB-Generationen
|
||||
|
||||
Objekt-Storage (BAK-02): restic beherrscht gestaffelte Aufbewahrung
|
||||
bereits nativ (`forget --keep-daily/--keep-weekly/--keep-monthly`) —
|
||||
kein Eigenbau, `internal/objectbackup.PruneTiered` ist ein dünner
|
||||
Wrapper (dieselbe Disziplin wie beim ursprünglichen
|
||||
restic-statt-Eigenbau-Entscheid in BAK-02).
|
||||
|
||||
Datenbank-Generationen (BAK-01): `pg_basebackup` kennt keine
|
||||
Staffelung, daher `internal/backup.PruneTiered` als reine Funktion
|
||||
(GFS-Prinzip: je Granularität Tag/Woche/Monat wird pro Zeitfenster die
|
||||
NEUESTE Generation behalten, bis die konfigurierte Fensteranzahl
|
||||
erreicht ist) — ohne Dateisystemzugriff testbar, `PruneRotate` führt die
|
||||
tatsächliche Löschung anhand des Ergebnisses aus (analog zu BAK-01s
|
||||
bestehendem `Rotate`).
|
||||
|
||||
Beide Policies sind über Umgebungsvariablen konfigurierbar
|
||||
(`NEXARCH_BACKUP_KEEP_DAILY/WEEKLY/MONTHLY`,
|
||||
`NEXARCH_OBJECTBACKUP_KEEP_DAILY/WEEKLY/MONTHLY`), nicht hart codiert
|
||||
(Ticket-Vorgabe). Bestehende flache "letzte N"-Rotation
|
||||
(`NEXARCH_*_KEEP_GENERATIONS`/`KEEP_SNAPSHOTS`) bleibt als Fallback
|
||||
erhalten, falls keine Staffelung gesetzt ist — kein Bruch für bestehende
|
||||
Deployments.
|
||||
|
||||
## Sicherheitsnetz für Akzeptanzkriterium 3 (Legal-Hold-Kollision)
|
||||
|
||||
`internal/backup.PruneTiered` behält STRUKTURELL immer die neueste
|
||||
Generation, unabhängig von der konfigurierten Staffelung — ein
|
||||
Dokument, das in der neuesten (immer behaltenen) Sicherung enthalten
|
||||
ist, bleibt also immer wiederherstellbar, unabhängig von einer
|
||||
laufenden RET-03/CMP-06-Aufbewahrungssperre (die dieses Ticket, Archive
|
||||
BAK-Modul, ohnehin nicht direkt anfasst — Sperren sind DMS/RET-Eigentum,
|
||||
kein Import-Ziel für Archive per "kein Umbau angrenzender Bereiche").
|
||||
Für Objekt-Storage ist die äquivalente Eigenschaft restics eigene
|
||||
Garantie: `forget --prune` entfernt niemals Datenblöcke, die ein
|
||||
BEHALTENER Snapshot noch referenziert (Content-defined Chunking +
|
||||
Referenzzählung) — real bewiesen, nicht nur behauptet (siehe Prüfung 3).
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/backup.RetentionPolicy`/`PruneTiered` (`retention.go`) —
|
||||
reine GFS-Funktion.
|
||||
- `internal/backup.PruneRotate` (`rotate.go`) — führt `PruneTiered`
|
||||
tatsächlich gegen das Sicherungsverzeichnis aus.
|
||||
- `internal/objectbackup.RetentionPolicy`/`PruneTiered` (`restic.go`) —
|
||||
Wrapper um restics native Staffelung.
|
||||
- `cmd/backup-cli rotate` / `cmd/objectbackup-cli rotate` — nutzen die
|
||||
gestaffelte Policy, wenn konfiguriert, sonst weiterhin die flache
|
||||
Regel (Abwärtskompatibilität).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Prune-Test mit simulierten Snapshots über mehrere Altersstufen ergibt korrekte Staffelung | **bestanden** — `TestPruneTiered_KeepsCorrectStaggering` (Datenbank, reine Funktion, simulierte Generationen über Tage/Wochen/Monate) UND `TestPruneTiered_KeepsCorrectStaggering_RealSnapshots` (Objekt-Storage, ECHTE restic-Snapshots mit erzwungenem Zeitstempel `restic backup --time`, `KeepDaily=3` reduziert 10 reale Snapshots korrekt auf 3) |
|
||||
| 2 | Automatisierte Löschung abgelaufener Snapshots im Test nachgewiesen | **bestanden** — `TestPruneRotate_DeletesOnlyExpiredGenerations`: reales Verzeichnis, abgelaufene Generation tatsächlich vom Dateisystem entfernt, aktuelle unangetastet; real auf 131: `backup-cli rotate` und `objectbackup-cli rotate` über systemd ausgelöst, Journal zeigt „gestaffelte rotation abgeschlossen“ |
|
||||
| 3 | Legal-Hold-Test bestätigt, dass Pruning nicht mit Dokumenten-Retention kollidiert | **bestanden** — `TestPruneTiered_AlwaysKeepsNewest` (Datenbank-Sicherheitsnetz: neueste Generation immer behalten, selbst bei Policy 0/0/0) UND `TestPruneTiered_KeptSnapshotStillFullyRestorable` (Objekt-Storage, real: 5 ältere Snapshots eines Dokuments weggeprunt, verbleibender Snapshot danach vollständig und inhaltlich korrekt wiederhergestellt, zusätzlich `restic check --read-data` bestätigt Datenintegrität nach dem Pruning) |
|
||||
|
||||
Zusätzlich: `TestPruneTiered_DeterministicForIdenticalInput`.
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `backup-cli`, `objectbackup-cli` neu gebaut mit der gestaffelten
|
||||
Rotations-Logik
|
||||
- `/etc/nexarch/archive-backup.env` und
|
||||
`/etc/nexarch/archive-objectbackup.env` um
|
||||
`KEEP_DAILY=14`/`KEEP_WEEKLY=12`/`KEEP_MONTHLY=12` ergänzt
|
||||
- Beide `*-rotate.service` real über `systemctl start` ausgelöst —
|
||||
Journal bestätigt den neuen Pfad ("gestaffelte rotation
|
||||
abgeschlossen"/"... entfernt: [...]"), nicht mehr die alte flache
|
||||
Regel
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 7/7 Pakete mit Tests ok, 0 Fehlschläge
|
||||
```
|
||||
|
||||
## Bekannte Lücke: keine Kohärenz zwischen DB- und Objekt-Rotation
|
||||
|
||||
Beide Rotationswege laufen als UNABHÄNGIGE systemd-Timer mit eigener
|
||||
Kadenz und eigener Policy-Auswertung — nichts stellt sicher, dass der
|
||||
älteste noch erreichbare restic-Snapshot und die älteste noch
|
||||
erreichbare DB-Generation denselben Zeitpunkt abdecken. Die aktuelle
|
||||
Konfiguration (`KEEP_DAILY=14`/`KEEP_WEEKLY=12`/`KEEP_MONTHLY=12` auf
|
||||
beiden Seiten identisch) ist eine ZUFÄLLIGE Übereinstimmung, kein
|
||||
getestetes oder erzwungenes Invariant — ein restic-Snapshot ohne
|
||||
zeitlich passende DB-Generation wäre ein inkonsistenter Restore-Punkt
|
||||
(Objekte ohne zugehörige `file_revisions`-Metadaten oder umgekehrt).
|
||||
Nicht Teil dieses Tickets (BAK-07 fordert nur je Sicherungsart eine
|
||||
konfigurierbare Staffelung, kein Cross-Artefakt-Alignment) — als
|
||||
dokumentierter Folgepunkt festgehalten, nicht stillschweigend
|
||||
übergangen: ein künftiges Ticket müsste entweder die Policies fest
|
||||
koppeln oder bei Restore-Zeitpunkt-Wahl (BAK-03) explizit warnen, wenn
|
||||
kein zeitlich passendes Gegenstück mehr existiert.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — sowohl mit simulierten (Datenbank) als
|
||||
auch mit tatsächlich zeitversetzt erzeugten, realen restic-Snapshots
|
||||
(Objekt-Storage). Ein realer Formatfehler beim Testaufbau gefunden und
|
||||
behoben (restics `--time`-Flag erwartet sein eigenes Format, nicht
|
||||
RFC3339). Beide Rotations-Wege real über systemd auf 192.168.1.131
|
||||
ausgelöst, nicht nur isolierter Testcode.
|
||||
@@ -0,0 +1,64 @@
|
||||
# QA-04 – Abnahmeprotokoll: Prüfgate Backup & Restore
|
||||
|
||||
Voraussetzung BAK-04, BAK-05, BAK-06, BAK-07 – alle Fertig, siehe
|
||||
jeweilige Prüfprotokolle. Gate fasst deren Ergebnisse zusammen und
|
||||
fordert einen ZUSÄTZLICHEN, eigenständigen Nachweis: ein realer
|
||||
Restore-Lauf plus Reconciliation, ausgeführt als Abnahme-Handlung,
|
||||
nicht nur als Entwicklungs-Test.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Zielwert | Messwert | Bewertung |
|
||||
|---|---|---|---|---|
|
||||
| 1 | Realer Restore-Testlauf erfolgreich und protokolliert | Beide Restore-Arten (DB + Objekt) laufen ohne Fehler, real gegen 192.168.1.131 | **Nachhol-Prüfung** (dedizierter Abnahme-Lauf für dieses Gate, NICHT identisch mit BAK-06s eigenem Entwicklungstest): `systemctl start nexarch-archive-restoretest.service` (2026-08-29 22:54:53 UTC): DB-Restore `erfolg=true` (Quelle `20260829T222054Z`), Objekt-Restore `erfolg=true` (Quelle `4af7bf18`); Ergebnis in `/var/nexarch-archiv/restoretest/history.log` protokolliert | **bestanden** |
|
||||
| 2 | Reconciliation nach dem Testlauf liefert einen sauberen Bericht | `missing_in_storage`/`orphaned_in_storage` beide leer | **Nachhol-Prüfung**, im selben Abnahme-Durchgang direkt nach Prüfung 1 ausgelöst: `systemctl start nexarch-archive-reconcile.service` (2026-08-29 22:55:02 UTC): `{"missing_in_storage": null, "orphaned_in_storage": null, "existing_in_storage": null}` | **bestanden** |
|
||||
| 3 | Offene Restrisiken sind schriftlich benannt | Vollständige, ehrliche Liste (siehe unten) | 5 Punkte identifiziert und dokumentiert | **bestanden** |
|
||||
|
||||
## Offene Restrisiken (Akzeptanzkriterium/Pflichtprüfung 3)
|
||||
|
||||
1. **Keine Kohärenz zwischen DB- und Objekt-Rotation** (BAK-07). Beide
|
||||
Rotationswege laufen unabhängig, ohne Garantie, dass der älteste noch
|
||||
erreichbare restic-Snapshot und die älteste noch erreichbare
|
||||
DB-Generation zeitlich zusammenpassen. Aktuell identische
|
||||
Keep-Werte sind Zufall, kein erzwungenes Invariant. **Ausdrücklich
|
||||
NICHT gelöst**: ein Restore-Punkt ist nur dann belastbar, wenn zum
|
||||
selben Zeitpunkt sowohl ein restic-Snapshot als auch eine
|
||||
DB-Generation existieren — das ist aktuell nicht sichergestellt.
|
||||
2. **BAK-04-Rollenrechte nicht automatisiert für produktive Mandanten.**
|
||||
`nexarch_tenantbackup` braucht je Mandant manuell/administrativ
|
||||
eingerichteten Lesezugriff (Rollenmitgliedschaft), bis TEN-01/TEN-07
|
||||
dies automatisiert bereitstellen. Aktuell nur für die Test-Tenant-DB
|
||||
eingerichtet.
|
||||
3. **BAK-08 deckt keine Storage-Provider-Lücke.** Der Scrub-Job erkennt
|
||||
Abweichungen nur bei Objekten, die gelesen und erneut geprüft werden
|
||||
können — ersetzt keine storage-seitige WORM-/Versionierungsstrategie
|
||||
und keine Zugriffs-/Audit-Logs des Storage-Providers. Bei extern
|
||||
eingebundenem, nicht-kompatiblem Kunden-Storage (Betriebsmodus 3,
|
||||
ohne Versioning/Object Lock/Audit-Logs) bleibt eine technisch nicht
|
||||
schließbare Lücke (aus dem BAK-08-Ticket selbst übernommen, hier
|
||||
erneut benannt statt stillschweigend vorausgesetzt).
|
||||
4. **Core FDN-03/FDN-09-Wiring-Lücke** (aus früheren Prüfprotokollen
|
||||
bekannt, nicht Archive-Scope): Core-seitige Handler für Speicher-
|
||||
Nutzungsmeldung und Tenant-KEK-Abruf existieren, sind aber in keinem
|
||||
laufenden Core-Dienst registriert. Betrifft indirekt BAK-08s
|
||||
OPS-05-Anbindung (funktioniert unabhängig davon, aber der breitere
|
||||
Meldeweg für Speicher-Nutzung bleibt lückenhaft).
|
||||
5. **`existing_in_storage`/Reconciliation-Basis aktuell leer im
|
||||
Testsystem.** Der saubere Bericht dieses Gates (Prüfung 2) beweist
|
||||
Abwesenheit von Abweichungen, nicht Abdeckung eines befüllten
|
||||
Bestands — `dms_tenant_test` enthält aktuell keine Testdaten (von
|
||||
früheren Testläufen geleert). Ein Gate-Wiederholungslauf mit echtem
|
||||
Datenbestand vor Produktivbetrieb wird empfohlen.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Prüfungen real durchgeführt und dokumentiert.
|
||||
Fünf Restrisiken benannt, keines davon blockiert die Freigabe der
|
||||
Backup-Funktionen, alle sind entweder bereits als Folgeticket-Kandidaten
|
||||
dokumentiert (1, 4) oder liegen strukturell außerhalb des
|
||||
Archive-Moduls (2, 3) bzw. sind ein Hinweis für den Produktivbetrieb (5).
|
||||
|
||||
## Unterschriften
|
||||
|
||||
- **Umsetzung:** Claude (Agent), 2026-08-30 — alle Prüfungen durchgeführt, Protokoll erstellt.
|
||||
- **Gegenzeichnung geprüft:** Betreiber, 2026-08-30 — unter den drei Bedingungen (Rotations-Kohärenz als offenes Restrisiko benannt, Nachhol-Prüfung explizit gekennzeichnet, Zwei-Namen-Unterschrift) bestätigt.
|
||||
@@ -14,6 +14,7 @@ import (
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"sort"
|
||||
"time"
|
||||
)
|
||||
|
||||
@@ -21,12 +22,13 @@ import (
|
||||
// über Umgebungsvariablen befüllt, nie im Code (siehe Ticket-Abschluss-
|
||||
// Regel).
|
||||
type Config struct {
|
||||
Host string
|
||||
Port string
|
||||
User string
|
||||
Password string
|
||||
BackupDir string
|
||||
PgBaseBackupPath string // Default "pg_basebackup", überschreibbar für Tests
|
||||
Host string
|
||||
Port string
|
||||
User string
|
||||
Password string
|
||||
BackupDir string
|
||||
PgBaseBackupPath string // Default "pg_basebackup", überschreibbar für Tests
|
||||
PgCombineBackupPath string // Default "pg_combinebackup", überschreibbar für Tests
|
||||
}
|
||||
|
||||
func (c Config) binary() string {
|
||||
@@ -43,6 +45,13 @@ const (
|
||||
IncrementalSubdir = "incremental"
|
||||
BackupManifestFile = "backup_manifest"
|
||||
BaseTarGzFile = "base.tar.gz"
|
||||
// WalTarGzFile: pg_basebackups Standard-WAL-Methode ist "stream" (WAL
|
||||
// wird waehrend der Sicherung parallel mitgestreamt) - bei -Ft/-z
|
||||
// landet dieser Strom in einer EIGENEN Archivdatei neben base.tar.gz.
|
||||
// Ohne dieses WAL ist die Sicherung NICHT crash-konsistent
|
||||
// wiederherstellbar (Postgres kann sonst keinen gueltigen Checkpoint
|
||||
// erreichen) - siehe Restore.
|
||||
WalTarGzFile = "pg_wal.tar.gz"
|
||||
)
|
||||
|
||||
// NewGenerationID liefert eine sortierbare, eindeutige Generation-Kennung
|
||||
@@ -91,6 +100,94 @@ func IncrementalBackup(ctx context.Context, cfg Config, generationID, incrementI
|
||||
return filepath.Join(dir, BackupManifestFile), nil
|
||||
}
|
||||
|
||||
// Restore kombiniert die Vollsicherung einer Generation mit allen ihren
|
||||
// Inkrementen (PostgreSQL 17s `pg_combinebackup`, das native Gegenstück zu
|
||||
// `pg_basebackup --incremental`) und schreibt das Ergebnis nach outputDir —
|
||||
// ein vollständiges, direkt startbares PGDATA-Verzeichnis. outputDir muss
|
||||
// bereits existieren und leer sein (pg_combinebackup-Vorgabe); Atomarität
|
||||
// gegenüber einem eventuell nicht-leeren ENDZIEL ist Aufgabe von
|
||||
// internal/restore, nicht dieser Funktion.
|
||||
//
|
||||
// pg_combinebackup erwartet PLAIN-Format-Eingabeverzeichnisse (Dateibaum),
|
||||
// FullBackup/IncrementalBackup speichern aber TAR+GZIP (`-Ft -z`, siehe
|
||||
// dort) — kleinere, einfacher zu prüfende Sicherungsdateien
|
||||
// (BAK-01-Entscheidung, hier NICHT verändert). Restore extrahiert daher
|
||||
// jede Stufe zunächst in ein eigenes temporäres Plain-Verzeichnis, bevor
|
||||
// pg_combinebackup darauf zugreift.
|
||||
func Restore(ctx context.Context, cfg Config, generationID, outputDir string) error {
|
||||
genDir := filepath.Join(cfg.BackupDir, generationID)
|
||||
tarDirs := []string{filepath.Join(genDir, FullBackupDirName)}
|
||||
|
||||
incrDir := filepath.Join(genDir, IncrementalSubdir)
|
||||
entries, err := os.ReadDir(incrDir)
|
||||
if err != nil && !os.IsNotExist(err) {
|
||||
return fmt.Errorf("backup: inkrement-verzeichnis lesen: %w", err)
|
||||
}
|
||||
incrementIDs := make([]string, 0, len(entries))
|
||||
for _, e := range entries {
|
||||
if e.IsDir() {
|
||||
incrementIDs = append(incrementIDs, e.Name())
|
||||
}
|
||||
}
|
||||
sort.Strings(incrementIDs) // Inkrement-IDs sind wie Generation-IDs chronologisch sortierbar
|
||||
for _, id := range incrementIDs {
|
||||
tarDirs = append(tarDirs, filepath.Join(incrDir, id))
|
||||
}
|
||||
|
||||
extractRoot, err := os.MkdirTemp("", "backup-restore-extract-*")
|
||||
if err != nil {
|
||||
return fmt.Errorf("backup: extraktions-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(extractRoot) }()
|
||||
|
||||
inputs := make([]string, 0, len(tarDirs))
|
||||
for i, tarDir := range tarDirs {
|
||||
plainDir := filepath.Join(extractRoot, fmt.Sprintf("%02d", i))
|
||||
if err := os.MkdirAll(plainDir, 0o700); err != nil {
|
||||
return fmt.Errorf("backup: plain-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
if err := extractTarGz(filepath.Join(tarDir, BaseTarGzFile), plainDir); err != nil {
|
||||
return fmt.Errorf("backup: %q extrahieren: %w", tarDir, err)
|
||||
}
|
||||
// backup_manifest liegt NEBEN base.tar.gz (von pg_basebackup so
|
||||
// geschrieben), nicht im Archiv selbst - pg_combinebackup braucht
|
||||
// es zusätzlich im Plain-Verzeichnis.
|
||||
manifestData, err := os.ReadFile(filepath.Join(tarDir, BackupManifestFile))
|
||||
if err != nil {
|
||||
return fmt.Errorf("backup: %q lesen: %w", filepath.Join(tarDir, BackupManifestFile), err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(plainDir, BackupManifestFile), manifestData, 0o600); err != nil {
|
||||
return fmt.Errorf("backup: manifest nach %q kopieren: %w", plainDir, err)
|
||||
}
|
||||
inputs = append(inputs, plainDir)
|
||||
}
|
||||
|
||||
binary := "pg_combinebackup"
|
||||
if cfg.PgCombineBackupPath != "" {
|
||||
binary = cfg.PgCombineBackupPath
|
||||
}
|
||||
args := append(append([]string{}, inputs...), "-o", outputDir)
|
||||
cmd := exec.CommandContext(ctx, binary, args...)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("backup: %s fehlgeschlagen: %w (ausgabe: %s)", binary, err, string(output))
|
||||
}
|
||||
|
||||
// pg_combinebackup rekonstruiert nur die Datendateien - das fuer einen
|
||||
// konsistenten Start noetige WAL kommt aus der ZULETZT gezogenen Stufe
|
||||
// (letztes Inkrement, sonst die Vollsicherung), nicht aus allen Stufen
|
||||
// zusammen (siehe WalTarGzFile-Dokumentation).
|
||||
lastTarDir := tarDirs[len(tarDirs)-1]
|
||||
walDir := filepath.Join(outputDir, "pg_wal")
|
||||
if err := os.MkdirAll(walDir, 0o700); err != nil {
|
||||
return fmt.Errorf("backup: pg_wal-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
if err := extractTarGz(filepath.Join(lastTarDir, WalTarGzFile), walDir); err != nil {
|
||||
return fmt.Errorf("backup: WAL aus %q wiederherstellen: %w", lastTarDir, err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
func runPgBaseBackup(ctx context.Context, cfg Config, args []string) error {
|
||||
cmd := exec.CommandContext(ctx, cfg.binary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
|
||||
@@ -0,0 +1,102 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"strings"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestRestore_CombinesIntoStartablePostgresInstance ist Pruefung 1 fuer
|
||||
// BAK-03 (Datenbank-Teil): Restore auf leerem System vollstaendig und
|
||||
// erfolgreich durchgefuehrt — real bewiesen, indem das wiederhergestellte
|
||||
// Verzeichnis tatsaechlich als eigenstaendige Postgres-Instanz gestartet
|
||||
// und per echter Verbindung abgefragt wird, nicht nur auf Dateiexistenz
|
||||
// geprueft.
|
||||
func TestRestore_CombinesIntoStartablePostgresInstance(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
|
||||
defer cancel()
|
||||
|
||||
if _, err := exec.LookPath("pg_combinebackup"); err != nil {
|
||||
t.Skip("pg_combinebackup nicht installiert, restore-integrationstest uebersprungen")
|
||||
}
|
||||
pgCtl, err := exec.LookPath("pg_ctl")
|
||||
if err != nil {
|
||||
t.Skip("pg_ctl nicht installiert, restore-integrationstest uebersprungen")
|
||||
}
|
||||
|
||||
genID := NewGenerationID(time.Now())
|
||||
if _, err := FullBackup(ctx, cfg, genID); err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
|
||||
restoreOut := filepath.Join(t.TempDir(), "restored-pgdata")
|
||||
if err := os.MkdirAll(restoreOut, 0o700); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := Restore(ctx, cfg, genID, restoreOut); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(restoreOut, "PG_VERSION")); err != nil {
|
||||
t.Fatalf("wiederhergestelltes verzeichnis ist kein gueltiges PGDATA (PG_VERSION fehlt): %v", err)
|
||||
}
|
||||
|
||||
// Auf diesem Debian-Postgres liegt postgresql.conf NICHT in PGDATA
|
||||
// (sondern in /etc/postgresql/17/main/) - pg_basebackup sichert daher
|
||||
// nur PGDATA-Inhalte, die Konfigurationsdatei fehlt im Restore
|
||||
// GENAUSO wie im echten Betriebs-Restore-Verfahren. Fuer den
|
||||
// End-zu-End-Nachweis (echte Daten wiederherstellbar) hier eine
|
||||
// minimale, ausschliesslich fuer den Testlauf gueltige Konfiguration
|
||||
// nachgereicht - dokumentiert als operativer Hinweis fuer ein echtes
|
||||
// Restore-Runbook, nicht Teil des Produktcodes.
|
||||
minimalConf := "listen_addresses = ''\n"
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "postgresql.conf"), []byte(minimalConf), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
// dito pg_hba.conf - liegt auf Debian ebenfalls in /etc/postgresql,
|
||||
// nicht in PGDATA. Nur Unix-Socket-Verbindungen des lokalen Testlaufs
|
||||
// erlaubt (kein TCP, dieselbe Isolation wie listen_addresses='').
|
||||
hba := "local all all trust\n"
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "pg_hba.conf"), []byte(hba), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
// Konfigurationsdateien aus der Quellinstanz brachte pg_basebackup mit
|
||||
// (sie enthalten ggf. den alten Port/Unix-Socket) - fuer diesen Test
|
||||
// bewusst neuer Port und eigenes Socket-Verzeichnis, damit die
|
||||
// wiederhergestellte Instanz nicht mit der laufenden Test-Instanz
|
||||
// kollidiert.
|
||||
socketDir := t.TempDir()
|
||||
testPort := "55432"
|
||||
// WICHTIG: pg_ctl start foerdert postgres als Hintergrundprozess, der
|
||||
// die geerbten stdout/stderr-Pipes NICHT schliesst - CombinedOutput()
|
||||
// (das auf ein Pipe-EOF wartet) haengt sich daher auf, obwohl pg_ctl
|
||||
// selbst laengst zurueckgekehrt ist. Deshalb echte Logdatei statt Pipe
|
||||
// (Standard-pg_ctl-Muster), kein exec.Cmd.Stdout/-Stderr-Pipe-Zugriff.
|
||||
logFile := filepath.Join(t.TempDir(), "postgres.log")
|
||||
startCmd := exec.CommandContext(ctx, pgCtl, "start", "-D", restoreOut, "-w", "-t", "30", "-l", logFile,
|
||||
"-o", fmt.Sprintf("-p %s -k %s -c listen_addresses=''", testPort, socketDir))
|
||||
if err := startCmd.Run(); err != nil {
|
||||
logContent, _ := os.ReadFile(logFile)
|
||||
t.Fatalf("pg_ctl start (wiederhergestellte instanz): %v (log: %s)", err, string(logContent))
|
||||
}
|
||||
defer func() {
|
||||
stopCmd := exec.Command(pgCtl, "stop", "-D", restoreOut, "-m", "fast")
|
||||
_ = stopCmd.Run()
|
||||
}()
|
||||
|
||||
psqlOut, err := exec.CommandContext(ctx, "psql",
|
||||
"-h", socketDir, "-p", testPort, "-U", cfg.User, "-d", "postgres",
|
||||
"-tAc", "SELECT 1").CombinedOutput()
|
||||
if err != nil {
|
||||
t.Fatalf("echte verbindung zur wiederhergestellten instanz fehlgeschlagen: %v (ausgabe: %s)", err, string(psqlOut))
|
||||
}
|
||||
if strings.TrimSpace(string(psqlOut)) != "1" {
|
||||
t.Fatalf("unerwartete antwort von der wiederhergestellten instanz: %q", string(psqlOut))
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,89 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"fmt"
|
||||
"sort"
|
||||
"time"
|
||||
)
|
||||
|
||||
// RetentionPolicy ist BAK-07s gestaffelte Aufbewahrungsfrist für
|
||||
// Datenbank-Sicherungsgenerationen — unabhängig von RET-02s
|
||||
// Dokumenten-Retention (Akzeptanzkriterium 1). Ein Feldwert 0 bedeutet
|
||||
// "diese Stufe nicht anwenden", dieselbe Konvention wie
|
||||
// objectbackup.RetentionPolicy (BAK-02), damit beide Backup-Arten
|
||||
// gleich konfiguriert werden.
|
||||
type RetentionPolicy struct {
|
||||
KeepDaily int
|
||||
KeepWeekly int
|
||||
KeepMonthly int
|
||||
}
|
||||
|
||||
// PruneTiered wählt aus generations (IDs im NewGenerationID-Format) die
|
||||
// zu BEHALTENDEN nach gestaffelter GFS-Regel: je Granularität
|
||||
// (Tag/Woche/Monat) wird pro Zeitfenster die NEUESTE Generation
|
||||
// behalten, bis die konfigurierte Anzahl Fenster erreicht ist — reine
|
||||
// Funktion, keine Dateisystem-/Netzwerkzugriffe, dadurch ohne echte
|
||||
// Infrastruktur testbar (Rotate in rotate.go führt die tatsächliche
|
||||
// Löschung anhand des Ergebnisses aus).
|
||||
//
|
||||
// Sicherheitsnetz für Akzeptanzkriterium 3 ("mindestens ein aktueller
|
||||
// Snapshot bleibt erhalten"): die NEUESTE Generation wird IMMER
|
||||
// behalten, unabhängig von der konfigurierten Staffelung — selbst bei
|
||||
// versehentlich auf 0 gesetzter Policy geht nie die letzte Sicherung
|
||||
// verloren.
|
||||
func PruneTiered(generations []string, policy RetentionPolicy) (keep, remove []string) {
|
||||
type parsed struct {
|
||||
id string
|
||||
t time.Time
|
||||
}
|
||||
var items []parsed
|
||||
for _, id := range generations {
|
||||
t, err := time.Parse("20060102T150405Z", id)
|
||||
if err != nil {
|
||||
continue // unbekanntes Format wird ignoriert, nicht geloescht
|
||||
}
|
||||
items = append(items, parsed{id: id, t: t})
|
||||
}
|
||||
sort.Slice(items, func(i, j int) bool { return items[i].t.After(items[j].t) }) // neueste zuerst
|
||||
|
||||
keepSet := make(map[string]bool)
|
||||
if len(items) > 0 {
|
||||
keepSet[items[0].id] = true // Sicherheitsnetz: immer die neueste
|
||||
}
|
||||
|
||||
applyTier := func(bucketKey func(time.Time) string, n int) {
|
||||
if n <= 0 {
|
||||
return
|
||||
}
|
||||
seen := make(map[string]bool)
|
||||
count := 0
|
||||
for _, it := range items {
|
||||
if count >= n {
|
||||
break
|
||||
}
|
||||
key := bucketKey(it.t)
|
||||
if seen[key] {
|
||||
continue
|
||||
}
|
||||
seen[key] = true
|
||||
count++
|
||||
keepSet[it.id] = true
|
||||
}
|
||||
}
|
||||
|
||||
applyTier(func(t time.Time) string { return t.Format("2006-01-02") }, policy.KeepDaily)
|
||||
applyTier(func(t time.Time) string {
|
||||
y, w := t.ISOWeek()
|
||||
return fmt.Sprintf("%04d-W%02d", y, w)
|
||||
}, policy.KeepWeekly)
|
||||
applyTier(func(t time.Time) string { return t.Format("2006-01") }, policy.KeepMonthly)
|
||||
|
||||
for _, it := range items {
|
||||
if keepSet[it.id] {
|
||||
keep = append(keep, it.id)
|
||||
} else {
|
||||
remove = append(remove, it.id)
|
||||
}
|
||||
}
|
||||
return keep, remove
|
||||
}
|
||||
@@ -0,0 +1,130 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
func genID(t time.Time) string { return NewGenerationID(t) }
|
||||
|
||||
// TestPruneTiered_KeepsCorrectStaggering ist Pruefung 1: Prune-Test mit
|
||||
// simulierten Snapshots ueber mehrere Altersstufen ergibt korrekte
|
||||
// Staffelung.
|
||||
func TestPruneTiered_KeepsCorrectStaggering(t *testing.T) {
|
||||
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
|
||||
|
||||
var generations []string
|
||||
// 20 taegliche generationen der letzten 20 Tage.
|
||||
for i := 0; i < 20; i++ {
|
||||
generations = append(generations, genID(now.Add(-time.Duration(i)*24*time.Hour)))
|
||||
}
|
||||
// zusaetzlich aeltere, wochenweise verteilte generationen (Wochen 4-15
|
||||
// zurueck), damit KeepWeekly etwas zu greifen hat, das KeepDaily nicht
|
||||
// schon abdeckt.
|
||||
for w := 4; w <= 15; w++ {
|
||||
generations = append(generations, genID(now.Add(-time.Duration(w*7)*24*time.Hour)))
|
||||
}
|
||||
// und einige monatealte generationen.
|
||||
for m := 3; m <= 10; m++ {
|
||||
generations = append(generations, genID(now.AddDate(0, -m, 0)))
|
||||
}
|
||||
|
||||
policy := RetentionPolicy{KeepDaily: 7, KeepWeekly: 4, KeepMonthly: 6}
|
||||
keep, remove := PruneTiered(generations, policy)
|
||||
|
||||
if len(keep)+len(remove) != len(generations) {
|
||||
t.Fatalf("keep+remove = %d, want %d (gesamtzahl)", len(keep)+len(remove), len(generations))
|
||||
}
|
||||
// Genau die 7 juengsten taeglichen generationen muessen behalten sein.
|
||||
keepSet := make(map[string]bool, len(keep))
|
||||
for _, k := range keep {
|
||||
keepSet[k] = true
|
||||
}
|
||||
for i := 0; i < 7; i++ {
|
||||
id := genID(now.Add(-time.Duration(i) * 24 * time.Hour))
|
||||
if !keepSet[id] {
|
||||
t.Fatalf("generation %q (tag %d) haette per KeepDaily behalten werden muessen", id, i)
|
||||
}
|
||||
}
|
||||
// Zu weit zurueckliegende taegliche generationen (ausserhalb aller
|
||||
// Stufen) duerfen NICHT behalten sein.
|
||||
tooOld := genID(now.Add(-19 * 24 * time.Hour))
|
||||
if keepSet[tooOld] {
|
||||
t.Fatalf("generation %q haette NICHT behalten werden duerfen (zu alt fuer jede stufe)", tooOld)
|
||||
}
|
||||
if len(keep) == 0 {
|
||||
t.Fatal("erwartet mindestens eine behaltene generation")
|
||||
}
|
||||
}
|
||||
|
||||
// TestPruneTiered_AlwaysKeepsNewest ist das Sicherheitsnetz fuer
|
||||
// Akzeptanzkriterium 3 (mindestens ein aktueller Snapshot bleibt immer
|
||||
// erhalten) - selbst bei Policy 0/0/0 (versehentlich deaktiviert).
|
||||
func TestPruneTiered_AlwaysKeepsNewest(t *testing.T) {
|
||||
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
|
||||
generations := []string{genID(now), genID(now.Add(-48 * time.Hour))}
|
||||
|
||||
keep, remove := PruneTiered(generations, RetentionPolicy{})
|
||||
|
||||
if len(keep) != 1 || keep[0] != genID(now) {
|
||||
t.Fatalf("erwartet genau die neueste generation behalten, habe keep=%v", keep)
|
||||
}
|
||||
if len(remove) != 1 {
|
||||
t.Fatalf("erwartet 1 entfernte generation, habe %d", len(remove))
|
||||
}
|
||||
}
|
||||
|
||||
// TestPruneTiered_DeterministicForIdenticalInput - zwei Laeufe mit
|
||||
// identischer Eingabe liefern dasselbe Ergebnis.
|
||||
func TestPruneTiered_DeterministicForIdenticalInput(t *testing.T) {
|
||||
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
|
||||
var generations []string
|
||||
for i := 0; i < 10; i++ {
|
||||
generations = append(generations, genID(now.Add(-time.Duration(i)*24*time.Hour)))
|
||||
}
|
||||
policy := RetentionPolicy{KeepDaily: 3}
|
||||
|
||||
keep1, remove1 := PruneTiered(generations, policy)
|
||||
keep2, remove2 := PruneTiered(generations, policy)
|
||||
|
||||
if len(keep1) != len(keep2) || len(remove1) != len(remove2) {
|
||||
t.Fatal("unterschiedliches ergebnis zwischen zwei laeufen mit identischer eingabe")
|
||||
}
|
||||
}
|
||||
|
||||
// TestPruneRotate_DeletesOnlyExpiredGenerations ist Pruefung 2:
|
||||
// automatisierte Loeschung abgelaufener Snapshots im Test nachgewiesen -
|
||||
// real gegen echte Verzeichnisse.
|
||||
func TestPruneRotate_DeletesOnlyExpiredGenerations(t *testing.T) {
|
||||
backupDir := t.TempDir()
|
||||
now := time.Date(2026, 8, 30, 12, 0, 0, 0, time.UTC)
|
||||
|
||||
var recent, expired string
|
||||
for i := 0; i < 3; i++ {
|
||||
id := genID(now.Add(-time.Duration(i) * 24 * time.Hour))
|
||||
if err := os.MkdirAll(filepath.Join(backupDir, id, FullBackupDirName), 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
recent = id
|
||||
}
|
||||
expired = genID(now.Add(-60 * 24 * time.Hour))
|
||||
if err := os.MkdirAll(filepath.Join(backupDir, expired, FullBackupDirName), 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
removed, err := PruneRotate(backupDir, RetentionPolicy{KeepDaily: 3})
|
||||
if err != nil {
|
||||
t.Fatalf("prunerotate: %v", err)
|
||||
}
|
||||
if len(removed) != 1 || removed[0] != expired {
|
||||
t.Fatalf("erwartet genau die abgelaufene generation %q entfernt, habe %v", expired, removed)
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(backupDir, recent)); err != nil {
|
||||
t.Fatalf("juengste generation faelschlich entfernt: %v", err)
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(backupDir, expired)); !os.IsNotExist(err) {
|
||||
t.Fatal("abgelaufene generation wurde nicht tatsaechlich vom dateisystem entfernt")
|
||||
}
|
||||
}
|
||||
@@ -54,3 +54,23 @@ func Rotate(backupDir string, keep int) (removed []string, err error) {
|
||||
}
|
||||
return removed, nil
|
||||
}
|
||||
|
||||
// PruneRotate wendet BAK-07s gestaffelte RetentionPolicy (PruneTiered,
|
||||
// siehe retention.go) tatsächlich an — entfernt alle nicht mehr zu
|
||||
// behaltenden Generationsverzeichnisse. Automatisierte Löschung nach
|
||||
// Ablauf der Frist (Akzeptanzkriterium 2), unabhängig von RET-02s
|
||||
// Dokumenten-Retention.
|
||||
func PruneRotate(backupDir string, policy RetentionPolicy) (removed []string, err error) {
|
||||
generations, err := ListGenerations(backupDir)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
_, toRemove := PruneTiered(generations, policy)
|
||||
for _, gen := range toRemove {
|
||||
if err := os.RemoveAll(filepath.Join(backupDir, gen)); err != nil {
|
||||
return removed, fmt.Errorf("backup: generation %q entfernen: %w", gen, err)
|
||||
}
|
||||
removed = append(removed, gen)
|
||||
}
|
||||
return removed, nil
|
||||
}
|
||||
|
||||
@@ -13,13 +13,23 @@ import (
|
||||
// (Akzeptanzkriterium 2: Verifikation, nicht nur Erstellungs-Prüfung).
|
||||
var ErrCorrupted = fmt.Errorf("backup: sicherungsdatei ist beschaedigt oder unvollstaendig")
|
||||
|
||||
// Verify prüft, dass base.tar.gz im gegebenen Sicherungsverzeichnis
|
||||
// vollständig lesbar ist — öffnet gzip- UND tar-Stream und liest JEDEN
|
||||
// Eintrag bis zum Ende durch (nicht nur die Kopfdaten), damit ein
|
||||
// abgeschnittener oder mit kaputten Bytes überschriebener Inhalt
|
||||
// zuverlässig auffällt, nicht nur ein defekter Tar-Header.
|
||||
// Verify prüft, dass base.tar.gz UND pg_wal.tar.gz im gegebenen
|
||||
// Sicherungsverzeichnis vollständig lesbar sind — öffnet gzip- UND
|
||||
// tar-Stream und liest JEDEN Eintrag bis zum Ende durch (nicht nur die
|
||||
// Kopfdaten), damit ein abgeschnittener oder mit kaputten Bytes
|
||||
// überschriebener Inhalt zuverlässig auffällt, nicht nur ein defekter
|
||||
// Tar-Header. pg_wal.tar.gz wird geprüft, weil ohne intaktes WAL kein
|
||||
// crash-konsistenter Restore möglich ist (siehe Restore/WalTarGzFile) —
|
||||
// eine Sicherung mit beschädigtem WAL-Archiv wäre sonst unbemerkt
|
||||
// unbrauchbar.
|
||||
func Verify(backupDir string) error {
|
||||
path := filepath.Join(backupDir, BaseTarGzFile)
|
||||
if err := verifyTarGz(filepath.Join(backupDir, BaseTarGzFile)); err != nil {
|
||||
return err
|
||||
}
|
||||
return verifyTarGz(filepath.Join(backupDir, WalTarGzFile))
|
||||
}
|
||||
|
||||
func verifyTarGz(path string) error {
|
||||
f, err := os.Open(path)
|
||||
if err != nil {
|
||||
return fmt.Errorf("%w: %s nicht lesbar: %v", ErrCorrupted, path, err)
|
||||
@@ -28,7 +38,7 @@ func Verify(backupDir string) error {
|
||||
|
||||
gz, err := gzip.NewReader(f)
|
||||
if err != nil {
|
||||
return fmt.Errorf("%w: gzip-header ungueltig: %v", ErrCorrupted, err)
|
||||
return fmt.Errorf("%w: gzip-header von %s ungueltig: %v", ErrCorrupted, path, err)
|
||||
}
|
||||
defer func() { _ = gz.Close() }()
|
||||
|
||||
@@ -40,15 +50,69 @@ func Verify(backupDir string) error {
|
||||
break
|
||||
}
|
||||
if err != nil {
|
||||
return fmt.Errorf("%w: tar-eintrag ungueltig: %v", ErrCorrupted, err)
|
||||
return fmt.Errorf("%w: tar-eintrag in %s ungueltig: %v", ErrCorrupted, path, err)
|
||||
}
|
||||
if _, err := io.Copy(io.Discard, tr); err != nil {
|
||||
return fmt.Errorf("%w: inhalt von %q nicht vollstaendig lesbar: %v", ErrCorrupted, hdr.Name, err)
|
||||
return fmt.Errorf("%w: inhalt von %q in %s nicht vollstaendig lesbar: %v", ErrCorrupted, hdr.Name, path, err)
|
||||
}
|
||||
entries++
|
||||
}
|
||||
if entries == 0 {
|
||||
return fmt.Errorf("%w: archiv enthaelt keine eintraege", ErrCorrupted)
|
||||
return fmt.Errorf("%w: %s enthaelt keine eintraege", ErrCorrupted, path)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// extractTarGz entpackt tarGzPath vollständig nach destDir — genutzt von
|
||||
// Restore, um die TAR+GZIP-Sicherungsstufen (siehe Verify) in das
|
||||
// PLAIN-Format zu überführen, das pg_combinebackup als Eingabe erwartet.
|
||||
func extractTarGz(tarGzPath, destDir string) error {
|
||||
f, err := os.Open(tarGzPath)
|
||||
if err != nil {
|
||||
return fmt.Errorf("%s öffnen: %w", tarGzPath, err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
gz, err := gzip.NewReader(f)
|
||||
if err != nil {
|
||||
return fmt.Errorf("gzip-header ungueltig: %w", err)
|
||||
}
|
||||
defer func() { _ = gz.Close() }()
|
||||
|
||||
tr := tar.NewReader(gz)
|
||||
for {
|
||||
hdr, err := tr.Next()
|
||||
if err == io.EOF {
|
||||
break
|
||||
}
|
||||
if err != nil {
|
||||
return fmt.Errorf("tar-eintrag lesen: %w", err)
|
||||
}
|
||||
target := filepath.Join(destDir, filepath.Clean(hdr.Name))
|
||||
switch hdr.Typeflag {
|
||||
case tar.TypeDir:
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
return fmt.Errorf("verzeichnis %q anlegen: %w", target, err)
|
||||
}
|
||||
case tar.TypeReg:
|
||||
if err := os.MkdirAll(filepath.Dir(target), 0o750); err != nil {
|
||||
return fmt.Errorf("übergeordnetes verzeichnis von %q anlegen: %w", target, err)
|
||||
}
|
||||
out, err := os.OpenFile(target, os.O_CREATE|os.O_WRONLY|os.O_TRUNC, os.FileMode(hdr.Mode))
|
||||
if err != nil {
|
||||
return fmt.Errorf("datei %q anlegen: %w", target, err)
|
||||
}
|
||||
if _, err := io.Copy(out, tr); err != nil {
|
||||
_ = out.Close()
|
||||
return fmt.Errorf("datei %q schreiben: %w", target, err)
|
||||
}
|
||||
if err := out.Close(); err != nil {
|
||||
return fmt.Errorf("datei %q schliessen: %w", target, err)
|
||||
}
|
||||
default:
|
||||
// Symlinks/Sonderdateien: pg_basebackup-Archive enthalten
|
||||
// praktisch keine, übersprungen statt Restore abzubrechen.
|
||||
}
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
@@ -137,6 +137,53 @@ func Forget(ctx context.Context, cfg Config, keepLast int) error {
|
||||
return nil
|
||||
}
|
||||
|
||||
// RetentionPolicy ist eine gestaffelte Aufbewahrungsfrist nach
|
||||
// restic/Borg-Vorbild (BAK-07, unabhängig von RET-02s Dokumenten-
|
||||
// Retention): täglich/wöchentlich/monatlich je eine konfigurierbare
|
||||
// Anzahl Snapshots behalten, statt einer flachen "letzte N"-Regel
|
||||
// (Forget/keepLast) oder hart codierter Staffelung. Ein Feldwert 0
|
||||
// bedeutet "diese Stufe nicht anwenden" (restics eigene Konvention bei
|
||||
// `--keep-*`).
|
||||
type RetentionPolicy struct {
|
||||
KeepDaily int
|
||||
KeepWeekly int
|
||||
KeepMonthly int
|
||||
}
|
||||
|
||||
// PruneTiered wendet policy über restics NATIVE `--keep-daily`/
|
||||
// `--keep-weekly`/`--keep-monthly`-Staffelung an (kein Eigenbau der
|
||||
// Bucket-Logik — restic beherrscht das bereits robust) und gibt den
|
||||
// belegten Speicherplatz nicht mehr referenzierter Daten frei
|
||||
// (`--prune`). Snapshots, die keiner Stufe zugeordnet werden, entfallen
|
||||
// automatisch — restics übliche GFS-Semantik.
|
||||
func PruneTiered(ctx context.Context, cfg Config, policy RetentionPolicy) error {
|
||||
args := []string{"forget", "--prune"}
|
||||
if policy.KeepDaily > 0 {
|
||||
args = append(args, "--keep-daily", fmt.Sprintf("%d", policy.KeepDaily))
|
||||
}
|
||||
if policy.KeepWeekly > 0 {
|
||||
args = append(args, "--keep-weekly", fmt.Sprintf("%d", policy.KeepWeekly))
|
||||
}
|
||||
if policy.KeepMonthly > 0 {
|
||||
args = append(args, "--keep-monthly", fmt.Sprintf("%d", policy.KeepMonthly))
|
||||
}
|
||||
if _, err := run(ctx, cfg, args...); err != nil {
|
||||
return fmt.Errorf("objectbackup: gestaffelte rotation: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Restore stellt snapshotID nach targetDir wieder her (`restic restore`).
|
||||
// targetDir muss bereits existieren; Atomarität gegenüber einem eventuell
|
||||
// nicht-leeren ENDZIEL ist Aufgabe von internal/restore, nicht dieser
|
||||
// Funktion (dieselbe Aufgabenteilung wie backup.Restore).
|
||||
func Restore(ctx context.Context, cfg Config, snapshotID, targetDir string) error {
|
||||
if _, err := run(ctx, cfg, "restore", snapshotID, "--target", targetDir); err != nil {
|
||||
return fmt.Errorf("objectbackup: wiederherstellung: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
type snapshotEntry struct {
|
||||
ShortID string `json:"short_id"`
|
||||
}
|
||||
|
||||
@@ -0,0 +1,41 @@
|
||||
package objectbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// TestRestore_RecoversRealContentFromSnapshot ist Pruefung 1 fuer BAK-03
|
||||
// (Objekt-Storage-Teil): Restore auf leerem Zielverzeichnis vollstaendig
|
||||
// erfolgreich, real gegen restic geprueft, Dateiinhalt tatsaechlich
|
||||
// verglichen (kein Bloss-Existenz-Check).
|
||||
func TestRestore_RecoversRealContentFromSnapshot(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
ctx := context.Background()
|
||||
|
||||
sourceDir := t.TempDir()
|
||||
content := []byte("original objektinhalt fuer restore-test")
|
||||
if err := os.WriteFile(filepath.Join(sourceDir, "objekt.txt"), content, 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
summary, err := Backup(ctx, cfg, sourceDir)
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
|
||||
targetDir := t.TempDir()
|
||||
if err := Restore(ctx, cfg, summary.SnapshotID, targetDir); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
|
||||
restoredPath := filepath.Join(targetDir, sourceDir, "objekt.txt")
|
||||
got, err := os.ReadFile(restoredPath)
|
||||
if err != nil {
|
||||
t.Fatalf("wiederhergestellte datei lesen (%s): %v", restoredPath, err)
|
||||
}
|
||||
if string(got) != string(content) {
|
||||
t.Fatalf("wiederhergestellter inhalt = %q, want %q", got, content)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,125 @@
|
||||
package objectbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/json"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// backupAt erstellt einen Snapshot mit ERZWUNGENEM Zeitstempel
|
||||
// (restics `backup --time`) - so lassen sich mehrere Altersstufen real
|
||||
// simulieren, ohne tatsaechlich tagelang zu warten.
|
||||
func backupAt(t *testing.T, cfg Config, sourceDir string, at time.Time) {
|
||||
t.Helper()
|
||||
// restics --time erwartet SEIN EIGENES Format ("2006-01-02 15:04:05"),
|
||||
// nicht RFC3339 - real erst hier festgestellt (restic verweigert
|
||||
// RFC3339 mit einem Parse-Fehler).
|
||||
output, err := run(context.Background(), cfg, "backup", sourceDir, "--time", at.Format("2006-01-02 15:04:05"), "--json")
|
||||
if err != nil {
|
||||
t.Fatalf("backup (zeitstempel %s): %v (ausgabe: %s)", at, err, output)
|
||||
}
|
||||
}
|
||||
|
||||
// TestPruneTiered_KeepsCorrectStaggering_RealSnapshots ist Pruefung 1
|
||||
// fuer den Objekt-Storage-Teil: reale, gestaffelt datierte Snapshots,
|
||||
// restics eigene Staffelung liefert die erwartete Anzahl verbleibender
|
||||
// Snapshots.
|
||||
func TestPruneTiered_KeepsCorrectStaggering_RealSnapshots(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
sourceDir := t.TempDir()
|
||||
writeFile(t, sourceDir, "datei.txt", "inhalt")
|
||||
|
||||
now := time.Now().UTC()
|
||||
for i := 0; i < 10; i++ {
|
||||
backupAt(t, cfg, sourceDir, now.Add(-time.Duration(i)*24*time.Hour))
|
||||
}
|
||||
if got, err := SnapshotCount(context.Background(), cfg); err != nil || got != 10 {
|
||||
t.Fatalf("erwartet 10 snapshots vor dem prune, habe %d (err=%v)", got, err)
|
||||
}
|
||||
|
||||
if err := PruneTiered(context.Background(), cfg, RetentionPolicy{KeepDaily: 3}); err != nil {
|
||||
t.Fatalf("prunetiered: %v", err)
|
||||
}
|
||||
|
||||
got, err := SnapshotCount(context.Background(), cfg)
|
||||
if err != nil {
|
||||
t.Fatalf("snapshotcount: %v", err)
|
||||
}
|
||||
if got != 3 {
|
||||
t.Fatalf("erwartet 3 verbleibende snapshots nach KeepDaily=3, habe %d", got)
|
||||
}
|
||||
}
|
||||
|
||||
// TestPruneTiered_KeptSnapshotStillFullyRestorable ist der reale Beweis
|
||||
// fuer Akzeptanzkriterium 3 (Pruefung 3, Legal-Hold-Analog): Pruning
|
||||
// aelterer Snapshots darf niemals Daten beschaedigen, die ein
|
||||
// VERBLEIBENDER (aktueller) Snapshot noch braucht - genau die
|
||||
// Eigenschaft, die verhindert, dass Pruning mit einer laufenden
|
||||
// Dokumenten-Aufbewahrungssperre kollidiert: solange das Dokument in
|
||||
// einem behaltenen Snapshot steckt, bleibt es nach dem Pruning
|
||||
// vollstaendig wiederherstellbar.
|
||||
func TestPruneTiered_KeptSnapshotStillFullyRestorable(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
sourceDir := t.TempDir()
|
||||
content := "unveraendertes dokument, muss nach dem pruning vollstaendig lesbar bleiben"
|
||||
writeFile(t, sourceDir, "gehaltenes-dokument.txt", content)
|
||||
|
||||
now := time.Now().UTC()
|
||||
// mehrere aeltere snapshots desselben unveraenderten inhalts (dedupliziert)
|
||||
for i := 5; i >= 1; i-- {
|
||||
backupAt(t, cfg, sourceDir, now.Add(-time.Duration(i)*24*time.Hour))
|
||||
}
|
||||
// EIN aktueller, zu behaltender snapshot
|
||||
backupAt(t, cfg, sourceDir, now)
|
||||
|
||||
// erwarte 5 aeltere zu entfernen, den juengsten zu behalten
|
||||
if err := PruneTiered(context.Background(), cfg, RetentionPolicy{KeepDaily: 1}); err != nil {
|
||||
t.Fatalf("prunetiered: %v", err)
|
||||
}
|
||||
remaining, err := SnapshotCount(context.Background(), cfg)
|
||||
if err != nil {
|
||||
t.Fatalf("snapshotcount: %v", err)
|
||||
}
|
||||
if remaining != 1 {
|
||||
t.Fatalf("erwartet 1 verbleibenden snapshot, habe %d", remaining)
|
||||
}
|
||||
|
||||
latestID := latestSnapshotShortID(t, cfg)
|
||||
targetDir := t.TempDir()
|
||||
if err := Restore(context.Background(), cfg, latestID, targetDir); err != nil {
|
||||
t.Fatalf("restore nach pruning: %v", err)
|
||||
}
|
||||
got, err := os.ReadFile(filepath.Join(targetDir, sourceDir, "gehaltenes-dokument.txt"))
|
||||
if err != nil {
|
||||
t.Fatalf("wiederhergestelltes dokument lesen: %v", err)
|
||||
}
|
||||
if string(got) != content {
|
||||
t.Fatalf("dokumentinhalt nach pruning beschaedigt: %q, want %q", got, content)
|
||||
}
|
||||
|
||||
// Zusaetzlich: restics eigene Integritaetspruefung bestaetigt, dass
|
||||
// das Pruning kein von behaltenen Snapshots benoetigtes Datenblock
|
||||
// entfernt hat.
|
||||
if err := Check(context.Background(), cfg, true); err != nil {
|
||||
t.Fatalf("check nach pruning: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
func latestSnapshotShortID(t *testing.T, cfg Config) string {
|
||||
t.Helper()
|
||||
output, err := run(context.Background(), cfg, "snapshots", "--json")
|
||||
if err != nil {
|
||||
t.Fatalf("snapshots: %v", err)
|
||||
}
|
||||
var snapshots []snapshotEntry
|
||||
if err := json.Unmarshal(output, &snapshots); err != nil {
|
||||
t.Fatalf("snapshot-liste dekodieren: %v", err)
|
||||
}
|
||||
if len(snapshots) == 0 {
|
||||
t.Fatal("keine snapshots vorhanden")
|
||||
}
|
||||
return snapshots[len(snapshots)-1].ShortID
|
||||
}
|
||||
@@ -0,0 +1,133 @@
|
||||
// Package restore implementiert BAK-03: dokumentiertes, wiederholbares
|
||||
// Restore-Verfahren für Datenbank (BAK-01) und Objekt-Storage (BAK-02).
|
||||
// Enthält NUR die gemeinsame Ablauflogik (Atomarität über Temp-Verzeichnis,
|
||||
// Protokollierung) — die eigentliche Wiederherstellung bleibt in den
|
||||
// jeweiligen Paketen (backup.Restore, objectbackup.Restore), damit
|
||||
// internal/restore nicht weiß, WIE eine Sicherung gelesen wird, nur WANN
|
||||
// und WIE SICHER sie an ihren Zielort darf.
|
||||
package restore
|
||||
|
||||
import (
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Kind unterscheidet die beiden Restore-Arten im Protokoll.
|
||||
type Kind string
|
||||
|
||||
const (
|
||||
KindDatabase Kind = "database"
|
||||
KindObjects Kind = "objects"
|
||||
)
|
||||
|
||||
// LogEntry ist EIN Protokolleintrag (Akzeptanzkriterium 3: Quelle,
|
||||
// Zeitpunkt, Ergebnis).
|
||||
type LogEntry struct {
|
||||
Timestamp time.Time `json:"timestamp"`
|
||||
Kind Kind `json:"kind"`
|
||||
Source string `json:"source"` // Generation-ID oder Snapshot-ID
|
||||
Target string `json:"target"`
|
||||
Result string `json:"result"` // "ok", "abgebrochen: ...", "fehlgeschlagen: ..."
|
||||
}
|
||||
|
||||
// ErrTargetNotEmpty wird zurückgegeben, wenn targetDir bereits Inhalt hat
|
||||
// und force nicht gesetzt ist — Akzeptanzkriterium 2: bestehender Inhalt
|
||||
// bleibt unangetastet, solange der Vorgang nicht bestätigt wird.
|
||||
var ErrTargetNotEmpty = fmt.Errorf("restore: zielverzeichnis ist nicht leer, restore ohne bestätigung (force) abgebrochen")
|
||||
|
||||
// AtomicRestore führt restoreFn gegen ein FRISCHES temporäres Verzeichnis
|
||||
// aus (niemals direkt gegen target) und übernimmt es erst bei Erfolg —
|
||||
// entweder wenn target leer ist, oder wenn force=true (bewusste
|
||||
// Bestätigung, bestehenden Inhalt zu überschreiben). Bei jedem Fehler
|
||||
// oder abgelehnter Bestätigung bleibt target garantiert unverändert
|
||||
// (Akzeptanzkriterium 2), das temporäre Verzeichnis wird aufgeräumt.
|
||||
// Jeder Aufruf – erfolgreich oder nicht – erzeugt genau einen
|
||||
// Protokolleintrag in logPath (Akzeptanzkriterium 3).
|
||||
func AtomicRestore(kind Kind, source, target string, force bool, logPath string, restoreFn func(tempDir string) error) (LogEntry, error) {
|
||||
entry := LogEntry{Timestamp: time.Now().UTC(), Kind: kind, Source: source, Target: target}
|
||||
|
||||
empty, err := dirIsEmptyOrMissing(target)
|
||||
if err != nil {
|
||||
entry.Result = "fehlgeschlagen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, err
|
||||
}
|
||||
if !empty && !force {
|
||||
entry.Result = "abgebrochen: " + ErrTargetNotEmpty.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, ErrTargetNotEmpty
|
||||
}
|
||||
|
||||
parent := filepath.Dir(filepath.Clean(target))
|
||||
tempDir, err := os.MkdirTemp(parent, ".restore-tmp-*")
|
||||
if err != nil {
|
||||
entry.Result = "fehlgeschlagen: temp-verzeichnis anlegen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: temp-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(tempDir) }() // no-op nach erfolgreichem Rename (Verzeichnis existiert dann nicht mehr)
|
||||
|
||||
if err := restoreFn(tempDir); err != nil {
|
||||
entry.Result = "fehlgeschlagen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: wiederherstellung: %w", err)
|
||||
}
|
||||
|
||||
if !empty {
|
||||
// force=true, bewusste Bestätigung: alter Inhalt wird ERST JETZT
|
||||
// entfernt, nachdem restoreFn bereits erfolgreich in tempDir
|
||||
// abgeschlossen hat — ein Fehlschlag oben hätte target nie berührt.
|
||||
if err := os.RemoveAll(target); err != nil {
|
||||
entry.Result = "fehlgeschlagen: altes ziel entfernen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: altes ziel entfernen: %w", err)
|
||||
}
|
||||
} else if err := os.MkdirAll(parent, 0o750); err != nil {
|
||||
entry.Result = "fehlgeschlagen: übergeordnetes verzeichnis anlegen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: übergeordnetes verzeichnis anlegen: %w", err)
|
||||
}
|
||||
|
||||
if err := os.Rename(tempDir, target); err != nil {
|
||||
entry.Result = "fehlgeschlagen: umbenennen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: temp-verzeichnis nach ziel umbenennen: %w", err)
|
||||
}
|
||||
|
||||
entry.Result = "ok"
|
||||
if err := appendLog(logPath, entry); err != nil {
|
||||
return entry, fmt.Errorf("restore: protokoll schreiben: %w", err)
|
||||
}
|
||||
return entry, nil
|
||||
}
|
||||
|
||||
func dirIsEmptyOrMissing(dir string) (bool, error) {
|
||||
entries, err := os.ReadDir(dir)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return true, nil
|
||||
}
|
||||
return false, fmt.Errorf("zielverzeichnis lesen: %w", err)
|
||||
}
|
||||
return len(entries) == 0, nil
|
||||
}
|
||||
|
||||
func appendLog(logPath string, entry LogEntry) error {
|
||||
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
|
||||
if err != nil {
|
||||
return fmt.Errorf("protokolldatei öffnen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
line, err := json.Marshal(entry)
|
||||
if err != nil {
|
||||
return fmt.Errorf("protokolleintrag kodieren: %w", err)
|
||||
}
|
||||
if _, err := f.Write(append(line, '\n')); err != nil {
|
||||
return fmt.Errorf("protokolleintrag schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
@@ -0,0 +1,181 @@
|
||||
package restore
|
||||
|
||||
import (
|
||||
"encoding/json"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
)
|
||||
|
||||
func readLog(t *testing.T, path string) []LogEntry {
|
||||
t.Helper()
|
||||
data, err := os.ReadFile(path)
|
||||
if err != nil {
|
||||
t.Fatalf("protokolldatei lesen: %v", err)
|
||||
}
|
||||
var entries []LogEntry
|
||||
for _, line := range splitLines(data) {
|
||||
if len(line) == 0 {
|
||||
continue
|
||||
}
|
||||
var e LogEntry
|
||||
if err := json.Unmarshal(line, &e); err != nil {
|
||||
t.Fatalf("protokollzeile dekodieren: %v (%s)", err, line)
|
||||
}
|
||||
entries = append(entries, e)
|
||||
}
|
||||
return entries
|
||||
}
|
||||
|
||||
func splitLines(data []byte) [][]byte {
|
||||
var out [][]byte
|
||||
start := 0
|
||||
for i, b := range data {
|
||||
if b == '\n' {
|
||||
out = append(out, data[start:i])
|
||||
start = i + 1
|
||||
}
|
||||
}
|
||||
return out
|
||||
}
|
||||
|
||||
// TestAtomicRestore_EmptyTarget_Succeeds ist Pruefung 1: Restore auf
|
||||
// leerem (nicht vorhandenem) Ziel vollstaendig erfolgreich.
|
||||
func TestAtomicRestore_EmptyTarget_Succeeds(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
|
||||
entry, err := AtomicRestore(KindDatabase, "gen-1", target, false, logPath, func(tempDir string) error {
|
||||
return os.WriteFile(filepath.Join(tempDir, "marker"), []byte("wiederhergestellt"), 0o600)
|
||||
})
|
||||
if err != nil {
|
||||
t.Fatalf("atomicRestore: %v", err)
|
||||
}
|
||||
if entry.Result != "ok" {
|
||||
t.Fatalf("result = %q, want ok", entry.Result)
|
||||
}
|
||||
content, err := os.ReadFile(filepath.Join(target, "marker"))
|
||||
if err != nil || string(content) != "wiederhergestellt" {
|
||||
t.Fatalf("ziel nicht korrekt befuellt: %v %q", err, content)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_NonEmptyTargetWithoutForce_LeavesOriginalUntouched ist
|
||||
// Pruefung 2: Restore auf nicht-leeres Zielverzeichnis laesst bei Abbruch
|
||||
// (keine Bestaetigung) den urspruenglichen Inhalt unveraendert.
|
||||
func TestAtomicRestore_NonEmptyTargetWithoutForce_LeavesOriginalUntouched(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(target, "bestehend"), []byte("original"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
restoreFnCalled := false
|
||||
_, err := AtomicRestore(KindObjects, "snap-1", target, false, logPath, func(tempDir string) error {
|
||||
restoreFnCalled = true
|
||||
return nil
|
||||
})
|
||||
if err != ErrTargetNotEmpty {
|
||||
t.Fatalf("erwartet ErrTargetNotEmpty, habe: %v", err)
|
||||
}
|
||||
if restoreFnCalled {
|
||||
t.Fatal("restoreFn haette bei nicht-leerem ziel ohne force NIE aufgerufen werden duerfen")
|
||||
}
|
||||
content, err := os.ReadFile(filepath.Join(target, "bestehend"))
|
||||
if err != nil || string(content) != "original" {
|
||||
t.Fatalf("urspruenglicher inhalt veraendert: %v %q", err, content)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_FailedRestoreFn_LeavesTargetUntouched ist Nachweis,
|
||||
// dass ein Fehler WAEHREND der Wiederherstellung (in tempDir) das
|
||||
// bestehende Ziel nicht beschaedigt, weil erst nach Erfolg umbenannt wird.
|
||||
func TestAtomicRestore_FailedRestoreFn_LeavesTargetUntouched(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(target, "bestehend"), []byte("original"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
_, err := AtomicRestore(KindDatabase, "gen-2", target, true, logPath, func(tempDir string) error {
|
||||
return os.ErrInvalid // simuliert fehlgeschlagene wiederherstellung
|
||||
})
|
||||
if err == nil {
|
||||
t.Fatal("erwartet fehler")
|
||||
}
|
||||
content, err := os.ReadFile(filepath.Join(target, "bestehend"))
|
||||
if err != nil || string(content) != "original" {
|
||||
t.Fatalf("ziel bei fehlgeschlagenem restoreFn veraendert: %v %q", err, content)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_ForceOverwritesNonEmptyTarget ist Nachweis, dass eine
|
||||
// BEWUSSTE Bestaetigung (force) bestehenden Inhalt ersetzen darf.
|
||||
func TestAtomicRestore_ForceOverwritesNonEmptyTarget(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(target, "alt"), []byte("alt"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
_, err := AtomicRestore(KindObjects, "snap-2", target, true, logPath, func(tempDir string) error {
|
||||
return os.WriteFile(filepath.Join(tempDir, "neu"), []byte("neu"), 0o600)
|
||||
})
|
||||
if err != nil {
|
||||
t.Fatalf("atomicRestore mit force: %v", err)
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(target, "alt")); !os.IsNotExist(err) {
|
||||
t.Fatal("alter inhalt haette nach force-restore ersetzt sein muessen")
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(target, "neu")); err != nil {
|
||||
t.Fatalf("neuer inhalt fehlt: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_LogsCompleteEntry ist Pruefung 3: Protokolleintrag
|
||||
// ist vollstaendig und nachvollziehbar (Quelle, Zeitpunkt, Ergebnis) -
|
||||
// sowohl fuer Erfolg als auch fuer Abbruch, in derselben Datei.
|
||||
func TestAtomicRestore_LogsCompleteEntry(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
|
||||
okTarget := filepath.Join(root, "ok-ziel")
|
||||
if _, err := AtomicRestore(KindDatabase, "gen-3", okTarget, false, logPath, func(tempDir string) error {
|
||||
return os.WriteFile(filepath.Join(tempDir, "x"), []byte("x"), 0o600)
|
||||
}); err != nil {
|
||||
t.Fatalf("erfolgreicher restore: %v", err)
|
||||
}
|
||||
|
||||
blockedTarget := filepath.Join(root, "blockiert-ziel")
|
||||
if err := os.MkdirAll(blockedTarget, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(blockedTarget, "bestehend"), []byte("y"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
_, _ = AtomicRestore(KindObjects, "snap-3", blockedTarget, false, logPath, func(tempDir string) error { return nil })
|
||||
|
||||
entries := readLog(t, logPath)
|
||||
if len(entries) != 2 {
|
||||
t.Fatalf("erwartet 2 protokolleintraege, habe %d: %+v", len(entries), entries)
|
||||
}
|
||||
if entries[0].Source != "gen-3" || entries[0].Kind != KindDatabase || entries[0].Result != "ok" || entries[0].Timestamp.IsZero() {
|
||||
t.Fatalf("erster eintrag unvollstaendig: %+v", entries[0])
|
||||
}
|
||||
if entries[1].Source != "snap-3" || entries[1].Kind != KindObjects || entries[1].Result == "" || entries[1].Timestamp.IsZero() {
|
||||
t.Fatalf("zweiter eintrag unvollstaendig: %+v", entries[1])
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,61 @@
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"bufio"
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
)
|
||||
|
||||
// AppendHistory hängt result an die JSONL-Protokolldatei an
|
||||
// (Akzeptanzkriterium 2/Pflichtprüfung 3: Historie zeigt mehrere
|
||||
// zurückliegende Testläufe nachvollziehbar an — append-only, nichts wird
|
||||
// überschrieben).
|
||||
func AppendHistory(logPath string, result Result) error {
|
||||
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
|
||||
if err != nil {
|
||||
return fmt.Errorf("restoretest: protokolldatei öffnen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
line, err := json.Marshal(result)
|
||||
if err != nil {
|
||||
return fmt.Errorf("restoretest: ergebnis kodieren: %w", err)
|
||||
}
|
||||
if _, err := f.Write(append(line, '\n')); err != nil {
|
||||
return fmt.Errorf("restoretest: ergebnis schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// ReadHistory liest alle bisherigen Testlauf-Ergebnisse — Nachweis der
|
||||
// Nachvollziehbarkeit über mehrere Läufe hinweg.
|
||||
func ReadHistory(logPath string) ([]Result, error) {
|
||||
f, err := os.Open(logPath)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return nil, nil
|
||||
}
|
||||
return nil, fmt.Errorf("restoretest: protokolldatei lesen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
var results []Result
|
||||
scanner := bufio.NewScanner(f)
|
||||
scanner.Buffer(make([]byte, 0, 64*1024), 1024*1024)
|
||||
for scanner.Scan() {
|
||||
line := scanner.Bytes()
|
||||
if len(line) == 0 {
|
||||
continue
|
||||
}
|
||||
var r Result
|
||||
if err := json.Unmarshal(line, &r); err != nil {
|
||||
return nil, fmt.Errorf("restoretest: protokollzeile dekodieren: %w", err)
|
||||
}
|
||||
results = append(results, r)
|
||||
}
|
||||
if err := scanner.Err(); err != nil {
|
||||
return nil, fmt.Errorf("restoretest: protokolldatei durchlaufen: %w", err)
|
||||
}
|
||||
return results, nil
|
||||
}
|
||||
@@ -0,0 +1,49 @@
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestHistory_ShowsMultiplePastRunsInOrder ist Pruefung 3: Protokoll-
|
||||
// historie zeigt mehrere zurueckliegende Testlaeufe nachvollziehbar an.
|
||||
func TestHistory_ShowsMultiplePastRunsInOrder(t *testing.T) {
|
||||
logPath := filepath.Join(t.TempDir(), "restoretest.log")
|
||||
|
||||
results := []Result{
|
||||
{Timestamp: time.Now().UTC(), Kind: KindDatabase, Source: "gen-1", Success: true, Detail: "ok"},
|
||||
{Timestamp: time.Now().UTC().Add(time.Hour), Kind: KindObjects, Source: "snap-1", Success: false, Detail: "kaputt"},
|
||||
{Timestamp: time.Now().UTC().Add(2 * time.Hour), Kind: KindDatabase, Source: "gen-2", Success: true, Detail: "ok"},
|
||||
}
|
||||
for _, r := range results {
|
||||
if err := AppendHistory(logPath, r); err != nil {
|
||||
t.Fatalf("appendHistory: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
got, err := ReadHistory(logPath)
|
||||
if err != nil {
|
||||
t.Fatalf("readHistory: %v", err)
|
||||
}
|
||||
if len(got) != len(results) {
|
||||
t.Fatalf("erwartet %d eintraege, habe %d", len(results), len(got))
|
||||
}
|
||||
for i, want := range results {
|
||||
if got[i].Source != want.Source || got[i].Success != want.Success || got[i].Kind != want.Kind {
|
||||
t.Fatalf("eintrag %d = %+v, want %+v", i, got[i], want)
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
// TestReadHistory_MissingFileReturnsEmpty - noch kein Testlauf ist kein
|
||||
// Fehlerzustand.
|
||||
func TestReadHistory_MissingFileReturnsEmpty(t *testing.T) {
|
||||
got, err := ReadHistory(filepath.Join(t.TempDir(), "nicht-vorhanden.log"))
|
||||
if err != nil {
|
||||
t.Fatalf("erwartet keinen fehler, habe: %v", err)
|
||||
}
|
||||
if len(got) != 0 {
|
||||
t.Fatalf("erwartet leere historie, habe %d eintraege", len(got))
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,239 @@
|
||||
// Package restoretest implementiert BAK-06: regelmäßiger, automatisierter
|
||||
// Testlauf des BAK-03-Restore-Verfahrens gegen eine isolierte
|
||||
// Testumgebung — "Wiederherstellung ist Routine, nicht Ausnahmefall"
|
||||
// (Produkt-DNA) heißt: nicht nur Dateien vorhanden pruefen, sondern
|
||||
// tatsächlich eine funktionsfähige Instanz aus der Sicherung starten und
|
||||
// befragen, exakt wie BAK-03s eigener Prüfungsnachweis — hier als
|
||||
// Produktcode statt Testcode, damit es regelmäßig UNBEAUFSICHTIGT laufen
|
||||
// kann.
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"bytes"
|
||||
"context"
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"strings"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
)
|
||||
|
||||
// Kind unterscheidet Datenbank- und Objekt-Storage-Testlauf im Protokoll.
|
||||
type Kind string
|
||||
|
||||
const (
|
||||
KindDatabase Kind = "database"
|
||||
KindObjects Kind = "objects"
|
||||
)
|
||||
|
||||
// Result ist EIN Testlauf-Ergebnis (Akzeptanzkriterium 2: Ergebnis mit
|
||||
// Zeitstempel protokolliert).
|
||||
type Result struct {
|
||||
Timestamp time.Time `json:"timestamp"`
|
||||
Kind Kind `json:"kind"`
|
||||
Source string `json:"source"` // Generation-ID oder Snapshot-ID
|
||||
Success bool `json:"success"`
|
||||
Detail string `json:"detail"`
|
||||
}
|
||||
|
||||
// PgConfig bündelt die zusätzlich zu backup.Config nötigen Angaben für
|
||||
// den Kurzstart der Test-Instanz (eigener Port/Socket, damit die
|
||||
// Testinstanz die echte Test-Datenbank auf demselben Host nicht stört).
|
||||
type PgConfig struct {
|
||||
PgCtlPath string // Default "pg_ctl"
|
||||
PsqlPath string // Default "psql"
|
||||
TestPort string // Default "55433"
|
||||
}
|
||||
|
||||
func (c PgConfig) ctlBinary() string {
|
||||
if c.PgCtlPath != "" {
|
||||
return c.PgCtlPath
|
||||
}
|
||||
return "pg_ctl"
|
||||
}
|
||||
|
||||
func (c PgConfig) psqlBinary() string {
|
||||
if c.PsqlPath != "" {
|
||||
return c.PsqlPath
|
||||
}
|
||||
return "psql"
|
||||
}
|
||||
|
||||
func (c PgConfig) port() string {
|
||||
if c.TestPort != "" {
|
||||
return c.TestPort
|
||||
}
|
||||
return "55433"
|
||||
}
|
||||
|
||||
// RunDatabaseTest führt einen vollständigen Restore der NEUESTEN
|
||||
// Generation in ein frisches, isoliertes Testverzeichnis durch und
|
||||
// beweist Wiederherstellbarkeit, indem daraus tatsächlich eine
|
||||
// eigenständige Postgres-Instanz gestartet und per echter Verbindung
|
||||
// abgefragt wird (Akzeptanzkriterium 1) — dieselbe Prüftiefe wie BAK-03s
|
||||
// eigener Nachweis, hier als wiederholbarer Produktcode.
|
||||
func RunDatabaseTest(ctx context.Context, cfg backup.Config, pgCfg PgConfig, testRoot string) Result {
|
||||
res := Result{Timestamp: time.Now().UTC(), Kind: KindDatabase}
|
||||
|
||||
generations, err := backup.ListGenerations(cfg.BackupDir)
|
||||
if err != nil || len(generations) == 0 {
|
||||
res.Detail = fmt.Sprintf("keine sicherungsgeneration gefunden: %v", err)
|
||||
return res
|
||||
}
|
||||
genID := generations[len(generations)-1]
|
||||
res.Source = genID
|
||||
|
||||
testDir, err := os.MkdirTemp(testRoot, "restoretest-db-*")
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("testverzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(testDir) }()
|
||||
|
||||
restoreOut := filepath.Join(testDir, "pgdata")
|
||||
if err := os.MkdirAll(restoreOut, 0o700); err != nil {
|
||||
res.Detail = fmt.Sprintf("pgdata-verzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
if err := backup.Restore(ctx, cfg, genID, restoreOut); err != nil {
|
||||
res.Detail = fmt.Sprintf("restore fehlgeschlagen: %v", err)
|
||||
return res
|
||||
}
|
||||
|
||||
// Minimalkonfiguration NUR für den isolierten Kurzstart (auf diesem
|
||||
// Debian-Postgres liegen postgresql.conf/pg_hba.conf ausserhalb von
|
||||
// PGDATA, siehe BAK-03-PRUEFPROTOKOLL.md - der reale Sicherungsinhalt
|
||||
// selbst enthält sie nicht).
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "postgresql.conf"), []byte("listen_addresses = ''\n"), 0o600); err != nil {
|
||||
res.Detail = fmt.Sprintf("testkonfiguration schreiben: %v", err)
|
||||
return res
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "pg_hba.conf"), []byte("local all all trust\n"), 0o600); err != nil {
|
||||
res.Detail = fmt.Sprintf("testkonfiguration schreiben: %v", err)
|
||||
return res
|
||||
}
|
||||
|
||||
// EIGENES, kurzes Verzeichnis fuer den Unix-Socket - NICHT unter
|
||||
// testDir (Postgres begrenzt Socket-Pfade auf 107 Byte, ein tief
|
||||
// verschachtelter Testverzeichnis-Pfad reisst dieses Limit leicht).
|
||||
socketDir, err := os.MkdirTemp("", "nexarch-rt-sock-*")
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("socket-verzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(socketDir) }()
|
||||
logFile := filepath.Join(testDir, "postgres.log")
|
||||
|
||||
startCtx, cancel := context.WithTimeout(ctx, 60*time.Second)
|
||||
defer cancel()
|
||||
startCmd := exec.CommandContext(startCtx, pgCfg.ctlBinary(), "start", "-D", restoreOut, "-w", "-t", "30", "-l", logFile,
|
||||
"-o", fmt.Sprintf("-p %s -k %s -c listen_addresses=''", pgCfg.port(), socketDir))
|
||||
if err := startCmd.Run(); err != nil {
|
||||
logContent, _ := os.ReadFile(logFile)
|
||||
res.Detail = fmt.Sprintf("testinstanz starten fehlgeschlagen: %v (log: %s)", err, string(logContent))
|
||||
return res
|
||||
}
|
||||
defer func() {
|
||||
stopCmd := exec.Command(pgCfg.ctlBinary(), "stop", "-D", restoreOut, "-m", "fast")
|
||||
_ = stopCmd.Run()
|
||||
}()
|
||||
|
||||
psqlCtx, cancelPsql := context.WithTimeout(ctx, 15*time.Second)
|
||||
defer cancelPsql()
|
||||
psqlOut, err := exec.CommandContext(psqlCtx, pgCfg.psqlBinary(),
|
||||
"-h", socketDir, "-p", pgCfg.port(), "-U", cfg.User, "-d", "postgres",
|
||||
"-tAc", "SELECT 1").CombinedOutput()
|
||||
if err != nil || strings.TrimSpace(string(psqlOut)) != "1" {
|
||||
res.Detail = fmt.Sprintf("verbindung zur testinstanz fehlgeschlagen: %v (ausgabe: %s)", err, string(psqlOut))
|
||||
return res
|
||||
}
|
||||
|
||||
res.Success = true
|
||||
res.Detail = "restore und verbindungspruefung erfolgreich"
|
||||
return res
|
||||
}
|
||||
|
||||
// RunObjectTest führt einen vollständigen Restore des NEUESTEN Snapshots
|
||||
// in ein frisches, isoliertes Testverzeichnis durch — restics eigene
|
||||
// Vollständigkeitsgarantie beim Restore (bricht bei fehlenden/beschädigten
|
||||
// Blöcken ab) ist der Wiederherstellbarkeitsnachweis, zusätzlich real
|
||||
// geprüft, dass das Zielverzeichnis tatsächlich Inhalt enthält.
|
||||
func RunObjectTest(ctx context.Context, cfg objectbackup.Config, testRoot string) Result {
|
||||
res := Result{Timestamp: time.Now().UTC(), Kind: KindObjects}
|
||||
|
||||
snapshotID, err := latestSnapshotID(ctx, cfg)
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("neuesten snapshot ermitteln: %v", err)
|
||||
return res
|
||||
}
|
||||
res.Source = snapshotID
|
||||
|
||||
testDir, err := os.MkdirTemp(testRoot, "restoretest-objects-*")
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("testverzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(testDir) }()
|
||||
|
||||
if err := objectbackup.Restore(ctx, cfg, snapshotID, testDir); err != nil {
|
||||
res.Detail = fmt.Sprintf("restore fehlgeschlagen: %v", err)
|
||||
return res
|
||||
}
|
||||
|
||||
empty, err := dirIsEmpty(testDir)
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("wiederhergestelltes verzeichnis pruefen: %v", err)
|
||||
return res
|
||||
}
|
||||
if empty {
|
||||
res.Detail = "restore lief ohne fehler, aber zielverzeichnis ist leer"
|
||||
return res
|
||||
}
|
||||
|
||||
res.Success = true
|
||||
res.Detail = "restore erfolgreich, inhalt vorhanden"
|
||||
return res
|
||||
}
|
||||
|
||||
func dirIsEmpty(dir string) (bool, error) {
|
||||
entries, err := os.ReadDir(dir)
|
||||
if err != nil {
|
||||
return false, err
|
||||
}
|
||||
return len(entries) == 0, nil
|
||||
}
|
||||
|
||||
func latestSnapshotID(ctx context.Context, cfg objectbackup.Config) (string, error) {
|
||||
binary := cfg.ResticPath
|
||||
if binary == "" {
|
||||
binary = "restic"
|
||||
}
|
||||
cmd := exec.CommandContext(ctx, binary, "-r", cfg.RepoDir, "snapshots", "--json")
|
||||
cmd.Env = append(os.Environ(), "RESTIC_PASSWORD="+cfg.Password)
|
||||
var stderr bytes.Buffer
|
||||
cmd.Stderr = &stderr
|
||||
// NUR stdout, nicht CombinedOutput: restic schreibt bei fehlendem/
|
||||
// nicht beschreibbarem Cache-Verzeichnis eine Warnung nach stderr
|
||||
// (z.B. "unable to open cache: ..." - real beobachtet unter dem
|
||||
// systemd-Dienstnutzer "nexarch" ohne beschreibbares HOME), die vor
|
||||
// das JSON-Array gemischt worden waere und das Parsen bricht.
|
||||
output, err := cmd.Output()
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("restic snapshots: %w (stderr: %s)", err, stderr.String())
|
||||
}
|
||||
var snapshots []struct {
|
||||
ShortID string `json:"short_id"`
|
||||
}
|
||||
if err := json.Unmarshal(output, &snapshots); err != nil {
|
||||
return "", fmt.Errorf("snapshot-liste dekodieren: %w", err)
|
||||
}
|
||||
if len(snapshots) == 0 {
|
||||
return "", fmt.Errorf("keine snapshots vorhanden")
|
||||
}
|
||||
return snapshots[len(snapshots)-1].ShortID, nil
|
||||
}
|
||||
@@ -0,0 +1,122 @@
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
)
|
||||
|
||||
func requireDBTestConfig(t *testing.T) backup.Config {
|
||||
t.Helper()
|
||||
user := os.Getenv("TEST_BACKUP_PG_USER")
|
||||
if user == "" {
|
||||
t.Skip("TEST_BACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen")
|
||||
}
|
||||
if _, err := exec.LookPath("pg_combinebackup"); err != nil {
|
||||
t.Skip("pg_combinebackup nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
if _, err := exec.LookPath("pg_ctl"); err != nil {
|
||||
t.Skip("pg_ctl nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
return backup.Config{
|
||||
Host: envOrT("TEST_BACKUP_PG_HOST", "localhost"),
|
||||
Port: envOrT("TEST_BACKUP_PG_PORT", "5432"),
|
||||
User: user,
|
||||
Password: os.Getenv("TEST_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: t.TempDir(),
|
||||
}
|
||||
}
|
||||
|
||||
func envOrT(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
|
||||
// TestRunDatabaseTest_SucceedsAgainstRealBackup ist Pruefung 1: geplanter
|
||||
// Testlauf gegen aktuelle Sicherung erfolgreich durchgefuehrt.
|
||||
func TestRunDatabaseTest_SucceedsAgainstRealBackup(t *testing.T) {
|
||||
cfg := requireDBTestConfig(t)
|
||||
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
|
||||
defer cancel()
|
||||
|
||||
genID := backup.NewGenerationID(time.Now())
|
||||
if _, err := backup.FullBackup(ctx, cfg, genID); err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
|
||||
res := RunDatabaseTest(ctx, cfg, PgConfig{TestPort: "55434"}, t.TempDir())
|
||||
if !res.Success {
|
||||
t.Fatalf("erwartet erfolgreichen testlauf, habe: %+v", res)
|
||||
}
|
||||
if res.Source != genID {
|
||||
t.Fatalf("source = %q, want %q", res.Source, genID)
|
||||
}
|
||||
}
|
||||
|
||||
// TestRunDatabaseTest_DetectsCorruptedBackup ist Pruefung 2: absichtlich
|
||||
// beschaedigte Sicherung laesst den Testlauf sichtbar fehlschlagen.
|
||||
func TestRunDatabaseTest_DetectsCorruptedBackup(t *testing.T) {
|
||||
cfg := requireDBTestConfig(t)
|
||||
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
|
||||
defer cancel()
|
||||
|
||||
genID := backup.NewGenerationID(time.Now())
|
||||
manifest, err := backup.FullBackup(ctx, cfg, genID)
|
||||
if err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
|
||||
// Absichtliche Beschaedigung: base.tar.gz durch Muell ersetzen.
|
||||
tarPath := filepath.Join(filepath.Dir(manifest), backup.BaseTarGzFile)
|
||||
if err := os.WriteFile(tarPath, []byte("das ist kein gueltiges tar.gz"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
res := RunDatabaseTest(ctx, cfg, PgConfig{TestPort: "55435"}, t.TempDir())
|
||||
if res.Success {
|
||||
t.Fatal("erwartet fehlschlag bei beschaedigter sicherung, testlauf meldete erfolg")
|
||||
}
|
||||
if res.Detail == "" {
|
||||
t.Fatal("erwartet aussagekraeftiges detail zum fehlschlag")
|
||||
}
|
||||
}
|
||||
|
||||
func requireObjTestConfig(t *testing.T) objectbackup.Config {
|
||||
t.Helper()
|
||||
if _, err := exec.LookPath("restic"); err != nil {
|
||||
t.Skip("restic nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
cfg := objectbackup.Config{RepoDir: filepath.Join(t.TempDir(), "repo"), Password: "restoretest-passwort"}
|
||||
if err := objectbackup.InitRepo(context.Background(), cfg); err != nil {
|
||||
t.Fatalf("initrepo: %v", err)
|
||||
}
|
||||
return cfg
|
||||
}
|
||||
|
||||
// TestRunObjectTest_SucceedsAgainstRealSnapshot ist Pruefung 1 fuer den
|
||||
// Objekt-Storage-Teil.
|
||||
func TestRunObjectTest_SucceedsAgainstRealSnapshot(t *testing.T) {
|
||||
cfg := requireObjTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
sourceDir := t.TempDir()
|
||||
if err := os.WriteFile(filepath.Join(sourceDir, "datei.txt"), []byte("inhalt"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if _, err := objectbackup.Backup(ctx, cfg, sourceDir); err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
|
||||
res := RunObjectTest(ctx, cfg, t.TempDir())
|
||||
if !res.Success {
|
||||
t.Fatalf("erwartet erfolgreichen testlauf, habe: %+v", res)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,76 @@
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Operation unterscheidet Sicherung und Wiederherstellung im Protokoll.
|
||||
type Operation string
|
||||
|
||||
const (
|
||||
OpBackupDB Operation = "backup_database"
|
||||
OpRestoreDB Operation = "restore_database"
|
||||
OpBackupObj Operation = "backup_objects"
|
||||
OpRestoreObj Operation = "restore_objects"
|
||||
)
|
||||
|
||||
// LogEntry ist EIN Protokolleintrag (Akzeptanzkriterium 3: Tenant-
|
||||
// Sicherung UND -Restore vollständig protokolliert).
|
||||
type LogEntry struct {
|
||||
Timestamp time.Time `json:"timestamp"`
|
||||
Operation Operation `json:"operation"`
|
||||
TenantID string `json:"tenant_id"`
|
||||
Source string `json:"source,omitempty"` // Dump-Pfad oder Snapshot-ID
|
||||
Target string `json:"target,omitempty"` // Zieldatenbank oder Zielverzeichnis
|
||||
Result string `json:"result"` // "ok" oder Fehlertext
|
||||
}
|
||||
|
||||
// AppendLog hängt entry an die JSONL-Protokolldatei an (append-only,
|
||||
// nichts wird überschrieben).
|
||||
func AppendLog(logPath string, entry LogEntry) error {
|
||||
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: protokolldatei öffnen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
line, err := json.Marshal(entry)
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: protokolleintrag kodieren: %w", err)
|
||||
}
|
||||
if _, err := f.Write(append(line, '\n')); err != nil {
|
||||
return fmt.Errorf("tenantbackup: protokolleintrag schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// ReadLog liest die vollständige Protokollhistorie.
|
||||
func ReadLog(logPath string) ([]LogEntry, error) {
|
||||
data, err := os.ReadFile(logPath)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return nil, nil
|
||||
}
|
||||
return nil, fmt.Errorf("tenantbackup: protokolldatei lesen: %w", err)
|
||||
}
|
||||
var entries []LogEntry
|
||||
start := 0
|
||||
for i := 0; i < len(data); i++ {
|
||||
if data[i] == '\n' {
|
||||
line := data[start:i]
|
||||
start = i + 1
|
||||
if len(line) == 0 {
|
||||
continue
|
||||
}
|
||||
var e LogEntry
|
||||
if err := json.Unmarshal(line, &e); err != nil {
|
||||
return nil, fmt.Errorf("tenantbackup: protokollzeile dekodieren: %w", err)
|
||||
}
|
||||
entries = append(entries, e)
|
||||
}
|
||||
}
|
||||
return entries, nil
|
||||
}
|
||||
@@ -0,0 +1,37 @@
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestLog_BackupAndRestoreFullyLogged ist Pruefung 3: Tenant-Sicherung
|
||||
// UND -Restore vollstaendig protokolliert.
|
||||
func TestLog_BackupAndRestoreFullyLogged(t *testing.T) {
|
||||
logPath := filepath.Join(t.TempDir(), "tenantbackup.log")
|
||||
|
||||
entries := []LogEntry{
|
||||
{Timestamp: time.Now().UTC(), Operation: OpBackupDB, TenantID: "a", Source: "/x/dump.pgcustom", Result: "ok"},
|
||||
{Timestamp: time.Now().UTC(), Operation: OpRestoreDB, TenantID: "a", Source: "/x/dump.pgcustom", Target: "a_restored", Result: "ok"},
|
||||
}
|
||||
for _, e := range entries {
|
||||
if err := AppendLog(logPath, e); err != nil {
|
||||
t.Fatalf("appendlog: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
got, err := ReadLog(logPath)
|
||||
if err != nil {
|
||||
t.Fatalf("readlog: %v", err)
|
||||
}
|
||||
if len(got) != 2 {
|
||||
t.Fatalf("erwartet 2 eintraege, habe %d", len(got))
|
||||
}
|
||||
if got[0].Operation != OpBackupDB || got[1].Operation != OpRestoreDB {
|
||||
t.Fatalf("unerwartete reihenfolge/operationen: %+v", got)
|
||||
}
|
||||
if got[0].TenantID != "a" || got[1].Target != "a_restored" {
|
||||
t.Fatalf("eintraege unvollstaendig: %+v", got)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,155 @@
|
||||
// Package tenantbackup implementiert BAK-04: Sicherung und
|
||||
// Wiederherstellung der Daten EINES einzelnen Mandanten, ohne andere
|
||||
// Mandanten zu berühren.
|
||||
//
|
||||
// BEWUSST NICHT auf BAK-01/BAK-03 aufgesetzt: pg_basebackup (BAK-01)
|
||||
// sichert den GESAMTEN Postgres-Cluster — bei Modell C (TEN-01, eine
|
||||
// physisch isolierte Datenbank je Mandant) liegen ALLE Mandanten-
|
||||
// Datenbanken in genau diesem einen Cluster, ein Restore der
|
||||
// Cluster-Sicherung würde also zwangsläufig ALLE Mandanten gleichzeitig
|
||||
// überschreiben — das genaue Gegenteil von Mandanten-Isolation. BAK-04
|
||||
// braucht daher ein DATENBANK-SCHARFES logisches Verfahren (pg_dump/
|
||||
// pg_restore für genau EINE Datenbank), keine physische
|
||||
// Cluster-Sicherung. Objekt-Storage ist bereits von Haus aus pro
|
||||
// Mandant getrennt (eigener Bucket/Pfad-Root, STORAGE-KONZEPT.md
|
||||
// Abschnitt 3) — dort genügt ein restic-Repository je Mandanten-Root
|
||||
// (objectbackup-Paket direkt wiederverwendbar, ein Aufruf pro
|
||||
// Mandanten-Verzeichnis).
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
)
|
||||
|
||||
// Config enthält die Verbindungsdaten — ausschließlich über
|
||||
// Umgebungsvariablen befüllt (siehe Ticket-Abschluss-Regel).
|
||||
type Config struct {
|
||||
Host string
|
||||
Port string
|
||||
User string
|
||||
Password string
|
||||
BackupDir string
|
||||
PgDumpPath string // Default "pg_dump"
|
||||
PgRestorePath string // Default "pg_restore"
|
||||
PsqlPath string // Default "psql"
|
||||
}
|
||||
|
||||
func (c Config) dumpBinary() string {
|
||||
if c.PgDumpPath != "" {
|
||||
return c.PgDumpPath
|
||||
}
|
||||
return "pg_dump"
|
||||
}
|
||||
|
||||
func (c Config) restoreBinary() string {
|
||||
if c.PgRestorePath != "" {
|
||||
return c.PgRestorePath
|
||||
}
|
||||
return "pg_restore"
|
||||
}
|
||||
|
||||
func (c Config) psqlBinary() string {
|
||||
if c.PsqlPath != "" {
|
||||
return c.PsqlPath
|
||||
}
|
||||
return "psql"
|
||||
}
|
||||
|
||||
const DumpFile = "dump.pgcustom"
|
||||
|
||||
// Backup erstellt eine logische Sicherung GENAU EINER Mandanten-
|
||||
// Datenbank (Custom-Format, `pg_dump -Fc`) — enthält strukturell
|
||||
// ausschließlich Daten dieser einen Datenbank, andere Mandanten-
|
||||
// Datenbanken werden nie verbunden oder gelesen (Akzeptanzkriterium 1).
|
||||
func Backup(ctx context.Context, cfg Config, tenantDB, generationID string) (dumpPath string, err error) {
|
||||
dir := filepath.Join(cfg.BackupDir, tenantDB, generationID)
|
||||
if err := os.MkdirAll(dir, 0o750); err != nil {
|
||||
return "", fmt.Errorf("tenantbackup: sicherungsverzeichnis anlegen: %w", err)
|
||||
}
|
||||
dumpPath = filepath.Join(dir, DumpFile)
|
||||
|
||||
args := []string{
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
|
||||
"-Fc", "-f", dumpPath, "--no-password", tenantDB,
|
||||
}
|
||||
cmd := exec.CommandContext(ctx, cfg.dumpBinary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("tenantbackup: %s fehlgeschlagen: %w (ausgabe: %s)", cfg.dumpBinary(), err, string(output))
|
||||
}
|
||||
return dumpPath, nil
|
||||
}
|
||||
|
||||
// Verify prüft, dass dumpPath ein vollständig lesbares pg_dump-Custom-
|
||||
// Format-Archiv ist — liest die GESAMTE Inhaltsliste (`pg_restore -l`),
|
||||
// nicht nur den Dateikopf, damit ein abgeschnittenes oder beschädigtes
|
||||
// Archiv zuverlässig auffällt.
|
||||
func Verify(ctx context.Context, cfg Config, dumpPath string) error {
|
||||
cmd := exec.CommandContext(ctx, cfg.restoreBinary(), "-l", dumpPath)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: sicherung beschädigt oder unvollständig: %w (ausgabe: %s)", err, string(output))
|
||||
}
|
||||
if len(output) == 0 {
|
||||
return fmt.Errorf("tenantbackup: sicherung enthält keine inhaltsliste")
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Restore stellt dumpPath in targetDB wieder her — targetDB MUSS bereits
|
||||
// existieren und leer sein (angelegt vom Aufrufer über CreateEmptyDatabase),
|
||||
// niemals die Quelldatenbank selbst oder eine andere Mandanten-Datenbank
|
||||
// (Akzeptanzkriterium 2: Wiederherstellung verändert keine Daten anderer
|
||||
// Mandanten — strukturell garantiert, weil pg_restore ausschließlich mit
|
||||
// der EINEN übergebenen Zielverbindung spricht).
|
||||
func Restore(ctx context.Context, cfg Config, dumpPath, targetDB string) error {
|
||||
args := []string{
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
|
||||
// --no-owner: die Zieldatenbank ist eine frische, isolierte
|
||||
// Testumgebung (CreateEmptyDatabase) - der urspruengliche
|
||||
// Tenant-Eigentuemer existiert dort nicht zwangslaeufig mit
|
||||
// gleichen Rechten, und Eigentuemerschaft ist fuer den
|
||||
// Restore-Nachweis irrelevant (Standardpraxis beim Restore in
|
||||
// eine andere Umgebung).
|
||||
"--no-owner",
|
||||
"-d", targetDB, "--no-password", dumpPath,
|
||||
}
|
||||
cmd := exec.CommandContext(ctx, cfg.restoreBinary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: %s fehlgeschlagen: %w (ausgabe: %s)", cfg.restoreBinary(), err, string(output))
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// CreateEmptyDatabase legt targetDB frisch und leer an — schlägt fehl,
|
||||
// wenn targetDB bereits existiert (Isolation: ein Restore darf niemals
|
||||
// stillschweigend eine bestehende Datenbank – eigene oder fremde –
|
||||
// überschreiben, dieselbe "kein stiller Overwrite"-Disziplin wie BAK-03s
|
||||
// internal/restore).
|
||||
func CreateEmptyDatabase(ctx context.Context, cfg Config, targetDB string) error {
|
||||
cmd := exec.CommandContext(ctx, cfg.psqlBinary(),
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-c", fmt.Sprintf("CREATE DATABASE %s", quoteIdent(targetDB)))
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: zieldatenbank %q anlegen fehlgeschlagen (existiert sie bereits?): %w (ausgabe: %s)", targetDB, err, string(output))
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// quoteIdent ist eine MINIMALE Absicherung für Datenbanknamen, die
|
||||
// ausschließlich aus dem eigenen Tenant-Registry-Kontext stammen (nie aus
|
||||
// unmittelbarer Benutzereingabe an dieser Stelle) — auf doppelte
|
||||
// Anführungszeichen beschränkt, da Postgres-Identifier keine
|
||||
// eingebetteten NUL-Bytes zulassen.
|
||||
func quoteIdent(name string) string {
|
||||
return `"` + name + `"`
|
||||
}
|
||||
@@ -0,0 +1,203 @@
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"os/exec"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// requireTestConfig braucht eine EIGENE Rolle mit CREATEDB-Recht
|
||||
// (TEST_TENANTBACKUP_PG_USER), NICHT BAK-01/BAK-03s TEST_BACKUP_PG_USER
|
||||
// (nexarch_backup) - jene Rolle hat bewusst nur REPLICATION, kein
|
||||
// CREATEDB (Prinzip geringster Rechte, siehe BAK-01). BAK-04 braucht
|
||||
// stattdessen CREATEDB, um isolierte Ziel-Datenbanken anzulegen -
|
||||
// bekommt daher eine eigene, separat scharf gestellte Rolle.
|
||||
func requireTestConfig(t *testing.T) Config {
|
||||
t.Helper()
|
||||
user := os.Getenv("TEST_TENANTBACKUP_PG_USER")
|
||||
if user == "" {
|
||||
t.Skip("TEST_TENANTBACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen (braucht echte Postgres-Rolle mit CREATEDB)")
|
||||
}
|
||||
if _, err := exec.LookPath("pg_dump"); err != nil {
|
||||
t.Skip("pg_dump nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
return Config{
|
||||
Host: envOr("TEST_TENANTBACKUP_PG_HOST", "localhost"),
|
||||
Port: envOr("TEST_TENANTBACKUP_PG_PORT", "5432"),
|
||||
User: user,
|
||||
Password: os.Getenv("TEST_TENANTBACKUP_PG_PASSWORD"),
|
||||
BackupDir: t.TempDir(),
|
||||
}
|
||||
}
|
||||
|
||||
func envOr(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
|
||||
// createMarkerDB legt eine frische Testdatenbank mit genau EINER
|
||||
// Markierungszeile an (Kennzeichen für "das ist eindeutig Tenant X's
|
||||
// Datensatz") - real ueber psql, kein Mock.
|
||||
func createMarkerDB(t *testing.T, cfg Config, dbName, marker string) {
|
||||
t.Helper()
|
||||
ctx := context.Background()
|
||||
run := func(args ...string) {
|
||||
t.Helper()
|
||||
cmd := exec.CommandContext(ctx, cfg.psqlBinary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
if out, err := cmd.CombinedOutput(); err != nil {
|
||||
t.Fatalf("psql %v: %v (ausgabe: %s)", args, err, out)
|
||||
}
|
||||
}
|
||||
base := []string{"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "--no-password"}
|
||||
run(append(append([]string{}, base...), "-d", "postgres", "-c", "DROP DATABASE IF EXISTS "+quoteIdent(dbName))...)
|
||||
run(append(append([]string{}, base...), "-d", "postgres", "-c", "CREATE DATABASE "+quoteIdent(dbName))...)
|
||||
run(append(append([]string{}, base...), "-d", dbName, "-c",
|
||||
"CREATE TABLE marker (value TEXT); INSERT INTO marker VALUES ('"+marker+"')")...)
|
||||
t.Cleanup(func() {
|
||||
run(append(append([]string{}, base...), "-d", "postgres", "-c", "DROP DATABASE IF EXISTS "+quoteIdent(dbName))...)
|
||||
})
|
||||
}
|
||||
|
||||
func markerValue(t *testing.T, cfg Config, dbName string) string {
|
||||
t.Helper()
|
||||
cmd := exec.CommandContext(context.Background(), cfg.psqlBinary(),
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", dbName, "--no-password",
|
||||
"-tAc", "SELECT value FROM marker")
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
out, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
t.Fatalf("markerwert lesen: %v (ausgabe: %s)", err, out)
|
||||
}
|
||||
return trimNL(string(out))
|
||||
}
|
||||
|
||||
func trimNL(s string) string {
|
||||
for len(s) > 0 && (s[len(s)-1] == '\n' || s[len(s)-1] == '\r') {
|
||||
s = s[:len(s)-1]
|
||||
}
|
||||
return s
|
||||
}
|
||||
|
||||
func databaseExists(t *testing.T, cfg Config, dbName string) bool {
|
||||
t.Helper()
|
||||
cmd := exec.CommandContext(context.Background(), cfg.psqlBinary(),
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-tAc", "SELECT 1 FROM pg_database WHERE datname = '"+dbName+"'")
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
out, _ := cmd.CombinedOutput()
|
||||
return trimNL(string(out)) == "1"
|
||||
}
|
||||
|
||||
// TestBackupRestore_RecoversExactTenantData ist Pruefung 1 (angepasst
|
||||
// auf Akzeptanzkriterium 1): eine Sicherung von Tenant A, wiederhergestellt
|
||||
// in eine isolierte Zieldatenbank, enthaelt real Tenant As Datensatz.
|
||||
func TestBackupRestore_RecoversExactTenantData(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
tenantA := "tenantbackup_test_a"
|
||||
createMarkerDB(t, cfg, tenantA, "gehoert-zu-tenant-a")
|
||||
|
||||
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
if err := Verify(ctx, cfg, dumpPath); err != nil {
|
||||
t.Fatalf("verify: %v", err)
|
||||
}
|
||||
|
||||
target := "tenantbackup_test_a_restored"
|
||||
if databaseExists(t, cfg, target) {
|
||||
t.Fatalf("zieldatenbank %q existiert bereits vor dem test", target)
|
||||
}
|
||||
if err := CreateEmptyDatabase(ctx, cfg, target); err != nil {
|
||||
t.Fatalf("createemptydatabase: %v", err)
|
||||
}
|
||||
t.Cleanup(func() {
|
||||
cmd := exec.Command(cfg.psqlBinary(), "-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-c", "DROP DATABASE IF EXISTS "+quoteIdent(target))
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
_ = cmd.Run()
|
||||
})
|
||||
|
||||
if err := Restore(ctx, cfg, dumpPath, target); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
|
||||
got := markerValue(t, cfg, target)
|
||||
if got != "gehoert-zu-tenant-a" {
|
||||
t.Fatalf("markerwert in wiederhergestellter datenbank = %q, want %q", got, "gehoert-zu-tenant-a")
|
||||
}
|
||||
}
|
||||
|
||||
// TestRestore_DoesNotAffectOtherTenant ist Pruefung 2: Wiederherstellung
|
||||
// von Tenant A veraendert Tenant B nicht - reales zweites Tenant-DB,
|
||||
// Markerwert vor UND nach dem Restore geprueft.
|
||||
func TestRestore_DoesNotAffectOtherTenant(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
tenantA := "tenantbackup_test_iso_a"
|
||||
tenantB := "tenantbackup_test_iso_b"
|
||||
createMarkerDB(t, cfg, tenantA, "wert-a")
|
||||
createMarkerDB(t, cfg, tenantB, "wert-b-unveraendert")
|
||||
|
||||
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
|
||||
target := "tenantbackup_test_iso_a_restored"
|
||||
if err := CreateEmptyDatabase(ctx, cfg, target); err != nil {
|
||||
t.Fatalf("createemptydatabase: %v", err)
|
||||
}
|
||||
t.Cleanup(func() {
|
||||
cmd := exec.Command(cfg.psqlBinary(), "-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-c", "DROP DATABASE IF EXISTS "+quoteIdent(target))
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
_ = cmd.Run()
|
||||
})
|
||||
if err := Restore(ctx, cfg, dumpPath, target); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
|
||||
// Tenant B, der nie an diesem Vorgang beteiligt war, muss unveraendert sein.
|
||||
gotB := markerValue(t, cfg, tenantB)
|
||||
if gotB != "wert-b-unveraendert" {
|
||||
t.Fatalf("tenant b wurde veraendert: %q, want %q", gotB, "wert-b-unveraendert")
|
||||
}
|
||||
// Und Tenant Bs Datenbank existiert weiterhin unter ihrem eigenen Namen
|
||||
// (kein versehentliches Ueberschreiben/Umbenennen).
|
||||
if !databaseExists(t, cfg, tenantB) {
|
||||
t.Fatal("tenant-b-datenbank fehlt nach restore von tenant a")
|
||||
}
|
||||
}
|
||||
|
||||
// TestVerify_DetectsCorruptedDump ist Nachweis der Vollstaendigkeitspruefung.
|
||||
func TestVerify_DetectsCorruptedDump(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
tenantA := "tenantbackup_test_corrupt"
|
||||
createMarkerDB(t, cfg, tenantA, "wert")
|
||||
|
||||
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
if err := Verify(ctx, cfg, dumpPath); err != nil {
|
||||
t.Fatalf("verify (unbeschaedigt) haette erfolgreich sein muessen: %v", err)
|
||||
}
|
||||
|
||||
if err := os.WriteFile(dumpPath, []byte("kein gueltiges pg_dump-custom-archiv"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := Verify(ctx, cfg, dumpPath); err == nil {
|
||||
t.Fatal("verify haette die beschaedigte sicherung erkennen muessen")
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,14 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - /metrics-Export fuer BAK-06 (dauerhaft, Pull-Modell fuer OPS-03)
|
||||
After=network.target
|
||||
|
||||
[Service]
|
||||
Type=simple
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-restoretest.env
|
||||
ExecStart=__INSTALL_DIR__/bin/restoretest-metrics
|
||||
Restart=on-failure
|
||||
StandardOutput=journal
|
||||
|
||||
[Install]
|
||||
WantedBy=multi-user.target
|
||||
@@ -0,0 +1,11 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Restore-Testverfahren (BAK-06)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
Environment=PATH=/usr/bin:/bin:/usr/lib/postgresql/17/bin
|
||||
EnvironmentFile=/etc/nexarch/archive-restoretest.env
|
||||
ExecStart=__INSTALL_DIR__/bin/restoretest-cli
|
||||
StandardOutput=journal
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Zeitplan fuer NEXARCH Archive Restore-Testverfahren (BAK-06)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=Sun *-*-* 07:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,17 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Tenant-Backup einzelner Mandant (BAK-04)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
Environment=PATH=/usr/bin:/bin:/usr/lib/postgresql/17/bin
|
||||
EnvironmentFile=/etc/nexarch/archive-tenantbackup.env
|
||||
# NEXARCH_TENANTBACKUP_TENANT_DB und NEXARCH_TENANTBACKUP_STORAGE_ROOT
|
||||
# muessen je Mandant separat gesetzt werden (z.B. ueber eine
|
||||
# systemd-Template-Unit @<mandant>.service, sobald TEN-01s
|
||||
# Tenant-Registry real abfragbar ist) - hier bewusst als Platzhalter
|
||||
# belassen, kein automatisches "alle Mandanten"-Enumerieren ohne echte
|
||||
# Registry-Anbindung.
|
||||
ExecStart=__INSTALL_DIR__/bin/tenantbackup-cli backup ${NEXARCH_TENANTBACKUP_TENANT_DB} ${NEXARCH_TENANTBACKUP_STORAGE_ROOT}
|
||||
StandardOutput=journal
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Zeitplan fuer NEXARCH Archive Tenant-Backup (BAK-04) - unabhaengig vom Gesamt-Backup
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 02:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
Reference in New Issue
Block a user