Compare commits
8
Commits
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
80b0ca9176 | ||
|
|
c761cf9b93 | ||
|
|
d252732d09 | ||
|
|
67bcdd1833 | ||
|
|
8100fa3d14 | ||
|
|
ae214f1731 | ||
|
|
10ba866f0e | ||
|
|
5e4b91c4e9 |
@@ -0,0 +1,19 @@
|
||||
.PHONY: build lint fmt test check
|
||||
|
||||
build:
|
||||
go build ./...
|
||||
|
||||
lint:
|
||||
golangci-lint run ./...
|
||||
|
||||
fmt:
|
||||
gofmt -l .
|
||||
@test -z "$$(gofmt -l .)" || (echo "gofmt-Verstoesse gefunden, siehe oben" && exit 1)
|
||||
|
||||
test:
|
||||
go test ./... -p 1 -count=1
|
||||
|
||||
check: build
|
||||
go vet ./...
|
||||
golangci-lint run ./...
|
||||
go test ./... -p 1 -count=1
|
||||
@@ -0,0 +1,62 @@
|
||||
# NEXARCH Archive
|
||||
|
||||
Zentrales, modulübergreifendes Modul für Aufbewahrung, WORM, Compliance und
|
||||
Backup. Dieses Verzeichnis enthält bisher `internal/backup` (BAK-01,
|
||||
Datenbank-Backup-Strategie) — weitere Bausteine folgen ticketweise.
|
||||
|
||||
## BAK-01: Datenbank-Backup
|
||||
|
||||
`cmd/backup-cli` — Aufrufpunkt für systemd-Timer (siehe
|
||||
`../deploy/systemd/nexarch-archive-backup-*.timer`):
|
||||
|
||||
```bash
|
||||
export NEXARCH_BACKUP_PG_USER=nexarch_backup
|
||||
export NEXARCH_BACKUP_PG_PASSWORD=...
|
||||
export NEXARCH_BACKUP_DIR=/var/nexarch-archiv/backups/postgres # NICHT auf einem ephemeren Test-Dataset (siehe Betrieb)
|
||||
export NEXARCH_BACKUP_KEEP_GENERATIONS=7 # optional, Default 7
|
||||
|
||||
backup-cli full # neue Vollsicherung + Verifikation
|
||||
backup-cli incremental # inkrementelle Sicherung gegen die neueste Generation
|
||||
backup-cli rotate # entfernt alle bis auf die neuesten N Generationen
|
||||
```
|
||||
|
||||
Voraussetzung: die konfigurierte Postgres-Rolle braucht das
|
||||
`REPLICATION`-Attribut (`pg_basebackup` nutzt eine
|
||||
Replikationsverbindung), und `summarize_wal = on` muss serverseitig gesetzt
|
||||
sein (PostgreSQL 17s natives inkrementelles Backup, keine WAL-Archivierung
|
||||
nötig).
|
||||
|
||||
## BAK-02: Objekt-Storage-Backup
|
||||
|
||||
`cmd/objectbackup-cli` sichert einen lokalen Verzeichnisbaum (den
|
||||
FDN-03-`LocalDriver`-Basisordner direkt, oder — für S3-gestützte
|
||||
Deployments — einen vorgelagerten `rclone`-Spiegel) mit
|
||||
[restic](https://restic.net) (Content-defined Chunking, verschlüsseltes
|
||||
Repository, geprüftes Tooling statt Eigenbau):
|
||||
|
||||
```bash
|
||||
export NEXARCH_OBJECTBACKUP_REPO_DIR=/var/nexarch-archiv/backups/objects
|
||||
export NEXARCH_OBJECTBACKUP_PASSWORD=...
|
||||
export NEXARCH_OBJECTBACKUP_KEEP_SNAPSHOTS=30 # optional, Default 7
|
||||
|
||||
objectbackup-cli backup /var/nexarch-objects # Sicherung + Verifikation
|
||||
objectbackup-cli check # vollständiges Lesen aller Datenblöcke
|
||||
objectbackup-cli rotate # restic forget --keep-last N --prune
|
||||
```
|
||||
|
||||
## Betrieb: Backup-Zielverzeichnis
|
||||
|
||||
Backup-Ziele liegen unter `/var/nexarch-archiv/` (persistentes ZFS-Dataset,
|
||||
`zfs/data/subvol-1131-disk-0` auf 192.168.1.131), NIEMALS unter
|
||||
`/var/nexarch-test/` (ephemeres Dataset, wird von den `reset-test-env.sh`-
|
||||
Skripten der anderen Module geleert). ZFS-seitige Snapshots/Replikation
|
||||
dieses Datasets sind ein eigenständiges Infra-Runbook (siehe
|
||||
`../../STORAGE-KONZEPT.md` Abschnitt 7), kein Ticket-Code — `zfs
|
||||
dedup=on` bewusst NICHT setzen (hoher RAM-Bedarf), Deduplizierung läuft
|
||||
ausschließlich App-seitig über restic.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
```bash
|
||||
make check # build + vet + lint + test, analog Core/DMS
|
||||
```
|
||||
@@ -0,0 +1,107 @@
|
||||
// backup-cli ist der Aufrufpunkt für BAK-01, gedacht für systemd-Timer
|
||||
// (siehe deploy/systemd/) — "automatisiert nach Zeitplan" (Akzeptanzkriterium
|
||||
// 1) entsteht durch die Zeitplan-Definition im Timer-Unit, nicht durch
|
||||
// einen eigenen In-Prozess-Scheduler (kein zusätzlicher Dauerprozess nötig,
|
||||
// passt zur Produkt-DNA "kein Anwendungsserver mit unnötigem
|
||||
// Ressourcenverbrauch").
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"log"
|
||||
"os"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
)
|
||||
|
||||
func loadConfig() backup.Config {
|
||||
cfg := backup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_BACKUP_DIR"),
|
||||
}
|
||||
if cfg.Host == "" {
|
||||
cfg.Host = "localhost"
|
||||
}
|
||||
if cfg.Port == "" {
|
||||
cfg.Port = "5432"
|
||||
}
|
||||
if cfg.User == "" || cfg.Password == "" || cfg.BackupDir == "" {
|
||||
log.Fatal("NEXARCH_BACKUP_PG_USER, NEXARCH_BACKUP_PG_PASSWORD und NEXARCH_BACKUP_DIR muessen gesetzt sein")
|
||||
}
|
||||
return cfg
|
||||
}
|
||||
|
||||
func latestManifest(backupDir string) (string, error) {
|
||||
generations, err := backup.ListGenerations(backupDir)
|
||||
if err != nil {
|
||||
return "", err
|
||||
}
|
||||
if len(generations) == 0 {
|
||||
return "", fmt.Errorf("keine vorhandene generation fuer inkrementelle sicherung gefunden - zuerst 'full' ausfuehren")
|
||||
}
|
||||
latest := generations[len(generations)-1]
|
||||
full := backupDir + "/" + latest + "/" + backup.FullBackupDirName + "/" + backup.BackupManifestFile
|
||||
if _, err := os.Stat(full); err == nil {
|
||||
return full, nil
|
||||
}
|
||||
return "", fmt.Errorf("kein backup_manifest in der neuesten generation %q gefunden", latest)
|
||||
}
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
log.Fatal("aufruf: backup-cli <full|incremental|verify|rotate> [args]")
|
||||
}
|
||||
cfg := loadConfig()
|
||||
ctx := context.Background()
|
||||
|
||||
switch os.Args[1] {
|
||||
case "full":
|
||||
genID := backup.NewGenerationID(time.Now())
|
||||
manifest, err := backup.FullBackup(ctx, cfg, genID)
|
||||
if err != nil {
|
||||
log.Fatalf("vollsicherung fehlgeschlagen: %v", err)
|
||||
}
|
||||
dir := manifest[:len(manifest)-len("/"+backup.BackupManifestFile)]
|
||||
if err := backup.Verify(dir); err != nil {
|
||||
log.Fatalf("verifikation der vollsicherung fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Printf("vollsicherung %q erstellt und verifiziert: %s\n", genID, manifest)
|
||||
|
||||
case "incremental":
|
||||
manifest, err := latestManifest(cfg.BackupDir)
|
||||
if err != nil {
|
||||
log.Fatal(err)
|
||||
}
|
||||
generations, _ := backup.ListGenerations(cfg.BackupDir)
|
||||
genID := generations[len(generations)-1]
|
||||
incID := backup.NewGenerationID(time.Now())
|
||||
newManifest, err := backup.IncrementalBackup(ctx, cfg, genID, incID, manifest)
|
||||
if err != nil {
|
||||
log.Fatalf("inkrementelle sicherung fehlgeschlagen: %v", err)
|
||||
}
|
||||
dir := newManifest[:len(newManifest)-len("/"+backup.BackupManifestFile)]
|
||||
if err := backup.Verify(dir); err != nil {
|
||||
log.Fatalf("verifikation der inkrementellen sicherung fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Printf("inkrementelle sicherung %q erstellt und verifiziert: %s\n", incID, newManifest)
|
||||
|
||||
case "rotate":
|
||||
keep := 7
|
||||
if v := os.Getenv("NEXARCH_BACKUP_KEEP_GENERATIONS"); v != "" {
|
||||
_, _ = fmt.Sscanf(v, "%d", &keep)
|
||||
}
|
||||
removed, err := backup.Rotate(cfg.BackupDir, keep)
|
||||
if err != nil {
|
||||
log.Fatalf("rotation fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Printf("rotation abgeschlossen, %d generation(en) entfernt: %v\n", len(removed), removed)
|
||||
|
||||
default:
|
||||
log.Fatalf("unbekannter befehl %q", os.Args[1])
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,75 @@
|
||||
// objectbackup-cli ist der Aufrufpunkt für BAK-02, für systemd-Timer
|
||||
// gedacht (siehe deploy/systemd/) — "automatisiert nach Zeitplan" entsteht
|
||||
// durch die Timer-Definition, kein eigener Dauerprozess (dieselbe
|
||||
// Begründung wie BAK-01 / cmd/backup-cli).
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"log"
|
||||
"os"
|
||||
"strconv"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
)
|
||||
|
||||
func loadConfig() objectbackup.Config {
|
||||
cfg := objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_OBJECTBACKUP_REPO_DIR"),
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
if cfg.RepoDir == "" || cfg.Password == "" {
|
||||
log.Fatal("NEXARCH_OBJECTBACKUP_REPO_DIR und NEXARCH_OBJECTBACKUP_PASSWORD muessen gesetzt sein")
|
||||
}
|
||||
return cfg
|
||||
}
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
log.Fatal("aufruf: objectbackup-cli <backup <quellverzeichnis>|check|rotate>")
|
||||
}
|
||||
cfg := loadConfig()
|
||||
ctx := context.Background()
|
||||
|
||||
if err := objectbackup.InitRepo(ctx, cfg); err != nil {
|
||||
log.Fatalf("repository initialisieren: %v", err)
|
||||
}
|
||||
|
||||
switch os.Args[1] {
|
||||
case "backup":
|
||||
if len(os.Args) < 3 {
|
||||
log.Fatal("aufruf: objectbackup-cli backup <quellverzeichnis>")
|
||||
}
|
||||
summary, err := objectbackup.Backup(ctx, cfg, os.Args[2])
|
||||
if err != nil {
|
||||
log.Fatalf("sicherung fehlgeschlagen: %v", err)
|
||||
}
|
||||
if err := objectbackup.Check(ctx, cfg, false); err != nil {
|
||||
log.Fatalf("verifikation nach sicherung fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Printf("sicherung %q erstellt und verifiziert (neu=%d geaendert=%d unveraendert=%d)\n",
|
||||
summary.SnapshotID, summary.FilesNew, summary.FilesChanged, summary.FilesUnmodified)
|
||||
|
||||
case "check":
|
||||
if err := objectbackup.Check(ctx, cfg, true); err != nil {
|
||||
log.Fatalf("verifikation fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Println("verifikation (mit vollstaendigem lesen) erfolgreich")
|
||||
|
||||
case "rotate":
|
||||
keep := 7
|
||||
if v := os.Getenv("NEXARCH_OBJECTBACKUP_KEEP_SNAPSHOTS"); v != "" {
|
||||
if n, err := strconv.Atoi(v); err == nil {
|
||||
keep = n
|
||||
}
|
||||
}
|
||||
if err := objectbackup.Forget(ctx, cfg, keep); err != nil {
|
||||
log.Fatalf("rotation fehlgeschlagen: %v", err)
|
||||
}
|
||||
fmt.Println("rotation abgeschlossen")
|
||||
|
||||
default:
|
||||
log.Fatalf("unbekannter befehl %q", os.Args[1])
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,55 @@
|
||||
// reconcile-cli ist der Aufrufpunkt für BAK-05, für systemd-Timer gedacht
|
||||
// (siehe deploy/systemd/) — "geplanter Abgleichs-Job" (Ticket-Vorgabe)
|
||||
// entsteht durch die Timer-Definition, kein eigener Dauerprozess.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/json"
|
||||
"log"
|
||||
"os"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/reconcile"
|
||||
)
|
||||
|
||||
func main() {
|
||||
dsn := os.Getenv("NEXARCH_RECONCILE_TENANT_DSN")
|
||||
storageDir := os.Getenv("NEXARCH_RECONCILE_STORAGE_DIR")
|
||||
if dsn == "" || storageDir == "" {
|
||||
log.Fatal("NEXARCH_RECONCILE_TENANT_DSN und NEXARCH_RECONCILE_STORAGE_DIR muessen gesetzt sein")
|
||||
}
|
||||
|
||||
ctx := context.Background()
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbankverbindung: %v", err)
|
||||
}
|
||||
defer pool.Close()
|
||||
|
||||
dbEntries, err := reconcile.ListDBStorageKeys(ctx, pool)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbank-eintraege lesen: %v", err)
|
||||
}
|
||||
storageKeys, err := reconcile.ListStorageObjects(storageDir)
|
||||
if err != nil {
|
||||
log.Fatalf("objekt-storage durchlaufen: %v", err)
|
||||
}
|
||||
|
||||
report := reconcile.Reconcile(dbEntries, storageKeys)
|
||||
|
||||
encoder := json.NewEncoder(os.Stdout)
|
||||
encoder.SetIndent("", " ")
|
||||
if err := encoder.Encode(report); err != nil {
|
||||
log.Fatalf("bericht ausgeben: %v", err)
|
||||
}
|
||||
|
||||
// Nicht-null-Exit-Code bei Abweichungen (Akzeptanzkriterium 3:
|
||||
// Abweichungen werden BERICHTET, nicht automatisch behoben — der
|
||||
// Exit-Code macht das fuer systemd/Monitoring sichtbar, OHNE selbst
|
||||
// irgendetwas zu reparieren).
|
||||
if !report.IsClean() {
|
||||
os.Exit(1)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,104 @@
|
||||
// restore-cli ist der Aufrufpunkt fuer BAK-03: dokumentiertes,
|
||||
// wiederholbares Restore-Verfahren fuer Datenbank (BAK-01) und
|
||||
// Objekt-Storage (BAK-02). Kein systemd-Timer (Notfall-/Einzelfall-
|
||||
// Werkzeug, kein Zeitplan) - manueller Aufruf mit expliziter Bestaetigung
|
||||
// bei nicht-leerem Ziel.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"flag"
|
||||
"fmt"
|
||||
"log"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restore"
|
||||
)
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
|
||||
logPath := os.Getenv("NEXARCH_RESTORE_LOG")
|
||||
if logPath == "" {
|
||||
logPath = "/var/nexarch-archiv/restore.log"
|
||||
}
|
||||
|
||||
switch os.Args[1] {
|
||||
case "database":
|
||||
runDatabase(logPath, os.Args[2:])
|
||||
case "objects":
|
||||
runObjects(logPath, os.Args[2:])
|
||||
default:
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
}
|
||||
|
||||
func usage() {
|
||||
fmt.Fprintln(os.Stderr, "usage: restore-cli database [-force] <generation-id> <ziel-verzeichnis>")
|
||||
fmt.Fprintln(os.Stderr, " restore-cli objects [-force] <snapshot-id> <ziel-verzeichnis>")
|
||||
fmt.Fprintln(os.Stderr, "(Flag -force MUSS vor den Positionsargumenten stehen, Standardverhalten des Go-flag-Pakets)")
|
||||
}
|
||||
|
||||
func runDatabase(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("database", flag.ExitOnError)
|
||||
force := fs.Bool("force", false, "bestehenden, nicht-leeren Inhalt im Zielverzeichnis ersetzen")
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() != 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
generationID, target := fs.Arg(0), fs.Arg(1)
|
||||
|
||||
cfg := backup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_BACKUP_DIR"),
|
||||
}
|
||||
ctx := context.Background()
|
||||
|
||||
entry, err := restore.AtomicRestore(restore.KindDatabase, generationID, target, *force, logPath, func(tempDir string) error {
|
||||
return backup.Restore(ctx, cfg, generationID, tempDir)
|
||||
})
|
||||
report(entry, err)
|
||||
}
|
||||
|
||||
func runObjects(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("objects", flag.ExitOnError)
|
||||
force := fs.Bool("force", false, "bestehenden, nicht-leeren Inhalt im Zielverzeichnis ersetzen")
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() != 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
snapshotID, target := fs.Arg(0), fs.Arg(1)
|
||||
|
||||
cfg := objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_OBJECTBACKUP_REPO_DIR"),
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
ctx := context.Background()
|
||||
|
||||
entry, err := restore.AtomicRestore(restore.KindObjects, snapshotID, target, *force, logPath, func(tempDir string) error {
|
||||
return objectbackup.Restore(ctx, cfg, snapshotID, tempDir)
|
||||
})
|
||||
report(entry, err)
|
||||
}
|
||||
|
||||
func report(entry restore.LogEntry, err error) {
|
||||
fmt.Printf("restore %s: quelle=%s ziel=%s ergebnis=%s\n", entry.Kind, entry.Source, entry.Target, entry.Result)
|
||||
if err != nil {
|
||||
log.Fatalf("restore fehlgeschlagen: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,71 @@
|
||||
// restoretest-cli ist der Aufrufpunkt fuer BAK-06 (systemd-Timer,
|
||||
// regelmaessiger Zeitplan) - fuehrt einen vollstaendigen Restore-Test
|
||||
// (Datenbank UND Objekt-Storage) gegen die jeweils neueste Sicherung in
|
||||
// eine isolierte Testumgebung durch und protokolliert das Ergebnis.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"log"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restoretest"
|
||||
)
|
||||
|
||||
func main() {
|
||||
testRoot := os.Getenv("NEXARCH_RESTORETEST_DIR")
|
||||
logPath := os.Getenv("NEXARCH_RESTORETEST_LOG")
|
||||
if testRoot == "" || logPath == "" {
|
||||
log.Fatal("NEXARCH_RESTORETEST_DIR und NEXARCH_RESTORETEST_LOG muessen gesetzt sein")
|
||||
}
|
||||
if err := os.MkdirAll(testRoot, 0o750); err != nil {
|
||||
log.Fatalf("testverzeichnis anlegen: %v", err)
|
||||
}
|
||||
|
||||
ctx := context.Background()
|
||||
failed := false
|
||||
|
||||
dbCfg := backup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_BACKUP_DIR"),
|
||||
}
|
||||
pgCfg := restoretest.PgConfig{TestPort: envOr("NEXARCH_RESTORETEST_PG_PORT", "55433")}
|
||||
dbResult := restoretest.RunDatabaseTest(ctx, dbCfg, pgCfg, testRoot)
|
||||
logResult(logPath, dbResult)
|
||||
if !dbResult.Success {
|
||||
failed = true
|
||||
}
|
||||
|
||||
objCfg := objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_OBJECTBACKUP_REPO_DIR"),
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
objResult := restoretest.RunObjectTest(ctx, objCfg, testRoot)
|
||||
logResult(logPath, objResult)
|
||||
if !objResult.Success {
|
||||
failed = true
|
||||
}
|
||||
|
||||
if failed {
|
||||
os.Exit(1)
|
||||
}
|
||||
}
|
||||
|
||||
func logResult(logPath string, r restoretest.Result) {
|
||||
log.Printf("restoretest %s: quelle=%s erfolg=%t detail=%s", r.Kind, r.Source, r.Success, r.Detail)
|
||||
if err := restoretest.AppendHistory(logPath, r); err != nil {
|
||||
log.Fatalf("protokoll schreiben: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
func envOr(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
@@ -0,0 +1,70 @@
|
||||
// restoretest-metrics stellt BAK-06s Testlauf-Historie unter /metrics
|
||||
// bereit - dauerhafter Prozess getrennt vom Oneshot-restoretest-cli
|
||||
// (Pull-Modell, Core OPS-03 scrapt, kein Push - dieselbe Begruendung wie
|
||||
// BAK-08s scrub-metrics).
|
||||
package main
|
||||
|
||||
import (
|
||||
"fmt"
|
||||
"log"
|
||||
"net/http"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/restoretest"
|
||||
)
|
||||
|
||||
func main() {
|
||||
logPath := os.Getenv("NEXARCH_RESTORETEST_LOG")
|
||||
if logPath == "" {
|
||||
log.Fatal("NEXARCH_RESTORETEST_LOG muss gesetzt sein")
|
||||
}
|
||||
addr := os.Getenv("NEXARCH_RESTORETEST_METRICS_LISTEN_ADDR")
|
||||
if addr == "" {
|
||||
addr = ":8091"
|
||||
}
|
||||
|
||||
mux := http.NewServeMux()
|
||||
mux.HandleFunc("/metrics", func(w http.ResponseWriter, r *http.Request) {
|
||||
history, err := restoretest.ReadHistory(logPath)
|
||||
if err != nil {
|
||||
http.Error(w, err.Error(), http.StatusInternalServerError)
|
||||
return
|
||||
}
|
||||
|
||||
// Historie ist append-only (siehe AppendHistory) - die Anzahl
|
||||
// fehlgeschlagener Eintraege waechst daher von selbst monoton,
|
||||
// kein separater Zaehlerstand noetig (gueltiger Prometheus-Counter).
|
||||
var failuresTotal int
|
||||
lastSuccess := map[restoretest.Kind]float64{restoretest.KindDatabase: -1, restoretest.KindObjects: -1}
|
||||
for _, res := range history {
|
||||
if !res.Success {
|
||||
failuresTotal++
|
||||
}
|
||||
if res.Success {
|
||||
lastSuccess[res.Kind] = 1
|
||||
} else {
|
||||
lastSuccess[res.Kind] = 0
|
||||
}
|
||||
}
|
||||
|
||||
w.Header().Set("Content-Type", "text/plain; version=0.0.4")
|
||||
body := fmt.Sprintf(
|
||||
"# HELP nexarch_archive_restore_test_failures_total Anzahl seit Einrichtung fehlgeschlagener Restore-Testlaeufe (BAK-06).\n"+
|
||||
"# TYPE nexarch_archive_restore_test_failures_total counter\n"+
|
||||
"nexarch_archive_restore_test_failures_total %d\n"+
|
||||
"# HELP nexarch_archive_restore_test_last_success Letzter Testlauf erfolgreich (1) oder fehlgeschlagen (0), -1 wenn noch kein Lauf, je Art.\n"+
|
||||
"# TYPE nexarch_archive_restore_test_last_success gauge\n"+
|
||||
"nexarch_archive_restore_test_last_success{kind=\"database\"} %g\n"+
|
||||
"nexarch_archive_restore_test_last_success{kind=\"objects\"} %g\n",
|
||||
failuresTotal, lastSuccess[restoretest.KindDatabase], lastSuccess[restoretest.KindObjects])
|
||||
if _, err := w.Write([]byte(body)); err != nil {
|
||||
log.Printf("restoretest-metrics: antwort schreiben: %v", err)
|
||||
}
|
||||
})
|
||||
mux.HandleFunc("/healthz", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) })
|
||||
|
||||
log.Printf("restoretest-metrics: listening on %s", addr)
|
||||
if err := http.ListenAndServe(addr, mux); err != nil {
|
||||
log.Fatalf("http server: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,144 @@
|
||||
// scrub-cli ist der Aufrufpunkt fuer BAK-08 (systemd-Timer, konfigurierbare
|
||||
// Kadenz) — zieht eine Stichprobe existierender Objekte (BAK-05 als
|
||||
// Existenz-Quelle), prueft deren Inhalt per SHA-256 gegen
|
||||
// file_revisions.checksum_sha256, meldet Abweichungen (kein Auto-Repair)
|
||||
// und schreibt den Befund-Zaehler fuer den OPS-05/OPS-03-Metrik-Export.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/json"
|
||||
"log"
|
||||
"os"
|
||||
"strconv"
|
||||
"time"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/reconcile"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/scrub"
|
||||
)
|
||||
|
||||
type finding struct {
|
||||
StorageKey string `json:"storage_key"`
|
||||
DocumentID string `json:"document_id"`
|
||||
RevisionID string `json:"revision_id"`
|
||||
Expected string `json:"expected_checksum"`
|
||||
Actual string `json:"actual_checksum,omitempty"`
|
||||
Error string `json:"error,omitempty"`
|
||||
}
|
||||
|
||||
type report struct {
|
||||
GeneratedAt time.Time `json:"generated_at"`
|
||||
Sampled int `json:"sampled"`
|
||||
Findings []finding `json:"findings"`
|
||||
}
|
||||
|
||||
func main() {
|
||||
dsn := os.Getenv("NEXARCH_SCRUB_TENANT_DSN")
|
||||
storageDir := os.Getenv("NEXARCH_SCRUB_STORAGE_DIR")
|
||||
if dsn == "" || storageDir == "" {
|
||||
log.Fatal("NEXARCH_SCRUB_TENANT_DSN und NEXARCH_SCRUB_STORAGE_DIR muessen gesetzt sein")
|
||||
}
|
||||
sampleSize := envInt("NEXARCH_SCRUB_SAMPLE_SIZE", 10)
|
||||
cooldown := envDuration("NEXARCH_SCRUB_COOLDOWN", 24*time.Hour)
|
||||
|
||||
ctx := context.Background()
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbankverbindung: %v", err)
|
||||
}
|
||||
defer pool.Close()
|
||||
|
||||
dbEntries, err := reconcile.ListDBStorageKeys(ctx, pool)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbank-eintraege lesen: %v", err)
|
||||
}
|
||||
storageKeys, err := reconcile.ListStorageObjects(storageDir)
|
||||
if err != nil {
|
||||
log.Fatalf("objekt-storage durchlaufen: %v", err)
|
||||
}
|
||||
rec := reconcile.Reconcile(dbEntries, storageKeys)
|
||||
|
||||
lastScrubbed, err := scrub.LoadLastScrubbed(ctx, pool)
|
||||
if err != nil {
|
||||
log.Fatalf("scrub-zustand lesen: %v", err)
|
||||
}
|
||||
|
||||
now := time.Now().UTC()
|
||||
candidates := scrub.Sample(rec.ExistingInStorage, lastScrubbed, cooldown, sampleSize, now)
|
||||
|
||||
keys := make([]string, 0, len(candidates))
|
||||
for _, c := range candidates {
|
||||
keys = append(keys, c.StorageKey)
|
||||
}
|
||||
expected, err := scrub.ExpectedChecksums(ctx, pool, keys)
|
||||
if err != nil {
|
||||
log.Fatalf("erwartete pruefsummen lesen: %v", err)
|
||||
}
|
||||
|
||||
rep := report{GeneratedAt: now, Sampled: len(candidates)}
|
||||
for _, c := range candidates {
|
||||
exp, known := expected[c.StorageKey]
|
||||
if !known {
|
||||
// Objekt in DB nicht (mehr) auffindbar - das ist BAK-05s
|
||||
// Zustaendigkeit (existiert der Datenbankeintrag?), nicht
|
||||
// dieses Jobs; ueberspringen ohne Markierung.
|
||||
continue
|
||||
}
|
||||
actual, readErr := scrub.ActualChecksum(storageDir, c.StorageKey)
|
||||
ok := readErr == nil && actual == exp
|
||||
if err := scrub.MarkScrubbed(ctx, pool, c.StorageKey, ok, now); err != nil {
|
||||
log.Fatalf("scrub-zustand schreiben: %v", err)
|
||||
}
|
||||
if !ok {
|
||||
f := finding{StorageKey: c.StorageKey, DocumentID: c.DocumentID, RevisionID: c.RevisionID, Expected: exp, Actual: actual}
|
||||
if readErr != nil {
|
||||
f.Error = readErr.Error()
|
||||
}
|
||||
rep.Findings = append(rep.Findings, f)
|
||||
if err := scrub.RecordFinding(ctx, pool); err != nil {
|
||||
log.Fatalf("befund-zaehler erhoehen: %v", err)
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
encoder := json.NewEncoder(os.Stdout)
|
||||
encoder.SetIndent("", " ")
|
||||
if err := encoder.Encode(rep); err != nil {
|
||||
log.Fatalf("bericht ausgeben: %v", err)
|
||||
}
|
||||
|
||||
// Befund wird gemeldet, nicht automatisch repariert (Akzeptanzkriterium
|
||||
// 3) - der Exit-Code macht das fuer systemd/Monitoring sichtbar, ohne
|
||||
// selbst etwas zu reparieren; die tatsaechliche Meldung an OPS-05
|
||||
// laeuft ueber den separaten /metrics-Export (cmd/scrub-metrics), nicht
|
||||
// ueber diesen Exit-Code.
|
||||
if len(rep.Findings) > 0 {
|
||||
os.Exit(1)
|
||||
}
|
||||
}
|
||||
|
||||
func envInt(name string, def int) int {
|
||||
v := os.Getenv(name)
|
||||
if v == "" {
|
||||
return def
|
||||
}
|
||||
n, err := strconv.Atoi(v)
|
||||
if err != nil {
|
||||
log.Fatalf("%s: ungueltiger wert %q: %v", name, v, err)
|
||||
}
|
||||
return n
|
||||
}
|
||||
|
||||
func envDuration(name string, def time.Duration) time.Duration {
|
||||
v := os.Getenv(name)
|
||||
if v == "" {
|
||||
return def
|
||||
}
|
||||
d, err := time.ParseDuration(v)
|
||||
if err != nil {
|
||||
log.Fatalf("%s: ungueltiger wert %q: %v", name, v, err)
|
||||
}
|
||||
return d
|
||||
}
|
||||
@@ -0,0 +1,62 @@
|
||||
// scrub-metrics stellt BAK-08s Befund-Zaehler unter /metrics bereit — die
|
||||
// OPS-05-Anbindung ist Pull-basiert (Core OPS-03 scrapt /metrics-URLs, kein
|
||||
// Push-Mechanismus), daher braucht es einen eigenen, dauerhaft laufenden
|
||||
// HTTP-Endpunkt getrennt vom Oneshot-scrub-cli (dessen Prozess nach jedem
|
||||
// Lauf beendet ist und daher zum Scrape-Zeitpunkt nicht erreichbar waere).
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"log"
|
||||
"net/http"
|
||||
"os"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/scrub"
|
||||
)
|
||||
|
||||
func main() {
|
||||
dsn := os.Getenv("NEXARCH_SCRUB_TENANT_DSN")
|
||||
if dsn == "" {
|
||||
log.Fatal("NEXARCH_SCRUB_TENANT_DSN muss gesetzt sein")
|
||||
}
|
||||
addr := os.Getenv("NEXARCH_SCRUB_METRICS_LISTEN_ADDR")
|
||||
if addr == "" {
|
||||
addr = ":8090"
|
||||
}
|
||||
|
||||
ctx := context.Background()
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbankverbindung: %v", err)
|
||||
}
|
||||
defer pool.Close()
|
||||
|
||||
mux := http.NewServeMux()
|
||||
mux.HandleFunc("/metrics", func(w http.ResponseWriter, r *http.Request) {
|
||||
total, err := scrub.FindingsTotal(r.Context(), pool)
|
||||
if err != nil {
|
||||
http.Error(w, err.Error(), http.StatusInternalServerError)
|
||||
return
|
||||
}
|
||||
w.Header().Set("Content-Type", "text/plain; version=0.0.4")
|
||||
// Counter (Akzeptanzkriterium/Nutzervorgabe: monoton steigend, kein
|
||||
// Gauge) - kein Befund => Wert 0, kein Dauer-Alarm ("kein Befund
|
||||
// bedeutet kein Alarm", nicht "kein Wert").
|
||||
body := fmt.Sprintf(
|
||||
"# HELP nexarch_archive_storage_integrity_failures_total Anzahl seit Einrichtung gefundener Pruefsummen-Abweichungen (BAK-08).\n"+
|
||||
"# TYPE nexarch_archive_storage_integrity_failures_total counter\n"+
|
||||
"nexarch_archive_storage_integrity_failures_total %d\n", total)
|
||||
if _, err := w.Write([]byte(body)); err != nil {
|
||||
log.Printf("scrub-metrics: antwort schreiben: %v", err)
|
||||
}
|
||||
})
|
||||
mux.HandleFunc("/healthz", func(w http.ResponseWriter, r *http.Request) { w.WriteHeader(http.StatusOK) })
|
||||
|
||||
log.Printf("scrub-metrics: listening on %s", addr)
|
||||
if err := http.ListenAndServe(addr, mux); err != nil {
|
||||
log.Fatalf("http server: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,146 @@
|
||||
// tenantbackup-cli ist der Aufrufpunkt fuer BAK-04: Sicherung/
|
||||
// Wiederherstellung EINES einzelnen Mandanten (Datenbank UND
|
||||
// Objekt-Storage-Root), unabhaengig vom Gesamt-Backup (BAK-01/BAK-02)
|
||||
// planbar - eigener systemd-Timer, eigenes Log.
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"flag"
|
||||
"fmt"
|
||||
"log"
|
||||
"os"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/tenantbackup"
|
||||
)
|
||||
|
||||
func main() {
|
||||
if len(os.Args) < 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
logPath := os.Getenv("NEXARCH_TENANTBACKUP_LOG")
|
||||
if logPath == "" {
|
||||
logPath = "/var/nexarch-archiv/tenantbackup.log"
|
||||
}
|
||||
|
||||
switch os.Args[1] {
|
||||
case "backup":
|
||||
runBackup(logPath, os.Args[2:])
|
||||
case "restore":
|
||||
runRestore(logPath, os.Args[2:])
|
||||
default:
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
}
|
||||
|
||||
func usage() {
|
||||
fmt.Fprintln(os.Stderr, "usage: tenantbackup-cli backup <tenant-db> <objekt-storage-root>")
|
||||
fmt.Fprintln(os.Stderr, " tenantbackup-cli restore <tenant-db> <ziel-db> <dump-datei> [<snapshot-id> <objekt-ziel-verzeichnis>]")
|
||||
}
|
||||
|
||||
func dbConfig() tenantbackup.Config {
|
||||
return tenantbackup.Config{
|
||||
Host: os.Getenv("NEXARCH_BACKUP_PG_HOST"),
|
||||
Port: os.Getenv("NEXARCH_BACKUP_PG_PORT"),
|
||||
User: os.Getenv("NEXARCH_BACKUP_PG_USER"),
|
||||
Password: os.Getenv("NEXARCH_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: os.Getenv("NEXARCH_TENANTBACKUP_DIR"),
|
||||
}
|
||||
}
|
||||
|
||||
func objConfig(tenantDB string) objectbackup.Config {
|
||||
return objectbackup.Config{
|
||||
RepoDir: os.Getenv("NEXARCH_TENANTBACKUP_OBJECT_REPO_ROOT") + "/" + tenantDB,
|
||||
Password: os.Getenv("NEXARCH_OBJECTBACKUP_PASSWORD"),
|
||||
}
|
||||
}
|
||||
|
||||
func runBackup(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("backup", flag.ExitOnError)
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() != 2 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
tenantDB, storageRoot := fs.Arg(0), fs.Arg(1)
|
||||
ctx := context.Background()
|
||||
genID := time.Now().UTC().Format("20060102T150405Z")
|
||||
|
||||
dbCfg := dbConfig()
|
||||
dumpPath, err := tenantbackup.Backup(ctx, dbCfg, tenantDB, genID)
|
||||
logEntry(logPath, tenantbackup.OpBackupDB, tenantDB, "", dumpPath, err)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbank-sicherung: %v", err)
|
||||
}
|
||||
if err := tenantbackup.Verify(ctx, dbCfg, dumpPath); err != nil {
|
||||
log.Fatalf("datenbank-sicherung verifizieren: %v", err)
|
||||
}
|
||||
|
||||
objCfg := objConfig(tenantDB)
|
||||
if err := objectbackup.InitRepo(ctx, objCfg); err != nil {
|
||||
log.Fatalf("objekt-repository initialisieren: %v", err)
|
||||
}
|
||||
summary, err := objectbackup.Backup(ctx, objCfg, storageRoot)
|
||||
logEntry(logPath, tenantbackup.OpBackupObj, tenantDB, storageRoot, summary.SnapshotID, err)
|
||||
if err != nil {
|
||||
log.Fatalf("objekt-storage-sicherung: %v", err)
|
||||
}
|
||||
|
||||
fmt.Printf("tenantbackup: tenant=%s db-dump=%s objekt-snapshot=%s\n", tenantDB, dumpPath, summary.SnapshotID)
|
||||
}
|
||||
|
||||
func runRestore(logPath string, args []string) {
|
||||
fs := flag.NewFlagSet("restore", flag.ExitOnError)
|
||||
if err := fs.Parse(args); err != nil {
|
||||
os.Exit(2)
|
||||
}
|
||||
if fs.NArg() < 3 {
|
||||
usage()
|
||||
os.Exit(2)
|
||||
}
|
||||
tenantDB, targetDB, dumpPath := fs.Arg(0), fs.Arg(1), fs.Arg(2)
|
||||
ctx := context.Background()
|
||||
|
||||
dbCfg := dbConfig()
|
||||
err := tenantbackup.CreateEmptyDatabase(ctx, dbCfg, targetDB)
|
||||
if err == nil {
|
||||
err = tenantbackup.Restore(ctx, dbCfg, dumpPath, targetDB)
|
||||
}
|
||||
logEntry(logPath, tenantbackup.OpRestoreDB, tenantDB, dumpPath, targetDB, err)
|
||||
if err != nil {
|
||||
log.Fatalf("datenbank-restore: %v", err)
|
||||
}
|
||||
fmt.Printf("tenantbackup restore: tenant=%s ziel-db=%s ergebnis=ok\n", tenantDB, targetDB)
|
||||
|
||||
if fs.NArg() < 5 {
|
||||
return
|
||||
}
|
||||
snapshotID, objTarget := fs.Arg(3), fs.Arg(4)
|
||||
objCfg := objConfig(tenantDB)
|
||||
err = objectbackup.Restore(ctx, objCfg, snapshotID, objTarget)
|
||||
logEntry(logPath, tenantbackup.OpRestoreObj, tenantDB, snapshotID, objTarget, err)
|
||||
if err != nil {
|
||||
log.Fatalf("objekt-storage-restore: %v", err)
|
||||
}
|
||||
fmt.Printf("tenantbackup restore: tenant=%s objekt-ziel=%s ergebnis=ok\n", tenantDB, objTarget)
|
||||
}
|
||||
|
||||
func logEntry(logPath string, op tenantbackup.Operation, tenantID, source, target string, err error) {
|
||||
result := "ok"
|
||||
if err != nil {
|
||||
result = err.Error()
|
||||
}
|
||||
entry := tenantbackup.LogEntry{
|
||||
Timestamp: time.Now().UTC(), Operation: op, TenantID: tenantID,
|
||||
Source: source, Target: target, Result: result,
|
||||
}
|
||||
if logErr := tenantbackup.AppendLog(logPath, entry); logErr != nil {
|
||||
log.Fatalf("protokoll schreiben: %v", logErr)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,97 @@
|
||||
# BAK-01 – Prüfprotokoll: Datenbank-Backup-Strategie
|
||||
|
||||
Welle 1, keine Vorbedingungen. Neues Modul-Verzeichnis `code/archive/`
|
||||
(gleiches Monorepo-Muster wie `code/dms/`), eigenes Go-Modul
|
||||
`gitea.perlbach24.de/scripte/nexarch/archive`.
|
||||
|
||||
## Grundsatzentscheidung: PostgreSQL-17-natives inkrementelles Backup
|
||||
|
||||
`pg_dump` kennt nur logische Vollsicherungen — "inkrementell" im Sinne des
|
||||
Tickets erfordert das physische Backup-Verfahren. Gewählt: PostgreSQL 17s
|
||||
natives `pg_basebackup --incremental` (WAL-Summarization), NICHT klassisches
|
||||
WAL-Archiving (`archive_mode`), weil letzteres einen Neustart der
|
||||
(geteilten, auch von Core/DMS-Tests genutzten) Postgres-Instanz auf
|
||||
192.168.1.131 erfordert hätte. Stattdessen `summarize_wal = on` gesetzt —
|
||||
nur ein `pg_reload_conf()`, kein Neustart, keine Unterbrechung laufender
|
||||
Verbindungen (per Health-Check nach der Änderung bestätigt).
|
||||
|
||||
Voraussetzung geschaffen: Rolle `nexarch_backup` mit `REPLICATION`-Attribut
|
||||
angelegt (Postgres verlangt eine Replikationsverbindung für
|
||||
`pg_basebackup`), `pg_hba.conf` erlaubte lokale Replikationsverbindungen
|
||||
bereits.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/backup.FullBackup`/`IncrementalBackup` — rufen `pg_basebackup`
|
||||
über `os/exec` auf, Ergebnis landet in einer Generationsstruktur
|
||||
(`<BackupDir>/<Generation>/full/` bzw. `.../incremental/<ID>/`).
|
||||
- `internal/backup.Verify` — öffnet `base.tar.gz` vollständig (gzip- UND
|
||||
tar-Stream, jeder Eintrag bis zum Ende gelesen, nicht nur Kopfdaten) —
|
||||
Akzeptanzkriterium 2: Verifikation auf Lesbarkeit, nicht nur Erstellung.
|
||||
- `internal/backup.Rotate`/`ListGenerations` — Generationen sind nach
|
||||
Zeitstempel-ID sortierbar, `Rotate` entfernt die ältesten bis auf `keep`
|
||||
komplett (inklusive aller abhängigen Inkremente).
|
||||
- `cmd/backup-cli` — `full`/`incremental`/`rotate`, aufgerufen von
|
||||
systemd-Timern (`deploy/systemd/nexarch-archive-backup-*.timer`) —
|
||||
"automatisiert nach Zeitplan" (Akzeptanzkriterium 1) entsteht durch die
|
||||
Timer-Definition, kein zusätzlicher Dauerprozess nötig.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Sicherung gegen Testdatenbank erfolgreich erstellt und verifiziert | **bestanden** — `TestFullBackup_CreatesVerifiedBackup` gegen die echte Postgres-17-Instanz auf 192.168.1.131 (kein Mock), zusätzlich `TestIncrementalBackup_IsSmallerThanFull`: inkrementelle Sicherung real deutlich kleiner als Vollsicherung (167 KB vs. 16 MB bei der ersten manuellen Probe) — beweist echte inkrementelle Übertragung, nicht nur eine zweite Vollsicherung |
|
||||
| 2 | Verifikation erkennt eine absichtlich beschädigte Sicherungsdatei | **bestanden** — `TestVerify_DetectsCorruptedFile`: 64 Bytes in der Mitte von `base.tar.gz` gekippt, `Verify` schlägt danach fehl (unbeschädigt zuvor erfolgreich) |
|
||||
| 3 | Rotationsregel entfernt nachweislich nur die ältesten Generationen | **bestanden** — `TestRotate_RemovesOnlyOldestGenerations`: 5 Generationen, `keep=2`, exakt die 3 ältesten entfernt, die 2 neuesten nachweislich unangetastet |
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131 (nicht nur Testcode)
|
||||
|
||||
Anders als die zuletzt in DMS gefundenen "Baustein existiert, ist aber
|
||||
nirgends verdrahtet"-Fälle (FDN-03/FDN-09 gegen Core) wurde hier die
|
||||
komplette Kette tatsächlich installiert und ausgeführt:
|
||||
|
||||
- `backup-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- `/etc/nexarch/archive-backup.env` mit den Verbindungsdaten (0600)
|
||||
- 3 systemd-Timer installiert und aktiviert (`enable --now`):
|
||||
Vollsicherung täglich 02:00 UTC, Inkrement stündlich, Rotation täglich
|
||||
03:00 UTC (`systemctl list-timers` bestätigt alle drei scharf)
|
||||
- Jeder der drei Dienste (`full`/`incremental`/`rotate`) einmal manuell über
|
||||
`systemctl start` ausgelöst (nicht nur `go test` direkt) — alle drei mit
|
||||
`status=0/SUCCESS`, Journal bestätigt inhaltlich korrekte Ausgabe
|
||||
(Vollsicherung erstellt+verifiziert, Inkrement erstellt+verifiziert
|
||||
gegen die richtige Vorgänger-Generation, Rotation lief ohne Fehler)
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 4/4 Tests ok, 0 Fehlschläge (echter Postgres 17, kein Mock)
|
||||
```
|
||||
|
||||
## Nachtrag (BAK-02-Sitzung): Backup-Zielverzeichnis korrigiert
|
||||
|
||||
`NEXARCH_BACKUP_DIR` zeigte ursprünglich auf `/var/backups/nexarch`
|
||||
(Root-Dateisystem des Containers, kein dediziertes Dataset) — korrigiert auf
|
||||
`/var/nexarch-archiv/backups/postgres` (persistentes ZFS-Dataset), siehe
|
||||
`docs/BAK-02-PRUEFPROTOKOLL.md` Abschnitt „Korrektur an BAK-01" für Details.
|
||||
Vollsicherung nach der Korrektur erneut über systemd ausgelöst, landet
|
||||
nachweislich am neuen Ort.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei Pflichtprüfungen
|
||||
real erfüllt — inklusive tatsächlicher systemd-Timer-Installation und
|
||||
manuell ausgelöstem End-to-End-Lauf aller drei Dienste auf dem Testhost,
|
||||
nicht nur isolierter Testcode.
|
||||
|
||||
## Nachtrag (BAK-03): Verify prüft jetzt auch pg_wal.tar.gz
|
||||
|
||||
Beim Bau von BAK-03s echtem Restore-Test fiel auf, dass `pg_basebackup`
|
||||
(Standard-WAL-Methode `stream`) bei `-Ft -z` NEBEN `base.tar.gz` eine
|
||||
zweite Archivdatei `pg_wal.tar.gz` erzeugt, die `Verify` bislang nie
|
||||
geprüft hat — eine Sicherung mit beschädigtem WAL-Archiv wäre unbemerkt
|
||||
nicht crash-konsistent wiederherstellbar gewesen. `Verify` prüft seither
|
||||
beide Archive vollständig (siehe `BAK-03-PRUEFPROTOKOLL.md`). Das
|
||||
Sicherungsverfahren selbst (Format, Ort, Rotation) bleibt unverändert.
|
||||
@@ -0,0 +1,93 @@
|
||||
# BAK-02 – Prüfprotokoll: Objekt-Storage-Backup/Snapshots
|
||||
|
||||
Welle 1, keine Vorbedingungen.
|
||||
|
||||
## Grundsatzentscheidung: restic statt Eigenbau
|
||||
|
||||
Nutzerentscheidung: restic statt einer Neuimplementierung, weil restic alle
|
||||
vier Akzeptanzkriterien mit ausgereiftem, breit geprüftem Tooling erfüllt
|
||||
(Content-defined Chunking für Dedup, `check --read-data` für
|
||||
Vollständigkeit, `forget --keep-last` für Rotation, Repository-Verschlüsselung
|
||||
ab Werk). Installiert via `apt-get install restic` (Version 0.18.0).
|
||||
|
||||
Backup-Quelle ist ein lokaler Verzeichnisbaum — für den FDN-03-`LocalDriver`
|
||||
direkt dessen Basisverzeichnis. Für S3-gestützte Produktions-Deployments
|
||||
(Betriebsmodus 2/3 aus `STORAGE-KONZEPT.md` Abschnitt 6.2) wäre ein
|
||||
vorgelagerter Sync-Schritt (z. B. `rclone`) nötig, um Bucket-Inhalte lokal
|
||||
zu spiegeln, bevor restic sie sichert — restic sichert Dateibäume, keine
|
||||
S3-Buckets direkt. Das bleibt hier bewusst unimplementiert (kein konkreter
|
||||
S3-Produktionsbestand vorhanden, der das aktuell erfordert), aber
|
||||
architektonisch vorgesehen und dokumentiert (`README.md`).
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/objectbackup.InitRepo` — idempotent, erkennt "bereits
|
||||
initialisiert" am `restic init`-Fehlertext statt zu scheitern.
|
||||
- `internal/objectbackup.Backup` — `restic backup --json`, parst die
|
||||
`summary`-Zeile (mehrere JSON-Zeilen in der Ausgabe, gezielt die mit
|
||||
`message_type=="summary"` gesucht).
|
||||
- `internal/objectbackup.Check` — `restic check [--read-data]` (Akzeptanz-
|
||||
kriterium 3: Vollständigkeitsprüfung).
|
||||
- `internal/objectbackup.Forget` — `restic forget --keep-last N --prune`
|
||||
(Rotation).
|
||||
- `cmd/objectbackup-cli` — `backup <dir>`/`check`/`rotate`, aufgerufen von
|
||||
systemd-Timern (stündlich/wöchentlich/täglich).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Zweiter Sicherungslauf nach unverändertem Bestand überträgt keine Daten erneut | **bestanden** — `TestBackup_UnchangedSecondRunTransmitsNothingNew`: zweiter Lauf gegen unveränderten Bestand liefert `files_new=0`, `files_changed=0`, `files_unmodified=1` |
|
||||
| 2 | Zwei identische Testdateien belegen nachweislich nur einmal Speicherplatz | **bestanden** — `TestBackup_DeduplicatesIdenticalContent`: zwei Dateien mit identischem Inhalt erzeugen `data_blobs=1`, nicht 2 — echter Dedup-Nachweis über restics Content-defined Chunking, nicht nur Namensvergleich |
|
||||
| 3 | Vollständigkeitsprüfung erkennt ein fehlendes Objekt in der Sicherung | **bestanden** — `TestCheck_DetectsCorruptedPack`: ein Byte in einer echten Repository-Pack-Datei gekippt, `Check(readData=true)` schlägt danach fehl (unbeschädigt zuvor erfolgreich) — dieselbe Vorgehensweise wie die manuelle Recherche vor der Implementierung |
|
||||
|
||||
Zusätzlich (nicht explizit als Pflichtprüfung gefordert, aber Teil von
|
||||
Akzeptanzkriterium 3 „lässt sich einzeln prüfen"): `TestForget_
|
||||
KeepsOnlyRequestedSnapshotCount` — 3 Sicherungsläufe, `Forget(keepLast=1)`
|
||||
reduziert auf genau 1 verbleibenden Snapshot.
|
||||
|
||||
## Korrektur an BAK-01 im selben Rutsch: Backup-Zielverzeichnis
|
||||
|
||||
Nutzerhinweis aufgegriffen: `NEXARCH_BACKUP_DIR` zeigte bei BAK-01
|
||||
ursprünglich auf `/var/backups/nexarch` (Root-Dateisystem des LXC-
|
||||
Containers, nicht auf einem der beiden dedizierten ZFS-Datasets). Korrigiert
|
||||
auf `/var/nexarch-archiv/backups/postgres` (persistentes Dataset
|
||||
`zfs/data/subvol-1131-disk-0`), NICHT `/var/nexarch-test/` (ephemeres
|
||||
Dataset `ssd-rpool-data/swap/subvol-1131-disk-0`, wird von
|
||||
`reset-test-env.sh`-Skripten anderer Module geleert). `objectbackup-cli`s
|
||||
Repository liegt von Anfang an korrekt unter
|
||||
`/var/nexarch-archiv/backups/objects`. Beide Pfade real auf
|
||||
192.168.1.131 verifiziert (`df`/`mount` bestätigt ZFS-Dataset-Zuordnung),
|
||||
BAK-01s Vollsicherung nach der Korrektur erneut über systemd ausgelöst und
|
||||
bestätigt am neuen Ort gelandet.
|
||||
|
||||
ZFS-seitige Snapshot-/Replikations-Strategie für `nexarch/archiv` bleibt
|
||||
bewusst außerhalb dieses Tickets (Infra-Runbook, siehe
|
||||
`STORAGE-KONZEPT.md` Abschnitt 7 „Backup vs. Storage-Redundanz" sowie den
|
||||
Hinweis, `zfs dedup=on` NICHT zu setzen — App-seitige Dedup über restic
|
||||
genügt, ZFS-Dedup wäre auf dem 4-GB-Testhost ein Speicherrisiko).
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `objectbackup-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- `/etc/nexarch/archive-objectbackup.env` (0600)
|
||||
- 3 systemd-Timer installiert und aktiviert: Sicherung stündlich (`:30`),
|
||||
Vollständigkeitsprüfung wöchentlich (So. 04:00 UTC), Rotation täglich
|
||||
(03:30 UTC) — `systemctl list-timers` bestätigt alle scharf
|
||||
- Jeder der drei Dienste einmal über `systemctl start` ausgelöst, alle mit
|
||||
`status=0/SUCCESS`; Journal bestätigt inhaltlich korrekte Ausgabe
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 2/2 Pakete mit Tests ok (internal/backup, internal/objectbackup), 0 Fehlschläge
|
||||
```
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei Pflichtprüfungen
|
||||
real gegen echtes restic-Tooling erfüllt. BAK-01-Pfadfehler im selben
|
||||
Rutsch korrigiert und erneut end-to-end verifiziert.
|
||||
@@ -0,0 +1,122 @@
|
||||
# BAK-03 – Prüfprotokoll: Restore-Verfahren
|
||||
|
||||
Voraussetzungen BAK-01, BAK-02 – erledigt, siehe eigene Protokolle.
|
||||
|
||||
## Grundsatzentscheidung: Atomarität über Temp-Verzeichnis + Rename
|
||||
|
||||
`internal/restore.AtomicRestore` kennt weder Postgres noch restic —
|
||||
reine Ablaufsteuerung: Wiederherstellung IMMER in ein frisches
|
||||
temporäres Verzeichnis (nie direkt in das Ziel), Übernahme erst bei
|
||||
Erfolg per `os.Rename` (selbes Dateisystem wie das Ziel, daher atomar).
|
||||
Ist das Ziel nicht leer und keine Bestätigung (`-force`) gegeben, wird
|
||||
NICHT einmal die Wiederherstellungsfunktion aufgerufen — Abbruch vor
|
||||
jeder Berührung des Ziels (Akzeptanzkriterium 2). Jeder Aufruf — Erfolg,
|
||||
Abbruch oder Fehler — erzeugt genau einen JSONL-Protokolleintrag
|
||||
(Akzeptanzkriterium 3).
|
||||
|
||||
Die eigentliche Wiederherstellung bleibt in `internal/backup.Restore`
|
||||
(Datenbank) und `internal/objectbackup.Restore` (Objekt-Storage) —
|
||||
`internal/restore` orchestriert nur.
|
||||
|
||||
## Drei reale Defekte während der Implementierung gefunden und behoben
|
||||
|
||||
Alle drei erst durch den ECHTEN Restore-Test (Postgres-Instanz tatsächlich
|
||||
gestartet, nicht nur Dateien verglichen) aufgedeckt:
|
||||
|
||||
1. **`pg_combinebackup` braucht Plain-Format, BAK-01 liefert Tar+Gzip.**
|
||||
`Restore` extrahiert jetzt jede Sicherungsstufe zunächst in ein
|
||||
temporäres Plain-Verzeichnis (inkl. `backup_manifest`-Kopie) und
|
||||
speist erst DIESE in `pg_combinebackup`. BAK-01s Speicherformat selbst
|
||||
unverändert (kleinere, leichter prüfbare Dateien).
|
||||
2. **`pg_wal.tar.gz` wurde nie verifiziert oder wiederhergestellt.**
|
||||
`pg_basebackup`s Standard-WAL-Methode (`stream`) erzeugt bei `-Ft -z`
|
||||
eine ZWEITE Archivdatei neben `base.tar.gz` — ohne sie ist keine
|
||||
crash-konsistente Wiederherstellung möglich (Postgres findet sonst
|
||||
keinen gültigen Checkpoint). `backup.Verify` prüft jetzt BEIDE
|
||||
Archive vollständig; `backup.Restore` extrahiert das WAL der ZULETZT
|
||||
gezogenen Stufe (nicht aller Stufen) nach `pg_wal/` im
|
||||
Wiederherstellungsziel. Ergänzung zu BAK-01s Prüfung, keine
|
||||
Umstellung des Sicherungsverfahrens.
|
||||
3. **Go-`exec`-Hänger bei `pg_ctl start`:** `pg_ctl` startet Postgres als
|
||||
Hintergrundprozess, der die geerbten stdout/stderr-Pipes NICHT
|
||||
schließt — `CombinedOutput()` (wartet auf Pipe-EOF) hängt sich
|
||||
dadurch auf, obwohl `pg_ctl` selbst längst zurückgekehrt ist. Fix nur
|
||||
im Testcode: echte Logdatei (`-l`) statt Pipe, Standard-`pg_ctl`-Muster.
|
||||
|
||||
Zusätzlich real (nicht Ticket-relevant, aber notiert): auf diesem
|
||||
Debian-Postgres liegen `postgresql.conf`/`pg_hba.conf` NICHT in PGDATA
|
||||
(sondern `/etc/postgresql/17/main/`) — ein echtes Restore-Runbook muss
|
||||
diese Dateien separat mitführen/rekonstruieren, `pg_basebackup` sichert
|
||||
sie nicht. Für den Testnachweis minimal nachgereicht, kein Produktcode.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/restore.AtomicRestore` — Ablaufsteuerung, JSONL-Protokoll
|
||||
(`Timestamp`, `Kind`, `Source`, `Target`, `Result`).
|
||||
- `internal/backup.Restore` — `pg_combinebackup` gegen extrahierte
|
||||
Plain-Verzeichnisse + WAL-Wiederherstellung der letzten Stufe.
|
||||
- `internal/backup.extractTarGz` (in `verify.go`, neben der bestehenden
|
||||
Tar/Gzip-Leselogik) — vollständige Extraktion, kein Kopf-only-Read.
|
||||
- `internal/backup.Verify` — prüft jetzt `base.tar.gz` UND
|
||||
`pg_wal.tar.gz` vollständig.
|
||||
- `internal/objectbackup.Restore` — `restic restore --target`.
|
||||
- `cmd/restore-cli` — `database`/`objects`-Unterbefehle, `-force`-Flag
|
||||
(vor Positionsargumenten, Go-`flag`-Konvention), kein systemd-Timer
|
||||
(Notfall-/Einzelfall-Werkzeug, kein Zeitplan).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Restore auf leerem System vollständig und erfolgreich durchgeführt | **bestanden** — real: `TestRestore_CombinesIntoStartablePostgresInstance` (Postgres tatsächlich aus wiederhergestelltem Verzeichnis gestartet, `SELECT 1` über echte Verbindung beantwortet); zusätzlich real per `restore-cli database` auf 131 ausgeführt (PG_VERSION/base/pg_wal vorhanden, Exit 0); `TestRestore_RecoversRealContentFromSnapshot` (Objekt-Storage, echter Dateiinhalt verglichen) UND real per `restore-cli objects` auf 131 (echter restic-Snapshot wiederhergestellt) |
|
||||
| 2 | Restore auf nicht-leeres Zielverzeichnis lässt bei Abbruch den ursprünglichen Inhalt unverändert | **bestanden** — `TestAtomicRestore_NonEmptyTargetWithoutForce_LeavesOriginalUntouched` (restoreFn wird nachweislich NIE aufgerufen) und `TestAtomicRestore_FailedRestoreFn_LeavesTargetUntouched`; real auf 131: `restore-cli database` gegen nicht-leeres Ziel ohne `-force` → Abbruch, bestehende Testdatei unverändert vorhanden |
|
||||
| 3 | Protokolleintrag zum Restore ist vollständig und nachvollziehbar | **bestanden** — `TestAtomicRestore_LogsCompleteEntry` (Quelle, Ziel, Zeitpunkt, Ergebnis für Erfolgs- UND Abbruchfall in derselben Datei); real auf 131: `/tmp/restore-cli-test.log` zeigt alle vier realen Läufe (Abbruch, Fehler mangels PATH, Erfolg, Force-Überschreiben) korrekt protokolliert |
|
||||
|
||||
Zusätzlich: `TestAtomicRestore_EmptyTarget_Succeeds`,
|
||||
`TestAtomicRestore_ForceOverwritesNonEmptyTarget` (bewusste Bestätigung
|
||||
ersetzt bestehenden Inhalt real, alter Inhalt nachweislich weg, neuer da).
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `restore-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- Kein systemd-Timer (bewusst — Notfall-/Einzelfall-Werkzeug)
|
||||
- Vier reale CLI-Läufe durchgeführt und protokolliert: Abbruch bei
|
||||
nicht-leerem Ziel ohne `-force`, Fehler mangels `pg_combinebackup` im
|
||||
PATH (zeigt: Fehler wird korrekt erkannt UND protokolliert, kein
|
||||
stiller Fehlschlag), erfolgreicher Restore einer echten Generation
|
||||
(`20260829T222054Z`) in leeres Ziel, erfolgreiches Überschreiben mit
|
||||
`-force`. Objekt-Storage-Restore real gegen echten restic-Snapshot
|
||||
(`43da36bf`) — Inhalt (`.placeholder`-Datei) tatsächlich vorhanden.
|
||||
- Alle Testartefakte (`/tmp/restore-*`, Testlog) nach Prüfung entfernt.
|
||||
|
||||
## Build/Test-Ergebnis
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
```
|
||||
|
||||
`internal/restore`: 5/5 Tests (reine Funktionen, kein Setup nötig).
|
||||
`internal/objectbackup`: `TestRestore_RecoversRealContentFromSnapshot`
|
||||
bestanden (zusammen mit den bestehenden BAK-02-Tests).
|
||||
`internal/backup`: `TestRestore_CombinesIntoStartablePostgresInstance`
|
||||
bestanden — **Hinweis**: dieser eine Test läuft NICHT als root
|
||||
(`pg_ctl: cannot be run as root`) und braucht `pg_combinebackup`/
|
||||
`pg_ctl` im PATH (`/usr/lib/postgresql/17/bin` auf Debian, dort nicht
|
||||
standardmäßig verlinkt) — daher separat als `postgres`-Systemnutzer mit
|
||||
entsprechendem PATH ausgeführt, nicht Teil des root-`make check`-Laufs;
|
||||
dort wird er mit klarer Meldung übersprungen (`pg_combinebackup nicht
|
||||
installiert`), kein stiller Fehlschlag. Alle übrigen BAK-01-Tests
|
||||
(inkl. der um `pg_wal.tar.gz` erweiterten `Verify`) liefen unverändert
|
||||
grün im normalen `make check`-Lauf.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — beide Restore-Pfade (Datenbank,
|
||||
Objekt-Storage) sowohl testgetrieben als auch manuell über `restore-cli`
|
||||
auf echter Infrastruktur nachgewiesen. Drei während der Implementierung
|
||||
gefundene reale Defekte (Tar-vs-Plain-Format, fehlende WAL-Sicherung/
|
||||
-Verifikation, Go-exec-Pipe-Hänger) behoben und dokumentiert, nicht
|
||||
stillschweigend umgangen.
|
||||
@@ -0,0 +1,123 @@
|
||||
# BAK-04 – Prüfprotokoll: Tenant-Backup & -Restore (einzelner Mandant)
|
||||
|
||||
Voraussetzung BAK-03 – erledigt, siehe eigenes Protokoll.
|
||||
|
||||
## Grundsatzentscheidung: eigenes Verfahren, NICHT auf BAK-01/BAK-03 aufgesetzt
|
||||
|
||||
Nutzer-Rückfrage vor Implementierungsbeginn bestätigte einen realen
|
||||
Architekturkonflikt: `pg_basebackup` (BAK-01) sichert den GESAMTEN
|
||||
Postgres-Cluster. Bei Modell C (TEN-01: eine physisch isolierte
|
||||
Datenbank je Mandant) liegen ALLE Mandanten-Datenbanken im selben
|
||||
Cluster — ein Restore der BAK-01-Sicherung würde zwangsläufig ALLE
|
||||
Mandanten gleichzeitig überschreiben, das Gegenteil von
|
||||
Mandanten-Isolation. `internal/tenantbackup` verwendet daher ein
|
||||
DATENBANK-SCHARFES logisches Verfahren (`pg_dump -Fc`/`pg_restore` für
|
||||
GENAU EINE benannte Datenbank), keine physische Cluster-Sicherung.
|
||||
Objekt-Storage-Seite: da jeder Mandant bereits einen eigenen
|
||||
Bucket/Pfad-Root hat (`STORAGE-KONZEPT.md` Abschnitt 3), genügt ein
|
||||
`objectbackup`-Aufruf pro Mandanten-Root — keine neue Objekt-Storage-Logik
|
||||
nötig, das bestehende BAK-02-Paket direkt wiederverwendet.
|
||||
|
||||
## Zweite Rückfrage geklärt: OPS-03/`metrics_sources` kennt keine
|
||||
## Tenant-Label-Dimension auf Schema-Ebene
|
||||
|
||||
`metrics_sources` ist `module_name TEXT PRIMARY KEY, metrics_url TEXT` —
|
||||
ein Eintrag pro DIENST, kein Tenant-Feld. Labels (z. B. `tenant="..."`)
|
||||
sind ein Prometheus-Textformat-Konzept INNERHALB der von einem Dienst
|
||||
exportierten Metrik, nicht Teil von `metrics_sources`. Ein
|
||||
`tenant_restore_failed_total{tenant="..."}`-Export wäre daher technisch
|
||||
möglich, ohne OPS-03s Schema zu ändern (derselbe Mechanismus wie
|
||||
BAK-06s `{kind="database"}`-Labels). **Bewusst nicht umgesetzt** in
|
||||
diesem Ticket: BAK-04s Akzeptanzkriterien fordern "vollständig
|
||||
protokolliert" (JSONL-Log, siehe unten), keine OPS-05-Alarmierung — eine
|
||||
`/metrics`-Anbindung wäre zusätzlicher Scope über das Ticket hinaus und
|
||||
bleibt als dokumentierter, leicht nachziehbarer Folgeschritt offen
|
||||
(gleiches Muster wie zuvor bei BAK-05s Meldeweg-Frage).
|
||||
|
||||
## Reale Betriebsrollen-Grenze gefunden (dokumentiert, nicht verschwiegen)
|
||||
|
||||
Die für BAK-04 nötige Postgres-Rolle braucht `CREATEDB` (isolierte
|
||||
Zieldatenbanken anlegen) — bewusst NICHT `nexarch_backup` erweitert
|
||||
(jene Rolle hat nur `REPLICATION`, Prinzip geringster Rechte aus BAK-01).
|
||||
Neue, eigene Rolle `nexarch_tenantbackup` angelegt. Beim ersten echten
|
||||
Restore-Versuch schlug `pg_restore` mit `permission denied for schema
|
||||
public` fehl (Versuch, Tabellen auf den URSPRÜNGLICHEN Tenant-Eigentümer
|
||||
umzueignen) — behoben mit `pg_restore --no-owner` (Standardpraxis beim
|
||||
Restore in eine andere Umgebung/Rolle, Eigentümerschaft ist für den
|
||||
Restore-Nachweis irrelevant). Für PRODUKTIVE Mandanten-Datenbanken (nach
|
||||
echter TEN-01-Provisionierung) muss `nexarch_tenantbackup` je Mandant
|
||||
Lesezugriff erhalten (z. B. Rollenmitgliedschaft) — hier für den
|
||||
Testnachweis exemplarisch für `dms_tenant_test` eingerichtet, echte
|
||||
Automatisierung dieses Zugriffs ist TEN-01/TEN-07-Folgearbeit.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/tenantbackup.Backup` — `pg_dump -Fc` für genau eine
|
||||
Datenbank.
|
||||
- `internal/tenantbackup.Verify` — `pg_restore -l`, volle
|
||||
Inhaltslisten-Prüfung (nicht nur Dateikopf).
|
||||
- `internal/tenantbackup.CreateEmptyDatabase` — schlägt fehl, wenn
|
||||
Zieldatenbank bereits existiert (kein stiller Overwrite, dieselbe
|
||||
Disziplin wie BAK-03s `internal/restore`).
|
||||
- `internal/tenantbackup.Restore` — `pg_restore --no-owner`.
|
||||
- `internal/tenantbackup.AppendLog`/`ReadLog` — JSONL,
|
||||
Sicherung UND Restore beide protokolliert (Akzeptanzkriterium 3).
|
||||
- `cmd/tenantbackup-cli` — `backup <tenant-db> <storage-root>` /
|
||||
`restore <tenant-db> <ziel-db> <dump> [<snapshot-id> <objekt-ziel>]`.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Sicherung von Tenant A enthält keine Datensätze von Tenant B (Stichprobe) | **bestanden** — `TestBackupRestore_RecoversExactTenantData`: Tenant A mit eindeutigem Markerwert gesichert und in isolierte Zieldatenbank wiederhergestellt, Markerwert stimmt exakt; strukturell ist ein Cross-Tenant-Leck ausgeschlossen, weil `pg_dump` ausschließlich mit der EINEN übergebenen Datenbankverbindung spricht (Modell C, TEN-01) |
|
||||
| 2 | Wiederherstellung von Tenant A in eine Testumgebung verändert Tenant B dort nicht | **bestanden** — `TestRestore_DoesNotAffectOtherTenant`: reales zweites Tenant-DB mit eigenem Markerwert angelegt, nach Restore von Tenant A unverändert (Markerwert UND Datenbank-Existenz geprüft) |
|
||||
| 3 | Tenant-Sicherung und -Restore vollständig protokolliert | **bestanden** — `TestLog_BackupAndRestoreFullyLogged`; real auf 131: `tenantbackup.log` zeigt beide Operationen (`backup_database`, `backup_objects`, `restore_database`, `restore_objects`) mit Zeitstempel/Quelle/Ziel/Ergebnis |
|
||||
|
||||
Zusätzlich: `TestVerify_DetectsCorruptedDump` (absichtlich beschädigtes
|
||||
Dump-Archiv wird erkannt).
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `tenantbackup-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- Eigene Postgres-Rolle `nexarch_tenantbackup` (`CREATEDB`, kein
|
||||
Superuser) angelegt — getrennt von `nexarch_backup` (Prinzip
|
||||
geringster Rechte)
|
||||
- `/etc/nexarch/archive-tenantbackup.env` (0600)
|
||||
- Realer End-zu-Ende-Lauf über `tenantbackup-cli` (nicht nur Testcode):
|
||||
Sicherung von `dms_tenant_test` (DB-Dump + Objekt-Snapshot eines
|
||||
Demo-Verzeichnisses) → Restore in isolierte Zieldatenbank
|
||||
(`dms_tenant_test_restore_demo`) UND isoliertes Zielverzeichnis →
|
||||
Objektinhalt real gelesen und bestätigt (`demo-tenant-objekt-inhalt`)
|
||||
→ Protokolldatei zeigt alle vier Operationen korrekt → Testartefakte
|
||||
anschließend entfernt (Zieldatenbank gedroppt, Demo-Verzeichnisse
|
||||
gelöscht)
|
||||
- `nexarch-archive-tenantbackup.{service,timer}.tmpl` als Vorlage
|
||||
bereitgestellt (unabhängiger Zeitplan, Akzeptanzkriterium 3) — bewusst
|
||||
NICHT auf einen festen Mandanten scharf geschaltet installiert, da
|
||||
TEN-01s echte Tenant-Registry auf 192.168.1.131 noch nicht produktiv
|
||||
befüllt ist (nur die Test-Tenant-DB `dms_tenant_test` existiert); reale
|
||||
Aktivierung pro Mandant folgt, sobald eine echte Registry-Abfrage dafür
|
||||
vorliegt (dokumentierter, kein stiller Gap)
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 7/7 Pakete mit Tests ok (backup, objectbackup, reconcile, restore, restoretest, scrub, tenantbackup), 0 Fehlschläge
|
||||
```
|
||||
|
||||
`internal/tenantbackup`-Tests brauchen eine eigene Rolle mit `CREATEDB`
|
||||
(`TEST_TENANTBACKUP_PG_USER`, NICHT `TEST_BACKUP_PG_USER` — bewusst
|
||||
getrennt, siehe Betriebsrollen-Hinweis oben): 4/4 Tests bestanden.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — sowohl testgetrieben (echte
|
||||
Zwei-Tenant-Isolation in beide Richtungen bewiesen) als auch über einen
|
||||
echten CLI-Lauf auf 192.168.1.131. Ein architektonischer Fund vor
|
||||
Implementierungsbeginn (Cluster- vs. Datenbank-scharfe Sicherung) und
|
||||
zwei reale Betriebsdefekte (fehlende Rollenrechte, `pg_restore`-
|
||||
Eigentümerkonflikt) dokumentiert, nicht stillschweigend umgangen.
|
||||
@@ -0,0 +1,119 @@
|
||||
# BAK-05 – Prüfprotokoll: Reconciliation / Konsistenzprüfung Storage vs. DB
|
||||
|
||||
Voraussetzung BAK-01, BAK-02 (Welle 1) – erledigt, siehe eigene Protokolle.
|
||||
|
||||
## Grundsatzentscheidung: reine Funktion + zwei Quell-Adapter
|
||||
|
||||
`internal/reconcile.Reconcile` ist eine reine Funktion ohne DB-/Storage-
|
||||
Zugriff (leicht ohne echte Infrastruktur testbar), die Ein- und
|
||||
Auslesen echter Systeme ist strikt in `sources.go` getrennt
|
||||
(`ListDBStorageKeys` gegen echtes Postgres, `ListStorageObjects` gegen
|
||||
echtes Dateisystem). Beide Seiten liefern nur SCHLÜSSEL – niemals Inhalt
|
||||
– dadurch bleibt BAK-05 sauber getrennt von BAK-08 (Inhalts-/Prüfsummen-
|
||||
verifikation, eigene Fehlerklasse, eigenes Ticket).
|
||||
|
||||
Report-Format bewusst deterministisch: alle drei Ergebnislisten
|
||||
(`missing_in_storage`, `orphaned_in_storage`, `existing_in_storage`)
|
||||
nach `storage_key` aufsteigend sortiert.
|
||||
|
||||
**Nachtrag (nach Rückfrage vor BAK-08-Start):** Der ursprüngliche Report
|
||||
enthielt nur die beiden Abweichungslisten – keine Liste der bestätigt
|
||||
existierenden Objekte. Für BAK-08 als Stichprobengrundlage reicht
|
||||
"keine Abweichung" nicht, es braucht die tatsächliche, deterministisch
|
||||
sortierte Liste. Ergänzt: `Report.ExistingInStorage` – DB-Eintrag UND
|
||||
Storage-Objekt beide vorhanden, reine Existenzbestätigung (keine
|
||||
Inhaltsprüfung, Scope-Trennung zu BAK-08 bleibt gewahrt), aufsteigend
|
||||
nach `storage_key` sortiert. BAK-08 zieht seine Stichprobe daraus, ohne
|
||||
selbst zu sortieren/filtern. Neuer Test
|
||||
`TestReconcile_ExistingInStorageIsStableSamplingBasis` beweist Inhalt
|
||||
und Sortierung. Real neu gebaut, getestet (9/9) und auf 131 erneut
|
||||
ausgelöst – Journal zeigt das Feld `existing_in_storage` im Report.
|
||||
|
||||
Meldeweg über OPS-05 (wie später BAK-08) wurde als offene Design-Frage
|
||||
aufgeworfen, aber nicht zur Vorbedingung gemacht – hier bewusst noch
|
||||
nicht umgesetzt (kein OPS-05-Abhängigkeitseintrag im Board für BAK-05);
|
||||
Report wird aktuell nur als JSON auf stdout ausgegeben und per
|
||||
Exit-Code (1 bei Abweichungen) für systemd/Monitoring sichtbar gemacht.
|
||||
Anbindung an OPS-05 kann bei Bedarf nachgezogen werden, ohne
|
||||
`Reconcile` selbst zu ändern.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/reconcile.Reconcile(dbEntries, storageKeys) Report` – reine
|
||||
Vergleichsfunktion, liefert `MissingInStorage`/`OrphanedInStorage`,
|
||||
`Report.IsClean()` als eindeutiges Sauber-Merkmal.
|
||||
- `internal/reconcile.ListDBStorageKeys` – liest `file_revisions`
|
||||
(DMS FDN-02) per direktem SQL aus derselben physischen Tenant-DB
|
||||
(Modell C, Core TEN-01) – kein Import von DMS-Go-Paketen möglich
|
||||
(eigenes Go-Modul), daher reiner SQL-Zugriff gegen das dokumentierte
|
||||
Schema.
|
||||
- `internal/reconcile.ListStorageObjects` – durchläuft den lokalen
|
||||
FDN-03-`LocalDriver`-Basisordner (`filepath.WalkDir`), liefert `nil,
|
||||
nil` bei fehlendem Verzeichnis statt Fehler (noch keine Objekte ist
|
||||
kein Fehlerzustand).
|
||||
- `cmd/reconcile-cli` – liest `NEXARCH_RECONCILE_TENANT_DSN` und
|
||||
`NEXARCH_RECONCILE_STORAGE_DIR`, gibt Report als JSON auf stdout aus,
|
||||
Exit-Code 1 bei Abweichungen.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Datenbankeintrag ohne Storage-Objekt wird erkannt | **bestanden** — `TestReconcile_DetectsMissingInStorage` |
|
||||
| 2 | Storage-Objekt ohne Datenbankeintrag wird erkannt | **bestanden** — `TestReconcile_DetectsOrphanedInStorage` |
|
||||
| 3 | Lauf ohne Abweichungen liefert leeren, eindeutig sauberen Bericht | **bestanden** — `TestReconcile_CleanRunProducesEmptyReport` (zusätzlich `IsClean()`-Konsistenzprüfung) |
|
||||
|
||||
Zusätzlich (Nutzervorgaben, nicht explizit im Ticket als Pflichtprüfung
|
||||
benannt, aber zentral für die Abgrenzung/Weiterverwendbarkeit):
|
||||
|
||||
- `TestReconcile_ExistingButCorruptedObjectProducesNoFinding` – Nachweis,
|
||||
dass Reconcile AUSSCHLIESSLICH Existenz prüft, niemals Inhalt (Trennung
|
||||
von BAK-08).
|
||||
- `TestReconcile_DeterministicOrdering` – zwei Läufe mit identischer
|
||||
Eingabe liefern identische Reihenfolge, aufsteigend nach `storage_key`.
|
||||
- `TestListDBStorageKeys_ReadsRealFileRevisions` – liest echt gegen die
|
||||
gemeinsame Tenant-Testdatenbank `dms_tenant_test` (reales DMS-FDN-02-
|
||||
Schema, kein Mock).
|
||||
- `TestListStorageObjects_WalksRealDirectory` /
|
||||
`_MissingDirectoryReturnsEmpty` – echtes Dateisystem, kein Mock.
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `reconcile-cli` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- `/etc/nexarch/archive-reconcile.env` (0600): `NEXARCH_RECONCILE_TENANT_DSN`
|
||||
zeigt auf die gemeinsame Tenant-Testdatenbank `dms_tenant_test`
|
||||
(DMS selbst läuft auf 192.168.1.131 noch nicht als eigener systemd-
|
||||
Dienst mit persistenter Konfiguration – dies ist die real verfügbare
|
||||
Tenant-DB mit echtem FDN-02-Schema, dokumentierter bekannter Stand,
|
||||
kein stiller Mock); `NEXARCH_RECONCILE_STORAGE_DIR` zeigt auf
|
||||
`/var/nexarch-archiv/dms-objects` (persistentes ZFS-Dataset, NICHT
|
||||
`/var/nexarch-test/`).
|
||||
- Timer `nexarch-archive-reconcile.timer` installiert und aktiviert
|
||||
(täglich 05:00 UTC), `systemctl list-timers` bestätigt scharf.
|
||||
- `systemctl start nexarch-archive-reconcile.service` real ausgelöst:
|
||||
`status=0/SUCCESS`, Journal zeigt echten JSON-Report
|
||||
(`missing_in_storage: null, orphaned_in_storage: null` – Tenant-DB
|
||||
aktuell leer, daher sauberer Bericht, keine synthetische Ausgabe).
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 3/3 Pakete mit Tests ok (internal/backup, internal/objectbackup, internal/reconcile), 0 Fehlschläge
|
||||
```
|
||||
|
||||
`internal/reconcile`-Tests separat mit gesetzter `TEST_TENANT_DSN` gegen
|
||||
`dms_tenant_test` verifiziert: 9/9 Tests bestanden (6 reine
|
||||
`Reconcile`-Tests + 3 `sources.go`-Integrationstests).
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle Pflicht- sowie
|
||||
Nutzervorgaben-Prüfungen real erfüllt (echte Postgres-Instanz, echtes
|
||||
Dateisystem, echter systemd-Lauf). Zwei Testfehler während der
|
||||
Entwicklung (Schema-Abweichung `revision_number` NOT NULL in der realen
|
||||
`dms_tenant_test`-Tabelle; inkonsistente Fixture-Daten in
|
||||
`TestReconcile_DeterministicOrdering`) gefunden und korrigiert – beide
|
||||
waren Testautorenfehler, keine Fehler in `Reconcile` selbst.
|
||||
@@ -0,0 +1,110 @@
|
||||
# BAK-06 – Prüfprotokoll: Restore-Testverfahren
|
||||
|
||||
Voraussetzung BAK-03 – erledigt, siehe eigenes Protokoll.
|
||||
|
||||
## Grundsatzentscheidung: Produktcode statt Testcode für den echten Nachweis
|
||||
|
||||
Produkt-DNA: "Wiederherstellung ist Routine, nicht Ausnahmefall –
|
||||
regelmäßig getestet." Ein reiner Dateiexistenz-Check hätte diese
|
||||
Forderung nicht erfüllt (dieselbe Disziplin wie überall sonst in diesem
|
||||
Projekt: "jede Prüfung tatsächlich durchführen"). `internal/restoretest`
|
||||
übernimmt daher exakt die Prüftiefe, die BAK-03s eigener Test bewiesen
|
||||
hat — tatsächlicher Restore, tatsächlicher Kurzstart einer isolierten
|
||||
Postgres-Instanz, tatsächliche `SELECT 1`-Abfrage — als WIEDERHOLBAREN
|
||||
Produktcode statt einmaligen Testcode, damit es unbeaufsichtigt auf
|
||||
Zeitplan laufen kann.
|
||||
|
||||
Historie: append-only JSONL-Datei (Akzeptanzkriterium 2/Pflichtprüfung
|
||||
3). Sichtbare Warnung (Akzeptanzkriterium 3): derselbe OPS-05-Pull-Weg
|
||||
wie BAK-08 (`nexarch_archive_restore_test_failures_total`, Counter) —
|
||||
bewusst als EIGENES `/metrics`-Modul (`archive-restoretest`) registriert,
|
||||
nicht in BAK-08s `scrub-metrics` verbaut (kein Umbau angrenzender,
|
||||
bereits fertiger Bereiche).
|
||||
|
||||
## Drei reale Defekte während der Implementierung gefunden und behoben
|
||||
|
||||
1. **Unix-Socket-Pfadlänge:** Postgres begrenzt Socket-Pfade auf 107
|
||||
Byte — ein unter `t.TempDir()` verschachtelter Pfad reißt dieses
|
||||
Limit leicht. Fix: eigenes, kurzes Socket-Verzeichnis
|
||||
(`os.MkdirTemp("", ...)`), nicht unter dem Testverzeichnis.
|
||||
2. **`restic snapshots --json` unter dem systemd-Dienstnutzer
|
||||
`nexarch`:** ohne beschreibbares `HOME` schreibt restic eine Warnung
|
||||
("unable to open cache: ...") nach STDERR — `CombinedOutput()` hätte
|
||||
sie vor das JSON-Array gemischt und das Parsen gebrochen. Fix: nur
|
||||
`cmd.Output()` (stdout), stderr separat für Fehlermeldungen.
|
||||
3. Beide Defekte wurden NICHT beim ersten laufenden Testdurchlauf
|
||||
sichtbar, sondern erst beim ECHTEN systemd-Lauf unter dem
|
||||
`nexarch`-Dienstnutzer (Defekt 2) bzw. bei tief verschachtelten
|
||||
Go-Testpfaden (Defekt 1) — Beleg dafür, warum sowohl automatisierte
|
||||
Tests als auch ein realer Deploy-Lauf nötig sind, keines allein hätte
|
||||
beide gefunden.
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `internal/restoretest.RunDatabaseTest` — neueste Generation ermitteln
|
||||
(`backup.ListGenerations`), `backup.Restore` in isoliertes
|
||||
Testverzeichnis, Kurzstart via `pg_ctl`, `SELECT 1` über echte
|
||||
Verbindung, danach `pg_ctl stop`.
|
||||
- `internal/restoretest.RunObjectTest` — neuesten Snapshot ermitteln,
|
||||
`objectbackup.Restore` in isoliertes Testverzeichnis, Inhalt real
|
||||
geprüft (nicht nur Exit-Code).
|
||||
- `internal/restoretest.AppendHistory`/`ReadHistory` — JSONL,
|
||||
append-only.
|
||||
- `cmd/restoretest-cli` — Oneshot, beide Testarten, Exit-Code 1 bei
|
||||
Fehlschlag.
|
||||
- `cmd/restoretest-metrics` — dauerhafter `/metrics`-Endpunkt, Zähler
|
||||
aus der Historie abgeleitet (append-only ⇒ Fehlschlagszahl von selbst
|
||||
monoton, kein separater Zählerstand nötig).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Geplanter Testlauf gegen aktuelle Sicherung erfolgreich durchgeführt und protokolliert | **bestanden** — `TestRunDatabaseTest_SucceedsAgainstRealBackup`, `TestRunObjectTest_SucceedsAgainstRealSnapshot`; real auf 131: `systemctl start nexarch-archive-restoretest.service` → beide Testarten `erfolg=true`, in `history.log` protokolliert |
|
||||
| 2 | Absichtlich beschädigte Sicherung lässt den Testlauf sichtbar fehlschlagen | **bestanden** — `TestRunDatabaseTest_DetectsCorruptedBackup`: `base.tar.gz` durch Datenmüll ersetzt, `RunDatabaseTest` liefert `Success=false` mit aussagekräftigem Detail |
|
||||
| 3 | Protokollhistorie zeigt mehrere zurückliegende Testläufe nachvollziehbar an | **bestanden** — `TestHistory_ShowsMultiplePastRunsInOrder`: drei Einträge angehängt, in exakt derselben Reihenfolge gelesen |
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `restoretest-cli`, `restoretest-metrics` gebaut nach
|
||||
`/opt/nexarch-archive/bin/`
|
||||
- `/etc/nexarch/archive-restoretest.env` (0600)
|
||||
- `nexarch-archive-restoretest.timer` installiert/aktiviert (wöchentlich
|
||||
So. 07:00 UTC), `nexarch-archive-restoretest-metrics.service`
|
||||
installiert/aktiviert (dauerhaft) — beide `systemctl status`: aktiv
|
||||
- `Environment=PATH=...` im Service ergänzt um
|
||||
`/usr/lib/postgresql/17/bin` (Debian verlinkt `pg_ctl`/
|
||||
`pg_combinebackup` nicht ins Standard-PATH)
|
||||
- **Reales `INSERT` in `metrics_sources`** (Core-Registry-DB):
|
||||
`('archive-restoretest', 'http://127.0.0.1:8091/metrics')`
|
||||
- **End-to-End über OPS-03 bestätigt**: `curl http://127.0.0.1:8085/metrics`
|
||||
zeigt `nexarch_module_archive_restoretest_nexarch_archive_restore_test_*`
|
||||
mit den realen Werten (`failures_total=0`,
|
||||
`last_success{kind="database"}=1`, `last_success{kind="objects"}=1`)
|
||||
- Realer Lauf via `systemctl start nexarch-archive-restoretest.service`:
|
||||
beide Testarten erfolgreich, Journal zeigt Details, `/metrics` und
|
||||
OPS-03-Aggregation stimmen überein
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 6/6 Pakete mit Tests ok (backup, objectbackup, reconcile, restore, restoretest, scrub), 0 Fehlschläge
|
||||
```
|
||||
|
||||
Hinweis wie bei BAK-03: die Datenbank-Restore-Tests
|
||||
(`TestRunDatabaseTest_*`) brauchen `pg_ctl`/`pg_combinebackup` im PATH
|
||||
und laufen NICHT als root — separat als `postgres`-Systemnutzer
|
||||
verifiziert (7/7 `internal/restoretest`-Tests bestanden), im normalen
|
||||
root-`make check`-Lauf werden sie mit klarer Meldung übersprungen.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei
|
||||
Pflichtprüfungen real erfüllt — sowohl testgetrieben als auch über einen
|
||||
echten, unbeaufsichtigten systemd-Lauf mit OPS-03/OPS-05-Sichtbarkeit
|
||||
nachgewiesen. Zwei während der Implementierung gefundene reale Defekte
|
||||
(Unix-Socket-Pfadlänge, restic-stderr-Vermischung unter dem
|
||||
Dienstnutzer) behoben und dokumentiert.
|
||||
@@ -0,0 +1,140 @@
|
||||
# BAK-08 – Prüfprotokoll: Checksum-basierte Objekt-Integritätsprüfung
|
||||
|
||||
Voraussetzungen BAK-05, FDN-04, FDN-09, OPS-05 – alle erledigt, siehe
|
||||
eigene Protokolle. Vor Start zwei offene Rückfragen geklärt (siehe unten).
|
||||
|
||||
## Grundsatzentscheidung: eigener Zustand statt file_revisions.created_at
|
||||
|
||||
`created_at` als Alterskriterium hätte immer dieselben "ältesten" Objekte
|
||||
gescrubbt und den Rest nie erreicht — kein echtes Rotationsverhalten.
|
||||
Stattdessen eigene Archive-Tabelle `scrub_state` (`storage_key` →
|
||||
`last_scrubbed_at`, `last_result`), Migration
|
||||
`migrations/0001_scrub_state.up.sql`. `internal/scrub.Sample` ist eine
|
||||
reine Funktion: nimmt BAK-05s `existing_in_storage` (deterministisch
|
||||
sortiert) entgegen, filtert Objekte innerhalb der konfigurierbaren
|
||||
Cooldown-Frist heraus, priorisiert danach nach `last_scrubbed_at`
|
||||
aufsteigend (nie geprüft = ältestmöglicher Wert), begrenzt auf die
|
||||
konfigurierte Stichprobengröße — kein Voll-Sort über den gesamten
|
||||
Bestand bei jedem Lauf (Nutzerhinweis zum Kostenfaktor bei 10⁵+
|
||||
Objekten: die WHERE-artige Cooldown-Filterung reduziert die Kandidatenmenge
|
||||
VOR der Sortierung, nur die Kandidaten selbst werden sortiert, nicht der
|
||||
komplette Bestand).
|
||||
|
||||
## Nachtrag: zwei Rückfragen vor Implementierungsbeginn geklärt
|
||||
|
||||
1. **OPS-05-Anbindung ist Pull, nicht Push.** OPS-05 (`internal/alerting`,
|
||||
Core) ist real implementiert, aber Core OPS-03 scrapt `/metrics`-URLs
|
||||
registrierter Module (`metrics_sources`-Tabelle in der Core-Registry-
|
||||
DB, `SourceStore.RegisterSource`) — kein Push-API. Für BAK-08 daher
|
||||
ein eigener, DAUERHAFT laufender Endpunkt (`cmd/scrub-metrics`,
|
||||
getrennt vom Oneshot-`scrub-cli`, dessen Prozess nach jedem Lauf endet
|
||||
und zum Scrape-Zeitpunkt nicht erreichbar wäre). Metrik als Counter
|
||||
(`nexarch_archive_storage_integrity_failures_total`), monoton
|
||||
steigend — kein Gauge, kein Rücksetzen bei behobenem Befund. Kein
|
||||
Befund = Wert bleibt unverändert (kein Dauer-Alarm durch andauernden
|
||||
"Fehler"-Zustand). Scope-Trennung gewahrt: `scrub-cli`/`scrub-metrics`
|
||||
erzeugen selbst KEIN Alert-Objekt — Schwellwert/Drosselung bleiben
|
||||
OPS-05-eigene Konfiguration (Alert-Regel wird separat über
|
||||
`alerting.RuleStore.CreateRule` angelegt, nicht Teil dieses Tickets).
|
||||
**CFG-04 war eine Verwechslung** (das ist die
|
||||
Benachrichtigungs-Einstellungen-Oberfläche, ein anderes Ticket) — die
|
||||
tatsächlich nötige "Config"-Aktion ist ein `INSERT` in
|
||||
`metrics_sources` (Core-Registry-DB), kein UI/Ticket-Abhängigkeit.
|
||||
Real ausgeführt (siehe „Echte Verdrahtung" unten).
|
||||
2. **Sampling-Kriterium.** Siehe Grundsatzentscheidung oben —
|
||||
`scrub_state.last_scrubbed_at` statt `file_revisions.created_at`,
|
||||
Cooldown-Filterung vor Sortierung, feste Stichprobengröße (Top-N,
|
||||
deterministisch, keine Zufallsstichprobe — Nutzerpräferenz für
|
||||
Reproduzierbarkeit im Protokoll).
|
||||
|
||||
## Umsetzung
|
||||
|
||||
- `migrations/0001_scrub_state.up.sql`/`.down.sql` — `scrub_state`,
|
||||
`scrub_counters` (Einzelzeile, monotoner Zähler).
|
||||
- `internal/scrub.Sample` — reine Funktion, Cooldown-Filter + Alt-
|
||||
Priorisierung + Stichprobenbegrenzung.
|
||||
- `internal/scrub.LoadLastScrubbed`/`MarkScrubbed`/`RecordFinding`/
|
||||
`FindingsTotal` — DB-Zugriff auf `scrub_state`/`scrub_counters`,
|
||||
`MarkScrubbed` idempotent (`ON CONFLICT`) für unterbrechbare Läufe.
|
||||
- `internal/scrub.ExpectedChecksums` — eigene, minimale Abfrage gegen
|
||||
`file_revisions` (keine Erweiterung von `reconcile.DBEntry` — BAK-05
|
||||
bleibt existenz-only).
|
||||
- `internal/scrub.ActualChecksum` — echtes Lesen der Datei + SHA-256,
|
||||
kein Header-/Größenvergleich.
|
||||
- `cmd/scrub-cli` — Oneshot: BAK-05-Reconcile → `Sample` → pro Kandidat
|
||||
Checksum-Vergleich → `MarkScrubbed` + bei Abweichung `RecordFinding` →
|
||||
JSON-Bericht auf stdout, Exit-Code 1 bei Befunden (gemeldet, nicht
|
||||
automatisch repariert).
|
||||
- `cmd/scrub-metrics` — dauerhafter `/metrics`-Endpunkt, liest
|
||||
`scrub_counters.findings_total`.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Absichtlich veränderter Objektinhalt wird als Abweichung erkannt | **bestanden** — real: Testobjekt mit absichtlich falscher `checksum_sha256` in `dms_tenant_test` angelegt, echte Datei ins Storage-Verzeichnis gelegt, `scrub-cli` real über systemd ausgelöst: Befund im JSON-Bericht, Exit-Code 1, `scrub_counters.findings_total` real von 0 auf 1 erhöht (siehe Journal-Auszug unten) |
|
||||
| 2 | Sampling priorisiert alte/nie geprüfte Objekte, nicht neue | **bestanden** — `TestSample_PrioritizesNeverScrubbedAndOldest`: nie geprüftes Objekt kommt vor einem vor 30 Tagen geprüften, dieses vor einem vor 1 Tag geprüften |
|
||||
| 3 | Wiederholter Lauf ohne neue Objekte meldet nichts erneut (kein Spam) / idempotent bei Unterbrechung | **bestanden** — real: zweiter `scrub-cli`-Lauf direkt nach dem ersten liefert `sampled: 0` (Cooldown greift), `TestMarkScrubbed_IsIdempotent` beweist wiederholtes Markieren ohne Duplikat |
|
||||
|
||||
Zusätzlich: `TestSample_RespectsCooldown`,
|
||||
`TestSample_LimitsToSampleSize`, `TestSample_DeterministicForIdenticalInput`,
|
||||
`TestRecordFinding_IsMonotonicallyIncreasing`,
|
||||
`TestActualChecksum_MatchesRealFileContent` (echter Dateiinhalt, echtes
|
||||
SHA-256), `TestExpectedChecksums_ReadsRealFileRevisions` (echtes
|
||||
Postgres, kein Mock).
|
||||
|
||||
## Echte Verdrahtung auf 192.168.1.131
|
||||
|
||||
- `scrub-cli`, `scrub-metrics` gebaut nach `/opt/nexarch-archive/bin/`
|
||||
- `/etc/nexarch/archive-scrub.env`, `/etc/nexarch/archive-scrub-metrics.env`
|
||||
(0600)
|
||||
- Migration real gegen `dms_tenant_test` angewendet
|
||||
(`psql -f migrations/0001_scrub_state.up.sql`)
|
||||
- `nexarch-archive-scrub.timer` installiert/aktiviert (täglich 06:00
|
||||
UTC), `nexarch-archive-scrub-metrics.service` installiert/aktiviert
|
||||
(dauerhaft, `Restart=on-failure`) — beide `systemctl status`: aktiv
|
||||
- **Reales `INSERT` in `metrics_sources`** (Core-Registry-DB
|
||||
`nexarch_registry`): `('archive', 'http://127.0.0.1:8090/metrics')` —
|
||||
bestätigt über `SELECT * FROM metrics_sources`
|
||||
- **End-to-End über OPS-03 bestätigt**: `curl http://127.0.0.1:8085/metrics`
|
||||
(Core-Aggregator) zeigt `nexarch_module_archive_nexarch_archive_storage_integrity_failures_total`
|
||||
— reale Umbenennung gemäß OPS-03-Namenskonvention, kein synthetischer
|
||||
Wert
|
||||
- Realer Befund-Durchlauf: Testobjekt mit absichtlich falscher Prüfsumme
|
||||
angelegt → `scrub-cli` real via `systemctl start` ausgelöst → Befund im
|
||||
Journal, `scrub_counters.findings_total` real 0→1, sichtbar sowohl auf
|
||||
`scrub-metrics` als auch über den Core-Aggregator → Testdaten
|
||||
anschließend bereinigt (`file_revisions`/`documents`/`users`-Zeilen
|
||||
gelöscht, `scrub_state`/`scrub_counters` zurückgesetzt, Testdatei
|
||||
entfernt)
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 4/4 Pakete mit Tests ok (internal/backup, internal/objectbackup, internal/reconcile, internal/scrub), 0 Fehlschläge
|
||||
```
|
||||
|
||||
`internal/scrub`-Tests separat mit gesetzter `TEST_TENANT_DSN` gegen
|
||||
`dms_tenant_test` verifiziert: 8/8 Tests bestanden.
|
||||
|
||||
## Bekannte Grenze (aus Ticket übernommen, nicht Teil der Abnahme)
|
||||
|
||||
Der Job erkennt Abweichungen nur bei Objekten, die gelesen und erneut
|
||||
geprüft werden können. Ersetzt keine storage-seitige WORM-/
|
||||
Versionierungsstrategie und keine Zugriffs-/Audit-Logs des
|
||||
Storage-Providers (`STORAGE-KONZEPT.md` Abschnitt 6.1) — bei extern
|
||||
eingebundenem, nicht-kompatiblem Kunden-Storage (Betriebsmodus 3, ohne
|
||||
Versioning/Object Lock/Audit-Logs) bleibt eine Lücke, die BAK-08
|
||||
technisch nicht schließen kann.
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle sechs Akzeptanzkriterien und alle drei Pflicht-
|
||||
prüfungen real erfüllt — inklusive echtem Ende-zu-Ende-Nachweis über
|
||||
Core OPS-03/OPS-05 (kein Stub, reale `/metrics`-Registrierung und
|
||||
-Aggregation). Beide vor Implementierungsbeginn gestellten Rückfragen
|
||||
(OPS-05-Anbindungsmechanismus, Sampling-Kriterium) im Protokoll
|
||||
dokumentiert und in der Umsetzung berücksichtigt.
|
||||
@@ -0,0 +1,14 @@
|
||||
module gitea.perlbach24.de/scripte/nexarch/archive
|
||||
|
||||
go 1.22
|
||||
|
||||
require github.com/jackc/pgx/v5 v5.6.0
|
||||
|
||||
require (
|
||||
github.com/jackc/pgpassfile v1.0.0 // indirect
|
||||
github.com/jackc/pgservicefile v0.0.0-20221227161230-091c0ba34f0a // indirect
|
||||
github.com/jackc/puddle/v2 v2.2.1 // indirect
|
||||
golang.org/x/crypto v0.17.0 // indirect
|
||||
golang.org/x/sync v0.1.0 // indirect
|
||||
golang.org/x/text v0.14.0 // indirect
|
||||
)
|
||||
@@ -0,0 +1,28 @@
|
||||
github.com/davecgh/go-spew v1.1.0/go.mod h1:J7Y8YcW2NihsgmVo/mv3lAwl/skON4iLHjSsI+c5H38=
|
||||
github.com/davecgh/go-spew v1.1.1 h1:vj9j/u1bqnvCEfJOwUhtlOARqs3+rkHYY13jYWTU97c=
|
||||
github.com/davecgh/go-spew v1.1.1/go.mod h1:J7Y8YcW2NihsgmVo/mv3lAwl/skON4iLHjSsI+c5H38=
|
||||
github.com/jackc/pgpassfile v1.0.0 h1:/6Hmqy13Ss2zCq62VdNG8tM1wchn8zjSGOBJ6icpsIM=
|
||||
github.com/jackc/pgpassfile v1.0.0/go.mod h1:CEx0iS5ambNFdcRtxPj5JhEz+xB6uRky5eyVu/W2HEg=
|
||||
github.com/jackc/pgservicefile v0.0.0-20221227161230-091c0ba34f0a h1:bbPeKD0xmW/Y25WS6cokEszi5g+S0QxI/d45PkRi7Nk=
|
||||
github.com/jackc/pgservicefile v0.0.0-20221227161230-091c0ba34f0a/go.mod h1:5TJZWKEWniPve33vlWYSoGYefn3gLQRzjfDlhSJ9ZKM=
|
||||
github.com/jackc/pgx/v5 v5.6.0 h1:SWJzexBzPL5jb0GEsrPMLIsi/3jOo7RHlzTjcAeDrPY=
|
||||
github.com/jackc/pgx/v5 v5.6.0/go.mod h1:DNZ/vlrUnhWCoFGxHAG8U2ljioxukquj7utPDgtQdTw=
|
||||
github.com/jackc/puddle/v2 v2.2.1 h1:RhxXJtFG022u4ibrCSMSiu5aOq1i77R3OHKNJj77OAk=
|
||||
github.com/jackc/puddle/v2 v2.2.1/go.mod h1:vriiEXHvEE654aYKXXjOvZM39qJ0q+azkZFrfEOc3H4=
|
||||
github.com/pmezard/go-difflib v1.0.0 h1:4DBwDE0NGyQoBHbLQYPwSUPoCMWR5BEzIk/f1lZbAQM=
|
||||
github.com/pmezard/go-difflib v1.0.0/go.mod h1:iKH77koFhYxTK1pcRnkKkqfTogsbg7gZNVY4sRDYZ/4=
|
||||
github.com/stretchr/objx v0.1.0/go.mod h1:HFkY916IF+rwdDfMAkV7OtwuqBVzrE8GR6GFx+wExME=
|
||||
github.com/stretchr/testify v1.3.0/go.mod h1:M5WIy9Dh21IEIfnGCwXGc5bZfKNJtfHm1UVUgZn+9EI=
|
||||
github.com/stretchr/testify v1.7.0/go.mod h1:6Fq8oRcR53rry900zMqJjRRixrwX3KX962/h/Wwjteg=
|
||||
github.com/stretchr/testify v1.8.1 h1:w7B6lhMri9wdJUVmEZPGGhZzrYTPvgJArz7wNPgYKsk=
|
||||
github.com/stretchr/testify v1.8.1/go.mod h1:w2LPCIKwWwSfY2zedu0+kehJoqGctiVI29o6fzry7u4=
|
||||
golang.org/x/crypto v0.17.0 h1:r8bRNjWL3GshPW3gkd+RpvzWrZAwPS49OmTGZ/uhM4k=
|
||||
golang.org/x/crypto v0.17.0/go.mod h1:gCAAfMLgwOJRpTjQ2zCCt2OcSfYMTeZVSRtQlPC7Nq4=
|
||||
golang.org/x/sync v0.1.0 h1:wsuoTGHzEhffawBOhz5CYhcrV4IdKZbEyZjBMuTp12o=
|
||||
golang.org/x/sync v0.1.0/go.mod h1:RxMgew5VJxzue5/jJTE5uejpjVlOe/izrB70Jof72aM=
|
||||
golang.org/x/text v0.14.0 h1:ScX5w1eTa3QqT8oi6+ziP7dTV1S2+ALU0bI+0zXKWiQ=
|
||||
golang.org/x/text v0.14.0/go.mod h1:18ZOQIKpY8NJVqYksKHtTdi31H5itFRjB5/qKTNYzSU=
|
||||
gopkg.in/check.v1 v0.0.0-20161208181325-20d25e280405/go.mod h1:Co6ibVJAznAaIkqp8huTwlJQCZ016jof/cbN4VW5Yz0=
|
||||
gopkg.in/yaml.v3 v3.0.0-20200313102051-9f266ea9e77c/go.mod h1:K4uyk7z7BCEPqu6E+C64Yfv1cQ7kz7rIZviUmN+EgEM=
|
||||
gopkg.in/yaml.v3 v3.0.1 h1:fxVm/GzAzEWqLHuvctI91KS9hhNmmWOoWu0XTYJS7CA=
|
||||
gopkg.in/yaml.v3 v3.0.1/go.mod h1:K4uyk7z7BCEPqu6E+C64Yfv1cQ7kz7rIZviUmN+EgEM=
|
||||
@@ -0,0 +1,199 @@
|
||||
// Package backup implementiert BAK-01: automatisierte, inkrementelle
|
||||
// Sicherung der PostgreSQL-Datenbank per pg_basebackup (PostgreSQL 17s
|
||||
// natives inkrementelles Backup über WAL-Summarization, siehe
|
||||
// `summarize_wal`), mit Verifikation jeder Sicherung und
|
||||
// generationsbasierter Rotation. Kein pg_dump-basierter Ansatz, weil
|
||||
// pg_dump ausschließlich logische Vollsicherungen kennt — "inkrementell"
|
||||
// im Sinne des Tickets erfordert das physische, WAL-summary-gestützte
|
||||
// Verfahren aus PostgreSQL 17.
|
||||
package backup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"sort"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Config enthält die Verbindungsdaten für pg_basebackup — ausschließlich
|
||||
// über Umgebungsvariablen befüllt, nie im Code (siehe Ticket-Abschluss-
|
||||
// Regel).
|
||||
type Config struct {
|
||||
Host string
|
||||
Port string
|
||||
User string
|
||||
Password string
|
||||
BackupDir string
|
||||
PgBaseBackupPath string // Default "pg_basebackup", überschreibbar für Tests
|
||||
PgCombineBackupPath string // Default "pg_combinebackup", überschreibbar für Tests
|
||||
}
|
||||
|
||||
func (c Config) binary() string {
|
||||
if c.PgBaseBackupPath != "" {
|
||||
return c.PgBaseBackupPath
|
||||
}
|
||||
return "pg_basebackup"
|
||||
}
|
||||
|
||||
// FullBackupDirName/IncrementalDirName sind die festen Unterverzeichnis-
|
||||
// namen je Generation.
|
||||
const (
|
||||
FullBackupDirName = "full"
|
||||
IncrementalSubdir = "incremental"
|
||||
BackupManifestFile = "backup_manifest"
|
||||
BaseTarGzFile = "base.tar.gz"
|
||||
// WalTarGzFile: pg_basebackups Standard-WAL-Methode ist "stream" (WAL
|
||||
// wird waehrend der Sicherung parallel mitgestreamt) - bei -Ft/-z
|
||||
// landet dieser Strom in einer EIGENEN Archivdatei neben base.tar.gz.
|
||||
// Ohne dieses WAL ist die Sicherung NICHT crash-konsistent
|
||||
// wiederherstellbar (Postgres kann sonst keinen gueltigen Checkpoint
|
||||
// erreichen) - siehe Restore.
|
||||
WalTarGzFile = "pg_wal.tar.gz"
|
||||
)
|
||||
|
||||
// NewGenerationID liefert eine sortierbare, eindeutige Generation-Kennung
|
||||
// (RFC3339-artig, dateisystemtauglich) — Generationen werden anhand dieser
|
||||
// Kennung chronologisch sortiert (Rotate, ListGenerations).
|
||||
func NewGenerationID(t time.Time) string {
|
||||
return t.UTC().Format("20060102T150405Z")
|
||||
}
|
||||
|
||||
// FullBackup erstellt eine neue Vollsicherung (Akzeptanzkriterium 1) als
|
||||
// eigene Generation. Liefert den Pfad zum backup_manifest, das spätere
|
||||
// IncrementalBackup-Aufrufe als Referenz brauchen.
|
||||
func FullBackup(ctx context.Context, cfg Config, generationID string) (manifestPath string, err error) {
|
||||
dir := filepath.Join(cfg.BackupDir, generationID, FullBackupDirName)
|
||||
if err := os.MkdirAll(filepath.Dir(dir), 0o750); err != nil {
|
||||
return "", fmt.Errorf("backup: generationsverzeichnis anlegen: %w", err)
|
||||
}
|
||||
|
||||
args := []string{
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
|
||||
"-D", dir, "-Ft", "-z", "--checkpoint=fast", "--no-password",
|
||||
}
|
||||
if err := runPgBaseBackup(ctx, cfg, args); err != nil {
|
||||
return "", fmt.Errorf("backup: vollsicherung: %w", err)
|
||||
}
|
||||
return filepath.Join(dir, BackupManifestFile), nil
|
||||
}
|
||||
|
||||
// IncrementalBackup erstellt eine inkrementelle Sicherung gegen die zuletzt
|
||||
// bekannte Vollsicherung ODER die letzte Inkrement-Sicherung (priorManifestPath
|
||||
// zeigt jeweils auf das backup_manifest der Referenz).
|
||||
func IncrementalBackup(ctx context.Context, cfg Config, generationID, incrementID, priorManifestPath string) (manifestPath string, err error) {
|
||||
dir := filepath.Join(cfg.BackupDir, generationID, IncrementalSubdir, incrementID)
|
||||
if err := os.MkdirAll(filepath.Dir(dir), 0o750); err != nil {
|
||||
return "", fmt.Errorf("backup: inkrement-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
|
||||
args := []string{
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
|
||||
"-D", dir, "-Ft", "-z", "--checkpoint=fast", "--no-password",
|
||||
"--incremental=" + priorManifestPath,
|
||||
}
|
||||
if err := runPgBaseBackup(ctx, cfg, args); err != nil {
|
||||
return "", fmt.Errorf("backup: inkrementelle sicherung: %w", err)
|
||||
}
|
||||
return filepath.Join(dir, BackupManifestFile), nil
|
||||
}
|
||||
|
||||
// Restore kombiniert die Vollsicherung einer Generation mit allen ihren
|
||||
// Inkrementen (PostgreSQL 17s `pg_combinebackup`, das native Gegenstück zu
|
||||
// `pg_basebackup --incremental`) und schreibt das Ergebnis nach outputDir —
|
||||
// ein vollständiges, direkt startbares PGDATA-Verzeichnis. outputDir muss
|
||||
// bereits existieren und leer sein (pg_combinebackup-Vorgabe); Atomarität
|
||||
// gegenüber einem eventuell nicht-leeren ENDZIEL ist Aufgabe von
|
||||
// internal/restore, nicht dieser Funktion.
|
||||
//
|
||||
// pg_combinebackup erwartet PLAIN-Format-Eingabeverzeichnisse (Dateibaum),
|
||||
// FullBackup/IncrementalBackup speichern aber TAR+GZIP (`-Ft -z`, siehe
|
||||
// dort) — kleinere, einfacher zu prüfende Sicherungsdateien
|
||||
// (BAK-01-Entscheidung, hier NICHT verändert). Restore extrahiert daher
|
||||
// jede Stufe zunächst in ein eigenes temporäres Plain-Verzeichnis, bevor
|
||||
// pg_combinebackup darauf zugreift.
|
||||
func Restore(ctx context.Context, cfg Config, generationID, outputDir string) error {
|
||||
genDir := filepath.Join(cfg.BackupDir, generationID)
|
||||
tarDirs := []string{filepath.Join(genDir, FullBackupDirName)}
|
||||
|
||||
incrDir := filepath.Join(genDir, IncrementalSubdir)
|
||||
entries, err := os.ReadDir(incrDir)
|
||||
if err != nil && !os.IsNotExist(err) {
|
||||
return fmt.Errorf("backup: inkrement-verzeichnis lesen: %w", err)
|
||||
}
|
||||
incrementIDs := make([]string, 0, len(entries))
|
||||
for _, e := range entries {
|
||||
if e.IsDir() {
|
||||
incrementIDs = append(incrementIDs, e.Name())
|
||||
}
|
||||
}
|
||||
sort.Strings(incrementIDs) // Inkrement-IDs sind wie Generation-IDs chronologisch sortierbar
|
||||
for _, id := range incrementIDs {
|
||||
tarDirs = append(tarDirs, filepath.Join(incrDir, id))
|
||||
}
|
||||
|
||||
extractRoot, err := os.MkdirTemp("", "backup-restore-extract-*")
|
||||
if err != nil {
|
||||
return fmt.Errorf("backup: extraktions-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(extractRoot) }()
|
||||
|
||||
inputs := make([]string, 0, len(tarDirs))
|
||||
for i, tarDir := range tarDirs {
|
||||
plainDir := filepath.Join(extractRoot, fmt.Sprintf("%02d", i))
|
||||
if err := os.MkdirAll(plainDir, 0o700); err != nil {
|
||||
return fmt.Errorf("backup: plain-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
if err := extractTarGz(filepath.Join(tarDir, BaseTarGzFile), plainDir); err != nil {
|
||||
return fmt.Errorf("backup: %q extrahieren: %w", tarDir, err)
|
||||
}
|
||||
// backup_manifest liegt NEBEN base.tar.gz (von pg_basebackup so
|
||||
// geschrieben), nicht im Archiv selbst - pg_combinebackup braucht
|
||||
// es zusätzlich im Plain-Verzeichnis.
|
||||
manifestData, err := os.ReadFile(filepath.Join(tarDir, BackupManifestFile))
|
||||
if err != nil {
|
||||
return fmt.Errorf("backup: %q lesen: %w", filepath.Join(tarDir, BackupManifestFile), err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(plainDir, BackupManifestFile), manifestData, 0o600); err != nil {
|
||||
return fmt.Errorf("backup: manifest nach %q kopieren: %w", plainDir, err)
|
||||
}
|
||||
inputs = append(inputs, plainDir)
|
||||
}
|
||||
|
||||
binary := "pg_combinebackup"
|
||||
if cfg.PgCombineBackupPath != "" {
|
||||
binary = cfg.PgCombineBackupPath
|
||||
}
|
||||
args := append(append([]string{}, inputs...), "-o", outputDir)
|
||||
cmd := exec.CommandContext(ctx, binary, args...)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("backup: %s fehlgeschlagen: %w (ausgabe: %s)", binary, err, string(output))
|
||||
}
|
||||
|
||||
// pg_combinebackup rekonstruiert nur die Datendateien - das fuer einen
|
||||
// konsistenten Start noetige WAL kommt aus der ZULETZT gezogenen Stufe
|
||||
// (letztes Inkrement, sonst die Vollsicherung), nicht aus allen Stufen
|
||||
// zusammen (siehe WalTarGzFile-Dokumentation).
|
||||
lastTarDir := tarDirs[len(tarDirs)-1]
|
||||
walDir := filepath.Join(outputDir, "pg_wal")
|
||||
if err := os.MkdirAll(walDir, 0o700); err != nil {
|
||||
return fmt.Errorf("backup: pg_wal-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
if err := extractTarGz(filepath.Join(lastTarDir, WalTarGzFile), walDir); err != nil {
|
||||
return fmt.Errorf("backup: WAL aus %q wiederherstellen: %w", lastTarDir, err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
func runPgBaseBackup(ctx context.Context, cfg Config, args []string) error {
|
||||
cmd := exec.CommandContext(ctx, cfg.binary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("%s fehlgeschlagen: %w (ausgabe: %s)", cfg.binary(), err, string(output))
|
||||
}
|
||||
return nil
|
||||
}
|
||||
@@ -0,0 +1,187 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
func requireTestConfig(t *testing.T) Config {
|
||||
t.Helper()
|
||||
user := os.Getenv("TEST_BACKUP_PG_USER")
|
||||
if user == "" {
|
||||
t.Skip("TEST_BACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen (braucht echten Postgres mit REPLICATION-Rolle)")
|
||||
}
|
||||
return Config{
|
||||
Host: envOr("TEST_BACKUP_PG_HOST", "localhost"),
|
||||
Port: envOr("TEST_BACKUP_PG_PORT", "5432"),
|
||||
User: user,
|
||||
Password: os.Getenv("TEST_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: t.TempDir(),
|
||||
}
|
||||
}
|
||||
|
||||
func envOr(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
|
||||
// TestFullBackup_CreatesVerifiedBackup ist Pruefung 1: Sicherung gegen
|
||||
// Testdatenbank erfolgreich erstellt und verifiziert.
|
||||
func TestFullBackup_CreatesVerifiedBackup(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
genID := NewGenerationID(time.Now())
|
||||
manifest, err := FullBackup(ctx, cfg, genID)
|
||||
if err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
if _, err := os.Stat(manifest); err != nil {
|
||||
t.Fatalf("backup_manifest fehlt: %v", err)
|
||||
}
|
||||
|
||||
dir := filepath.Dir(manifest)
|
||||
if _, err := os.Stat(filepath.Join(dir, BaseTarGzFile)); err != nil {
|
||||
t.Fatalf("%s fehlt: %v", BaseTarGzFile, err)
|
||||
}
|
||||
|
||||
if err := Verify(dir); err != nil {
|
||||
t.Fatalf("verify: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestIncrementalBackup_IsSmallerThanFull ist der Nachweis fuer
|
||||
// Akzeptanzkriterium 1 (inkrementell): eine echte inkrementelle Sicherung
|
||||
// gegen unveraenderten Bestand ist deutlich kleiner als die Vollsicherung —
|
||||
// beweist, dass tatsaechlich nur Aenderungen uebertragen wurden (PostgreSQL
|
||||
// 17 WAL-Summarization), nicht nochmal alles.
|
||||
func TestIncrementalBackup_IsSmallerThanFull(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
genID := NewGenerationID(time.Now())
|
||||
fullManifest, err := FullBackup(ctx, cfg, genID)
|
||||
if err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
fullDir := filepath.Dir(fullManifest)
|
||||
fullSize := fileSize(t, filepath.Join(fullDir, BaseTarGzFile))
|
||||
|
||||
incID := NewGenerationID(time.Now().Add(time.Second))
|
||||
incManifest, err := IncrementalBackup(ctx, cfg, genID, incID, fullManifest)
|
||||
if err != nil {
|
||||
t.Fatalf("incrementalbackup: %v", err)
|
||||
}
|
||||
incDir := filepath.Dir(incManifest)
|
||||
if err := Verify(incDir); err != nil {
|
||||
t.Fatalf("verify (inkrementell): %v", err)
|
||||
}
|
||||
incSize := fileSize(t, filepath.Join(incDir, BaseTarGzFile))
|
||||
|
||||
if incSize >= fullSize {
|
||||
t.Fatalf("inkrementelle sicherung (%d bytes) ist nicht kleiner als die vollsicherung (%d bytes) - keine echte inkrementelle Uebertragung", incSize, fullSize)
|
||||
}
|
||||
}
|
||||
|
||||
func fileSize(t *testing.T, path string) int64 {
|
||||
t.Helper()
|
||||
info, err := os.Stat(path)
|
||||
if err != nil {
|
||||
t.Fatalf("dateigroesse von %q ermitteln: %v", path, err)
|
||||
}
|
||||
return info.Size()
|
||||
}
|
||||
|
||||
// TestVerify_DetectsCorruptedFile ist Pruefung 2: Verifikation erkennt eine
|
||||
// absichtlich beschaedigte Sicherungsdatei.
|
||||
func TestVerify_DetectsCorruptedFile(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
genID := NewGenerationID(time.Now())
|
||||
manifest, err := FullBackup(ctx, cfg, genID)
|
||||
if err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
dir := filepath.Dir(manifest)
|
||||
|
||||
if err := Verify(dir); err != nil {
|
||||
t.Fatalf("verify (unbeschaedigt) haette erfolgreich sein muessen: %v", err)
|
||||
}
|
||||
|
||||
// Absichtliche Beschaedigung: mehrere Bytes in der Mitte der Datei kippen.
|
||||
path := filepath.Join(dir, BaseTarGzFile)
|
||||
data, err := os.ReadFile(path)
|
||||
if err != nil {
|
||||
t.Fatalf("sicherungsdatei lesen: %v", err)
|
||||
}
|
||||
mid := len(data) / 2
|
||||
for i := mid; i < mid+64 && i < len(data); i++ {
|
||||
data[i] ^= 0xFF
|
||||
}
|
||||
if err := os.WriteFile(path, data, 0o600); err != nil {
|
||||
t.Fatalf("beschaedigte sicherungsdatei schreiben: %v", err)
|
||||
}
|
||||
|
||||
if err := Verify(dir); err == nil {
|
||||
t.Fatal("verify haette die beschaedigte sicherungsdatei erkennen muessen")
|
||||
}
|
||||
}
|
||||
|
||||
// TestRotate_RemovesOnlyOldestGenerations ist Pruefung 3.
|
||||
func TestRotate_RemovesOnlyOldestGenerations(t *testing.T) {
|
||||
backupDir := t.TempDir()
|
||||
generationIDs := []string{
|
||||
"20260101T000000Z",
|
||||
"20260102T000000Z",
|
||||
"20260103T000000Z",
|
||||
"20260104T000000Z",
|
||||
"20260105T000000Z",
|
||||
}
|
||||
for _, id := range generationIDs {
|
||||
if err := os.MkdirAll(filepath.Join(backupDir, id, FullBackupDirName), 0o750); err != nil {
|
||||
t.Fatalf("generation %q anlegen: %v", id, err)
|
||||
}
|
||||
}
|
||||
|
||||
removed, err := Rotate(backupDir, 2)
|
||||
if err != nil {
|
||||
t.Fatalf("rotate: %v", err)
|
||||
}
|
||||
wantRemoved := []string{"20260101T000000Z", "20260102T000000Z", "20260103T000000Z"}
|
||||
if len(removed) != len(wantRemoved) {
|
||||
t.Fatalf("entfernte generationen = %v, want %v", removed, wantRemoved)
|
||||
}
|
||||
for i, w := range wantRemoved {
|
||||
if removed[i] != w {
|
||||
t.Fatalf("entfernte generationen = %v, want %v", removed, wantRemoved)
|
||||
}
|
||||
}
|
||||
|
||||
remaining, err := ListGenerations(backupDir)
|
||||
if err != nil {
|
||||
t.Fatalf("listgenerations: %v", err)
|
||||
}
|
||||
wantRemaining := []string{"20260104T000000Z", "20260105T000000Z"}
|
||||
if len(remaining) != len(wantRemaining) {
|
||||
t.Fatalf("verbleibende generationen = %v, want %v", remaining, wantRemaining)
|
||||
}
|
||||
for i, w := range wantRemaining {
|
||||
if remaining[i] != w {
|
||||
t.Fatalf("verbleibende generationen = %v, want %v", remaining, wantRemaining)
|
||||
}
|
||||
}
|
||||
|
||||
// Die NEUESTEN duerfen NICHT entfernt sein (Pruefung 3: nur die
|
||||
// aeltesten Generationen).
|
||||
for _, w := range wantRemaining {
|
||||
if _, err := os.Stat(filepath.Join(backupDir, w)); err != nil {
|
||||
t.Fatalf("neueste generation %q wurde faelschlich entfernt: %v", w, err)
|
||||
}
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,102 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"strings"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestRestore_CombinesIntoStartablePostgresInstance ist Pruefung 1 fuer
|
||||
// BAK-03 (Datenbank-Teil): Restore auf leerem System vollstaendig und
|
||||
// erfolgreich durchgefuehrt — real bewiesen, indem das wiederhergestellte
|
||||
// Verzeichnis tatsaechlich als eigenstaendige Postgres-Instanz gestartet
|
||||
// und per echter Verbindung abgefragt wird, nicht nur auf Dateiexistenz
|
||||
// geprueft.
|
||||
func TestRestore_CombinesIntoStartablePostgresInstance(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
|
||||
defer cancel()
|
||||
|
||||
if _, err := exec.LookPath("pg_combinebackup"); err != nil {
|
||||
t.Skip("pg_combinebackup nicht installiert, restore-integrationstest uebersprungen")
|
||||
}
|
||||
pgCtl, err := exec.LookPath("pg_ctl")
|
||||
if err != nil {
|
||||
t.Skip("pg_ctl nicht installiert, restore-integrationstest uebersprungen")
|
||||
}
|
||||
|
||||
genID := NewGenerationID(time.Now())
|
||||
if _, err := FullBackup(ctx, cfg, genID); err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
|
||||
restoreOut := filepath.Join(t.TempDir(), "restored-pgdata")
|
||||
if err := os.MkdirAll(restoreOut, 0o700); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := Restore(ctx, cfg, genID, restoreOut); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(restoreOut, "PG_VERSION")); err != nil {
|
||||
t.Fatalf("wiederhergestelltes verzeichnis ist kein gueltiges PGDATA (PG_VERSION fehlt): %v", err)
|
||||
}
|
||||
|
||||
// Auf diesem Debian-Postgres liegt postgresql.conf NICHT in PGDATA
|
||||
// (sondern in /etc/postgresql/17/main/) - pg_basebackup sichert daher
|
||||
// nur PGDATA-Inhalte, die Konfigurationsdatei fehlt im Restore
|
||||
// GENAUSO wie im echten Betriebs-Restore-Verfahren. Fuer den
|
||||
// End-zu-End-Nachweis (echte Daten wiederherstellbar) hier eine
|
||||
// minimale, ausschliesslich fuer den Testlauf gueltige Konfiguration
|
||||
// nachgereicht - dokumentiert als operativer Hinweis fuer ein echtes
|
||||
// Restore-Runbook, nicht Teil des Produktcodes.
|
||||
minimalConf := "listen_addresses = ''\n"
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "postgresql.conf"), []byte(minimalConf), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
// dito pg_hba.conf - liegt auf Debian ebenfalls in /etc/postgresql,
|
||||
// nicht in PGDATA. Nur Unix-Socket-Verbindungen des lokalen Testlaufs
|
||||
// erlaubt (kein TCP, dieselbe Isolation wie listen_addresses='').
|
||||
hba := "local all all trust\n"
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "pg_hba.conf"), []byte(hba), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
// Konfigurationsdateien aus der Quellinstanz brachte pg_basebackup mit
|
||||
// (sie enthalten ggf. den alten Port/Unix-Socket) - fuer diesen Test
|
||||
// bewusst neuer Port und eigenes Socket-Verzeichnis, damit die
|
||||
// wiederhergestellte Instanz nicht mit der laufenden Test-Instanz
|
||||
// kollidiert.
|
||||
socketDir := t.TempDir()
|
||||
testPort := "55432"
|
||||
// WICHTIG: pg_ctl start foerdert postgres als Hintergrundprozess, der
|
||||
// die geerbten stdout/stderr-Pipes NICHT schliesst - CombinedOutput()
|
||||
// (das auf ein Pipe-EOF wartet) haengt sich daher auf, obwohl pg_ctl
|
||||
// selbst laengst zurueckgekehrt ist. Deshalb echte Logdatei statt Pipe
|
||||
// (Standard-pg_ctl-Muster), kein exec.Cmd.Stdout/-Stderr-Pipe-Zugriff.
|
||||
logFile := filepath.Join(t.TempDir(), "postgres.log")
|
||||
startCmd := exec.CommandContext(ctx, pgCtl, "start", "-D", restoreOut, "-w", "-t", "30", "-l", logFile,
|
||||
"-o", fmt.Sprintf("-p %s -k %s -c listen_addresses=''", testPort, socketDir))
|
||||
if err := startCmd.Run(); err != nil {
|
||||
logContent, _ := os.ReadFile(logFile)
|
||||
t.Fatalf("pg_ctl start (wiederhergestellte instanz): %v (log: %s)", err, string(logContent))
|
||||
}
|
||||
defer func() {
|
||||
stopCmd := exec.Command(pgCtl, "stop", "-D", restoreOut, "-m", "fast")
|
||||
_ = stopCmd.Run()
|
||||
}()
|
||||
|
||||
psqlOut, err := exec.CommandContext(ctx, "psql",
|
||||
"-h", socketDir, "-p", testPort, "-U", cfg.User, "-d", "postgres",
|
||||
"-tAc", "SELECT 1").CombinedOutput()
|
||||
if err != nil {
|
||||
t.Fatalf("echte verbindung zur wiederhergestellten instanz fehlgeschlagen: %v (ausgabe: %s)", err, string(psqlOut))
|
||||
}
|
||||
if strings.TrimSpace(string(psqlOut)) != "1" {
|
||||
t.Fatalf("unerwartete antwort von der wiederhergestellten instanz: %q", string(psqlOut))
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,56 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"fmt"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"sort"
|
||||
)
|
||||
|
||||
// ListGenerations liefert alle Generation-IDs in backupDir, aufsteigend
|
||||
// sortiert (die GenerationID selbst ist chronologisch sortierbar, siehe
|
||||
// NewGenerationID — kein Blick auf Dateisystem-Zeitstempel nötig, die bei
|
||||
// einem Restore/Kopiervorgang verändert werden könnten).
|
||||
func ListGenerations(backupDir string) ([]string, error) {
|
||||
entries, err := os.ReadDir(backupDir)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return nil, nil
|
||||
}
|
||||
return nil, fmt.Errorf("backup: sicherungsverzeichnis lesen: %w", err)
|
||||
}
|
||||
var generations []string
|
||||
for _, e := range entries {
|
||||
if e.IsDir() {
|
||||
generations = append(generations, e.Name())
|
||||
}
|
||||
}
|
||||
sort.Strings(generations)
|
||||
return generations, nil
|
||||
}
|
||||
|
||||
// Rotate entfernt alle bis auf die `keep` NEUESTEN Generationen
|
||||
// (Akzeptanzkriterium 3) — jede Generation umfasst ihre Vollsicherung UND
|
||||
// alle davon abhängigen Inkremente, ein Löschen der gesamten
|
||||
// Generationsverzeichnisses entfernt beides konsistent zusammen.
|
||||
func Rotate(backupDir string, keep int) (removed []string, err error) {
|
||||
if keep < 0 {
|
||||
keep = 0
|
||||
}
|
||||
generations, err := ListGenerations(backupDir)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
if len(generations) <= keep {
|
||||
return nil, nil
|
||||
}
|
||||
|
||||
toRemove := generations[:len(generations)-keep]
|
||||
for _, gen := range toRemove {
|
||||
if err := os.RemoveAll(filepath.Join(backupDir, gen)); err != nil {
|
||||
return removed, fmt.Errorf("backup: generation %q entfernen: %w", gen, err)
|
||||
}
|
||||
removed = append(removed, gen)
|
||||
}
|
||||
return removed, nil
|
||||
}
|
||||
@@ -0,0 +1,118 @@
|
||||
package backup
|
||||
|
||||
import (
|
||||
"archive/tar"
|
||||
"compress/gzip"
|
||||
"fmt"
|
||||
"io"
|
||||
"os"
|
||||
"path/filepath"
|
||||
)
|
||||
|
||||
// ErrCorrupted wird geliefert, wenn eine Sicherungsdatei nicht lesbar ist
|
||||
// (Akzeptanzkriterium 2: Verifikation, nicht nur Erstellungs-Prüfung).
|
||||
var ErrCorrupted = fmt.Errorf("backup: sicherungsdatei ist beschaedigt oder unvollstaendig")
|
||||
|
||||
// Verify prüft, dass base.tar.gz UND pg_wal.tar.gz im gegebenen
|
||||
// Sicherungsverzeichnis vollständig lesbar sind — öffnet gzip- UND
|
||||
// tar-Stream und liest JEDEN Eintrag bis zum Ende durch (nicht nur die
|
||||
// Kopfdaten), damit ein abgeschnittener oder mit kaputten Bytes
|
||||
// überschriebener Inhalt zuverlässig auffällt, nicht nur ein defekter
|
||||
// Tar-Header. pg_wal.tar.gz wird geprüft, weil ohne intaktes WAL kein
|
||||
// crash-konsistenter Restore möglich ist (siehe Restore/WalTarGzFile) —
|
||||
// eine Sicherung mit beschädigtem WAL-Archiv wäre sonst unbemerkt
|
||||
// unbrauchbar.
|
||||
func Verify(backupDir string) error {
|
||||
if err := verifyTarGz(filepath.Join(backupDir, BaseTarGzFile)); err != nil {
|
||||
return err
|
||||
}
|
||||
return verifyTarGz(filepath.Join(backupDir, WalTarGzFile))
|
||||
}
|
||||
|
||||
func verifyTarGz(path string) error {
|
||||
f, err := os.Open(path)
|
||||
if err != nil {
|
||||
return fmt.Errorf("%w: %s nicht lesbar: %v", ErrCorrupted, path, err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
gz, err := gzip.NewReader(f)
|
||||
if err != nil {
|
||||
return fmt.Errorf("%w: gzip-header von %s ungueltig: %v", ErrCorrupted, path, err)
|
||||
}
|
||||
defer func() { _ = gz.Close() }()
|
||||
|
||||
tr := tar.NewReader(gz)
|
||||
entries := 0
|
||||
for {
|
||||
hdr, err := tr.Next()
|
||||
if err == io.EOF {
|
||||
break
|
||||
}
|
||||
if err != nil {
|
||||
return fmt.Errorf("%w: tar-eintrag in %s ungueltig: %v", ErrCorrupted, path, err)
|
||||
}
|
||||
if _, err := io.Copy(io.Discard, tr); err != nil {
|
||||
return fmt.Errorf("%w: inhalt von %q in %s nicht vollstaendig lesbar: %v", ErrCorrupted, hdr.Name, path, err)
|
||||
}
|
||||
entries++
|
||||
}
|
||||
if entries == 0 {
|
||||
return fmt.Errorf("%w: %s enthaelt keine eintraege", ErrCorrupted, path)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// extractTarGz entpackt tarGzPath vollständig nach destDir — genutzt von
|
||||
// Restore, um die TAR+GZIP-Sicherungsstufen (siehe Verify) in das
|
||||
// PLAIN-Format zu überführen, das pg_combinebackup als Eingabe erwartet.
|
||||
func extractTarGz(tarGzPath, destDir string) error {
|
||||
f, err := os.Open(tarGzPath)
|
||||
if err != nil {
|
||||
return fmt.Errorf("%s öffnen: %w", tarGzPath, err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
gz, err := gzip.NewReader(f)
|
||||
if err != nil {
|
||||
return fmt.Errorf("gzip-header ungueltig: %w", err)
|
||||
}
|
||||
defer func() { _ = gz.Close() }()
|
||||
|
||||
tr := tar.NewReader(gz)
|
||||
for {
|
||||
hdr, err := tr.Next()
|
||||
if err == io.EOF {
|
||||
break
|
||||
}
|
||||
if err != nil {
|
||||
return fmt.Errorf("tar-eintrag lesen: %w", err)
|
||||
}
|
||||
target := filepath.Join(destDir, filepath.Clean(hdr.Name))
|
||||
switch hdr.Typeflag {
|
||||
case tar.TypeDir:
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
return fmt.Errorf("verzeichnis %q anlegen: %w", target, err)
|
||||
}
|
||||
case tar.TypeReg:
|
||||
if err := os.MkdirAll(filepath.Dir(target), 0o750); err != nil {
|
||||
return fmt.Errorf("übergeordnetes verzeichnis von %q anlegen: %w", target, err)
|
||||
}
|
||||
out, err := os.OpenFile(target, os.O_CREATE|os.O_WRONLY|os.O_TRUNC, os.FileMode(hdr.Mode))
|
||||
if err != nil {
|
||||
return fmt.Errorf("datei %q anlegen: %w", target, err)
|
||||
}
|
||||
if _, err := io.Copy(out, tr); err != nil {
|
||||
_ = out.Close()
|
||||
return fmt.Errorf("datei %q schreiben: %w", target, err)
|
||||
}
|
||||
if err := out.Close(); err != nil {
|
||||
return fmt.Errorf("datei %q schliessen: %w", target, err)
|
||||
}
|
||||
default:
|
||||
// Symlinks/Sonderdateien: pg_basebackup-Archive enthalten
|
||||
// praktisch keine, übersprungen statt Restore abzubrechen.
|
||||
}
|
||||
}
|
||||
return nil
|
||||
}
|
||||
@@ -0,0 +1,167 @@
|
||||
// Package objectbackup implementiert BAK-02: automatisierte, inkrementelle,
|
||||
// deduplizierende Sicherung des Objekt-Storage-Bestands. Nutzt restic
|
||||
// (Content-defined Chunking, verschlüsseltes Repository ab Werk) statt
|
||||
// Eigenbau — restic erfüllt alle Akzeptanzkriterien mit ausgereiftem,
|
||||
// geprüftem Tooling statt einer weniger robusten Neuimplementierung.
|
||||
//
|
||||
// Backup-Quelle ist ein lokaler Verzeichnisbaum — für den LocalDriver aus
|
||||
// FDN-03 direkt dessen Basisverzeichnis, für S3-gestützte Produktions-
|
||||
// Deployments ein vorgelagerter Sync-Schritt (z.B. rclone) auf einen
|
||||
// lokalen Spiegel, bevor restic ihn sichert (nicht Bestandteil dieser
|
||||
// Kachel — restic selbst sichert Dateibäume, keine S3-Buckets direkt).
|
||||
package objectbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"strings"
|
||||
)
|
||||
|
||||
// Config enthält Repository-Ort und -Passwort — ausschließlich über
|
||||
// Umgebungsvariablen befüllt (siehe Ticket-Abschluss-Regel).
|
||||
type Config struct {
|
||||
RepoDir string
|
||||
Password string
|
||||
ResticPath string // Default "restic", überschreibbar für Tests
|
||||
}
|
||||
|
||||
func (c Config) binary() string {
|
||||
if c.ResticPath != "" {
|
||||
return c.ResticPath
|
||||
}
|
||||
return "restic"
|
||||
}
|
||||
|
||||
func (c Config) env() []string {
|
||||
return append(os.Environ(), "RESTIC_PASSWORD="+c.Password)
|
||||
}
|
||||
|
||||
func run(ctx context.Context, cfg Config, args ...string) ([]byte, error) {
|
||||
fullArgs := append([]string{"-r", cfg.RepoDir}, args...)
|
||||
cmd := exec.CommandContext(ctx, cfg.binary(), fullArgs...)
|
||||
cmd.Env = cfg.env()
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return output, fmt.Errorf("%s %v fehlgeschlagen: %w (ausgabe: %s)", cfg.binary(), args, err, string(output))
|
||||
}
|
||||
return output, nil
|
||||
}
|
||||
|
||||
// InitRepo legt ein neues restic-Repository an, falls es noch nicht
|
||||
// existiert — idempotent, ein bereits initialisiertes Repository ist kein
|
||||
// Fehler (Wiederholte Aufrufe durch systemd-Timer nach einem Neustart
|
||||
// dürfen nicht fehlschlagen).
|
||||
func InitRepo(ctx context.Context, cfg Config) error {
|
||||
output, err := run(ctx, cfg, "init")
|
||||
if err != nil {
|
||||
if strings.Contains(string(output), "config file already exists") {
|
||||
return nil
|
||||
}
|
||||
return fmt.Errorf("objectbackup: repository initialisieren: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// BackupSummary ist der geparste "summary"-Datensatz aus `restic backup --json`.
|
||||
type BackupSummary struct {
|
||||
SnapshotID string `json:"snapshot_id"`
|
||||
FilesNew int `json:"files_new"`
|
||||
FilesChanged int `json:"files_changed"`
|
||||
FilesUnmodified int `json:"files_unmodified"`
|
||||
DataBlobs int `json:"data_blobs"`
|
||||
TotalBytes int64 `json:"total_bytes_processed"`
|
||||
}
|
||||
|
||||
// Backup sichert sourceDir inkrementell (Akzeptanzkriterium 1: unveränderte
|
||||
// Objekte werden nicht erneut übertragen — restics Content-defined
|
||||
// Chunking erkennt das automatisch, kein manueller Änderungsabgleich
|
||||
// nötig).
|
||||
func Backup(ctx context.Context, cfg Config, sourceDir string) (BackupSummary, error) {
|
||||
output, err := run(ctx, cfg, "backup", sourceDir, "--json")
|
||||
if err != nil {
|
||||
return BackupSummary{}, fmt.Errorf("objectbackup: sicherung: %w", err)
|
||||
}
|
||||
return parseSummary(output)
|
||||
}
|
||||
|
||||
// parseSummary sucht in der zeilenweisen JSON-Ausgabe von `restic backup
|
||||
// --json` (mehrere Fortschritts-/Statuszeilen, GENAU EINE mit
|
||||
// message_type=="summary") die Zusammenfassung.
|
||||
func parseSummary(output []byte) (BackupSummary, error) {
|
||||
lines := strings.Split(strings.TrimSpace(string(output)), "\n")
|
||||
for i := len(lines) - 1; i >= 0; i-- {
|
||||
var probe struct {
|
||||
MessageType string `json:"message_type"`
|
||||
}
|
||||
if err := json.Unmarshal([]byte(lines[i]), &probe); err != nil {
|
||||
continue
|
||||
}
|
||||
if probe.MessageType == "summary" {
|
||||
var summary BackupSummary
|
||||
if err := json.Unmarshal([]byte(lines[i]), &summary); err != nil {
|
||||
return BackupSummary{}, fmt.Errorf("objectbackup: summary-zeile dekodieren: %w", err)
|
||||
}
|
||||
return summary, nil
|
||||
}
|
||||
}
|
||||
return BackupSummary{}, fmt.Errorf("objectbackup: keine summary-zeile in der restic-ausgabe gefunden")
|
||||
}
|
||||
|
||||
// Check prüft die Vollständigkeit/Lesbarkeit des Repository
|
||||
// (Akzeptanzkriterium 3 / Pflichtprüfung: Vollständigkeitsprüfung erkennt
|
||||
// fehlendes/beschädigtes Objekt). readData=true liest jeden gespeicherten
|
||||
// Datenblock tatsächlich (teurer, aber die einzige Prüfung, die
|
||||
// Bit-Rot in bereits gespeicherten Paketen erkennt — ohne readData prüft
|
||||
// restic nur Struktur/Indizes, nicht den tatsächlichen Blockinhalt).
|
||||
func Check(ctx context.Context, cfg Config, readData bool) error {
|
||||
args := []string{"check"}
|
||||
if readData {
|
||||
args = append(args, "--read-data")
|
||||
}
|
||||
if _, err := run(ctx, cfg, args...); err != nil {
|
||||
return fmt.Errorf("objectbackup: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Forget entfernt alte Snapshots nach Rotationsregel und gibt den davon
|
||||
// belegten Speicherplatz frei (--prune) — restics Äquivalent zu
|
||||
// BAK-01s Rotate.
|
||||
func Forget(ctx context.Context, cfg Config, keepLast int) error {
|
||||
if _, err := run(ctx, cfg, "forget", "--keep-last", fmt.Sprintf("%d", keepLast), "--prune"); err != nil {
|
||||
return fmt.Errorf("objectbackup: rotation: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Restore stellt snapshotID nach targetDir wieder her (`restic restore`).
|
||||
// targetDir muss bereits existieren; Atomarität gegenüber einem eventuell
|
||||
// nicht-leeren ENDZIEL ist Aufgabe von internal/restore, nicht dieser
|
||||
// Funktion (dieselbe Aufgabenteilung wie backup.Restore).
|
||||
func Restore(ctx context.Context, cfg Config, snapshotID, targetDir string) error {
|
||||
if _, err := run(ctx, cfg, "restore", snapshotID, "--target", targetDir); err != nil {
|
||||
return fmt.Errorf("objectbackup: wiederherstellung: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
type snapshotEntry struct {
|
||||
ShortID string `json:"short_id"`
|
||||
}
|
||||
|
||||
// SnapshotCount liefert die Anzahl vorhandener Snapshots — für Tests und
|
||||
// Statusabfragen.
|
||||
func SnapshotCount(ctx context.Context, cfg Config) (int, error) {
|
||||
output, err := run(ctx, cfg, "snapshots", "--json")
|
||||
if err != nil {
|
||||
return 0, fmt.Errorf("objectbackup: snapshots auflisten: %w", err)
|
||||
}
|
||||
var snapshots []snapshotEntry
|
||||
if err := json.Unmarshal(output, &snapshots); err != nil {
|
||||
return 0, fmt.Errorf("objectbackup: snapshot-liste dekodieren: %w", err)
|
||||
}
|
||||
return len(snapshots), nil
|
||||
}
|
||||
@@ -0,0 +1,168 @@
|
||||
package objectbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
)
|
||||
|
||||
func requireRestic(t *testing.T) {
|
||||
t.Helper()
|
||||
if _, err := exec.LookPath("restic"); err != nil {
|
||||
t.Skip("restic nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
}
|
||||
|
||||
func setupTest(t *testing.T) Config {
|
||||
t.Helper()
|
||||
requireRestic(t)
|
||||
cfg := Config{RepoDir: filepath.Join(t.TempDir(), "repo"), Password: "test-passwort-fuer-objectbackup"}
|
||||
if err := InitRepo(context.Background(), cfg); err != nil {
|
||||
t.Fatalf("initrepo: %v", err)
|
||||
}
|
||||
return cfg
|
||||
}
|
||||
|
||||
func writeFile(t *testing.T, dir, name, content string) {
|
||||
t.Helper()
|
||||
if err := os.WriteFile(filepath.Join(dir, name), []byte(content), 0o600); err != nil {
|
||||
t.Fatalf("testdatei %q schreiben: %v", name, err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestBackup_UnchangedSecondRunTransmitsNothingNew ist Pruefung 1:
|
||||
// zweiter Sicherungslauf nach unveraendertem Bestand ueberraegt keine
|
||||
// Daten erneut.
|
||||
func TestBackup_UnchangedSecondRunTransmitsNothingNew(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
ctx := context.Background()
|
||||
sourceDir := t.TempDir()
|
||||
writeFile(t, sourceDir, "dokument.pdf", "unveraenderter inhalt")
|
||||
|
||||
first, err := Backup(ctx, cfg, sourceDir)
|
||||
if err != nil {
|
||||
t.Fatalf("erste sicherung: %v", err)
|
||||
}
|
||||
if first.FilesNew != 1 {
|
||||
t.Fatalf("erste sicherung: files_new = %d, want 1", first.FilesNew)
|
||||
}
|
||||
|
||||
second, err := Backup(ctx, cfg, sourceDir)
|
||||
if err != nil {
|
||||
t.Fatalf("zweite sicherung: %v", err)
|
||||
}
|
||||
if second.FilesNew != 0 || second.FilesChanged != 0 {
|
||||
t.Fatalf("zweite sicherung (unveraendert): files_new=%d files_changed=%d, want beide 0", second.FilesNew, second.FilesChanged)
|
||||
}
|
||||
if second.FilesUnmodified != 1 {
|
||||
t.Fatalf("zweite sicherung: files_unmodified = %d, want 1", second.FilesUnmodified)
|
||||
}
|
||||
}
|
||||
|
||||
// TestBackup_DeduplicatesIdenticalContent ist Pruefung 2: zwei identische
|
||||
// Testdateien belegen nachweislich nur einmal Speicherplatz.
|
||||
func TestBackup_DeduplicatesIdenticalContent(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
ctx := context.Background()
|
||||
sourceDir := t.TempDir()
|
||||
content := "exakt identischer inhalt in beiden dateien fuer den dedup-nachweis"
|
||||
writeFile(t, sourceDir, "original.pdf", content)
|
||||
writeFile(t, sourceDir, "kopie.pdf", content)
|
||||
|
||||
summary, err := Backup(ctx, cfg, sourceDir)
|
||||
if err != nil {
|
||||
t.Fatalf("sicherung: %v", err)
|
||||
}
|
||||
if summary.FilesNew != 2 {
|
||||
t.Fatalf("erwartet 2 neue dateien, habe %d", summary.FilesNew)
|
||||
}
|
||||
// Zwei Dateien mit IDENTISCHEM Inhalt duerfen nur EINEN data_blob
|
||||
// erzeugen - das ist der Dedup-Nachweis (Akzeptanzkriterium 2).
|
||||
if summary.DataBlobs != 1 {
|
||||
t.Fatalf("data_blobs = %d, want 1 (zwei identische dateien haetten nur einen blob erzeugen duerfen - keine dedup)", summary.DataBlobs)
|
||||
}
|
||||
}
|
||||
|
||||
// TestCheck_DetectsCorruptedPack ist Pruefung 3: Vollstaendigkeitspruefung
|
||||
// erkennt ein beschaedigtes/fehlendes Objekt in der Sicherung.
|
||||
func TestCheck_DetectsCorruptedPack(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
ctx := context.Background()
|
||||
sourceDir := t.TempDir()
|
||||
writeFile(t, sourceDir, "wichtig.pdf", "inhalt, der spaeter absichtlich beschaedigt wird")
|
||||
|
||||
if _, err := Backup(ctx, cfg, sourceDir); err != nil {
|
||||
t.Fatalf("sicherung: %v", err)
|
||||
}
|
||||
if err := Check(ctx, cfg, true); err != nil {
|
||||
t.Fatalf("check (unbeschaedigt) haette erfolgreich sein muessen: %v", err)
|
||||
}
|
||||
|
||||
// Absichtliche Beschaedigung: ein Byte in einer Pack-Datei im
|
||||
// Repository kippen (dieselbe Fundstelle wie beim manuellen
|
||||
// Nachweis waehrend der Recherche zu diesem Ticket).
|
||||
packDir := filepath.Join(cfg.RepoDir, "data")
|
||||
corrupted := false
|
||||
if err := filepath.Walk(packDir, func(path string, info os.FileInfo, err error) error {
|
||||
if err != nil || info.IsDir() || corrupted {
|
||||
return err
|
||||
}
|
||||
data, err := os.ReadFile(path)
|
||||
if err != nil {
|
||||
return err
|
||||
}
|
||||
if len(data) < 20 {
|
||||
return nil
|
||||
}
|
||||
data[10] ^= 0xFF
|
||||
if err := os.WriteFile(path, data, 0o600); err != nil {
|
||||
return err
|
||||
}
|
||||
corrupted = true
|
||||
return nil
|
||||
}); err != nil {
|
||||
t.Fatalf("pack-datei beschaedigen: %v", err)
|
||||
}
|
||||
if !corrupted {
|
||||
t.Fatal("keine pack-datei zum beschaedigen gefunden - testaufbau fehlerhaft")
|
||||
}
|
||||
|
||||
if err := Check(ctx, cfg, true); err == nil {
|
||||
t.Fatal("check haette die beschaedigte pack-datei erkennen muessen")
|
||||
}
|
||||
}
|
||||
|
||||
// TestForget_KeepsOnlyRequestedSnapshotCount prueft die Rotation.
|
||||
func TestForget_KeepsOnlyRequestedSnapshotCount(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
ctx := context.Background()
|
||||
sourceDir := t.TempDir()
|
||||
|
||||
for i := 0; i < 3; i++ {
|
||||
writeFile(t, sourceDir, "f.txt", "version "+string(rune('a'+i)))
|
||||
if _, err := Backup(ctx, cfg, sourceDir); err != nil {
|
||||
t.Fatalf("sicherung %d: %v", i, err)
|
||||
}
|
||||
}
|
||||
before, err := SnapshotCount(ctx, cfg)
|
||||
if err != nil {
|
||||
t.Fatalf("snapshotcount (vorher): %v", err)
|
||||
}
|
||||
if before != 3 {
|
||||
t.Fatalf("erwartet 3 snapshots vor rotation, habe %d", before)
|
||||
}
|
||||
|
||||
if err := Forget(ctx, cfg, 1); err != nil {
|
||||
t.Fatalf("forget: %v", err)
|
||||
}
|
||||
|
||||
after, err := SnapshotCount(ctx, cfg)
|
||||
if err != nil {
|
||||
t.Fatalf("snapshotcount (nachher): %v", err)
|
||||
}
|
||||
if after != 1 {
|
||||
t.Fatalf("erwartet 1 snapshot nach rotation (keep-last 1), habe %d", after)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,41 @@
|
||||
package objectbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// TestRestore_RecoversRealContentFromSnapshot ist Pruefung 1 fuer BAK-03
|
||||
// (Objekt-Storage-Teil): Restore auf leerem Zielverzeichnis vollstaendig
|
||||
// erfolgreich, real gegen restic geprueft, Dateiinhalt tatsaechlich
|
||||
// verglichen (kein Bloss-Existenz-Check).
|
||||
func TestRestore_RecoversRealContentFromSnapshot(t *testing.T) {
|
||||
cfg := setupTest(t)
|
||||
ctx := context.Background()
|
||||
|
||||
sourceDir := t.TempDir()
|
||||
content := []byte("original objektinhalt fuer restore-test")
|
||||
if err := os.WriteFile(filepath.Join(sourceDir, "objekt.txt"), content, 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
summary, err := Backup(ctx, cfg, sourceDir)
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
|
||||
targetDir := t.TempDir()
|
||||
if err := Restore(ctx, cfg, summary.SnapshotID, targetDir); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
|
||||
restoredPath := filepath.Join(targetDir, sourceDir, "objekt.txt")
|
||||
got, err := os.ReadFile(restoredPath)
|
||||
if err != nil {
|
||||
t.Fatalf("wiederhergestellte datei lesen (%s): %v", restoredPath, err)
|
||||
}
|
||||
if string(got) != string(content) {
|
||||
t.Fatalf("wiederhergestellter inhalt = %q, want %q", got, content)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,106 @@
|
||||
// Package reconcile implementiert BAK-05: periodischer Abgleich, ob jeder
|
||||
// in der Datenbank referenzierte Objekt-Storage-Eintrag tatsächlich
|
||||
// existiert und umgekehrt. Prüft AUSSCHLIESSLICH Existenz — niemals
|
||||
// Inhalt (das ist Archive BAK-08, eine eigene Fehlerklasse, bewusst nicht
|
||||
// hier mit hineingezogen, siehe reconcile_test.go
|
||||
// TestReconcile_ExistingButCorruptedObjectProducesNoFinding).
|
||||
package reconcile
|
||||
|
||||
import (
|
||||
"sort"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Finding ist EIN Abweichungsfund — entweder ein Datenbankeintrag ohne
|
||||
// Storage-Objekt oder umgekehrt.
|
||||
type Finding struct {
|
||||
StorageKey string `json:"storage_key"`
|
||||
DocumentID string `json:"document_id,omitempty"`
|
||||
RevisionID string `json:"revision_id,omitempty"`
|
||||
}
|
||||
|
||||
// Report ist das Ergebnis EINES Abgleichslaufs (Akzeptanzkriterium 3:
|
||||
// Abweichungen werden BERICHTET, nicht automatisch behoben — Report ist
|
||||
// reine Information, keine Reparaturfunktion existiert in diesem Paket).
|
||||
//
|
||||
// Beide Listen sind nach StorageKey aufsteigend sortiert — bei gleicher
|
||||
// Eingabe liefert Reconcile IMMER dieselbe Reihenfolge (deterministisch),
|
||||
// damit ein nachgelagerter Verbraucher (Archive BAK-08: zieht seine
|
||||
// Stichprobe aus der Liste der EXISTIERENDEN Objekte) sich auf eine
|
||||
// stabile Sortierung verlassen kann, statt bei jedem Lauf neu zu
|
||||
// filtern/sortieren.
|
||||
type Report struct {
|
||||
GeneratedAt time.Time `json:"generated_at"`
|
||||
// MissingInStorage: Datenbankeintrag vorhanden, Objekt im Storage fehlt
|
||||
// (Akzeptanzkriterium 1).
|
||||
MissingInStorage []Finding `json:"missing_in_storage"`
|
||||
// OrphanedInStorage: Objekt im Storage vorhanden, kein Datenbankeintrag
|
||||
// (Akzeptanzkriterium 2).
|
||||
OrphanedInStorage []Finding `json:"orphaned_in_storage"`
|
||||
// ExistingInStorage: Datenbankeintrag UND Storage-Objekt beide
|
||||
// vorhanden — reine Existenzbestätigung, KEINE Inhaltsprüfung. Dient
|
||||
// Archive BAK-08 als stabile, deterministisch sortierte
|
||||
// Stichprobengrundlage (nach StorageKey aufsteigend, siehe Report-
|
||||
// Dokumentation oben) — BAK-08 muss dafür selbst nicht mehr
|
||||
// sortieren/filtern.
|
||||
ExistingInStorage []Finding `json:"existing_in_storage"`
|
||||
}
|
||||
|
||||
// IsClean liefert true, wenn der Lauf keine Abweichungen fand (Pflicht-
|
||||
// prüfung 3: "Lauf ohne Abweichungen liefert einen leeren, eindeutig als
|
||||
// sauber erkennbaren Bericht" — IsClean ist genau dieses eindeutige
|
||||
// Erkennungsmerkmal, statt dass ein Aufrufer beide Listen selbst auf
|
||||
// Leere prüfen muss).
|
||||
func (r Report) IsClean() bool {
|
||||
return len(r.MissingInStorage) == 0 && len(r.OrphanedInStorage) == 0
|
||||
}
|
||||
|
||||
// DBEntry ist ein Datenbankeintrag, wie ihn ListDBStorageKeys liefert.
|
||||
type DBEntry struct {
|
||||
StorageKey string
|
||||
DocumentID string
|
||||
RevisionID string
|
||||
}
|
||||
|
||||
// Reconcile vergleicht dbEntries (aus file_revisions.storage_key, DMS
|
||||
// FDN-02) gegen storageKeys (tatsächlich im Objekt-Storage vorhandene
|
||||
// Schlüssel, z.B. per Verzeichnis-Walk des FDN-03-LocalDriver-
|
||||
// Basisverzeichnisses) und liefert die Abweichungen in beide Richtungen.
|
||||
// Reine Funktion — kein Datenbank-/Storage-Zugriff hier, dadurch ohne
|
||||
// echte Infrastruktur testbar (siehe reconcile_test.go).
|
||||
func Reconcile(dbEntries []DBEntry, storageKeys []string) Report {
|
||||
storageSet := make(map[string]bool, len(storageKeys))
|
||||
for _, k := range storageKeys {
|
||||
storageSet[k] = true
|
||||
}
|
||||
dbSet := make(map[string]DBEntry, len(dbEntries))
|
||||
for _, e := range dbEntries {
|
||||
dbSet[e.StorageKey] = e
|
||||
}
|
||||
|
||||
var missing, existing []Finding
|
||||
for _, e := range dbEntries {
|
||||
if !storageSet[e.StorageKey] {
|
||||
missing = append(missing, Finding(e))
|
||||
} else {
|
||||
existing = append(existing, Finding(e))
|
||||
}
|
||||
}
|
||||
var orphaned []Finding
|
||||
for _, k := range storageKeys {
|
||||
if _, ok := dbSet[k]; !ok {
|
||||
orphaned = append(orphaned, Finding{StorageKey: k})
|
||||
}
|
||||
}
|
||||
|
||||
sort.Slice(missing, func(i, j int) bool { return missing[i].StorageKey < missing[j].StorageKey })
|
||||
sort.Slice(orphaned, func(i, j int) bool { return orphaned[i].StorageKey < orphaned[j].StorageKey })
|
||||
sort.Slice(existing, func(i, j int) bool { return existing[i].StorageKey < existing[j].StorageKey })
|
||||
|
||||
return Report{
|
||||
GeneratedAt: time.Now().UTC(),
|
||||
MissingInStorage: missing,
|
||||
OrphanedInStorage: orphaned,
|
||||
ExistingInStorage: existing,
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,169 @@
|
||||
package reconcile
|
||||
|
||||
import "testing"
|
||||
|
||||
// TestReconcile_DetectsMissingInStorage ist Akzeptanzkriterium 1 / Pruefung
|
||||
// 1: ein Datenbankeintrag ohne zugehoeriges Objekt im Storage wird erkannt.
|
||||
func TestReconcile_DetectsMissingInStorage(t *testing.T) {
|
||||
db := []DBEntry{
|
||||
{StorageKey: "documents/d1/revisions/r1", DocumentID: "d1", RevisionID: "r1"},
|
||||
{StorageKey: "documents/d2/revisions/r1", DocumentID: "d2", RevisionID: "r1"},
|
||||
}
|
||||
storage := []string{"documents/d1/revisions/r1"} // d2/r1 fehlt absichtlich
|
||||
|
||||
report := Reconcile(db, storage)
|
||||
|
||||
if len(report.MissingInStorage) != 1 {
|
||||
t.Fatalf("erwartet 1 fund in missing_in_storage, habe %d: %+v", len(report.MissingInStorage), report.MissingInStorage)
|
||||
}
|
||||
if report.MissingInStorage[0].StorageKey != "documents/d2/revisions/r1" {
|
||||
t.Fatalf("unerwarteter fund: %+v", report.MissingInStorage[0])
|
||||
}
|
||||
if len(report.OrphanedInStorage) != 0 {
|
||||
t.Fatalf("erwartet 0 funde in orphaned_in_storage, habe %d", len(report.OrphanedInStorage))
|
||||
}
|
||||
}
|
||||
|
||||
// TestReconcile_DetectsOrphanedInStorage ist Akzeptanzkriterium 2 /
|
||||
// Pruefung 2: ein Storage-Objekt ohne Datenbankeintrag wird erkannt.
|
||||
func TestReconcile_DetectsOrphanedInStorage(t *testing.T) {
|
||||
db := []DBEntry{
|
||||
{StorageKey: "documents/d1/revisions/r1", DocumentID: "d1", RevisionID: "r1"},
|
||||
}
|
||||
storage := []string{
|
||||
"documents/d1/revisions/r1",
|
||||
"documents/verwaist/revisions/r1", // kein DB-Eintrag dafuer
|
||||
}
|
||||
|
||||
report := Reconcile(db, storage)
|
||||
|
||||
if len(report.OrphanedInStorage) != 1 {
|
||||
t.Fatalf("erwartet 1 fund in orphaned_in_storage, habe %d: %+v", len(report.OrphanedInStorage), report.OrphanedInStorage)
|
||||
}
|
||||
if report.OrphanedInStorage[0].StorageKey != "documents/verwaist/revisions/r1" {
|
||||
t.Fatalf("unerwarteter fund: %+v", report.OrphanedInStorage[0])
|
||||
}
|
||||
if len(report.MissingInStorage) != 0 {
|
||||
t.Fatalf("erwartet 0 funde in missing_in_storage, habe %d", len(report.MissingInStorage))
|
||||
}
|
||||
}
|
||||
|
||||
// TestReconcile_CleanRunProducesEmptyReport ist Pruefung 3: Lauf ohne
|
||||
// Abweichungen liefert einen leeren, eindeutig als sauber erkennbaren
|
||||
// Bericht.
|
||||
func TestReconcile_CleanRunProducesEmptyReport(t *testing.T) {
|
||||
db := []DBEntry{
|
||||
{StorageKey: "documents/d1/revisions/r1", DocumentID: "d1", RevisionID: "r1"},
|
||||
{StorageKey: "documents/d2/revisions/r1", DocumentID: "d2", RevisionID: "r1"},
|
||||
}
|
||||
storage := []string{"documents/d1/revisions/r1", "documents/d2/revisions/r1"}
|
||||
|
||||
report := Reconcile(db, storage)
|
||||
|
||||
if !report.IsClean() {
|
||||
t.Fatalf("erwartet sauberen bericht, habe missing=%v orphaned=%v", report.MissingInStorage, report.OrphanedInStorage)
|
||||
}
|
||||
if len(report.MissingInStorage) != 0 || len(report.OrphanedInStorage) != 0 {
|
||||
t.Fatal("IsClean()==true, aber listen sind nicht leer - widerspruch")
|
||||
}
|
||||
}
|
||||
|
||||
// TestReconcile_ExistingButCorruptedObjectProducesNoFinding ist der
|
||||
// Nachweis, dass BAK-05 AUSSCHLIESSLICH Existenz prueft, niemals Inhalt
|
||||
// (die Fehlerklasse "existiert, aber Inhalt beschaedigt" ist Archive
|
||||
// BAK-08, bewusst nicht hier) — Reconcile bekommt nur SCHLUESSEL, hat gar
|
||||
// keine Moeglichkeit, auf Inhalt zuzugreifen; dieser Test dokumentiert die
|
||||
// Absicht explizit, damit sie nicht versehentlich spaeter aufgeweicht wird.
|
||||
func TestReconcile_ExistingButCorruptedObjectProducesNoFinding(t *testing.T) {
|
||||
db := []DBEntry{
|
||||
{StorageKey: "documents/d1/revisions/r1", DocumentID: "d1", RevisionID: "r1"},
|
||||
}
|
||||
// "korruptes" Objekt hier rein simuliert durch denselben Schluessel -
|
||||
// Reconcile kennt und prueft keinen Inhalt, nur den Schluessel selbst.
|
||||
storage := []string{"documents/d1/revisions/r1"}
|
||||
|
||||
report := Reconcile(db, storage)
|
||||
|
||||
if !report.IsClean() {
|
||||
t.Fatalf("ein existierendes (wenn auch inhaltlich korruptes) objekt haette KEINEN befund ausloesen duerfen, habe: %+v", report)
|
||||
}
|
||||
}
|
||||
|
||||
// TestReconcile_ExistingInStorageIsStableSamplingBasis ist der Nachweis,
|
||||
// dass Reconcile eine deterministisch sortierte Liste ALLER bestaetigt
|
||||
// existierenden Objekte liefert (DB-Eintrag UND Storage-Objekt vorhanden)
|
||||
// - dies ist die Stichprobengrundlage, die Archive BAK-08 weiterverwendet,
|
||||
// ohne selbst neu zu sortieren/filtern.
|
||||
func TestReconcile_ExistingInStorageIsStableSamplingBasis(t *testing.T) {
|
||||
db := []DBEntry{
|
||||
{StorageKey: "documents/z/revisions/r1", DocumentID: "z", RevisionID: "r1"},
|
||||
{StorageKey: "documents/a/revisions/r1", DocumentID: "a", RevisionID: "r1"},
|
||||
{StorageKey: "documents/fehlt/revisions/r1", DocumentID: "fehlt", RevisionID: "r1"},
|
||||
}
|
||||
storage := []string{
|
||||
"documents/z/revisions/r1",
|
||||
"documents/a/revisions/r1",
|
||||
}
|
||||
|
||||
report := Reconcile(db, storage)
|
||||
|
||||
want := []string{"documents/a/revisions/r1", "documents/z/revisions/r1"}
|
||||
if len(report.ExistingInStorage) != len(want) {
|
||||
t.Fatalf("erwartet %d bestaetigt existierende objekte, habe %d: %+v", len(want), len(report.ExistingInStorage), report.ExistingInStorage)
|
||||
}
|
||||
for i, w := range want {
|
||||
if report.ExistingInStorage[i].StorageKey != w {
|
||||
t.Fatalf("sortierreihenfolge falsch: %v, want beginnend mit %v", report.ExistingInStorage, want)
|
||||
}
|
||||
}
|
||||
if len(report.MissingInStorage) != 1 || report.MissingInStorage[0].StorageKey != "documents/fehlt/revisions/r1" {
|
||||
t.Fatalf("missing_in_storage unerwartet: %+v", report.MissingInStorage)
|
||||
}
|
||||
}
|
||||
|
||||
// TestReconcile_DeterministicOrdering ist der Nachweis fuer die
|
||||
// Stabilitaets-Anforderung: gleiche Eingabe liefert bei mehreren Laeufen
|
||||
// IMMER dieselbe Reihenfolge (Voraussetzung dafuer, dass Archive BAK-08
|
||||
// die Liste der existierenden Objekte stabil weiterverarbeiten kann, ohne
|
||||
// selbst neu zu sortieren/filtern).
|
||||
func TestReconcile_DeterministicOrdering(t *testing.T) {
|
||||
db := []DBEntry{
|
||||
{StorageKey: "documents/z/revisions/r1", DocumentID: "z", RevisionID: "r1"},
|
||||
{StorageKey: "documents/a/revisions/r1", DocumentID: "a", RevisionID: "r1"},
|
||||
{StorageKey: "documents/m/revisions/r1", DocumentID: "m", RevisionID: "r1"},
|
||||
}
|
||||
storage := []string{
|
||||
"documents/a/revisions/r1", // deckt genau den DB-Eintrag "a" ab
|
||||
"documents/y/revisions/r1",
|
||||
"documents/n/revisions/r1",
|
||||
}
|
||||
|
||||
first := Reconcile(db, storage)
|
||||
second := Reconcile(db, storage)
|
||||
|
||||
if len(first.MissingInStorage) != len(second.MissingInStorage) {
|
||||
t.Fatal("unterschiedliche anzahl funde zwischen zwei laeufen mit identischer eingabe")
|
||||
}
|
||||
for i := range first.MissingInStorage {
|
||||
if first.MissingInStorage[i].StorageKey != second.MissingInStorage[i].StorageKey {
|
||||
t.Fatalf("reihenfolge in missing_in_storage nicht deterministisch: lauf1[%d]=%q lauf2[%d]=%q",
|
||||
i, first.MissingInStorage[i].StorageKey, i, second.MissingInStorage[i].StorageKey)
|
||||
}
|
||||
}
|
||||
for i := range first.OrphanedInStorage {
|
||||
if first.OrphanedInStorage[i].StorageKey != second.OrphanedInStorage[i].StorageKey {
|
||||
t.Fatalf("reihenfolge in orphaned_in_storage nicht deterministisch: lauf1[%d]=%q lauf2[%d]=%q",
|
||||
i, first.OrphanedInStorage[i].StorageKey, i, second.OrphanedInStorage[i].StorageKey)
|
||||
}
|
||||
}
|
||||
// Aufsteigend sortiert (a < m < z), nicht Einfuegereihenfolge.
|
||||
wantOrder := []string{"documents/m/revisions/r1", "documents/z/revisions/r1"}
|
||||
if len(first.MissingInStorage) != len(wantOrder) {
|
||||
t.Fatalf("erwartet %d funde, habe %d", len(wantOrder), len(first.MissingInStorage))
|
||||
}
|
||||
for i, w := range wantOrder {
|
||||
if first.MissingInStorage[i].StorageKey != w {
|
||||
t.Fatalf("sortierreihenfolge falsch: %v, want beginnend mit %v", first.MissingInStorage, wantOrder)
|
||||
}
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,65 @@
|
||||
package reconcile
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"path/filepath"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
// ListDBStorageKeys liest alle storage_key-Werte aus file_revisions
|
||||
// (DMS FDN-02) — Archive liest direkt aus derselben physischen
|
||||
// Tenant-Datenbank (Modell C, Core TEN-01), OHNE DMS-Go-Pakete zu
|
||||
// importieren (Archive ist ein eigenes Go-Modul) — reiner SQL-Zugriff
|
||||
// gegen das dokumentierte Schema, sortiert nach storage_key für
|
||||
// deterministische Reconcile-Ergebnisse.
|
||||
func ListDBStorageKeys(ctx context.Context, pool *pgxpool.Pool) ([]DBEntry, error) {
|
||||
rows, err := pool.Query(ctx, `
|
||||
SELECT storage_key, document_id, id FROM file_revisions ORDER BY storage_key
|
||||
`)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("reconcile: file_revisions abfragen: %w", err)
|
||||
}
|
||||
defer rows.Close()
|
||||
|
||||
var entries []DBEntry
|
||||
for rows.Next() {
|
||||
var e DBEntry
|
||||
if err := rows.Scan(&e.StorageKey, &e.DocumentID, &e.RevisionID); err != nil {
|
||||
return nil, fmt.Errorf("reconcile: file_revisions-zeile lesen: %w", err)
|
||||
}
|
||||
entries = append(entries, e)
|
||||
}
|
||||
return entries, rows.Err()
|
||||
}
|
||||
|
||||
// ListStorageObjects durchläuft den lokalen FDN-03-LocalDriver-
|
||||
// Basisordner und liefert alle vorhandenen Objektschlüssel (Pfad relativ
|
||||
// zu baseDir, mit "/" als Trenner — dasselbe Format wie
|
||||
// storage.ObjectKey aus FDN-03), sortiert.
|
||||
func ListStorageObjects(baseDir string) ([]string, error) {
|
||||
var keys []string
|
||||
err := filepath.WalkDir(baseDir, func(path string, d os.DirEntry, err error) error {
|
||||
if err != nil {
|
||||
return err
|
||||
}
|
||||
if d.IsDir() {
|
||||
return nil
|
||||
}
|
||||
rel, err := filepath.Rel(baseDir, path)
|
||||
if err != nil {
|
||||
return err
|
||||
}
|
||||
keys = append(keys, filepath.ToSlash(rel))
|
||||
return nil
|
||||
})
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return nil, nil
|
||||
}
|
||||
return nil, fmt.Errorf("reconcile: objekt-storage durchlaufen: %w", err)
|
||||
}
|
||||
return keys, nil
|
||||
}
|
||||
@@ -0,0 +1,132 @@
|
||||
package reconcile
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
func requireTestPool(t *testing.T) *pgxpool.Pool {
|
||||
t.Helper()
|
||||
dsn := os.Getenv("TEST_TENANT_DSN")
|
||||
if dsn == "" {
|
||||
t.Skip("TEST_TENANT_DSN nicht gesetzt, Integrationstest uebersprungen")
|
||||
}
|
||||
ctx := context.Background()
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
t.Fatalf("pool: %v", err)
|
||||
}
|
||||
t.Cleanup(func() { pool.Close() })
|
||||
|
||||
// Minimalschema, das exakt DMS FDN-02s file_revisions-Spalten spiegelt
|
||||
// (Archive kann DMS' internal/-Pakete als eigenes Go-Modul nicht
|
||||
// importieren, daher hier als Testfixture kopiert statt real migriert).
|
||||
if _, err := pool.Exec(ctx, `
|
||||
CREATE EXTENSION IF NOT EXISTS pgcrypto;
|
||||
CREATE TABLE IF NOT EXISTS users (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(), email TEXT NOT NULL UNIQUE, name TEXT NOT NULL,
|
||||
created_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
CREATE TABLE IF NOT EXISTS documents (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(), title TEXT NOT NULL,
|
||||
created_by UUID NOT NULL REFERENCES users(id), created_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
CREATE TABLE IF NOT EXISTS file_revisions (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(), document_id UUID NOT NULL REFERENCES documents(id) ON DELETE CASCADE,
|
||||
storage_key TEXT NOT NULL, checksum_sha256 TEXT NOT NULL, size_bytes BIGINT NOT NULL,
|
||||
mime_type TEXT NOT NULL, revision_number INTEGER NOT NULL, created_by UUID NOT NULL REFERENCES users(id),
|
||||
created_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
`); err != nil {
|
||||
t.Fatalf("schema: %v", err)
|
||||
}
|
||||
t.Cleanup(func() {
|
||||
_, _ = pool.Exec(context.Background(), `TRUNCATE file_revisions, documents, users CASCADE`)
|
||||
})
|
||||
return pool
|
||||
}
|
||||
|
||||
// TestListDBStorageKeys_ReadsRealFileRevisions ist der Nachweis, dass
|
||||
// ListDBStorageKeys tatsaechlich gegen eine echte Postgres-Instanz mit
|
||||
// DMS-FDN-02-Schema liest — kein Mock.
|
||||
func TestListDBStorageKeys_ReadsRealFileRevisions(t *testing.T) {
|
||||
pool := requireTestPool(t)
|
||||
ctx := context.Background()
|
||||
|
||||
var userID, docID string
|
||||
if err := pool.QueryRow(ctx, `INSERT INTO users (email, name) VALUES ('reconcile-test@example.test', 'Test') RETURNING id`).Scan(&userID); err != nil {
|
||||
t.Fatalf("testbenutzer anlegen: %v", err)
|
||||
}
|
||||
if err := pool.QueryRow(ctx, `INSERT INTO documents (title, created_by) VALUES ('doc', $1) RETURNING id`, userID).Scan(&docID); err != nil {
|
||||
t.Fatalf("testdokument anlegen: %v", err)
|
||||
}
|
||||
if _, err := pool.Exec(ctx, `
|
||||
INSERT INTO file_revisions (document_id, storage_key, checksum_sha256, size_bytes, mime_type, revision_number, created_by)
|
||||
VALUES ($1, 'documents/x/revisions/1', 'abc', 10, 'text/plain', 1, $2)
|
||||
`, docID, userID); err != nil {
|
||||
t.Fatalf("testrevision anlegen: %v", err)
|
||||
}
|
||||
|
||||
entries, err := ListDBStorageKeys(ctx, pool)
|
||||
if err != nil {
|
||||
t.Fatalf("listdbstoragekeys: %v", err)
|
||||
}
|
||||
if len(entries) != 1 {
|
||||
t.Fatalf("erwartet 1 eintrag, habe %d", len(entries))
|
||||
}
|
||||
if entries[0].StorageKey != "documents/x/revisions/1" {
|
||||
t.Fatalf("storage_key = %q, want %q", entries[0].StorageKey, "documents/x/revisions/1")
|
||||
}
|
||||
if entries[0].DocumentID != docID {
|
||||
t.Fatalf("document_id = %q, want %q", entries[0].DocumentID, docID)
|
||||
}
|
||||
}
|
||||
|
||||
// TestListStorageObjects_WalksRealDirectory ist der Nachweis, dass
|
||||
// ListStorageObjects tatsaechlich das Dateisystem durchlaeuft.
|
||||
func TestListStorageObjects_WalksRealDirectory(t *testing.T) {
|
||||
baseDir := t.TempDir()
|
||||
mustWriteFile(t, filepath.Join(baseDir, "documents", "d1", "revisions", "r1"), "inhalt")
|
||||
mustWriteFile(t, filepath.Join(baseDir, "documents", "d2", "revisions", "r1"), "inhalt")
|
||||
|
||||
keys, err := ListStorageObjects(baseDir)
|
||||
if err != nil {
|
||||
t.Fatalf("liststorageobjects: %v", err)
|
||||
}
|
||||
if len(keys) != 2 {
|
||||
t.Fatalf("erwartet 2 objektschluessel, habe %d: %v", len(keys), keys)
|
||||
}
|
||||
want := []string{"documents/d1/revisions/r1", "documents/d2/revisions/r1"}
|
||||
for i, w := range want {
|
||||
if keys[i] != w {
|
||||
t.Fatalf("schluessel[%d] = %q, want %q (voll: %v)", i, keys[i], w, keys)
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
// TestListStorageObjects_MissingDirectoryReturnsEmpty prueft das
|
||||
// Verhalten, wenn das Basisverzeichnis (noch) gar nicht existiert -
|
||||
// sollte als "keine Objekte", nicht als Fehler behandelt werden.
|
||||
func TestListStorageObjects_MissingDirectoryReturnsEmpty(t *testing.T) {
|
||||
keys, err := ListStorageObjects("/pfad/der/nicht/existiert/fuer/diesen/test")
|
||||
if err != nil {
|
||||
t.Fatalf("erwartet keinen fehler bei fehlendem verzeichnis, habe: %v", err)
|
||||
}
|
||||
if len(keys) != 0 {
|
||||
t.Fatalf("erwartet 0 schluessel, habe %d", len(keys))
|
||||
}
|
||||
}
|
||||
|
||||
func mustWriteFile(t *testing.T, path, content string) {
|
||||
t.Helper()
|
||||
if err := os.MkdirAll(filepath.Dir(path), 0o755); err != nil {
|
||||
t.Fatalf("verzeichnis anlegen: %v", err)
|
||||
}
|
||||
if err := os.WriteFile(path, []byte(content), 0o600); err != nil {
|
||||
t.Fatalf("datei schreiben: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,133 @@
|
||||
// Package restore implementiert BAK-03: dokumentiertes, wiederholbares
|
||||
// Restore-Verfahren für Datenbank (BAK-01) und Objekt-Storage (BAK-02).
|
||||
// Enthält NUR die gemeinsame Ablauflogik (Atomarität über Temp-Verzeichnis,
|
||||
// Protokollierung) — die eigentliche Wiederherstellung bleibt in den
|
||||
// jeweiligen Paketen (backup.Restore, objectbackup.Restore), damit
|
||||
// internal/restore nicht weiß, WIE eine Sicherung gelesen wird, nur WANN
|
||||
// und WIE SICHER sie an ihren Zielort darf.
|
||||
package restore
|
||||
|
||||
import (
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Kind unterscheidet die beiden Restore-Arten im Protokoll.
|
||||
type Kind string
|
||||
|
||||
const (
|
||||
KindDatabase Kind = "database"
|
||||
KindObjects Kind = "objects"
|
||||
)
|
||||
|
||||
// LogEntry ist EIN Protokolleintrag (Akzeptanzkriterium 3: Quelle,
|
||||
// Zeitpunkt, Ergebnis).
|
||||
type LogEntry struct {
|
||||
Timestamp time.Time `json:"timestamp"`
|
||||
Kind Kind `json:"kind"`
|
||||
Source string `json:"source"` // Generation-ID oder Snapshot-ID
|
||||
Target string `json:"target"`
|
||||
Result string `json:"result"` // "ok", "abgebrochen: ...", "fehlgeschlagen: ..."
|
||||
}
|
||||
|
||||
// ErrTargetNotEmpty wird zurückgegeben, wenn targetDir bereits Inhalt hat
|
||||
// und force nicht gesetzt ist — Akzeptanzkriterium 2: bestehender Inhalt
|
||||
// bleibt unangetastet, solange der Vorgang nicht bestätigt wird.
|
||||
var ErrTargetNotEmpty = fmt.Errorf("restore: zielverzeichnis ist nicht leer, restore ohne bestätigung (force) abgebrochen")
|
||||
|
||||
// AtomicRestore führt restoreFn gegen ein FRISCHES temporäres Verzeichnis
|
||||
// aus (niemals direkt gegen target) und übernimmt es erst bei Erfolg —
|
||||
// entweder wenn target leer ist, oder wenn force=true (bewusste
|
||||
// Bestätigung, bestehenden Inhalt zu überschreiben). Bei jedem Fehler
|
||||
// oder abgelehnter Bestätigung bleibt target garantiert unverändert
|
||||
// (Akzeptanzkriterium 2), das temporäre Verzeichnis wird aufgeräumt.
|
||||
// Jeder Aufruf – erfolgreich oder nicht – erzeugt genau einen
|
||||
// Protokolleintrag in logPath (Akzeptanzkriterium 3).
|
||||
func AtomicRestore(kind Kind, source, target string, force bool, logPath string, restoreFn func(tempDir string) error) (LogEntry, error) {
|
||||
entry := LogEntry{Timestamp: time.Now().UTC(), Kind: kind, Source: source, Target: target}
|
||||
|
||||
empty, err := dirIsEmptyOrMissing(target)
|
||||
if err != nil {
|
||||
entry.Result = "fehlgeschlagen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, err
|
||||
}
|
||||
if !empty && !force {
|
||||
entry.Result = "abgebrochen: " + ErrTargetNotEmpty.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, ErrTargetNotEmpty
|
||||
}
|
||||
|
||||
parent := filepath.Dir(filepath.Clean(target))
|
||||
tempDir, err := os.MkdirTemp(parent, ".restore-tmp-*")
|
||||
if err != nil {
|
||||
entry.Result = "fehlgeschlagen: temp-verzeichnis anlegen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: temp-verzeichnis anlegen: %w", err)
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(tempDir) }() // no-op nach erfolgreichem Rename (Verzeichnis existiert dann nicht mehr)
|
||||
|
||||
if err := restoreFn(tempDir); err != nil {
|
||||
entry.Result = "fehlgeschlagen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: wiederherstellung: %w", err)
|
||||
}
|
||||
|
||||
if !empty {
|
||||
// force=true, bewusste Bestätigung: alter Inhalt wird ERST JETZT
|
||||
// entfernt, nachdem restoreFn bereits erfolgreich in tempDir
|
||||
// abgeschlossen hat — ein Fehlschlag oben hätte target nie berührt.
|
||||
if err := os.RemoveAll(target); err != nil {
|
||||
entry.Result = "fehlgeschlagen: altes ziel entfernen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: altes ziel entfernen: %w", err)
|
||||
}
|
||||
} else if err := os.MkdirAll(parent, 0o750); err != nil {
|
||||
entry.Result = "fehlgeschlagen: übergeordnetes verzeichnis anlegen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: übergeordnetes verzeichnis anlegen: %w", err)
|
||||
}
|
||||
|
||||
if err := os.Rename(tempDir, target); err != nil {
|
||||
entry.Result = "fehlgeschlagen: umbenennen: " + err.Error()
|
||||
_ = appendLog(logPath, entry)
|
||||
return entry, fmt.Errorf("restore: temp-verzeichnis nach ziel umbenennen: %w", err)
|
||||
}
|
||||
|
||||
entry.Result = "ok"
|
||||
if err := appendLog(logPath, entry); err != nil {
|
||||
return entry, fmt.Errorf("restore: protokoll schreiben: %w", err)
|
||||
}
|
||||
return entry, nil
|
||||
}
|
||||
|
||||
func dirIsEmptyOrMissing(dir string) (bool, error) {
|
||||
entries, err := os.ReadDir(dir)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return true, nil
|
||||
}
|
||||
return false, fmt.Errorf("zielverzeichnis lesen: %w", err)
|
||||
}
|
||||
return len(entries) == 0, nil
|
||||
}
|
||||
|
||||
func appendLog(logPath string, entry LogEntry) error {
|
||||
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
|
||||
if err != nil {
|
||||
return fmt.Errorf("protokolldatei öffnen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
line, err := json.Marshal(entry)
|
||||
if err != nil {
|
||||
return fmt.Errorf("protokolleintrag kodieren: %w", err)
|
||||
}
|
||||
if _, err := f.Write(append(line, '\n')); err != nil {
|
||||
return fmt.Errorf("protokolleintrag schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
@@ -0,0 +1,181 @@
|
||||
package restore
|
||||
|
||||
import (
|
||||
"encoding/json"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
)
|
||||
|
||||
func readLog(t *testing.T, path string) []LogEntry {
|
||||
t.Helper()
|
||||
data, err := os.ReadFile(path)
|
||||
if err != nil {
|
||||
t.Fatalf("protokolldatei lesen: %v", err)
|
||||
}
|
||||
var entries []LogEntry
|
||||
for _, line := range splitLines(data) {
|
||||
if len(line) == 0 {
|
||||
continue
|
||||
}
|
||||
var e LogEntry
|
||||
if err := json.Unmarshal(line, &e); err != nil {
|
||||
t.Fatalf("protokollzeile dekodieren: %v (%s)", err, line)
|
||||
}
|
||||
entries = append(entries, e)
|
||||
}
|
||||
return entries
|
||||
}
|
||||
|
||||
func splitLines(data []byte) [][]byte {
|
||||
var out [][]byte
|
||||
start := 0
|
||||
for i, b := range data {
|
||||
if b == '\n' {
|
||||
out = append(out, data[start:i])
|
||||
start = i + 1
|
||||
}
|
||||
}
|
||||
return out
|
||||
}
|
||||
|
||||
// TestAtomicRestore_EmptyTarget_Succeeds ist Pruefung 1: Restore auf
|
||||
// leerem (nicht vorhandenem) Ziel vollstaendig erfolgreich.
|
||||
func TestAtomicRestore_EmptyTarget_Succeeds(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
|
||||
entry, err := AtomicRestore(KindDatabase, "gen-1", target, false, logPath, func(tempDir string) error {
|
||||
return os.WriteFile(filepath.Join(tempDir, "marker"), []byte("wiederhergestellt"), 0o600)
|
||||
})
|
||||
if err != nil {
|
||||
t.Fatalf("atomicRestore: %v", err)
|
||||
}
|
||||
if entry.Result != "ok" {
|
||||
t.Fatalf("result = %q, want ok", entry.Result)
|
||||
}
|
||||
content, err := os.ReadFile(filepath.Join(target, "marker"))
|
||||
if err != nil || string(content) != "wiederhergestellt" {
|
||||
t.Fatalf("ziel nicht korrekt befuellt: %v %q", err, content)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_NonEmptyTargetWithoutForce_LeavesOriginalUntouched ist
|
||||
// Pruefung 2: Restore auf nicht-leeres Zielverzeichnis laesst bei Abbruch
|
||||
// (keine Bestaetigung) den urspruenglichen Inhalt unveraendert.
|
||||
func TestAtomicRestore_NonEmptyTargetWithoutForce_LeavesOriginalUntouched(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(target, "bestehend"), []byte("original"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
restoreFnCalled := false
|
||||
_, err := AtomicRestore(KindObjects, "snap-1", target, false, logPath, func(tempDir string) error {
|
||||
restoreFnCalled = true
|
||||
return nil
|
||||
})
|
||||
if err != ErrTargetNotEmpty {
|
||||
t.Fatalf("erwartet ErrTargetNotEmpty, habe: %v", err)
|
||||
}
|
||||
if restoreFnCalled {
|
||||
t.Fatal("restoreFn haette bei nicht-leerem ziel ohne force NIE aufgerufen werden duerfen")
|
||||
}
|
||||
content, err := os.ReadFile(filepath.Join(target, "bestehend"))
|
||||
if err != nil || string(content) != "original" {
|
||||
t.Fatalf("urspruenglicher inhalt veraendert: %v %q", err, content)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_FailedRestoreFn_LeavesTargetUntouched ist Nachweis,
|
||||
// dass ein Fehler WAEHREND der Wiederherstellung (in tempDir) das
|
||||
// bestehende Ziel nicht beschaedigt, weil erst nach Erfolg umbenannt wird.
|
||||
func TestAtomicRestore_FailedRestoreFn_LeavesTargetUntouched(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(target, "bestehend"), []byte("original"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
_, err := AtomicRestore(KindDatabase, "gen-2", target, true, logPath, func(tempDir string) error {
|
||||
return os.ErrInvalid // simuliert fehlgeschlagene wiederherstellung
|
||||
})
|
||||
if err == nil {
|
||||
t.Fatal("erwartet fehler")
|
||||
}
|
||||
content, err := os.ReadFile(filepath.Join(target, "bestehend"))
|
||||
if err != nil || string(content) != "original" {
|
||||
t.Fatalf("ziel bei fehlgeschlagenem restoreFn veraendert: %v %q", err, content)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_ForceOverwritesNonEmptyTarget ist Nachweis, dass eine
|
||||
// BEWUSSTE Bestaetigung (force) bestehenden Inhalt ersetzen darf.
|
||||
func TestAtomicRestore_ForceOverwritesNonEmptyTarget(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
target := filepath.Join(root, "ziel")
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
if err := os.MkdirAll(target, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(target, "alt"), []byte("alt"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
_, err := AtomicRestore(KindObjects, "snap-2", target, true, logPath, func(tempDir string) error {
|
||||
return os.WriteFile(filepath.Join(tempDir, "neu"), []byte("neu"), 0o600)
|
||||
})
|
||||
if err != nil {
|
||||
t.Fatalf("atomicRestore mit force: %v", err)
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(target, "alt")); !os.IsNotExist(err) {
|
||||
t.Fatal("alter inhalt haette nach force-restore ersetzt sein muessen")
|
||||
}
|
||||
if _, err := os.Stat(filepath.Join(target, "neu")); err != nil {
|
||||
t.Fatalf("neuer inhalt fehlt: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestAtomicRestore_LogsCompleteEntry ist Pruefung 3: Protokolleintrag
|
||||
// ist vollstaendig und nachvollziehbar (Quelle, Zeitpunkt, Ergebnis) -
|
||||
// sowohl fuer Erfolg als auch fuer Abbruch, in derselben Datei.
|
||||
func TestAtomicRestore_LogsCompleteEntry(t *testing.T) {
|
||||
root := t.TempDir()
|
||||
logPath := filepath.Join(root, "restore.log")
|
||||
|
||||
okTarget := filepath.Join(root, "ok-ziel")
|
||||
if _, err := AtomicRestore(KindDatabase, "gen-3", okTarget, false, logPath, func(tempDir string) error {
|
||||
return os.WriteFile(filepath.Join(tempDir, "x"), []byte("x"), 0o600)
|
||||
}); err != nil {
|
||||
t.Fatalf("erfolgreicher restore: %v", err)
|
||||
}
|
||||
|
||||
blockedTarget := filepath.Join(root, "blockiert-ziel")
|
||||
if err := os.MkdirAll(blockedTarget, 0o750); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(blockedTarget, "bestehend"), []byte("y"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
_, _ = AtomicRestore(KindObjects, "snap-3", blockedTarget, false, logPath, func(tempDir string) error { return nil })
|
||||
|
||||
entries := readLog(t, logPath)
|
||||
if len(entries) != 2 {
|
||||
t.Fatalf("erwartet 2 protokolleintraege, habe %d: %+v", len(entries), entries)
|
||||
}
|
||||
if entries[0].Source != "gen-3" || entries[0].Kind != KindDatabase || entries[0].Result != "ok" || entries[0].Timestamp.IsZero() {
|
||||
t.Fatalf("erster eintrag unvollstaendig: %+v", entries[0])
|
||||
}
|
||||
if entries[1].Source != "snap-3" || entries[1].Kind != KindObjects || entries[1].Result == "" || entries[1].Timestamp.IsZero() {
|
||||
t.Fatalf("zweiter eintrag unvollstaendig: %+v", entries[1])
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,61 @@
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"bufio"
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
)
|
||||
|
||||
// AppendHistory hängt result an die JSONL-Protokolldatei an
|
||||
// (Akzeptanzkriterium 2/Pflichtprüfung 3: Historie zeigt mehrere
|
||||
// zurückliegende Testläufe nachvollziehbar an — append-only, nichts wird
|
||||
// überschrieben).
|
||||
func AppendHistory(logPath string, result Result) error {
|
||||
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
|
||||
if err != nil {
|
||||
return fmt.Errorf("restoretest: protokolldatei öffnen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
line, err := json.Marshal(result)
|
||||
if err != nil {
|
||||
return fmt.Errorf("restoretest: ergebnis kodieren: %w", err)
|
||||
}
|
||||
if _, err := f.Write(append(line, '\n')); err != nil {
|
||||
return fmt.Errorf("restoretest: ergebnis schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// ReadHistory liest alle bisherigen Testlauf-Ergebnisse — Nachweis der
|
||||
// Nachvollziehbarkeit über mehrere Läufe hinweg.
|
||||
func ReadHistory(logPath string) ([]Result, error) {
|
||||
f, err := os.Open(logPath)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return nil, nil
|
||||
}
|
||||
return nil, fmt.Errorf("restoretest: protokolldatei lesen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
var results []Result
|
||||
scanner := bufio.NewScanner(f)
|
||||
scanner.Buffer(make([]byte, 0, 64*1024), 1024*1024)
|
||||
for scanner.Scan() {
|
||||
line := scanner.Bytes()
|
||||
if len(line) == 0 {
|
||||
continue
|
||||
}
|
||||
var r Result
|
||||
if err := json.Unmarshal(line, &r); err != nil {
|
||||
return nil, fmt.Errorf("restoretest: protokollzeile dekodieren: %w", err)
|
||||
}
|
||||
results = append(results, r)
|
||||
}
|
||||
if err := scanner.Err(); err != nil {
|
||||
return nil, fmt.Errorf("restoretest: protokolldatei durchlaufen: %w", err)
|
||||
}
|
||||
return results, nil
|
||||
}
|
||||
@@ -0,0 +1,49 @@
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestHistory_ShowsMultiplePastRunsInOrder ist Pruefung 3: Protokoll-
|
||||
// historie zeigt mehrere zurueckliegende Testlaeufe nachvollziehbar an.
|
||||
func TestHistory_ShowsMultiplePastRunsInOrder(t *testing.T) {
|
||||
logPath := filepath.Join(t.TempDir(), "restoretest.log")
|
||||
|
||||
results := []Result{
|
||||
{Timestamp: time.Now().UTC(), Kind: KindDatabase, Source: "gen-1", Success: true, Detail: "ok"},
|
||||
{Timestamp: time.Now().UTC().Add(time.Hour), Kind: KindObjects, Source: "snap-1", Success: false, Detail: "kaputt"},
|
||||
{Timestamp: time.Now().UTC().Add(2 * time.Hour), Kind: KindDatabase, Source: "gen-2", Success: true, Detail: "ok"},
|
||||
}
|
||||
for _, r := range results {
|
||||
if err := AppendHistory(logPath, r); err != nil {
|
||||
t.Fatalf("appendHistory: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
got, err := ReadHistory(logPath)
|
||||
if err != nil {
|
||||
t.Fatalf("readHistory: %v", err)
|
||||
}
|
||||
if len(got) != len(results) {
|
||||
t.Fatalf("erwartet %d eintraege, habe %d", len(results), len(got))
|
||||
}
|
||||
for i, want := range results {
|
||||
if got[i].Source != want.Source || got[i].Success != want.Success || got[i].Kind != want.Kind {
|
||||
t.Fatalf("eintrag %d = %+v, want %+v", i, got[i], want)
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
// TestReadHistory_MissingFileReturnsEmpty - noch kein Testlauf ist kein
|
||||
// Fehlerzustand.
|
||||
func TestReadHistory_MissingFileReturnsEmpty(t *testing.T) {
|
||||
got, err := ReadHistory(filepath.Join(t.TempDir(), "nicht-vorhanden.log"))
|
||||
if err != nil {
|
||||
t.Fatalf("erwartet keinen fehler, habe: %v", err)
|
||||
}
|
||||
if len(got) != 0 {
|
||||
t.Fatalf("erwartet leere historie, habe %d eintraege", len(got))
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,239 @@
|
||||
// Package restoretest implementiert BAK-06: regelmäßiger, automatisierter
|
||||
// Testlauf des BAK-03-Restore-Verfahrens gegen eine isolierte
|
||||
// Testumgebung — "Wiederherstellung ist Routine, nicht Ausnahmefall"
|
||||
// (Produkt-DNA) heißt: nicht nur Dateien vorhanden pruefen, sondern
|
||||
// tatsächlich eine funktionsfähige Instanz aus der Sicherung starten und
|
||||
// befragen, exakt wie BAK-03s eigener Prüfungsnachweis — hier als
|
||||
// Produktcode statt Testcode, damit es regelmäßig UNBEAUFSICHTIGT laufen
|
||||
// kann.
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"bytes"
|
||||
"context"
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"strings"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
)
|
||||
|
||||
// Kind unterscheidet Datenbank- und Objekt-Storage-Testlauf im Protokoll.
|
||||
type Kind string
|
||||
|
||||
const (
|
||||
KindDatabase Kind = "database"
|
||||
KindObjects Kind = "objects"
|
||||
)
|
||||
|
||||
// Result ist EIN Testlauf-Ergebnis (Akzeptanzkriterium 2: Ergebnis mit
|
||||
// Zeitstempel protokolliert).
|
||||
type Result struct {
|
||||
Timestamp time.Time `json:"timestamp"`
|
||||
Kind Kind `json:"kind"`
|
||||
Source string `json:"source"` // Generation-ID oder Snapshot-ID
|
||||
Success bool `json:"success"`
|
||||
Detail string `json:"detail"`
|
||||
}
|
||||
|
||||
// PgConfig bündelt die zusätzlich zu backup.Config nötigen Angaben für
|
||||
// den Kurzstart der Test-Instanz (eigener Port/Socket, damit die
|
||||
// Testinstanz die echte Test-Datenbank auf demselben Host nicht stört).
|
||||
type PgConfig struct {
|
||||
PgCtlPath string // Default "pg_ctl"
|
||||
PsqlPath string // Default "psql"
|
||||
TestPort string // Default "55433"
|
||||
}
|
||||
|
||||
func (c PgConfig) ctlBinary() string {
|
||||
if c.PgCtlPath != "" {
|
||||
return c.PgCtlPath
|
||||
}
|
||||
return "pg_ctl"
|
||||
}
|
||||
|
||||
func (c PgConfig) psqlBinary() string {
|
||||
if c.PsqlPath != "" {
|
||||
return c.PsqlPath
|
||||
}
|
||||
return "psql"
|
||||
}
|
||||
|
||||
func (c PgConfig) port() string {
|
||||
if c.TestPort != "" {
|
||||
return c.TestPort
|
||||
}
|
||||
return "55433"
|
||||
}
|
||||
|
||||
// RunDatabaseTest führt einen vollständigen Restore der NEUESTEN
|
||||
// Generation in ein frisches, isoliertes Testverzeichnis durch und
|
||||
// beweist Wiederherstellbarkeit, indem daraus tatsächlich eine
|
||||
// eigenständige Postgres-Instanz gestartet und per echter Verbindung
|
||||
// abgefragt wird (Akzeptanzkriterium 1) — dieselbe Prüftiefe wie BAK-03s
|
||||
// eigener Nachweis, hier als wiederholbarer Produktcode.
|
||||
func RunDatabaseTest(ctx context.Context, cfg backup.Config, pgCfg PgConfig, testRoot string) Result {
|
||||
res := Result{Timestamp: time.Now().UTC(), Kind: KindDatabase}
|
||||
|
||||
generations, err := backup.ListGenerations(cfg.BackupDir)
|
||||
if err != nil || len(generations) == 0 {
|
||||
res.Detail = fmt.Sprintf("keine sicherungsgeneration gefunden: %v", err)
|
||||
return res
|
||||
}
|
||||
genID := generations[len(generations)-1]
|
||||
res.Source = genID
|
||||
|
||||
testDir, err := os.MkdirTemp(testRoot, "restoretest-db-*")
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("testverzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(testDir) }()
|
||||
|
||||
restoreOut := filepath.Join(testDir, "pgdata")
|
||||
if err := os.MkdirAll(restoreOut, 0o700); err != nil {
|
||||
res.Detail = fmt.Sprintf("pgdata-verzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
if err := backup.Restore(ctx, cfg, genID, restoreOut); err != nil {
|
||||
res.Detail = fmt.Sprintf("restore fehlgeschlagen: %v", err)
|
||||
return res
|
||||
}
|
||||
|
||||
// Minimalkonfiguration NUR für den isolierten Kurzstart (auf diesem
|
||||
// Debian-Postgres liegen postgresql.conf/pg_hba.conf ausserhalb von
|
||||
// PGDATA, siehe BAK-03-PRUEFPROTOKOLL.md - der reale Sicherungsinhalt
|
||||
// selbst enthält sie nicht).
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "postgresql.conf"), []byte("listen_addresses = ''\n"), 0o600); err != nil {
|
||||
res.Detail = fmt.Sprintf("testkonfiguration schreiben: %v", err)
|
||||
return res
|
||||
}
|
||||
if err := os.WriteFile(filepath.Join(restoreOut, "pg_hba.conf"), []byte("local all all trust\n"), 0o600); err != nil {
|
||||
res.Detail = fmt.Sprintf("testkonfiguration schreiben: %v", err)
|
||||
return res
|
||||
}
|
||||
|
||||
// EIGENES, kurzes Verzeichnis fuer den Unix-Socket - NICHT unter
|
||||
// testDir (Postgres begrenzt Socket-Pfade auf 107 Byte, ein tief
|
||||
// verschachtelter Testverzeichnis-Pfad reisst dieses Limit leicht).
|
||||
socketDir, err := os.MkdirTemp("", "nexarch-rt-sock-*")
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("socket-verzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(socketDir) }()
|
||||
logFile := filepath.Join(testDir, "postgres.log")
|
||||
|
||||
startCtx, cancel := context.WithTimeout(ctx, 60*time.Second)
|
||||
defer cancel()
|
||||
startCmd := exec.CommandContext(startCtx, pgCfg.ctlBinary(), "start", "-D", restoreOut, "-w", "-t", "30", "-l", logFile,
|
||||
"-o", fmt.Sprintf("-p %s -k %s -c listen_addresses=''", pgCfg.port(), socketDir))
|
||||
if err := startCmd.Run(); err != nil {
|
||||
logContent, _ := os.ReadFile(logFile)
|
||||
res.Detail = fmt.Sprintf("testinstanz starten fehlgeschlagen: %v (log: %s)", err, string(logContent))
|
||||
return res
|
||||
}
|
||||
defer func() {
|
||||
stopCmd := exec.Command(pgCfg.ctlBinary(), "stop", "-D", restoreOut, "-m", "fast")
|
||||
_ = stopCmd.Run()
|
||||
}()
|
||||
|
||||
psqlCtx, cancelPsql := context.WithTimeout(ctx, 15*time.Second)
|
||||
defer cancelPsql()
|
||||
psqlOut, err := exec.CommandContext(psqlCtx, pgCfg.psqlBinary(),
|
||||
"-h", socketDir, "-p", pgCfg.port(), "-U", cfg.User, "-d", "postgres",
|
||||
"-tAc", "SELECT 1").CombinedOutput()
|
||||
if err != nil || strings.TrimSpace(string(psqlOut)) != "1" {
|
||||
res.Detail = fmt.Sprintf("verbindung zur testinstanz fehlgeschlagen: %v (ausgabe: %s)", err, string(psqlOut))
|
||||
return res
|
||||
}
|
||||
|
||||
res.Success = true
|
||||
res.Detail = "restore und verbindungspruefung erfolgreich"
|
||||
return res
|
||||
}
|
||||
|
||||
// RunObjectTest führt einen vollständigen Restore des NEUESTEN Snapshots
|
||||
// in ein frisches, isoliertes Testverzeichnis durch — restics eigene
|
||||
// Vollständigkeitsgarantie beim Restore (bricht bei fehlenden/beschädigten
|
||||
// Blöcken ab) ist der Wiederherstellbarkeitsnachweis, zusätzlich real
|
||||
// geprüft, dass das Zielverzeichnis tatsächlich Inhalt enthält.
|
||||
func RunObjectTest(ctx context.Context, cfg objectbackup.Config, testRoot string) Result {
|
||||
res := Result{Timestamp: time.Now().UTC(), Kind: KindObjects}
|
||||
|
||||
snapshotID, err := latestSnapshotID(ctx, cfg)
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("neuesten snapshot ermitteln: %v", err)
|
||||
return res
|
||||
}
|
||||
res.Source = snapshotID
|
||||
|
||||
testDir, err := os.MkdirTemp(testRoot, "restoretest-objects-*")
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("testverzeichnis anlegen: %v", err)
|
||||
return res
|
||||
}
|
||||
defer func() { _ = os.RemoveAll(testDir) }()
|
||||
|
||||
if err := objectbackup.Restore(ctx, cfg, snapshotID, testDir); err != nil {
|
||||
res.Detail = fmt.Sprintf("restore fehlgeschlagen: %v", err)
|
||||
return res
|
||||
}
|
||||
|
||||
empty, err := dirIsEmpty(testDir)
|
||||
if err != nil {
|
||||
res.Detail = fmt.Sprintf("wiederhergestelltes verzeichnis pruefen: %v", err)
|
||||
return res
|
||||
}
|
||||
if empty {
|
||||
res.Detail = "restore lief ohne fehler, aber zielverzeichnis ist leer"
|
||||
return res
|
||||
}
|
||||
|
||||
res.Success = true
|
||||
res.Detail = "restore erfolgreich, inhalt vorhanden"
|
||||
return res
|
||||
}
|
||||
|
||||
func dirIsEmpty(dir string) (bool, error) {
|
||||
entries, err := os.ReadDir(dir)
|
||||
if err != nil {
|
||||
return false, err
|
||||
}
|
||||
return len(entries) == 0, nil
|
||||
}
|
||||
|
||||
func latestSnapshotID(ctx context.Context, cfg objectbackup.Config) (string, error) {
|
||||
binary := cfg.ResticPath
|
||||
if binary == "" {
|
||||
binary = "restic"
|
||||
}
|
||||
cmd := exec.CommandContext(ctx, binary, "-r", cfg.RepoDir, "snapshots", "--json")
|
||||
cmd.Env = append(os.Environ(), "RESTIC_PASSWORD="+cfg.Password)
|
||||
var stderr bytes.Buffer
|
||||
cmd.Stderr = &stderr
|
||||
// NUR stdout, nicht CombinedOutput: restic schreibt bei fehlendem/
|
||||
// nicht beschreibbarem Cache-Verzeichnis eine Warnung nach stderr
|
||||
// (z.B. "unable to open cache: ..." - real beobachtet unter dem
|
||||
// systemd-Dienstnutzer "nexarch" ohne beschreibbares HOME), die vor
|
||||
// das JSON-Array gemischt worden waere und das Parsen bricht.
|
||||
output, err := cmd.Output()
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("restic snapshots: %w (stderr: %s)", err, stderr.String())
|
||||
}
|
||||
var snapshots []struct {
|
||||
ShortID string `json:"short_id"`
|
||||
}
|
||||
if err := json.Unmarshal(output, &snapshots); err != nil {
|
||||
return "", fmt.Errorf("snapshot-liste dekodieren: %w", err)
|
||||
}
|
||||
if len(snapshots) == 0 {
|
||||
return "", fmt.Errorf("keine snapshots vorhanden")
|
||||
}
|
||||
return snapshots[len(snapshots)-1].ShortID, nil
|
||||
}
|
||||
@@ -0,0 +1,122 @@
|
||||
package restoretest
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/backup"
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/objectbackup"
|
||||
)
|
||||
|
||||
func requireDBTestConfig(t *testing.T) backup.Config {
|
||||
t.Helper()
|
||||
user := os.Getenv("TEST_BACKUP_PG_USER")
|
||||
if user == "" {
|
||||
t.Skip("TEST_BACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen")
|
||||
}
|
||||
if _, err := exec.LookPath("pg_combinebackup"); err != nil {
|
||||
t.Skip("pg_combinebackup nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
if _, err := exec.LookPath("pg_ctl"); err != nil {
|
||||
t.Skip("pg_ctl nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
return backup.Config{
|
||||
Host: envOrT("TEST_BACKUP_PG_HOST", "localhost"),
|
||||
Port: envOrT("TEST_BACKUP_PG_PORT", "5432"),
|
||||
User: user,
|
||||
Password: os.Getenv("TEST_BACKUP_PG_PASSWORD"),
|
||||
BackupDir: t.TempDir(),
|
||||
}
|
||||
}
|
||||
|
||||
func envOrT(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
|
||||
// TestRunDatabaseTest_SucceedsAgainstRealBackup ist Pruefung 1: geplanter
|
||||
// Testlauf gegen aktuelle Sicherung erfolgreich durchgefuehrt.
|
||||
func TestRunDatabaseTest_SucceedsAgainstRealBackup(t *testing.T) {
|
||||
cfg := requireDBTestConfig(t)
|
||||
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
|
||||
defer cancel()
|
||||
|
||||
genID := backup.NewGenerationID(time.Now())
|
||||
if _, err := backup.FullBackup(ctx, cfg, genID); err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
|
||||
res := RunDatabaseTest(ctx, cfg, PgConfig{TestPort: "55434"}, t.TempDir())
|
||||
if !res.Success {
|
||||
t.Fatalf("erwartet erfolgreichen testlauf, habe: %+v", res)
|
||||
}
|
||||
if res.Source != genID {
|
||||
t.Fatalf("source = %q, want %q", res.Source, genID)
|
||||
}
|
||||
}
|
||||
|
||||
// TestRunDatabaseTest_DetectsCorruptedBackup ist Pruefung 2: absichtlich
|
||||
// beschaedigte Sicherung laesst den Testlauf sichtbar fehlschlagen.
|
||||
func TestRunDatabaseTest_DetectsCorruptedBackup(t *testing.T) {
|
||||
cfg := requireDBTestConfig(t)
|
||||
ctx, cancel := context.WithTimeout(context.Background(), 60*time.Second)
|
||||
defer cancel()
|
||||
|
||||
genID := backup.NewGenerationID(time.Now())
|
||||
manifest, err := backup.FullBackup(ctx, cfg, genID)
|
||||
if err != nil {
|
||||
t.Fatalf("fullbackup: %v", err)
|
||||
}
|
||||
|
||||
// Absichtliche Beschaedigung: base.tar.gz durch Muell ersetzen.
|
||||
tarPath := filepath.Join(filepath.Dir(manifest), backup.BaseTarGzFile)
|
||||
if err := os.WriteFile(tarPath, []byte("das ist kein gueltiges tar.gz"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
res := RunDatabaseTest(ctx, cfg, PgConfig{TestPort: "55435"}, t.TempDir())
|
||||
if res.Success {
|
||||
t.Fatal("erwartet fehlschlag bei beschaedigter sicherung, testlauf meldete erfolg")
|
||||
}
|
||||
if res.Detail == "" {
|
||||
t.Fatal("erwartet aussagekraeftiges detail zum fehlschlag")
|
||||
}
|
||||
}
|
||||
|
||||
func requireObjTestConfig(t *testing.T) objectbackup.Config {
|
||||
t.Helper()
|
||||
if _, err := exec.LookPath("restic"); err != nil {
|
||||
t.Skip("restic nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
cfg := objectbackup.Config{RepoDir: filepath.Join(t.TempDir(), "repo"), Password: "restoretest-passwort"}
|
||||
if err := objectbackup.InitRepo(context.Background(), cfg); err != nil {
|
||||
t.Fatalf("initrepo: %v", err)
|
||||
}
|
||||
return cfg
|
||||
}
|
||||
|
||||
// TestRunObjectTest_SucceedsAgainstRealSnapshot ist Pruefung 1 fuer den
|
||||
// Objekt-Storage-Teil.
|
||||
func TestRunObjectTest_SucceedsAgainstRealSnapshot(t *testing.T) {
|
||||
cfg := requireObjTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
sourceDir := t.TempDir()
|
||||
if err := os.WriteFile(filepath.Join(sourceDir, "datei.txt"), []byte("inhalt"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if _, err := objectbackup.Backup(ctx, cfg, sourceDir); err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
|
||||
res := RunObjectTest(ctx, cfg, t.TempDir())
|
||||
if !res.Success {
|
||||
t.Fatalf("erwartet erfolgreichen testlauf, habe: %+v", res)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,57 @@
|
||||
package scrub
|
||||
|
||||
import (
|
||||
"context"
|
||||
"crypto/sha256"
|
||||
"encoding/hex"
|
||||
"fmt"
|
||||
"io"
|
||||
"os"
|
||||
"path/filepath"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
// ExpectedChecksums liest file_revisions.checksum_sha256 fuer genau die
|
||||
// uebergebenen storage_keys — bewusst eine eigene, minimale Abfrage statt
|
||||
// Erweiterung von reconcile.DBEntry (BAK-05 bleibt existenz-only, keine
|
||||
// Kopplung an Inhaltspruefungs-Bedarf von BAK-08).
|
||||
func ExpectedChecksums(ctx context.Context, pool *pgxpool.Pool, storageKeys []string) (map[string]string, error) {
|
||||
if len(storageKeys) == 0 {
|
||||
return map[string]string{}, nil
|
||||
}
|
||||
rows, err := pool.Query(ctx, `
|
||||
SELECT storage_key, checksum_sha256 FROM file_revisions WHERE storage_key = ANY($1)
|
||||
`, storageKeys)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("scrub: erwartete pruefsummen lesen: %w", err)
|
||||
}
|
||||
defer rows.Close()
|
||||
|
||||
out := make(map[string]string, len(storageKeys))
|
||||
for rows.Next() {
|
||||
var key, checksum string
|
||||
if err := rows.Scan(&key, &checksum); err != nil {
|
||||
return nil, fmt.Errorf("scrub: pruefsummen-zeile lesen: %w", err)
|
||||
}
|
||||
out[key] = checksum
|
||||
}
|
||||
return out, rows.Err()
|
||||
}
|
||||
|
||||
// ActualChecksum liest die Datei unter baseDir/storageKey vollstaendig
|
||||
// und berechnet ihren SHA-256 — echte Inhaltspruefung, kein
|
||||
// Header-/Groessenvergleich (dieselbe Disziplin wie BAK-01s Verify).
|
||||
func ActualChecksum(baseDir, storageKey string) (string, error) {
|
||||
f, err := os.Open(filepath.Join(baseDir, filepath.FromSlash(storageKey)))
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("scrub: objekt lesen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
h := sha256.New()
|
||||
if _, err := io.Copy(h, f); err != nil {
|
||||
return "", fmt.Errorf("scrub: objekt hashen: %w", err)
|
||||
}
|
||||
return hex.EncodeToString(h.Sum(nil)), nil
|
||||
}
|
||||
@@ -0,0 +1,94 @@
|
||||
package scrub
|
||||
|
||||
import (
|
||||
"context"
|
||||
"crypto/sha256"
|
||||
"encoding/hex"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
func requireFileRevisionsFixture(t *testing.T) (pool *pgxpool.Pool, userID, docID string) {
|
||||
t.Helper()
|
||||
p := requireTestPool(t)
|
||||
ctx := context.Background()
|
||||
if _, err := p.Exec(ctx, `
|
||||
CREATE EXTENSION IF NOT EXISTS pgcrypto;
|
||||
CREATE TABLE IF NOT EXISTS users (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(), email TEXT NOT NULL UNIQUE, name TEXT NOT NULL,
|
||||
created_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
CREATE TABLE IF NOT EXISTS documents (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(), title TEXT NOT NULL,
|
||||
created_by UUID NOT NULL REFERENCES users(id), created_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
CREATE TABLE IF NOT EXISTS file_revisions (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(), document_id UUID NOT NULL REFERENCES documents(id) ON DELETE CASCADE,
|
||||
storage_key TEXT NOT NULL, checksum_sha256 TEXT NOT NULL, size_bytes BIGINT NOT NULL,
|
||||
mime_type TEXT NOT NULL, revision_number INTEGER NOT NULL, created_by UUID NOT NULL REFERENCES users(id),
|
||||
created_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
`); err != nil {
|
||||
t.Fatalf("file_revisions-fixture: %v", err)
|
||||
}
|
||||
var uid string
|
||||
if err := p.QueryRow(ctx, `INSERT INTO users (email, name) VALUES ('scrub-test@example.test', 'Test') RETURNING id`).Scan(&uid); err != nil {
|
||||
t.Fatalf("testbenutzer anlegen: %v", err)
|
||||
}
|
||||
var did string
|
||||
if err := p.QueryRow(ctx, `INSERT INTO documents (title, created_by) VALUES ('doc', $1) RETURNING id`, uid).Scan(&did); err != nil {
|
||||
t.Fatalf("testdokument anlegen: %v", err)
|
||||
}
|
||||
t.Cleanup(func() { _, _ = p.Exec(context.Background(), `TRUNCATE file_revisions, documents, users CASCADE`) })
|
||||
return p, uid, did
|
||||
}
|
||||
|
||||
// TestActualChecksum_MatchesRealFileContent ist Nachweis, dass
|
||||
// ActualChecksum tatsaechlich den Dateiinhalt liest und hasht (kein
|
||||
// Header-/Groessenvergleich).
|
||||
func TestActualChecksum_MatchesRealFileContent(t *testing.T) {
|
||||
baseDir := t.TempDir()
|
||||
content := []byte("echter dateiinhalt fuer scrub-test")
|
||||
path := filepath.Join(baseDir, "documents", "x", "revisions", "1")
|
||||
if err := os.MkdirAll(filepath.Dir(path), 0o755); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := os.WriteFile(path, content, 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
|
||||
got, err := ActualChecksum(baseDir, "documents/x/revisions/1")
|
||||
if err != nil {
|
||||
t.Fatalf("actualChecksum: %v", err)
|
||||
}
|
||||
sum := sha256.Sum256(content)
|
||||
want := hex.EncodeToString(sum[:])
|
||||
if got != want {
|
||||
t.Fatalf("checksum = %q, want %q", got, want)
|
||||
}
|
||||
}
|
||||
|
||||
// TestExpectedChecksums_ReadsRealFileRevisions ist Nachweis gegen echtes
|
||||
// Postgres, kein Mock.
|
||||
func TestExpectedChecksums_ReadsRealFileRevisions(t *testing.T) {
|
||||
pool, uid, did := requireFileRevisionsFixture(t)
|
||||
ctx := context.Background()
|
||||
|
||||
if _, err := pool.Exec(ctx, `
|
||||
INSERT INTO file_revisions (document_id, storage_key, checksum_sha256, size_bytes, mime_type, revision_number, created_by)
|
||||
VALUES ($1, 'documents/x/revisions/1', 'abc123', 10, 'text/plain', 1, $2)
|
||||
`, did, uid); err != nil {
|
||||
t.Fatalf("testrevision anlegen: %v", err)
|
||||
}
|
||||
|
||||
got, err := ExpectedChecksums(ctx, pool, []string{"documents/x/revisions/1", "documents/fehlt/revisions/1"})
|
||||
if err != nil {
|
||||
t.Fatalf("expectedChecksums: %v", err)
|
||||
}
|
||||
if len(got) != 1 || got["documents/x/revisions/1"] != "abc123" {
|
||||
t.Fatalf("unerwartetes ergebnis: %+v", got)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,69 @@
|
||||
// Package scrub implementiert BAK-08: periodische, checksummenbasierte
|
||||
// Integritaetspruefung einer Stichprobe existierender Objekte. Baut auf
|
||||
// BAK-05 (internal/reconcile) auf, das die deterministisch sortierte
|
||||
// Liste bestaetigt existierender Objekte liefert (existenz-only) — scrub
|
||||
// fuegt die INHALTSPRUEFUNG hinzu, die BAK-05 bewusst ausspart.
|
||||
package scrub
|
||||
|
||||
import (
|
||||
"sort"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/reconcile"
|
||||
)
|
||||
|
||||
// Candidate ist ein fuer den aktuellen Lauf ausgewaehltes Objekt.
|
||||
type Candidate struct {
|
||||
StorageKey string
|
||||
DocumentID string
|
||||
RevisionID string
|
||||
}
|
||||
|
||||
// Sample waehlt aus existing (BAK-05s existing_in_storage, bereits nach
|
||||
// StorageKey sortiert) die naechste Stichprobe: Objekte, die noch nie
|
||||
// oder vor mehr als cooldown geprueft wurden (last_scrubbed via
|
||||
// storage_key -> last_scrubbed_at aus scrub_state), begrenzt auf
|
||||
// sampleSize. Reine Funktion, deterministisch bei gleicher Eingabe (fixe
|
||||
// Reihenfolge von existing, kein Zufall) — Akzeptanzkriterium
|
||||
// "Sampling priorisiert alte, unveraenderte Objekte": ein nie/am
|
||||
// laengsten nicht geprueftes Objekt hat KEINEN last_scrubbed-Eintrag oder
|
||||
// den aeltesten, beides erscheint zuerst in "existing", das seinerseits
|
||||
// nach StorageKey sortiert ist — daher wird zusaetzlich vor der
|
||||
// Groessenbegrenzung nach last_scrubbed_at aufsteigend sortiert (nie
|
||||
// geprueft = aeltestmoeglicher Wert), damit tatsaechlich das am laengsten
|
||||
// nicht verifizierte Objekt zuerst drankommt, nicht nur alphabetisch nach
|
||||
// Schluessel.
|
||||
func Sample(existing []reconcile.Finding, lastScrubbed map[string]time.Time, cooldown time.Duration, sampleSize int, now time.Time) []Candidate {
|
||||
type scored struct {
|
||||
f reconcile.Finding
|
||||
last time.Time
|
||||
}
|
||||
var due []scored
|
||||
for _, f := range existing {
|
||||
last, ok := lastScrubbed[f.StorageKey]
|
||||
if ok && now.Sub(last) < cooldown {
|
||||
continue // erst kuerzlich geprueft, ueberspringen
|
||||
}
|
||||
if !ok {
|
||||
last = time.Time{} // nie geprueft = aeltestmoeglicher Wert, kommt zuerst
|
||||
}
|
||||
due = append(due, scored{f: f, last: last})
|
||||
}
|
||||
|
||||
sort.SliceStable(due, func(i, j int) bool {
|
||||
if !due[i].last.Equal(due[j].last) {
|
||||
return due[i].last.Before(due[j].last)
|
||||
}
|
||||
return due[i].f.StorageKey < due[j].f.StorageKey // Tie-Break deterministisch
|
||||
})
|
||||
|
||||
if sampleSize >= 0 && len(due) > sampleSize {
|
||||
due = due[:sampleSize]
|
||||
}
|
||||
|
||||
out := make([]Candidate, 0, len(due))
|
||||
for _, d := range due {
|
||||
out = append(out, Candidate{StorageKey: d.f.StorageKey, DocumentID: d.f.DocumentID, RevisionID: d.f.RevisionID})
|
||||
}
|
||||
return out
|
||||
}
|
||||
@@ -0,0 +1,95 @@
|
||||
package scrub
|
||||
|
||||
import (
|
||||
"testing"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/archive/internal/reconcile"
|
||||
)
|
||||
|
||||
var now = time.Date(2026, 8, 29, 12, 0, 0, 0, time.UTC)
|
||||
|
||||
// TestSample_PrioritizesNeverScrubbedAndOldest ist der Nachweis fuer das
|
||||
// GoBD-Akzeptanzkriterium: nie geprueft ODER am laengsten nicht geprueft
|
||||
// kommt zuerst, nicht bloss alphabetisch nach StorageKey.
|
||||
func TestSample_PrioritizesNeverScrubbedAndOldest(t *testing.T) {
|
||||
existing := []reconcile.Finding{
|
||||
{StorageKey: "documents/a/revisions/r1"}, // vor 1 tag geprueft
|
||||
{StorageKey: "documents/b/revisions/r1"}, // nie geprueft
|
||||
{StorageKey: "documents/c/revisions/r1"}, // vor 30 tagen geprueft (aeltest)
|
||||
}
|
||||
lastScrubbed := map[string]time.Time{
|
||||
"documents/a/revisions/r1": now.Add(-24 * time.Hour),
|
||||
"documents/c/revisions/r1": now.Add(-30 * 24 * time.Hour),
|
||||
}
|
||||
|
||||
got := Sample(existing, lastScrubbed, time.Hour, 2, now)
|
||||
|
||||
if len(got) != 2 {
|
||||
t.Fatalf("erwartet 2 kandidaten, habe %d: %+v", len(got), got)
|
||||
}
|
||||
// "nie geprueft" (b) zaehlt als aeltestmoeglich, kommt vor "vor 30 tagen" (c).
|
||||
if got[0].StorageKey != "documents/b/revisions/r1" || got[1].StorageKey != "documents/c/revisions/r1" {
|
||||
t.Fatalf("falsche prioritaet, want [b, c], habe %+v", got)
|
||||
}
|
||||
}
|
||||
|
||||
// TestSample_RespectsCooldown ist der Nachweis, dass kuerzlich gepruefte
|
||||
// Objekte NICHT erneut ausgewaehlt werden — sonst wuerde dieselbe Gruppe
|
||||
// dauernd gescrubbt (genau der Fehler, den die Alt-Priorisierung
|
||||
// verhindern soll).
|
||||
func TestSample_RespectsCooldown(t *testing.T) {
|
||||
existing := []reconcile.Finding{
|
||||
{StorageKey: "documents/a/revisions/r1"},
|
||||
{StorageKey: "documents/b/revisions/r1"},
|
||||
}
|
||||
lastScrubbed := map[string]time.Time{
|
||||
"documents/a/revisions/r1": now.Add(-1 * time.Hour), // innerhalb cooldown
|
||||
}
|
||||
|
||||
got := Sample(existing, lastScrubbed, 24*time.Hour, 10, now)
|
||||
|
||||
if len(got) != 1 || got[0].StorageKey != "documents/b/revisions/r1" {
|
||||
t.Fatalf("erwartet nur b (a innerhalb cooldown), habe %+v", got)
|
||||
}
|
||||
}
|
||||
|
||||
// TestSample_LimitsToSampleSize ist der Nachweis, dass die
|
||||
// Stichprobengroesse tatsaechlich begrenzt (kein Voll-Scrub jeden Lauf).
|
||||
func TestSample_LimitsToSampleSize(t *testing.T) {
|
||||
existing := []reconcile.Finding{
|
||||
{StorageKey: "documents/a/revisions/r1"},
|
||||
{StorageKey: "documents/b/revisions/r1"},
|
||||
{StorageKey: "documents/c/revisions/r1"},
|
||||
}
|
||||
|
||||
got := Sample(existing, map[string]time.Time{}, time.Hour, 1, now)
|
||||
|
||||
if len(got) != 1 {
|
||||
t.Fatalf("erwartet genau 1 kandidat, habe %d", len(got))
|
||||
}
|
||||
}
|
||||
|
||||
// TestSample_DeterministicForIdenticalInput ist der Nachweis, dass zwei
|
||||
// Laeufe mit identischer Eingabe dieselbe Reihenfolge liefern (kein
|
||||
// Zufall im Sampling).
|
||||
func TestSample_DeterministicForIdenticalInput(t *testing.T) {
|
||||
existing := []reconcile.Finding{
|
||||
{StorageKey: "documents/a/revisions/r1"},
|
||||
{StorageKey: "documents/b/revisions/r1"},
|
||||
{StorageKey: "documents/c/revisions/r1"},
|
||||
}
|
||||
lastScrubbed := map[string]time.Time{}
|
||||
|
||||
first := Sample(existing, lastScrubbed, time.Hour, 2, now)
|
||||
second := Sample(existing, lastScrubbed, time.Hour, 2, now)
|
||||
|
||||
if len(first) != len(second) {
|
||||
t.Fatal("unterschiedliche anzahl zwischen zwei laeufen mit identischer eingabe")
|
||||
}
|
||||
for i := range first {
|
||||
if first[i].StorageKey != second[i].StorageKey {
|
||||
t.Fatalf("reihenfolge nicht deterministisch: lauf1=%+v lauf2=%+v", first, second)
|
||||
}
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,74 @@
|
||||
package scrub
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"time"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
// LoadLastScrubbed liefert je storage_key den Zeitpunkt der letzten
|
||||
// Pruefung — Grundlage fuer Sample's Cooldown-Filter.
|
||||
func LoadLastScrubbed(ctx context.Context, pool *pgxpool.Pool) (map[string]time.Time, error) {
|
||||
rows, err := pool.Query(ctx, `SELECT storage_key, last_scrubbed_at FROM scrub_state`)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("scrub: scrub_state lesen: %w", err)
|
||||
}
|
||||
defer rows.Close()
|
||||
|
||||
out := make(map[string]time.Time)
|
||||
for rows.Next() {
|
||||
var key string
|
||||
var ts time.Time
|
||||
if err := rows.Scan(&key, &ts); err != nil {
|
||||
return nil, fmt.Errorf("scrub: scrub_state-zeile lesen: %w", err)
|
||||
}
|
||||
out[key] = ts
|
||||
}
|
||||
return out, rows.Err()
|
||||
}
|
||||
|
||||
// MarkScrubbed vermerkt Ergebnis und Zeitpunkt der Pruefung eines
|
||||
// Objekts — idempotent (ON CONFLICT), damit ein unterbrochener und neu
|
||||
// gestarteter Lauf keinen inkonsistenten Zustand hinterlaesst
|
||||
// (Akzeptanzkriterium: Lauf ist unterbrechbar ohne inkonsistenten
|
||||
// Zustand).
|
||||
func MarkScrubbed(ctx context.Context, pool *pgxpool.Pool, storageKey string, ok bool, at time.Time) error {
|
||||
result := "ok"
|
||||
if !ok {
|
||||
result = "failed"
|
||||
}
|
||||
_, err := pool.Exec(ctx, `
|
||||
INSERT INTO scrub_state (storage_key, last_scrubbed_at, last_result)
|
||||
VALUES ($1, $2, $3)
|
||||
ON CONFLICT (storage_key) DO UPDATE SET last_scrubbed_at = $2, last_result = $3
|
||||
`, storageKey, at, result)
|
||||
if err != nil {
|
||||
return fmt.Errorf("scrub: scrub_state schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// RecordFinding erhoeht den monoton steigenden Befund-Zaehler
|
||||
// (scrub_counters.findings_total) um genau 1 — als gueltiger Prometheus-
|
||||
// Counter darf dieser Wert nur steigen, niemals sinken, auch wenn ein
|
||||
// Befund spaeter behoben wird.
|
||||
func RecordFinding(ctx context.Context, pool *pgxpool.Pool) error {
|
||||
_, err := pool.Exec(ctx, `UPDATE scrub_counters SET findings_total = findings_total + 1 WHERE id = 1`)
|
||||
if err != nil {
|
||||
return fmt.Errorf("scrub: befund-zaehler erhoehen: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// FindingsTotal liest den aktuellen Zaehlerstand — genutzt vom
|
||||
// /metrics-Endpunkt (cmd/scrub-metrics).
|
||||
func FindingsTotal(ctx context.Context, pool *pgxpool.Pool) (int64, error) {
|
||||
var total int64
|
||||
err := pool.QueryRow(ctx, `SELECT findings_total FROM scrub_counters WHERE id = 1`).Scan(&total)
|
||||
if err != nil {
|
||||
return 0, fmt.Errorf("scrub: befund-zaehler lesen: %w", err)
|
||||
}
|
||||
return total, nil
|
||||
}
|
||||
@@ -0,0 +1,92 @@
|
||||
package scrub
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"testing"
|
||||
"time"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
func requireTestPool(t *testing.T) *pgxpool.Pool {
|
||||
t.Helper()
|
||||
dsn := os.Getenv("TEST_TENANT_DSN")
|
||||
if dsn == "" {
|
||||
t.Skip("TEST_TENANT_DSN nicht gesetzt, Integrationstest uebersprungen")
|
||||
}
|
||||
ctx := context.Background()
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
t.Fatalf("pool: %v", err)
|
||||
}
|
||||
t.Cleanup(func() { pool.Close() })
|
||||
|
||||
if _, err := pool.Exec(ctx, `
|
||||
CREATE TABLE IF NOT EXISTS scrub_state (
|
||||
storage_key TEXT PRIMARY KEY, last_scrubbed_at TIMESTAMPTZ NOT NULL,
|
||||
last_result TEXT NOT NULL CHECK (last_result IN ('ok', 'failed'))
|
||||
);
|
||||
CREATE TABLE IF NOT EXISTS scrub_counters (
|
||||
id INTEGER PRIMARY KEY DEFAULT 1 CHECK (id = 1), findings_total BIGINT NOT NULL DEFAULT 0
|
||||
);
|
||||
INSERT INTO scrub_counters (id, findings_total) VALUES (1, 0) ON CONFLICT (id) DO NOTHING;
|
||||
`); err != nil {
|
||||
t.Fatalf("schema: %v", err)
|
||||
}
|
||||
t.Cleanup(func() {
|
||||
_, _ = pool.Exec(context.Background(), `TRUNCATE scrub_state; UPDATE scrub_counters SET findings_total = 0 WHERE id = 1`)
|
||||
})
|
||||
return pool
|
||||
}
|
||||
|
||||
// TestMarkScrubbed_IsIdempotent ist Nachweis fuer "Lauf ist idempotent und
|
||||
// unterbrechbar ohne inkonsistenten Zustand": derselbe storage_key kann
|
||||
// beliebig oft neu markiert werden, es entsteht kein Duplikat/Fehler.
|
||||
func TestMarkScrubbed_IsIdempotent(t *testing.T) {
|
||||
pool := requireTestPool(t)
|
||||
ctx := context.Background()
|
||||
key := "documents/x/revisions/1"
|
||||
|
||||
if err := MarkScrubbed(ctx, pool, key, true, time.Now().UTC()); err != nil {
|
||||
t.Fatalf("erster markScrubbed: %v", err)
|
||||
}
|
||||
second := time.Now().UTC().Add(time.Hour)
|
||||
if err := MarkScrubbed(ctx, pool, key, false, second); err != nil {
|
||||
t.Fatalf("zweiter markScrubbed (ueberschreibt): %v", err)
|
||||
}
|
||||
|
||||
last, err := LoadLastScrubbed(ctx, pool)
|
||||
if err != nil {
|
||||
t.Fatalf("loadLastScrubbed: %v", err)
|
||||
}
|
||||
if len(last) != 1 {
|
||||
t.Fatalf("erwartet genau 1 eintrag (kein duplikat), habe %d", len(last))
|
||||
}
|
||||
// Postgres timestamptz rundet auf Mikrosekunden, Go time.Time hat
|
||||
// Nanosekunden-Praezision - Vergleich daher auf Mikrosekunden gerundet.
|
||||
if !last[key].Truncate(time.Microsecond).Equal(second.Truncate(time.Microsecond)) {
|
||||
t.Fatalf("last_scrubbed_at nicht ueberschrieben: %v, want %v", last[key], second)
|
||||
}
|
||||
}
|
||||
|
||||
// TestRecordFinding_IsMonotonicallyIncreasing ist Nachweis, dass der
|
||||
// Zaehler ein gueltiger Prometheus-Counter ist (steigt nur, sinkt nie).
|
||||
func TestRecordFinding_IsMonotonicallyIncreasing(t *testing.T) {
|
||||
pool := requireTestPool(t)
|
||||
ctx := context.Background()
|
||||
|
||||
for i := 0; i < 3; i++ {
|
||||
if err := RecordFinding(ctx, pool); err != nil {
|
||||
t.Fatalf("recordFinding: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
total, err := FindingsTotal(ctx, pool)
|
||||
if err != nil {
|
||||
t.Fatalf("findingsTotal: %v", err)
|
||||
}
|
||||
if total != 3 {
|
||||
t.Fatalf("erwartet 3, habe %d", total)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,76 @@
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"os"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Operation unterscheidet Sicherung und Wiederherstellung im Protokoll.
|
||||
type Operation string
|
||||
|
||||
const (
|
||||
OpBackupDB Operation = "backup_database"
|
||||
OpRestoreDB Operation = "restore_database"
|
||||
OpBackupObj Operation = "backup_objects"
|
||||
OpRestoreObj Operation = "restore_objects"
|
||||
)
|
||||
|
||||
// LogEntry ist EIN Protokolleintrag (Akzeptanzkriterium 3: Tenant-
|
||||
// Sicherung UND -Restore vollständig protokolliert).
|
||||
type LogEntry struct {
|
||||
Timestamp time.Time `json:"timestamp"`
|
||||
Operation Operation `json:"operation"`
|
||||
TenantID string `json:"tenant_id"`
|
||||
Source string `json:"source,omitempty"` // Dump-Pfad oder Snapshot-ID
|
||||
Target string `json:"target,omitempty"` // Zieldatenbank oder Zielverzeichnis
|
||||
Result string `json:"result"` // "ok" oder Fehlertext
|
||||
}
|
||||
|
||||
// AppendLog hängt entry an die JSONL-Protokolldatei an (append-only,
|
||||
// nichts wird überschrieben).
|
||||
func AppendLog(logPath string, entry LogEntry) error {
|
||||
f, err := os.OpenFile(logPath, os.O_APPEND|os.O_CREATE|os.O_WRONLY, 0o600)
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: protokolldatei öffnen: %w", err)
|
||||
}
|
||||
defer func() { _ = f.Close() }()
|
||||
|
||||
line, err := json.Marshal(entry)
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: protokolleintrag kodieren: %w", err)
|
||||
}
|
||||
if _, err := f.Write(append(line, '\n')); err != nil {
|
||||
return fmt.Errorf("tenantbackup: protokolleintrag schreiben: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// ReadLog liest die vollständige Protokollhistorie.
|
||||
func ReadLog(logPath string) ([]LogEntry, error) {
|
||||
data, err := os.ReadFile(logPath)
|
||||
if err != nil {
|
||||
if os.IsNotExist(err) {
|
||||
return nil, nil
|
||||
}
|
||||
return nil, fmt.Errorf("tenantbackup: protokolldatei lesen: %w", err)
|
||||
}
|
||||
var entries []LogEntry
|
||||
start := 0
|
||||
for i := 0; i < len(data); i++ {
|
||||
if data[i] == '\n' {
|
||||
line := data[start:i]
|
||||
start = i + 1
|
||||
if len(line) == 0 {
|
||||
continue
|
||||
}
|
||||
var e LogEntry
|
||||
if err := json.Unmarshal(line, &e); err != nil {
|
||||
return nil, fmt.Errorf("tenantbackup: protokollzeile dekodieren: %w", err)
|
||||
}
|
||||
entries = append(entries, e)
|
||||
}
|
||||
}
|
||||
return entries, nil
|
||||
}
|
||||
@@ -0,0 +1,37 @@
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"path/filepath"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestLog_BackupAndRestoreFullyLogged ist Pruefung 3: Tenant-Sicherung
|
||||
// UND -Restore vollstaendig protokolliert.
|
||||
func TestLog_BackupAndRestoreFullyLogged(t *testing.T) {
|
||||
logPath := filepath.Join(t.TempDir(), "tenantbackup.log")
|
||||
|
||||
entries := []LogEntry{
|
||||
{Timestamp: time.Now().UTC(), Operation: OpBackupDB, TenantID: "a", Source: "/x/dump.pgcustom", Result: "ok"},
|
||||
{Timestamp: time.Now().UTC(), Operation: OpRestoreDB, TenantID: "a", Source: "/x/dump.pgcustom", Target: "a_restored", Result: "ok"},
|
||||
}
|
||||
for _, e := range entries {
|
||||
if err := AppendLog(logPath, e); err != nil {
|
||||
t.Fatalf("appendlog: %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
got, err := ReadLog(logPath)
|
||||
if err != nil {
|
||||
t.Fatalf("readlog: %v", err)
|
||||
}
|
||||
if len(got) != 2 {
|
||||
t.Fatalf("erwartet 2 eintraege, habe %d", len(got))
|
||||
}
|
||||
if got[0].Operation != OpBackupDB || got[1].Operation != OpRestoreDB {
|
||||
t.Fatalf("unerwartete reihenfolge/operationen: %+v", got)
|
||||
}
|
||||
if got[0].TenantID != "a" || got[1].Target != "a_restored" {
|
||||
t.Fatalf("eintraege unvollstaendig: %+v", got)
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,155 @@
|
||||
// Package tenantbackup implementiert BAK-04: Sicherung und
|
||||
// Wiederherstellung der Daten EINES einzelnen Mandanten, ohne andere
|
||||
// Mandanten zu berühren.
|
||||
//
|
||||
// BEWUSST NICHT auf BAK-01/BAK-03 aufgesetzt: pg_basebackup (BAK-01)
|
||||
// sichert den GESAMTEN Postgres-Cluster — bei Modell C (TEN-01, eine
|
||||
// physisch isolierte Datenbank je Mandant) liegen ALLE Mandanten-
|
||||
// Datenbanken in genau diesem einen Cluster, ein Restore der
|
||||
// Cluster-Sicherung würde also zwangsläufig ALLE Mandanten gleichzeitig
|
||||
// überschreiben — das genaue Gegenteil von Mandanten-Isolation. BAK-04
|
||||
// braucht daher ein DATENBANK-SCHARFES logisches Verfahren (pg_dump/
|
||||
// pg_restore für genau EINE Datenbank), keine physische
|
||||
// Cluster-Sicherung. Objekt-Storage ist bereits von Haus aus pro
|
||||
// Mandant getrennt (eigener Bucket/Pfad-Root, STORAGE-KONZEPT.md
|
||||
// Abschnitt 3) — dort genügt ein restic-Repository je Mandanten-Root
|
||||
// (objectbackup-Paket direkt wiederverwendbar, ein Aufruf pro
|
||||
// Mandanten-Verzeichnis).
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"os/exec"
|
||||
"path/filepath"
|
||||
)
|
||||
|
||||
// Config enthält die Verbindungsdaten — ausschließlich über
|
||||
// Umgebungsvariablen befüllt (siehe Ticket-Abschluss-Regel).
|
||||
type Config struct {
|
||||
Host string
|
||||
Port string
|
||||
User string
|
||||
Password string
|
||||
BackupDir string
|
||||
PgDumpPath string // Default "pg_dump"
|
||||
PgRestorePath string // Default "pg_restore"
|
||||
PsqlPath string // Default "psql"
|
||||
}
|
||||
|
||||
func (c Config) dumpBinary() string {
|
||||
if c.PgDumpPath != "" {
|
||||
return c.PgDumpPath
|
||||
}
|
||||
return "pg_dump"
|
||||
}
|
||||
|
||||
func (c Config) restoreBinary() string {
|
||||
if c.PgRestorePath != "" {
|
||||
return c.PgRestorePath
|
||||
}
|
||||
return "pg_restore"
|
||||
}
|
||||
|
||||
func (c Config) psqlBinary() string {
|
||||
if c.PsqlPath != "" {
|
||||
return c.PsqlPath
|
||||
}
|
||||
return "psql"
|
||||
}
|
||||
|
||||
const DumpFile = "dump.pgcustom"
|
||||
|
||||
// Backup erstellt eine logische Sicherung GENAU EINER Mandanten-
|
||||
// Datenbank (Custom-Format, `pg_dump -Fc`) — enthält strukturell
|
||||
// ausschließlich Daten dieser einen Datenbank, andere Mandanten-
|
||||
// Datenbanken werden nie verbunden oder gelesen (Akzeptanzkriterium 1).
|
||||
func Backup(ctx context.Context, cfg Config, tenantDB, generationID string) (dumpPath string, err error) {
|
||||
dir := filepath.Join(cfg.BackupDir, tenantDB, generationID)
|
||||
if err := os.MkdirAll(dir, 0o750); err != nil {
|
||||
return "", fmt.Errorf("tenantbackup: sicherungsverzeichnis anlegen: %w", err)
|
||||
}
|
||||
dumpPath = filepath.Join(dir, DumpFile)
|
||||
|
||||
args := []string{
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
|
||||
"-Fc", "-f", dumpPath, "--no-password", tenantDB,
|
||||
}
|
||||
cmd := exec.CommandContext(ctx, cfg.dumpBinary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("tenantbackup: %s fehlgeschlagen: %w (ausgabe: %s)", cfg.dumpBinary(), err, string(output))
|
||||
}
|
||||
return dumpPath, nil
|
||||
}
|
||||
|
||||
// Verify prüft, dass dumpPath ein vollständig lesbares pg_dump-Custom-
|
||||
// Format-Archiv ist — liest die GESAMTE Inhaltsliste (`pg_restore -l`),
|
||||
// nicht nur den Dateikopf, damit ein abgeschnittenes oder beschädigtes
|
||||
// Archiv zuverlässig auffällt.
|
||||
func Verify(ctx context.Context, cfg Config, dumpPath string) error {
|
||||
cmd := exec.CommandContext(ctx, cfg.restoreBinary(), "-l", dumpPath)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: sicherung beschädigt oder unvollständig: %w (ausgabe: %s)", err, string(output))
|
||||
}
|
||||
if len(output) == 0 {
|
||||
return fmt.Errorf("tenantbackup: sicherung enthält keine inhaltsliste")
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Restore stellt dumpPath in targetDB wieder her — targetDB MUSS bereits
|
||||
// existieren und leer sein (angelegt vom Aufrufer über CreateEmptyDatabase),
|
||||
// niemals die Quelldatenbank selbst oder eine andere Mandanten-Datenbank
|
||||
// (Akzeptanzkriterium 2: Wiederherstellung verändert keine Daten anderer
|
||||
// Mandanten — strukturell garantiert, weil pg_restore ausschließlich mit
|
||||
// der EINEN übergebenen Zielverbindung spricht).
|
||||
func Restore(ctx context.Context, cfg Config, dumpPath, targetDB string) error {
|
||||
args := []string{
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User,
|
||||
// --no-owner: die Zieldatenbank ist eine frische, isolierte
|
||||
// Testumgebung (CreateEmptyDatabase) - der urspruengliche
|
||||
// Tenant-Eigentuemer existiert dort nicht zwangslaeufig mit
|
||||
// gleichen Rechten, und Eigentuemerschaft ist fuer den
|
||||
// Restore-Nachweis irrelevant (Standardpraxis beim Restore in
|
||||
// eine andere Umgebung).
|
||||
"--no-owner",
|
||||
"-d", targetDB, "--no-password", dumpPath,
|
||||
}
|
||||
cmd := exec.CommandContext(ctx, cfg.restoreBinary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: %s fehlgeschlagen: %w (ausgabe: %s)", cfg.restoreBinary(), err, string(output))
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// CreateEmptyDatabase legt targetDB frisch und leer an — schlägt fehl,
|
||||
// wenn targetDB bereits existiert (Isolation: ein Restore darf niemals
|
||||
// stillschweigend eine bestehende Datenbank – eigene oder fremde –
|
||||
// überschreiben, dieselbe "kein stiller Overwrite"-Disziplin wie BAK-03s
|
||||
// internal/restore).
|
||||
func CreateEmptyDatabase(ctx context.Context, cfg Config, targetDB string) error {
|
||||
cmd := exec.CommandContext(ctx, cfg.psqlBinary(),
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-c", fmt.Sprintf("CREATE DATABASE %s", quoteIdent(targetDB)))
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
output, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
return fmt.Errorf("tenantbackup: zieldatenbank %q anlegen fehlgeschlagen (existiert sie bereits?): %w (ausgabe: %s)", targetDB, err, string(output))
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// quoteIdent ist eine MINIMALE Absicherung für Datenbanknamen, die
|
||||
// ausschließlich aus dem eigenen Tenant-Registry-Kontext stammen (nie aus
|
||||
// unmittelbarer Benutzereingabe an dieser Stelle) — auf doppelte
|
||||
// Anführungszeichen beschränkt, da Postgres-Identifier keine
|
||||
// eingebetteten NUL-Bytes zulassen.
|
||||
func quoteIdent(name string) string {
|
||||
return `"` + name + `"`
|
||||
}
|
||||
@@ -0,0 +1,203 @@
|
||||
package tenantbackup
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"os/exec"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// requireTestConfig braucht eine EIGENE Rolle mit CREATEDB-Recht
|
||||
// (TEST_TENANTBACKUP_PG_USER), NICHT BAK-01/BAK-03s TEST_BACKUP_PG_USER
|
||||
// (nexarch_backup) - jene Rolle hat bewusst nur REPLICATION, kein
|
||||
// CREATEDB (Prinzip geringster Rechte, siehe BAK-01). BAK-04 braucht
|
||||
// stattdessen CREATEDB, um isolierte Ziel-Datenbanken anzulegen -
|
||||
// bekommt daher eine eigene, separat scharf gestellte Rolle.
|
||||
func requireTestConfig(t *testing.T) Config {
|
||||
t.Helper()
|
||||
user := os.Getenv("TEST_TENANTBACKUP_PG_USER")
|
||||
if user == "" {
|
||||
t.Skip("TEST_TENANTBACKUP_PG_USER nicht gesetzt, Integrationstest uebersprungen (braucht echte Postgres-Rolle mit CREATEDB)")
|
||||
}
|
||||
if _, err := exec.LookPath("pg_dump"); err != nil {
|
||||
t.Skip("pg_dump nicht installiert, Integrationstest uebersprungen")
|
||||
}
|
||||
return Config{
|
||||
Host: envOr("TEST_TENANTBACKUP_PG_HOST", "localhost"),
|
||||
Port: envOr("TEST_TENANTBACKUP_PG_PORT", "5432"),
|
||||
User: user,
|
||||
Password: os.Getenv("TEST_TENANTBACKUP_PG_PASSWORD"),
|
||||
BackupDir: t.TempDir(),
|
||||
}
|
||||
}
|
||||
|
||||
func envOr(key, fallback string) string {
|
||||
if v := os.Getenv(key); v != "" {
|
||||
return v
|
||||
}
|
||||
return fallback
|
||||
}
|
||||
|
||||
// createMarkerDB legt eine frische Testdatenbank mit genau EINER
|
||||
// Markierungszeile an (Kennzeichen für "das ist eindeutig Tenant X's
|
||||
// Datensatz") - real ueber psql, kein Mock.
|
||||
func createMarkerDB(t *testing.T, cfg Config, dbName, marker string) {
|
||||
t.Helper()
|
||||
ctx := context.Background()
|
||||
run := func(args ...string) {
|
||||
t.Helper()
|
||||
cmd := exec.CommandContext(ctx, cfg.psqlBinary(), args...)
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
if out, err := cmd.CombinedOutput(); err != nil {
|
||||
t.Fatalf("psql %v: %v (ausgabe: %s)", args, err, out)
|
||||
}
|
||||
}
|
||||
base := []string{"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "--no-password"}
|
||||
run(append(append([]string{}, base...), "-d", "postgres", "-c", "DROP DATABASE IF EXISTS "+quoteIdent(dbName))...)
|
||||
run(append(append([]string{}, base...), "-d", "postgres", "-c", "CREATE DATABASE "+quoteIdent(dbName))...)
|
||||
run(append(append([]string{}, base...), "-d", dbName, "-c",
|
||||
"CREATE TABLE marker (value TEXT); INSERT INTO marker VALUES ('"+marker+"')")...)
|
||||
t.Cleanup(func() {
|
||||
run(append(append([]string{}, base...), "-d", "postgres", "-c", "DROP DATABASE IF EXISTS "+quoteIdent(dbName))...)
|
||||
})
|
||||
}
|
||||
|
||||
func markerValue(t *testing.T, cfg Config, dbName string) string {
|
||||
t.Helper()
|
||||
cmd := exec.CommandContext(context.Background(), cfg.psqlBinary(),
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", dbName, "--no-password",
|
||||
"-tAc", "SELECT value FROM marker")
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
out, err := cmd.CombinedOutput()
|
||||
if err != nil {
|
||||
t.Fatalf("markerwert lesen: %v (ausgabe: %s)", err, out)
|
||||
}
|
||||
return trimNL(string(out))
|
||||
}
|
||||
|
||||
func trimNL(s string) string {
|
||||
for len(s) > 0 && (s[len(s)-1] == '\n' || s[len(s)-1] == '\r') {
|
||||
s = s[:len(s)-1]
|
||||
}
|
||||
return s
|
||||
}
|
||||
|
||||
func databaseExists(t *testing.T, cfg Config, dbName string) bool {
|
||||
t.Helper()
|
||||
cmd := exec.CommandContext(context.Background(), cfg.psqlBinary(),
|
||||
"-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-tAc", "SELECT 1 FROM pg_database WHERE datname = '"+dbName+"'")
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
out, _ := cmd.CombinedOutput()
|
||||
return trimNL(string(out)) == "1"
|
||||
}
|
||||
|
||||
// TestBackupRestore_RecoversExactTenantData ist Pruefung 1 (angepasst
|
||||
// auf Akzeptanzkriterium 1): eine Sicherung von Tenant A, wiederhergestellt
|
||||
// in eine isolierte Zieldatenbank, enthaelt real Tenant As Datensatz.
|
||||
func TestBackupRestore_RecoversExactTenantData(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
tenantA := "tenantbackup_test_a"
|
||||
createMarkerDB(t, cfg, tenantA, "gehoert-zu-tenant-a")
|
||||
|
||||
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
if err := Verify(ctx, cfg, dumpPath); err != nil {
|
||||
t.Fatalf("verify: %v", err)
|
||||
}
|
||||
|
||||
target := "tenantbackup_test_a_restored"
|
||||
if databaseExists(t, cfg, target) {
|
||||
t.Fatalf("zieldatenbank %q existiert bereits vor dem test", target)
|
||||
}
|
||||
if err := CreateEmptyDatabase(ctx, cfg, target); err != nil {
|
||||
t.Fatalf("createemptydatabase: %v", err)
|
||||
}
|
||||
t.Cleanup(func() {
|
||||
cmd := exec.Command(cfg.psqlBinary(), "-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-c", "DROP DATABASE IF EXISTS "+quoteIdent(target))
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
_ = cmd.Run()
|
||||
})
|
||||
|
||||
if err := Restore(ctx, cfg, dumpPath, target); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
|
||||
got := markerValue(t, cfg, target)
|
||||
if got != "gehoert-zu-tenant-a" {
|
||||
t.Fatalf("markerwert in wiederhergestellter datenbank = %q, want %q", got, "gehoert-zu-tenant-a")
|
||||
}
|
||||
}
|
||||
|
||||
// TestRestore_DoesNotAffectOtherTenant ist Pruefung 2: Wiederherstellung
|
||||
// von Tenant A veraendert Tenant B nicht - reales zweites Tenant-DB,
|
||||
// Markerwert vor UND nach dem Restore geprueft.
|
||||
func TestRestore_DoesNotAffectOtherTenant(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
tenantA := "tenantbackup_test_iso_a"
|
||||
tenantB := "tenantbackup_test_iso_b"
|
||||
createMarkerDB(t, cfg, tenantA, "wert-a")
|
||||
createMarkerDB(t, cfg, tenantB, "wert-b-unveraendert")
|
||||
|
||||
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
|
||||
target := "tenantbackup_test_iso_a_restored"
|
||||
if err := CreateEmptyDatabase(ctx, cfg, target); err != nil {
|
||||
t.Fatalf("createemptydatabase: %v", err)
|
||||
}
|
||||
t.Cleanup(func() {
|
||||
cmd := exec.Command(cfg.psqlBinary(), "-h", cfg.Host, "-p", cfg.Port, "-U", cfg.User, "-d", "postgres", "--no-password",
|
||||
"-c", "DROP DATABASE IF EXISTS "+quoteIdent(target))
|
||||
cmd.Env = append(os.Environ(), "PGPASSWORD="+cfg.Password)
|
||||
_ = cmd.Run()
|
||||
})
|
||||
if err := Restore(ctx, cfg, dumpPath, target); err != nil {
|
||||
t.Fatalf("restore: %v", err)
|
||||
}
|
||||
|
||||
// Tenant B, der nie an diesem Vorgang beteiligt war, muss unveraendert sein.
|
||||
gotB := markerValue(t, cfg, tenantB)
|
||||
if gotB != "wert-b-unveraendert" {
|
||||
t.Fatalf("tenant b wurde veraendert: %q, want %q", gotB, "wert-b-unveraendert")
|
||||
}
|
||||
// Und Tenant Bs Datenbank existiert weiterhin unter ihrem eigenen Namen
|
||||
// (kein versehentliches Ueberschreiben/Umbenennen).
|
||||
if !databaseExists(t, cfg, tenantB) {
|
||||
t.Fatal("tenant-b-datenbank fehlt nach restore von tenant a")
|
||||
}
|
||||
}
|
||||
|
||||
// TestVerify_DetectsCorruptedDump ist Nachweis der Vollstaendigkeitspruefung.
|
||||
func TestVerify_DetectsCorruptedDump(t *testing.T) {
|
||||
cfg := requireTestConfig(t)
|
||||
ctx := context.Background()
|
||||
|
||||
tenantA := "tenantbackup_test_corrupt"
|
||||
createMarkerDB(t, cfg, tenantA, "wert")
|
||||
|
||||
dumpPath, err := Backup(ctx, cfg, tenantA, time.Now().UTC().Format("20060102T150405Z"))
|
||||
if err != nil {
|
||||
t.Fatalf("backup: %v", err)
|
||||
}
|
||||
if err := Verify(ctx, cfg, dumpPath); err != nil {
|
||||
t.Fatalf("verify (unbeschaedigt) haette erfolgreich sein muessen: %v", err)
|
||||
}
|
||||
|
||||
if err := os.WriteFile(dumpPath, []byte("kein gueltiges pg_dump-custom-archiv"), 0o600); err != nil {
|
||||
t.Fatal(err)
|
||||
}
|
||||
if err := Verify(ctx, cfg, dumpPath); err == nil {
|
||||
t.Fatal("verify haette die beschaedigte sicherung erkennen muessen")
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,2 @@
|
||||
DROP TABLE IF EXISTS scrub_counters;
|
||||
DROP TABLE IF EXISTS scrub_state;
|
||||
@@ -0,0 +1,21 @@
|
||||
-- BAK-08: Zustand des Integritaets-Scrub-Jobs. Getrennt von file_revisions
|
||||
-- (DMS-Eigentum, nur lesend zugegriffen) und getrennt von BAK-05s
|
||||
-- reconcile-Paket (existenz-only, keine Inhaltspruefung) — eigener,
|
||||
-- Archive-eigener Zustand ueber ZULETZT geprueften Zeitpunkt je Objekt,
|
||||
-- damit Sampling rotiert statt dieselben "aeltesten" Objekte auf ewig
|
||||
-- erneut zu ziehen.
|
||||
CREATE TABLE IF NOT EXISTS scrub_state (
|
||||
storage_key TEXT PRIMARY KEY,
|
||||
last_scrubbed_at TIMESTAMPTZ NOT NULL,
|
||||
last_result TEXT NOT NULL CHECK (last_result IN ('ok', 'failed'))
|
||||
);
|
||||
|
||||
-- Einzelne Zeile, monoton steigender Zaehler fuer den OPS-05/OPS-03-
|
||||
-- Metrik-Export (Counter, nie ruecksetzbar — ein behobener Befund darf den
|
||||
-- Zaehler nicht wieder senken, sonst waere es kein gueltiger Prometheus-
|
||||
-- Counter mehr).
|
||||
CREATE TABLE IF NOT EXISTS scrub_counters (
|
||||
id INTEGER PRIMARY KEY DEFAULT 1 CHECK (id = 1),
|
||||
findings_total BIGINT NOT NULL DEFAULT 0
|
||||
);
|
||||
INSERT INTO scrub_counters (id, findings_total) VALUES (1, 0) ON CONFLICT (id) DO NOTHING;
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Datenbank-Vollsicherung (BAK-01)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-backup.env
|
||||
ExecStart=__INSTALL_DIR__/bin/backup-cli full
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Taeglicher Zeitplan fuer NEXARCH Archive Datenbank-Vollsicherung (BAK-01)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 02:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Datenbank-Inkrementalsicherung (BAK-01)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-backup.env
|
||||
ExecStart=__INSTALL_DIR__/bin/backup-cli incremental
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Stuendlicher Zeitplan fuer NEXARCH Archive Datenbank-Inkrementalsicherung (BAK-01)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* *:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Sicherungsgenerationen-Rotation (BAK-01)
|
||||
After=network.target
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-backup.env
|
||||
ExecStart=__INSTALL_DIR__/bin/backup-cli rotate
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Taeglicher Zeitplan fuer NEXARCH Archive Sicherungsgenerationen-Rotation (BAK-01)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 03:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Objekt-Storage-Sicherung (BAK-02)
|
||||
After=network.target
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-objectbackup.env
|
||||
ExecStart=__INSTALL_DIR__/bin/objectbackup-cli backup __OBJECT_SOURCE_DIR__
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Stuendlicher Zeitplan fuer NEXARCH Archive Objekt-Storage-Sicherung (BAK-02)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* *:30:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Objekt-Storage-Sicherung Vollstaendigkeitspruefung (BAK-02)
|
||||
After=network.target
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-objectbackup.env
|
||||
ExecStart=__INSTALL_DIR__/bin/objectbackup-cli check
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Woechentlicher Zeitplan fuer NEXARCH Archive Objekt-Storage-Vollstaendigkeitspruefung (BAK-02)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=Sun *-*-* 04:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Objekt-Storage-Sicherung Rotation (BAK-02)
|
||||
After=network.target
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-objectbackup.env
|
||||
ExecStart=__INSTALL_DIR__/bin/objectbackup-cli rotate
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Taeglicher Zeitplan fuer NEXARCH Archive Objekt-Storage-Rotation (BAK-02)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 03:30:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,10 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Konsistenzpruefung Storage vs. DB (BAK-05)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-reconcile.env
|
||||
ExecStart=__INSTALL_DIR__/bin/reconcile-cli
|
||||
StandardOutput=journal
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Taeglicher Zeitplan fuer NEXARCH Archive Konsistenzpruefung (BAK-05)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 05:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,14 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - /metrics-Export fuer BAK-06 (dauerhaft, Pull-Modell fuer OPS-03)
|
||||
After=network.target
|
||||
|
||||
[Service]
|
||||
Type=simple
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-restoretest.env
|
||||
ExecStart=__INSTALL_DIR__/bin/restoretest-metrics
|
||||
Restart=on-failure
|
||||
StandardOutput=journal
|
||||
|
||||
[Install]
|
||||
WantedBy=multi-user.target
|
||||
@@ -0,0 +1,11 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Restore-Testverfahren (BAK-06)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
Environment=PATH=/usr/bin:/bin:/usr/lib/postgresql/17/bin
|
||||
EnvironmentFile=/etc/nexarch/archive-restoretest.env
|
||||
ExecStart=__INSTALL_DIR__/bin/restoretest-cli
|
||||
StandardOutput=journal
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Zeitplan fuer NEXARCH Archive Restore-Testverfahren (BAK-06)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=Sun *-*-* 07:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,14 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - /metrics-Export fuer BAK-08 (dauerhaft, Pull-Modell fuer OPS-03)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=simple
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-scrub-metrics.env
|
||||
ExecStart=__INSTALL_DIR__/bin/scrub-metrics
|
||||
Restart=on-failure
|
||||
StandardOutput=journal
|
||||
|
||||
[Install]
|
||||
WantedBy=multi-user.target
|
||||
@@ -0,0 +1,10 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Checksummen-Integritaetspruefung Stichprobe (BAK-08)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
EnvironmentFile=/etc/nexarch/archive-scrub.env
|
||||
ExecStart=__INSTALL_DIR__/bin/scrub-cli
|
||||
StandardOutput=journal
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Zeitplan fuer NEXARCH Archive Checksummen-Stichprobe (BAK-08)
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 06:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -0,0 +1,17 @@
|
||||
[Unit]
|
||||
Description=NEXARCH Archive - Tenant-Backup einzelner Mandant (BAK-04)
|
||||
After=network.target postgresql.service
|
||||
|
||||
[Service]
|
||||
Type=oneshot
|
||||
User=nexarch
|
||||
Environment=PATH=/usr/bin:/bin:/usr/lib/postgresql/17/bin
|
||||
EnvironmentFile=/etc/nexarch/archive-tenantbackup.env
|
||||
# NEXARCH_TENANTBACKUP_TENANT_DB und NEXARCH_TENANTBACKUP_STORAGE_ROOT
|
||||
# muessen je Mandant separat gesetzt werden (z.B. ueber eine
|
||||
# systemd-Template-Unit @<mandant>.service, sobald TEN-01s
|
||||
# Tenant-Registry real abfragbar ist) - hier bewusst als Platzhalter
|
||||
# belassen, kein automatisches "alle Mandanten"-Enumerieren ohne echte
|
||||
# Registry-Anbindung.
|
||||
ExecStart=__INSTALL_DIR__/bin/tenantbackup-cli backup ${NEXARCH_TENANTBACKUP_TENANT_DB} ${NEXARCH_TENANTBACKUP_STORAGE_ROOT}
|
||||
StandardOutput=journal
|
||||
@@ -0,0 +1,9 @@
|
||||
[Unit]
|
||||
Description=Zeitplan fuer NEXARCH Archive Tenant-Backup (BAK-04) - unabhaengig vom Gesamt-Backup
|
||||
|
||||
[Timer]
|
||||
OnCalendar=*-*-* 02:00:00
|
||||
Persistent=true
|
||||
|
||||
[Install]
|
||||
WantedBy=timers.target
|
||||
@@ -1,43 +0,0 @@
|
||||
.PHONY: install run run-app run-worker lint fmt test build check
|
||||
|
||||
# Akzeptanzkriterium 1: ein Befehl installiert+startet App und Worker.
|
||||
install: build
|
||||
|
||||
build:
|
||||
go build ./...
|
||||
|
||||
run: build
|
||||
@echo "Starte dms-app und dms-worker (Strg+C zum Beenden beider)"
|
||||
@trap 'kill 0' EXIT; \
|
||||
go run ./cmd/app & \
|
||||
go run ./cmd/worker & \
|
||||
wait
|
||||
|
||||
run-app:
|
||||
go run ./cmd/app
|
||||
|
||||
run-worker:
|
||||
go run ./cmd/worker
|
||||
|
||||
# Akzeptanzkriterium 2: Lint-/Format-Checks laufen lokal durch.
|
||||
lint:
|
||||
golangci-lint run ./...
|
||||
|
||||
fmt:
|
||||
gofmt -l .
|
||||
@test -z "$$(gofmt -l .)" || (echo "gofmt-Verstoesse gefunden, siehe oben" && exit 1)
|
||||
|
||||
test:
|
||||
# -p 1: alle Integrationstest-Pakete teilen sich dieselbe physische
|
||||
# Test-Datenbank (TEST_TENANT_DSN); parallele Paketausfuehrung wuerde
|
||||
# sich gegenseitig ueberschreiben (dieselbe Konvention wie NEXARCH Core,
|
||||
# siehe scripts/run-checks.sh im Core-Modul).
|
||||
go test ./... -p 1 -count=1
|
||||
|
||||
# Setzt die geteilte Test-Datenbank zurueck, dann build/vet/test in einem
|
||||
# Rutsch — analog zu NEXARCH Cores scripts/run-checks.sh.
|
||||
check: build
|
||||
NEXARCH_DMS_TEST_DB_PASSWORD="$${NEXARCH_DMS_TEST_DB_PASSWORD:?Setze NEXARCH_DMS_TEST_DB_PASSWORD vor dem Aufruf}" bash scripts/reset-test-env.sh
|
||||
go vet ./...
|
||||
golangci-lint run ./...
|
||||
go test ./... -p 1 -count=1
|
||||
@@ -1,52 +0,0 @@
|
||||
# NEXARCH DMS
|
||||
|
||||
Dokumentenmanagement-Modul von NEXARCH. Vereint die Stärken von
|
||||
paperless-ngx, Alfresco, Docspell und ecoDMS, vermeidet deren bekannte
|
||||
Schwächen (siehe `known-issues-archivdms.md` im `dms-kanban/`-Ordner).
|
||||
|
||||
Identität, Rechte, Mandantenverwaltung, Authentifizierung, UI-Shell,
|
||||
API-Grundgerüst und Benachrichtigungen kommen aus NEXARCH Core (siehe
|
||||
`../` bzw. `../../core-kanban/`) — dieses Modul implementiert nur die
|
||||
DMS-eigene Logik.
|
||||
|
||||
## Setup
|
||||
|
||||
Voraussetzung: Go 1.22+.
|
||||
|
||||
```bash
|
||||
cd dms
|
||||
make install # baut App und Worker
|
||||
make run # startet beide (Strg+C beendet beide)
|
||||
```
|
||||
|
||||
App läuft danach auf `:8090` (überschreibbar über
|
||||
`NEXARCH_DMS_APP_LISTEN_ADDR`), `GET /healthz` liefert den Status.
|
||||
|
||||
## Struktur
|
||||
|
||||
- `cmd/app` — Anfrage-Dienst (HTTP), blockiert nie durch lange Aufgaben
|
||||
- `cmd/worker` — Hintergrund-Dienst für lange laufende Aufgaben (Indexierung,
|
||||
OCR, Storage-Vorgänge — folgen in FDN-02 ff.)
|
||||
- `internal/shared` — von App und Worker gemeinsam genutzter Code
|
||||
|
||||
## Prüfungen
|
||||
|
||||
```bash
|
||||
make fmt # gofmt-Verstöße brechen ab
|
||||
make lint # golangci-lint
|
||||
make test # go test ./...
|
||||
```
|
||||
|
||||
## Branch- und Commit-Konvention
|
||||
|
||||
Gleiche Konvention wie NEXARCH Core:
|
||||
|
||||
- Branch je Ticket: `feature/<ticket-code>-<kurzbeschreibung>`, z. B.
|
||||
`feature/fdn-02-datenmodell-migrationen`
|
||||
- Commit-Nachricht beginnt mit dem Ticket-Code, z. B.
|
||||
`FDN-02: datenmodell & migrationen`
|
||||
- Ein Ticket = ein Branch. Schrittweise committen, Branch pushen, dann
|
||||
anhalten (kein Merge, kein Deploy durch die bearbeitende Person selbst).
|
||||
- Deutschsprachige Oberflächentexte, englischsprachige Bezeichner im Code.
|
||||
- Keine Zugangsdaten/Schlüssel/Verbindungszeichenfolgen im Code —
|
||||
ausschließlich über Umgebungsvariablen.
|
||||
@@ -1,30 +0,0 @@
|
||||
// app ist der Anfrage-Dienst (Request-Path) des DMS — getrennt vom Worker,
|
||||
// damit lange Hintergrundaufgaben nie eine HTTP-Anfrage blockieren
|
||||
// (Akzeptanzkriterium/Produkt-DNA: paperless-ngx-Trennung Dienst/Worker).
|
||||
package main
|
||||
|
||||
import (
|
||||
"log"
|
||||
"net/http"
|
||||
"os"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/dms/internal/shared"
|
||||
)
|
||||
|
||||
func main() {
|
||||
addr := os.Getenv("NEXARCH_DMS_APP_LISTEN_ADDR")
|
||||
if addr == "" {
|
||||
addr = ":8090"
|
||||
}
|
||||
|
||||
mux := http.NewServeMux()
|
||||
mux.HandleFunc("/healthz", func(w http.ResponseWriter, r *http.Request) {
|
||||
w.Header().Set("Content-Type", "application/json")
|
||||
_, _ = w.Write([]byte(`{"status":"ok","service":"dms-app","version":"` + shared.Version + `"}`))
|
||||
})
|
||||
|
||||
log.Printf("dms-app hoert auf %s (version %s)", addr, shared.Version)
|
||||
if err := http.ListenAndServe(addr, mux); err != nil {
|
||||
log.Fatal(err)
|
||||
}
|
||||
}
|
||||
@@ -1,31 +0,0 @@
|
||||
package main
|
||||
|
||||
import (
|
||||
"net/http"
|
||||
"net/http/httptest"
|
||||
"strings"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// TestHealthz ist der Nachweis, dass der App-Dienst tatsaechlich startet und
|
||||
// antwortet (Akzeptanzkriterium 1: "mit einem Befehl installieren und
|
||||
// starten") — geprueft ueber den Handler direkt statt einen echten Port zu
|
||||
// binden, damit der Test parallel und ohne Portkonflikte laufen kann.
|
||||
func TestHealthz(t *testing.T) {
|
||||
mux := http.NewServeMux()
|
||||
mux.HandleFunc("/healthz", func(w http.ResponseWriter, r *http.Request) {
|
||||
w.Header().Set("Content-Type", "application/json")
|
||||
_, _ = w.Write([]byte(`{"status":"ok","service":"dms-app","version":"test"}`))
|
||||
})
|
||||
|
||||
req := httptest.NewRequest(http.MethodGet, "/healthz", nil)
|
||||
rec := httptest.NewRecorder()
|
||||
mux.ServeHTTP(rec, req)
|
||||
|
||||
if rec.Code != http.StatusOK {
|
||||
t.Fatalf("status = %d, want %d", rec.Code, http.StatusOK)
|
||||
}
|
||||
if !strings.Contains(rec.Body.String(), `"status":"ok"`) {
|
||||
t.Fatalf("unerwarteter body: %s", rec.Body.String())
|
||||
}
|
||||
}
|
||||
@@ -1,35 +0,0 @@
|
||||
// worker ist der Hintergrund-Dienst des DMS — verarbeitet lange laufende
|
||||
// Aufgaben (Indexierung, OCR, Storage-Vorgaenge in spaeteren Kacheln),
|
||||
// getrennt vom App-Prozess (siehe cmd/app).
|
||||
package main
|
||||
|
||||
import (
|
||||
"context"
|
||||
"log"
|
||||
"os"
|
||||
"os/signal"
|
||||
"syscall"
|
||||
"time"
|
||||
|
||||
"gitea.perlbach24.de/scripte/nexarch/dms/internal/shared"
|
||||
)
|
||||
|
||||
func main() {
|
||||
log.Printf("dms-worker gestartet (version %s)", shared.Version)
|
||||
|
||||
ctx, stop := signal.NotifyContext(context.Background(), os.Interrupt, syscall.SIGTERM)
|
||||
defer stop()
|
||||
|
||||
ticker := time.NewTicker(30 * time.Second)
|
||||
defer ticker.Stop()
|
||||
for {
|
||||
select {
|
||||
case <-ctx.Done():
|
||||
log.Println("dms-worker beendet")
|
||||
return
|
||||
case <-ticker.C:
|
||||
// Platzhalter fuer Job-Verarbeitung (FDN-02 ff.) — Poll-Intervall
|
||||
// folgt der projektweiten Postgres-Jobqueue-Konvention.
|
||||
}
|
||||
}
|
||||
}
|
||||
@@ -1,78 +0,0 @@
|
||||
# DOC-01 – Prüfprotokoll: Upload-API & Chunk-Handling
|
||||
|
||||
Welle 3. Voraussetzung: FDN-02, FDN-03, FDN-09 (alle Status "Fertig").
|
||||
|
||||
## Umsetzung
|
||||
|
||||
`internal/upload` verbindet FDN-02 (Datenmodell), FDN-03 (Storage) und
|
||||
FDN-09 (Verschlüsselung) zur ersten echten Ingest-Strecke:
|
||||
|
||||
- `Validator` — MIME-Positivliste (Akzeptanzkriterium 2) und Größenlimit
|
||||
(Schutz vor Speicherbomben) VOR jedem entgegengenommenen Byte geprüft.
|
||||
- `SessionStore`/`upload_sessions` — Fortschritt (`bytes_received`) je
|
||||
Sitzung, `GREATEST`-Update verhindert Rückschritt bei erneut zugestellten
|
||||
Chunks (Akzeptanzkriterium 1).
|
||||
- `Staging` — Chunks landen lokal über `os.File.WriteAt` an ihrem Offset,
|
||||
beliebige Reihenfolge/Wiederholung möglich, bevor das vollständige Objekt
|
||||
verschlüsselt im Storage landet.
|
||||
- `Service.Complete` — SHA-256 UND Verschlüsselung lesen denselben
|
||||
Byte-Strom in einem Durchlauf (`io.TeeReader`), garantiert Prüfsumme auf
|
||||
exakt dem, was verschlüsselt wurde (Akzeptanzkriterium 4, Reihenfolge aus
|
||||
"Bekannte Fehler vermeiden" eingehalten: Hash → verschlüsseln → ablegen).
|
||||
Dokument+Revision werden in EINER Postgres-Transaktion angelegt
|
||||
(Akzeptanzkriterium 3), das Storage-`Put` erfolgt innerhalb derselben
|
||||
Transaktionsspanne vor dem Commit.
|
||||
- Neue Spalte `file_revisions.wrapped_dek` (Migration `0004`) für den
|
||||
FDN-09-Envelope-Wrapper.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Upload von 1 GB Datei erfolgreich | **eingeschränkt bestanden** — siehe Abschnitt "Skalierungs-Einschränkung" unten: real bis 300 MiB auf 192.168.1.131 verifiziert (Upload → Verschlüsselung → Ablage → Checksummen-Abgleich → Entschlüsselungs-Round-Trip, alles exakt), volle 1 GiB auf diesem 4-GB-RAM-Testhost mangels Arbeitsspeicher nicht möglich |
|
||||
| 2 | Abbruch bei 50% und Fortsetzung ergibt identische Prüfsumme | **bestanden** — `TestUploadChunk_ResumeAfterAbortProducesIdenticalChecksum`: 200 KiB Zufallsinhalt, erste Hälfte hochgeladen, `Status`-Abfrage (wie ein neu verbindender Client) bestätigt exakt die Hälfte empfangen, Fortsetzung ab genau diesem Offset, Endprüfsumme stimmt exakt mit der Prüfsumme des vollständigen Originalinhalts überein |
|
||||
| 3 | Parallel-Upload von 20 Dateien ohne Datenverlust | **bestanden** — `TestParallelUploads_NoDataLoss`: 20 gleichzeitige vollständige Upload-Durchläufe (eigene Session je Datei), alle 20 liefern eindeutige Dokument-IDs, jede mit korrekter, individueller Prüfsumme |
|
||||
| 4 | Nach Upload ist `file_revisions.checksum_sha256` befüllt und entspricht der SHA-256 des hochgeladenen Klartexts | **bestanden** — `TestCompleteUpload_CreatesDocumentAndRevisionTransactionally` UND die 300-MiB-Verifikation: gespeicherte Prüfsumme stimmt exakt mit unabhängig berechneter Prüfsumme des Originalinhalts überein |
|
||||
|
||||
## Skalierungs-Einschränkung (real gefunden, nicht vorab bekannt)
|
||||
|
||||
Ein echter 1-GiB-Durchlauf auf 192.168.1.131 (4 GB RAM, kein Swap) endete
|
||||
mit `signal: killed` (OOM). Ursache: sowohl `crypto.EncryptStream`/
|
||||
`DecryptStream` (FDN-09) als auch `storage.S3Driver.Put`/`HTTPUsageReporter`-
|
||||
Pfad (FDN-03) puffern den gesamten Inhalt vollständig im Speicher
|
||||
(`io.ReadAll`) statt echt zu streamen — bereits in den jeweiligen
|
||||
Prüfprotokollen als bewusste Vereinfachung ("kleinste Lösung") dokumentiert,
|
||||
hier zeigt sich der reale Preis dafür: mehrere ~1-GiB-Kopien (Klartext,
|
||||
Chiffretext, ggf. weitere beim Round-Trip) gleichzeitig im Speicher
|
||||
überschreiten 4 GB deutlich. Reduziert auf 300 MiB erfolgreich und
|
||||
vollständig verifiziert (Upload, Verschlüsselung, Ablage, Prüfsummen-Abgleich,
|
||||
Entschlüsselungs-Round-Trip — alles exakt, keine Verkürzung der eigentlichen
|
||||
Prüftiefe, nur der Dateigröße).
|
||||
|
||||
**Nicht in dieser Kachel behoben** (wäre Umbau von FDN-03/FDN-09, „kein
|
||||
Umbau angrenzender Bereiche"): echtes Streaming (segmentierte AEAD-
|
||||
Verschlüsselung, `io.Copy`-basierter Storage-Pfad statt `io.ReadAll`) wäre
|
||||
nötig, um sehr große Dateien auf speicherschwachen Hosts zuverlässig zu
|
||||
verarbeiten. Empfehlung: eigenes Folgeticket, sobald reale Dateigrößen im
|
||||
GB-Bereich Teil der Anforderungen werden — auf einem Host mit mehr RAM
|
||||
wäre der volle 1-GiB-Test hingegen ohne Codeänderung durchführbar, die
|
||||
Einschränkung ist eine Ressourcen-, keine Korrektheitsfrage.
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 6/6 Pakete ok, 0 Fehlschläge (5 neue upload-Tests)
|
||||
```
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden, mit dokumentierter Skalierungs-Einschränkung.** Alle vier
|
||||
Akzeptanzkriterien erfüllt. Von den vier Pflichtprüfungen sind drei
|
||||
uneingeschränkt bestanden; Prüfung 1 (1 GB) wurde bei reduzierter, aber
|
||||
vollständig verifizierter Dateigröße (300 MiB) bestanden — die Differenz
|
||||
liegt nachweislich an der Testhost-Ressourcenausstattung, nicht an der
|
||||
Korrektheit der Implementierung (Mechanismus bei 300 MiB exakt bewiesen,
|
||||
nichts an der Logik ist größenabhängig außer dem Speicherbedarf selbst).
|
||||
@@ -1,42 +0,0 @@
|
||||
# FDN-01 – Prüfprotokoll: Repository & Projektgerüst
|
||||
|
||||
Welle 1, keine Vorbedingungen. Verzeichnis `code/dms/` im bestehenden
|
||||
NEXARCH-Repository (Monorepo-Entscheidung, siehe Rückfrage im
|
||||
Session-Verlauf: DMS als Unterordner statt eigenes Gitea-Repo).
|
||||
|
||||
## Struktur
|
||||
|
||||
- `cmd/app` — Anfrage-Dienst (HTTP, Port 8090 per Default)
|
||||
- `cmd/worker` — Hintergrund-Dienst (getrennter Prozess)
|
||||
- `internal/shared` — gemeinsam genutzter Code
|
||||
- `go.mod` — eigenes Modul `gitea.perlbach24.de/scripte/nexarch/dms`,
|
||||
unabhängig vom Core-Modul (kein gemeinsames `go.mod`, um Abhängigkeits-
|
||||
versionen beider Module unabhängig weiterzuentwickeln)
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Zielwert | Ergebnis |
|
||||
|---|---|---|---|
|
||||
| 1 | Frischer Clone baut ohne manuelle Nacharbeit | `make install` läuft ohne Fehler | **bestanden** — `go build ./...` clean auf 192.168.1.131 |
|
||||
| 2 | Lint-Fehler brechen den Build ab | `make lint` liefert Exit-Code ≠ 0 bei echtem Verstoß | **bestanden** — absichtlich eingefügte ungenutzte Variable liefert Exit-Code 2, Fund korrekt lokalisiert (`declared and not used`) |
|
||||
| 3 | README-Setupanleitung von zweiter Person nachvollzogen | — | **nicht durchgeführt** — keine zweite Person in dieser autonomen Sitzung verfügbar (gleiche Methodik-Abweichung wie QA-05 Prüfung 2/QA-09 Bildschirmleser-Durchlauf); ersatzweise die Anleitung selbst Schritt für Schritt auf einer frischen Kopie (`rsync` auf 192.168.1.131) nachvollzogen: `make install` → `make run` → `curl /healthz` → `{"status":"ok",...}`. |
|
||||
|
||||
Zusätzlich (nicht explizit gefordert, aber Teil von Akzeptanzkriterium 1
|
||||
„installieren UND starten"): `make run` startet App und Worker parallel,
|
||||
`GET /healthz` antwortet mit `200 {"status":"ok","service":"dms-app",...}`
|
||||
innerhalb von 2 Sekunden nach Start.
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131)
|
||||
|
||||
```
|
||||
make build -> clean
|
||||
make fmt -> clean (keine gofmt-Verstoesse)
|
||||
make lint -> clean (golangci-lint v1.62.2: govet, staticcheck, errcheck, unused, ineffassign, gofmt, goimports)
|
||||
make test -> 1/1 Pakete mit Tests ok (cmd/app), 0 Fehlschlaege
|
||||
```
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden**, mit einer dokumentierten Methodik-Abweichung (Prüfung 3,
|
||||
Vier-Augen-Nachvollzug) mangels zweiter Person — durch Selbst-Nachvollzug auf
|
||||
frischer Kopie ersetzt.
|
||||
@@ -1,71 +0,0 @@
|
||||
# FDN-02 – Prüfprotokoll: Datenmodell & Migrationen
|
||||
|
||||
Welle 2. Voraussetzung: FDN-01 (Status "Fertig").
|
||||
|
||||
## Datenmodell
|
||||
|
||||
`migrations/tenant/0001_documents.up.sql` — läuft in der physisch isolierten
|
||||
Tenant-Datenbank (Modell C, siehe Core TEN-01), keine `tenant_id`-Spalte.
|
||||
|
||||
| Entität | Tabelle | Beziehungen |
|
||||
|---|---|---|
|
||||
| Ordner | `folders` | selbstreferenzierend (`parent_folder_id`), `created_by` → `users(id)` |
|
||||
| Dokument | `documents` | `folder_id` → `folders`, `current_revision_id` → `file_revisions`, `created_by` → `users(id)` |
|
||||
| Datei-Revision | `file_revisions` | `document_id` → `documents`, `created_by` → `users(id)`, `UNIQUE(document_id, revision_number)` |
|
||||
| Tag | `tags` | — |
|
||||
| Tag-Zuordnung | `document_tags` | `document_id` → `documents`, `tag_id` → `tags` |
|
||||
| Metadatenfeld | `metadata_fields` | — |
|
||||
| Metadatenwert | `document_metadata_values` | `document_id` → `documents`, `field_id` → `metadata_fields` |
|
||||
|
||||
`created_by`/Benutzerbezug referenziert `users(id)` aus Core IAM-01 (Auth
|
||||
liegt vollständig in Core, siehe "Nicht Bestandteil") — DMS legt `users`
|
||||
nicht selbst an, setzt die Tabelle als bereits vorhanden voraus (dieselbe
|
||||
physische Tenant-Datenbank).
|
||||
|
||||
**Indizes:** `folders(parent_folder_id)`, `documents(folder_id)`,
|
||||
`documents(created_by)`, `file_revisions(document_id)`,
|
||||
`document_tags(tag_id)`, `document_metadata_values(field_id)`.
|
||||
|
||||
## Migrationsmechanik
|
||||
|
||||
`internal/migrate` — eigenständiger, minimaler Runner (kein ORM,
|
||||
`*.up.sql`/`*.down.sql`-Paare), `schema_migrations`-Tabelle als
|
||||
Fortschrittsspeicher (dasselbe Prinzip wie Core, hier eigenständig
|
||||
implementiert, da DMS ein eigenes Go-Modul ist und Cores `internal/`-Pakete
|
||||
nicht importieren kann).
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Migration auf leerer DB und auf bestehender DB getestet | **bestanden** — `TestUp_OnEmptyAndExistingDB`: erster Lauf legt alle 7 Tabellen an, zweiter Lauf gegen dieselbe (jetzt bestehende) DB wendet 0 neue Migrationen an (über `schema_migrations` erkannt) |
|
||||
| 2 | Rollback stellt Vorzustand wieder her | **bestanden** — `TestDownOne_RestoresPreviousState`: nach `DownOne` existiert keine der 7 Tabellen mehr, zweiter `DownOne`-Aufruf ohne verbleibende Migration liefert korrekt leeren String statt Fehler |
|
||||
| 3 | Fremdschlüssel-Constraints durch Negativtests belegt | **bestanden** — `TestForeignKeyConstraints_RejectInvalidReferences`, 4 Fälle: Dokument mit unbekanntem Ordner, unbekanntem Ersteller, Datei-Revision mit unbekanntem Dokument, Tag-Zuordnung mit unbekanntem Tag — alle vier korrekt abgewiesen |
|
||||
|
||||
Zusätzlich (Akzeptanzkriterium 3, Seed-Datensatz): `migrations/tenant/seed/dev_seed.sql`
|
||||
manuell gegen eine frische Test-DB mit einer `users`-Zeile ausgeführt (siehe
|
||||
Sitzungsprotokoll) — legt Ordner, Dokument mit Revision, Tag und
|
||||
Metadatenfeld+-wert an, per Abfrage bestätigt (`Beispieldokument`,
|
||||
`Beispiel-Tag`, `rechnungsnummer` vorhanden). Schlägt bewusst mit
|
||||
sprechender Fehlermeldung fehl, wenn noch kein Benutzer existiert (DMS legt
|
||||
`users` nicht selbst an).
|
||||
|
||||
## Bekannte Fehler vermeiden (aus Ticket)
|
||||
|
||||
„Fehlende Lock-/Sum-Datei blockiert CI" — `go.sum` ist committet (siehe
|
||||
`git status`/Commit-Diff), `go mod tidy` auf 192.168.1.131 ausgeführt und
|
||||
Ergebnis übernommen.
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
make lint -> clean (golangci-lint)
|
||||
go test ./... -v -count=1 -> 3/3 Pakete mit Tests ok (cmd/app, internal/migrate), 0 Fehlschläge
|
||||
```
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei Pflichtprüfungen
|
||||
erfüllt und belegt.
|
||||
@@ -1,84 +0,0 @@
|
||||
# FDN-03 – Prüfprotokoll: Objekt-Storage-Abstraktion
|
||||
|
||||
Welle 2. Voraussetzung: FDN-01 (Status "Fertig"), Core LIC-05 (Status
|
||||
"Fertig").
|
||||
|
||||
## Umsetzung
|
||||
|
||||
`internal/storage`:
|
||||
|
||||
- `Driver`-Interface (Akzeptanzkriterium 1): `Put`/`Get`/`Delete`/`SignedURL`.
|
||||
- `LocalDriver` — Entwicklungs-Treiber, Dateisystem, signierte URLs über
|
||||
HMAC-SHA256 (timing-safe verglichen, `crypto/subtle`, dieselbe Konvention
|
||||
wie Core IAM-15).
|
||||
- `S3Driver` — Produktions-Treiber, S3-kompatibel (`aws-sdk-go-v2`),
|
||||
presigned URLs über `s3.PresignClient`.
|
||||
- `ObjectKey(documentID, revisionID)` — Pfadschema `documents/<id>/revisions/<id>`
|
||||
innerhalb des bereits mandantenspezifischen Buckets (Akzeptanzkriterium 3;
|
||||
die Bucket-Trennung selbst ist Core TEN-01).
|
||||
- `Service` — verbindet `Driver` mit `UsageReporter`: jeder `Put`/`Delete`
|
||||
löst genau eine Nutzungsmeldung mit der tatsächlichen Objektgröße aus
|
||||
(Akzeptanzkriterium 4). Repository-Code soll ausschließlich `Service`
|
||||
aufrufen, nie einen `Driver` direkt.
|
||||
- `HTTPUsageReporter` — meldet über Cores Service-Credential-authentifizierten
|
||||
Resync-Endpunkt (`internal/resync.Handler.UsageHandler`, API-06/AUD-06-Muster),
|
||||
Metrikname `storage_bytes` (gespiegelt aus Core `internal/usage.StorageBytesMetric`,
|
||||
LIC-05 — DMS kann Cores `internal/`-Pakete als eigenes Go-Modul nicht
|
||||
importieren).
|
||||
|
||||
## Wichtiger Befund: Core-Endpunkt noch nicht live verdrahtet
|
||||
|
||||
`internal/resync.Handler` (die Gegenstelle für `HTTPUsageReporter`) ist im
|
||||
Core-Modul vollständig implementiert und getestet, aber **in keinem
|
||||
`cmd/*/main.go` registriert** (per `grep` bestätigt, Stand
|
||||
2026-08-29) — dieselbe Fehlerklasse wie der QA-05/AUD-06-Befund
|
||||
(Bausteine existieren, sind aber nicht in einen laufenden Dienst verdrahtet).
|
||||
`HTTPUsageReporter` ist daher gegen den **dokumentierten Vertrag** (exakte
|
||||
Feldnamen/Header aus `internal/resync/handler.go` gelesen) getestet, nicht
|
||||
gegen eine echte laufende Core-Instanz. Prüfung 4 ist damit im Rahmen dessen
|
||||
erfüllt, was DMS beeinflussen kann — die Lücke auf Core-Seite ist ein
|
||||
Core-Board-Thema (Empfehlung: analog AUD-06 ein Ticket "Resync-Endpunkt in
|
||||
Core-Server verdrahten" anlegen), nicht Bestandteil dieser DMS-Kachel.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Round-Trip-Test Upload/Download je Treiber | **bestanden** — `TestLocalDriver_RoundTrip` (Dateisystem) und `TestS3Driver_RoundTrip` (echtes MinIO auf 192.168.1.131, kein Mock) |
|
||||
| 2 | Abgelaufene signierte URL wird abgewiesen | **bestanden** — `TestLocalDriver_SignedURL_ExpiredIsRejected` (Signatur-/Ablauflogik) UND manuell gegen echtes MinIO verifiziert: presigned URL liefert `200` innerhalb der Gültigkeit, `403` nach Ablauf (2s TTL, siehe Sitzungsprotokoll) |
|
||||
| 3 | Verhalten bei fehlendem Objekt liefert klaren Fehler | **bestanden** — `TestLocalDriver_MissingObject`/`TestS3Driver_MissingObject`: beide Treiber liefern `ErrNotFound` für `Get` UND `Delete` eines nicht existierenden Objekts |
|
||||
| 4 | Melde-Aufruf an Core LIC-05 bei Schreib-/Löschvorgang nachweislich ausgelöst, korrekte Größe | **bestanden** (mit Einschränkung s.o.) — `TestService_PutReportsPositiveDelta`/`TestService_DeleteReportsNegativeDelta` (Fake-Reporter zeichnet Aufrufe auf, prüft Tenant/Metrik/Delta) UND `TestHTTPUsageReporter_SendsCorrectContractToCore` (echter HTTP-Request gegen `httptest.Server`, der Cores Vertrag nachbildet — Header, JSON-Feldnamen) |
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
make lint -> clean (golangci-lint v2.1.6, aus Quelle mit go1.24.4 gebaut,
|
||||
da v1.63.4 den Zielstand go1.24 nicht linten konnte —
|
||||
.golangci.yml auf v2-Konfigurationsformat migriert)
|
||||
go test ./internal/storage/... -v -count=1 -> 11/11 Tests ok (3 S3-Tests real
|
||||
gegen lokal installiertes MinIO statt uebersprungen)
|
||||
```
|
||||
|
||||
## Offener Punkt: Prüfsummen-Schreibpfad noch nicht befüllt
|
||||
|
||||
`file_revisions.checksum_sha256` (FDN-02) wird aktuell von **keinem**
|
||||
Schreibpfad befüllt oder verifiziert — `internal/storage.Service.Put`
|
||||
berechnet keine Inhalts-Prüfsumme (das einzige SHA256 im Paket ist die
|
||||
HMAC-Signatur lokaler URLs, siehe oben, unabhängig vom Dateiinhalt). Die
|
||||
Spalte existiert seit FDN-02 ungenutzt. Nachgetragen als
|
||||
Akzeptanzkriterium/Prüfung in `DOC-01` (Upload-API), das den Hash auf
|
||||
Klartext berechnen und transaktional persistieren muss — Voraussetzung für
|
||||
Duplikaterkennung (`DOC-02`) und die spätere Integritätsprüfung
|
||||
(Archive `BAK-08`, siehe Sitzungsprotokoll 2026-08-29 zu externem,
|
||||
selbst nicht überwachtem Kunden-S3-Storage).
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden**, mit einer dokumentierten Abhängigkeit auf Core-Seite
|
||||
(Abschnitt "Wichtiger Befund") — Core muss `internal/resync.Handler` noch in
|
||||
einen laufenden Dienst verdrahten, bevor `HTTPUsageReporter` echte
|
||||
Nutzungsmeldungen an eine Produktivinstanz senden kann. Alle vier
|
||||
Akzeptanzkriterien und alle vier Pflichtprüfungen im Rahmen des
|
||||
DMS-seitigen Scopes erfüllt.
|
||||
@@ -1,77 +0,0 @@
|
||||
# FDN-04 – Prüfprotokoll: Job-Queue & Worker-Runtime
|
||||
|
||||
Welle 3. Voraussetzung: FDN-02 (Status "Fertig").
|
||||
|
||||
## Umsetzung
|
||||
|
||||
`internal/jobqueue`:
|
||||
|
||||
- `migrations/tenant/0002_processing_jobs.up.sql` — `processing_jobs`-Tabelle
|
||||
(Status `pending`/`processing`/`succeeded`/`failed`/`dead_letter`,
|
||||
`attempts`/`max_attempts`, `available_at` für Backoff-Terminierung,
|
||||
`locked_at`/`locked_by` für die Sperre, `idempotency_key` UNIQUE).
|
||||
- `Queue.Enqueue` — reiht ein, mit optionalem `idempotency_key` (Dedup bei
|
||||
Doppelzustellung, `ON CONFLICT DO UPDATE ... RETURNING id`).
|
||||
- `Queue.Dequeue` — `FOR UPDATE SKIP LOCKED`, holt entweder einen fälligen
|
||||
`pending`-Job oder einen `processing`-Job, dessen Sperre älter als
|
||||
`staleLockAfter` ist (Absturz-Wiedervorlage). Backoff-Intervallarithmetik
|
||||
über `LEAST(attempts, 10) * interval '30 seconds'` — arithmetischer
|
||||
Cast, keine String-Konkatenation (siehe "Bekannte Fehler vermeiden").
|
||||
- `Queue.Complete`/`Queue.Fail` — bei erschöpften Versuchen wandert der Job
|
||||
in `dead_letter`.
|
||||
- `Queue.RequeueDeadLetter` — manuelle Wiederholung eines DLQ-Eintrags.
|
||||
- `Queue.Status` — Job-Status abfragbar.
|
||||
- `Worker`/`Handler` — In-Prozess-Worker-Goroutine, pollt und ruft `Handler`
|
||||
je Job auf.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Absturz eines Workers führt zu erneuter Zustellung | **bestanden** — `TestDequeue_StaleLockIsRedelivered`: Job wird von `worker-crashed` gesperrt, NIE completed/failed (simulierter Absturz); sofortiger erneuter Dequeue-Versuch liefert `ErrNoJobAvailable` (Sperre noch frisch), nach Ablauf von `staleLockAfter` liefert `worker-2` denselben Job |
|
||||
| 2 | Idempotenz bei Doppelzustellung nachgewiesen | **bestanden** — `TestEnqueue_IdempotencyKeyPreventsDuplicate`: zweifache Einreihung mit gleichem `idempotency_key` erzeugt nachweislich nur 1 Zeile (per Abfrage bestätigt) |
|
||||
| 3 | DLQ-Eintrag manuell wiederholbar | **bestanden** — `TestRequeueDeadLetter`: Job nach erschöpften Versuchen in `dead_letter`, `RequeueDeadLetter` setzt zurück auf `pending` mit `attempts=0`; Requeue eines NICHT-DLQ-Jobs wird korrekt abgewiesen |
|
||||
|
||||
## Reale Fehler gefunden und behoben (kein Vorab-Wissen, beim Testen entdeckt)
|
||||
|
||||
1. **pgx-Typinferenz-Fehler bei ungenutztem Parameter**: `Dequeue`s SQL
|
||||
übergab `workerID` als `$1`, ohne es in der Query zu referenzieren —
|
||||
Postgres/pgx konnte den Typ von `$1` dadurch nicht ableiten
|
||||
(`SQLSTATE 42P18`). Behoben durch Entfernen des toten Parameters
|
||||
(workerID wird erst im nachfolgenden `UPDATE` gebraucht).
|
||||
2. **`$2::text[]`-Cast mit untypisiertem `nil`**: `typeFilter any` (statt
|
||||
`[]string`) ließ pgx den Zieltyp des Casts nicht auflösen. Behoben durch
|
||||
`[]string`-Typisierung der Variable.
|
||||
3. **Testinfrastruktur-Drift über Sitzungsgrenzen**: `dms_tenant_test`
|
||||
sammelte über mehrere Testläufe (FDN-02/03/04) `schema_migrations`-Zustand
|
||||
an, wodurch `internal/migrate`s Rollback-Test nur noch einen Teil der
|
||||
Tabellen zurückrollte. Neues `scripts/reset-test-env.sh` (Datenbank
|
||||
droppen+neu anlegen, analog Core `scripts/reset-test-env.sh`) sowie
|
||||
`make check`-Target (Reset+vet+lint+test in einem Rutsch) behoben das
|
||||
strukturell. Zusätzlich fehlte `-p 1` im `test`-Target — mehrere
|
||||
Testpakete teilen sich dieselbe physische Test-DB, parallele
|
||||
Paketausführung (Go-Testdefault) verursachte Querschläger zwischen
|
||||
`internal/jobqueue` und `internal/migrate`.
|
||||
4. **`internal/jobqueue`s Test-Fixture räumte nicht auf**: `TRUNCATE` statt
|
||||
`DROP TABLE` ließ die Tabelle `processing_jobs` stehen, wodurch
|
||||
`internal/migrate`s eigene, versionierte Migration mit
|
||||
`relation already exists` scheiterte. Behoben durch `DROP TABLE IF EXISTS`
|
||||
im Test-Cleanup.
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
scripts/reset-test-env.sh -> dms_tenant_test leer neu angelegt
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 4/4 Pakete ok, 0 Fehlschläge (inkl. 8 jobqueue-Tests, 3 migrate-Tests, 6 storage-Tests real gegen MinIO)
|
||||
```
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden.** Alle drei Akzeptanzkriterien und alle drei Pflichtprüfungen
|
||||
erfüllt. Vier reale Fehler beim Testen gefunden und behoben (zwei
|
||||
Produktionscode-Bugs im SQL-Parameterhandling, zwei
|
||||
Testinfrastruktur-Bugs) — bestätigt erneut den Wert, jede Prüfung
|
||||
tatsächlich auf einem echten Testhost auszuführen statt nur zu behaupten.
|
||||
@@ -1,57 +0,0 @@
|
||||
# FDN-09 – Prüfprotokoll: Verschlüsselung at rest & Schlüsselverwaltung
|
||||
|
||||
Welle 2. Voraussetzung: FDN-01 (Status "Fertig"), Core API-10 (Status
|
||||
"Fertig").
|
||||
|
||||
## Umsetzung
|
||||
|
||||
`internal/crypto`:
|
||||
|
||||
- `GenerateDEK` — 32-Byte-Zufallsschlüssel je Objekt (Akzeptanzkriterium 1).
|
||||
- `EncryptStream`/`DecryptStream` — AES-256-GCM auf dem Objektinhalt.
|
||||
- `WrapDEK`/`UnwrapDEK` — Envelope-Verpackung des DEK mit dem Tenant-KEK.
|
||||
- `RewrapDEK` — verpackt einen DEK-Wrapper von altem auf neuen KEK um,
|
||||
ohne DEK oder Objekt-Chiffretext anzufassen (Akzeptanzkriterium 3).
|
||||
- `HTTPKEKProvider` — bezieht den Tenant-KEK über Cores
|
||||
`internal/kek.Handler.TenantKEKHandler` (API-10), Service-Credential-
|
||||
authentifiziert (Akzeptanzkriterium 2: KEK kommt ausschließlich von Core,
|
||||
wird hier nie persistiert — jeder `Seal`/`Open`-Aufruf bezieht ihn frisch).
|
||||
- `Service` — verbindet `KEKProvider` mit den Envelope-Operationen
|
||||
(`Seal`/`Open`), das ist die einzige öffentliche Schnittstelle, die
|
||||
FDN-03/DOC-01 nutzen sollen.
|
||||
|
||||
## Wichtiger Befund: Core-Endpunkt noch nicht live verdrahtet
|
||||
|
||||
Dieselbe Fehlerklasse wie in FDN-03 (dort: `internal/resync.Handler`):
|
||||
`internal/kek.Handler` (inkl. `TenantKEKHandler`) ist in Core vollständig
|
||||
implementiert und eigenständig getestet, aber **in keinem `cmd/*/main.go`
|
||||
registriert** (per `grep` bestätigt, Stand 2026-08-29). `HTTPKEKProvider`
|
||||
ist daher gegen den **dokumentierten Vertrag** getestet (exakte
|
||||
Feldnamen/Header/Query-Parameter aus `internal/kek/handler.go` gelesen),
|
||||
nicht gegen eine echte laufende Core-Instanz. Empfehlung wie schon bei
|
||||
FDN-03: Core-Board-Folgeticket analog `AUD-06`/dem FDN-03-Befund, das
|
||||
sowohl den Resync- als auch den KEK-Endpunkt in einen laufenden Dienst
|
||||
verdrahtet.
|
||||
|
||||
## Prüfungen
|
||||
|
||||
| # | Prüfung | Ergebnis |
|
||||
|---|---|---|
|
||||
| 1 | Round-Trip Encrypt/Decrypt liefert identischen Klartext | **bestanden** — `TestEncryptDecryptStream_RoundTrip`, `TestService_SealOpen_RoundTrip` |
|
||||
| 2 | Manipulierter Chiffretext wird bei Decrypt erkannt und abgelehnt (GCM-Auth-Tag) | **bestanden** — `TestDecryptStream_RejectsTamperedCiphertext` (letztes Byte gekippt) UND `TestDecryptStream_WrongKeyRejected` (falscher Schlüssel, zweite mögliche Fehlerursache) |
|
||||
| 3 | KEK-Rotation getestet, alte Objekte weiterhin lesbar | **bestanden** — `TestRewrapDEK_RotationKeepsObjectReadable`: Objekt vor Rotation verschlüsselt, `RewrapDEK` von altem auf neuen KEK, Chiffretext bleibt UNVERÄNDERT, alter KEK kann neuen Wrapper nicht mehr entpacken (Rotation wirksam), neuer KEK + neuer Wrapper entschlüsseln das unveränderte, alte Objekt korrekt |
|
||||
|
||||
## Build/Test-Ergebnis (192.168.1.131, `make check`)
|
||||
|
||||
```
|
||||
go build ./... -> clean
|
||||
go vet ./... -> clean
|
||||
golangci-lint run ./... -> 0 issues
|
||||
go test ./... -p 1 -count=1 -> 5/5 Pakete ok, 0 Fehlschläge (10 neue crypto-Tests)
|
||||
```
|
||||
|
||||
## Gesamtergebnis
|
||||
|
||||
**Bestanden**, mit derselben dokumentierten Core-seitigen Abhängigkeit wie
|
||||
FDN-03 (Abschnitt "Wichtiger Befund"). Alle drei Akzeptanzkriterien und
|
||||
alle drei Pflichtprüfungen im Rahmen des DMS-seitigen Scopes erfüllt.
|
||||
-36
@@ -1,36 +0,0 @@
|
||||
module gitea.perlbach24.de/scripte/nexarch/dms
|
||||
|
||||
go 1.24
|
||||
|
||||
toolchain go1.24.4
|
||||
|
||||
require (
|
||||
github.com/aws/aws-sdk-go-v2 v1.45.1
|
||||
github.com/aws/aws-sdk-go-v2/config v1.33.1
|
||||
github.com/aws/aws-sdk-go-v2/credentials v1.20.1
|
||||
github.com/aws/aws-sdk-go-v2/service/s3 v1.109.1
|
||||
github.com/aws/smithy-go v1.28.1
|
||||
github.com/jackc/pgx/v5 v5.6.0
|
||||
)
|
||||
|
||||
require (
|
||||
github.com/aws/aws-sdk-go-v2/aws/protocol/eventstream v1.7.20 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/feature/ec2/imds v1.19.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/internal/configsources v1.5.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/internal/endpoints/v2 v2.8.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/internal/v4a v1.5.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/accept-encoding v1.13.19 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/checksum v1.11.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/presigned-url v1.14.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/s3shared v1.20.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/signin v1.7.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/sso v1.35.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/ssooidc v1.40.1 // indirect
|
||||
github.com/aws/aws-sdk-go-v2/service/sts v1.47.1 // indirect
|
||||
github.com/jackc/pgpassfile v1.0.0 // indirect
|
||||
github.com/jackc/pgservicefile v0.0.0-20221227161230-091c0ba34f0a // indirect
|
||||
github.com/jackc/puddle/v2 v2.2.1 // indirect
|
||||
golang.org/x/crypto v0.17.0 // indirect
|
||||
golang.org/x/sync v0.1.0 // indirect
|
||||
golang.org/x/text v0.14.0 // indirect
|
||||
)
|
||||
-64
@@ -1,64 +0,0 @@
|
||||
github.com/aws/aws-sdk-go-v2 v1.45.1 h1:iIoG3NaLhV6UZpPXyPXlDj2I9oS8tV/nMcMnITCC6Ks=
|
||||
github.com/aws/aws-sdk-go-v2 v1.45.1/go.mod h1:bttEH6JqnUL8LepvDVfdrds/fZ5bCIxzpe3abyUrhDU=
|
||||
github.com/aws/aws-sdk-go-v2/aws/protocol/eventstream v1.7.20 h1:GPRlPwz40I2B2VrBEASOA3Bi77NyeqejNLkifosX0rs=
|
||||
github.com/aws/aws-sdk-go-v2/aws/protocol/eventstream v1.7.20/go.mod h1:g7PNzKcsOKWb4fkSRBA7BZVAS6Y8IcxzN+nRohhQ1Q8=
|
||||
github.com/aws/aws-sdk-go-v2/config v1.33.1 h1:bq9jze1hQ5YTCLoVxNnbp0T7rglrlOE7N9YsHqjGkEw=
|
||||
github.com/aws/aws-sdk-go-v2/config v1.33.1/go.mod h1:2A3HQwG4zaL5Tm80rc6RZj8LmWWv4WYT5v8raSz/L7A=
|
||||
github.com/aws/aws-sdk-go-v2/credentials v1.20.1 h1:Z8GRNEx0u9sDkZOq4PUnN8mjGwbUQGRzMSXpvt3d8xQ=
|
||||
github.com/aws/aws-sdk-go-v2/credentials v1.20.1/go.mod h1:uBIK00kFo95dnemqfFMTWx0X8YRqsh6ecIoCjjOkZqM=
|
||||
github.com/aws/aws-sdk-go-v2/feature/ec2/imds v1.19.1 h1:YIEBqcqRnpi4Pfv0YHImtgi6czGCwKHANC7SwmUAVD0=
|
||||
github.com/aws/aws-sdk-go-v2/feature/ec2/imds v1.19.1/go.mod h1:imEf0oufgAo8KAkCHhrOdqGEC0YWx1PPBQH82shSxGw=
|
||||
github.com/aws/aws-sdk-go-v2/internal/configsources v1.5.1 h1:pc138gM1CW+XPc60rEwUlwwuwWFQK16CI1T7v1F9Oec=
|
||||
github.com/aws/aws-sdk-go-v2/internal/configsources v1.5.1/go.mod h1:1+koxpPIbfBdfzP6vojm5/zTpTQ/micYwlxIiNB3TxI=
|
||||
github.com/aws/aws-sdk-go-v2/internal/endpoints/v2 v2.8.1 h1:K0JsbZQj+1h208Ro1zHeA4l7bMp0NvRffHQ91q8Ol1s=
|
||||
github.com/aws/aws-sdk-go-v2/internal/endpoints/v2 v2.8.1/go.mod h1:W3/vL6EtCIatICGy9ab29QhMuae+cOKPWcMxv02CO+Q=
|
||||
github.com/aws/aws-sdk-go-v2/internal/v4a v1.5.1 h1:yhw5KD1phVyP9vijxOUzDfEtJx+bt+L63k+VfuiYFAA=
|
||||
github.com/aws/aws-sdk-go-v2/internal/v4a v1.5.1/go.mod h1:ZW2e0d7DYlRxlS9hEiMXE47gTdX5KRN4byUiNbUpG+Q=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/accept-encoding v1.13.19 h1:bAdDl/HkGCcGPoe25ToSHEw23VIxt6CT5fLcg111BKg=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/accept-encoding v1.13.19/go.mod h1:KaUzbLxv4CeSxh6ZCl9B4m7CuFenS8kUEaDs+f/DQr4=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/checksum v1.11.1 h1:s67hBfG5t9rn1NCvDuB4E3QIep3UFhHPtaIqFDjV3N8=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/checksum v1.11.1/go.mod h1:FpvjBMXtSNMLPmDJsWwcY5cRnqJlpS2y1R6n4pvzs4k=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/presigned-url v1.14.1 h1:RmmWQPREQdk9U+PfqeHW3MqZaBaNK7TpV9W3RY+b+7g=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/presigned-url v1.14.1/go.mod h1:0A3W4F+68ZnNk5XcNL/e9HFMwnP8RlEicFfy6eOEDyw=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/s3shared v1.20.1 h1:ZMbtPZZQRca+3+XYQne9PBvRiYpHZlNJJOZfE9WNfT0=
|
||||
github.com/aws/aws-sdk-go-v2/service/internal/s3shared v1.20.1/go.mod h1:YAGWQdCYlVCoqrzvfv3RLxO6zKwti7gsAULOGWPLYv4=
|
||||
github.com/aws/aws-sdk-go-v2/service/s3 v1.109.1 h1:kVpzaDBzOdRtOftmiSpTdQbWVqRg0kONLXijktiwXnk=
|
||||
github.com/aws/aws-sdk-go-v2/service/s3 v1.109.1/go.mod h1:CUr46sCpGAg/rHaclRyhJX0LJAmH73uWSJPPSaMUrSk=
|
||||
github.com/aws/aws-sdk-go-v2/service/signin v1.7.1 h1:mdMtSVKdQ3+mzBh+l0ogrFYZVQUCg6pJZOirA2ARsYE=
|
||||
github.com/aws/aws-sdk-go-v2/service/signin v1.7.1/go.mod h1:9IqUlsJDbUPcg6cgx3WEzXdjrbWzLDQrak0aaSqlTcI=
|
||||
github.com/aws/aws-sdk-go-v2/service/sso v1.35.1 h1:B6WFn91tobD6gG4724ONHaqrpKsoETGnv98LHe/yIGM=
|
||||
github.com/aws/aws-sdk-go-v2/service/sso v1.35.1/go.mod h1:tWuiVBUtPBr8/rgRiYS8Uf85sHcAN+G7XS3D3CEoUh8=
|
||||
github.com/aws/aws-sdk-go-v2/service/ssooidc v1.40.1 h1:6yeYCWFvgbI2TI3K6jr9LtBNhXgJ7g4xqD+DEiaDDmM=
|
||||
github.com/aws/aws-sdk-go-v2/service/ssooidc v1.40.1/go.mod h1:naFe83jSMuYkH+QjQPX8n1MLhBkeCFM5Lsnh5m5wz3c=
|
||||
github.com/aws/aws-sdk-go-v2/service/sts v1.47.1 h1:Sv2xPnRHlThSUtVujYuUBPI/Il8si6UPHXL8DMiB/F0=
|
||||
github.com/aws/aws-sdk-go-v2/service/sts v1.47.1/go.mod h1:mKo/CzaCz8qytGW70NG4vIIGAx1HXTlb5lHNkC5k3lk=
|
||||
github.com/aws/smithy-go v1.28.1 h1:R/nXH00c8qcfCzQVELtRw+eLQWtzv+VAIEFJ1/xxXlQ=
|
||||
github.com/aws/smithy-go v1.28.1/go.mod h1:YE2RhdIuDbA5E5bTdciG9KrW3+TiEONeUWCqxX9i1Fc=
|
||||
github.com/davecgh/go-spew v1.1.0/go.mod h1:J7Y8YcW2NihsgmVo/mv3lAwl/skON4iLHjSsI+c5H38=
|
||||
github.com/davecgh/go-spew v1.1.1 h1:vj9j/u1bqnvCEfJOwUhtlOARqs3+rkHYY13jYWTU97c=
|
||||
github.com/davecgh/go-spew v1.1.1/go.mod h1:J7Y8YcW2NihsgmVo/mv3lAwl/skON4iLHjSsI+c5H38=
|
||||
github.com/jackc/pgpassfile v1.0.0 h1:/6Hmqy13Ss2zCq62VdNG8tM1wchn8zjSGOBJ6icpsIM=
|
||||
github.com/jackc/pgpassfile v1.0.0/go.mod h1:CEx0iS5ambNFdcRtxPj5JhEz+xB6uRky5eyVu/W2HEg=
|
||||
github.com/jackc/pgservicefile v0.0.0-20221227161230-091c0ba34f0a h1:bbPeKD0xmW/Y25WS6cokEszi5g+S0QxI/d45PkRi7Nk=
|
||||
github.com/jackc/pgservicefile v0.0.0-20221227161230-091c0ba34f0a/go.mod h1:5TJZWKEWniPve33vlWYSoGYefn3gLQRzjfDlhSJ9ZKM=
|
||||
github.com/jackc/pgx/v5 v5.6.0 h1:SWJzexBzPL5jb0GEsrPMLIsi/3jOo7RHlzTjcAeDrPY=
|
||||
github.com/jackc/pgx/v5 v5.6.0/go.mod h1:DNZ/vlrUnhWCoFGxHAG8U2ljioxukquj7utPDgtQdTw=
|
||||
github.com/jackc/puddle/v2 v2.2.1 h1:RhxXJtFG022u4ibrCSMSiu5aOq1i77R3OHKNJj77OAk=
|
||||
github.com/jackc/puddle/v2 v2.2.1/go.mod h1:vriiEXHvEE654aYKXXjOvZM39qJ0q+azkZFrfEOc3H4=
|
||||
github.com/pmezard/go-difflib v1.0.0 h1:4DBwDE0NGyQoBHbLQYPwSUPoCMWR5BEzIk/f1lZbAQM=
|
||||
github.com/pmezard/go-difflib v1.0.0/go.mod h1:iKH77koFhYxTK1pcRnkKkqfTogsbg7gZNVY4sRDYZ/4=
|
||||
github.com/stretchr/objx v0.1.0/go.mod h1:HFkY916IF+rwdDfMAkV7OtwuqBVzrE8GR6GFx+wExME=
|
||||
github.com/stretchr/testify v1.3.0/go.mod h1:M5WIy9Dh21IEIfnGCwXGc5bZfKNJtfHm1UVUgZn+9EI=
|
||||
github.com/stretchr/testify v1.7.0/go.mod h1:6Fq8oRcR53rry900zMqJjRRixrwX3KX962/h/Wwjteg=
|
||||
github.com/stretchr/testify v1.8.1 h1:w7B6lhMri9wdJUVmEZPGGhZzrYTPvgJArz7wNPgYKsk=
|
||||
github.com/stretchr/testify v1.8.1/go.mod h1:w2LPCIKwWwSfY2zedu0+kehJoqGctiVI29o6fzry7u4=
|
||||
golang.org/x/crypto v0.17.0 h1:r8bRNjWL3GshPW3gkd+RpvzWrZAwPS49OmTGZ/uhM4k=
|
||||
golang.org/x/crypto v0.17.0/go.mod h1:gCAAfMLgwOJRpTjQ2zCCt2OcSfYMTeZVSRtQlPC7Nq4=
|
||||
golang.org/x/sync v0.1.0 h1:wsuoTGHzEhffawBOhz5CYhcrV4IdKZbEyZjBMuTp12o=
|
||||
golang.org/x/sync v0.1.0/go.mod h1:RxMgew5VJxzue5/jJTE5uejpjVlOe/izrB70Jof72aM=
|
||||
golang.org/x/text v0.14.0 h1:ScX5w1eTa3QqT8oi6+ziP7dTV1S2+ALU0bI+0zXKWiQ=
|
||||
golang.org/x/text v0.14.0/go.mod h1:18ZOQIKpY8NJVqYksKHtTdi31H5itFRjB5/qKTNYzSU=
|
||||
gopkg.in/check.v1 v0.0.0-20161208181325-20d25e280405/go.mod h1:Co6ibVJAznAaIkqp8huTwlJQCZ016jof/cbN4VW5Yz0=
|
||||
gopkg.in/yaml.v3 v3.0.0-20200313102051-9f266ea9e77c/go.mod h1:K4uyk7z7BCEPqu6E+C64Yfv1cQ7kz7rIZviUmN+EgEM=
|
||||
gopkg.in/yaml.v3 v3.0.1 h1:fxVm/GzAzEWqLHuvctI91KS9hhNmmWOoWu0XTYJS7CA=
|
||||
gopkg.in/yaml.v3 v3.0.1/go.mod h1:K4uyk7z7BCEPqu6E+C64Yfv1cQ7kz7rIZviUmN+EgEM=
|
||||
@@ -1,140 +0,0 @@
|
||||
// Package crypto implementiert FDN-09: Envelope-Encryption fuer Objekte
|
||||
// at rest. Jedes Objekt bekommt einen eigenen, zufaelligen
|
||||
// Datenverschluesselungsschluessel (DEK, Akzeptanzkriterium 1), der mit
|
||||
// dem Tenant-Hauptschluessel (KEK) verpackt wird — der KEK selbst kommt
|
||||
// AUSSCHLIESSLICH von Core API-10 (Akzeptanzkriterium 2), wird hier nie
|
||||
// persistiert, nur fluechtig fuer eine Wrap-/Unwrap-Operation gehalten.
|
||||
package crypto
|
||||
|
||||
import (
|
||||
"bytes"
|
||||
"crypto/aes"
|
||||
"crypto/cipher"
|
||||
"crypto/rand"
|
||||
"errors"
|
||||
"fmt"
|
||||
"io"
|
||||
)
|
||||
|
||||
// DEKSize/KEKSize sind die geforderten Laengen fuer AES-256-GCM.
|
||||
const (
|
||||
DEKSize = 32
|
||||
KEKSize = 32
|
||||
)
|
||||
|
||||
// ErrDecryptFailed wird geliefert, wenn ein Chiffretext nicht entschluesselt
|
||||
// werden kann — falscher Schluessel ODER manipulierte Daten (Pruefung 2:
|
||||
// GCM-Auth-Tag erkennt Manipulation zuverlaessig, AEAD unterscheidet die
|
||||
// beiden Ursachen bewusst nicht, um keine Seitenkanal-Information ueber
|
||||
// "welcher Teil" falsch war preiszugeben).
|
||||
var ErrDecryptFailed = errors.New("crypto: entschluesselung fehlgeschlagen (falscher schluessel oder manipulierte daten)")
|
||||
|
||||
// GenerateDEK erzeugt einen neuen, zufaelligen Datenverschluesselungs-
|
||||
// schluessel — fuer JEDES Objekt neu, nie wiederverwendet
|
||||
// (Akzeptanzkriterium 1).
|
||||
func GenerateDEK() ([]byte, error) {
|
||||
dek := make([]byte, DEKSize)
|
||||
if _, err := rand.Read(dek); err != nil {
|
||||
return nil, fmt.Errorf("crypto: dek erzeugen: %w", err)
|
||||
}
|
||||
return dek, nil
|
||||
}
|
||||
|
||||
func seal(key, plaintext []byte) ([]byte, error) {
|
||||
block, err := aes.NewCipher(key)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: aes-cipher erstellen: %w", err)
|
||||
}
|
||||
gcm, err := cipher.NewGCM(block)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: gcm erstellen: %w", err)
|
||||
}
|
||||
nonce := make([]byte, gcm.NonceSize())
|
||||
if _, err := rand.Read(nonce); err != nil {
|
||||
return nil, fmt.Errorf("crypto: nonce erzeugen: %w", err)
|
||||
}
|
||||
return gcm.Seal(nonce, nonce, plaintext, nil), nil
|
||||
}
|
||||
|
||||
func open(key, sealed []byte) ([]byte, error) {
|
||||
block, err := aes.NewCipher(key)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: aes-cipher erstellen: %w", err)
|
||||
}
|
||||
gcm, err := cipher.NewGCM(block)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: gcm erstellen: %w", err)
|
||||
}
|
||||
if len(sealed) < gcm.NonceSize() {
|
||||
return nil, ErrDecryptFailed
|
||||
}
|
||||
nonce, ciphertext := sealed[:gcm.NonceSize()], sealed[gcm.NonceSize():]
|
||||
plaintext, err := gcm.Open(nil, nonce, ciphertext, nil)
|
||||
if err != nil {
|
||||
return nil, ErrDecryptFailed
|
||||
}
|
||||
return plaintext, nil
|
||||
}
|
||||
|
||||
// WrapDEK verpackt einen DEK mit dem Tenant-KEK (Envelope-Verfahren).
|
||||
func WrapDEK(kek, dek []byte) ([]byte, error) {
|
||||
wrapped, err := seal(kek, dek)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: dek verpacken: %w", err)
|
||||
}
|
||||
return wrapped, nil
|
||||
}
|
||||
|
||||
// UnwrapDEK entpackt einen zuvor mit WrapDEK verpackten DEK.
|
||||
func UnwrapDEK(kek, wrappedDEK []byte) ([]byte, error) {
|
||||
return open(kek, wrappedDEK)
|
||||
}
|
||||
|
||||
// RewrapDEK verpackt einen bereits vorhandenen DEK-Wrapper von oldKEK auf
|
||||
// newKEK um, OHNE den DEK selbst oder den Objekt-Chiffretext zu veraendern
|
||||
// (Akzeptanzkriterium 3: KEK-Rotation ohne Neuverschluesselung aller
|
||||
// Objekte — nur der DEK-Wrapper wird neu verpackt).
|
||||
func RewrapDEK(oldKEK, newKEK, wrappedDEK []byte) ([]byte, error) {
|
||||
dek, err := UnwrapDEK(oldKEK, wrappedDEK)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: dek mit altem kek entpacken: %w", err)
|
||||
}
|
||||
rewrapped, err := WrapDEK(newKEK, dek)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: dek mit neuem kek verpacken: %w", err)
|
||||
}
|
||||
return rewrapped, nil
|
||||
}
|
||||
|
||||
// EncryptStream verschluesselt den gesamten Inhalt von r mit dek
|
||||
// (AES-256-GCM) und liefert den Chiffretext als Stream. Liest r vollstaendig
|
||||
// in den Speicher (dasselbe Muster wie internal/storage.S3Driver.Put aus
|
||||
// FDN-03, das S3-PutObject ebenfalls vollstaendig puffert) — fuer sehr
|
||||
// grosse Dateien waere ein segmentiertes AEAD-Verfahren noetig, das ist
|
||||
// bewusst nicht Teil der "kleinsten Loesung" dieser Kachel.
|
||||
func EncryptStream(dek []byte, r io.Reader) (io.Reader, error) {
|
||||
plaintext, err := io.ReadAll(r)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: klartext lesen: %w", err)
|
||||
}
|
||||
ciphertext, err := seal(dek, plaintext)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: verschluesseln: %w", err)
|
||||
}
|
||||
return bytes.NewReader(ciphertext), nil
|
||||
}
|
||||
|
||||
// DecryptStream entschluesselt einen zuvor mit EncryptStream erzeugten
|
||||
// Chiffretext-Stream. Liefert ErrDecryptFailed bei manipuliertem Chiffretext
|
||||
// (Pruefung 2, GCM-Auth-Tag).
|
||||
func DecryptStream(dek []byte, r io.Reader) (io.Reader, error) {
|
||||
ciphertext, err := io.ReadAll(r)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: chiffretext lesen: %w", err)
|
||||
}
|
||||
plaintext, err := open(dek, ciphertext)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
return bytes.NewReader(plaintext), nil
|
||||
}
|
||||
@@ -1,187 +0,0 @@
|
||||
package crypto
|
||||
|
||||
import (
|
||||
"bytes"
|
||||
"errors"
|
||||
"io"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// TestGenerateDEK_NeverReused ist Akzeptanzkriterium 1: DEK wird pro
|
||||
// Objekt neu erzeugt, nie wiederverwendet.
|
||||
func TestGenerateDEK_NeverReused(t *testing.T) {
|
||||
seen := map[string]bool{}
|
||||
for i := 0; i < 50; i++ {
|
||||
dek, err := GenerateDEK()
|
||||
if err != nil {
|
||||
t.Fatalf("generatedek: %v", err)
|
||||
}
|
||||
if len(dek) != DEKSize {
|
||||
t.Fatalf("dek-laenge = %d, want %d", len(dek), DEKSize)
|
||||
}
|
||||
key := string(dek)
|
||||
if seen[key] {
|
||||
t.Fatal("generatedek lieferte denselben schluessel zweimal")
|
||||
}
|
||||
seen[key] = true
|
||||
}
|
||||
}
|
||||
|
||||
// TestEncryptDecryptStream_RoundTrip ist Pruefung 1: Round-Trip liefert
|
||||
// identischen Klartext.
|
||||
func TestEncryptDecryptStream_RoundTrip(t *testing.T) {
|
||||
dek, err := GenerateDEK()
|
||||
if err != nil {
|
||||
t.Fatalf("generatedek: %v", err)
|
||||
}
|
||||
plaintext := []byte("Rechnung 2026-0001 — vertraulicher Inhalt")
|
||||
|
||||
ciphertext, err := EncryptStream(dek, bytes.NewReader(plaintext))
|
||||
if err != nil {
|
||||
t.Fatalf("encryptstream: %v", err)
|
||||
}
|
||||
ciphertextBytes, err := io.ReadAll(ciphertext)
|
||||
if err != nil {
|
||||
t.Fatalf("chiffretext lesen: %v", err)
|
||||
}
|
||||
if bytes.Equal(ciphertextBytes, plaintext) {
|
||||
t.Fatal("chiffretext ist identisch zum klartext - keine verschluesselung stattgefunden")
|
||||
}
|
||||
|
||||
decrypted, err := DecryptStream(dek, bytes.NewReader(ciphertextBytes))
|
||||
if err != nil {
|
||||
t.Fatalf("decryptstream: %v", err)
|
||||
}
|
||||
got, err := io.ReadAll(decrypted)
|
||||
if err != nil {
|
||||
t.Fatalf("klartext lesen: %v", err)
|
||||
}
|
||||
if !bytes.Equal(got, plaintext) {
|
||||
t.Fatalf("entschluesselter klartext = %q, want %q", got, plaintext)
|
||||
}
|
||||
}
|
||||
|
||||
// TestDecryptStream_RejectsTamperedCiphertext ist Pruefung 2: manipulierter
|
||||
// Chiffretext wird bei Decrypt erkannt und abgelehnt (GCM-Auth-Tag).
|
||||
func TestDecryptStream_RejectsTamperedCiphertext(t *testing.T) {
|
||||
dek, err := GenerateDEK()
|
||||
if err != nil {
|
||||
t.Fatalf("generatedek: %v", err)
|
||||
}
|
||||
ciphertext, err := EncryptStream(dek, bytes.NewReader([]byte("geheimer inhalt")))
|
||||
if err != nil {
|
||||
t.Fatalf("encryptstream: %v", err)
|
||||
}
|
||||
tampered, err := io.ReadAll(ciphertext)
|
||||
if err != nil {
|
||||
t.Fatalf("chiffretext lesen: %v", err)
|
||||
}
|
||||
// Ein Byte in der Mitte des Chiffretexts kippen (nach dem Nonce-Praefix).
|
||||
tampered[len(tampered)-1] ^= 0xFF
|
||||
|
||||
if _, err := DecryptStream(dek, bytes.NewReader(tampered)); !errors.Is(err, ErrDecryptFailed) {
|
||||
t.Fatalf("manipulierter chiffretext: erwartet ErrDecryptFailed, habe %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestDecryptStream_WrongKeyRejected prueft den zweiten Fall, in dem
|
||||
// Entschluesselung scheitern muss: falscher Schluessel statt Manipulation.
|
||||
func TestDecryptStream_WrongKeyRejected(t *testing.T) {
|
||||
dek1, _ := GenerateDEK()
|
||||
dek2, _ := GenerateDEK()
|
||||
ciphertext, err := EncryptStream(dek1, bytes.NewReader([]byte("inhalt")))
|
||||
if err != nil {
|
||||
t.Fatalf("encryptstream: %v", err)
|
||||
}
|
||||
ciphertextBytes, _ := io.ReadAll(ciphertext)
|
||||
|
||||
if _, err := DecryptStream(dek2, bytes.NewReader(ciphertextBytes)); !errors.Is(err, ErrDecryptFailed) {
|
||||
t.Fatalf("falscher schluessel: erwartet ErrDecryptFailed, habe %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestWrapUnwrapDEK_RoundTrip prueft das Envelope-Verpacken des DEK selbst.
|
||||
func TestWrapUnwrapDEK_RoundTrip(t *testing.T) {
|
||||
kek := make([]byte, KEKSize)
|
||||
for i := range kek {
|
||||
kek[i] = byte(i)
|
||||
}
|
||||
dek, err := GenerateDEK()
|
||||
if err != nil {
|
||||
t.Fatalf("generatedek: %v", err)
|
||||
}
|
||||
|
||||
wrapped, err := WrapDEK(kek, dek)
|
||||
if err != nil {
|
||||
t.Fatalf("wrapdek: %v", err)
|
||||
}
|
||||
if bytes.Equal(wrapped, dek) {
|
||||
t.Fatal("wrapdek lieferte den unveraenderten dek")
|
||||
}
|
||||
|
||||
unwrapped, err := UnwrapDEK(kek, wrapped)
|
||||
if err != nil {
|
||||
t.Fatalf("unwrapdek: %v", err)
|
||||
}
|
||||
if !bytes.Equal(unwrapped, dek) {
|
||||
t.Fatal("entpackter dek stimmt nicht mit original ueberein")
|
||||
}
|
||||
}
|
||||
|
||||
// TestRewrapDEK_RotationKeepsObjectReadable ist Pruefung 3: KEK-Rotation
|
||||
// getestet, alte Objekte weiterhin lesbar — OHNE dass der Chiffretext des
|
||||
// Objekts selbst jemals angefasst wird (Akzeptanzkriterium 3).
|
||||
func TestRewrapDEK_RotationKeepsObjectReadable(t *testing.T) {
|
||||
oldKEK := bytes.Repeat([]byte{0x01}, KEKSize)
|
||||
newKEK := bytes.Repeat([]byte{0x02}, KEKSize)
|
||||
|
||||
dek, err := GenerateDEK()
|
||||
if err != nil {
|
||||
t.Fatalf("generatedek: %v", err)
|
||||
}
|
||||
plaintext := []byte("altes objekt, vor der rotation verschluesselt")
|
||||
ciphertext, err := EncryptStream(dek, bytes.NewReader(plaintext))
|
||||
if err != nil {
|
||||
t.Fatalf("encryptstream: %v", err)
|
||||
}
|
||||
ciphertextBytes, _ := io.ReadAll(ciphertext)
|
||||
|
||||
wrappedOld, err := WrapDEK(oldKEK, dek)
|
||||
if err != nil {
|
||||
t.Fatalf("wrapdek (alt): %v", err)
|
||||
}
|
||||
|
||||
// Rotation: NUR der DEK-Wrapper wird neu verpackt, der Chiffretext
|
||||
// (ciphertextBytes) wird nicht angefasst.
|
||||
wrappedNew, err := RewrapDEK(oldKEK, newKEK, wrappedOld)
|
||||
if err != nil {
|
||||
t.Fatalf("rewrapdek: %v", err)
|
||||
}
|
||||
if bytes.Equal(wrappedNew, wrappedOld) {
|
||||
t.Fatal("rewrapdek lieferte denselben wrapper wie vor der rotation")
|
||||
}
|
||||
|
||||
// Der alte KEK kann den NEUEN Wrapper nicht mehr entpacken (Rotation
|
||||
// war wirksam).
|
||||
if _, err := UnwrapDEK(oldKEK, wrappedNew); !errors.Is(err, ErrDecryptFailed) {
|
||||
t.Fatal("alter kek konnte den nach der rotation neu verpackten dek weiterhin entpacken")
|
||||
}
|
||||
|
||||
// Mit dem NEUEN KEK und dem neuen Wrapper ist das unveraenderte, alte
|
||||
// Objekt weiterhin vollstaendig lesbar.
|
||||
dekAfterRotation, err := UnwrapDEK(newKEK, wrappedNew)
|
||||
if err != nil {
|
||||
t.Fatalf("unwrapdek (neu) nach rotation: %v", err)
|
||||
}
|
||||
decrypted, err := DecryptStream(dekAfterRotation, bytes.NewReader(ciphertextBytes))
|
||||
if err != nil {
|
||||
t.Fatalf("decryptstream nach rotation: %v", err)
|
||||
}
|
||||
got, err := io.ReadAll(decrypted)
|
||||
if err != nil {
|
||||
t.Fatalf("klartext lesen: %v", err)
|
||||
}
|
||||
if !bytes.Equal(got, plaintext) {
|
||||
t.Fatalf("altes objekt nach rotation = %q, want %q", got, plaintext)
|
||||
}
|
||||
}
|
||||
@@ -1,80 +0,0 @@
|
||||
package crypto
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/base64"
|
||||
"encoding/json"
|
||||
"fmt"
|
||||
"net/http"
|
||||
"net/url"
|
||||
)
|
||||
|
||||
// KEKProvider liefert den aktuellen, entschluesselten Tenant-KEK
|
||||
// (Akzeptanzkriterium 2: KEK kommt ausschliesslich von Core API-10).
|
||||
// Schmale Schnittstelle, damit Tests einen Fake statt eines echten
|
||||
// HTTP-Aufrufs einsetzen koennen.
|
||||
type KEKProvider interface {
|
||||
TenantKEK(ctx context.Context, tenantSlug string) ([]byte, error)
|
||||
}
|
||||
|
||||
// tenantKEKResponse entspricht Core internal/kek.tenantKEKResponse
|
||||
// (JSON-Vertrag: tenant_kek_base64) — dieselbe Struktur, hier gespiegelt,
|
||||
// da DMS Cores internal/-Pakete nicht importieren kann.
|
||||
type tenantKEKResponse struct {
|
||||
TenantKEKBase64 string `json:"tenant_kek_base64"`
|
||||
}
|
||||
|
||||
// HTTPKEKProvider bezieht den Tenant-KEK ueber Cores KEK-Handler
|
||||
// (internal/kek.Handler.TenantKEKHandler, API-10), authentifiziert ueber
|
||||
// dasselbe Service-Credential-Verfahren wie jeder andere Modul-Core-Aufruf
|
||||
// (API-02) — identisches Muster wie internal/storage.HTTPUsageReporter aus
|
||||
// FDN-03.
|
||||
type HTTPKEKProvider struct {
|
||||
endpointURL string
|
||||
clientID string
|
||||
clientSecret string
|
||||
httpClient *http.Client
|
||||
}
|
||||
|
||||
func NewHTTPKEKProvider(endpointURL, clientID, clientSecret string, httpClient *http.Client) *HTTPKEKProvider {
|
||||
if httpClient == nil {
|
||||
httpClient = http.DefaultClient
|
||||
}
|
||||
return &HTTPKEKProvider{endpointURL: endpointURL, clientID: clientID, clientSecret: clientSecret, httpClient: httpClient}
|
||||
}
|
||||
|
||||
func (p *HTTPKEKProvider) TenantKEK(ctx context.Context, tenantSlug string) ([]byte, error) {
|
||||
u, err := url.Parse(p.endpointURL)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: kek-endpunkt-url ungueltig: %w", err)
|
||||
}
|
||||
q := u.Query()
|
||||
q.Set("tenant", tenantSlug)
|
||||
u.RawQuery = q.Encode()
|
||||
|
||||
req, err := http.NewRequestWithContext(ctx, http.MethodGet, u.String(), nil)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: kek-anfrage aufbauen: %w", err)
|
||||
}
|
||||
req.Header.Set("X-Nexarch-Client-Id", p.clientID)
|
||||
req.Header.Set("X-Nexarch-Client-Secret", p.clientSecret)
|
||||
|
||||
resp, err := p.httpClient.Do(req)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: kek-anfrage senden: %w", err)
|
||||
}
|
||||
defer func() { _ = resp.Body.Close() }()
|
||||
if resp.StatusCode != http.StatusOK {
|
||||
return nil, fmt.Errorf("crypto: kek-bezug von core abgelehnt: status %d", resp.StatusCode)
|
||||
}
|
||||
|
||||
var body tenantKEKResponse
|
||||
if err := json.NewDecoder(resp.Body).Decode(&body); err != nil {
|
||||
return nil, fmt.Errorf("crypto: kek-antwort dekodieren: %w", err)
|
||||
}
|
||||
kek, err := base64.StdEncoding.DecodeString(body.TenantKEKBase64)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: kek base64-dekodieren: %w", err)
|
||||
}
|
||||
return kek, nil
|
||||
}
|
||||
@@ -1,65 +0,0 @@
|
||||
package crypto
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/base64"
|
||||
"encoding/json"
|
||||
"net/http"
|
||||
"net/http/httptest"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// TestHTTPKEKProvider_SendsCorrectContractToCore ist der Nachweis, dass
|
||||
// HTTPKEKProvider exakt den Vertrag von Core internal/kek.Handler.
|
||||
// TenantKEKHandler bedient (Service-Credential-Header, tenant-Query-Param,
|
||||
// JSON-Feldname) — echte Vernetzung gegen einen laufenden Core-Prozess ist
|
||||
// nicht Teil dieses Tests (siehe FDN-09-Pruefprotokoll: derselbe
|
||||
// "nicht verdrahtet"-Befund wie bei internal/resync in FDN-03), daher hier
|
||||
// gegen einen httptest-Server geprueft, der denselben Vertrag nachbildet.
|
||||
func TestHTTPKEKProvider_SendsCorrectContractToCore(t *testing.T) {
|
||||
wantKEK := make([]byte, KEKSize)
|
||||
for i := range wantKEK {
|
||||
wantKEK[i] = byte(i)
|
||||
}
|
||||
|
||||
var gotClientID, gotClientSecret, gotTenant string
|
||||
srv := httptest.NewServer(http.HandlerFunc(func(w http.ResponseWriter, r *http.Request) {
|
||||
gotClientID = r.Header.Get("X-Nexarch-Client-Id")
|
||||
gotClientSecret = r.Header.Get("X-Nexarch-Client-Secret")
|
||||
gotTenant = r.URL.Query().Get("tenant")
|
||||
w.Header().Set("Content-Type", "application/json")
|
||||
_ = json.NewEncoder(w).Encode(tenantKEKResponse{TenantKEKBase64: base64.StdEncoding.EncodeToString(wantKEK)})
|
||||
}))
|
||||
defer srv.Close()
|
||||
|
||||
provider := NewHTTPKEKProvider(srv.URL, "dms-service-client", "dms-service-secret", nil)
|
||||
got, err := provider.TenantKEK(context.Background(), "acme")
|
||||
if err != nil {
|
||||
t.Fatalf("tenantkek: %v", err)
|
||||
}
|
||||
|
||||
if gotClientID != "dms-service-client" || gotClientSecret != "dms-service-secret" {
|
||||
t.Fatalf("service-credential-header falsch: id=%q secret=%q", gotClientID, gotClientSecret)
|
||||
}
|
||||
if gotTenant != "acme" {
|
||||
t.Fatalf("tenant-query-parameter = %q, want %q", gotTenant, "acme")
|
||||
}
|
||||
if len(got) != KEKSize || got[0] != wantKEK[0] {
|
||||
t.Fatalf("erhaltener kek stimmt nicht mit erwartetem ueberein")
|
||||
}
|
||||
}
|
||||
|
||||
// TestHTTPKEKProvider_RejectsNonOKStatus prueft, dass ein von Core
|
||||
// abgelehnter Aufruf (z.B. Modul nicht fuer diesen Mandanten aktiv,
|
||||
// ErrForbidden auf Core-Seite) als Fehler zurueckgegeben wird.
|
||||
func TestHTTPKEKProvider_RejectsNonOKStatus(t *testing.T) {
|
||||
srv := httptest.NewServer(http.HandlerFunc(func(w http.ResponseWriter, r *http.Request) {
|
||||
http.Error(w, "zugriff auf diesen mandanten verweigert", http.StatusForbidden)
|
||||
}))
|
||||
defer srv.Close()
|
||||
|
||||
provider := NewHTTPKEKProvider(srv.URL, "x", "y", nil)
|
||||
if _, err := provider.TenantKEK(context.Background(), "fremder-tenant"); err == nil {
|
||||
t.Fatal("erwartet fehler bei abgelehntem kek-bezug, habe nil")
|
||||
}
|
||||
}
|
||||
@@ -1,65 +0,0 @@
|
||||
package crypto
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"io"
|
||||
)
|
||||
|
||||
// Envelope ist das Ergebnis einer Seal-Operation: der Chiffretext-Stream
|
||||
// plus der mit dem Tenant-KEK verpackte DEK, der zusammen mit dem Objekt
|
||||
// persistiert werden muss (z.B. in file_revisions, FDN-02 — die konkrete
|
||||
// Spalte ist nicht Bestandteil dieser Kachel, siehe "Nicht Bestandteil").
|
||||
type Envelope struct {
|
||||
Ciphertext io.Reader
|
||||
WrappedDEK []byte
|
||||
}
|
||||
|
||||
// Service verbindet KEKProvider mit den Envelope-Operationen — die
|
||||
// Storage-Abstraktion (FDN-03) ruft ausschliesslich Service auf, nie die
|
||||
// Einzelfunktionen aus envelope.go direkt.
|
||||
type Service struct {
|
||||
kek KEKProvider
|
||||
}
|
||||
|
||||
func NewService(kek KEKProvider) *Service {
|
||||
return &Service{kek: kek}
|
||||
}
|
||||
|
||||
// Seal erzeugt einen neuen DEK (Akzeptanzkriterium 1), verschluesselt
|
||||
// plaintext damit und verpackt den DEK mit dem aktuellen Tenant-KEK
|
||||
// (Akzeptanzkriterium 2 — der KEK wird bei JEDEM Aufruf frisch von Core
|
||||
// bezogen, nie zwischengespeichert).
|
||||
func (s *Service) Seal(ctx context.Context, tenantSlug string, plaintext io.Reader) (*Envelope, error) {
|
||||
dek, err := GenerateDEK()
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
ciphertext, err := EncryptStream(dek, plaintext)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
kek, err := s.kek.TenantKEK(ctx, tenantSlug)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: tenant-kek beziehen: %w", err)
|
||||
}
|
||||
wrappedDEK, err := WrapDEK(kek, dek)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
return &Envelope{Ciphertext: ciphertext, WrappedDEK: wrappedDEK}, nil
|
||||
}
|
||||
|
||||
// Open entpackt den DEK mit dem aktuellen Tenant-KEK und entschluesselt
|
||||
// ciphertext damit.
|
||||
func (s *Service) Open(ctx context.Context, tenantSlug string, wrappedDEK []byte, ciphertext io.Reader) (io.Reader, error) {
|
||||
kek, err := s.kek.TenantKEK(ctx, tenantSlug)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("crypto: tenant-kek beziehen: %w", err)
|
||||
}
|
||||
dek, err := UnwrapDEK(kek, wrappedDEK)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
return DecryptStream(dek, ciphertext)
|
||||
}
|
||||
@@ -1,77 +0,0 @@
|
||||
package crypto
|
||||
|
||||
import (
|
||||
"bytes"
|
||||
"context"
|
||||
"io"
|
||||
"testing"
|
||||
)
|
||||
|
||||
// fakeKEKProvider liefert einen fest hinterlegten Tenant-KEK, ohne echten
|
||||
// HTTP-Aufruf — fuer Tests, die Service isoliert vom Core-Kontrakt pruefen
|
||||
// wollen (der Kontrakt selbst ist in kekprovider_test.go geprueft).
|
||||
type fakeKEKProvider struct {
|
||||
kek []byte
|
||||
calls int
|
||||
}
|
||||
|
||||
func (f *fakeKEKProvider) TenantKEK(ctx context.Context, tenantSlug string) ([]byte, error) {
|
||||
f.calls++
|
||||
return f.kek, nil
|
||||
}
|
||||
|
||||
// TestService_SealOpen_RoundTrip ist der End-to-End-Nachweis fuer
|
||||
// Pruefung 1 ueber Service statt die Einzelfunktionen.
|
||||
func TestService_SealOpen_RoundTrip(t *testing.T) {
|
||||
kekProvider := &fakeKEKProvider{kek: bytes.Repeat([]byte{0x07}, KEKSize)}
|
||||
svc := NewService(kekProvider)
|
||||
ctx := context.Background()
|
||||
plaintext := []byte("vertraulicher dokumentinhalt")
|
||||
|
||||
env, err := svc.Seal(ctx, "acme", bytes.NewReader(plaintext))
|
||||
if err != nil {
|
||||
t.Fatalf("seal: %v", err)
|
||||
}
|
||||
ciphertextBytes, err := io.ReadAll(env.Ciphertext)
|
||||
if err != nil {
|
||||
t.Fatalf("chiffretext lesen: %v", err)
|
||||
}
|
||||
if bytes.Equal(ciphertextBytes, plaintext) {
|
||||
t.Fatal("chiffretext ist identisch zum klartext")
|
||||
}
|
||||
if len(env.WrappedDEK) == 0 {
|
||||
t.Fatal("erwartet nicht-leeren wrappeddek")
|
||||
}
|
||||
|
||||
decrypted, err := svc.Open(ctx, "acme", env.WrappedDEK, bytes.NewReader(ciphertextBytes))
|
||||
if err != nil {
|
||||
t.Fatalf("open: %v", err)
|
||||
}
|
||||
got, err := io.ReadAll(decrypted)
|
||||
if err != nil {
|
||||
t.Fatalf("klartext lesen: %v", err)
|
||||
}
|
||||
if !bytes.Equal(got, plaintext) {
|
||||
t.Fatalf("entschluesselter klartext = %q, want %q", got, plaintext)
|
||||
}
|
||||
}
|
||||
|
||||
// TestService_Seal_NeverPersistsKEK ist Akzeptanzkriterium 2 (struktureller
|
||||
// Nachweis): Service haelt den KEK nicht ueber einen Aufruf hinaus fest —
|
||||
// jeder Seal/Open-Aufruf bezieht ihn frisch ueber KEKProvider.
|
||||
func TestService_Seal_NeverPersistsKEK(t *testing.T) {
|
||||
kekProvider := &fakeKEKProvider{kek: bytes.Repeat([]byte{0x09}, KEKSize)}
|
||||
svc := NewService(kekProvider)
|
||||
ctx := context.Background()
|
||||
|
||||
if _, err := svc.Seal(ctx, "acme", bytes.NewReader([]byte("a"))); err != nil {
|
||||
t.Fatalf("seal 1: %v", err)
|
||||
}
|
||||
if _, err := svc.Seal(ctx, "acme", bytes.NewReader([]byte("b"))); err != nil {
|
||||
t.Fatalf("seal 2: %v", err)
|
||||
}
|
||||
|
||||
if kekProvider.calls != 2 {
|
||||
t.Fatalf("erwartet 2 kek-abrufe (einer je Seal-Aufruf, kein Caching), habe %d", kekProvider.calls)
|
||||
}
|
||||
}
|
||||
@@ -1,238 +0,0 @@
|
||||
// Package jobqueue implementiert FDN-04: eine Postgres-gestuetzte
|
||||
// Job-Queue mit Wiederholungslogik, Backoff und Dead-Letter-Queue — kein
|
||||
// Redis/AMQP (siehe Ticket-Vorgabe). FOR UPDATE SKIP LOCKED erlaubt
|
||||
// mehrere gleichzeitige Worker-Goroutinen (auch mehrinstanzfaehig, da der
|
||||
// Zustand ausschliesslich in Postgres liegt, keine In-Memory-Zaehler —
|
||||
// dieselbe Konvention wie Core internal/lockout, siehe "Bekannte Fehler
|
||||
// vermeiden" im Ticket).
|
||||
package jobqueue
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/json"
|
||||
"errors"
|
||||
"fmt"
|
||||
"time"
|
||||
|
||||
"github.com/jackc/pgx/v5"
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
// Status-Werte spiegeln den CHECK-Constraint der Migration.
|
||||
const (
|
||||
StatusPending = "pending"
|
||||
StatusProcessing = "processing"
|
||||
StatusSucceeded = "succeeded"
|
||||
StatusFailed = "failed"
|
||||
StatusDeadLetter = "dead_letter"
|
||||
)
|
||||
|
||||
// ErrNotFound wird geliefert, wenn ein angefragter Job nicht existiert.
|
||||
var ErrNotFound = errors.New("jobqueue: job nicht gefunden")
|
||||
|
||||
// ErrNoJobAvailable wird von Dequeue geliefert, wenn aktuell kein
|
||||
// abholbarer Job vorhanden ist (kein Fehlerzustand, sondern der Normalfall
|
||||
// bei leerer Queue).
|
||||
var ErrNoJobAvailable = errors.New("jobqueue: kein job verfuegbar")
|
||||
|
||||
// Job ist eine einzelne Aufgabe in der Queue.
|
||||
type Job struct {
|
||||
ID string
|
||||
JobType string
|
||||
Payload json.RawMessage
|
||||
Status string
|
||||
Attempts int
|
||||
MaxAttempts int
|
||||
LastError *string
|
||||
}
|
||||
|
||||
// DefaultMaxAttempts/DefaultStaleLockAfter sind Standardwerte, ueberschreibbar
|
||||
// je Enqueue-Aufruf (MaxAttempts) bzw. am Queue selbst (StaleLockAfter).
|
||||
const (
|
||||
DefaultMaxAttempts = 5
|
||||
)
|
||||
|
||||
// Queue kapselt den Zugriff auf processing_jobs.
|
||||
type Queue struct {
|
||||
pool *pgxpool.Pool
|
||||
staleLockAfter time.Duration
|
||||
}
|
||||
|
||||
// NewQueue erzeugt eine Queue. staleLockAfter legt fest, ab wann ein
|
||||
// Job, der als "processing" markiert ist, aber dessen Worker vermutlich
|
||||
// abgestuerzt ist, wieder als abholbar gilt (Pruefung 1: Absturz fuehrt zu
|
||||
// erneuter Zustellung) — kein Heartbeat-Mechanismus noetig, ein grosszuegiges
|
||||
// Zeitfenster genuegt fuer die "kleinste Loesung".
|
||||
func NewQueue(pool *pgxpool.Pool, staleLockAfter time.Duration) *Queue {
|
||||
return &Queue{pool: pool, staleLockAfter: staleLockAfter}
|
||||
}
|
||||
|
||||
// EnqueueOptions steuert optionale Einreih-Parameter.
|
||||
type EnqueueOptions struct {
|
||||
// IdempotencyKey verhindert doppelte Einreihung derselben logischen
|
||||
// Aufgabe (Pruefung 2: Idempotenz bei Doppelzustellung) — leer bedeutet
|
||||
// kein Dedup-Anspruch.
|
||||
IdempotencyKey string
|
||||
MaxAttempts int
|
||||
}
|
||||
|
||||
// Enqueue reiht einen neuen Job ein (Akzeptanzkriterium 1). Bei gesetztem
|
||||
// IdempotencyKey und bereits existierendem gleichen Key wird die ID des
|
||||
// BEREITS vorhandenen Jobs zurueckgegeben, kein Duplikat angelegt.
|
||||
func (q *Queue) Enqueue(ctx context.Context, jobType string, payload any, opts EnqueueOptions) (string, error) {
|
||||
payloadJSON, err := json.Marshal(payload)
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("jobqueue: payload serialisieren: %w", err)
|
||||
}
|
||||
maxAttempts := opts.MaxAttempts
|
||||
if maxAttempts <= 0 {
|
||||
maxAttempts = DefaultMaxAttempts
|
||||
}
|
||||
|
||||
var idempotencyKey any
|
||||
if opts.IdempotencyKey != "" {
|
||||
idempotencyKey = opts.IdempotencyKey
|
||||
}
|
||||
|
||||
var id string
|
||||
err = q.pool.QueryRow(ctx, `
|
||||
INSERT INTO processing_jobs (job_type, payload, idempotency_key, max_attempts)
|
||||
VALUES ($1, $2, $3, $4)
|
||||
ON CONFLICT (idempotency_key) DO UPDATE SET job_type = processing_jobs.job_type
|
||||
RETURNING id
|
||||
`, jobType, payloadJSON, idempotencyKey, maxAttempts).Scan(&id)
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("jobqueue: job einreihen: %w", err)
|
||||
}
|
||||
return id, nil
|
||||
}
|
||||
|
||||
// Dequeue holt GENAU EINEN abholbaren Job (faellig UND nicht bereits von
|
||||
// einem anderen Worker gesperrt, ODER dessen Sperre als abgestanden gilt)
|
||||
// und markiert ihn atomar als "processing" (Akzeptanzkriterium 1 / Pruefung
|
||||
// 1 — FOR UPDATE SKIP LOCKED erlaubt mehreren Worker-Goroutinen
|
||||
// gleichzeitigen Aufruf ohne sich gegenseitig zu blockieren oder denselben
|
||||
// Job doppelt zu holen).
|
||||
func (q *Queue) Dequeue(ctx context.Context, workerID string, jobTypes []string) (*Job, error) {
|
||||
tx, err := q.pool.Begin(ctx)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("jobqueue: transaktion starten: %w", err)
|
||||
}
|
||||
defer func() { _ = tx.Rollback(ctx) }()
|
||||
|
||||
var typeFilter []string
|
||||
if len(jobTypes) > 0 {
|
||||
typeFilter = jobTypes
|
||||
}
|
||||
|
||||
row := tx.QueryRow(ctx, `
|
||||
SELECT id, job_type, payload, status, attempts, max_attempts, last_error
|
||||
FROM processing_jobs
|
||||
WHERE (
|
||||
(status = 'pending' AND available_at <= now())
|
||||
OR (status = 'processing' AND locked_at <= now() - ($2 * interval '1 second'))
|
||||
)
|
||||
AND ($1::text[] IS NULL OR job_type = ANY($1))
|
||||
ORDER BY available_at
|
||||
FOR UPDATE SKIP LOCKED
|
||||
LIMIT 1
|
||||
`, typeFilter, q.staleLockAfter.Seconds())
|
||||
|
||||
var j Job
|
||||
if err := row.Scan(&j.ID, &j.JobType, &j.Payload, &j.Status, &j.Attempts, &j.MaxAttempts, &j.LastError); err != nil {
|
||||
if errors.Is(err, pgx.ErrNoRows) {
|
||||
return nil, ErrNoJobAvailable
|
||||
}
|
||||
return nil, fmt.Errorf("jobqueue: naechsten job lesen: %w", err)
|
||||
}
|
||||
|
||||
if _, err := tx.Exec(ctx, `
|
||||
UPDATE processing_jobs
|
||||
SET status = 'processing', attempts = attempts + 1, locked_at = now(), locked_by = $2, updated_at = now()
|
||||
WHERE id = $1
|
||||
`, j.ID, workerID); err != nil {
|
||||
return nil, fmt.Errorf("jobqueue: job sperren: %w", err)
|
||||
}
|
||||
|
||||
if err := tx.Commit(ctx); err != nil {
|
||||
return nil, fmt.Errorf("jobqueue: dequeue committen: %w", err)
|
||||
}
|
||||
|
||||
j.Status = StatusProcessing
|
||||
j.Attempts++
|
||||
return &j, nil
|
||||
}
|
||||
|
||||
// Complete markiert einen Job als erfolgreich abgeschlossen.
|
||||
func (q *Queue) Complete(ctx context.Context, jobID string) error {
|
||||
tag, err := q.pool.Exec(ctx, `
|
||||
UPDATE processing_jobs SET status = 'succeeded', locked_at = NULL, locked_by = NULL, updated_at = now()
|
||||
WHERE id = $1
|
||||
`, jobID)
|
||||
if err != nil {
|
||||
return fmt.Errorf("jobqueue: job abschliessen: %w", err)
|
||||
}
|
||||
if tag.RowsAffected() == 0 {
|
||||
return ErrNotFound
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Fail markiert einen Job als fehlgeschlagen (Akzeptanzkriterium 2): sind
|
||||
// die maximalen Versuche erreicht, wandert der Job in die Dead-Letter-Queue
|
||||
// (status='dead_letter'), sonst wird er mit exponentiellem Backoff erneut
|
||||
// eingeplant. Backoff-Berechnung nutzt arithmetischen Intervall-Cast
|
||||
// (attempts * interval), KEINE String-Konkatenation (siehe "Bekannte
|
||||
// Fehler vermeiden" im Ticket).
|
||||
func (q *Queue) Fail(ctx context.Context, jobID string, cause error) error {
|
||||
errMsg := cause.Error()
|
||||
tag, err := q.pool.Exec(ctx, `
|
||||
UPDATE processing_jobs
|
||||
SET status = CASE WHEN attempts >= max_attempts THEN 'dead_letter' ELSE 'pending' END,
|
||||
available_at = now() + (LEAST(attempts, 10) * interval '30 seconds'),
|
||||
locked_at = NULL, locked_by = NULL, last_error = $2, updated_at = now()
|
||||
WHERE id = $1
|
||||
`, jobID, errMsg)
|
||||
if err != nil {
|
||||
return fmt.Errorf("jobqueue: fehlschlag erfassen: %w", err)
|
||||
}
|
||||
if tag.RowsAffected() == 0 {
|
||||
return ErrNotFound
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
// Status liefert den aktuellen Zustand eines Jobs (Akzeptanzkriterium 3).
|
||||
func (q *Queue) Status(ctx context.Context, jobID string) (*Job, error) {
|
||||
var j Job
|
||||
err := q.pool.QueryRow(ctx, `
|
||||
SELECT id, job_type, payload, status, attempts, max_attempts, last_error
|
||||
FROM processing_jobs WHERE id = $1
|
||||
`, jobID).Scan(&j.ID, &j.JobType, &j.Payload, &j.Status, &j.Attempts, &j.MaxAttempts, &j.LastError)
|
||||
if err != nil {
|
||||
if errors.Is(err, pgx.ErrNoRows) {
|
||||
return nil, ErrNotFound
|
||||
}
|
||||
return nil, fmt.Errorf("jobqueue: job-status lesen: %w", err)
|
||||
}
|
||||
return &j, nil
|
||||
}
|
||||
|
||||
// RequeueDeadLetter holt einen Job manuell aus der Dead-Letter-Queue zurueck
|
||||
// in "pending", mit zurueckgesetztem Versuchszaehler (Pruefung 3: DLQ-Eintrag
|
||||
// manuell wiederholbar). Nur fuer Jobs, die tatsaechlich in dead_letter
|
||||
// stehen — verhindert versehentliches Requeue eines noch laufenden Jobs.
|
||||
func (q *Queue) RequeueDeadLetter(ctx context.Context, jobID string) error {
|
||||
tag, err := q.pool.Exec(ctx, `
|
||||
UPDATE processing_jobs
|
||||
SET status = 'pending', attempts = 0, available_at = now(), last_error = NULL, updated_at = now()
|
||||
WHERE id = $1 AND status = 'dead_letter'
|
||||
`, jobID)
|
||||
if err != nil {
|
||||
return fmt.Errorf("jobqueue: dead-letter-job erneut einreihen: %w", err)
|
||||
}
|
||||
if tag.RowsAffected() == 0 {
|
||||
return fmt.Errorf("jobqueue: job %q steht nicht in dead_letter (oder existiert nicht): %w", jobID, ErrNotFound)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
@@ -1,233 +0,0 @@
|
||||
package jobqueue
|
||||
|
||||
import (
|
||||
"context"
|
||||
"encoding/json"
|
||||
"errors"
|
||||
"os"
|
||||
"testing"
|
||||
"time"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
func setupTest(t *testing.T) *pgxpool.Pool {
|
||||
t.Helper()
|
||||
dsn := os.Getenv("TEST_TENANT_DSN")
|
||||
if dsn == "" {
|
||||
t.Skip("TEST_TENANT_DSN nicht gesetzt, Integrationstest uebersprungen")
|
||||
}
|
||||
ctx := context.Background()
|
||||
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
t.Fatalf("pool: %v", err)
|
||||
}
|
||||
t.Cleanup(func() { pool.Close() })
|
||||
|
||||
if _, err := pool.Exec(ctx, `
|
||||
CREATE EXTENSION IF NOT EXISTS pgcrypto;
|
||||
CREATE TABLE IF NOT EXISTS processing_jobs (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(),
|
||||
job_type TEXT NOT NULL,
|
||||
payload JSONB NOT NULL DEFAULT '{}'::jsonb,
|
||||
idempotency_key TEXT UNIQUE,
|
||||
status TEXT NOT NULL DEFAULT 'pending'
|
||||
CHECK (status IN ('pending', 'processing', 'succeeded', 'failed', 'dead_letter')),
|
||||
attempts INT NOT NULL DEFAULT 0,
|
||||
max_attempts INT NOT NULL DEFAULT 5,
|
||||
available_at TIMESTAMPTZ NOT NULL DEFAULT now(),
|
||||
locked_at TIMESTAMPTZ,
|
||||
locked_by TEXT,
|
||||
last_error TEXT,
|
||||
created_at TIMESTAMPTZ NOT NULL DEFAULT now(),
|
||||
updated_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
`); err != nil {
|
||||
t.Fatalf("schema: %v", err)
|
||||
}
|
||||
// DROP statt nur TRUNCATE: internal/jobqueue und internal/migrate teilen
|
||||
// sich dieselbe physische Test-Datenbank (TEST_TENANT_DSN) ueber
|
||||
// Paketgrenzen hinweg. Bliebe die Tabelle stehen, wuerde internal/migrate
|
||||
// spaeter mit "relation already exists" gegen die von diesem Fixture
|
||||
// angelegte, aber unversionierte Tabelle scheitern.
|
||||
t.Cleanup(func() {
|
||||
_, _ = pool.Exec(context.Background(), `DROP TABLE IF EXISTS processing_jobs`)
|
||||
})
|
||||
return pool
|
||||
}
|
||||
|
||||
// TestEnqueueDequeueComplete ist Akzeptanzkriterium 1: Jobs werden
|
||||
// zuverlaessig eingereiht und verarbeitet.
|
||||
func TestEnqueueDequeueComplete(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
ctx := context.Background()
|
||||
|
||||
id, err := q.Enqueue(ctx, "index-document", map[string]string{"document_id": "d1"}, EnqueueOptions{})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue: %v", err)
|
||||
}
|
||||
|
||||
job, err := q.Dequeue(ctx, "worker-1", nil)
|
||||
if err != nil {
|
||||
t.Fatalf("dequeue: %v", err)
|
||||
}
|
||||
if job.ID != id {
|
||||
t.Fatalf("dequeue lieferte job %q, want %q", job.ID, id)
|
||||
}
|
||||
if job.Status != StatusProcessing {
|
||||
t.Fatalf("status nach dequeue = %q, want %q", job.Status, StatusProcessing)
|
||||
}
|
||||
var payload map[string]string
|
||||
if err := json.Unmarshal(job.Payload, &payload); err != nil {
|
||||
t.Fatalf("payload dekodieren: %v", err)
|
||||
}
|
||||
if payload["document_id"] != "d1" {
|
||||
t.Fatalf("payload = %v, want document_id=d1", payload)
|
||||
}
|
||||
|
||||
if err := q.Complete(ctx, job.ID); err != nil {
|
||||
t.Fatalf("complete: %v", err)
|
||||
}
|
||||
|
||||
status, err := q.Status(ctx, job.ID)
|
||||
if err != nil {
|
||||
t.Fatalf("status: %v", err)
|
||||
}
|
||||
if status.Status != StatusSucceeded {
|
||||
t.Fatalf("endstatus = %q, want %q", status.Status, StatusSucceeded)
|
||||
}
|
||||
}
|
||||
|
||||
// TestDequeue_NoJobAvailable prueft den Leerfall.
|
||||
func TestDequeue_NoJobAvailable(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
|
||||
if _, err := q.Dequeue(context.Background(), "worker-1", nil); !errors.Is(err, ErrNoJobAvailable) {
|
||||
t.Fatalf("erwartet ErrNoJobAvailable, habe %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestFail_LandsInDeadLetterAfterMaxAttempts ist Akzeptanzkriterium 2.
|
||||
func TestFail_LandsInDeadLetterAfterMaxAttempts(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
ctx := context.Background()
|
||||
|
||||
id, err := q.Enqueue(ctx, "ocr", nil, EnqueueOptions{MaxAttempts: 2})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue: %v", err)
|
||||
}
|
||||
|
||||
// Versuch 1: schlaegt fehl, geht zurueck nach "pending" (max_attempts=2 noch nicht erreicht).
|
||||
job, err := q.Dequeue(ctx, "worker-1", nil)
|
||||
if err != nil {
|
||||
t.Fatalf("dequeue 1: %v", err)
|
||||
}
|
||||
if err := q.Fail(ctx, job.ID, errors.New("ocr-engine nicht erreichbar")); err != nil {
|
||||
t.Fatalf("fail 1: %v", err)
|
||||
}
|
||||
status, err := q.Status(ctx, id)
|
||||
if err != nil {
|
||||
t.Fatalf("status nach fail 1: %v", err)
|
||||
}
|
||||
if status.Status != StatusPending {
|
||||
t.Fatalf("status nach fail 1 = %q, want %q (noch nicht erschoepft)", status.Status, StatusPending)
|
||||
}
|
||||
|
||||
// Versuch 2: Backoff manuell umgehen (available_at direkt zuruecksetzen,
|
||||
// damit der Test nicht auf echten Backoff warten muss).
|
||||
if _, err := pool.Exec(ctx, `UPDATE processing_jobs SET available_at = now() WHERE id = $1`, id); err != nil {
|
||||
t.Fatalf("available_at zuruecksetzen: %v", err)
|
||||
}
|
||||
job2, err := q.Dequeue(ctx, "worker-1", nil)
|
||||
if err != nil {
|
||||
t.Fatalf("dequeue 2: %v", err)
|
||||
}
|
||||
if err := q.Fail(ctx, job2.ID, errors.New("ocr-engine weiterhin nicht erreichbar")); err != nil {
|
||||
t.Fatalf("fail 2: %v", err)
|
||||
}
|
||||
|
||||
final, err := q.Status(ctx, id)
|
||||
if err != nil {
|
||||
t.Fatalf("status nach fail 2: %v", err)
|
||||
}
|
||||
if final.Status != StatusDeadLetter {
|
||||
t.Fatalf("status nach erschoepften versuchen = %q, want %q", final.Status, StatusDeadLetter)
|
||||
}
|
||||
if final.LastError == nil || *final.LastError == "" {
|
||||
t.Fatal("erwartet gesetzten last_error im dead-letter-eintrag")
|
||||
}
|
||||
}
|
||||
|
||||
// TestRequeueDeadLetter ist Pruefung 3: DLQ-Eintrag manuell wiederholbar.
|
||||
func TestRequeueDeadLetter(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
ctx := context.Background()
|
||||
|
||||
id, err := q.Enqueue(ctx, "convert", nil, EnqueueOptions{MaxAttempts: 1})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue: %v", err)
|
||||
}
|
||||
job, err := q.Dequeue(ctx, "worker-1", nil)
|
||||
if err != nil {
|
||||
t.Fatalf("dequeue: %v", err)
|
||||
}
|
||||
if err := q.Fail(ctx, job.ID, errors.New("konverter abgestuerzt")); err != nil {
|
||||
t.Fatalf("fail: %v", err)
|
||||
}
|
||||
status, _ := q.Status(ctx, id)
|
||||
if status.Status != StatusDeadLetter {
|
||||
t.Fatalf("voraussetzung nicht erfuellt: job sollte in dead_letter stehen, ist %q", status.Status)
|
||||
}
|
||||
|
||||
if err := q.RequeueDeadLetter(ctx, id); err != nil {
|
||||
t.Fatalf("requeuedeadletter: %v", err)
|
||||
}
|
||||
afterRequeue, err := q.Status(ctx, id)
|
||||
if err != nil {
|
||||
t.Fatalf("status nach requeue: %v", err)
|
||||
}
|
||||
if afterRequeue.Status != StatusPending {
|
||||
t.Fatalf("status nach requeue = %q, want %q", afterRequeue.Status, StatusPending)
|
||||
}
|
||||
if afterRequeue.Attempts != 0 {
|
||||
t.Fatalf("attempts nach requeue = %d, want 0", afterRequeue.Attempts)
|
||||
}
|
||||
|
||||
// Requeue eines NICHT in dead_letter stehenden Jobs wird abgewiesen.
|
||||
if err := q.RequeueDeadLetter(ctx, id); !errors.Is(err, ErrNotFound) {
|
||||
t.Fatalf("requeue eines pending-jobs: erwartet ErrNotFound, habe %v", err)
|
||||
}
|
||||
}
|
||||
|
||||
// TestEnqueue_IdempotencyKeyPreventsDuplicate ist Pruefung 2: Idempotenz
|
||||
// bei Doppelzustellung nachgewiesen (auf Einreih-Ebene).
|
||||
func TestEnqueue_IdempotencyKeyPreventsDuplicate(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
ctx := context.Background()
|
||||
|
||||
id1, err := q.Enqueue(ctx, "ocr", nil, EnqueueOptions{IdempotencyKey: "ocr:revision-42"})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue 1: %v", err)
|
||||
}
|
||||
id2, err := q.Enqueue(ctx, "ocr", nil, EnqueueOptions{IdempotencyKey: "ocr:revision-42"})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue 2 (doppelzustellung): %v", err)
|
||||
}
|
||||
if id1 != id2 {
|
||||
t.Fatalf("doppelte einreihung mit gleichem idempotency-key erzeugte zwei jobs: %q != %q", id1, id2)
|
||||
}
|
||||
|
||||
var count int
|
||||
if err := pool.QueryRow(ctx, `SELECT count(*) FROM processing_jobs WHERE idempotency_key = 'ocr:revision-42'`).Scan(&count); err != nil {
|
||||
t.Fatalf("zeilen zaehlen: %v", err)
|
||||
}
|
||||
if count != 1 {
|
||||
t.Fatalf("erwartet genau 1 zeile fuer den idempotency-key, habe %d", count)
|
||||
}
|
||||
}
|
||||
@@ -1,75 +0,0 @@
|
||||
package jobqueue
|
||||
|
||||
import (
|
||||
"context"
|
||||
"errors"
|
||||
"log"
|
||||
"time"
|
||||
)
|
||||
|
||||
// Handler verarbeitet einen einzelnen Job. Ein zurueckgegebener Fehler
|
||||
// fuehrt zu Queue.Fail (Backoff/DLQ), nil zu Queue.Complete.
|
||||
type Handler func(ctx context.Context, job *Job) error
|
||||
|
||||
// Worker pollt die Queue in einer In-Prozess-Goroutine und ruft Handler je
|
||||
// abgeholtem Job auf — die "In-Prozess-Worker-Goroutinen" aus der
|
||||
// Ticket-Vorgabe, kein separater Prozess/Redis noetig.
|
||||
type Worker struct {
|
||||
queue *Queue
|
||||
workerID string
|
||||
jobTypes []string
|
||||
pollInterval time.Duration
|
||||
handler Handler
|
||||
}
|
||||
|
||||
func NewWorker(queue *Queue, workerID string, jobTypes []string, pollInterval time.Duration, handler Handler) *Worker {
|
||||
return &Worker{queue: queue, workerID: workerID, jobTypes: jobTypes, pollInterval: pollInterval, handler: handler}
|
||||
}
|
||||
|
||||
// Run blockiert, bis ctx beendet wird, und verarbeitet dabei fortlaufend
|
||||
// Jobs. Absturzsicherheit (Pruefung 1) entsteht NICHT durch Run selbst,
|
||||
// sondern dadurch, dass ein abgestuerzter Prozess (der Run gar nicht mehr
|
||||
// ausfuehrt) seine "processing"-Sperren nie verlaengert — ein ANDERER
|
||||
// Worker-Prozess holt den Job nach Ablauf von staleLockAfter erneut ab
|
||||
// (siehe Queue.Dequeue).
|
||||
func (w *Worker) Run(ctx context.Context) {
|
||||
ticker := time.NewTicker(w.pollInterval)
|
||||
defer ticker.Stop()
|
||||
for {
|
||||
select {
|
||||
case <-ctx.Done():
|
||||
return
|
||||
case <-ticker.C:
|
||||
w.processOne(ctx)
|
||||
}
|
||||
}
|
||||
}
|
||||
|
||||
// processOne holt und verarbeitet EINEN Job, falls verfuegbar. Oeffentlich
|
||||
// über RunOnce fuer Tests, die deterministisch (ohne Polling-Timing) einen
|
||||
// einzelnen Verarbeitungsschritt auslösen wollen.
|
||||
func (w *Worker) processOne(ctx context.Context) {
|
||||
job, err := w.queue.Dequeue(ctx, w.workerID, w.jobTypes)
|
||||
if err != nil {
|
||||
if !errors.Is(err, ErrNoJobAvailable) {
|
||||
log.Printf("jobqueue: dequeue fehlgeschlagen: %v", err)
|
||||
}
|
||||
return
|
||||
}
|
||||
|
||||
if handlerErr := w.handler(ctx, job); handlerErr != nil {
|
||||
if err := w.queue.Fail(ctx, job.ID, handlerErr); err != nil {
|
||||
log.Printf("jobqueue: fehlschlag fuer job %q nicht erfassbar: %v", job.ID, err)
|
||||
}
|
||||
return
|
||||
}
|
||||
if err := w.queue.Complete(ctx, job.ID); err != nil {
|
||||
log.Printf("jobqueue: abschluss fuer job %q fehlgeschlagen: %v", job.ID, err)
|
||||
}
|
||||
}
|
||||
|
||||
// RunOnce verarbeitet synchron genau einen Job (falls verfuegbar) und
|
||||
// kehrt zurueck — fuer Tests, die ohne Polling-Intervall arbeiten wollen.
|
||||
func (w *Worker) RunOnce(ctx context.Context) {
|
||||
w.processOne(ctx)
|
||||
}
|
||||
@@ -1,115 +0,0 @@
|
||||
package jobqueue
|
||||
|
||||
import (
|
||||
"context"
|
||||
"errors"
|
||||
"sync/atomic"
|
||||
"testing"
|
||||
"time"
|
||||
)
|
||||
|
||||
// TestWorker_RunOnce_ProcessesAndCompletesJob ist der End-to-End-Nachweis
|
||||
// fuer Akzeptanzkriterium 1 ueber den Worker statt direkt ueber Queue.
|
||||
func TestWorker_RunOnce_ProcessesAndCompletesJob(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
ctx := context.Background()
|
||||
|
||||
id, err := q.Enqueue(ctx, "index-document", nil, EnqueueOptions{})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue: %v", err)
|
||||
}
|
||||
|
||||
var handled int32
|
||||
w := NewWorker(q, "worker-1", nil, time.Millisecond, func(ctx context.Context, job *Job) error {
|
||||
atomic.AddInt32(&handled, 1)
|
||||
return nil
|
||||
})
|
||||
w.RunOnce(ctx)
|
||||
|
||||
if atomic.LoadInt32(&handled) != 1 {
|
||||
t.Fatalf("handler wurde %d mal aufgerufen, want 1", handled)
|
||||
}
|
||||
status, err := q.Status(ctx, id)
|
||||
if err != nil {
|
||||
t.Fatalf("status: %v", err)
|
||||
}
|
||||
if status.Status != StatusSucceeded {
|
||||
t.Fatalf("status = %q, want %q", status.Status, StatusSucceeded)
|
||||
}
|
||||
}
|
||||
|
||||
// TestWorker_HandlerErrorTriggersFail prueft, dass ein Handler-Fehler zu
|
||||
// Queue.Fail fuehrt (Backoff/DLQ-Pfad ueber den Worker statt direkt).
|
||||
func TestWorker_HandlerErrorTriggersFail(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
q := NewQueue(pool, time.Minute)
|
||||
ctx := context.Background()
|
||||
|
||||
id, err := q.Enqueue(ctx, "ocr", nil, EnqueueOptions{MaxAttempts: 5})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue: %v", err)
|
||||
}
|
||||
|
||||
w := NewWorker(q, "worker-1", nil, time.Millisecond, func(ctx context.Context, job *Job) error {
|
||||
return errors.New("ocr fehlgeschlagen")
|
||||
})
|
||||
w.RunOnce(ctx)
|
||||
|
||||
status, err := q.Status(ctx, id)
|
||||
if err != nil {
|
||||
t.Fatalf("status: %v", err)
|
||||
}
|
||||
if status.Status != StatusPending {
|
||||
t.Fatalf("status nach handler-fehler = %q, want %q (erneut eingeplant)", status.Status, StatusPending)
|
||||
}
|
||||
if status.LastError == nil || *status.LastError != "ocr fehlgeschlagen" {
|
||||
t.Fatalf("last_error = %v, want %q", status.LastError, "ocr fehlgeschlagen")
|
||||
}
|
||||
}
|
||||
|
||||
// TestDequeue_StaleLockIsRedelivered ist Pruefung 1: Absturz eines Workers
|
||||
// fuehrt zu erneuter Zustellung. Simuliert einen Absturz, indem ein Job
|
||||
// dequeued (auf "processing" gesperrt), aber NIE completed/failed wird —
|
||||
// nach Ablauf von staleLockAfter muss ein ANDERER Worker denselben Job
|
||||
// erneut abholen koennen.
|
||||
func TestDequeue_StaleLockIsRedelivered(t *testing.T) {
|
||||
pool := setupTest(t)
|
||||
// Sehr kurzes Stale-Fenster, damit der Test nicht lange warten muss.
|
||||
q := NewQueue(pool, 50*time.Millisecond)
|
||||
ctx := context.Background()
|
||||
|
||||
id, err := q.Enqueue(ctx, "convert", nil, EnqueueOptions{})
|
||||
if err != nil {
|
||||
t.Fatalf("enqueue: %v", err)
|
||||
}
|
||||
|
||||
crashed, err := q.Dequeue(ctx, "worker-crashed", nil)
|
||||
if err != nil {
|
||||
t.Fatalf("dequeue (worker-crashed): %v", err)
|
||||
}
|
||||
if crashed.ID != id {
|
||||
t.Fatalf("dequeue lieferte unerwarteten job %q", crashed.ID)
|
||||
}
|
||||
// worker-crashed ruft absichtlich weder Complete noch Fail auf — simuliert
|
||||
// einen Prozessabsturz mitten in der Verarbeitung.
|
||||
|
||||
// Sofortiger erneuter Dequeue-Versuch (Sperre noch frisch) darf den Job
|
||||
// NICHT liefern.
|
||||
if _, err := q.Dequeue(ctx, "worker-2", nil); !errors.Is(err, ErrNoJobAvailable) {
|
||||
t.Fatalf("job wurde trotz frischer sperre erneut ausgeliefert (oder anderer fehler): %v", err)
|
||||
}
|
||||
|
||||
time.Sleep(80 * time.Millisecond) // > staleLockAfter
|
||||
|
||||
redelivered, err := q.Dequeue(ctx, "worker-2", nil)
|
||||
if err != nil {
|
||||
t.Fatalf("dequeue nach ablauf der sperre: %v", err)
|
||||
}
|
||||
if redelivered.ID != id {
|
||||
t.Fatalf("erneut zugestellter job = %q, want %q", redelivered.ID, id)
|
||||
}
|
||||
if err := q.Complete(ctx, redelivered.ID); err != nil {
|
||||
t.Fatalf("complete durch worker-2: %v", err)
|
||||
}
|
||||
}
|
||||
@@ -1,165 +0,0 @@
|
||||
// Package migrate implementiert FDN-02s Migrationsmechanik: versionierte,
|
||||
// rueckrollbare SQL-Migrationsdateien (kein ORM), mit einer
|
||||
// schema_migrations-Tabelle als Fortschrittsspeicher — dasselbe Prinzip wie
|
||||
// NEXARCH Core (internal/migrate), hier eigenstaendig implementiert, da DMS
|
||||
// ein eigenes Go-Modul ist und Cores internal/-Pakete nicht importieren
|
||||
// kann.
|
||||
package migrate
|
||||
|
||||
import (
|
||||
"context"
|
||||
"fmt"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"sort"
|
||||
"strings"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
// Migration ist eine einzelne versionierte Migrationsdatei.
|
||||
type Migration struct {
|
||||
Version string // Dateiname ohne .up.sql/.down.sql, z.B. "0001_documents"
|
||||
UpSQL string
|
||||
DownSQL string
|
||||
}
|
||||
|
||||
// Load liest alle *.up.sql/*.down.sql-Paare aus dir, sortiert nach
|
||||
// Dateiname (Akzeptanzkriterium: Migrationen sind versioniert).
|
||||
func Load(dir string) ([]Migration, error) {
|
||||
entries, err := os.ReadDir(dir)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("migrationsverzeichnis %q lesen: %w", dir, err)
|
||||
}
|
||||
var versions []string
|
||||
for _, e := range entries {
|
||||
if e.IsDir() || !strings.HasSuffix(e.Name(), ".up.sql") {
|
||||
continue
|
||||
}
|
||||
versions = append(versions, strings.TrimSuffix(e.Name(), ".up.sql"))
|
||||
}
|
||||
sort.Strings(versions)
|
||||
|
||||
migrations := make([]Migration, 0, len(versions))
|
||||
for _, v := range versions {
|
||||
up, err := os.ReadFile(filepath.Join(dir, v+".up.sql"))
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("migration %q: up.sql lesen: %w", v, err)
|
||||
}
|
||||
down, err := os.ReadFile(filepath.Join(dir, v+".down.sql"))
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("migration %q: down.sql lesen (jede Migration braucht ein Rollback): %w", v, err)
|
||||
}
|
||||
migrations = append(migrations, Migration{Version: v, UpSQL: string(up), DownSQL: string(down)})
|
||||
}
|
||||
return migrations, nil
|
||||
}
|
||||
|
||||
func ensureTrackingTable(ctx context.Context, pool *pgxpool.Pool) error {
|
||||
_, err := pool.Exec(ctx, `
|
||||
CREATE TABLE IF NOT EXISTS schema_migrations (
|
||||
version TEXT PRIMARY KEY,
|
||||
applied_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
)
|
||||
`)
|
||||
if err != nil {
|
||||
return fmt.Errorf("schema_migrations anlegen: %w", err)
|
||||
}
|
||||
return nil
|
||||
}
|
||||
|
||||
func appliedVersions(ctx context.Context, pool *pgxpool.Pool) (map[string]bool, error) {
|
||||
rows, err := pool.Query(ctx, `SELECT version FROM schema_migrations`)
|
||||
if err != nil {
|
||||
return nil, fmt.Errorf("angewendete migrationen lesen: %w", err)
|
||||
}
|
||||
defer rows.Close()
|
||||
|
||||
applied := map[string]bool{}
|
||||
for rows.Next() {
|
||||
var v string
|
||||
if err := rows.Scan(&v); err != nil {
|
||||
return nil, fmt.Errorf("migrationsversion lesen: %w", err)
|
||||
}
|
||||
applied[v] = true
|
||||
}
|
||||
return applied, rows.Err()
|
||||
}
|
||||
|
||||
// Up wendet alle noch nicht angewendeten Migrationen in Reihenfolge an
|
||||
// (Akzeptanzkriterium 2: vorwaerts ausfuehrbar) — bereits angewendete
|
||||
// werden uebersprungen, damit Up auf einer leeren UND auf einer bestehenden
|
||||
// DB funktioniert (Pruefung 1).
|
||||
func Up(ctx context.Context, pool *pgxpool.Pool, migrations []Migration) (applied []string, err error) {
|
||||
if err := ensureTrackingTable(ctx, pool); err != nil {
|
||||
return nil, err
|
||||
}
|
||||
already, err := appliedVersions(ctx, pool)
|
||||
if err != nil {
|
||||
return nil, err
|
||||
}
|
||||
|
||||
for _, m := range migrations {
|
||||
if already[m.Version] {
|
||||
continue
|
||||
}
|
||||
tx, err := pool.Begin(ctx)
|
||||
if err != nil {
|
||||
return applied, fmt.Errorf("transaktion fuer %q starten: %w", m.Version, err)
|
||||
}
|
||||
if _, err := tx.Exec(ctx, m.UpSQL); err != nil {
|
||||
_ = tx.Rollback(ctx)
|
||||
return applied, fmt.Errorf("migration %q anwenden: %w", m.Version, err)
|
||||
}
|
||||
if _, err := tx.Exec(ctx, `INSERT INTO schema_migrations (version) VALUES ($1)`, m.Version); err != nil {
|
||||
_ = tx.Rollback(ctx)
|
||||
return applied, fmt.Errorf("migration %q als angewendet markieren: %w", m.Version, err)
|
||||
}
|
||||
if err := tx.Commit(ctx); err != nil {
|
||||
return applied, fmt.Errorf("migration %q committen: %w", m.Version, err)
|
||||
}
|
||||
applied = append(applied, m.Version)
|
||||
}
|
||||
return applied, nil
|
||||
}
|
||||
|
||||
// DownOne macht die zuletzt angewendete Migration rueckgaengig
|
||||
// (Akzeptanzkriterium 2: rueckwaerts ausfuehrbar) und liefert deren Version,
|
||||
// oder "" falls keine Migration angewendet war.
|
||||
func DownOne(ctx context.Context, pool *pgxpool.Pool, migrations []Migration) (version string, err error) {
|
||||
if err := ensureTrackingTable(ctx, pool); err != nil {
|
||||
return "", err
|
||||
}
|
||||
already, err := appliedVersions(ctx, pool)
|
||||
if err != nil {
|
||||
return "", err
|
||||
}
|
||||
|
||||
var last *Migration
|
||||
for i := len(migrations) - 1; i >= 0; i-- {
|
||||
if already[migrations[i].Version] {
|
||||
last = &migrations[i]
|
||||
break
|
||||
}
|
||||
}
|
||||
if last == nil {
|
||||
return "", nil
|
||||
}
|
||||
|
||||
tx, err := pool.Begin(ctx)
|
||||
if err != nil {
|
||||
return "", fmt.Errorf("transaktion fuer rollback von %q starten: %w", last.Version, err)
|
||||
}
|
||||
if _, err := tx.Exec(ctx, last.DownSQL); err != nil {
|
||||
_ = tx.Rollback(ctx)
|
||||
return "", fmt.Errorf("migration %q zurueckrollen: %w", last.Version, err)
|
||||
}
|
||||
if _, err := tx.Exec(ctx, `DELETE FROM schema_migrations WHERE version = $1`, last.Version); err != nil {
|
||||
_ = tx.Rollback(ctx)
|
||||
return "", fmt.Errorf("migration %q aus schema_migrations entfernen: %w", last.Version, err)
|
||||
}
|
||||
if err := tx.Commit(ctx); err != nil {
|
||||
return "", fmt.Errorf("rollback von %q committen: %w", last.Version, err)
|
||||
}
|
||||
return last.Version, nil
|
||||
}
|
||||
@@ -1,213 +0,0 @@
|
||||
package migrate
|
||||
|
||||
import (
|
||||
"context"
|
||||
"os"
|
||||
"path/filepath"
|
||||
"testing"
|
||||
|
||||
"github.com/jackc/pgx/v5/pgxpool"
|
||||
)
|
||||
|
||||
// usersFixtureSQL spiegelt Core IAM-01s reales Schema
|
||||
// (migrations/tenant/0001_users.up.sql im NEXARCH-Core-Modul) - DMS ist ein
|
||||
// eigenes Go-Modul und kann Cores Migrationsdateien nicht importieren, daher
|
||||
// hier als Testfixture kopiert, NICHT als Produktionsmigration (DMS legt
|
||||
// users nicht selbst an, siehe "Nicht Bestandteil" in FDN-02).
|
||||
const usersFixtureSQL = `
|
||||
CREATE EXTENSION IF NOT EXISTS pgcrypto;
|
||||
CREATE TABLE IF NOT EXISTS users (
|
||||
id UUID PRIMARY KEY DEFAULT gen_random_uuid(),
|
||||
email TEXT NOT NULL UNIQUE,
|
||||
name TEXT NOT NULL,
|
||||
status TEXT NOT NULL DEFAULT 'active',
|
||||
created_at TIMESTAMPTZ NOT NULL DEFAULT now(),
|
||||
updated_at TIMESTAMPTZ NOT NULL DEFAULT now()
|
||||
);
|
||||
`
|
||||
|
||||
func setupTest(t *testing.T) (*pgxpool.Pool, []Migration) {
|
||||
t.Helper()
|
||||
dsn := os.Getenv("TEST_TENANT_DSN")
|
||||
if dsn == "" {
|
||||
t.Skip("TEST_TENANT_DSN nicht gesetzt, Integrationstest uebersprungen")
|
||||
}
|
||||
ctx := context.Background()
|
||||
|
||||
pool, err := pgxpool.New(ctx, dsn)
|
||||
if err != nil {
|
||||
t.Fatalf("pool: %v", err)
|
||||
}
|
||||
t.Cleanup(func() { pool.Close() })
|
||||
|
||||
if _, err := pool.Exec(ctx, usersFixtureSQL); err != nil {
|
||||
t.Fatalf("users-fixture anlegen: %v", err)
|
||||
}
|
||||
if _, err := pool.Exec(ctx, `
|
||||
INSERT INTO users (email, name) VALUES ('seed@example.test', 'Seed-Benutzer')
|
||||
ON CONFLICT (email) DO NOTHING
|
||||
`); err != nil {
|
||||
t.Fatalf("seed-benutzer anlegen: %v", err)
|
||||
}
|
||||
|
||||
migrations, err := Load(migrationsDir(t))
|
||||
if err != nil {
|
||||
t.Fatalf("migrationen laden: %v", err)
|
||||
}
|
||||
return pool, migrations
|
||||
}
|
||||
|
||||
func migrationsDir(t *testing.T) string {
|
||||
t.Helper()
|
||||
wd, err := os.Getwd()
|
||||
if err != nil {
|
||||
t.Fatalf("getwd: %v", err)
|
||||
}
|
||||
return filepath.Join(wd, "..", "..", "migrations", "tenant")
|
||||
}
|
||||
|
||||
func tableExists(t *testing.T, ctx context.Context, pool *pgxpool.Pool, name string) bool {
|
||||
t.Helper()
|
||||
var exists bool
|
||||
if err := pool.QueryRow(ctx, `
|
||||
SELECT EXISTS (SELECT 1 FROM information_schema.tables WHERE table_name = $1)
|
||||
`, name).Scan(&exists); err != nil {
|
||||
t.Fatalf("tabellenexistenz von %q pruefen: %v", name, err)
|
||||
}
|
||||
return exists
|
||||
}
|
||||
|
||||
// TestUp_OnEmptyAndExistingDB ist Pruefung 1: Migration auf leerer DB und
|
||||
// auf bestehender DB getestet.
|
||||
func TestUp_OnEmptyAndExistingDB(t *testing.T) {
|
||||
pool, migrations := setupTest(t)
|
||||
ctx := context.Background()
|
||||
|
||||
applied, err := Up(ctx, pool, migrations)
|
||||
if err != nil {
|
||||
t.Fatalf("up (leere db): %v", err)
|
||||
}
|
||||
if len(applied) == 0 {
|
||||
t.Fatal("erwartet mindestens 1 angewendete migration auf leerer db")
|
||||
}
|
||||
for _, table := range []string{"folders", "documents", "file_revisions", "tags", "document_tags", "metadata_fields", "document_metadata_values"} {
|
||||
if !tableExists(t, ctx, pool, table) {
|
||||
t.Fatalf("tabelle %q existiert nach Up nicht", table)
|
||||
}
|
||||
}
|
||||
|
||||
// Zweiter Up-Lauf gegen die JETZT BESTEHENDE db - muss ohne Fehler
|
||||
// durchlaufen und darf nichts erneut anwenden (idempotent ueber
|
||||
// schema_migrations).
|
||||
appliedAgain, err := Up(ctx, pool, migrations)
|
||||
if err != nil {
|
||||
t.Fatalf("up (bestehende db, zweiter lauf): %v", err)
|
||||
}
|
||||
if len(appliedAgain) != 0 {
|
||||
t.Fatalf("zweiter Up-Lauf haette 0 neue migrationen anwenden sollen, hat %d", len(appliedAgain))
|
||||
}
|
||||
}
|
||||
|
||||
// TestDownOne_RestoresPreviousState ist Pruefung 2: Rollback stellt den
|
||||
// Vorzustand wieder her.
|
||||
func TestDownOne_RestoresPreviousState(t *testing.T) {
|
||||
pool, migrations := setupTest(t)
|
||||
ctx := context.Background()
|
||||
|
||||
if _, err := Up(ctx, pool, migrations); err != nil {
|
||||
t.Fatalf("up: %v", err)
|
||||
}
|
||||
if !tableExists(t, ctx, pool, "documents") {
|
||||
t.Fatal("voraussetzung nicht erfuellt: documents sollte nach Up existieren")
|
||||
}
|
||||
|
||||
// DownOne rollt IMMER nur die zuletzt angewendete Migration zurueck
|
||||
// (dokumentiertes Verhalten) — bei mehreren Migrationen (z.B. FDN-02
|
||||
// documents + FDN-04 processing_jobs) muss man entsprechend oft
|
||||
// aufrufen. Anzahl der Wiederholungen richtet sich NICHT nach dem
|
||||
// Rueckgabewert von Up() (der nur die in DIESEM Aufruf NEU angewendeten
|
||||
// Migrationen zaehlt, siehe Kommentar an Up) — stattdessen wird
|
||||
// wiederholt, bis DownOne "" liefert (schema_migrations leer).
|
||||
for i := 0; i < len(migrations); i++ {
|
||||
version, err := DownOne(ctx, pool, migrations)
|
||||
if err != nil {
|
||||
t.Fatalf("downone (lauf %d): %v", i, err)
|
||||
}
|
||||
if version == "" {
|
||||
break
|
||||
}
|
||||
}
|
||||
|
||||
for _, table := range []string{"folders", "documents", "file_revisions", "tags", "document_tags", "metadata_fields", "document_metadata_values", "processing_jobs"} {
|
||||
if tableExists(t, ctx, pool, table) {
|
||||
t.Fatalf("tabelle %q existiert nach vollstaendigem Rollback noch - Vorzustand nicht wiederhergestellt", table)
|
||||
}
|
||||
}
|
||||
|
||||
// Erneutes DownOne ohne verbleibende angewendete Migration liefert "".
|
||||
versionAfterAll, err := DownOne(ctx, pool, migrations)
|
||||
if err != nil {
|
||||
t.Fatalf("downone (nichts mehr anzuwenden): %v", err)
|
||||
}
|
||||
if versionAfterAll != "" {
|
||||
t.Fatalf("erwartet leeren string bei leerer schema_migrations, habe %q", versionAfterAll)
|
||||
}
|
||||
}
|
||||
|
||||
// TestForeignKeyConstraints_RejectInvalidReferences ist Pruefung 3:
|
||||
// Fremdschluessel-Constraints durch Negativtests belegt.
|
||||
func TestForeignKeyConstraints_RejectInvalidReferences(t *testing.T) {
|
||||
pool, migrations := setupTest(t)
|
||||
ctx := context.Background()
|
||||
if _, err := Up(ctx, pool, migrations); err != nil {
|
||||
t.Fatalf("up: %v", err)
|
||||
}
|
||||
|
||||
var userID string
|
||||
if err := pool.QueryRow(ctx, `SELECT id FROM users LIMIT 1`).Scan(&userID); err != nil {
|
||||
t.Fatalf("seed-benutzer lesen: %v", err)
|
||||
}
|
||||
|
||||
t.Run("dokument mit unbekanntem ordner wird abgewiesen", func(t *testing.T) {
|
||||
_, err := pool.Exec(ctx, `
|
||||
INSERT INTO documents (folder_id, title, created_by) VALUES (gen_random_uuid(), 'x', $1)
|
||||
`, userID)
|
||||
if err == nil {
|
||||
t.Fatal("insert mit unbekanntem folder_id haette scheitern muessen")
|
||||
}
|
||||
})
|
||||
|
||||
t.Run("dokument mit unbekanntem ersteller wird abgewiesen", func(t *testing.T) {
|
||||
_, err := pool.Exec(ctx, `
|
||||
INSERT INTO documents (title, created_by) VALUES ('x', gen_random_uuid())
|
||||
`)
|
||||
if err == nil {
|
||||
t.Fatal("insert mit unbekanntem created_by haette scheitern muessen")
|
||||
}
|
||||
})
|
||||
|
||||
t.Run("datei-revision mit unbekanntem dokument wird abgewiesen", func(t *testing.T) {
|
||||
_, err := pool.Exec(ctx, `
|
||||
INSERT INTO file_revisions (document_id, revision_number, storage_key, checksum_sha256, size_bytes, mime_type, created_by)
|
||||
VALUES (gen_random_uuid(), 1, 'k', repeat('0',64), 1, 'text/plain', $1)
|
||||
`, userID)
|
||||
if err == nil {
|
||||
t.Fatal("insert mit unbekanntem document_id haette scheitern muessen")
|
||||
}
|
||||
})
|
||||
|
||||
t.Run("tag-zuordnung mit unbekanntem tag wird abgewiesen", func(t *testing.T) {
|
||||
var docID string
|
||||
if err := pool.QueryRow(ctx, `
|
||||
INSERT INTO documents (title, created_by) VALUES ('fk-test-doc', $1) RETURNING id
|
||||
`, userID).Scan(&docID); err != nil {
|
||||
t.Fatalf("testdokument anlegen: %v", err)
|
||||
}
|
||||
_, err := pool.Exec(ctx, `
|
||||
INSERT INTO document_tags (document_id, tag_id) VALUES ($1, gen_random_uuid())
|
||||
`, docID)
|
||||
if err == nil {
|
||||
t.Fatal("insert mit unbekanntem tag_id haette scheitern muessen")
|
||||
}
|
||||
})
|
||||
}
|
||||
@@ -1,8 +0,0 @@
|
||||
// Package shared enthaelt Code, der von App und Worker gemeinsam genutzt
|
||||
// wird (FDN-01) — Datenmodell, Storage-Zugriff etc. kommen in spaeteren
|
||||
// Kacheln (FDN-02/FDN-03) hierher, dieses Paket ist bewusst noch schlank.
|
||||
package shared
|
||||
|
||||
// Version ist die aktuelle DMS-Version, per -ldflags ueberschreibbar
|
||||
// (siehe Makefile) — Platzhalter fuer echtes Versionsmanagement.
|
||||
var Version = "dev"
|
||||
@@ -1,45 +0,0 @@
|
||||
// Package storage implementiert FDN-03: eine einheitliche Objekt-Storage-
|
||||
// Abstraktion mit zwei austauschbaren Treibern (lokal fuer Entwicklung,
|
||||
// S3-kompatibel fuer Produktion). Verschluesselung at rest ist NICHT
|
||||
// Bestandteil dieser Kachel (siehe FDN-09) — dieses Paket legt Bytes
|
||||
// unveraendert ab.
|
||||
package storage
|
||||
|
||||
import (
|
||||
"context"
|
||||
"errors"
|
||||
"io"
|
||||
"time"
|
||||
)
|
||||
|
||||
// ErrNotFound wird geliefert, wenn ein angefragtes Objekt nicht existiert
|
||||
// (Akzeptanzkriterium/Pruefung 3: klarer Fehler statt treiberspezifischer
|
||||
// Fehlertypen, die der Aufrufer sonst je Treiber unterschiedlich behandeln
|
||||
// muesste).
|
||||
var ErrNotFound = errors.New("storage: objekt nicht gefunden")
|
||||
|
||||
// Driver ist die EINE Schnittstelle, gegen die der Rest von DMS arbeitet
|
||||
// (Akzeptanzkriterium 1). Zwei Implementierungen: LocalDriver (Entwicklung)
|
||||
// und S3Driver (Produktion, S3-kompatibel).
|
||||
type Driver interface {
|
||||
// Put legt die Bytes aus r unter key ab und liefert die tatsaechlich
|
||||
// geschriebene Groesse in Bytes.
|
||||
Put(ctx context.Context, key string, r io.Reader, size int64, contentType string) (int64, error)
|
||||
// Get liefert die Bytes unter key. Existiert key nicht, liefert Get
|
||||
// ErrNotFound.
|
||||
Get(ctx context.Context, key string) (io.ReadCloser, error)
|
||||
// Delete entfernt das Objekt unter key. Existiert key nicht, liefert
|
||||
// Delete ErrNotFound.
|
||||
Delete(ctx context.Context, key string) error
|
||||
// SignedURL liefert eine zeitlich begrenzte, signierte URL zum Lesen des
|
||||
// Objekts (Akzeptanzkriterium 2: konfigurierbare Gueltigkeit ueber ttl).
|
||||
SignedURL(ctx context.Context, key string, ttl time.Duration) (string, error)
|
||||
}
|
||||
|
||||
// ObjectKey liefert das Pfadschema fuer ein Dokument/Revision INNERHALB des
|
||||
// Mandanten-Buckets (Akzeptanzkriterium 3) — die Bucket-Trennung selbst ist
|
||||
// Sache von Core TEN-01, hier geht es nur um den Pfad innerhalb eines
|
||||
// bereits mandantenspezifischen Buckets.
|
||||
func ObjectKey(documentID, revisionID string) string {
|
||||
return "documents/" + documentID + "/revisions/" + revisionID
|
||||
}
|
||||
Some files were not shown because too many files have changed in this diff Show More
Reference in New Issue
Block a user