HOS 2.1 Ceph-Installation mit Netzwerk-Anpassung (8 von 8)

2016-01-23

HOS 2.1 Ceph-Installation mit Netzwerk-Anpassung (8 von 8)

Machine-translated from English. Read the English original

# Die Wahrheit, die ganze Wahrheit…

Hier sind die Fehler, die ich während dieser Installation encountered habe.

Fehler – 1

Beim Ausführen des Konfigurationsprozessors wird ein kurzes Verschlüsselungsschlüssel akzeptiert, und es wird erst am Ende des Durchlaufs gewarnt oder ein Fehler ausgegeben.

InstallC (11)

Ich führe den Konfigurationsprozessor erneut aus und verwende ein stärkeres Verschlüsselungspasswort ‚H3lionhelion!‘

Und so geht es weiter zum nächsten Konfigurationsschritt, der debuggt werden muss…

Fehler – 2

cd ~/helion/hos/ansible
ansible-playbook -i hosts/localhost config-processor-run.yml

InstallC (12)

Wenn wir uns die network_groups.yml-Datei ansehen, kann ich sehen, dass ich diesen Abschnitt vergessen habe zu ändern

InstallC (13)

Ich habe ‚hos2.allthingscloud.eu‘ als externen Namen hinzugefügt

installC(100)

Fehler – 3

Es beschwert sich auch über meine nic_mapping-Profile, die in der servers.yml-Datei zugewiesen sind.

InstallC (15)

Dieses Profil fehlte in der nic_mappings-Datei.

Ich habe das korrekte Profil, HP-DL360-8PORT, zur nic_mappings-Datei hinzugefügt.

InstallC (16)

Nun müssen wir alle diese Änderungen erneut im Repository committen und von vorne beginnen.

cd ~/helion/hos/ansible
git add -A
git commit -m "Fixed initial configuration errors"

Fehler – 4

cd ~/scratch/ansible/next/hos/ansible
ansible-playbook -i hosts/verb_hosts wipe_disks.yml

Ich erhalte den folgenden FEHLER beim Versuch, die Festplatten zu löschen

InstallC (27)

Das liegt daran, dass ich sensible Inhalte verschlüsselt habe – um dies zu umgehen, muss ich die --ask-vault-pass als Teil der Befehlszeile angeben

ansible-playbook -i hosts/verb_hosts wipe_disks.yml --ask-vault-pass

Fehler – 5

Und gerade als ich denke, ich bin fast fertig, erhalte ich einen weiteren Fehler wie folgt:

InstallC (30)

Viele Beschwerden in ~/.ansible/ansible.log über beschädigte Festplattenpartitionen – ich habe versucht, diese „manuell“ mit dem folgenden Skript zu löschen:

clear_host() {
  ssh $1 << EOF
    echo onhost connected
    sudo /bin/dd if=/dev/zero of=/dev/sdb bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdc bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdd bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sde bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdf bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdg bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdh bs=512 count=2
    sync
EOF
}

export -f clear_host

seq 15 17 | while read i; do
  clear_host 172.16.60.$i
done

Das hat jedoch keinen Unterschied gemacht. Ich erhalte denselben Partitionierungsfehler.

Mein nächster Versuch zur Fehlerbehebung besteht darin, mich auf dem RAID-Controller jedes Ceph-Servers anzumelden und die Nicht-Betriebssystem-Laufwerke zu löschen und neu zu erstellen.

InstallC (31)InstallC (32)InstallC (33)InstallC (34)InstallC (35)

Nun lösche ich alle Arrays AUSSER Array A – das Betriebssystem-Laufwerk

InstallC (36)InstallC (37)

Wiederholen Sie dies für die Arrays B – G, und Sie sollten am Ende etwas wie Folgendes haben:

InstallC (38)

Erstellen Sie nun alle RAID0-Laufwerk-Arrays neu

InstallC (39)

Wählen Sie die Option „Arrays mit RAID 0 erstellen“

InstallC (40)

Wählen Sie OK

InstallC (41)InstallC (42)InstallC (43)

Wiederholen Sie diesen Vorgang auf den anderen 2 Ceph-Knoten, und dann können wir die Bereitstellung erneut starten

ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry

Wiederum haben wir den exakt gleichen Fehler – Zeit, nach bekannten Fehlern zu suchen…

Ja – dies ist ein bekannter Fehler – die wipe_disk-Funktionalität funktioniert nicht immer korrekt –
Es ist notwendig, sich auf jedem Knoten anzumelden und den folgenden Befehl gegen jedes Journal- und OSD-Laufwerk auszuführen:

/sbin/sgdisk --zap-all -- /dev/sd[b-h]

oder verwenden Sie das folgende Skript:

clear_host() {
  ssh $1 << EOF
    echo onhost connected
    sudo /sbin/sgdisk --zap-all -- /dev/sdb 
    sudo /sbin/sgdisk --zap-all -- /dev/sdc 
    sudo /sbin/sgdisk --zap-all -- /dev/sdd 
    sudo /sbin/sgdisk --zap-all -- /dev/sde 
    sudo /sbin/sgdisk --zap-all -- /dev/sdf 
    sudo /sbin/sgdisk --zap-all -- /dev/sdg 
    sudo /sbin/sgdisk --zap-all -- /dev/sdh 
    sync
EOF
}

export -f clear_host

seq 15 17 | while read i; do
  clear_host 172.16.60.$i
done

Fehler – 6

Und nun fahren wir dort fort, wo wir aufgehört haben –

ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry

Dies bringt mich zur nächsten Herausforderung –

InstallC (44)

Wie Sie sehen können, beschwert es sich über Authentifizierung. Was Sie nicht sehen können, ist, dass seit dem erneuten Beitritt zum ursprünglichen fehlgeschlagenen Screen-Sitzung über 12 Stunden vergangen sind. Durch Anhängen der --limit @/home/graham/site.retry wird versucht, dort fortzufahren, wo es fehlgeschlagen ist. Allerdings scheint es, als ob einige Authentifizierungstoken anschließend abgelaufen sein könnten.

Starten Sie die Installation ohne die --limit @/home/graham/site.retry-Option erneut.

ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass

Originally published on allthingscloud.eu (2016-01-23).

← All posts