HOS 2.1 Ceph-Installation mit Netzwerk-Anpassung (8 von 8)
2016-01-23
Machine-translated from English. Read the English original
Hier sind die Fehler, die ich während dieser Installation encountered habe.
Fehler – 1
Beim Ausführen des Konfigurationsprozessors wird ein kurzes Verschlüsselungsschlüssel akzeptiert, und es wird erst am Ende des Durchlaufs gewarnt oder ein Fehler ausgegeben.

Ich führe den Konfigurationsprozessor erneut aus und verwende ein stärkeres Verschlüsselungspasswort ‚H3lionhelion!‘
Und so geht es weiter zum nächsten Konfigurationsschritt, der debuggt werden muss…
Fehler – 2
cd ~/helion/hos/ansible
ansible-playbook -i hosts/localhost config-processor-run.yml

Wenn wir uns die network_groups.yml-Datei ansehen, kann ich sehen, dass ich diesen Abschnitt vergessen habe zu ändern

Ich habe ‚hos2.allthingscloud.eu‘ als externen Namen hinzugefügt

Fehler – 3
Es beschwert sich auch über meine nic_mapping-Profile, die in der servers.yml-Datei zugewiesen sind.

Dieses Profil fehlte in der nic_mappings-Datei.
Ich habe das korrekte Profil, HP-DL360-8PORT, zur nic_mappings-Datei hinzugefügt.

Nun müssen wir alle diese Änderungen erneut im Repository committen und von vorne beginnen.
cd ~/helion/hos/ansible
git add -A
git commit -m "Fixed initial configuration errors"
Fehler – 4
cd ~/scratch/ansible/next/hos/ansible
ansible-playbook -i hosts/verb_hosts wipe_disks.yml
Ich erhalte den folgenden FEHLER beim Versuch, die Festplatten zu löschen

Das liegt daran, dass ich sensible Inhalte verschlüsselt habe – um dies zu umgehen, muss ich die --ask-vault-pass als Teil der Befehlszeile angeben
ansible-playbook -i hosts/verb_hosts wipe_disks.yml --ask-vault-pass
Fehler – 5
Und gerade als ich denke, ich bin fast fertig, erhalte ich einen weiteren Fehler wie folgt:

Viele Beschwerden in ~/.ansible/ansible.log über beschädigte Festplattenpartitionen – ich habe versucht, diese „manuell“ mit dem folgenden Skript zu löschen:
clear_host() {
ssh $1 << EOF
echo onhost connected
sudo /bin/dd if=/dev/zero of=/dev/sdb bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdc bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdd bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sde bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdf bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdg bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdh bs=512 count=2
sync
EOF
}
export -f clear_host
seq 15 17 | while read i; do
clear_host 172.16.60.$i
done
Das hat jedoch keinen Unterschied gemacht. Ich erhalte denselben Partitionierungsfehler.
Mein nächster Versuch zur Fehlerbehebung besteht darin, mich auf dem RAID-Controller jedes Ceph-Servers anzumelden und die Nicht-Betriebssystem-Laufwerke zu löschen und neu zu erstellen.





Nun lösche ich alle Arrays AUSSER Array A – das Betriebssystem-Laufwerk


Wiederholen Sie dies für die Arrays B – G, und Sie sollten am Ende etwas wie Folgendes haben:

Erstellen Sie nun alle RAID0-Laufwerk-Arrays neu

Wählen Sie die Option „Arrays mit RAID 0 erstellen“

Wählen Sie OK



Wiederholen Sie diesen Vorgang auf den anderen 2 Ceph-Knoten, und dann können wir die Bereitstellung erneut starten
ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry
Wiederum haben wir den exakt gleichen Fehler – Zeit, nach bekannten Fehlern zu suchen…
Ja – dies ist ein bekannter Fehler – die wipe_disk-Funktionalität funktioniert nicht immer korrekt –
Es ist notwendig, sich auf jedem Knoten anzumelden und den folgenden Befehl gegen jedes Journal- und OSD-Laufwerk auszuführen:
/sbin/sgdisk --zap-all -- /dev/sd[b-h]
oder verwenden Sie das folgende Skript:
clear_host() {
ssh $1 << EOF
echo onhost connected
sudo /sbin/sgdisk --zap-all -- /dev/sdb
sudo /sbin/sgdisk --zap-all -- /dev/sdc
sudo /sbin/sgdisk --zap-all -- /dev/sdd
sudo /sbin/sgdisk --zap-all -- /dev/sde
sudo /sbin/sgdisk --zap-all -- /dev/sdf
sudo /sbin/sgdisk --zap-all -- /dev/sdg
sudo /sbin/sgdisk --zap-all -- /dev/sdh
sync
EOF
}
export -f clear_host
seq 15 17 | while read i; do
clear_host 172.16.60.$i
done
Fehler – 6
Und nun fahren wir dort fort, wo wir aufgehört haben –
ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry
Dies bringt mich zur nächsten Herausforderung –

Wie Sie sehen können, beschwert es sich über Authentifizierung. Was Sie nicht sehen können, ist, dass seit dem erneuten Beitritt zum ursprünglichen fehlgeschlagenen Screen-Sitzung über 12 Stunden vergangen sind. Durch Anhängen der --limit @/home/graham/site.retry wird versucht, dort fortzufahren, wo es fehlgeschlagen ist. Allerdings scheint es, als ob einige Authentifizierungstoken anschließend abgelaufen sein könnten.
Starten Sie die Installation ohne die --limit @/home/graham/site.retry-Option erneut.
ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass
Originally published on allthingscloud.eu (2016-01-23).