HOS 2.1 Installazione di Ceph con personalizzazione della rete (8 di 8)
2016-01-23
Machine-translated from English. Read the English original
Ecco gli errori che ho incontrato durante questa installazione.
Errore – 1
Quando si esegue il processore di configurazione, questo accetta una chiave di crittografia breve e non segnala avvisi o errori fino alla fine dell'esecuzione.

Rieseguo il processore di configurazione e utilizzo una password di crittografia più robusta ‘H3lionhelion!’
E così passiamo alla prossima configurazione che deve essere messa a punto…
Errore – 2
cd ~/helion/hos/ansible
ansible-playbook -i hosts/localhost config-processor-run.yml

Se esaminiamo il file network_groups.yml, vedo che ho dimenticato di modificare questa sezione

Ho aggiunto ‘hos2.allthingscloud.eu’ come nome esterno

Errore – 3
Si lamenta anche dei miei profili nic_mapping assegnati nel file servers.yml.

Questo profilo mancava nel file nic_mappings.
Ho aggiunto il profilo corretto, HP-DL360-8PORT, al file nic_mappings.

Ora dobbiamo reinserire tutte queste modifiche nel repository e ricominciare.
cd ~/helion/hos/ansible
git add -A
git commit -m "Fixed initial configuration errors"
Errore – 4
cd ~/scratch/ansible/next/hos/ansible
ansible-playbook -i hosts/verb_hosts wipe_disks.yml
Ricevo il seguente ERRORE quando provo a cancellare i dischi

Questo accade perché ho crittografato i contenuti sensibili – per superare questo problema devo fornire --ask-vault-pass come parte della riga di comando
ansible-playbook -i hosts/verb_hosts wipe_disks.yml --ask-vault-pass
Errore – 5
E proprio quando penso di aver quasi finito, ricevo un altro fallimento come segue:

Molte lamentele in ~/.ansible/ansible.log riguardo a partizioni del disco corrotte – ho tentato di “manualmente” cancellarle utilizzando il seguente script:
clear_host() {
ssh $1 << EOF
echo onhost connected
sudo /bin/dd if=/dev/zero of=/dev/sdb bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdc bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdd bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sde bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdf bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdg bs=512 count=2
sudo /bin/dd if=/dev/zero of=/dev/sdh bs=512 count=2
sync
EOF
}
export -f clear_host
seq 15 17 | while read i; do
clear_host 172.16.60.$i
done
Questo non ha fatto alcuna differenza. Ricevo lo stesso errore di partizione.
Il mio prossimo tentativo di risoluzione sarà accedere al controller RAID su ogni server Ceph ed eliminare e ricreare i dischi non OS.





Ora cancellerò tutti gli Array ECCETTO l'Array A – il disco OS


Ripetere questa operazione per gli Array B – G; dovresti ottenere qualcosa del genere:

Ora ricrea tutti gli array di dischi RAID0

Seleziona l'opzione “Crea array con RAID 0”

Seleziona OK



Ripeti questo processo sugli altri 2 nodi Ceph e poi possiamo rilanciare nuovamente il deployment
ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry
Anche questa volta abbiamo lo stesso identico fallimento – è ora di cercare bug noti…
Sì – questo è un bug noto – la funzionalità wipe_disk non funziona sempre correttamente –
È necessario accedere a ciascun nodo ed eseguire il seguente comando su ciascun disco journal e OSD:
/sbin/sgdisk --zap-all -- /dev/sd[b-h]
oppure utilizzare il seguente script:
clear_host() {
ssh $1 << EOF
echo onhost connected
sudo /sbin/sgdisk --zap-all -- /dev/sdb
sudo /sbin/sgdisk --zap-all -- /dev/sdc
sudo /sbin/sgdisk --zap-all -- /dev/sdd
sudo /sbin/sgdisk --zap-all -- /dev/sde
sudo /sbin/sgdisk --zap-all -- /dev/sdf
sudo /sbin/sgdisk --zap-all -- /dev/sdg
sudo /sbin/sgdisk --zap-all -- /dev/sdh
sync
EOF
}
export -f clear_host
seq 15 17 | while read i; do
clear_host 172.16.60.$i
done
Errore – 6
E ora continuiamo da dove avevamo lasciato –
ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry
Questo mi porta alla prossima sfida –

Come puoi vedere, questo si lamenta dell'autenticazione. Quello che non puoi vedere è che sono trascorse oltre 12 ore da quando mi sono ricollegato alla sessione screen originale fallita. Aggiungendo --limit @/home/graham/site.retry tenta di continuare da dove ha fallito. Tuttavia, sembra che alcuni token di autenticazione possano essere successivamente scaduti.
Rilancia l'installazione senza l'opzione --limit @/home/graham/site.retry.
ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass
Originally published on allthingscloud.eu (2016-01-23).