HOS 2.1 Installazione di Ceph con personalizzazione della rete (8 di 8)

2016-01-23

HOS 2.1 Installazione di Ceph con personalizzazione della rete (8 di 8)

Machine-translated from English. Read the English original

# La verità, la sola verità…

Ecco gli errori che ho incontrato durante questa installazione.

Errore – 1

Quando si esegue il processore di configurazione, questo accetta una chiave di crittografia breve e non segnala avvisi o errori fino alla fine dell'esecuzione.

InstallC (11)

Rieseguo il processore di configurazione e utilizzo una password di crittografia più robusta ‘H3lionhelion!’

E così passiamo alla prossima configurazione che deve essere messa a punto…

Errore – 2

cd ~/helion/hos/ansible
ansible-playbook -i hosts/localhost config-processor-run.yml

InstallC (12)

Se esaminiamo il file network_groups.yml, vedo che ho dimenticato di modificare questa sezione

InstallC (13)

Ho aggiunto ‘hos2.allthingscloud.eu’ come nome esterno

installC(100)

Errore – 3

Si lamenta anche dei miei profili nic_mapping assegnati nel file servers.yml.

InstallC (15)

Questo profilo mancava nel file nic_mappings.

Ho aggiunto il profilo corretto, HP-DL360-8PORT, al file nic_mappings.

InstallC (16)

Ora dobbiamo reinserire tutte queste modifiche nel repository e ricominciare.

cd ~/helion/hos/ansible
git add -A
git commit -m "Fixed initial configuration errors"

Errore – 4

cd ~/scratch/ansible/next/hos/ansible
ansible-playbook -i hosts/verb_hosts wipe_disks.yml

Ricevo il seguente ERRORE quando provo a cancellare i dischi

InstallC (27)

Questo accade perché ho crittografato i contenuti sensibili – per superare questo problema devo fornire --ask-vault-pass come parte della riga di comando

ansible-playbook -i hosts/verb_hosts wipe_disks.yml --ask-vault-pass

Errore – 5

E proprio quando penso di aver quasi finito, ricevo un altro fallimento come segue:

InstallC (30)

Molte lamentele in ~/.ansible/ansible.log riguardo a partizioni del disco corrotte – ho tentato di “manualmente” cancellarle utilizzando il seguente script:

clear_host() {
  ssh $1 << EOF
    echo onhost connected
    sudo /bin/dd if=/dev/zero of=/dev/sdb bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdc bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdd bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sde bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdf bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdg bs=512 count=2
    sudo /bin/dd if=/dev/zero of=/dev/sdh bs=512 count=2
    sync
EOF
}

export -f clear_host

seq 15 17 | while read i; do
  clear_host 172.16.60.$i
done

Questo non ha fatto alcuna differenza. Ricevo lo stesso errore di partizione.

Il mio prossimo tentativo di risoluzione sarà accedere al controller RAID su ogni server Ceph ed eliminare e ricreare i dischi non OS.

InstallC (31)InstallC (32)InstallC (33)InstallC (34)InstallC (35)

Ora cancellerò tutti gli Array ECCETTO l'Array A – il disco OS

InstallC (36)InstallC (37)

Ripetere questa operazione per gli Array B – G; dovresti ottenere qualcosa del genere:

InstallC (38)

Ora ricrea tutti gli array di dischi RAID0

InstallC (39)

Seleziona l'opzione “Crea array con RAID 0”

InstallC (40)

Seleziona OK

InstallC (41)InstallC (42)InstallC (43)

Ripeti questo processo sugli altri 2 nodi Ceph e poi possiamo rilanciare nuovamente il deployment

ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry

Anche questa volta abbiamo lo stesso identico fallimento – è ora di cercare bug noti…

Sì – questo è un bug noto – la funzionalità wipe_disk non funziona sempre correttamente –
È necessario accedere a ciascun nodo ed eseguire il seguente comando su ciascun disco journal e OSD:

/sbin/sgdisk --zap-all -- /dev/sd[b-h]

oppure utilizzare il seguente script:

clear_host() {
  ssh $1 << EOF
    echo onhost connected
    sudo /sbin/sgdisk --zap-all -- /dev/sdb 
    sudo /sbin/sgdisk --zap-all -- /dev/sdc 
    sudo /sbin/sgdisk --zap-all -- /dev/sdd 
    sudo /sbin/sgdisk --zap-all -- /dev/sde 
    sudo /sbin/sgdisk --zap-all -- /dev/sdf 
    sudo /sbin/sgdisk --zap-all -- /dev/sdg 
    sudo /sbin/sgdisk --zap-all -- /dev/sdh 
    sync
EOF
}

export -f clear_host

seq 15 17 | while read i; do
  clear_host 172.16.60.$i
done

Errore – 6

E ora continuiamo da dove avevamo lasciato –

ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass --limit @/home/graham/site.retry

Questo mi porta alla prossima sfida –

InstallC (44)

Come puoi vedere, questo si lamenta dell'autenticazione. Quello che non puoi vedere è che sono trascorse oltre 12 ore da quando mi sono ricollegato alla sessione screen originale fallita. Aggiungendo --limit @/home/graham/site.retry tenta di continuare da dove ha fallito. Tuttavia, sembra che alcuni token di autenticazione possano essere successivamente scaduti.

Rilancia l'installazione senza l'opzione --limit @/home/graham/site.retry.

ansible-playbook -i hosts/verb_hosts site.yml --ask-vault-pass

Originally published on allthingscloud.eu (2016-01-23).

← All posts