add notes on site
This commit is contained in:
@@ -0,0 +1,18 @@
|
|||||||
|
Инвентарь для плейбуков бывает 3-х видов
|
||||||
|
1. INI
|
||||||
|
2. YAML
|
||||||
|
3. Динамический
|
||||||
|
Я использую ini формат как самый простой. Динамический интвентарь мы пока не научились формировать
|
||||||
|
Примерный вид инвентаря
|
||||||
|
|
||||||
|
[localhost]
|
||||||
|
localhost
|
||||||
|
[web]
|
||||||
|
web1
|
||||||
|
web2
|
||||||
|
[web:vars]
|
||||||
|
ansible_user=root
|
||||||
|
|
||||||
|
|
||||||
|
В инвентаре также указываем переменные относящиеся к данному хосту, по типу юзера которым подключаемся, где лежит ключ, какой порт используем и т.д. Для подробных сведений надо смотерть документацию
|
||||||
|
https://docs.ansible.com/ansible/latest/inventory_guide/intro_inventory.html
|
||||||
@@ -0,0 +1,23 @@
|
|||||||
|
Файл конфигурации с именем ansible.cfg лежит в директории пользования и задает параметры ансибла для пользователя. Для подробных разъяснений требуется смотреть документацию.
|
||||||
|
```
|
||||||
|
[defaults]
|
||||||
|
inventory = /home/ubadmin/ansible/inventory.ini
|
||||||
|
ansible_ssh_private_key_file = /home/ubadmin/.ssh/id_ed25519
|
||||||
|
ansible_user = ubadmin
|
||||||
|
roles_path = /home/ubadmin/ansible/roles
|
||||||
|
allow_world_readable_tmpfiles = false
|
||||||
|
remote_tmp = /tmp/${USER}/ansible
|
||||||
|
host_key_checking = False
|
||||||
|
timeout = 60
|
||||||
|
deprecation_warnings = False
|
||||||
|
display_skipped_hosts = False
|
||||||
|
[ssh_connection]
|
||||||
|
pipelining = True
|
||||||
|
ansible_connection=paramiko
|
||||||
|
[persistent_connection]
|
||||||
|
retries = 3
|
||||||
|
connect_timeout = 60
|
||||||
|
command_timeout = 30
|
||||||
|
```
|
||||||
|
|
||||||
|
https://docs.ansible.com/ansible/latest/reference_appendices/config.html
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#Homelab
|
||||||
|
Для своей лабы нужен сервак, и внешний адрес через который я смогу подключать внешние сервисы.
|
||||||
@@ -0,0 +1,8 @@
|
|||||||
|
#openstack
|
||||||
|
Заметки по поводу запуска Openstack
|
||||||
|
Для запуска использовать 2U Oracle и харды для Ceph
|
||||||
|
Пересобрать рейды. Установить контроллер в режим JBOD или вообще убрать его и подключить бекплейн к материнке.
|
||||||
|
Подключить сетевые карты на 10Гб\с к серверам
|
||||||
|
Накатываем 22 убунту на все сервера.
|
||||||
|
Для подключения используем 10 Гбс на Цеф и 1 гбс на остальное. Так же можно прокинуть внешний ip для тестов облака.
|
||||||
|
Ставим коллу и деплоим
|
||||||
@@ -0,0 +1,145 @@
|
|||||||
|
Сделаю наверное перевод с дополнениями
|
||||||
|
|
||||||
|
В этом посте я буду использовать следующие продукты:
|
||||||
|
|
||||||
|
- Proxmox - [домашняя страница](https://www.proxmox.com/en/)
|
||||||
|
- Ubuntu - [домашняя страница](https://ubuntu.com/)
|
||||||
|
- OpenTofu - [домашняя страница](https://opentofu.org/)
|
||||||
|
- поставщик terraform для bpg/proxmox — [реестр](https://registry.terraform.io/providers/bpg/proxmox/latest) и [github](https://github.com/bpg/terraform-provider-proxmox)
|
||||||
|
- Ansible - [домашняя страница](https://www.ansible.com/community)
|
||||||
|
- Kubespray - [домашняя страница](https://kubespray.io/#/) и [github](https://github.com/kubernetes-sigs/kubespray/tree/master)
|
||||||
|
|
||||||
|
### Установить OpenTofu
|
||||||
|
|
||||||
|
Чтобы начать работу с OpenTofu, я установил его на свой компьютер с Linux с помощью Snap, но есть и несколько других альтернатив. Подробнее см. на официальной странице [документации](https://opentofu.org/docs/intro/install/snap) OpenTofu.
|
||||||
|
|
||||||
|
```bash
|
||||||
|
sudo snap install --classic opentofu
|
||||||
|
```
|
||||||
|
|
||||||
|
Теперь OpenTofu установлен, и я могу начать его использовать. Я также установил автозаполнение bash следующим образом:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
tofu -install-autocomplete # restart shell session...
|
||||||
|
```
|
||||||
|
|
||||||
|
Я решил создать отдельную папку для своих «проектов», поэтому я создал папку в своей домашней папке под названием *tofu/proxmox, в которой у меня есть разные подпапки в зависимости от задач или ресурсов, для которых я буду использовать OpenTofu.
|
||||||
|
|
||||||
|
```bash
|
||||||
|
tofu/proxmox/
|
||||||
|
├── k8s-cluster-02
|
||||||
|
├── proxmox-images
|
||||||
|
```
|
||||||
|
|
||||||
|
## Сетевое зеркало реестра провайдеров terraform
|
||||||
|
|
||||||
|
Так как реестры и тераформ заблокированы для РФ требуется использовать пути обхода.
|
||||||
|
Для использования зеркала добавьте в [файл настроек terraform](https://www.terraform.io/cli/config/config-file) следующий код:
|
||||||
|
|
||||||
|
```
|
||||||
|
|
||||||
|
provider_installation {
|
||||||
|
network_mirror {
|
||||||
|
url = "https://nm.tf.org.ru/"
|
||||||
|
include = ["registry.terraform.io/*/*"]
|
||||||
|
}
|
||||||
|
direct {
|
||||||
|
exclude = ["registry.terraform.io/*/*"]
|
||||||
|
}
|
||||||
|
}
|
||||||
|
|
||||||
|
```
|
||||||
|
|
||||||
|
- В Windows файл должен называться `terraform.rc` и находиться в каталоге `%APPDATA%` соответствующего пользователя. Расположение каталога зависит от версии Windows. Чтобы найти этот каталог в своей системе используйте `$env:APPDATA` в PowerShell.
|
||||||
|
- В остальных системах файл должен называться `.terraformrc` и находиться в домашнем каталоге пользователя. (/home/ubadmin)
|
||||||
|
## Другие сайты
|
||||||
|
## Зеркала реестров
|
||||||
|
- [registry.comcloud.xyz](https://registry.comcloud.xyz/)
|
||||||
|
- [terraform-mirror.yandexcloud.net](https://cloud.yandex.ru/docs/tutorials/infrastructure-management/terraform-quickstart#configure-provider)
|
||||||
|
## Зеркала релизов
|
||||||
|
- [hashicorp-releases.website.yandexcloud.net](https://hashicorp-releases.website.yandexcloud.net/terraform/)
|
||||||
|
- [hc-mirror.express42.net](https://hc-mirror.express42.net/)
|
||||||
|
- [releases.comcloud.xyz](https://releases.comcloud.xyz/)
|
||||||
|
## Документация
|
||||||
|
- [docs.comcloud.xyz](https://docs.comcloud.xyz/)
|
||||||
|
|
||||||
|
### Провайдер OpenTofu Proxmox
|
||||||
|
|
||||||
|
Чтобы использовать OpenTofu с Proxmox, мне нужен провайдер, который может использовать API Proxmox. Я быстро изучил различные варианты и остановился на этом провайдере: [bpg/proxmox](https://registry.terraform.io/providers/bpg/proxmox). Он кажется очень активным и недавно обновлялся (согласно репозиторию git [здесь](https://github.com/bpg/terraform-provider-proxmox))
|
||||||
|
|
||||||
|
Поставщик OpenTofu/Terraform определяется следующим образом, а приведенный ниже пример настраивает установку поставщика bpg/proxmox, необходимого для взаимодействия с Proxmox.
|
||||||
|
terraform {
|
||||||
|
|
||||||
|
```
|
||||||
|
required_providers {
|
||||||
|
proxmox = {
|
||||||
|
source = "registry.terraform.io/bpg/proxmox"
|
||||||
|
}
|
||||||
|
local = {
|
||||||
|
source = "registry.terraform.io/hashicorp/local"
|
||||||
|
}
|
||||||
|
null = {
|
||||||
|
source = "registry.terraform.io/hashicorp/null"
|
||||||
|
}
|
||||||
|
time = {
|
||||||
|
source = "registry.terraform.io/hashicorp/time"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
}
|
||||||
|
|
||||||
|
provider "proxmox" {
|
||||||
|
endpoint = var.pve_api_url
|
||||||
|
api_token = "${var.pve_token_id}=${var.pve_token_secret}"
|
||||||
|
insecure = true
|
||||||
|
ssh {
|
||||||
|
agent = true
|
||||||
|
username = "root"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
```
|
||||||
|
|
||||||
|
Я сохраню это содержимое в файле под названием _providers.tf_
|
||||||
|
Сначала краткое объяснение двух разделов выше. Разделы _terraform_ указывают OpenTofu/Terraform, какой провайдер следует загрузить и включить. Поле _version_ определяет конкретную версию для использования, а не _последнюю_, а именно эту версию. Использование этого поля гарантирует, что ваша автоматизация не сломается, если в версии провайдера произойдут какие-либо изменения в API.
|
||||||
|
Раздел _provider_ настраивает взаимодействие прокси-провайдера с Proxmox. Вместо обычного имени пользователя и пароля я решил использовать токен API. Здесь я использую значение переменной в ключах endpoint и api-token, которые определены в другом файле под названием variables.tf и credentials.auto.tfvars. В моей системе автоматизации есть задачи, для которых требуется взаимодействие с Proxmox по SSH, поэтому я также включил его, настроив поле _ssh_.
|
||||||
|
|
||||||
|
Для получения дополнительной информации о провайдере bpg/proxmox перейдите [сюда](https://registry.terraform.io/providers/bpg/proxmox/latest/docs)
|
||||||
|
### Подготовьте Proxmox с помощью токена API для поставщика OpenTofu bpg/proxmox
|
||||||
|
|
||||||
|
Чтобы использовать описанный выше провайдер с Proxmox, мне нужно подготовить Proxmox для использования токена API. Я следовал документации провайдера bpg/proxmox [здесь](https://registry.terraform.io/providers/bpg/proxmox/latest/docs#api-token-authentication)
|
||||||
|
|
||||||
|
```
|
||||||
|
# Create the user
|
||||||
|
sudo pveum user add terraform@pve
|
||||||
|
|
||||||
|
# Create a role for the user above
|
||||||
|
sudo pveum role add Terraform -privs "Datastore.Allocate Datastore.AllocateSpace Datastore.AllocateTemplate Datastore.Audit Pool.Allocate Sys.Audit Sys.Console Sys.Modify SDN.Use VM.Allocate VM.Audit VM.Clone VM.Config.CDROM VM.Config.Cloudinit VM.Config.CPU VM.Config.Disk VM.Config.HWType VM.Config.Memory VM.Config.Network VM.Config.Options VM.Migrate VM.Monitor VM.PowerMgmt User.Modify"
|
||||||
|
|
||||||
|
# Assign the terraform user to the above role
|
||||||
|
sudo pveum aclmod / -user terraform@pve -role Terraform
|
||||||
|
|
||||||
|
# Create the token
|
||||||
|
sudo pveum user token add terraform@pve provider --privsep=0
|
||||||
|
|
||||||
|
┌──────────────┬──────────────────────────────────────┐
|
||||||
|
│ key │ value │
|
||||||
|
╞══════════════╪══════════════════════════════════════╡
|
||||||
|
│ full-tokenid │ terraform@pve!provider │
|
||||||
|
├──────────────┼──────────────────────────────────────┤
|
||||||
|
│ info │ {"privsep":"0"} │
|
||||||
|
├──────────────┼──────────────────────────────────────┤
|
||||||
|
│ value │ <token> │
|
||||||
|
└──────────────┴──────────────────────────────────────┘
|
||||||
|
# make a backup of the token
|
||||||
|
|
||||||
|
|
||||||
|
```
|
||||||
|
|
||||||
|
Теперь я могу войти в свой узел Proxmox по SSH без пароля с моего Linux-шлюза. Но при использовании в сочетании с opentofu этого недостаточно. Мне нужно загрузить ключ в хранилище ключей. Если я этого не сделаю, автоматизация, требующая доступа по SSH, завершится ошибкой с этим сообщением:
|
||||||
|
```bash
|
||||||
|
Error: failed to open SSH client: unable to authenticate user "root" over SSH to "172.18.5.102:22". Please verify that ssh-agent is correctly loaded with an authorized key via 'ssh-add -L' (NOTE: configurations in ~/.ssh/config are not considered by golang's ssh implementation). The exact error from ssh.Dial: ssh: handshake failed: ssh: unable to authenticate, attempted methods [none password], no supported methods remain
|
||||||
|
```
|
||||||
|
Для того что бы избавиться от ошибки нужно выполнить команды в терминале:
|
||||||
|
```
|
||||||
|
eval `ssh-agent -s`
|
||||||
|
ssh-add /home/ubadmin/.ssh/id_ed25519
|
||||||
|
```
|
||||||
@@ -0,0 +1,3 @@
|
|||||||
|
|
||||||
|
eval `ssh-agent -s`
|
||||||
|
ssh-add /home/ubadmin/.ssh/id_ed25519
|
||||||
@@ -0,0 +1,9 @@
|
|||||||
|
При добавлении хранилища в прокс не ставить MTU 9000 даже если оборудование поддерживает. Потому что кривые пидарасы не смогли это реализовать. До первой проблемы\перезгарузки\мигания электричества (нужное подчеркнуть) оно работает как часы, но потом не запустишь. Кластер разваливается и пиздец.
|
||||||
|
Возможно я накосячил с MTU.
|
||||||
|
Jumbo Frames включены на всем маршруте
|
||||||
|
Опытным путем замеров и кринжа выяснен МТУ для маршрута до СХД
|
||||||
|
MTU 7940
|
||||||
|
Почему так а хуй его знает. Заголовок VLAN 4 байта. МТУ на интерфейсах свитча 9126
|
||||||
|
МТУ на СХД 9000
|
||||||
|
куда делись 1000 байт а хер его знает.
|
||||||
|
Я выяснил свой косяк. Производитель говна под названием Infortrend сделал на модели СХД jumbo frames 8000 вместо 9000 Теперь понятно куда делся косарь байтиков. Вонючие тайваньцы сожрали
|
||||||
@@ -0,0 +1,37 @@
|
|||||||
|
|
||||||
|
Для создания кластера копируем мой шаблон в рабочую директорию и переименовываем. Переходим в свежую копию и готовимся к развертыванию
|
||||||
|
ЧТо нам потребуется:
|
||||||
|
- Создать 3 мастер ноды
|
||||||
|
- Создать 3 воркер ноды
|
||||||
|
- Сгенерировать инвентарь для ансибл
|
||||||
|
- Установить кубспрей
|
||||||
|
- установить зависимости
|
||||||
|
- Запустить плейбук установки кубера
|
||||||
|
Действия для выполнения.
|
||||||
|
ТАк как надо создавать 2 вида вм то создадим 2 файла где опишем ресурсы и назовем их k8s-cp-node-01 и k8s-worker-node-01
|
||||||
|
Копируем в эти файлы содержимое темплейта и меняем название ресурса.
|
||||||
|
С переменными в данной ситуации все сложно.
|
||||||
|
Можно создать набор переменных для каждой установки, но тогда на потребуется указывать 2 набора переменных под каждый тип машин.
|
||||||
|
Можно использовать переменные из шаблона не вводя новые, но так как ресурса 2 разных мы столкнемся с проблемой что переменные пересекаются в ресурсах и мешают друг другу (например Id вм должно быть индивидуальным, но без колхозинга оно таким не является и падает в ошибку )
|
||||||
|
|
||||||
|
Я предпочел колхозинг второму набору, так как его немного. А так же не надо городить второй набор практических неизменных значений. (подумать над решением такой проблемы)
|
||||||
|
|
||||||
|
Меняем значения переменных в файле значений. СЛЕДИМ ЗА ID!!!!! Так можно убить инфру. По хорошему надо добавить автотест с отдельной ручкой на случай сушествования ВМ с таким айди.
|
||||||
|
|
||||||
|
Так как у нас добавился счетчик, то для подставления значений в имя, ip и тд, нам нужно экранировать переменные, а так же добавить простой текст для того, что бы не городить второй набор. Этот текст будет различать разные виды ресурса.
|
||||||
|
Переменные которые обязательно меняются:
|
||||||
|
vm_id
|
||||||
|
vm_hostname
|
||||||
|
ip_address
|
||||||
|
Значение для них записываются в виде :
|
||||||
|
```
|
||||||
|
"${var.vm_hostname}-cp-${count.index + 1}"
|
||||||
|
```
|
||||||
|
```
|
||||||
|
"${var.vm_id}1${count.index + 1}"
|
||||||
|
```
|
||||||
|
```
|
||||||
|
"${var.ip_address}${count.index + 1}/24"
|
||||||
|
```
|
||||||
|
Мы добавляем кавычки так как внутри содержится просто текст. Текст мы добавляем для каждого ресурса свой.
|
||||||
|
Так как имя будет составное из переменной из файла и переменной счетчика то мы их экранируем друг от друга конструкцией ${}
|
||||||
@@ -0,0 +1,74 @@
|
|||||||
|
```
|
||||||
|
#cloud-config
|
||||||
|
package_update: true
|
||||||
|
packages:
|
||||||
|
- iptables-persistent
|
||||||
|
- fail2ban
|
||||||
|
- auditd
|
||||||
|
- qemu-guest-agent
|
||||||
|
- net-tools
|
||||||
|
groups:
|
||||||
|
- admins
|
||||||
|
users:
|
||||||
|
- name: ubadmin
|
||||||
|
primary_group: admin
|
||||||
|
groups:
|
||||||
|
- sudo
|
||||||
|
- admins
|
||||||
|
sudo: ALL=(ALL) NOPASSWD:ALL
|
||||||
|
shell: /bin/bash
|
||||||
|
ssh_authorized_keys:
|
||||||
|
- <ssh_public_key>
|
||||||
|
write_files:
|
||||||
|
- path: /etc/iptables/rules.v4
|
||||||
|
permissions: 0640
|
||||||
|
owner: root:root
|
||||||
|
content: |
|
||||||
|
*filter
|
||||||
|
:INPUT DROP [0:0]
|
||||||
|
:FORWARD DROP [0:0]
|
||||||
|
:OUTPUT ACCEPT [0:0]
|
||||||
|
-A INPUT -p tcp -m tcp --dport 22 -j ACCEPT
|
||||||
|
-A INPUT -i lo -j ACCEPT
|
||||||
|
-A INPUT -m conntrack --ctstate RELATED,ESTABLISHED -j ACCEPT
|
||||||
|
-A INPUT -p icmp --icmp-type 0 -j ACCEPT
|
||||||
|
-A INPUT -p icmp --icmp-type 3 -j ACCEPT
|
||||||
|
-A INPUT -p icmp --icmp-type 11 -j ACCEPT
|
||||||
|
COMMIT
|
||||||
|
- path: /etc/fail2ban/jail.local
|
||||||
|
permissions: 0640
|
||||||
|
owner: root:root
|
||||||
|
content: |
|
||||||
|
[sshd]
|
||||||
|
enabled = true
|
||||||
|
findtime = 1m
|
||||||
|
nmaxretry = 5
|
||||||
|
bantime = 15m
|
||||||
|
- path: /etc/audit/rules.d/audit.rules
|
||||||
|
permissions: 0640
|
||||||
|
owner: root:root
|
||||||
|
content: |
|
||||||
|
-D
|
||||||
|
-e 1
|
||||||
|
-f 1
|
||||||
|
-a always,exclude -F msgtype=CWD
|
||||||
|
-a always,exclude -F msgtype=PATH
|
||||||
|
-a always,exclude -F msgtype=PROCTITLE
|
||||||
|
-a always,exit -F dir=/var/log/audit/ -F perm=wa -F auid!=unset -F key=audit-trail-modification
|
||||||
|
-a always,exit -F path=/var/log/syslog -F perm=wa -F auid!=unset -F key=audit-trail-modification
|
||||||
|
-a always,exit -F path=/var/log/auth.log -F perm=wa -F auid!=unset -F key=audit-trail-modification
|
||||||
|
-a always,exit -F arch=x86_64 -S setuid -F auid!=unset -F a0=0 -F exe=/usr/bin/su -F key=elevated-privileges-session
|
||||||
|
-a always,exit -F arch=x86_64 -S setresuid -F auid!=unset -F a0=0 -F exe=/usr/bin/sudo -F key=elevated-privileges-session
|
||||||
|
-a always,exit -F arch=x86_64 -S execve -F auid!=unset -C uid!=euid -F euid=0 -F key=elevated-privileges-session
|
||||||
|
-a always,exit -F arch=x86_64 -S chmod -S fchmod -S chown -S fchown -S lchown -F auid!=unset -F key=access-rights-modification
|
||||||
|
runcmd:
|
||||||
|
- printf "%s\n""readonly TMOUT=900" "export TMOUT" >> /etc/profile
|
||||||
|
- printf "%s\n" "net.ipv6.conf.all.disable_ipv6 = 1" "net.ipv6.conf.default.disable_ipv6 = 1" "net.ipv6.conf.lo.disable_ipv6 = 1" >> /etc/sysctl.conf && sysctl -p
|
||||||
|
- sed -i -e '/^PermitRootLogin/s/^.*$/PermitRootLogin no/' /etc/ssh/sshd_config
|
||||||
|
- sed -i -e '/^PasswordAuthentication/s/^.*$/PasswordAuthentication no/' /etc/ssh/sshd_config
|
||||||
|
- sed -i -e '/^#ClientAliveInterval/s/^.*$/ClientAliveInterval 5m/' /etc/ssh/sshd_config
|
||||||
|
- sed -i -e '/^#ClientAliveCountMax/s/^.*$/ClientAliveCountMax 3/' /etc/ssh/sshd_config
|
||||||
|
- sed -i -e '$aAllowGroups admins' /etc/ssh/sshd_config
|
||||||
|
- systemctl enable fail2ban
|
||||||
|
- reboot
|
||||||
|
```
|
||||||
@@ -0,0 +1,10 @@
|
|||||||
|
Данная нейросеть развернута локально на машине ООО Трастинфо.
|
||||||
|
Нейросеть помнит контекст во время диалога
|
||||||
|
Она не понимает местонахождение меня.
|
||||||
|
Старается дать развернутый ответ.
|
||||||
|
При большом объеме информации заметны фризы и подвисания
|
||||||
|
На задачи математических вычислений она начинает выводить код python и отвечает на английском языке при вопросе на русском, но вычисление сделаны верно. Проверено на очень простом уравнении
|
||||||
|
После решения уравнения нейросеть в чате начала отображать выполнение кода и повторять ответ на английском языке на старый вопрос пока не скажешь прекратить
|
||||||
|
Пишет простые функции на питоне и может их выполнить
|
||||||
|
Воспринимает ли текст с ошибками?
|
||||||
|
Текст с ошибками воспринимает плохо, но воспринимает и осознает контекст сообщения
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#comand #notes #database #mysql
|
||||||
|
mysqldump -u root -v --single-transaction --skip-lock-tables --flush-privileges --quick zabbix > /tmp/zabbix.sql
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#comand #notes
|
||||||
|
![[Pasted image 20250312073216.png]]
|
||||||
@@ -0,0 +1,10 @@
|
|||||||
|
#comand #linux #iptables
|
||||||
|
```
|
||||||
|
iptables -A FORWARD -i eth1(внутрений) -o eth0(внешний) -j ACCEPT
|
||||||
|
```
|
||||||
|
```
|
||||||
|
iptables -A FORWARD -m state --state RELATED,ESTABLISHED -j ACCEPT
|
||||||
|
```
|
||||||
|
```
|
||||||
|
iptables -t nat -A POSTROUTING -s 10.2.0.0/24 -o eth1 -j SNAT --to-source 84.201.168.122
|
||||||
|
```
|
||||||
@@ -0,0 +1,5 @@
|
|||||||
|
#comand #notes #linux
|
||||||
|
```
|
||||||
|
apt list --instaled (name)
|
||||||
|
```
|
||||||
|
Имя пакета, можно использовать звездочку если не помнишь точное имя
|
||||||
@@ -0,0 +1,12 @@
|
|||||||
|
#comand #linux #notes
|
||||||
|
**du** — команда в Linux, которая отображает размер директории. [1](https://winitpro.ru/index.php/2021/02/20/svobodnoe-mesta-na-diske-v-linux/) Расшифровывается как disk usage (использование диска). [2](https://rebrainme.com/blog/linux/kak-uznat-skolko-mesta-zanimayut-fajly-i-direktorii-v-linux/)
|
||||||
|
|
||||||
|
**Некоторые дополнительные опции для du**:
|
||||||
|
|
||||||
|
- **du -h** — показывает информацию в читабельном формате. Можно указать путь к конкретной директории, если применить без этого, покажет информацию в текущем каталоге. [1](https://winitpro.ru/index.php/2021/02/20/svobodnoe-mesta-na-diske-v-linux/)
|
||||||
|
- **du -sh** — покажет размер директории, в которой пользователь находится. Можно указать путь к директории. [1](https://winitpro.ru/index.php/2021/02/20/svobodnoe-mesta-na-diske-v-linux/)
|
||||||
|
- **du -m** — вывод информации в мегабайтах. [1](https://winitpro.ru/index.php/2021/02/20/svobodnoe-mesta-na-diske-v-linux/)
|
||||||
|
- **du -h --time** — выведет информацию с дополнительным столбцом по времени изменения директории или файлов.
|
||||||
|
|
||||||
|
Если запустить du без указания параметров, то она выведет все директории и поддиректории текущей директории.
|
||||||
|
(https://winitpro.ru/index.php/2021/02/20/svobodnoe-mesta-na-diske-v-linux/)
|
||||||
@@ -0,0 +1,5 @@
|
|||||||
|
#comand #notes #linux
|
||||||
|
```
|
||||||
|
ip addr flush dev eth0 (указать имя сетевого интерфеса)
|
||||||
|
ifconfig <interface> 0.0.0.0
|
||||||
|
```
|
||||||
@@ -0,0 +1,761 @@
|
|||||||
|
#notes #comand #linux #docker
|
||||||
|
```
|
||||||
|
curl -fsSL https://get.docker.com | sh -
|
||||||
|
```
|
||||||
|
|
||||||
|
|
||||||
|
```
|
||||||
|
#!/bin/sh
|
||||||
|
set -e
|
||||||
|
# Docker Engine for Linux installation script.
|
||||||
|
#
|
||||||
|
# This script is intended as a convenient way to configure docker's package
|
||||||
|
# repositories and to install Docker Engine, This script is not recommended
|
||||||
|
# for production environments. Before running this script, make yourself familiar
|
||||||
|
# with potential risks and limitations, and refer to the installation manual
|
||||||
|
# at https://docs.docker.com/engine/install/ for alternative installation methods.
|
||||||
|
#
|
||||||
|
# The script:
|
||||||
|
#
|
||||||
|
# - Requires `root` or `sudo` privileges to run.
|
||||||
|
# - Attempts to detect your Linux distribution and version and configure your
|
||||||
|
# package management system for you.
|
||||||
|
# - Doesn't allow you to customize most installation parameters.
|
||||||
|
# - Installs dependencies and recommendations without asking for confirmation.
|
||||||
|
# - Installs the latest stable release (by default) of Docker CLI, Docker Engine,
|
||||||
|
# Docker Buildx, Docker Compose, containerd, and runc. When using this script
|
||||||
|
# to provision a machine, this may result in unexpected major version upgrades
|
||||||
|
# of these packages. Always test upgrades in a test environment before
|
||||||
|
# deploying to your production systems.
|
||||||
|
# - Isn't designed to upgrade an existing Docker installation. When using the
|
||||||
|
# script to update an existing installation, dependencies may not be updated
|
||||||
|
# to the expected version, resulting in outdated versions.
|
||||||
|
#
|
||||||
|
# Source code is available at https://github.com/docker/docker-install/
|
||||||
|
#
|
||||||
|
# Usage
|
||||||
|
# ==============================================================================
|
||||||
|
#
|
||||||
|
# To install the latest stable versions of Docker CLI, Docker Engine, and their
|
||||||
|
# dependencies:
|
||||||
|
#
|
||||||
|
# 1. download the script
|
||||||
|
#
|
||||||
|
# $ curl -fsSL https://get.docker.com -o install-docker.sh
|
||||||
|
#
|
||||||
|
# 2. verify the script's content
|
||||||
|
#
|
||||||
|
# $ cat install-docker.sh
|
||||||
|
#
|
||||||
|
# 3. run the script with --dry-run to verify the steps it executes
|
||||||
|
#
|
||||||
|
# $ sh install-docker.sh --dry-run
|
||||||
|
#
|
||||||
|
# 4. run the script either as root, or using sudo to perform the installation.
|
||||||
|
#
|
||||||
|
# $ sudo sh install-docker.sh
|
||||||
|
#
|
||||||
|
# Command-line options
|
||||||
|
# ==============================================================================
|
||||||
|
#
|
||||||
|
# --version <VERSION>
|
||||||
|
# Use the --version option to install a specific version, for example:
|
||||||
|
#
|
||||||
|
# $ sudo sh install-docker.sh --version 23.0
|
||||||
|
#
|
||||||
|
# --channel <stable|test>
|
||||||
|
#
|
||||||
|
# Use the --channel option to install from an alternative installation channel.
|
||||||
|
# The following example installs the latest versions from the "test" channel,
|
||||||
|
# which includes pre-releases (alpha, beta, rc):
|
||||||
|
#
|
||||||
|
# $ sudo sh install-docker.sh --channel test
|
||||||
|
#
|
||||||
|
# Alternatively, use the script at https://test.docker.com, which uses the test
|
||||||
|
# channel as default.
|
||||||
|
#
|
||||||
|
# --mirror <Aliyun|AzureChinaCloud>
|
||||||
|
#
|
||||||
|
# Use the --mirror option to install from a mirror supported by this script.
|
||||||
|
# Available mirrors are "Aliyun" (https://mirrors.aliyun.com/docker-ce), and
|
||||||
|
# "AzureChinaCloud" (https://mirror.azure.cn/docker-ce), for example:
|
||||||
|
#
|
||||||
|
# $ sudo sh install-docker.sh --mirror AzureChinaCloud
|
||||||
|
#
|
||||||
|
# ==============================================================================
|
||||||
|
|
||||||
|
|
||||||
|
# Git commit from https://github.com/docker/docker-install when
|
||||||
|
# the script was uploaded (Should only be modified by upload job):
|
||||||
|
SCRIPT_COMMIT_SHA="4c94a56999e10efcf48c5b8e3f6afea464f9108e"
|
||||||
|
|
||||||
|
# strip "v" prefix if present
|
||||||
|
VERSION="${VERSION#v}"
|
||||||
|
|
||||||
|
# The channel to install from:
|
||||||
|
# * stable
|
||||||
|
# * test
|
||||||
|
DEFAULT_CHANNEL_VALUE="stable"
|
||||||
|
if [ -z "$CHANNEL" ]; then
|
||||||
|
CHANNEL=$DEFAULT_CHANNEL_VALUE
|
||||||
|
fi
|
||||||
|
|
||||||
|
DEFAULT_DOWNLOAD_URL="https://download.docker.com"
|
||||||
|
if [ -z "$DOWNLOAD_URL" ]; then
|
||||||
|
DOWNLOAD_URL=$DEFAULT_DOWNLOAD_URL
|
||||||
|
fi
|
||||||
|
|
||||||
|
DEFAULT_REPO_FILE="docker-ce.repo"
|
||||||
|
if [ -z "$REPO_FILE" ]; then
|
||||||
|
REPO_FILE="$DEFAULT_REPO_FILE"
|
||||||
|
fi
|
||||||
|
|
||||||
|
mirror=''
|
||||||
|
DRY_RUN=${DRY_RUN:-}
|
||||||
|
while [ $# -gt 0 ]; do
|
||||||
|
case "$1" in
|
||||||
|
--channel)
|
||||||
|
CHANNEL="$2"
|
||||||
|
shift
|
||||||
|
;;
|
||||||
|
--dry-run)
|
||||||
|
DRY_RUN=1
|
||||||
|
;;
|
||||||
|
--mirror)
|
||||||
|
mirror="$2"
|
||||||
|
shift
|
||||||
|
;;
|
||||||
|
--version)
|
||||||
|
VERSION="${2#v}"
|
||||||
|
shift
|
||||||
|
;;
|
||||||
|
--*)
|
||||||
|
echo "Illegal option $1"
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
shift $(( $# > 0 ? 1 : 0 ))
|
||||||
|
done
|
||||||
|
|
||||||
|
case "$mirror" in
|
||||||
|
Aliyun)
|
||||||
|
DOWNLOAD_URL="https://mirrors.aliyun.com/docker-ce"
|
||||||
|
;;
|
||||||
|
AzureChinaCloud)
|
||||||
|
DOWNLOAD_URL="https://mirror.azure.cn/docker-ce"
|
||||||
|
;;
|
||||||
|
"")
|
||||||
|
;;
|
||||||
|
*)
|
||||||
|
>&2 echo "unknown mirror '$mirror': use either 'Aliyun', or 'AzureChinaCloud'."
|
||||||
|
exit 1
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
|
||||||
|
case "$CHANNEL" in
|
||||||
|
stable|test)
|
||||||
|
;;
|
||||||
|
*)
|
||||||
|
>&2 echo "unknown CHANNEL '$CHANNEL': use either stable or test."
|
||||||
|
exit 1
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
|
||||||
|
command_exists() {
|
||||||
|
command -v "$@" > /dev/null 2>&1
|
||||||
|
}
|
||||||
|
|
||||||
|
# version_gte checks if the version specified in $VERSION is at least the given
|
||||||
|
# SemVer (Maj.Minor[.Patch]), or CalVer (YY.MM) version.It returns 0 (success)
|
||||||
|
# if $VERSION is either unset (=latest) or newer or equal than the specified
|
||||||
|
# version, or returns 1 (fail) otherwise.
|
||||||
|
#
|
||||||
|
# examples:
|
||||||
|
#
|
||||||
|
# VERSION=23.0
|
||||||
|
# version_gte 23.0 // 0 (success)
|
||||||
|
# version_gte 20.10 // 0 (success)
|
||||||
|
# version_gte 19.03 // 0 (success)
|
||||||
|
# version_gte 26.1 // 1 (fail)
|
||||||
|
version_gte() {
|
||||||
|
if [ -z "$VERSION" ]; then
|
||||||
|
return 0
|
||||||
|
fi
|
||||||
|
version_compare "$VERSION" "$1"
|
||||||
|
}
|
||||||
|
|
||||||
|
# version_compare compares two version strings (either SemVer (Major.Minor.Path),
|
||||||
|
# or CalVer (YY.MM) version strings. It returns 0 (success) if version A is newer
|
||||||
|
# or equal than version B, or 1 (fail) otherwise. Patch releases and pre-release
|
||||||
|
# (-alpha/-beta) are not taken into account
|
||||||
|
#
|
||||||
|
# examples:
|
||||||
|
#
|
||||||
|
# version_compare 23.0.0 20.10 // 0 (success)
|
||||||
|
# version_compare 23.0 20.10 // 0 (success)
|
||||||
|
# version_compare 20.10 19.03 // 0 (success)
|
||||||
|
# version_compare 20.10 20.10 // 0 (success)
|
||||||
|
# version_compare 19.03 20.10 // 1 (fail)
|
||||||
|
version_compare() (
|
||||||
|
set +x
|
||||||
|
|
||||||
|
yy_a="$(echo "$1" | cut -d'.' -f1)"
|
||||||
|
yy_b="$(echo "$2" | cut -d'.' -f1)"
|
||||||
|
if [ "$yy_a" -lt "$yy_b" ]; then
|
||||||
|
return 1
|
||||||
|
fi
|
||||||
|
if [ "$yy_a" -gt "$yy_b" ]; then
|
||||||
|
return 0
|
||||||
|
fi
|
||||||
|
mm_a="$(echo "$1" | cut -d'.' -f2)"
|
||||||
|
mm_b="$(echo "$2" | cut -d'.' -f2)"
|
||||||
|
|
||||||
|
# trim leading zeros to accommodate CalVer
|
||||||
|
mm_a="${mm_a#0}"
|
||||||
|
mm_b="${mm_b#0}"
|
||||||
|
|
||||||
|
if [ "${mm_a:-0}" -lt "${mm_b:-0}" ]; then
|
||||||
|
return 1
|
||||||
|
fi
|
||||||
|
|
||||||
|
return 0
|
||||||
|
)
|
||||||
|
|
||||||
|
is_dry_run() {
|
||||||
|
if [ -z "$DRY_RUN" ]; then
|
||||||
|
return 1
|
||||||
|
else
|
||||||
|
return 0
|
||||||
|
fi
|
||||||
|
}
|
||||||
|
|
||||||
|
is_wsl() {
|
||||||
|
case "$(uname -r)" in
|
||||||
|
*microsoft* ) true ;; # WSL 2
|
||||||
|
*Microsoft* ) true ;; # WSL 1
|
||||||
|
* ) false;;
|
||||||
|
esac
|
||||||
|
}
|
||||||
|
|
||||||
|
is_darwin() {
|
||||||
|
case "$(uname -s)" in
|
||||||
|
*darwin* ) true ;;
|
||||||
|
*Darwin* ) true ;;
|
||||||
|
* ) false;;
|
||||||
|
esac
|
||||||
|
}
|
||||||
|
|
||||||
|
deprecation_notice() {
|
||||||
|
distro=$1
|
||||||
|
distro_version=$2
|
||||||
|
echo
|
||||||
|
printf "\033[91;1mDEPRECATION WARNING\033[0m\n"
|
||||||
|
printf " This Linux distribution (\033[1m%s %s\033[0m) reached end-of-life and is no longer supported by this script.\n" "$distro" "$distro_version"
|
||||||
|
echo " No updates or security fixes will be released for this distribution, and users are recommended"
|
||||||
|
echo " to upgrade to a currently maintained version of $distro."
|
||||||
|
echo
|
||||||
|
printf "Press \033[1mCtrl+C\033[0m now to abort this script, or wait for the installation to continue."
|
||||||
|
echo
|
||||||
|
sleep 10
|
||||||
|
}
|
||||||
|
|
||||||
|
get_distribution() {
|
||||||
|
lsb_dist=""
|
||||||
|
# Every system that we officially support has /etc/os-release
|
||||||
|
if [ -r /etc/os-release ]; then
|
||||||
|
lsb_dist="$(. /etc/os-release && echo "$ID")"
|
||||||
|
fi
|
||||||
|
# Returning an empty string here should be alright since the
|
||||||
|
# case statements don't act unless you provide an actual value
|
||||||
|
echo "$lsb_dist"
|
||||||
|
}
|
||||||
|
|
||||||
|
echo_docker_as_nonroot() {
|
||||||
|
if is_dry_run; then
|
||||||
|
return
|
||||||
|
fi
|
||||||
|
if command_exists docker && [ -e /var/run/docker.sock ]; then
|
||||||
|
(
|
||||||
|
set -x
|
||||||
|
$sh_c 'docker version'
|
||||||
|
) || true
|
||||||
|
fi
|
||||||
|
|
||||||
|
# intentionally mixed spaces and tabs here -- tabs are stripped by "<<-EOF", spaces are kept in the output
|
||||||
|
echo
|
||||||
|
echo "================================================================================"
|
||||||
|
echo
|
||||||
|
if version_gte "20.10"; then
|
||||||
|
echo "To run Docker as a non-privileged user, consider setting up the"
|
||||||
|
echo "Docker daemon in rootless mode for your user:"
|
||||||
|
echo
|
||||||
|
echo " dockerd-rootless-setuptool.sh install"
|
||||||
|
echo
|
||||||
|
echo "Visit https://docs.docker.com/go/rootless/ to learn about rootless mode."
|
||||||
|
echo
|
||||||
|
fi
|
||||||
|
echo
|
||||||
|
echo "To run the Docker daemon as a fully privileged service, but granting non-root"
|
||||||
|
echo "users access, refer to https://docs.docker.com/go/daemon-access/"
|
||||||
|
echo
|
||||||
|
echo "WARNING: Access to the remote API on a privileged Docker daemon is equivalent"
|
||||||
|
echo " to root access on the host. Refer to the 'Docker daemon attack surface'"
|
||||||
|
echo " documentation for details: https://docs.docker.com/go/attack-surface/"
|
||||||
|
echo
|
||||||
|
echo "================================================================================"
|
||||||
|
echo
|
||||||
|
}
|
||||||
|
|
||||||
|
# Check if this is a forked Linux distro
|
||||||
|
check_forked() {
|
||||||
|
|
||||||
|
# Check for lsb_release command existence, it usually exists in forked distros
|
||||||
|
if command_exists lsb_release; then
|
||||||
|
# Check if the `-u` option is supported
|
||||||
|
set +e
|
||||||
|
lsb_release -a -u > /dev/null 2>&1
|
||||||
|
lsb_release_exit_code=$?
|
||||||
|
set -e
|
||||||
|
|
||||||
|
# Check if the command has exited successfully, it means we're in a forked distro
|
||||||
|
if [ "$lsb_release_exit_code" = "0" ]; then
|
||||||
|
# Print info about current distro
|
||||||
|
cat <<-EOF
|
||||||
|
You're using '$lsb_dist' version '$dist_version'.
|
||||||
|
EOF
|
||||||
|
|
||||||
|
# Get the upstream release info
|
||||||
|
lsb_dist=$(lsb_release -a -u 2>&1 | tr '[:upper:]' '[:lower:]' | grep -E 'id' | cut -d ':' -f 2 | tr -d '[:space:]')
|
||||||
|
dist_version=$(lsb_release -a -u 2>&1 | tr '[:upper:]' '[:lower:]' | grep -E 'codename' | cut -d ':' -f 2 | tr -d '[:space:]')
|
||||||
|
|
||||||
|
# Print info about upstream distro
|
||||||
|
cat <<-EOF
|
||||||
|
Upstream release is '$lsb_dist' version '$dist_version'.
|
||||||
|
EOF
|
||||||
|
else
|
||||||
|
if [ -r /etc/debian_version ] && [ "$lsb_dist" != "ubuntu" ] && [ "$lsb_dist" != "raspbian" ]; then
|
||||||
|
if [ "$lsb_dist" = "osmc" ]; then
|
||||||
|
# OSMC runs Raspbian
|
||||||
|
lsb_dist=raspbian
|
||||||
|
else
|
||||||
|
# We're Debian and don't even know it!
|
||||||
|
lsb_dist=debian
|
||||||
|
fi
|
||||||
|
dist_version="$(sed 's/\/.*//' /etc/debian_version | sed 's/\..*//')"
|
||||||
|
case "$dist_version" in
|
||||||
|
12)
|
||||||
|
dist_version="bookworm"
|
||||||
|
;;
|
||||||
|
11)
|
||||||
|
dist_version="bullseye"
|
||||||
|
;;
|
||||||
|
10)
|
||||||
|
dist_version="buster"
|
||||||
|
;;
|
||||||
|
9)
|
||||||
|
dist_version="stretch"
|
||||||
|
;;
|
||||||
|
8)
|
||||||
|
dist_version="jessie"
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
}
|
||||||
|
|
||||||
|
do_install() {
|
||||||
|
echo "# Executing docker install script, commit: $SCRIPT_COMMIT_SHA"
|
||||||
|
|
||||||
|
if command_exists docker; then
|
||||||
|
cat >&2 <<-'EOF'
|
||||||
|
Warning: the "docker" command appears to already exist on this system.
|
||||||
|
|
||||||
|
If you already have Docker installed, this script can cause trouble, which is
|
||||||
|
why we're displaying this warning and provide the opportunity to cancel the
|
||||||
|
installation.
|
||||||
|
|
||||||
|
If you installed the current Docker package using this script and are using it
|
||||||
|
again to update Docker, you can ignore this message, but be aware that the
|
||||||
|
script resets any custom changes in the deb and rpm repo configuration
|
||||||
|
files to match the parameters passed to the script.
|
||||||
|
|
||||||
|
You may press Ctrl+C now to abort this script.
|
||||||
|
EOF
|
||||||
|
( set -x; sleep 20 )
|
||||||
|
fi
|
||||||
|
|
||||||
|
user="$(id -un 2>/dev/null || true)"
|
||||||
|
|
||||||
|
sh_c='sh -c'
|
||||||
|
if [ "$user" != 'root' ]; then
|
||||||
|
if command_exists sudo; then
|
||||||
|
sh_c='sudo -E sh -c'
|
||||||
|
elif command_exists su; then
|
||||||
|
sh_c='su -c'
|
||||||
|
else
|
||||||
|
cat >&2 <<-'EOF'
|
||||||
|
Error: this installer needs the ability to run commands as root.
|
||||||
|
We are unable to find either "sudo" or "su" available to make this happen.
|
||||||
|
EOF
|
||||||
|
exit 1
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
|
||||||
|
if is_dry_run; then
|
||||||
|
sh_c="echo"
|
||||||
|
fi
|
||||||
|
|
||||||
|
# perform some very rudimentary platform detection
|
||||||
|
lsb_dist=$( get_distribution )
|
||||||
|
lsb_dist="$(echo "$lsb_dist" | tr '[:upper:]' '[:lower:]')"
|
||||||
|
|
||||||
|
if is_wsl; then
|
||||||
|
echo
|
||||||
|
echo "WSL DETECTED: We recommend using Docker Desktop for Windows."
|
||||||
|
echo "Please get Docker Desktop from https://www.docker.com/products/docker-desktop/"
|
||||||
|
echo
|
||||||
|
cat >&2 <<-'EOF'
|
||||||
|
|
||||||
|
You may press Ctrl+C now to abort this script.
|
||||||
|
EOF
|
||||||
|
( set -x; sleep 20 )
|
||||||
|
fi
|
||||||
|
|
||||||
|
case "$lsb_dist" in
|
||||||
|
|
||||||
|
ubuntu)
|
||||||
|
if command_exists lsb_release; then
|
||||||
|
dist_version="$(lsb_release --codename | cut -f2)"
|
||||||
|
fi
|
||||||
|
if [ -z "$dist_version" ] && [ -r /etc/lsb-release ]; then
|
||||||
|
dist_version="$(. /etc/lsb-release && echo "$DISTRIB_CODENAME")"
|
||||||
|
fi
|
||||||
|
;;
|
||||||
|
|
||||||
|
debian|raspbian)
|
||||||
|
dist_version="$(sed 's/\/.*//' /etc/debian_version | sed 's/\..*//')"
|
||||||
|
case "$dist_version" in
|
||||||
|
12)
|
||||||
|
dist_version="bookworm"
|
||||||
|
;;
|
||||||
|
11)
|
||||||
|
dist_version="bullseye"
|
||||||
|
;;
|
||||||
|
10)
|
||||||
|
dist_version="buster"
|
||||||
|
;;
|
||||||
|
9)
|
||||||
|
dist_version="stretch"
|
||||||
|
;;
|
||||||
|
8)
|
||||||
|
dist_version="jessie"
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
;;
|
||||||
|
|
||||||
|
centos|rhel)
|
||||||
|
if [ -z "$dist_version" ] && [ -r /etc/os-release ]; then
|
||||||
|
dist_version="$(. /etc/os-release && echo "$VERSION_ID")"
|
||||||
|
fi
|
||||||
|
;;
|
||||||
|
|
||||||
|
*)
|
||||||
|
if command_exists lsb_release; then
|
||||||
|
dist_version="$(lsb_release --release | cut -f2)"
|
||||||
|
fi
|
||||||
|
if [ -z "$dist_version" ] && [ -r /etc/os-release ]; then
|
||||||
|
dist_version="$(. /etc/os-release && echo "$VERSION_ID")"
|
||||||
|
fi
|
||||||
|
;;
|
||||||
|
|
||||||
|
esac
|
||||||
|
|
||||||
|
# Check if this is a forked Linux distro
|
||||||
|
check_forked
|
||||||
|
|
||||||
|
# Print deprecation warnings for distro versions that recently reached EOL,
|
||||||
|
# but may still be commonly used (especially LTS versions).
|
||||||
|
case "$lsb_dist.$dist_version" in
|
||||||
|
centos.8|centos.7|rhel.7)
|
||||||
|
deprecation_notice "$lsb_dist" "$dist_version"
|
||||||
|
;;
|
||||||
|
debian.buster|debian.stretch|debian.jessie)
|
||||||
|
deprecation_notice "$lsb_dist" "$dist_version"
|
||||||
|
;;
|
||||||
|
raspbian.buster|raspbian.stretch|raspbian.jessie)
|
||||||
|
deprecation_notice "$lsb_dist" "$dist_version"
|
||||||
|
;;
|
||||||
|
ubuntu.bionic|ubuntu.xenial|ubuntu.trusty)
|
||||||
|
deprecation_notice "$lsb_dist" "$dist_version"
|
||||||
|
;;
|
||||||
|
ubuntu.mantic|ubuntu.lunar|ubuntu.kinetic|ubuntu.impish|ubuntu.hirsute|ubuntu.groovy|ubuntu.eoan|ubuntu.disco|ubuntu.cosmic)
|
||||||
|
deprecation_notice "$lsb_dist" "$dist_version"
|
||||||
|
;;
|
||||||
|
fedora.*)
|
||||||
|
if [ "$dist_version" -lt 40 ]; then
|
||||||
|
deprecation_notice "$lsb_dist" "$dist_version"
|
||||||
|
fi
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
|
||||||
|
# Run setup for each distro accordingly
|
||||||
|
case "$lsb_dist" in
|
||||||
|
ubuntu|debian|raspbian)
|
||||||
|
pre_reqs="ca-certificates curl"
|
||||||
|
apt_repo="deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] $DOWNLOAD_URL/linux/$lsb_dist $dist_version $CHANNEL"
|
||||||
|
(
|
||||||
|
if ! is_dry_run; then
|
||||||
|
set -x
|
||||||
|
fi
|
||||||
|
$sh_c 'apt-get -qq update >/dev/null'
|
||||||
|
$sh_c "DEBIAN_FRONTEND=noninteractive apt-get -y -qq install $pre_reqs >/dev/null"
|
||||||
|
$sh_c 'install -m 0755 -d /etc/apt/keyrings'
|
||||||
|
$sh_c "curl -fsSL \"$DOWNLOAD_URL/linux/$lsb_dist/gpg\" -o /etc/apt/keyrings/docker.asc"
|
||||||
|
$sh_c "chmod a+r /etc/apt/keyrings/docker.asc"
|
||||||
|
$sh_c "echo \"$apt_repo\" > /etc/apt/sources.list.d/docker.list"
|
||||||
|
$sh_c 'apt-get -qq update >/dev/null'
|
||||||
|
)
|
||||||
|
pkg_version=""
|
||||||
|
if [ -n "$VERSION" ]; then
|
||||||
|
if is_dry_run; then
|
||||||
|
echo "# WARNING: VERSION pinning is not supported in DRY_RUN"
|
||||||
|
else
|
||||||
|
# Will work for incomplete versions IE (17.12), but may not actually grab the "latest" if in the test channel
|
||||||
|
pkg_pattern="$(echo "$VERSION" | sed 's/-ce-/~ce~.*/g' | sed 's/-/.*/g')"
|
||||||
|
search_command="apt-cache madison docker-ce | grep '$pkg_pattern' | head -1 | awk '{\$1=\$1};1' | cut -d' ' -f 3"
|
||||||
|
pkg_version="$($sh_c "$search_command")"
|
||||||
|
echo "INFO: Searching repository for VERSION '$VERSION'"
|
||||||
|
echo "INFO: $search_command"
|
||||||
|
if [ -z "$pkg_version" ]; then
|
||||||
|
echo
|
||||||
|
echo "ERROR: '$VERSION' not found amongst apt-cache madison results"
|
||||||
|
echo
|
||||||
|
exit 1
|
||||||
|
fi
|
||||||
|
if version_gte "18.09"; then
|
||||||
|
search_command="apt-cache madison docker-ce-cli | grep '$pkg_pattern' | head -1 | awk '{\$1=\$1};1' | cut -d' ' -f 3"
|
||||||
|
echo "INFO: $search_command"
|
||||||
|
cli_pkg_version="=$($sh_c "$search_command")"
|
||||||
|
fi
|
||||||
|
pkg_version="=$pkg_version"
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
(
|
||||||
|
pkgs="docker-ce${pkg_version%=}"
|
||||||
|
if version_gte "18.09"; then
|
||||||
|
# older versions didn't ship the cli and containerd as separate packages
|
||||||
|
pkgs="$pkgs docker-ce-cli${cli_pkg_version%=} containerd.io"
|
||||||
|
fi
|
||||||
|
if version_gte "20.10"; then
|
||||||
|
pkgs="$pkgs docker-compose-plugin docker-ce-rootless-extras$pkg_version"
|
||||||
|
fi
|
||||||
|
if version_gte "23.0"; then
|
||||||
|
pkgs="$pkgs docker-buildx-plugin"
|
||||||
|
fi
|
||||||
|
if ! is_dry_run; then
|
||||||
|
set -x
|
||||||
|
fi
|
||||||
|
$sh_c "DEBIAN_FRONTEND=noninteractive apt-get -y -qq install $pkgs >/dev/null"
|
||||||
|
)
|
||||||
|
echo_docker_as_nonroot
|
||||||
|
exit 0
|
||||||
|
;;
|
||||||
|
centos|fedora|rhel)
|
||||||
|
repo_file_url="$DOWNLOAD_URL/linux/$lsb_dist/$REPO_FILE"
|
||||||
|
(
|
||||||
|
if ! is_dry_run; then
|
||||||
|
set -x
|
||||||
|
fi
|
||||||
|
if command_exists dnf5; then
|
||||||
|
$sh_c "dnf -y -q --setopt=install_weak_deps=False install dnf-plugins-core"
|
||||||
|
$sh_c "dnf5 config-manager addrepo --overwrite --save-filename=docker-ce.repo --from-repofile='$repo_file_url'"
|
||||||
|
|
||||||
|
if [ "$CHANNEL" != "stable" ]; then
|
||||||
|
$sh_c "dnf5 config-manager setopt \"docker-ce-*.enabled=0\""
|
||||||
|
$sh_c "dnf5 config-manager setopt \"docker-ce-$CHANNEL.enabled=1\""
|
||||||
|
fi
|
||||||
|
$sh_c "dnf makecache"
|
||||||
|
elif command_exists dnf; then
|
||||||
|
$sh_c "dnf -y -q --setopt=install_weak_deps=False install dnf-plugins-core"
|
||||||
|
$sh_c "rm -f /etc/yum.repos.d/docker-ce.repo /etc/yum.repos.d/docker-ce-staging.repo"
|
||||||
|
$sh_c "dnf config-manager --add-repo $repo_file_url"
|
||||||
|
|
||||||
|
if [ "$CHANNEL" != "stable" ]; then
|
||||||
|
$sh_c "dnf config-manager --set-disabled \"docker-ce-*\""
|
||||||
|
$sh_c "dnf config-manager --set-enabled \"docker-ce-$CHANNEL\""
|
||||||
|
fi
|
||||||
|
$sh_c "dnf makecache"
|
||||||
|
else
|
||||||
|
$sh_c "yum -y -q install yum-utils"
|
||||||
|
$sh_c "rm -f /etc/yum.repos.d/docker-ce.repo /etc/yum.repos.d/docker-ce-staging.repo"
|
||||||
|
$sh_c "yum-config-manager --add-repo $repo_file_url"
|
||||||
|
|
||||||
|
if [ "$CHANNEL" != "stable" ]; then
|
||||||
|
$sh_c "yum-config-manager --disable \"docker-ce-*\""
|
||||||
|
$sh_c "yum-config-manager --enable \"docker-ce-$CHANNEL\""
|
||||||
|
fi
|
||||||
|
$sh_c "yum makecache"
|
||||||
|
fi
|
||||||
|
)
|
||||||
|
pkg_version=""
|
||||||
|
if command_exists dnf; then
|
||||||
|
pkg_manager="dnf"
|
||||||
|
pkg_manager_flags="-y -q --best"
|
||||||
|
else
|
||||||
|
pkg_manager="yum"
|
||||||
|
pkg_manager_flags="-y -q"
|
||||||
|
fi
|
||||||
|
if [ -n "$VERSION" ]; then
|
||||||
|
if is_dry_run; then
|
||||||
|
echo "# WARNING: VERSION pinning is not supported in DRY_RUN"
|
||||||
|
else
|
||||||
|
if [ "$lsb_dist" = "fedora" ]; then
|
||||||
|
pkg_suffix="fc$dist_version"
|
||||||
|
else
|
||||||
|
pkg_suffix="el"
|
||||||
|
fi
|
||||||
|
pkg_pattern="$(echo "$VERSION" | sed 's/-ce-/\\\\.ce.*/g' | sed 's/-/.*/g').*$pkg_suffix"
|
||||||
|
search_command="$pkg_manager list --showduplicates docker-ce | grep '$pkg_pattern' | tail -1 | awk '{print \$2}'"
|
||||||
|
pkg_version="$($sh_c "$search_command")"
|
||||||
|
echo "INFO: Searching repository for VERSION '$VERSION'"
|
||||||
|
echo "INFO: $search_command"
|
||||||
|
if [ -z "$pkg_version" ]; then
|
||||||
|
echo
|
||||||
|
echo "ERROR: '$VERSION' not found amongst $pkg_manager list results"
|
||||||
|
echo
|
||||||
|
exit 1
|
||||||
|
fi
|
||||||
|
if version_gte "18.09"; then
|
||||||
|
# older versions don't support a cli package
|
||||||
|
search_command="$pkg_manager list --showduplicates docker-ce-cli | grep '$pkg_pattern' | tail -1 | awk '{print \$2}'"
|
||||||
|
cli_pkg_version="$($sh_c "$search_command" | cut -d':' -f 2)"
|
||||||
|
fi
|
||||||
|
# Cut out the epoch and prefix with a '-'
|
||||||
|
pkg_version="-$(echo "$pkg_version" | cut -d':' -f 2)"
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
(
|
||||||
|
pkgs="docker-ce$pkg_version"
|
||||||
|
if version_gte "18.09"; then
|
||||||
|
# older versions didn't ship the cli and containerd as separate packages
|
||||||
|
if [ -n "$cli_pkg_version" ]; then
|
||||||
|
pkgs="$pkgs docker-ce-cli-$cli_pkg_version containerd.io"
|
||||||
|
else
|
||||||
|
pkgs="$pkgs docker-ce-cli containerd.io"
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
if version_gte "20.10"; then
|
||||||
|
pkgs="$pkgs docker-compose-plugin docker-ce-rootless-extras$pkg_version"
|
||||||
|
fi
|
||||||
|
if version_gte "23.0"; then
|
||||||
|
pkgs="$pkgs docker-buildx-plugin"
|
||||||
|
fi
|
||||||
|
if ! is_dry_run; then
|
||||||
|
set -x
|
||||||
|
fi
|
||||||
|
$sh_c "$pkg_manager $pkg_manager_flags install $pkgs"
|
||||||
|
)
|
||||||
|
echo_docker_as_nonroot
|
||||||
|
exit 0
|
||||||
|
;;
|
||||||
|
sles)
|
||||||
|
if [ "$(uname -m)" != "s390x" ]; then
|
||||||
|
echo "Packages for SLES are currently only available for s390x"
|
||||||
|
exit 1
|
||||||
|
fi
|
||||||
|
repo_file_url="$DOWNLOAD_URL/linux/$lsb_dist/$REPO_FILE"
|
||||||
|
pre_reqs="ca-certificates curl libseccomp2 awk"
|
||||||
|
(
|
||||||
|
if ! is_dry_run; then
|
||||||
|
set -x
|
||||||
|
fi
|
||||||
|
$sh_c "zypper install -y $pre_reqs"
|
||||||
|
$sh_c "rm -f /etc/zypp/repos.d/docker-ce-*.repo"
|
||||||
|
$sh_c "zypper addrepo $repo_file_url"
|
||||||
|
|
||||||
|
opensuse_factory_url="https://download.opensuse.org/repositories/security:/SELinux/openSUSE_Factory/"
|
||||||
|
if ! zypper lr -d | grep -q "${opensuse_factory_url}"; then
|
||||||
|
opensuse_repo="${opensuse_factory_url}security:SELinux.repo"
|
||||||
|
if ! is_dry_run; then
|
||||||
|
cat >&2 <<- EOF
|
||||||
|
WARNING!!
|
||||||
|
openSUSE repository ($opensuse_repo) will be enabled now.
|
||||||
|
Do you wish to continue?
|
||||||
|
You may press Ctrl+C now to abort this script.
|
||||||
|
EOF
|
||||||
|
( set -x; sleep 20 )
|
||||||
|
fi
|
||||||
|
$sh_c "zypper addrepo $opensuse_repo"
|
||||||
|
fi
|
||||||
|
$sh_c "zypper --gpg-auto-import-keys refresh"
|
||||||
|
$sh_c "zypper lr -d"
|
||||||
|
)
|
||||||
|
pkg_version=""
|
||||||
|
if [ -n "$VERSION" ]; then
|
||||||
|
if is_dry_run; then
|
||||||
|
echo "# WARNING: VERSION pinning is not supported in DRY_RUN"
|
||||||
|
else
|
||||||
|
pkg_pattern="$(echo "$VERSION" | sed 's/-ce-/\\\\.ce.*/g' | sed 's/-/.*/g')"
|
||||||
|
search_command="zypper search -s --match-exact 'docker-ce' | grep '$pkg_pattern' | tail -1 | awk '{print \$6}'"
|
||||||
|
pkg_version="$($sh_c "$search_command")"
|
||||||
|
echo "INFO: Searching repository for VERSION '$VERSION'"
|
||||||
|
echo "INFO: $search_command"
|
||||||
|
if [ -z "$pkg_version" ]; then
|
||||||
|
echo
|
||||||
|
echo "ERROR: '$VERSION' not found amongst zypper list results"
|
||||||
|
echo
|
||||||
|
exit 1
|
||||||
|
fi
|
||||||
|
search_command="zypper search -s --match-exact 'docker-ce-cli' | grep '$pkg_pattern' | tail -1 | awk '{print \$6}'"
|
||||||
|
# It's okay for cli_pkg_version to be blank, since older versions don't support a cli package
|
||||||
|
cli_pkg_version="$($sh_c "$search_command")"
|
||||||
|
pkg_version="-$pkg_version"
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
(
|
||||||
|
pkgs="docker-ce$pkg_version"
|
||||||
|
if version_gte "18.09"; then
|
||||||
|
if [ -n "$cli_pkg_version" ]; then
|
||||||
|
# older versions didn't ship the cli and containerd as separate packages
|
||||||
|
pkgs="$pkgs docker-ce-cli-$cli_pkg_version containerd.io"
|
||||||
|
else
|
||||||
|
pkgs="$pkgs docker-ce-cli containerd.io"
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
if version_gte "20.10"; then
|
||||||
|
pkgs="$pkgs docker-compose-plugin docker-ce-rootless-extras$pkg_version"
|
||||||
|
fi
|
||||||
|
if version_gte "23.0"; then
|
||||||
|
pkgs="$pkgs docker-buildx-plugin"
|
||||||
|
fi
|
||||||
|
if ! is_dry_run; then
|
||||||
|
set -x
|
||||||
|
fi
|
||||||
|
$sh_c "zypper -q install -y $pkgs"
|
||||||
|
)
|
||||||
|
echo_docker_as_nonroot
|
||||||
|
exit 0
|
||||||
|
;;
|
||||||
|
*)
|
||||||
|
if [ -z "$lsb_dist" ]; then
|
||||||
|
if is_darwin; then
|
||||||
|
echo
|
||||||
|
echo "ERROR: Unsupported operating system 'macOS'"
|
||||||
|
echo "Please get Docker Desktop from https://www.docker.com/products/docker-desktop"
|
||||||
|
echo
|
||||||
|
exit 1
|
||||||
|
fi
|
||||||
|
fi
|
||||||
|
echo
|
||||||
|
echo "ERROR: Unsupported distribution '$lsb_dist'"
|
||||||
|
echo
|
||||||
|
exit 1
|
||||||
|
;;
|
||||||
|
esac
|
||||||
|
exit 1
|
||||||
|
}
|
||||||
|
|
||||||
|
# wrapped up in a function so that we have some protection against only getting
|
||||||
|
# half the file during "curl | sh"
|
||||||
|
do_install
|
||||||
|
```
|
||||||
@@ -0,0 +1,4 @@
|
|||||||
|
#comand #notes #linux
|
||||||
|
```
|
||||||
|
sudo hostnamectl set-hostname linuxconfig
|
||||||
|
```
|
||||||
@@ -0,0 +1,7 @@
|
|||||||
|
#comand #cloud-init #note
|
||||||
|
|
||||||
|
```
|
||||||
|
echo (пароль) | mkpasswd -m sha-512 -s
|
||||||
|
```
|
||||||
|
|
||||||
|
echo lGoI9ltSpDJDL91zYaEy | mkpasswd -m sha-512 -s
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#cloud-init #notes #automation #мысли
|
||||||
|
Подумать что мы можем делать с клауд инитом
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#docker #notes #мысли
|
||||||
|
Для автоматизации установки докера на хост скопировать скрипт установки с сайта докера, залить в локальную репу и разливать его с ансибл хоста, после клауд инита.
|
||||||
@@ -0,0 +1,3 @@
|
|||||||
|
#мысли
|
||||||
|
Определить бы какие сервера будут стетлесс а как стейтфулл
|
||||||
|
Тогда можно будет раскидать инфру, на плейбуки и создать репы для бекапов
|
||||||
@@ -0,0 +1,16 @@
|
|||||||
|
#automation #notes #мысли
|
||||||
|
План настройки автоматизации при деплое сервисов.
|
||||||
|
Инструменты для использования OpenTofu + Ansible
|
||||||
|
Что мы настраиваем терраформом
|
||||||
|
1. Параметры ВМ (CPU, Ram, disk, ip, dns)
|
||||||
|
2. Креды (логин, пароль, ssh)
|
||||||
|
3. Первичная настройка (hostname, iptables?, fail2ban, ssh, time)
|
||||||
|
4. Docker?
|
||||||
|
В принципе делаем копию официальной репы софта?
|
||||||
|
Вид к которому я пришел
|
||||||
|
- Деплоим вм на хост через тераформ
|
||||||
|
- При деплое выполняются первичные настройки
|
||||||
|
- Передаем параметры в инвентарь ансибла
|
||||||
|
- Ансибл запускает плейбуки для настройки
|
||||||
|
- В настройку входят: система, мониторинг, бекап файлов.
|
||||||
|
-
|
||||||
@@ -0,0 +1,15 @@
|
|||||||
|
#notes #backup #мысли
|
||||||
|
Примерные мысли такие. Для рекавери нам нужна вм, дата и конфиги.
|
||||||
|
Как сервер бекапов используем urbackup. С его помощью мы бекапим файлы из ВМок которые мы можем быстро востановить в случае чего, что бы уменьшить оверхед бекапа. На каждую ВМ создаем рекавери план. В основном мы имеем 3 вида файлов:
|
||||||
|
1) БД
|
||||||
|
2) Статика
|
||||||
|
3) Конфиги
|
||||||
|
На каждую ВМ делаем свою репу с бекапами. Хотелось бы все делать рестиком быстро и просто с дедупом, но сложно в управлении и не совмещаем образы ВМ и файлы. Можно написать автоматизацию для хапер ви через снапшоты, но очень много подводных. Это прям надо целый инструмент писать.
|
||||||
|
Для урбекапа надо проверить ограничения по скорости и мультипоток.
|
||||||
|
Настроить репы для файлов. Так же настроить репы для хранения тофу файлов.
|
||||||
|
Подумать над автоматической раскаткой приложения. Очень много автоматизации, долго писать тяжело поддерживать.
|
||||||
|
Примерная блок схема
|
||||||
|
Разверстка ВМ --> Добавление провижинига в репозиторий --> Определение директорий и файлов для бекапа --> Организация бекап-репы -- > Автоматизация бекапа
|
||||||
|
Схема говно надо переделать.
|
||||||
|
Добавить интеграцию бекапов в автоматизацию.
|
||||||
|
Надо сделать регистри контейнеров для наших систем.
|
||||||
@@ -0,0 +1,5 @@
|
|||||||
|
#мысли
|
||||||
|
|
||||||
|
Маркировка осуществляется для:
|
||||||
|
* Сетевых кабелей (медных и оптических)
|
||||||
|
* Кабелей питания
|
||||||
@@ -0,0 +1,15 @@
|
|||||||
|
#notes #мысли
|
||||||
|
Что требуется для онбординга новичка в команде?
|
||||||
|
Какая документация нужна для онбординга?
|
||||||
|
Попробуем сформировать базовую подготовку
|
||||||
|
Задачи на онбординг:
|
||||||
|
1) Знакомство с командой. Оформление пропусков (задача начальства)
|
||||||
|
2) Ознакомление с документами по ТБ, ОТ и остальными
|
||||||
|
3) Заведение учетных записей.
|
||||||
|
4) Первичный инструктаж
|
||||||
|
5) Острова обучения
|
||||||
|
6) Сдача предварительного среза знаний
|
||||||
|
7) Сдача экзамена.
|
||||||
|
* [ ] Составить список учетных записей которые нужно дать сотруднику.
|
||||||
|
* [ ] Определить входящую в инструктаж информацию
|
||||||
|
* [ ] Сформировать острова обучения
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#мысли #notes
|
||||||
|
Нетбокс будет являться эталонным хостом для систем. НА основе его сделаем документацию и отработаем алгоритм развертывания. Так же эталонными хостами будут сервисные хосты (мониторинг, логи, бекап.)
|
||||||
@@ -0,0 +1,12 @@
|
|||||||
|
|
||||||
|
Здравствуйте. Для организации высокопроизводительного хранилища базы данных мониторинга электропотребления PDU требуется закупить SSD диски и SFP модули. Высокопроизводительное хранилище требуется так как текущее хранилище не справляется с возросшей нагрузкой, что в дальнейшем может привести к потере данных.
|
||||||
|
|
||||||
|
Для организации отказоустойчивости требуется что бы каждый сервер в количестве 8 штук был оснащен SSD дисками. Минимальное количество дисков 2-шт на сервер.
|
||||||
|
|
||||||
|
Таким образом требуется 16 дисков SSD Samsung PM1643a <MZILT1T9HBJR> или аналогичных.
|
||||||
|
|
||||||
|
Для организации высокоскоростного подключения к хранилищу базы данных системы мониторинга PDU требуется SFP модули. Для обеспечения отказоустойчивости, совместимости и взаимозаменяемости серверов требуется закупить:
|
||||||
|
|
||||||
|
24 модуля SFP ASF-10G-T 10Gteck или аналогичные
|
||||||
|
|
||||||
|
16 модулей SFP Lenovo AFBR-709SMZ-ib8, ARISTA XVR-00001-02, Huawei LTF8501-BC+ 02310MNW или аналогичных
|
||||||
@@ -0,0 +1,4 @@
|
|||||||
|
Надо портов 15 + 2 аплинка
|
||||||
|
Адресов надо штук 50-100
|
||||||
|
Стойка 2.5 метра. Между стойками 3 метра. лоток пол метра с каждой стойки.
|
||||||
|
Итого 2.5 +1 +3 = 6.5 метров
|
||||||
@@ -0,0 +1,12 @@
|
|||||||
|
#note #imap #mail
|
||||||
|
Порт для подключения по протоколу IMAP с шифрованием TLS 993 Без
|
||||||
|
##### SMTP
|
||||||
|
- 25/tcp SMTP (стандартный порт)
|
||||||
|
- 465/tcp SMTPS (устаревший)
|
||||||
|
- 587/tcp submission (порт для обслуживания клиентов)
|
||||||
|
##### POP3
|
||||||
|
- 110/tcp POP3 (стандартный порт)
|
||||||
|
- 995/tcp POP3S (порт с предварительной установкой SSL/TLS соединения)
|
||||||
|
##### IMAP
|
||||||
|
- 143/tcp IMAP (стандартный порт)
|
||||||
|
- 993/tcp IMAPS (порт с предварительной установкой SSL/TLS соединения)
|
||||||
@@ -0,0 +1,25 @@
|
|||||||
|
Идея такая - сделать скрипт который будет создавать рейд, потом запускать тесты и записывать результаты в файл. После рейд удаляется и создается с другим страйпом. После всех тестов создается рейд с включенным кешем. и аналогично запускаются тесты
|
||||||
|
|
||||||
|
Тестирование будет осуществляться в два этапа без кеша и с кешем. Для каждого страйпа будет проверятся нагрузка в (1,4) потока, блоками (4,8,64,4096) К, с глубиной очереди (1,8,32,64,128).
|
||||||
|
Размер файла неизвестен. Тестирование настроено на время. Время тестирование 10 сек каждый конфиг.
|
||||||
|
Элементы программы:
|
||||||
|
Статические данные:
|
||||||
|
- Список страйпов для рейд контроллера, список потоков, список очереди, размер блока. +
|
||||||
|
Функции ОС:
|
||||||
|
- Функция создания рейда +
|
||||||
|
- Функция создания ФС +
|
||||||
|
- Функция монтирования +
|
||||||
|
- Функция отмонтирования +
|
||||||
|
- Функция удаления ФС +
|
||||||
|
- Функция удаления рейда +
|
||||||
|
- Функция включения кеша
|
||||||
|
Тестирование:
|
||||||
|
- Функция генерации конфиг файлов +
|
||||||
|
- Функция перебора конфигов
|
||||||
|
- Функция тестирования и записи в файл результатов
|
||||||
|
- Парсинг файлов и вывод только нужных данных в таблицу
|
||||||
|
|
||||||
|
|
||||||
|
Реализация на питоне. Запускаем большой цикл с вложенным циклом.
|
||||||
|
Выполнение выглядит так:
|
||||||
|
Генерим конфиги -> Начали цикл создаем RAID 0 из 1-ого диска со страйпом 8 -> создаем ФС -> Монтируем ФС -> Начало цикла тестирования -> Начало цикла парсинга -> Завршение парсинга - > Завершение цикла тестирования -> Отмонтируем диск -> Удаляем ФС -> Удаляем рейд 0 со страйпом 8 -> Завершаем Цикл тестирования.
|
||||||
@@ -0,0 +1,9 @@
|
|||||||
|
#reglament
|
||||||
|
Для введения нового оборудования в эксплуатацию требуется:
|
||||||
|
1) Заявка
|
||||||
|
2) Оборудование
|
||||||
|
3) Предварительные настройки
|
||||||
|
4) Монтаж
|
||||||
|
5) Коммутация
|
||||||
|
6) Введение в работу
|
||||||
|
7) Отчет о выполненных работах
|
||||||
@@ -0,0 +1,70 @@
|
|||||||
|
#reglament
|
||||||
|
Для введения нового оборудования в эксплуатацию требуется:
|
||||||
|
1) Заявка
|
||||||
|
2) Оборудование
|
||||||
|
3) Предварительные настройки
|
||||||
|
4) Монтаж
|
||||||
|
5) Коммутация
|
||||||
|
6) Введение в работу
|
||||||
|
7) Отчет о выполненных работах
|
||||||
|
|
||||||
|
## Заявка
|
||||||
|
Перед тем как приступать к работе требуется принять заявку на введение в эксплуатацию оборудования. Если такой нет требуется ее создать.
|
||||||
|
В заявке должно быть указано:
|
||||||
|
- Производитель оборудования и его модель
|
||||||
|
- Серийный номер
|
||||||
|
- Хостнейм и ip адрес
|
||||||
|
- Куда монтируется Стойка Юнит
|
||||||
|
- Куда будет подключено Стойка Юнит Порт (линки для управления, uplink)
|
||||||
|
- Назначение оборудования
|
||||||
|
- Ответственный за выполнение работ (Если разные задачи выполняют разные они все должны быть указаны в исполнителях)
|
||||||
|
|
||||||
|
## Оборудование
|
||||||
|
Для понимания какие настройки делать нужно понимать что это за оборудование и как оно будет использоваться.
|
||||||
|
Для этого следует ответить на вопросы:
|
||||||
|
- Сюда будут подключаться конечные узлы?
|
||||||
|
- Какой трафик будет идти через оборудование?
|
||||||
|
- На каком уровне будет работать оборудование?
|
||||||
|
- Есть ли отдельный линк управления?
|
||||||
|
Если подключается конечное оборудование, то скорее всего магистральный трафик идет только по аплинку, но если подключены сервера, то возможно деление трафика в канале на вланы или оверлейный трафик. Это относится и как L2 фабрике, так и к L3.
|
||||||
|
Если линк не предусмотрен то оно будет управляться через uplink.
|
||||||
|
Это дает нам понять какие настройки мы сделаем.
|
||||||
|
|
||||||
|
## Предварительные настройки
|
||||||
|
Прежде всего на оборудовании требуется настроить доступ. Без доступа мы управление идет через консоль, что мешает делать дальнейшие настройки.
|
||||||
|
Для получения доступа требуется настроить такие параметры как:
|
||||||
|
- Хостнейм (из заявки)
|
||||||
|
- Время
|
||||||
|
- Юзер, пароль и привелегии
|
||||||
|
- Разрешить доступ по SSH (если надо ACL)
|
||||||
|
- Создать влан через который будет осуществляться доступ
|
||||||
|
- Настроить порты во влан доступа и включить их
|
||||||
|
- Если управление идет через аплинк, то настроить uplink. А именно агрегацию или STP, транковый канал (канал доступа), назначить влан на uplink
|
||||||
|
Как только у нас появился удаленный доступ, то предварительные настройки завершены.
|
||||||
|
Все дальнейшие настройки являются уже индивидуальными и зависят от задачи эксплуатации.
|
||||||
|
|
||||||
|
## Монтаж
|
||||||
|
Монтаж производится после настройки удаленного доступа и uplink.
|
||||||
|
Размещение оборудования мы берем из заявки.
|
||||||
|
В монтаж входит прокладка кабеля между оборудованием. Откуда и куда будет подключено тоже берем из заявки.
|
||||||
|
Кабель тянем либо сами, либо заводим на СКС, если своих сил не достаточно.
|
||||||
|
На СКС заводятся межзальная, и клиентская прокладка линков. В остальных случаях ( внутри стойки и между стоек) можно протянуть кабель своими силами.
|
||||||
|
Тип и длинна кабеля завися от подключения и расстояния между устройствами. Это понятно из заявки.
|
||||||
|
Перед прокладкой кабеля должны быть промаркированы в соответствии с регламентом маркировки
|
||||||
|
[[Регламент маркировки]]
|
||||||
|
|
||||||
|
## Коммутация
|
||||||
|
Коммутация выполняется после прокладки всех линков и предварительных настроек. Если оборудование не настроено, то сработает защита на другом конце и порты не включатся. Кабеля заводим через специальные отверстия в стойках и включаем в нужные порты. (Какие именно указано в зявке)
|
||||||
|
После подключения кабелей между узлами сети можно выполнять настройки для эксплуатации.
|
||||||
|
Не забываем про STP и если между узлами образовались петли их надо разрешить.
|
||||||
|
|
||||||
|
## Введение в работу
|
||||||
|
Производим настройки портов для пользования оборудованием. Из заявки нам известно назначение оборудования и мы можем приступить к его эксплуатации.
|
||||||
|
В данном пункте не будут описываться параметры и настройки, так как все зависит от назначения.
|
||||||
|
Не забываем сохраняться и указывать дескрипшены и подсказки.
|
||||||
|
Так же лучше всего вести лог действий, которые выполняются
|
||||||
|
После настройки обязательно тестируем
|
||||||
|
## Отчет о выполнении работ
|
||||||
|
В отчете о выполнении требуется указать какие работы и настройки были сделаны, сколько времени потрачено и кто что сделал
|
||||||
|
Данную информацию заполняет указанный ответственный и пинает остальных для указания нужной информации.
|
||||||
|
Если в исходных данных были изменения они обязательно должны быть отражены в заявке.
|
||||||
@@ -0,0 +1 @@
|
|||||||
|
|
||||||
@@ -0,0 +1,420 @@
|
|||||||
|
Оглавление
|
||||||
|
|
||||||
|
[Инструкция по введению в эксплуатацию серверов. 1](#_Toc182279328)
|
||||||
|
|
||||||
|
[Часть 1. Приемка сервера и коммутация сервера. 1](#_Toc182279329)
|
||||||
|
|
||||||
|
[Этап 1: Приемка сервера. 1](#_Toc182279330)
|
||||||
|
|
||||||
|
[Этап 2. Коммутация и включение сервера. 1](#_Toc182279331)
|
||||||
|
|
||||||
|
[Часть 2. BIOS, порт удаленного управления, мониторинг 2](#_Toc182279332)
|
||||||
|
|
||||||
|
[Этап 1. BIOS. 2](#_Toc182279333)
|
||||||
|
|
||||||
|
[Этап 2. Порт удаленного управления. 3](#_Toc182279334)
|
||||||
|
|
||||||
|
[Этап 3. Мониторинг 4](#_Toc182279335)
|
||||||
|
|
||||||
|
[Установка ОС и подготовка к тестам.. 4](#_Toc182279336)
|
||||||
|
|
||||||
|
[Нагрузочное тестирование компонентов. 4](#_Toc182279337)
|
||||||
|
|
||||||
|
[Тестирование отказоустойчивости компонентов. 5](#_Toc182279338)
|
||||||
|
|
||||||
|
[Отключение и извлечение блока питания: имитация отказа блока питания. 5](#_Toc182279339)
|
||||||
|
|
||||||
|
[Извлечение накопителей: имитация отказа накопителей. 6](#_Toc182279340)
|
||||||
|
|
||||||
|
[Тестирование сетевых интерфейсов и пропускной способности. 8](#_Toc182279341)
|
||||||
|
|
||||||
|
# Инструкция по введению в эксплуатацию серверов
|
||||||
|
|
||||||
|
Для введения серверов в эксплуатацию и использования их в продакшене требуется выполнить обязательный порядок действий. Эти шаги являются обязательными и требуют внимания.
|
||||||
|
|
||||||
|
Для каждого сервера требуется заполнить чек-лист по пунктам инструкции. Сервер помечается как испорченный, если хотя бы один из критичных критериев не проходит проверку
|
||||||
|
|
||||||
|
## Часть 1. Приемка сервера и коммутация сервера
|
||||||
|
|
||||||
|
Приемка сервера является критичным критерием.
|
||||||
|
При поступлении сервера требуется провести:
|
||||||
|
|
||||||
|
### Этап 1: Приемка сервера
|
||||||
|
|
||||||
|
1. Проведение внешнего осмотра:
|
||||||
|
|
||||||
|
1.1. Осмотрите корпус сервера на наличие видимых повреждений (вмятин, царапин, сколов).
|
||||||
|
|
||||||
|
1.2. Проверьте кабели, блоки питания, кнопки и разъемы на наличие повреждений и целостность креплений.
|
||||||
|
|
||||||
|
1.3. Убедитесь, что на корпусе и внутренних компонентах нет признаков ударов, трещин или коррозии.
|
||||||
|
|
||||||
|
2. Проверка внутренних компонентов:
|
||||||
|
|
||||||
|
2.1. Откройте корпус и осмотрите плату, процессоры, модули памяти, накопители и кабели.
|
||||||
|
|
||||||
|
2.2. Проверьте крепление всех модулей, особенно оперативной памяти и процессора: они должны быть надежно зафиксированы.
|
||||||
|
|
||||||
|
2.3. Проверьте вентиляторы – они должны быть установлены плотно и вращаться без заеданий.
|
||||||
|
|
||||||
|
2.4. Если сервер прибыл в разобранном виде компоненты проверяются ДО и ПОСЛЕ установки в сервер.
|
||||||
|
|
||||||
|
3. Устранение неполадок (если обнаружены):
|
||||||
|
|
||||||
|
3.1. В случае обнаружения повреждений, зафиксируйте их и сделайте фотографии.
|
||||||
|
|
||||||
|
3.2. Оповестите руководство или службу поддержки, если повреждения серьезные или присутствуют недостающие компоненты.
|
||||||
|
|
||||||
|
4. Сборка сервера.
|
||||||
|
|
||||||
|
4.1. Сборка сервера осуществляется, если сервер поступил в разобранном виде.
|
||||||
|
|
||||||
|
4.2. Компоненты сервера являются модульными и подключаются согласно документации.
|
||||||
|
|
||||||
|
4.3. Сборка осуществляется аккуратно, без применения силы.
|
||||||
|
|
||||||
|
Этап 2. Коммутация и включение сервера.
|
||||||
|
ЗАПРЕЩАЕТСЯ УСТАНАВЛИВАТЬ СЕРВЕР В СТОЙКУ С ПРОДАКШН СЕРВЕРАМИ.
|
||||||
|
|
||||||
|
После осмотра и сборки сервера необходимо установить его в стойку и скоммутировать для тестирования.
|
||||||
|
|
||||||
|
1. Установка сервера в стойку:
|
||||||
|
|
||||||
|
1.1. Установите сервер в стойку, используя рекомендованные производителем монтажные крепления или шасси, чтобы обеспечить надежность крепления.
|
||||||
|
|
||||||
|
2. Подключение сетевых и периферийных устройств:
|
||||||
|
|
||||||
|
2.1. Подключите кабели Ethernet к сетевым портам сервера. Обычно подключают два порта: основной и резервный.
|
||||||
|
|
||||||
|
2.2. Подключите кабель к порту удаленного управления (ILO/DRAC/IPMI) для удаленного контроля и диагностики.
|
||||||
|
|
||||||
|
2.3. Подключите PSU используя кабели питания, подключив их к PDU (подключение производится симметрично, подключение PSU производится в разные PDU – один основной луч, другой резервный).
|
||||||
|
|
||||||
|
2.4. Подсоедините монитор, клавиатуру и мышь к серверу для доступа к начальной настройке.
|
||||||
|
|
||||||
|
3. Включение сервера
|
||||||
|
|
||||||
|
3.1. Произвести включение сервера нажатием на кнопку на передней панели
|
||||||
|
|
||||||
|
3.2. Проверьте, что все индикаторы на компонентах (диски, питание, сеть) работают нормально.
|
||||||
|
|
||||||
|
3.3. Ожидайте завершения POST (Power-On Self Test). Если система не проходит POST, зафиксируйте код ошибки и устраните причину.
|
||||||
|
|
||||||
|
3.4. Выключаем сервер
|
||||||
|
|
||||||
|
Часть 2. BIOS, порт удаленного управления, мониторинг
|
||||||
|
|
||||||
|
### Этап 1. BIOS
|
||||||
|
|
||||||
|
1. Вход в BIOS:
|
||||||
|
|
||||||
|
1.1. Нажмите необходимую клавишу (обычно F2, F10, Delete) при загрузке сервера, чтобы войти в BIOS.
|
||||||
|
|
||||||
|
2. Проверка конфигурации:
|
||||||
|
|
||||||
|
2.1. Убедитесь, что BIOS корректно распознает процессоры, модули памяти и диски.
|
||||||
|
|
||||||
|
2.2. Проверьте наличие и корректность кода версии BIOS и BMC.
|
||||||
|
|
||||||
|
3. Обновление прошивок:
|
||||||
|
|
||||||
|
3.1. Если необходимо, обновите BIOS и прошивки BMC. Используйте только версии, рекомендованные производителем.
|
||||||
|
|
||||||
|
3.2. Проверьте наличие обновлений для RAID-контроллера и PCIe-карт. Убедитесь, что обновление завершилось без ошибок.
|
||||||
|
|
||||||
|
4. Настройка базовых параметров:
|
||||||
|
|
||||||
|
4.1. Настройте системное время и дату для синхронизации с сервером мониторинга. Если для времени используется NTP сервер, то по возможности использовать его.
|
||||||
|
|
||||||
|
4.2. Включите опции виртуализации и Hyper-Threading (если необходимо для задач сервера).
|
||||||
|
|
||||||
|
4.3. Включаем параметр для сервера включаться всегда, когда есть питание.
|
||||||
|
|
||||||
|
4.4. Настройте последовательность загрузки, указав на USB в приоритете для загрузки установщика тестовой ОС.
|
||||||
|
|
||||||
|
4.5. Настройте сетевые параметры (ip, маска, шлюз) для порта удаленного управления (ILO/DRAC/IPMI) и, по возможности, учетную запись администратора (логин и пароль)
|
||||||
|
|
||||||
|
5. Настройка загрузки в режиме UEFI:
|
||||||
|
|
||||||
|
5.1. Включите режим загрузки UEFI, если система поддерживает его и планируется установка UEFI-совместимой ОС.
|
||||||
|
|
||||||
|
5.2. Если совместимость с Legacy обязательна для некоторых компонентов, включите режим Dual Boot или Legacy.
|
||||||
|
|
||||||
|
### Этап 2. Порт удаленного управления.
|
||||||
|
|
||||||
|
1. Подключение к порту управления (ILO, DRAC, IPMI):
|
||||||
|
|
||||||
|
1.1. Проверьте сетевую связность с портом управления.
|
||||||
|
|
||||||
|
1.2. Проверьте что по указанному адресу порта управления есть доступ через браузер и ssh.
|
||||||
|
|
||||||
|
1.3. Войдите в систему удаленного управления (ILO, DRAC, IPMI) через браузер и ssh с настроенными ранее логином и паролем. В иных случаях используйте логин и пароль указанные производителем.
|
||||||
|
|
||||||
|
2. Проверка аппаратной конфигурации и состояния компонентов:
|
||||||
|
|
||||||
|
2.1. Убедитесь, что на экране управления отображаются корректные сведения о сервере: серийный номер, модель, версия микрокода BIOS и BMC.
|
||||||
|
|
||||||
|
2.2. Проверьте статус установленных компонентов (процессор, ОЗУ, накопители, модули PCIe).
|
||||||
|
|
||||||
|
2.3. Проверьте показания датчиков температуры, напряжения, частоты вращения вентиляторов. Если есть возможность настройте пороговые значения для данных датчиков.
|
||||||
|
|
||||||
|
2.4. Просмотрите журналы событий BMC, чтобы убедиться в отсутствии ошибок, связанных с оборудованием.
|
||||||
|
|
||||||
|
3. Проверка функциональных возможностей системы удаленного управления (ILO, DRAC, IPMI):
|
||||||
|
|
||||||
|
3.1. Протестируйте функцию управления включением, выключением, перезагрузкой сервера
|
||||||
|
|
||||||
|
3.2. Создание новых пользователей и групп с определенными правами доступа (администратор, оператор, только чтение).
|
||||||
|
|
||||||
|
3.3. Использование HTML KVM-консоли или Java-консоли для установки и управления ОС.
|
||||||
|
|
||||||
|
3.4. Обновление версии микрокода BMC без влияния на работу ОС.
|
||||||
|
|
||||||
|
3.5. Генерация нового или добавление существующего SSL-сертификата.
|
||||||
|
|
||||||
|
3.6. Экспорт и импорт конфигурации интерфейса управления.
|
||||||
|
|
||||||
|
3.7. Сбросом порта управления до заводских настроек;
|
||||||
|
|
||||||
|
3.8. Отправка сообщений о событиях с использованием SMTP, syslog и SNMP Trap.
|
||||||
|
|
||||||
|
Дополнительные функциональные возможности можно узнать из документации к серверу от производителя.
|
||||||
|
|
||||||
|
### Этап 3. Мониторинг
|
||||||
|
|
||||||
|
Перед проведением тестов компонентов нам требуется настроить мониторинг сервера. От мониторинга мы получим статистку и проверим работоспособность мониторинга со стороны сервера.
|
||||||
|
|
||||||
|
1. Импорт и настройка MIB-файлов:
|
||||||
|
|
||||||
|
1.1. Загрузите и импортируйте MIB-файлы производителя в систему мониторинга (например, Zabbix, Nagios).
|
||||||
|
|
||||||
|
2. Создание шаблонов мониторинга:
|
||||||
|
|
||||||
|
2.1. Настройте шаблоны для мониторинга температур, энергопотребления, состояния компонентов (процессор, ОЗУ, диски).
|
||||||
|
|
||||||
|
3. Настройка оповещений:
|
||||||
|
|
||||||
|
3.1. Задайте пороговые значения для предупреждений и оповещений.
|
||||||
|
|
||||||
|
3.2. Убедитесь, что уведомления отправляются при перегрузке процессора, перегреве или отказе дисков.
|
||||||
|
|
||||||
|
## Часть 3. Нагрузочное тестирование.
|
||||||
|
|
||||||
|
### Этап 1. Установка ОС и подготовка к тестам
|
||||||
|
|
||||||
|
Закончив с предварительными настройками, мы можем переходить к установке ОС и запуске нагрузочного тестирования сервера.
|
||||||
|
|
||||||
|
1. Подключите носитель с установочным образом к серверу
|
||||||
|
|
||||||
|
2. Создайте RAID массив (если сервер содержит RAID контроллер)
|
||||||
|
|
||||||
|
2.1. Уровень RAID выбирается в зависимости от количества дисков и задач сервера
|
||||||
|
|
||||||
|
2.2. В основном используются уровни RAID 1 или 10, но также допускается уровень RAID5
|
||||||
|
|
||||||
|
3. Установка ОС
|
||||||
|
|
||||||
|
3.1. Для установки ОС используется дистрибутив Linux, который поддерживает утилиты из списка далее.
|
||||||
|
|
||||||
|
3.2. В основном используются дистрибутивы Ubuntu и Debian
|
||||||
|
|
||||||
|
3.3. Произведите установку ОС. При установке используйте LVM и выделите под корневой раздел все доступное пространство. Создайте файловую систему.
|
||||||
|
|
||||||
|
3.4. Настройте тестовую сеть
|
||||||
|
|
||||||
|
4. После установки
|
||||||
|
|
||||||
|
4.1. Обновите список пакетов и скачайте, и установите обновления системы.
|
||||||
|
|
||||||
|
4.2. Установите необходимые для тестирования утилиты:
|
||||||
|
|
||||||
|
· **badblocks** – для проверки дисков на наличие поврежденных секторов.
|
||||||
|
|
||||||
|
· **stress-ng** – для создания нагрузки на процессор и оперативную память.
|
||||||
|
|
||||||
|
· **fio** – для тестирования производительности дисковой подсистемы.
|
||||||
|
|
||||||
|
· **dd** – для измерения скорости записи данных на диск.
|
||||||
|
|
||||||
|
· **htop** – для мониторинга загрузки процессора, памяти и других системных ресурсов в реальном времени.
|
||||||
|
|
||||||
|
· **smartmontools** (включает smartctl) – для проверки состояния жестких дисков и SSD, поддержки S.M.A.R.T.
|
||||||
|
|
||||||
|
· **iperf****3** – Для тестирования пропускной способности сети
|
||||||
|
|
||||||
|
## Нагрузочное тестирование компонентов
|
||||||
|
|
||||||
|
После всех подготовок можно приступать к тестированию.
|
||||||
|
|
||||||
|
1) Процессор, память и температура.
|
||||||
|
|
||||||
|
Для проверки работы процессора, оперативной памяти и охлаждения запускаем стресс тест через утилиту stress-ng. Данный тест загружает каждый поток процессора на максимум и 98% оперативной памяти. Процент памяти надо указывать такой, чтобы осталось памяти для работы операционной системы. Иначе операционная система отключит выполнение тестов. Во время теста следим за ОС и сервером через утилиту htop. Смотрим что бы система не зависала и утилизировала указанные ресурсы. Сервер все 2 часа должен проработать без перезагрузок. Так же наблюдаем за сервером через менджмент порт. Смотрим температуру системы и отчеты в журналах (нагрев, перезагрузки и тд). Записываем показатель bogo ops/s (real time) и температуры.
|
||||||
|
|
||||||
|
**stress-ng --cpu 0 --cache 0 -m 0 --vm-bytes (объем RAM в сервере в %) --io 0 --hdd 0 -t (время теста) s --metrics-brief --tz**
|
||||||
|
|
||||||
|
2) Дисковая подсистема.
|
||||||
|
|
||||||
|
Перед запуском тестов проверим здоровье дисков. Для этого используем утилиту smartmontools
|
||||||
|
|
||||||
|
Так как диски находятся в RAID, то наша система видит его как логический диск. Для того что бы определить физические диски просканируем систему.
|
||||||
|
|
||||||
|
**smartctl --scan**
|
||||||
|
|
||||||
|
Данная команда отразит рейд контроллер и номер канала. Эти данные мы используем в проверке
|
||||||
|
|
||||||
|
**smartctl -****H -****d** **megaraid,5 (рейд контроллер и номер канала из сканирования) /****dev/****sda**
|
||||||
|
|
||||||
|
Вывод будет формата ок или не ок.
|
||||||
|
|
||||||
|
Для тестов дисковой подсистемы мы используем утилиты badblock, fio, dd
|
||||||
|
badblock проверяет блоки жесткого диска.
|
||||||
|
**badblocks -v****s /dev/sda (указываем диск или раздел который хотим протестировать)**
|
||||||
|
|
||||||
|
После проверки блоков если все блоки целые проверяем скорость чтения/записи. Пишем временный файл, состоящий из блоков размером в 1m количеством 40960 скидывая кэш. Скорость записи должна быть большой так как файл сначала пишется в кэш потом на диск
|
||||||
|
|
||||||
|
**dd status=progress if=/dev/zero of=/tmp/tempfile bs=1M count=40960 oflag=sync**
|
||||||
|
|
||||||
|
**sync; dd if=/dev/zero of=/tmp/tempfile bs=1M count=1024; sync**
|
||||||
|
|
||||||
|
Прогоняем данный тест 10 раз. Скорость не должна опускаться меньше 90 MB/s.
|
||||||
|
|
||||||
|
## Тестирование отказоустойчивости компонентов
|
||||||
|
|
||||||
|
После нагрузочного тестирования требуется протестировать отработку отказа компонентов с горячей заменой. А именно блоки питания и диски в RAID. Для данного тестирования мы поочередно отключаем компоненты, а потом возвращаем обратно. Во время тестов смотрим на работоспособность системы и отчеты в журнале менеджмент порта.
|
||||||
|
|
||||||
|
## Отключение и извлечение блока питания: имитация отказа блока питания
|
||||||
|
|
||||||
|
Этапы:
|
||||||
|
|
||||||
|
1. Перед проведением тестирования для получения эталонных результатов запускаем утилиту Stress-ng на 2 часа с параметрами, которые были описаны в разделе «Нагрузочное тестирование процессора». Фиксируем результаты для последующего сравнения.
|
||||||
|
|
||||||
|
2. Для создания нагрузки на сервер при выполнении тестирования повторно запускаем утилиту Stress-ng на 2 часа с параметрами, описанными в разделе «Утилита Stress-ng».
|
||||||
|
|
||||||
|
3. От блока питания PSU1 отключаем кабель питания и наблюдаем за BMC сервера с использованием IPMI на предмет появления уведомлений об ошибках и создания записей в системном журнале.
|
||||||
|
|
||||||
|
4. Блок питания PSU1 извлекаем из сервера и наблюдаем за BMC сервера, как описано в пункте 3.
|
||||||
|
|
||||||
|
5. По истечении 2 часов работы сервера под нагрузкой на одном блоке питания PSU2 фиксируем полученные результаты работы утилиты Stress-ng, чтобы сравнить с результатами, полученными при выполнении пункта 1.
|
||||||
|
|
||||||
|
6. Устанавливаем обратно блок питания PSU1. Наблюдаем за BMC сервера, как описано в пункте 3.
|
||||||
|
|
||||||
|
7. К блоку питания PSU1 подключаем кабель питания и наблюдаем за BMC сервера, как описано в пункте 3.
|
||||||
|
|
||||||
|
8. Повторно выполняем пункты со 2 по 7 включительно для блока питания PSU2.
|
||||||
|
|
||||||
|
Критерии успешного прохождения теста
|
||||||
|
|
||||||
|
· Во время работы под нагрузкой сервер доступен по ssh.
|
||||||
|
|
||||||
|
· При отключении от блока питания в BMC появилось уведомление, в системном журнале создалась запись о событии, датчики зафиксировали отсутствие напряжения на блоке питания.
|
||||||
|
|
||||||
|
· При извлечении блока питания из сервера в BMC создалось уведомление, определяется только один блок питания.
|
||||||
|
|
||||||
|
· При возврате блока питания в сервер и подключении кабеля питания в BMC определяются все блоки питания, все датчики с нормальными значениями, в системном журнале создалась запись о наличии напряжения на блоке питания.
|
||||||
|
|
||||||
|
· Результаты утилиты Stress-ng при работе сервера под нагрузкой и на одном блоке питания не отличаются в меньшую сторону больше чем на 10% по сравнению с результатами, полученными при работе сервера под нагрузкой на двух блоках питания.
|
||||||
|
|
||||||
|
## Извлечение накопителей: имитация отказа накопителей
|
||||||
|
|
||||||
|
Этапы
|
||||||
|
|
||||||
|
На свободных накопителях в сервере создаем дисковое хранилище с уровнем резервирования RAID1, RAID6 или RAID10 через BMC, BIOS или с использованием, например, утилиты StorCLI. Тестирование проводим для каждого уровня резервирования дискового хранилища.
|
||||||
|
|
||||||
|
При возможности один из свободных накопителей настраиваем как резервный (Global Hot Spare). Зависит от количества дисков и уровня RAID
|
||||||
|
|
||||||
|
Для дискового хранилища без файловой системы
|
||||||
|
|
||||||
|
1. Запускаем утилиту FIO с профилем нагрузки: 40% случайных операций записи и 60% случайных операций чтения блоком 8 КБ, 16 потоков. Фиксируем производительность в IOPS на чтение и запись.
|
||||||
|
|
||||||
|
2. Извлекаем из сервера один из накопителей. До начала перестроения дискового хранилища снова фиксируем производительность в IOPS на чтение и запись. Наблюдаем за BMC сервера на предмет появления уведомлений и создания записей в системном журнале.
|
||||||
|
|
||||||
|
3. Контролируем статус и процесс перестроения (rebuild) дискового хранилища, если есть свободный резервный накопитель в сервере (Global Hot Spare). Фиксируем производительность в IOPS на чтение и запись во время перестроения дискового хранилища.
|
||||||
|
|
||||||
|
4. При использовании дискового хранилища с уровнем резервирования RAID6 или RAID10 извлекаем второй накопитель из сервера. Фиксируем производительность в IOPS на чтение и запись.
|
||||||
|
|
||||||
|
5. По завершении перестроения дискового хранилища все ранее извлеченные накопители устанавливаем обратно. Отслеживаем статус всех накопителей, а также наблюдаем за BMC сервера, как описано в пункте 2.
|
||||||
|
|
||||||
|
6. При необходимости через BMC или с помощью утилиты StorCLI в ОС удаляем стороннюю конфигурацию на накопителях и меняем их статусы.
|
||||||
|
|
||||||
|
7. По завершении второго перестроения дискового хранилища отслеживаем статус и состав дискового хранилища, а также статус самих накопителей.
|
||||||
|
|
||||||
|
Для дискового хранилища с файловой системой:
|
||||||
|
|
||||||
|
1. На дисковом хранилище создаем один раздел максимального размера и файловую систему ext4, которую подключаем к директории test1..
|
||||||
|
|
||||||
|
2. Запускаем копирование большого файла (несколько десятков ГБ) в директорию test1.
|
||||||
|
|
||||||
|
3. Извлекаем из сервера один из накопителей. Отслеживаем статус дискового хранилища и наблюдаем за BMC сервера на предмет появления уведомлений и создания записей в системном журнале.
|
||||||
|
|
||||||
|
4. Контролируем процесс перестроения дискового хранилища, если есть свободный накопитель в сервере (Global Hot Spare), и отслеживаем скорость копирования файла.
|
||||||
|
|
||||||
|
5. Если используем дисковое хранилище с уровнем резервирования RAID6 или RAID10, извлекаем второй накопитель из сервера.
|
||||||
|
|
||||||
|
6. После перестроения дискового хранилища и окончания копирования файла устанавливаем накопители обратно. Отслеживаем статус всех накопителей, а также наблюдаем за BMC сервера, как описано в пункте 3.
|
||||||
|
|
||||||
|
7. Вычисляем и сравниваем контрольные суммы файла-источника и скопированного файла.
|
||||||
|
|
||||||
|
8. При необходимости через BMC или с помощью утилиты StorCLI в ОС удаляем стороннюю конфигурацию на установленных накопителях с последующим изменением статусов установленных накопителей.
|
||||||
|
|
||||||
|
9. После второго перестроения дискового хранилища отслеживаем статус и состав дискового хранилища, а также статус самих накопителей.
|
||||||
|
|
||||||
|
Критерии выполнения теста
|
||||||
|
|
||||||
|
Дисковое хранилище без файловой системы
|
||||||
|
|
||||||
|
· Работа утилиты FIO не прерывалась во время тестирования, и дисковое хранилище было постоянно доступно на чтение и запись.
|
||||||
|
|
||||||
|
· Сработала автоматическая замена извлеченного накопителя на резервный (Global Hot Spare).
|
||||||
|
|
||||||
|
· Дисковое хранилище успешно выполнило все перестроения.
|
||||||
|
|
||||||
|
· Возврат к начальной конфигурации дискового хранилища (состав и статус накопителей) происходит без перезагрузки сервера.
|
||||||
|
|
||||||
|
Дисковое хранилище с файловой системой
|
||||||
|
|
||||||
|
· Файловая система на дисковом хранилище была доступна на протяжении всего времени тестирования.
|
||||||
|
|
||||||
|
· Копирование файла завершилось без прерываний.
|
||||||
|
|
||||||
|
· Сработала автоматическая замена извлеченного накопителя на резервный (Global Hot Spare).
|
||||||
|
|
||||||
|
· Дисковое хранилище успешно выполнило все перестроения.
|
||||||
|
|
||||||
|
· Контрольные суммы файла-источника и скопированного файла остались одинаковыми.
|
||||||
|
|
||||||
|
· Конфигурация дискового хранилища (состав и статус накопителей) вернулась в начальное состояние без перезагрузки сервера.
|
||||||
|
|
||||||
|
## Тестирование сетевых интерфейсов и пропускной способности
|
||||||
|
|
||||||
|
Для тестирования сетевых интерфейсов на потребуется приемник трафика. Приемник должен обладать достаточной пропускной способностью и иметь возможность запускать утилиту iperf3. То есть для интерфейса скоростью 10 Гбит\с у приемника должен быть такой же по скорости интерфейс.
|
||||||
|
|
||||||
|
При подключении интерфейса должна загораться индикация на нем. На интерфейсах и приемнике настраиваем ip адреса. Тестируемый интерфейс и приемник должны обладать сетевой связностью. Пропингуем интерфейс с приёмника. Он должен быть доступен и передавать пакеты без потерь.
|
||||||
|
|
||||||
|
|
||||||
|
Для тестирования пропускной способности сети воспользуемся утилитой iperf3.
|
||||||
|
|
||||||
|
На приемнике запускаем утилиту iperf3 –s
|
||||||
|
|
||||||
|
-s Запуск в режиме сервера. В данном режиме машина принимает трафик по порту 5201
|
||||||
|
|
||||||
|
На тестируемом сервере так же запускаем утилиту iperf3
|
||||||
|
|
||||||
|
iperf3 -c (ip адрес приемника) -t 1800 -f g -P 20
|
||||||
|
|
||||||
|
-с Запуск в режиме клиента с указанием ip адреса сервера
|
||||||
|
|
||||||
|
-t Время работы утилиты
|
||||||
|
|
||||||
|
-f формат вывода пропускной способности k, m, g килобиты, мегабиты, гигабиты. K, M, G килобайты, мегабайты, гигабайты
|
||||||
|
|
||||||
|
-P Количество потоков генерации трафика.
|
||||||
|
|
||||||
|
Значение ключа –P требуется подобрать такое что бы утилизация интерфеса была максимальная.
|
||||||
|
|
||||||
|
Критерии выполнения теста:
|
||||||
|
|
||||||
|
· Сетевые интерфейсы включатся и имеют индикацию
|
||||||
|
|
||||||
|
· Между приемником и передатчиком ходят пакеты
|
||||||
|
|
||||||
|
· Пропускная способность интерфейса во время теста больше 90 % от заявленной производителем
|
||||||
@@ -0,0 +1,11 @@
|
|||||||
|
|
||||||
|
Что требуется для сдачи юнита стойки в аренду
|
||||||
|
1) Стойка 1U + розетка
|
||||||
|
2) Питание + резерв -> проблема управления питанием и мониторинга его потребления (Сколько максимальный объем питания на 1 БП? На 1 сервер?)
|
||||||
|
3) Охлаждение
|
||||||
|
4) IP Адреса -> Проблема подключения и портов (сколько ip адресов? Сколько портов подключения? Какой гарантированный канал? Порт IPMI дается ли? какой у него канал? )
|
||||||
|
5) Контроль доступа ?
|
||||||
|
6) Суммарный трафик?
|
||||||
|
7) Топология сети?
|
||||||
|
8) Автоматизация?
|
||||||
|
9) Биллинг?
|
||||||
@@ -0,0 +1,16 @@
|
|||||||
|
#note #error #ILO
|
||||||
|
|
||||||
|
Текст ошибки
|
||||||
|
iLO Self-Test reports a problem with: Embedded Flash/SD-CARD
|
||||||
|
Такая ошибка возникает при использовании ILO4 на серверах HP DL360 G9. Это впаянная SD карта. Из за большокго количество операций чтения записи карта кораптится. Для сброса ошибки требуется отформатировать карту и перезагрузить сервер.
|
||||||
|
Для форматирования карты заходим в ILO с правами администратора. Видим ошибку в категории
|
||||||
|
Status
|
||||||
|
ILO Health Degraded
|
||||||
|
Кликаем на ILO Health, открывается окно диагностики.
|
||||||
|
![[Pasted image 20250502153656.png]]
|
||||||
|
Пробуем перезагрузить ILO
|
||||||
|
![[Pasted image 20250502153811.png]]
|
||||||
|
Если это не помогло, то кликаем на ILO Health на окне диагностики и нажимаем кнопку форматирования Флеш карты
|
||||||
|
![[Pasted image 20250502154443.png]]
|
||||||
|
Если кнопка не активна то это другая проблема, требуется погуглить
|
||||||
|
|
||||||
@@ -0,0 +1,31 @@
|
|||||||
|
#note #RAID #firmware
|
||||||
|
Для обновления прошивки нам нужна утилита для управления рейдом из ОС или ILO.
|
||||||
|
[[Установка утилиты для управление рейдом]]
|
||||||
|
Они нужны для того что бы узнать текущую версию прошивки и надо ли вообще обновляться
|
||||||
|
Найти прошивку нужно на сайте поддержки HP.
|
||||||
|
https://support.hpe.com/connect/s/softwaredetails?language=en_US&softwareId=MTX_26880c85fb3e4f5897e03283cc&tab=releaseNotes
|
||||||
|
Для Debiana к сожалению готового пакета нет поэтому мы будем распаковывать RPM пакет для Red Hat Enterprise Linux 7.1
|
||||||
|
Выберем в меню нужные параметры и получим ссылку на скачивание.
|
||||||
|
![[Pasted image 20250502234053.png]]
|
||||||
|
Установим пакет rpm2cpio для распаковки rpm-пакета
|
||||||
|
```
|
||||||
|
apt install rpm2cpio
|
||||||
|
```
|
||||||
|
После установки скачаем прошивку по ссылке с сайта HP
|
||||||
|
Распаковываем
|
||||||
|
```
|
||||||
|
rpm2cpio firmware-smartarray-ea3138d8e8-7.20-1.1.x86_64.rpm | cpio -id
|
||||||
|
```
|
||||||
|
|
||||||
|
Переходим в директорию с прошивкой
|
||||||
|
```
|
||||||
|
cd /usr/lib/x86_64-linux-gnu/firmware-smartarray-ea3138d8e8-7.20-1.1
|
||||||
|
```
|
||||||
|
|
||||||
|
И запускаем скрипт установки
|
||||||
|
```
|
||||||
|
./setup
|
||||||
|
```
|
||||||
|
|
||||||
|
Скрипт предложит ввести цифру с нужным нам Рейд контроллером
|
||||||
|
После завершения требуется перезагрузить компьютер
|
||||||
@@ -0,0 +1,74 @@
|
|||||||
|
#note #raid #utils
|
||||||
|
Все действия выполняются на ОС Proxmox 8.4 (Debian). Рейд контроллер P440ar на сервере HP Dl 360 G9
|
||||||
|
Для установки утилиты требуется ее скачать или закинуть из файлопомойки на сервер
|
||||||
|
Скачиваем утилиту
|
||||||
|
```
|
||||||
|
wget https://downloads.linux.hpe.com/sdr/repo/mcp/pool/non-free/hpssacli-2.40-13.0_amd64.deb
|
||||||
|
```
|
||||||
|
|
||||||
|
Устанавливаем пакет
|
||||||
|
```
|
||||||
|
dpkg -i hpssacli-2.40-13.0_amd64.deb
|
||||||
|
```
|
||||||
|
Далее мы можем использовать команды:
|
||||||
|
|
||||||
|
Посмотреть статус контроллера
|
||||||
|
```
|
||||||
|
hpssacli ctrl all show status
|
||||||
|
```
|
||||||
|
Статус покажет текущее состояние контроллера и его слот
|
||||||
|
Далее мы будем использовать параметр слота в качестве указателя для дальнейших команд
|
||||||
|
Посмотреть физические диски
|
||||||
|
```
|
||||||
|
hpssacli ctrl slot=0 pd all show status
|
||||||
|
```
|
||||||
|
Посмотрев диски можно узнать их расположение в сервере вида
|
||||||
|
```
|
||||||
|
physicaldrive 1I:1:1 (port 1I:box 1:bay 1, 300 GB): OK
|
||||||
|
```
|
||||||
|
Указывается что это физический диск находящийся в порте 1i в боксе 1 слоте 1
|
||||||
|
Эти данные понадобиться нам для дальнейшей настройки
|
||||||
|
|
||||||
|
Посмотреть логические диски
|
||||||
|
```
|
||||||
|
hpssacli ctrl slot=0 ld all show status
|
||||||
|
```
|
||||||
|
|
||||||
|
Полная информация по контроллеру
|
||||||
|
```
|
||||||
|
hpssacli ctrl all show detail
|
||||||
|
```
|
||||||
|
Собрать рейд
|
||||||
|
```
|
||||||
|
hpssacli ctrl slot=0 create type=ld drives=1I:1:3 raid=0 stripsize=16
|
||||||
|
```
|
||||||
|
Указываем контроллер в нужном слоте. Указываем тип логический диск кеазываем через запятую диски в формате порт:бокс:слот. Указываем уровень рейда и размер страйпа.
|
||||||
|
Страйп это блок данных который записывается за одну итерацию IO. Для больших файлов лучше большой блок, для маленьких маленький.
|
||||||
|
Размеры страйпов бывают:
|
||||||
|
8
|
||||||
|
16
|
||||||
|
32
|
||||||
|
64
|
||||||
|
128
|
||||||
|
256
|
||||||
|
512
|
||||||
|
1024
|
||||||
|
Лучше всего смотреть в спеках рейд котроллера.
|
||||||
|
Для удаления рейда
|
||||||
|
```
|
||||||
|
hpssacli ctrl slot=0 logicaldrive 2 delete
|
||||||
|
```
|
||||||
|
Так же указываем контроллер, какой логический диск и команду удалить. Если диск используется из ОС, то он не даст его удалить.
|
||||||
|
|
||||||
|
Включения кеша контроллера при работе с SSD.
|
||||||
|
Отключаем функцию SSDSmartPath.
|
||||||
|
Это функция позволяет увеличить производительность дисков при большом их количестве, так как кеш маленький по размеру. При малом количестве дисков следует включить кеш контроллера для увеличения производительности.
|
||||||
|
Эти функции надо включить и перевести систему в ХБА режим если мы планируем строить SDS
|
||||||
|
```
|
||||||
|
hpssacli ctrl slot=2 array A modify ssdsmartpath=disable
|
||||||
|
```
|
||||||
|
Выбираем слот контроллера и какой массив будем использовать
|
||||||
|
|
||||||
|
```
|
||||||
|
hpssacli ctrl slot=2 logicaldrive 1 modify arrayaccelerator=enable
|
||||||
|
```
|
||||||
@@ -0,0 +1,8 @@
|
|||||||
|
#network #stp
|
||||||
|
## STP
|
||||||
|
Протокол STP и иные его реализации служит для предотвращения появления петель в топологии и широковещательного шторма.
|
||||||
|
Такое может случиться из за избыточных линков по которым будут ходит и размножаться широковещательные запросы
|
||||||
|
Для разрыва колец Замкнутая топология приобретает как бы вид дерева путем блокирования избыточных линков.
|
||||||
|
Принцип работы:
|
||||||
|
- Выбирается Корневой коммутатор. Процесс выбора корневого коммутаторы может быть ручным или автоматическим. В автоматическом режиме выбирается коммутатор с наименьшим MAC адресом. **Это влечет за собой проблемы так как наименьший мак у самого старого оборудования!**
|
||||||
|
-
|
||||||
@@ -0,0 +1,8 @@
|
|||||||
|
|
||||||
|
Порты маркируем в соответствии со стандартом ОТКУДА Стойка Юнит Порт - КУДА Стойка Юнит Порт
|
||||||
|
Для блейд серверов и маршрутизаторов добавляется обозначение B (Bay) оно же лезвие. Номер лезвия указывается на корзине и на маркировке
|
||||||
|
Порты считаем слева направо сверху вниз если не указаны специальные обозначения
|
||||||
|
3 5 7
|
||||||
|
1 2 4 6 8
|
||||||
|
Если специальные обозначение есть (тип LAN1 или ETH1) то ориентируемся по ним
|
||||||
|
Порты IPMI (ilo, iDRAC, Irmc) не считаем и указываем их как менеджмент порты отдельно
|
||||||
@@ -0,0 +1,5 @@
|
|||||||
|
#мысли
|
||||||
|
Ну какую то сверх очевидную базу я знаю.
|
||||||
|
Темы которые следует поизучать подробнее это ВПН, маршрутизация, БГП
|
||||||
|
БГП вообще 10 раз читал ниче не понял
|
||||||
|
С впном пока надо повременить и отрисовать архитектуру
|
||||||
@@ -0,0 +1,81 @@
|
|||||||
|
#note #network #sfp
|
||||||
|
У нас все оборудование цисковсвкое. Кароточки тоже хуй пойми какие.
|
||||||
|
Посчитаем сколько всего надо:
|
||||||
|
6 серверов RJ45 (2 порта) 24
|
||||||
|
2 сервера SFP+ (2 порта) 8
|
||||||
|
1 СХД SFP+ (4 порта) 8
|
||||||
|
Подключение идет с 2-х сторон
|
||||||
|
Итого:
|
||||||
|
24 RJ4 Пример ASF-10G-T 10Gteck
|
||||||
|
16 SFP+
|
||||||
|
|
||||||
|
Пересчет
|
||||||
|
6 серверов RJ45 по 2 порта = 12 штук
|
||||||
|
5 серверов SFP+ по 2 порта =20 штук
|
||||||
|
1 схд 4 портов rj45 = 4 штуки (4 было в комплекте они уже есть)
|
||||||
|
Запас? 4 RJ45
|
||||||
|
Итого
|
||||||
|
16 RJ45
|
||||||
|
24 SFP+
|
||||||
|
|
||||||
|
|
||||||
|
Чисто теоретически заведутся все СФП. Практически а хуй его знает.
|
||||||
|
|
||||||
|
Точно рабочие
|
||||||
|
ASF-10G-T 10Gteck
|
||||||
|
|
||||||
|
Lenovo AFBR-709SMZ-ib8
|
||||||
|
ARISTA XVR-00001-02
|
||||||
|
Huawei LTF8501-BC+ 02310MNW
|
||||||
|
Текст письма
|
||||||
|
|
||||||
|
Здравствуйте. Для организации высокоскоростного подключения к хранилищу базы данных системы мониторинга PDU требуется SFP модули. Для обеспечения отказоустойчивости и совместимости серверов требуется закупить:
|
||||||
|
24 модуля SFP ASF-10G-T 10Gteck или аналогичные
|
||||||
|
16 модулей SFP Lenovo AFBR-709SMZ-ib8, ARISTA XVR-00001-02, Huawei LTF8501-BC+ 02310MNW или аналогичных
|
||||||
|
|
||||||
|
|
||||||
|
|
||||||
|
Отчет о своместимости SFP
|
||||||
|
HPE 10GB SR SFP+ 455885-001
|
||||||
|
SN 7CR909N16K
|
||||||
|
Ядро сети Работает
|
||||||
|
HP NIC Работает
|
||||||
|
Eonstore DS1012 Работает
|
||||||
|
|
||||||
|
Lenovo AFBR-709SMZ-ib8
|
||||||
|
pn\sn 46c3448 Y050UC0C6FD0
|
||||||
|
(Хпшеная в ленову работает)
|
||||||
|
Ядро сети (Работает)
|
||||||
|
from core to HP DL360G9 SFP+ card Работает
|
||||||
|
Eonstore DS1012 Работает
|
||||||
|
HP NIC (работает)
|
||||||
|
|
||||||
|
ARISTA XVR-00001-02
|
||||||
|
Sn XAP1114T3654
|
||||||
|
Ленова в аристу работает
|
||||||
|
Ариста в Хп работает
|
||||||
|
Ядро сети (Работает)
|
||||||
|
HP NIC (работает)
|
||||||
|
Eonstore DS1012 Работает
|
||||||
|
|
||||||
|
Huawei LTF8501-BC+ 02310MNW
|
||||||
|
Sn J265A000290
|
||||||
|
Ядро сети (Работает)
|
||||||
|
Хуавей в аристу работает
|
||||||
|
Хуавей в ленову +
|
||||||
|
Хуавей в ХП +
|
||||||
|
HP NIC (работает)
|
||||||
|
Eonstore DS1012 Работает
|
||||||
|
|
||||||
|
Оптические трансиверы
|
||||||
|
СХД 8 Шт
|
||||||
|
Сервера HP 8 Шт
|
||||||
|
Сервера оракл 12 Шт
|
||||||
|
Rj45 трансиверы 16 ШТ
|
||||||
|
|
||||||
|
|
||||||
|
Карточки куда идет
|
||||||
|
деллы BCM57416 NetXtreme-E Dual-Media 10G RDMA Ethernet Controller (rev 01)
|
||||||
|
ХП rj54 Intel Corporation Ethernet Controller 10-Gigabit X540-AT2 (rev 01)
|
||||||
|
SFP+ карточки HP NC550SFP Dual Port 10Gbe Server adapter
|
||||||
|
Лезвие ядра сети Cisco C6800-32P10G
|
||||||
@@ -0,0 +1,2 @@
|
|||||||
|
#links #notes
|
||||||
|
[https://github.com/awesome-selfhosted/awesome-selfhosted?tab=readme-ov-file#automation](https://github.com/awesome-selfhosted/awesome-selfhosted?tab=readme-ov-file#automation)
|
||||||
@@ -0,0 +1,144 @@
|
|||||||
|
|
||||||
|
конфиг
|
||||||
|
[fiotest]
|
||||||
|
rw=write
|
||||||
|
name=fiotest
|
||||||
|
blocksize=8k
|
||||||
|
filename=/mnt/pve/test/write
|
||||||
|
size=1g
|
||||||
|
ioengine=libaio
|
||||||
|
iodepth=128
|
||||||
|
numjobs=1
|
||||||
|
runtime=60
|
||||||
|
direct=1
|
||||||
|
|
||||||
|
Результат
|
||||||
|
fiotest: (g=0): rw=write, bs=(R) 4096B-4096B, (W) 4096B-4096B, (T) 4096B-4096B, ioengine=libaio, iodepth=1
|
||||||
|
fio-3.28
|
||||||
|
Starting 1 process
|
||||||
|
fiotest: Laying out IO file (1 file / 1024MiB)
|
||||||
|
^Cbs: 1 (f=1): [W(1)][33.3%][w=1001KiB/s][w=250 IOPS][eta 00m:40s]
|
||||||
|
fio: terminating on signal 2
|
||||||
|
|
||||||
|
fiotest: (groupid=0, jobs=1): err= 0: pid=2515: Sat May 3 00:11:44 2025
|
||||||
|
write: IOPS=306, BW=1227KiB/s (1257kB/s)(24.2MiB/20224msec); 0 zone resets
|
||||||
|
slat (nsec): min=9129, max=61388, avg=11072.73, stdev=2469.71
|
||||||
|
clat (usec): min=1575, max=237505, avg=3247.15, stdev=5187.99
|
||||||
|
lat (usec): min=1585, max=237546, avg=3258.36, stdev=5188.33
|
||||||
|
clat percentiles (usec):
|
||||||
|
| 1.00th=[ 1745], 5.00th=[ 1909], 10.00th=[ 2008], 20.00th=[ 2180],
|
||||||
|
| 30.00th=[ 2311], 40.00th=[ 2442], 50.00th=[ 2573], 60.00th=[ 2737],
|
||||||
|
| 70.00th=[ 2966], 80.00th=[ 3294], 90.00th=[ 4228], 95.00th=[ 5866],
|
||||||
|
| 99.00th=[ 11994], 99.50th=[ 16319], 99.90th=[ 90702], 99.95th=[103285],
|
||||||
|
| 99.99th=[238027]
|
||||||
|
bw ( KiB/s): min= 672, max= 1888, per=99.49%, avg=1221.60, stdev=244.70, samples=40
|
||||||
|
iops : min= 168, max= 472, avg=305.40, stdev=61.18, samples=40
|
||||||
|
lat (msec) : 2=9.88%, 4=78.65%, 10=9.69%, 20=1.50%, 50=0.10%
|
||||||
|
lat (msec) : 100=0.11%, 250=0.08%
|
||||||
|
cpu : usr=0.17%, sys=0.29%, ctx=6206, majf=0, minf=12
|
||||||
|
IO depths : 1=100.0%, 2=0.0%, 4=0.0%, 8=0.0%, 16=0.0%, 32=0.0%, >=64=0.0%
|
||||||
|
submit : 0=0.0%, 4=100.0%, 8=0.0%, 16=0.0%, 32=0.0%, 64=0.0%, >=64=0.0%
|
||||||
|
complete : 0=0.0%, 4=100.0%, 8=0.0%, 16=0.0%, 32=0.0%, 64=0.0%, >=64=0.0%
|
||||||
|
issued rwts: total=0,6205,0,0 short=0,0,0,0 dropped=0,0,0,0
|
||||||
|
latency : target=0, window=0, percentile=100.00%, depth=1
|
||||||
|
|
||||||
|
Run status group 0 (all jobs):
|
||||||
|
WRITE: bw=1227KiB/s (1257kB/s), 1227KiB/s-1227KiB/s (1257kB/s-1257kB/s), io=24.2MiB (25.4MB), run=20224-20224msec
|
||||||
|
|
||||||
|
Disk stats (read/write):
|
||||||
|
dm-0: ios=54/8018, merge=0/0, ticks=636/27836, in_queue=28472, util=97.85%, aggrios=54/7434, aggrmerge=0/861, aggrticks=638/24232, aggrin_queue=24906, aggrutil=97.59%
|
||||||
|
sda: ios=54/7434, merge=0/861, ticks=638/24232, in_queue=24906, util=97.59%
|
||||||
|
|
||||||
|
Конфиг
|
||||||
|
[fiotest]
|
||||||
|
rw=write
|
||||||
|
name=fiotest
|
||||||
|
blocksize=8k
|
||||||
|
filename=/mnt/pve/test/write
|
||||||
|
size=1g
|
||||||
|
ioengine=libaio
|
||||||
|
iodepth=32
|
||||||
|
numjobs=1
|
||||||
|
runtime=60
|
||||||
|
direct=1
|
||||||
|
|
||||||
|
Результат
|
||||||
|
fiotest: (g=0): rw=write, bs=(R) 8192B-8192B, (W) 8192B-8192B, (T) 8192B-8192B, ioengine=libaio, iodepth=32
|
||||||
|
fio-3.28
|
||||||
|
Starting 1 process
|
||||||
|
Jobs: 1 (f=1): [W(1)][100.0%][w=11.0MiB/s][w=1409 IOPS][eta 00m:00s]
|
||||||
|
fiotest: (groupid=0, jobs=1): err= 0: pid=3588: Sat May 3 00:16:19 2025
|
||||||
|
write: IOPS=1530, BW=12.0MiB/s (12.5MB/s)(718MiB/60022msec); 0 zone resets
|
||||||
|
slat (usec): min=3, max=141739, avg=94.73, stdev=1480.44
|
||||||
|
clat (msec): min=2, max=262, avg=20.81, stdev=14.28
|
||||||
|
lat (msec): min=2, max=262, avg=20.91, stdev=14.27
|
||||||
|
clat percentiles (msec):
|
||||||
|
| 1.00th=[ 4], 5.00th=[ 8], 10.00th=[ 12], 20.00th=[ 14],
|
||||||
|
| 30.00th=[ 16], 40.00th=[ 17], 50.00th=[ 18], 60.00th=[ 20],
|
||||||
|
| 70.00th=[ 23], 80.00th=[ 26], 90.00th=[ 33], 95.00th=[ 40],
|
||||||
|
| 99.00th=[ 69], 99.50th=[ 95], 99.90th=[ 203], 99.95th=[ 226],
|
||||||
|
| 99.99th=[ 247]
|
||||||
|
bw ( KiB/s): min= 5584, max=17216, per=99.85%, avg=12226.15, stdev=2529.45, samples=119
|
||||||
|
iops : min= 698, max= 2152, avg=1528.27, stdev=316.18, samples=119
|
||||||
|
lat (msec) : 4=1.24%, 10=6.83%, 20=52.96%, 50=36.68%, 100=1.86%
|
||||||
|
lat (msec) : 250=0.43%, 500=0.01%
|
||||||
|
cpu : usr=0.48%, sys=1.47%, ctx=68734, majf=0, minf=10
|
||||||
|
IO depths : 1=0.1%, 2=0.1%, 4=0.1%, 8=0.1%, 16=0.1%, 32=100.0%, >=64=0.0%
|
||||||
|
submit : 0=0.0%, 4=100.0%, 8=0.0%, 16=0.0%, 32=0.0%, 64=0.0%, >=64=0.0%
|
||||||
|
complete : 0=0.0%, 4=100.0%, 8=0.0%, 16=0.0%, 32=0.1%, 64=0.0%, >=64=0.0%
|
||||||
|
issued rwts: total=0,91862,0,0 short=0,0,0,0 dropped=0,0,0,0
|
||||||
|
latency : target=0, window=0, percentile=100.00%, depth=32
|
||||||
|
|
||||||
|
Run status group 0 (all jobs):
|
||||||
|
WRITE: bw=12.0MiB/s (12.5MB/s), 12.0MiB/s-12.0MiB/s (12.5MB/s-12.5MB/s), io=718MiB (753MB), run=60022-60022msec
|
||||||
|
|
||||||
|
Disk stats (read/write):
|
||||||
|
dm-0: ios=126/98119, merge=0/0, ticks=3940/1857428, in_queue=1861368, util=99.31%, aggrios=126/96396, aggrmerge=0/2709, aggrticks=3928/1803591, aggrin_queue=1807713, aggrutil=99.23%
|
||||||
|
sda: ios=126/96396, merge=0/2709, ticks=3928/1803591, in_queue=1807713, util=99.23%
|
||||||
|
|
||||||
|
конфиг
|
||||||
|
[fiotest]
|
||||||
|
rw=write
|
||||||
|
name=fiotest
|
||||||
|
blocksize=8k
|
||||||
|
filename=/mnt/pve/test/write
|
||||||
|
size=1g
|
||||||
|
ioengine=libaio
|
||||||
|
iodepth=1
|
||||||
|
numjobs=1
|
||||||
|
runtime=60
|
||||||
|
direct=1
|
||||||
|
|
||||||
|
Результат
|
||||||
|
fiotest: (g=0): rw=write, bs=(R) 8192B-8192B, (W) 8192B-8192B, (T) 8192B-8192B, ioengine=libaio, iodepth=1
|
||||||
|
fio-3.28
|
||||||
|
Starting 1 process
|
||||||
|
Jobs: 1 (f=1): [W(1)][100.0%][w=1632KiB/s][w=204 IOPS][eta 00m:00s]
|
||||||
|
fiotest: (groupid=0, jobs=1): err= 0: pid=3616: Sat May 3 00:18:47 2025
|
||||||
|
write: IOPS=282, BW=2258KiB/s (2312kB/s)(132MiB/60002msec); 0 zone resets
|
||||||
|
slat (usec): min=6, max=42146, avg=91.13, stdev=759.96
|
||||||
|
clat (usec): min=1609, max=285038, avg=3450.64, stdev=5465.66
|
||||||
|
lat (usec): min=1617, max=285046, avg=3541.91, stdev=5565.78
|
||||||
|
clat percentiles (usec):
|
||||||
|
| 1.00th=[ 1778], 5.00th=[ 1909], 10.00th=[ 2008], 20.00th=[ 2147],
|
||||||
|
| 30.00th=[ 2278], 40.00th=[ 2409], 50.00th=[ 2573], 60.00th=[ 2802],
|
||||||
|
| 70.00th=[ 3130], 80.00th=[ 3916], 90.00th=[ 5407], 95.00th=[ 6980],
|
||||||
|
| 99.00th=[ 11338], 99.50th=[ 16581], 99.90th=[ 83362], 99.95th=[124257],
|
||||||
|
| 99.99th=[238027]
|
||||||
|
bw ( KiB/s): min= 656, max= 3552, per=100.00%, avg=2266.08, stdev=760.91, samples=119
|
||||||
|
iops : min= 82, max= 444, avg=283.26, stdev=95.11, samples=119
|
||||||
|
lat (msec) : 2=9.96%, 4=70.89%, 10=17.68%, 20=1.12%, 50=0.21%
|
||||||
|
lat (msec) : 100=0.08%, 250=0.06%, 500=0.01%
|
||||||
|
cpu : usr=0.12%, sys=0.26%, ctx=17491, majf=0, minf=12
|
||||||
|
IO depths : 1=100.0%, 2=0.0%, 4=0.0%, 8=0.0%, 16=0.0%, 32=0.0%, >=64=0.0%
|
||||||
|
submit : 0=0.0%, 4=100.0%, 8=0.0%, 16=0.0%, 32=0.0%, 64=0.0%, >=64=0.0%
|
||||||
|
complete : 0=0.0%, 4=100.0%, 8=0.0%, 16=0.0%, 32=0.0%, 64=0.0%, >=64=0.0%
|
||||||
|
issued rwts: total=0,16936,0,0 short=0,0,0,0 dropped=0,0,0,0
|
||||||
|
latency : target=0, window=0, percentile=100.00%, depth=1
|
||||||
|
|
||||||
|
Run status group 0 (all jobs):
|
||||||
|
WRITE: bw=2258KiB/s (2312kB/s), 2258KiB/s-2258KiB/s (2312kB/s-2312kB/s), io=132MiB (139MB), run=60002-60002msec
|
||||||
|
|
||||||
|
Disk stats (read/write):
|
||||||
|
dm-0: ios=220/23472, merge=0/0, ticks=2652/93376, in_queue=96028, util=97.68%, aggrios=220/21785, aggrmerge=0/2623, aggrticks=2622/79363, aggrin_queue=82138, aggrutil=97.58%
|
||||||
|
sda: ios=220/21785, merge=0/2623, ticks=2622/79363, in_queue=82138, util=97.58%
|
||||||
@@ -0,0 +1 @@
|
|||||||
|
Замеры производительности дисков DC600M Enterprise. Диски подключены в сервер HP DL360 G9 в рейд контроллер P440ar и собраны в одиночный RAID 0 без включения кеша контроллера.
|
||||||
@@ -0,0 +1,20 @@
|
|||||||
|
#note #storage #disk
|
||||||
|
Для базы данных нам требуется быстрые диски. Не столько важна пропускная способность сколько IO диска. Так как мы часто выполняем и чтение и запись маленьким блоком.
|
||||||
|
Обязательное условие это Энтерпрайз диски для ДЦ так как содержат конденсаторы.
|
||||||
|
Мы можем установить не более 4-х дисков на сервер (sas) и 8-и дисков (sata), так как упремся в пропускную способность интерфейса, а кеши медленные. Можно купить переходник для NVME дисков, но есть подводные на количество линий и возможности бифуркации PCI-e слота. Чисто теоретически можно заказать U.2 HBA модуль для линий 16x на 4 диска и протянуть кабеля до бекплейна, а потом приколхозить их. Тогда мы упираемся в производительность сети. Джае 10ГБ\с канал не покроет мощность NVME дисков
|
||||||
|
|
||||||
|
Желаемый диск 2Тб
|
||||||
|
SSD Samsung PM1643a <MZILT1T9HBJR>
|
||||||
|
|
||||||
|
Возможный бомж вариант 2Тб
|
||||||
|
SSD Samsung PM897 <MZ7L31T9HBNA-00A07>
|
||||||
|
|
||||||
|
Альтернативный вендор 2Тб
|
||||||
|
SSD Intel D3-S4620 <SSDSC2KG019TZ01>
|
||||||
|
|
||||||
|
Текст письма
|
||||||
|
Здравствуйте. В связи с проблемами производительности хранилища для базы данных мониторинга электропотребления PDU, требуется закупить SSD диски
|
||||||
|
|
||||||
|
Здравствуйте. Для организации высокопроизводительного хранилища базы данных мониторинга электропотребления PDU требуется закупить SSD диски. Высокопроизводительное хранилище требуется так как текущее хранилище не справляется с возросшей нагрузкой.
|
||||||
|
Для организации отказоустойчивости требуется что бы каждый сервер в количестве 8 штук был оснащен SSD дисками. Минимальное количество дисков 2-шт на сервер.
|
||||||
|
Таким образом требуется 16 дисков SSD Samsung PM1643a <MZILT1T9HBJR> или аналогичных.
|
||||||
@@ -0,0 +1,977 @@
|
|||||||
|
|
||||||
|
[Открыть главное меню](https://yourcmc.ru/wiki/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:%D0%9C%D0%BE%D0%B1%D0%B8%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D0%BC%D0%B5%D0%BD%D1%8E "Открыть главное меню")
|
||||||
|
|
||||||
|
- Наблюдать за этой страницей
|
||||||
|
|
||||||
|
# Производительность Ceph
|
||||||
|
|
||||||
|
Ссылки сюда (2) →
|
||||||
|
|
||||||
|
[](https://yourcmc.ru/wiki/%D0%A4%D0%B0%D0%B9%D0%BB:Ceph-funnel.svg)
|
||||||
|
|
||||||
|
Ceph — это SDS (по-русски — программная СХД), которая по некоторым параметрам является уникальной в своём роде, и в целом, умеет очень многое — S3, диски виртуалок, кластерную FS + огромный багаж дополнительных фич.
|
||||||
|
|
||||||
|
И всё было бы хорошо — бери, ставь, запускай своё облако и руби бабло — если бы не один маленький нюанс: ПРОИЗВОДИТЕЛЬНОСТЬ. Терять 95 % производительности в Production-е разумным людям обычно жалко. «Облакам» типа AWS, GCP, Яндекса, по-видимому, не жалко — у них тоже собственные крафтовые SDS и они тоже тормозят примерно так же :-) но этот вопрос оставим — кто мы такие, чтобы их судить.
|
||||||
|
|
||||||
|
В данной статье описано, каких показателей производительности можно добиться от цефа и как. Если вкратце, то примерным ориентиром служит доклад Nick Fisk «Low-Latency Ceph», в его исполнении Low Latency это 0.7 мс (на запись). Лучший результат с Ceph-ом получить практически невозможно (худший — легко). При этом 0.7 мс — это всего лишь примерно ~1500 iops в 1 поток. На чтение в идеальной ситуации можно получить где-то раза в 2 больше, то есть где-то до 3000 iops в 1 поток.
|
||||||
|
|
||||||
|
Для сравнения: любой самый дешёвый серверный SSD-диск раз в 10 быстрее, средний порядок задержки SSD на запись — 0.01-0.04 мс, на чтение — 0.1 мс.
|
||||||
|
|
||||||
|
**UPDATE: Догнать (почти догнать) SDS-кой локальной диск можно, я это сделал в своём собственном проекте — Vitastor: [https://vitastor.io](https://vitastor.io/) :-) это блочная SDS с архитектурой, похожей на Ceph, но при этом БЫСТРАЯ — в тесте на SATA SSD кластере задержка и чтения, и записи составила 0.14 мс. На том же кластере задержка записи у Ceph была 1 мс, а чтения — 0.57 мс. Детали в [README](https://yourcmc.ru/git/vitalif/vitastor/src/branch/master/README.md) — смотрите по ссылке.**
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Содержание
|
||||||
|
|
||||||
|
- [Бенчмаркинг](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.91.D0.B5.D0.BD.D1.87.D0.BC.D0.B0.D1.80.D0.BA.D0.B8.D0.BD.D0.B3)
|
||||||
|
- [Тестирование дисков](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A2.D0.B5.D1.81.D1.82.D0.B8.D1.80.D0.BE.D0.B2.D0.B0.D0.BD.D0.B8.D0.B5_.D0.B4.D0.B8.D1.81.D0.BA.D0.BE.D0.B2)
|
||||||
|
- [Лирическое отступление](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9B.D0.B8.D1.80.D0.B8.D1.87.D0.B5.D1.81.D0.BA.D0.BE.D0.B5_.D0.BE.D1.82.D1.81.D1.82.D1.83.D0.BF.D0.BB.D0.B5.D0.BD.D0.B8.D0.B5)
|
||||||
|
|
||||||
|
- [Тестирование кластера Ceph](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A2.D0.B5.D1.81.D1.82.D0.B8.D1.80.D0.BE.D0.B2.D0.B0.D0.BD.D0.B8.D0.B5_.D0.BA.D0.BB.D0.B0.D1.81.D1.82.D0.B5.D1.80.D0.B0_Ceph)
|
||||||
|
- [RBD](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#RBD)
|
||||||
|
|
||||||
|
- [Отдельные OSD](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9E.D1.82.D0.B4.D0.B5.D0.BB.D1.8C.D0.BD.D1.8B.D0.B5_OSD)
|
||||||
|
|
||||||
|
- [CephFS](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#CephFS)
|
||||||
|
|
||||||
|
- [S3 (rgw)](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#S3_.28rgw.29)
|
||||||
|
|
||||||
|
- [Что использовать не надо](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A7.D1.82.D0.BE_.D0.B8.D1.81.D0.BF.D0.BE.D0.BB.D1.8C.D0.B7.D0.BE.D0.B2.D0.B0.D1.82.D1.8C_.D0.BD.D0.B5_.D0.BD.D0.B0.D0.B4.D0.BE)
|
||||||
|
|
||||||
|
- [Про RBD и параллелизм](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.BE_RBD_.D0.B8_.D0.BF.D0.B0.D1.80.D0.B0.D0.BB.D0.BB.D0.B5.D0.BB.D0.B8.D0.B7.D0.BC)
|
||||||
|
|
||||||
|
- [Тестирование сети](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A2.D0.B5.D1.81.D1.82.D0.B8.D1.80.D0.BE.D0.B2.D0.B0.D0.BD.D0.B8.D0.B5_.D1.81.D0.B5.D1.82.D0.B8)
|
||||||
|
|
||||||
|
- [О транзакционности записи](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9E_.D1.82.D1.80.D0.B0.D0.BD.D0.B7.D0.B0.D0.BA.D1.86.D0.B8.D0.BE.D0.BD.D0.BD.D0.BE.D1.81.D1.82.D0.B8_.D0.B7.D0.B0.D0.BF.D0.B8.D1.81.D0.B8)
|
||||||
|
|
||||||
|
- [Конденсаторы](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9A.D0.BE.D0.BD.D0.B4.D0.B5.D0.BD.D1.81.D0.B0.D1.82.D0.BE.D1.80.D1.8B)
|
||||||
|
|
||||||
|
- [Bluestore vs Filestore](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#Bluestore_vs_Filestore)
|
||||||
|
- [Тест на 1 NVMe](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A2.D0.B5.D1.81.D1.82_.D0.BD.D0.B0_1_NVMe)
|
||||||
|
|
||||||
|
- [Про размер block.db](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.BE_.D1.80.D0.B0.D0.B7.D0.BC.D0.B5.D1.80_block.db)
|
||||||
|
|
||||||
|
- [RGW vs Minio](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#RGW_vs_Minio)
|
||||||
|
|
||||||
|
- [Снапшоты](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A1.D0.BD.D0.B0.D0.BF.D1.88.D0.BE.D1.82.D1.8B)
|
||||||
|
|
||||||
|
- [EC](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#EC)
|
||||||
|
- [Про вероятность потери данных](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.BE_.D0.B2.D0.B5.D1.80.D0.BE.D1.8F.D1.82.D0.BD.D0.BE.D1.81.D1.82.D1.8C_.D0.BF.D0.BE.D1.82.D0.B5.D1.80.D0.B8_.D0.B4.D0.B0.D0.BD.D0.BD.D1.8B.D1.85)
|
||||||
|
|
||||||
|
- [Контроллеры](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9A.D0.BE.D0.BD.D1.82.D1.80.D0.BE.D0.BB.D0.BB.D0.B5.D1.80.D1.8B)
|
||||||
|
|
||||||
|
- [Процессоры](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.BE.D1.86.D0.B5.D1.81.D1.81.D0.BE.D1.80.D1.8B)
|
||||||
|
|
||||||
|
- [Сеть](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A1.D0.B5.D1.82.D1.8C)
|
||||||
|
|
||||||
|
- [Настройка виртуалок и ФС](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9D.D0.B0.D1.81.D1.82.D1.80.D0.BE.D0.B9.D0.BA.D0.B0_.D0.B2.D0.B8.D1.80.D1.82.D1.83.D0.B0.D0.BB.D0.BE.D0.BA_.D0.B8_.D0.A4.D0.A1)
|
||||||
|
- [Драйвер виртуального диска и ФС](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.94.D1.80.D0.B0.D0.B9.D0.B2.D0.B5.D1.80_.D0.B2.D0.B8.D1.80.D1.82.D1.83.D0.B0.D0.BB.D1.8C.D0.BD.D0.BE.D0.B3.D0.BE_.D0.B4.D0.B8.D1.81.D0.BA.D0.B0_.D0.B8_.D0.A4.D0.A1)
|
||||||
|
|
||||||
|
- [cache=writeback](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#cache.3Dwriteback)
|
||||||
|
|
||||||
|
- [ФС](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A4.D0.A1)
|
||||||
|
|
||||||
|
- [Оценка производительности кластера](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9E.D1.86.D0.B5.D0.BD.D0.BA.D0.B0_.D0.BF.D1.80.D0.BE.D0.B8.D0.B7.D0.B2.D0.BE.D0.B4.D0.B8.D1.82.D0.B5.D0.BB.D1.8C.D0.BD.D0.BE.D1.81.D1.82.D0.B8_.D0.BA.D0.BB.D0.B0.D1.81.D1.82.D0.B5.D1.80.D0.B0)
|
||||||
|
|
||||||
|
- [Картина маслом «Тормозящий кэш»](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9A.D0.B0.D1.80.D1.82.D0.B8.D0.BD.D0.B0_.D0.BC.D0.B0.D1.81.D0.BB.D0.BE.D0.BC_.C2.AB.D0.A2.D0.BE.D1.80.D0.BC.D0.BE.D0.B7.D1.8F.D1.89.D0.B8.D0.B9_.D0.BA.D1.8D.D1.88.C2.BB)
|
||||||
|
- [O_SYNC vs fsync vs hdparm -W 0](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#O_SYNC_vs_fsync_vs_hdparm_-W_0)
|
||||||
|
|
||||||
|
- [Серверные SSD](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A1.D0.B5.D1.80.D0.B2.D0.B5.D1.80.D0.BD.D1.8B.D0.B5_SSD)
|
||||||
|
|
||||||
|
- [Ceph HDD+SSD](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#Ceph_HDD.2BSSD)
|
||||||
|
- [Примечания](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.B8.D0.BC.D0.B5.D1.87.D0.B0.D0.BD.D0.B8.D1.8F)
|
||||||
|
|
||||||
|
- [Почему вообще Bluestore такой медленный?](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D0.BE.D1.87.D0.B5.D0.BC.D1.83_.D0.B2.D0.BE.D0.BE.D0.B1.D1.89.D0.B5_Bluestore_.D1.82.D0.B0.D0.BA.D0.BE.D0.B9_.D0.BC.D0.B5.D0.B4.D0.BB.D0.B5.D0.BD.D0.BD.D1.8B.D0.B9.3F)
|
||||||
|
|
||||||
|
- [DPDK и SPDK](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#DPDK_.D0.B8_SPDK)
|
||||||
|
|
||||||
|
- [RAID WRITE HOLE](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#RAID_WRITE_HOLE)
|
||||||
|
|
||||||
|
- [Краткий экскурс в устройство SSD и флеш-памяти](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9A.D1.80.D0.B0.D1.82.D0.BA.D0.B8.D0.B9_.D1.8D.D0.BA.D1.81.D0.BA.D1.83.D1.80.D1.81_.D0.B2_.D1.83.D1.81.D1.82.D1.80.D0.BE.D0.B9.D1.81.D1.82.D0.B2.D0.BE_SSD_.D0.B8_.D1.84.D0.BB.D0.B5.D1.88-.D0.BF.D0.B0.D0.BC.D1.8F.D1.82.D0.B8)
|
||||||
|
- [Бонус: USB-флешки](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.91.D0.BE.D0.BD.D1.83.D1.81:_USB-.D1.84.D0.BB.D0.B5.D1.88.D0.BA.D0.B8)
|
||||||
|
|
||||||
|
- [Пример теста от Micron](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.B8.D0.BC.D0.B5.D1.80_.D1.82.D0.B5.D1.81.D1.82.D0.B0_.D0.BE.D1.82_Micron)
|
||||||
|
- [Апдейт](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.90.D0.BF.D0.B4.D0.B5.D0.B9.D1.82)
|
||||||
|
|
||||||
|
- [Бонус: висян (vSAN)](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.91.D0.BE.D0.BD.D1.83.D1.81:_.D0.B2.D0.B8.D1.81.D1.8F.D0.BD_.28vSAN.29)
|
||||||
|
|
||||||
|
- [Модели](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9C.D0.BE.D0.B4.D0.B5.D0.BB.D0.B8)
|
||||||
|
|
||||||
|
- [Резюме](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A0.D0.B5.D0.B7.D1.8E.D0.BC.D0.B5)
|
||||||
|
|
||||||
|
- [Примечание](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9F.D1.80.D0.B8.D0.BC.D0.B5.D1.87.D0.B0.D0.BD.D0.B8.D0.B5)
|
||||||
|
|
||||||
|
- [См. также](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A1.D0.BC._.D1.82.D0.B0.D0.BA.D0.B6.D0.B5)
|
||||||
|
|
||||||
|
- [Советы лучших собаководов](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.A1.D0.BE.D0.B2.D0.B5.D1.82.D1.8B_.D0.BB.D1.83.D1.87.D1.88.D0.B8.D1.85_.D1.81.D0.BE.D0.B1.D0.B0.D0.BA.D0.BE.D0.B2.D0.BE.D0.B4.D0.BE.D0.B2)
|
||||||
|
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Бенчмаркинг
|
||||||
|
|
||||||
|
Основные направления тестирования:
|
||||||
|
|
||||||
|
- Линейное чтение/запись (большими блоками)
|
||||||
|
- Пиковая производительность высоко-параллельного случайного чтения/записи мелкими блоками
|
||||||
|
- Задержка однопоточного случайного чтения мелкими блоками (4-8 Кб)
|
||||||
|
- Задержка однопоточной транзакционной записи мелкими блоками (4-8 Кб) — обычно последовательной, как в журнал СУБД, но в один поток это обычно слабо отличается от случайной
|
||||||
|
|
||||||
|
Задержки обычно важнее простой пиковой производительности случайного чтения/записи, так как далеко не каждое приложение может загрузить диск при большом параллелизме / глубокой очереди (32-128 запросов).
|
||||||
|
|
||||||
|
### Тестирование дисков
|
||||||
|
|
||||||
|
[SSD Bench Google Docs](https://docs.google.com/spreadsheets/d/1E9-eXjzsKboiCCX-0u0r5fAjjufLKayaut_FOPxYZjc)
|
||||||
|
|
||||||
|
Сначала прогоните fio на голом диске:
|
||||||
|
|
||||||
|
 ВНИМАНИЕ! Для тех, кто в танке — fio-тест записи на диск ДЕСТРУКТИВНЫЙ. Не вздумайте запускать его на дисках/разделах, на которых есть нужные данные… например, журналы OSD (был прецедент).
|
||||||
|
|
||||||
|
- Перед тестированием попробуйте отключить кэш записи диска: hdparm -W 0 /dev/sdX (SATA-диски через SATA или HBA), sdparm --set WCE=0 /dev/sdX (SAS-диски). Не совсем ясно, почему, но эта операция на серверных SSD может увеличить IOPS-ы на 2 порядка (а может НЕ увеличить, поэтому пробуйте оба варианта — и W0, и W1). Также см.ниже [#Картина маслом «Тормозящий кэш»](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#.D0.9A.D0.B0.D1.80.D1.82.D0.B8.D0.BD.D0.B0_.D0.BC.D0.B0.D1.81.D0.BB.D0.BE.D0.BC_.C2.AB.D0.A2.D0.BE.D1.80.D0.BC.D0.BE.D0.B7.D1.8F.D1.89.D0.B8.D0.B9_.D0.BA.D1.8D.D1.88.C2.BB).
|
||||||
|
- Линейное чтение: fio -ioengine=libaio -direct=1 -invalidate=1 -name=test -bs=4M -iodepth=32 -rw=read -runtime=60 -filename=/dev/sdX
|
||||||
|
- Линейная запись: fio -ioengine=libaio -direct=1 -invalidate=1 -name=test -bs=4M -iodepth=32 -rw=write -runtime=60 -filename=/dev/sdX
|
||||||
|
- Пиковые IOPS случайного чтения: fio -ioengine=libaio -direct=1 -invalidate=1 -name=test -bs=4k -iodepth=128 -rw=randread -runtime=60 -filename=/dev/sdX
|
||||||
|
- Задержка случайного чтения: fio -ioengine=libaio -sync=1 -direct=1 -invalidate=1 -name=test -bs=4k -iodepth=1 -rw=randread -runtime=60 -filename=/dev/sdX
|
||||||
|
- Пиковые IOPS случайной записи: fio -ioengine=libaio -direct=1 -invalidate=1 -name=test -bs=4k -iodepth=128 -rw=randwrite -runtime=60 -filename=/dev/sdX
|
||||||
|
- Задержка записи в журнал: fio -ioengine=libaio -sync=1 -direct=1 -invalidate=1 -name=test -bs=4k -iodepth=1 -rw=write -runtime=60 -filename=/dev/sdX — также стоит повторить тот же тест с -fsync=1 вместо -sync=1 и принять худший результат, так как иногда бывает, что одним из методов sync игнорируется (зависит от контроллера).
|
||||||
|
- Задержка случайной записи: fio -ioengine=libaio -sync=1 -direct=1 -invalidate=1 -name=test -bs=4k -iodepth=1 -rw=randwrite -runtime=60 -filename=/dev/sdX
|
||||||
|
|
||||||
|
«А почему так мало…» — см.ниже сагу про конденсаторы.
|
||||||
|
|
||||||
|
 Когда разворачиваете Ceph OSD на SSD — очень разумно не отдавать её под Ceph целиком, а оставить небольшой раздел (10-20 гб) пустым для будущего использования под бенчмаркинг. Ибо SSD имеют свойство со временем (или при забивании данными под 80%) начинать тормозить. Очень удобно иметь возможность гонять fio на пустом никем не используемом разделе.
|
||||||
|
|
||||||
|
#### Лирическое отступление
|
||||||
|
|
||||||
|
Почему нужно тестировать именно так? Ведь в целом производительность диска зависит от многих параметров:
|
||||||
|
|
||||||
|
- Размер блока
|
||||||
|
- Режим — чтение, запись или смешанный режим чтение+запись в разных пропорциях
|
||||||
|
- Параллелизм — размер очереди и число потоков, то есть, в целом число одновременно запрашиваемых у диска операций
|
||||||
|
- Длительность теста
|
||||||
|
- Исходное состояние — пуст, заполнен линейной записью, заполнен случайной записью, заполнен случайной записью на протяжении какого-то времени и т. п.
|
||||||
|
- Распределение данных — например, 10% горячих данных и 90% холодных — или, например, определённое расположение горячих данных (в начале диска)
|
||||||
|
- Другие смешанные режимы тестов, например, тестирование одновременно с разными размерами блоков
|
||||||
|
|
||||||
|
Также и результаты можно интерпретировать с разной степенью детализации — вместо простого среднего числа операций или мегабайт в секунду можно также приводить графики, гистограммы, перцентили и так далее — это, естественно, даст больше информации о поведении тестируемого образца.
|
||||||
|
|
||||||
|
Есть и философская сторона тестов — например, производители серверных SSD иногда заявляют о необходимости подготовки диска к тестам путём 2-х кратной полной случайной перезаписи, чтобы нагрузить слой трансляции адресов диска, а я считаю, что это на самом деле ставит SSD в неправдоподобно плохие по сравнению с реальной нагрузкой условия; есть сторонники рисования графиков формата «задержка в зависимости от числа операций в секунду», что я считаю немного странным, но тоже возможным подходом — в нём, по сути, строится график F1(q) в зависимости от F2(q) и график обычно получается достаточно замысловатый — но для каких-то применений, может быть, и тоже разумный.
|
||||||
|
|
||||||
|
В общем, бенчмаркингом заниматься можно бесконечно, и уж несколько дней, чтобы предоставить полную информацию, точно уйдёт. Этим обычно и занимаются ресурсы типа 3dnews в своих обзорах SSD. А мы не хотим сидеть несколько дней. Мы хотим обозначить набор тестов, которые можно провести быстро и сразу составить примерное представление о производительности.
|
||||||
|
|
||||||
|
Посему общая идея — выделить несколько наиболее «крайних» режимов, протестировать диск в них и представить, что остальная часть «амплитудно-скоростной характеристики» диска является некоторой гладкой функцией в пределах изменения параметров между крайними точками. Тем более, что каждому из крайних режимов соответствует и реальное применение в своей категории приложений:
|
||||||
|
|
||||||
|
1. Использующих в основном линейный или крупноблочный доступ. Для таких приложений наиболее важная характеристика — производительность линейного доступа в мегабайтах в секунду. Отсюда режим тестирования линейным доступом 4 МБ блоком со средней очередью — 16-32 операции. Результаты — только в МБ/с.
|
||||||
|
2. Использующих случайный доступ мелким блоком и при этом способных к распараллеливанию. Отсюда — режимы тестирования случайным доступом 4 КБ блоком (стандартный блок для большинства ФС и, плюс-минус, СУБД) с большой очередью — 128 операций или, если диск не удаётся нагрузить одним потоком CPU с глубиной очереди 128 — тогда в несколько (2-4-8 или больше) потоков по 128 операций. Результаты — только в iops. Задержку (latency) указывать не нужно, так как в данном тесте её можно произвольно увеличить, просто подняв размер очереди — задержка жёстко связана с iops формулой latency=queue/iops.
|
||||||
|
3. Использующих случайный доступ мелким блоком и при этом НЕспособных к распараллеливанию. Таких приложений больше, чем вы могли подумать — например, в части записи сюда относятся все транзакционные СУБД. Отсюда вытекают режимы тестирования случайным доступом 4 КБ блоком с очередью 1 и, для записи, с fsync после каждой операции, чтобы диск/СХД не могли нас обмануть и положить запись во внутренний кэш. Результаты — iops или latency, по желанию — но выберите что-то одно, так как числа, опять же, жёстко связанные.
|
||||||
|
|
||||||
|
### Тестирование кластера Ceph
|
||||||
|
|
||||||
|
Как тестировать Ceph после сборки.
|
||||||
|
|
||||||
|
#### RBD
|
||||||
|
|
||||||
|
fio -ioengine=rbd. Нужно сделать следующее:
|
||||||
|
|
||||||
|
1. fio -ioengine=rbd -direct=1 -name=test -bs=4M -iodepth=16 -rw=write -pool=rpool_hdd -runtime=60 -rbdname=testimg
|
||||||
|
2. fio -ioengine=rbd -direct=1 -name=test -bs=4k -iodepth=1 -rw=randwrite -pool=rpool_hdd -runtime=60 -rbdname=testimg
|
||||||
|
3. fio -ioengine=rbd -direct=1 -name=test -bs=4k -iodepth=128 -rw=randwrite -pool=rpool_hdd -runtime=60 -rbdname=testimg
|
||||||
|
4. ...и потом то же самое для read/randread.
|
||||||
|
|
||||||
|
Смысл в том, чтобы протестировать а) задержку в идеальных условиях б) линейную пропускную способность в) случайные iops-ы.
|
||||||
|
|
||||||
|
Перед тестами чтения образ сначала нужно заполнить линейной записью, так как чтение из пустого образа очень быстрое :)
|
||||||
|
|
||||||
|
Запускать нужно оттуда, где будут реальные пользователи RBD. В целом, с другого узла результаты обычно лучше.
|
||||||
|
|
||||||
|
Также всё то же самое можно повторить изнутри виртуалки или через krbd:
|
||||||
|
|
||||||
|
1. fio -ioengine=libaio -direct=1 -name=test -bs=4M -iodepth=16 -rw=write -runtime=60 -filename=/dev/rbdX
|
||||||
|
2. fio -ioengine=libaio -direct=1 -sync=1 -name=test -bs=4k -iodepth=1 -rw=randwrite -runtime=60 -filename=/dev/rbdX
|
||||||
|
3. fio -ioengine=libaio -direct=1 -name=test -bs=4k -iodepth=128 -rw=randwrite -runtime=60 -filename=/dev/rbdX
|
||||||
|
|
||||||
|
Заметьте, что при тестировании задержки через libaio добавилась опция -sync=1. Это не случайно, а соответствует режиму работы СУБД (транзакционная запись в 1 поток). В ioengine=rbd понятие sync отсутствует, там всё всегда «sync».
|
||||||
|
|
||||||
|
#### Отдельные OSD
|
||||||
|
|
||||||
|
ceph-gobench: [https://github.com/rumanzo/ceph-gobench/](https://github.com/rumanzo/ceph-gobench/)
|
||||||
|
|
||||||
|
Либо [https://github.com/vitalif/ceph-bench](https://github.com/vitalif/ceph-bench), что примерно то же самое. Родоначальник идеи — @socketpair Марк Коренберг ([оригинал](https://github.com/socketpair/ceph-bench)). Бенчилка тестирует _отдельные OSD_, что очень помогает понять, кто же из них тупит-то.
|
||||||
|
|
||||||
|
Перед запуском надо создать пул без репликации ceph osd pool create bench 128 replicated; ceph osd pool set bench size 1; ceph osd pool set bench min_size 1 и с числом PG, достаточным, чтобы при случайном выборе туда попали все OSD (ну или прибить их вручную к каждому OSD upmap-ами).
|
||||||
|
|
||||||
|
#### CephFS
|
||||||
|
|
||||||
|
«Нормальных» инструментов для тестирования ФС, сцуко, нет!!!
|
||||||
|
|
||||||
|
«Нормальный» инструмент — это такой инструмент, который вёл бы себя, как файловый сервер: случайно открывал, создавал/писал/читал и закрывал маленькие файлы среди большого общего количества, разбитые по набору каталогов
|
||||||
|
|
||||||
|
Всё, что есть, какое-то кривожопое: bonnie++, например, зачем-то тестирует запись по 1 байту. iometer, fs_mark не обновлялись лет по 10, но и паттерн файл сервера не умеют. Лучшее, что умеют — это тест создания файлов.
|
||||||
|
|
||||||
|
Пришлось написать свой ioengine для fio: [https://github.com/vitalif/libfio_fileserver](https://github.com/vitalif/libfio_fileserver) :)
|
||||||
|
|
||||||
|
#### S3 (rgw)
|
||||||
|
|
||||||
|
Предпочтительный вариант: [hsbench](https://github.com/vitalif/hsbench) — ссылка дана на исправленную версию (!). Максимально простой, консольное Golang приложение. Оригинальная версия пока что имеет 2 неприятных бага: во-первых, вместо чтения объектов целиком читает только первые 64 КБ, во-вторых, производит последовательное, а не случайное, чтение. Что, например, с minio приводит к слишком оптимистичным результатам тестов. В моей данные баги исправлены.
|
||||||
|
|
||||||
|
[cosbench](https://github.com/intel-cloud/cosbench) — очень толстый, Java с Web-интерфейсом, XML-настройки.
|
||||||
|
|
||||||
|
[minio warp](https://github.com/minio/warp) — тестов чуть больше, чем в hsbench, но зато тестирует только 1 бакет и при каждом тесте загружает данные заново.
|
||||||
|
|
||||||
|
#### Что использовать не надо
|
||||||
|
|
||||||
|
- dd и hdparm для бенчмаркинга не использовать вообще никогда!!!
|
||||||
|
- rados bench использовать тоже не надо, так как он создаёт для тестирования очень мало объектов (в 1 поток всего 2, в 128 — несколько сотен). «Случайная» запись в такое число объектов не очень-то и случайная.
|
||||||
|
- rbd bench лучше тоже не использовать. В принципе, он адекватен, но fio всё равно лучше.
|
||||||
|
- Не надо удивляться, если Ceph не может загрузить диски на 100 % при случайной записи. Он тормоз :)
|
||||||
|
|
||||||
|
#### Про RBD и параллелизм
|
||||||
|
|
||||||
|
 Тестировать запись несколькими параллельными процессами (fio numjobs > 1) в один RBD-образ бесполезно. Из-за особенностей реализации RBD, в частности, из-за object-map, при параллельной записи из нескольких источников производительность СИЛЬНО проседает (в 2-10 раз). Можно отключить object-map, но это будет некорректный тест, т.к. в реальной эксплуатации в 99% случаев он нужен, так что с отключенным object-map вы лишь получите неправильный (слишком хороший) результат.
|
||||||
|
|
||||||
|
Если вы не можете загрузить кластер одним процессом fio, то нужно создать несколько отдельных RBD-образов и запустить несколько процессов fio параллельно, каждый на своём RBD-образе.
|
||||||
|
|
||||||
|
### Тестирование сети
|
||||||
|
|
||||||
|
sockperf. На одной ноде запускаем сервер: sockperf sr -i IP --tcp. На другой клиент в режиме ping-pong: sockperf pp -i SERVER_IP --tcp -m 4096. ВНИМАНИЕ: В выводе фигурирует **половина** задержки (задержка в одну сторону). Таким образом, для получения RTT её стоит умножить на 2. Нормальный средний RTT - в районе 30-50 микросекунд (0.05ms).
|
||||||
|
|
||||||
|
~~Также qperf. На одной ноде просто qperf. На второй qperf -vvs -m 4096 SERVER_IP tcp_lat.~~
|
||||||
|
|
||||||
|
qperf написан криво: 1) всегда использует для tcp_lat размер сообщения 1 байт!!! 2) не использует TCP_NODELAY. Так что его юзать, только если возьмёте его с моим патчем отсюда: [Мой Debian репозиторий](https://yourcmc.ru/wiki/%D0%9C%D0%BE%D0%B9_Debian_%D1%80%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9 "Мой Debian репозиторий").
|
||||||
|
|
||||||
|
 Внимание: в Ubuntu на сетевую задержку негативно влияет AppArmor, его лучше отключить. Картина примерно такая (Intel X520-DA2):
|
||||||
|
|
||||||
|
- centos 3.10: rtt min/avg/max/mdev = 0.039/0.053/0.132/0.012 ms
|
||||||
|
- ubuntu 4.x + apparmor: rtt min/avg/max/mdev = 0.068/0.163/0.230/0.029 ms
|
||||||
|
- ubuntu 4.x: rtt min/avg/max/mdev = 0.037/0.071/0.157/0.018 ms
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
О транзакционности записи
|
||||||
|
|
||||||
|
 Плохая новость!
|
||||||
|
|
||||||
|
Важная особенность Ceph — _вся запись, даже та, для которой никто этого явно не просит, ведётся транзакционно_. То есть, никакая операция записи не завершается, пока она не записана в журналы всех OSD и не сделан fsync() диска. Так сделано, чтобы предотвращать [#RAID WRITE HOLE](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#RAID_WRITE_HOLE)-подобные ситуации рассинхронизации данных между репликами при отключении питания, потере сети и т.п…
|
||||||
|
|
||||||
|
Если конкретизировать сильнее, это означает, что Ceph не использует никакие буферы записи дисков (наоборот, он делает всё, чтобы эти буферы всё время очищать). Это не значит, что буферизации записи нет вообще — она есть на уровне клиентов (page cache в linux, кэш RBD устройства на уровне драйвера librbd qemu…). Но именно внутренние дисковые буферы не используются.
|
||||||
|
|
||||||
|
Это приводит к тому, что типичная настольная SSD под журналом в Ceph выдаёт **неприлично низкие IOPS-ы** — обычно от 500 до 2000. И это при том, что при обычном тестировании почти любая SSD выдаёт > 20000 iops. Даже самый паршивый китайский noname выдаёт не менее 10000 iops. NVMe легко выжимает 150000 и больше. Но стоит начать использовать fsync… и та же NVMe выдаёт 600 iops (на 2.5 порядка меньше).
|
||||||
|
|
||||||
|
В общем, чтобы понять, сколько у вас теоретически может быть IOPS-ов на запись в Ceph, диски под него нужно тестировать с опциями fio **sync=1 iodepth=1**. Это даст «журнальные» иопсы (производительность последовательного коммита операций по одной).
|
||||||
|
|
||||||
|
Другие почти идентичные варианты: fdatasync=1 (в файле поверх ФС) либо fsync=1 (на голом девайсе). Разница между опциями:
|
||||||
|
|
||||||
|
- fsync=1 синхронизирует данные и метаданные тестируемого файла отдельным запросом после каждой операции записи. Так работает BlueStore.
|
||||||
|
- fdatasync=1 синхронизирует только данные (но не метаданные) тестируемого файла после каждой операции записи. Соответственно, от fsync=1 это отличается, только если тестируется **файл в ФС**, а не блочное устройство.
|
||||||
|
 fdatasync=1 надо использовать, когда на диске уже есть ФС, а прогнать тест хочется. Результаты будут достаточно корректными.
|
||||||
|
- sync=1 использует O_SYNC и синхронный ввод/вывод, то есть, каждая операция начинается только после завершения предыдущей. Так работает FileStore.
|
||||||
|
|
||||||
|
Но ещё нужна опция iodepth=1, иначе в очередь диска до синхронизации «пролезает» несколько операций и IOPS-ы растут, тест перестаёт быть тестом журнала.
|
||||||
|
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Конденсаторы
|
||||||
|
|
||||||
|
Нас спасёт такое чудо инженерной мысли, как **SSD с конденсаторами** (или с суперконденсаторами — ионисторами). Которые на M.2 SSD, кстати, прекрасно видны невооружённым глазом (только тут это не ионисторы :)):
|
||||||
|
|
||||||
|
[](https://yourcmc.ru/wiki/%D0%A4%D0%B0%D0%B9%D0%BB:Micron_5100_sata_m2.jpg)
|
||||||
|
|
||||||
|
Конденсаторы работают фактически как встроенный в SSD ИБП и позволяют SSD успеть сбросить кэш во флеш-память при потере питания. Таким образом кэш становится «энергонезависимым» — и таким образом SSD может просто игнорировать запросы fsync, так как точно знает, что данные из кэша в любом случае доедут до постоянной памяти.
|
||||||
|
|
||||||
|
При этом **IOPS-ы транзакционной записи становятся равны IOPS-ам нетранзакционной**.
|
||||||
|
|
||||||
|
Конденсаторы в официальных описаниях SSD-шек обычно называются «enhanced/advanced power loss protection». Этой характеристикой обладают, как правило, только «серверные» SSD, да и то не все. Например, в Intel DC S3100 конденсаторов нет, а в Intel DC S4600 есть.
|
||||||
|
|
||||||
|
 Это и является главным отличием серверных SSD от настольных. Обычному пользователю транзакции нужны редко — а вот на серверах живут СУБД, которым транзакции как раз нужны позарез.
|
||||||
|
|
||||||
|
То есть, под Ceph следует закупать **только** SSD с конденсаторами. Даже если рассматривать NVMe — NVMe без конденсаторов хуже, чем SATA с оными.
|
||||||
|
|
||||||
|
И ещё один вариант — Intel Optane. Это тоже SSD, но они основаны не на Flash памяти (не NAND и не NOR), а на Phase-Change-Memory «3D XPoint». По спецификации заявляются 550000 iops при полном отсутствии необходимости в стирании блоков, кэше и конденсаторах. Но если даже задержка такого диска и равна 0.005мс (она действительно равна), то задержка Ceph всё равно 0.5-1мс, соответственно, с Ceph оптаны использовать чуть менее, чем бессмысленно — за большие деньги (1500$ за 960 гб, 500$ за 240 гб) вы получите не сильно лучший результат.
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Bluestore vs Filestore
|
||||||
|
|
||||||
|
Блюстор — «новое» хранилище. От «нового» хранилища честно ожидаешь лучшей или хотя бы не худшей производительности во всех сценариях. Однако это, увы, не совсем так.
|
||||||
|
|
||||||
|
Что лучше в Bluestore?
|
||||||
|
|
||||||
|
- Ликвидирована двойная запись при линейной записи. Линейная запись быстрее в честных 2 раза практически в любых конфигурациях.
|
||||||
|
- Отложенная запись, эффективная для HDD (и, частично, для очень плохих SSD). iops случайной записи в HDD-only конфигурациях почти в 2 раза больше, чем в Filestore. Правда, речь об iops на HDD не идёт в принципе, поэтому вся разница — 33 или 66 iops на 1 HDD.
|
||||||
|
- Возможность использования EC под CephFS и RBD благодаря реализованной частичной перезаписи объектов в EC-пулах.
|
||||||
|
- Эффективные снапшоты (благодаря «виртуальным клонам»): после снятия снапшота iops практически не падают, в отличие от Filestore, в котором они падают до считанных сотен даже на NVMe, так как при перезаписи даже 4 КБ после снятия снапшота в Filestore копируется целый 4 МБ объект.
|
||||||
|
|
||||||
|
 Увы, это относится только к **rbd snapshot**, но не к **rbd clone**. Клоны неэффективны в Bluestore точно так же, как и в Filestore. Запись 4 КБ в клон точно так же выливается в копирование 4 МБ.
|
||||||
|
|
||||||
|
- Это не так критично, но в Bluestore есть поддержка сжатия и контрольных сумм данных.
|
||||||
|
|
||||||
|
А что хуже? В целом, претензии сводятся к производительности:
|
||||||
|
|
||||||
|
- Гораздо хуже производительность случайной записи на SSD+HDD, SSD-раздел не работает как буфер для быстрой записи. Bluestore не пишет быстрее, чем может в среднем сам HDD. То есть, с SSD-журналом и Filestore будет 1000—2000 иопс случайной записи, а с Bluestore (и без bcache) — 200—300. 1000—2000, конечно, упадёт до 100 или даже ниже, когда у Filestore забьётся журнал и его придётся сбрасывать — но тем не менее, «буфер» для сглаживания пиков Filestore предоставляет. А Bluestore — нет.
|
||||||
|
|
||||||
|
И проблема не только в том, что параметры по умолчанию — deferred_batch_ops и max_deferred_txc — задают частый сброс операций на медленный диск (раз в 64 операции). Проблема ещё в том, что в Bluestore отсутствуют механизмы фоновой очистки «журнала» (очереди отложенной записи). Поэтому, когда очередь забивается, производительность просто падает до HDD-шной до перезапуска OSD. Ну и сама очередь находится в RocksDB, поэтому сильно поднимать её размер, по идее, неполезно.
|
||||||
|
|
||||||
|
- До 1.5-2 раз хуже latency случайной записи на SSD/NVMe (All-Flash), ибо накладных расходов на каждую операцию записи у Bluestore больше.
|
||||||
|
- Жор памяти больше. Да, у Filestore много занимал pagecache, но Bluestore меньше 2 ГБ памяти не жрёт вообще никогда. Причиной тому — RocksDB (одни только memtable-ы с дефолтными настройками съедают 1 ГБ памяти) и собственный кэш метаданных и данных (Bluestore не может использовать pagecache).
|
||||||
|
- Фрагментация приводит к снижению скорости чтения.
|
||||||
|
|
||||||
|
Также BlueStore делает огромное количество fsync-ов (что очень смешно — даже больше, чем запросов записи), из-за чего не терпит десктопных SSD под журналом. Но FileStore работает похоже, и кардинальных различий производительности это не вносит.
|
||||||
|
|
||||||
|
Как полечить высокие задержки на SSD+HDD?
|
||||||
|
|
||||||
|
- Либо вместо журнала (или рядом с журналом) сделать на SSD bcache для HDD.
|
||||||
|
- Либо использовать HDD с SSD Cache, Media Cache или аналогом (перманентным кэшем случайной записи на пластинах). Например, в старых дисках HGST это включается при отключении волатильного кэша командой `hdparm -W 0 /dev/sdXX`. В новых, похоже, включено всё время.
|
||||||
|
|
||||||
|
### Тест на 1 NVMe
|
||||||
|
|
||||||
|
Threadripper 2920X, NVMe Intel P4500, localhost. 1 OSD без репликации, 8 PG, чтобы не упираться в блокировки, 1 маленький RBD образ 10 Гб.
|
||||||
|
|
||||||
|
Журнал Filestore 1 GB, чтобы в тестах успевал начинаться сброс. Bluestore 4k — это min_alloc_size и prefer_deferred_size = 4096 (4k запись идёт через redirect-write), Bluestore 16k — 16384 (4k запись идёт через deferred).
|
||||||
|
|
||||||
|
||Filestore|Bluestore 16k|Bluestore 4k||
|
||||||
|
|---|---|---|---|---|
|
||||||
|
|bs=4M iodepth=16 rw=write|950 MB/s|1700 MB/s|1700 MB/s||
|
||||||
|
|bs=4M iodepth=16 rw=read|1250 MB/s|1300 MB/s|1300 MB/s|После полной линейной перезаписи + drop_caches|
|
||||||
|
|bs=4M iodepth=16 rw=read|1250 MB/s|450 MB/s|320 MB/s|После 33 % случайной перезаписи блоком min_alloc_size|
|
||||||
|
|bs=4k iodepth=1 rw=randwrite|3900 iops|3200 iops|2500 iops||
|
||||||
|
|bs=4k iodepth=128 rw=randwrite|19100 iops|19500 iops|25500 iops||
|
||||||
|
|bs=4k iodepth=1 rw=randwrite|180 iops|2800 iops|2500 iops|Сразу после снятия snapshot-а RBD|
|
||||||
|
|bs=4k iodepth=128 rw=randwrite|180 iops|8800 iops|15600 iops|Сразу после снятия snapshot-а RBD|
|
||||||
|
|bs=4k iodepth=1 rw=randread|3900 iops|4500 iops|4500 iops|После drop_caches / перезапуска OSD|
|
||||||
|
|bs=4k iodepth=1 rw=randread|6300 iops|4500 iops|4500 iops|Прогретый кэш|
|
||||||
|
|bs=4k iodepth=128 rw=randread|33000 iops|32000 iops|33000 iops||
|
||||||
|
|RAM|270 MB|2 GB +||Filestore также использует произвольный объём page cache|
|
||||||
|
|CPU randwrite Q=128|600 %|550 %|||
|
||||||
|
|
||||||
|
### Про размер block.db
|
||||||
|
|
||||||
|
**Внимание:** актуально до Ceph 14. Начиная с Ceph 15, благодаря добавленным «allocation hints» RocksDB, Bluestore стал нормально утилизировать раздел block.db. Для истории — это коммит 5f72c376deb64562e5e88be2f22339135ac7372b, там добавили опцию bluestore_volume_selection_policy.
|
||||||
|
|
||||||
|
Дальше стоит читать, только если у вас всё ещё проблемы со spillover-ами.
|
||||||
|
|
||||||
|
Спилловер — это когда вы собрали Bluestore на SSD+HDD, выделив SSD под базу (block.db), но при этом эта самая база постоянно частично утекает на HDD. При этом она, вроде бы, даже влезает в SSD с запасом — но всё равно утекает. Начиная с Ceph 14 Nautilus о спилловерах предупреждает ceph -s.
|
||||||
|
|
||||||
|
Когда случается спилловер в SSD+HDD конфигурациях, работа кластера замедляется — в большей или меньшей степени, в зависимости от размеров RocksDB и паттерна нагрузки, так как когда метаданных не очень много, они влезают в кэш OSD — либо onode cache, либо rocksdb cache, либо, если включено bluefs buffered io — то ещё и в системный page cache. Если кэш-промахов достаточно много, или если OSD упирается в compaction RocksDB, могут даже появляться slow ops-ы.
|
||||||
|
|
||||||
|
Так в чём же дело и как это победить? А дело в том, что с выбором раздела для очередного файла БД (RocksDB организована в виде набора файлов) «есть нюанс», точнее, даже два.
|
||||||
|
|
||||||
|
**Нюанс № 1:** RocksDB кладёт файл на быстрый диск только когда считает, что на быстром диске хватит места под все файлы этого же уровня (для тех, кто ещё не в курсе — RocksDB это [LSM база](https://github.com/facebook/rocksdb/wiki/Leveled-Compaction)).
|
||||||
|
|
||||||
|
Дефолтные настройки цефа:
|
||||||
|
|
||||||
|
- 1 Гб WAL = 4x256 Мб
|
||||||
|
- max_bytes_for_level_base и max_bytes_for_level_multiplier не изменены, поэтому равны 256 Мб и 10 соответственно
|
||||||
|
- соответственно, L1 = 256 Мб
|
||||||
|
- L2 = 2560 Мб
|
||||||
|
- L3 = 25600 Мб и т. д.
|
||||||
|
|
||||||
|
…Соответственно!
|
||||||
|
|
||||||
|
Rocksdb положит L2 на block.db, только если раздел имеет размер хотя бы 2560+256+1000 Мб — округлим вверх до **4 ГБ**. А L3 она положит на block.db, только если block.db размером хотя бы 25600+2560+256+1000 МБ = около **30 ГБ**. А L4, соответственно, если ещё +256 ГБ, то есть итого **286 ГБ**.
|
||||||
|
|
||||||
|
Иными словами, имеют смысл только размеры раздела block.db 4 ГБ, 30 ГБ, 286 ГБ. Все промежуточные значения бессмысленны — место сверх предыдущего граничного значения использоваться не будет. Например, если БД занимает 10 ГБ, а раздел SSD — 20 ГБ, то фактически на SSD ляжет только WAL (1 ГБ), L1 и L2 (256 МБ + 2.56 ГБ). L3, составляющий бОльшую часть базы, уедет на HDD и будет тормозить работу.
|
||||||
|
|
||||||
|
При этом 4 ГБ — слишком мало, 286 ГБ — слишком много. Так что, по сути, правильно делать block.db размером 30 ГБ для OSD любого размера. Ещё раз повторюсь: это актуально до Ceph 14, с Ceph 15 уже не актуально.
|
||||||
|
|
||||||
|
Кстати, из этого же следует то, что официальная рекомендация — выделять под block.db то ли 2 %, то ли 4 % от размера устройства данных — полный отстой.
|
||||||
|
|
||||||
|
Но что делать, если у вас разделы другого размера? Например, 80 ГБ, и вы по каким-то причинам не хотите делать bcache, но хотите использовать эти 80 ГБ по максимуму. В этом случае можно поменять базовый размер уровня RocksDB (max_bytes_for_level_base). multiplier менять не будем, оставим по умолчанию 10 — его значение влияет на итоговое количество уровней RocksDB, а это уже более тонкая материя. Теоретически, меньшее число уровней снижает read и space amplification, но замедляет compaction и из-за этого может сильно повысить итоговый write amplification. Также есть тема с уменьшением размера отдельных memtable и кратным увеличением общего их числа, то есть, например, установки 32*32 МБ вместо дефолтных 4*256 МБ и min_write_buffer_to_merge=8, но эффект от этого тоже не совсем понятен (возможно, немного экономится CPU при compaction-е), так что это тоже пока лучше не трогать.
|
||||||
|
|
||||||
|
Так как каждый уровень отличается от предыдущего в 10 раз, общий размер раздела БД должен быть равен k*X, где k — коэффициенты из ряда: 1, 11, 111, 1111 и т. п. (по числу уровней RocksDB). Значит, мы можем взять размер нашего block.db, вычесть из него 1 ГБ WAL (лучше даже вычесть с запасом 2 ГБ) и делить его последовательно на каждую из цифр до тех пор, пока не получим значение, близкое к 256 МБ … 1 ГБ. Это значение округлить вниз, принять за базовый размер уровня RocksDB и прописать в конфиг как max_bytes_for_level_base. База компактится по 256 МБ за раз, так что меньше 256 МБ размер первого уровня ставить точно смысла нет. Например, для 80 ГБ раздела это будет 719 МБ, только не забываем считать всё в двоичных мегабайтах — MiB. Остаётся прописать это значение в конфигурацию (bluestore_rocksdb_options = …,max_bytes_for_level_base=719MB), перезапустить OSD и сделать ручной compaction (можно дважды).
|
||||||
|
|
||||||
|
**Нюанс № 2:** При ручном compaction-е RocksDB переписывает уровни целиком. Если при этом на SSD нет запаса места в размере этого уровня, то уровень, опять-таки, утечёт на HDD и так там и останется, ибо перемещать после compaction-а его обратно она не умеет. Теоретически, если после этого сделать compaction ещё раз, то уровень должен вернуться на SSD (поэтому выше дана рекомендация делать ручной compaction дважды). Однако по сведениям из чата якобы бывает так, что один-два файла *.sst на SSD не возвращается. Чтобы это побороть на 100 %, можно предусмотреть на SSD-разделе ещё и запас в размере первого + последнего уровня БД. В этом случае коэффициенты вместо 1-11-111-1111 превращаются в 2-22-212-2112 и т. п.
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
RGW vs Minio
|
||||||
|
|
||||||
|
Вопрос частый, так как Ceph и Minio — две наиболее распространённые реализации S3.
|
||||||
|
|
||||||
|
Сравнение, как всегда, не совсем честное, так как в Minio «бесконечного масштабирования» и произвольных схем избыточности нет. Есть только erasure коды, которые оперируют группами дисков, кратными по количеству 4 или 16 дискам. Расширения кластера в Minio раньше не было вообще, потом в каком-то смысле появилось через создание дополнительных зон.
|
||||||
|
|
||||||
|
Таких же гарантий целостности, как в Ceph, в Minio тоже нет. Minio работает поверх обычных ФС, даже не делая fsync данных. На практике ext4, правда, делает sync автоматически раз в 5 секунд, да и Minio пишет с O_DIRECT, так что не совсем всё плохо — но тем не менее, потенциально небольшие потери при отключении питания возможны.
|
||||||
|
|
||||||
|
Особенно классный перл был в баге [https://github.com/minio/minio/issues/3478](https://github.com/minio/minio/issues/3478):
|
||||||
|
|
||||||
|
> Minio in this case is working as intended, minio cannot be expanded or shrinkable in this manner. Minio is different by design. It is designed to solve all the needs of a single tenant. Spinning minio per tenant is the job of external orchestration layer. Any addition and removal means one has to rebalance the nodes. When Minio does it internally, it behaves like blackbox. It also adds significant complexity to Minio. Minio is designed to be deployed once and forgotten. We dont even want users to be replacing failed drives and nodes. Erasure code has enough redundancy built it. By the time half the nodes or drives are gone, it is time to refresh all the hardware. If the user still requires rebalancing, one can always start a new minio server on the same system on a different port and simply migrate the data over. It is essentially what minio would do internally. Doing it externally means more control and visibility. Minio is meant to be deployed in static units per tenant.
|
||||||
|
|
||||||
|
Короче, всё работает как надо, в минио нет возможности расширения, если у вас будут ломаться диски — не меняйте, просто дождитесь, пока из строя выйдет половина дисков и пересоздайте кластер. На самом деле всё не так печально, можно заменить диск и запустить heal, но, конечно, без той же прозрачности, что в Ceph — оно будет просто сканировать все объекты и проверять отсутствующие. Если дисков много, это очень накладно.
|
||||||
|
|
||||||
|
Ещё Minio хранит объекты в виде обычных файлов, даже не шардируя каталоги (соответствующие бакетам) по подкаталогам, плюс на каждый объект ещё создаёт директорию с парой файлов метаданных. Ну а директории в ФС по миллиону файлов — это, естественно, удовольствие ниже среднего. Хотя просто для раздачи оно, благодаря всяким dir_index-ам, работает.
|
||||||
|
|
||||||
|
Для представления о производительности проведём простой тест Ceph (bluestore) vs Minio (ext4) на 1 HDD. Да, я знаю, что это тупо и нужно ещё хотя бы посравнивать их на SSD. Но всё-таки результаты довольно показательны. Да и объектное хранилище чаще холодное/прохладное и строится на HDD, а не на SSD.
|
||||||
|
|
||||||
|
Тест делался через [hsbench](https://github.com/vitalif/hsbench). Заключался в заливке примерно 1.1 миллиона объектов в 1 бакет, потом сброса кэшей и перезапуска Ceph/Minio, и потом — их раздачи в случайном порядке, а также проверки скорости выполнения операций листингов. Результаты:
|
||||||
|
|
||||||
|
- Заливка в 32 потока: Minio — 305 объектов в секунду, RGW — 135 объектов в секунду. RGW indexless — 288 объектов в секунду.
|
||||||
|
- Раздача в 32 потока: Minio — 45 объектов в секунду, RGW — 78 объектов в секунду
|
||||||
|
- Листинги в 32 потока: Minio — после сброса кэша 35 сек, после прогрева — 2.9 сек с разбросом от 0.5 до 16 сек. RGW — стабильно — 0.4 сек
|
||||||
|
|
||||||
|
Да, заливка в Minio быстрее. Но, во-первых, меньшая скорость заливки — это цена, во-первых, консистентности (fsync), а во-вторых, bucket index-а и bucket index log-а, которые позволяют RGW, например, делать геосинхронизацию (multisite), чего в Minio нет.
|
||||||
|
|
||||||
|
Кроме того, индексы в RGW можно положить на отдельные SSD (как обычно все и делают), а если же вам совсем не нужны листинги, синхронизация и прочее, в Ceph бакеты можно сделать безиндексными (indexless), и тогда оверхед bucket index-а вообще исчезает, как и возможные проблемы с его шардированием.
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Снапшоты
|
||||||
|
|
||||||
|
В реализации снапшотов в Ceph есть целый ворох проблем из-за количества параллельных реализаций и общего накопленного архитектурного бардака:
|
||||||
|
|
||||||
|
- На уровне RADOS снапшоты свои и их уже 2 вида: снапшоты пулов и снапшоты объектов.
|
||||||
|
- На уровне RBD тоже свои снапшоты, причём они отличаются от RADOS-снапшотов, хоть внутри и реализованы частично через них. RBD снапшоты, можно сказать, не юзабельны ни для чего, кроме быстрого снятия бэкапов, за которым тут же следует удаление снапшота. Откат к RBD снапшотам очень медленный и реализован не просто ужасно, а отвратительно — копированием содержимого снапшота поверх образа, _даже неизменённых частей_. Кроме того, при откате цепочка последующих снапшотов уничтожается. Кроме того, есть прикол с жором места — см. на 2 пункта ниже.
|
||||||
|
- В Bluestore снапшоты эффективны — после снятия снапшота случайная запись практически не замедляется, в отличие от Filestore, где принцип работы снапшотов схож со старым LVM и при записи даже 4 КБ после снятия снапшота соответствующий 4 МБ объект копируется целиком.
|
||||||
|
- Но при этом эта оптимизация снапшотов — «виртуальные клоны» — реализована именно на уровне Bluestore, ни клиент, ни OSD о ней ничего не знают и поэтому она… ломается при ребалансе. Выглядит это так: ты добавляешь в кластер диск, он заполняется, а доступного места больше не становится. Почему? Потому что изначально, при записи, Bluestore получил запрос «клонировать 4 МБ объект в новую версию» и сделал это внутри себя, реально не копируя данные, а потом перезаписал 4 КБ. А при ребалансе эта связь порвалась и объект стал занимать все 4 МБ… Fail.
|
||||||
|
- Также на уровне RBD есть клоны, которые, с одной стороны, более юзабельны — реализованы они через ссылку на родительский образ, соответственно, откат к такому «снапшоту» быстрый — достаточно просто создать новый клон. С другой стороны, для клонов не работает эта самая блюсторовская оптимизация, поэтому они опять-таки копируют объекты целиком при любой записи… что выливается в 40 иопс на запись (QD=1) в свежий клон даже в NVMe кластере.
|
||||||
|
- В CephFS ещё одна реализация снапшотов, и там отката нет вообще.
|
||||||
|
|
||||||
|
В общем, наговнокодили — мама не горюй…
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
EC
|
||||||
|
|
||||||
|
EC ещё больше снижает iops-ы, так как добавляется цикл Read-Modify-Write. [#RAID WRITE HOLE](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_mobile#RAID_WRITE_HOLE) в цефе закрыт, поэтому при записи все OSD сначала делают вторые копии объекта (по-видимому, виртуальные, через тот же механизм virtual clone bluestore), а потом удаляют старые.
|
||||||
|
|
||||||
|
В моём примере на NVMe-шках — write iops с репликацией Q=1 примерно 1500, а с EC — примерно 500. Q=128 — примерно 25000 с репликацией и 10000 с EC.
|
||||||
|
|
||||||
|
### Про вероятность потери данных
|
||||||
|
|
||||||
|
Смотрите мой калькулятор вероятности потери данных в кластере: [https://yourcmc.ru/afr-calc/](https://yourcmc.ru/afr-calc/)
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Контроллеры
|
||||||
|
|
||||||
|
- SATA — это нормально, SAS не обязателен от слова «совсем». SATA за счёт того, что «не умничает», достаточно быстрая и точно лучше, чем старые RAID контроллеры.
|
||||||
|
- Разница в IOPS между RAID и HBA/SATA может быть колоссальна. В производительность не самого нового RAID контроллера легко упереться. Плохо даже не то, что на 1 диск вы получите 48000 iops вместо 60000, хуже то, что при подключении 8 дисков вы получите 6000 iops на каждый диск вместо 60000, так как 48000 поделятся на всех. Также в RAID режиме увеличивается задержка в 1 поток.
|
||||||
|
- Так что свой RAID контроллер либо переключите в режим passthrough (если он умеет), либо перепрошейте, чтобы умел, либо выкиньте в помойку и купите HBA («RAID без RAID-функционала», например, LSI 9300-8i). Это актуально для всех видов программных хранилок — Ceph, ZFS и т. п.
|
||||||
|
- Если не выкинули RAID — отключайте все кэши контроллера, чтобы уменьшить влияние прослойки и не страдать при разряде батарейки / перемещении диска в другой сервер... и молитесь :). Наверное, в теории можно выжить и с включенным кэшем, но это стрельба себе в ногу.
|
||||||
|
- Даже если у вас HBA — имейте в виду, что некоторые HBA (в частности, Adaptec) могут всё равно не сбросить кэш корректно и устроить вам Cloudmouse при отключении питания. Но по крайней мере точно известно, что LSI ведут себя нормально.
|
||||||
|
- Хороший пост про RAID-кэши в списке рассылки: [http://lists.ceph.com/pipermail/ceph-users-ceph.com/2019-July/036237.html](http://lists.ceph.com/pipermail/ceph-users-ceph.com/2019-July/036237.html) - если вкратце - человек, админивший 6000 OSD, пишет, что никогда больше не свяжется с RAID0-режимами.
|
||||||
|
- У HBA тоже есть предел IOPS. К примеру, у LSI 9211-8i это ~280000 iops на весь контроллер.
|
||||||
|
- При подключении через SATA или HBA контроллер не забывайте для **серверных** SATA дисков сделать hdparm -W 0 /dev/sdX, для SAS — sdparm --set WCE=0 /dev/sdX.
|
||||||
|
- Для SAS и NVMe включайте blk-mq (ну или юзайте свежие ядра, в районе 4.18 оно включается по умолчанию). Но для SATA blk-mq обычно бесполезен или почти бесполезен.
|
||||||
|
- Фактическая глубина очереди, используемая Ceph OSD при случайной записи, редко больше 10 (посмотреть можно при работе утилитой iostat -xmt 1).
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Процессоры
|
||||||
|
|
||||||
|
- На SSD Ceph ОЧЕНЬ СИЛЬНО упирается в процессор. Можно сказать, что процессор — основной bottleneck.
|
||||||
|
- Как сказано в презентации Ника Фиска — Ceph is a Software-Defined Storage **and every piece of Ceph «Software»** will run faster with every GHz of CPU frequency.
|
||||||
|
- Кроме частоты, на серверных процессорах часто наличествует NUMA (Non-Uniform Memory Access). То есть, часть памяти и оборудования доступна процессору напрямую, а часть — только через другой процессор.
|
||||||
|
- Для максимизации производительности конфигураций с NUMA лучше избегать, а процессорам с бОльшим числом ядер и меньшей частотой лучше предпочитать бОльшую частоту и меньшее число ядер…
|
||||||
|
- …но в пределах разумного, так как даже один OSD на серверном SSD под нагрузкой может спокойно выжрать на 100 % ядер 6.
|
||||||
|
- Под частотой подразумевается номинальная частота, а не Turbo Boost, так как оный актуален только для однопоточных нагрузок.
|
||||||
|
- Рекомендации по привязке OSD к отдельным CPU (taskset), можно сказать, неактуальны, так как Ceph OSD сильно многопоточные — при записи постоянно активно как минимум 4 потока, и ограничение их несколькими ядрами сильно урезает производительность.
|
||||||
|
- Есть два параметра, которые регулируют число рабочих потоков OSD — osd_op_num_shards и osd_op_num_threads_per_shard…
|
||||||
|
- …Но менять их бесполезно, поднять производительность таким образом не получается абсолютно, дефолтные значения (1x5 на HDD и 2x8 на SSD) оптимальны. kv_sync_thread-то всё равно только один.
|
||||||
|
- Есть одна мера, которая помогает поднять производительность сразу раза в 2-3: отключение экономии энергии процессором:
|
||||||
|
- cpupower idle-set -D 0 — отключает C-States (либо опции ядра processor.max_cstate=1 intel_idle.max_cstate=0)
|
||||||
|
- cpupower frequency-set -g performance или (старое) for i in $(seq 0 $((`nproc`-1))); do cpufreq-set -c $i -g performance; done — отключает снижение частоты через множитель
|
||||||
|
- После этих двух команд процессор начинает греться как ПЕЧ, но iops-ы увеличиваются сразу раза в 2 (а то и 3)
|
||||||
|
- Также жор CPU — одна из причин НЕ делать из Ceph «гиперконвергентное облако» (в котором совмещены узлы хранения и запуска виртуальных машин)
|
||||||
|
- Ещё можно отключить все mitigation-ы аппаратных уязвимостей: noibrs noibpb nopti nospectre_v2 nospectre_v1 l1tf=off nospec_store_bypass_disable no_stf_barrier
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Сеть
|
||||||
|
|
||||||
|
- Разумеется, 10 Гбит/с или быстрее
|
||||||
|
- MTU 9000: ip l set enp3s0f0 mtu 9000
|
||||||
|
- Отключить оффлоады: ethtool -K enp3s0f0 gro off gso off tso off lro off sg off
|
||||||
|
- Отключить объединение прерываний: ethtool -C enp3s0f0 rx-usecs 0
|
||||||
|
- Самый дешёвый 10G свитч с Ebay: Quanta LB6M / Brocade TurboIron 24X — но говно старое унылое и жрёт под 200 ватт, и греется и жужжит соответственно
|
||||||
|
- UPD Самый дешёвый свитч с Aliexpress: [TP-LINK TL-ST5008F](https://aliexpress.ru/item/1005004429524441.html). На чипе [Realtek RTL9303-CG](https://www.realtek.com/en/products/communications-network-ics/item/rtl9303-cg)
|
||||||
|
|
||||||
|
Если совсем задолбала латенси, как отключить ВСЕ оффлоады?
|
||||||
|
|
||||||
|
for i in rx tx tso ufo gso gro lro tx nocache copy sg txvlan rxvlan; do
|
||||||
|
/sbin/ethtool -K eth3 $i off 2>&1 > /dev/null;
|
||||||
|
done
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Настройка виртуалок и ФС
|
||||||
|
|
||||||
|
С дефолтными опциями qemu подключает RBD, увы, криво.
|
||||||
|
|
||||||
|
Криво — это значит, что:
|
||||||
|
|
||||||
|
а) используется медленная эмуляция lsi-контроллера
|
||||||
|
|
||||||
|
б) неправильно настроен кэш
|
||||||
|
|
||||||
|
### Драйвер виртуального диска и ФС
|
||||||
|
|
||||||
|
В qemu есть следующие способы эмуляции дисков:
|
||||||
|
|
||||||
|
- lsi — самый медленный
|
||||||
|
- virtio — самый быстрый, но до QEMU 4.0 не умел TRIM. Юзать надо его.
|
||||||
|
- virtio-scsi — достаточно быстрый. На самом деле, умеет multiqueue и поэтому на быстром хранилище (например, при прямом доступе к локальной NVMe) должен быть быстрее virtio — но в случае с Ceph это не так, так как цеф не настолько быстрый, чтобы multiqueue играл роль
|
||||||
|
- nvme — тоже достаточно быстрый, но немного медленнее virtio. Принцип работы похожий — и там, и там кольцевые буферы. Можно использовать для тех образцов ПО, которые не умеют virtio, потому что не уметь nvme сейчас совершенно точно не может никто. Например, если хочется потестировать VMWare ESXi с вложенной виртуализацией внутри QEMU, то nvme — для вас!
|
||||||
|
|
||||||
|
### cache=writeback
|
||||||
|
|
||||||
|
Кэш дисков в qemu регулируется опцией, собственно, cache. Бывает <не указано>, writethrough, writeback, none, unsafe, directsync.
|
||||||
|
|
||||||
|
С Ceph RBD эта опция регулирует работу rbd cache, то есть кэша на стороне клиентской библиотеки Ceph (librbd). RBD cache маленький (32 МБ) и является аналогом буфера записи на HDD, то есть, предназначен исключительно для группировки операций записи перед, собственно, отправкой их в хранилище.
|
||||||
|
|
||||||
|
Режимы writethrough, <не указано> и directsync с RBD, по сути, эквивалентны и означают отсутствие кэширования записи (каждая операция отправляется сразу в Ceph).
|
||||||
|
|
||||||
|
Режим writeback означает «честное» (безопасное) кэширование записи. То есть, операции записи без fsync ложатся в кэш и отправляются оттуда либо раз в rbd_cache_max_dirty_age (по умолчанию 1 сек), либо когда ВМ просит fsync.
|
||||||
|
|
||||||
|
Режим unsafe означает «нечестное» (чреватое потерей данных) кэширование записи. Операции записи также ложатся в кэш, но fsync от ВМ игнорируются. Транзакционность в виртуалке отсутствует, но и производительность повышается. Использовать этот режим можно только для виртуалок, не содержащих ценные данные (например, для каких-нибудь тестов или CI).
|
||||||
|
|
||||||
|
При среднем применении правильный режим — **cache=writeback**. Грубо говоря, cache=writeback увеличивает результат следующего теста:
|
||||||
|
|
||||||
|
fio -name=test -ioengine=libaio -direct=1 -bs=4k -iodepth=1 -rw=randwrite -filename=/dev/vdb # без -fsync и без -sync
|
||||||
|
|
||||||
|
…примерно приводя его к результату того же теста с iodepth=32.
|
||||||
|
|
||||||
|
 ОДНАКО, есть НЮАНСЫ (как всегда с цефом…):
|
||||||
|
|
||||||
|
- Если RBD-образ пустой и при этом на нём включён object-map (по умолчанию включён, см. rbd info <pool>/<image>), то сброс кэша становится однопоточным И ФИГ ВЫ ВИДИТЕ улучшение результата fio.
|
||||||
|
- Если опция rbd_cache_writethrough_until_flush равна true (так по умолчанию), то до первого fsync кэш не работает. То есть, если вы монтируете к виртуалке диск и сразу тестируете его вышеприведённой командой — вы опять-таки не увидите хороших результатов.
|
||||||
|
- Из-за той же опции, стоящей в true, cache=unsafe не работает вообще. В Proxmox включен патч, который заставляет qemu ставить эту опцию автоматически. Если у вас не Proxmox — опцию нужно прописать в конфиг глобально: rbd_cache_writethrough_until_flush=false.
|
||||||
|
- Сам кэш может являться тормозом в SSD-кластерах. Что-то там сделано с блокировками, что-то там однопоточное, всё это оптимизируют, но пока не оптимизировали. Например, 4K randwrite Q128 с rbd_cache=false может достигать 20000 iops, а с rbd_cache=true — только 11000 iops. Для говнософта, который пишет на диск абы как, это торможение оправдано, а для, например, СУБД — нет. Поэтому в случае, если у вас SSD и вам нужны в первую очередь random iops, то правильный режим — **cache=none**.
|
||||||
|
|
||||||
|
### ФС
|
||||||
|
|
||||||
|
А ещё тормозит файловая система! Конкретно, если у вас не включена опция mount -o lazytime, то при каждой мелкой записи ФС обновляет mtime, то есть время модификации inode-а. Так как это метаданные, а ФС журналируемые — это изменение журналируется. Из-за этого при тесте fio -sync=1 -iodepth=1 -direct=1 поверх ФС без lazytime iops-ы уменьшаются в 3-4 раза.
|
||||||
|
|
||||||
|
Для lazytime нужны свежие ядра: с ext4 — хотя бы 4.0, с XFS — хотя бы 4.17. Также нужны соответствующие (свежие) util-linux (подсказка: в протухшей 7-й центоси их нет, поставить можно только из исходников).
|
||||||
|
|
||||||
|
А если у вас (не дай бог) внутри Oracle, то ему надо обязательно поставить опцию FILESYSTEMIO_OPTIONS=SETALL.
|
||||||
|
|
||||||
|
Производительность случайной записи в CephFS почти не отличается от RBD.
|
||||||
|
|
||||||
|
Производительность случайной записи в CephFS через mount -t cephfs и через ceph-fuse… при iodepth=1 почти не отличается. А вот при iodepth=128 ядерный клиент ведёт себя нормально, а ceph-fuse выдаёт столько же, сколько при iodepth=1 (то есть на порядок/порядки меньше, чем ядерный клиент).
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Оценка производительности кластера
|
||||||
|
|
||||||
|
Оценка производительности кластера просто по спецификациям входящих в него дисков — абсолютно неправильна.
|
||||||
|
|
||||||
|
Речь о Bluestore. Под iops понимаются iops случайного чтения/записи блоками по 4 кб.
|
||||||
|
|
||||||
|
1 HDD (обычный, 7200 rpm, не SMR, без ssd-кэша) — это:
|
||||||
|
|
||||||
|
- ~100-120 iops при QD=128
|
||||||
|
- ~66 iops при QD=1
|
||||||
|
- ~40 MB/s линейного чтения/записи
|
||||||
|
- При недостатке памяти показатели будут хуже, так как будут cache miss по метаданным
|
||||||
|
|
||||||
|
1 быстрый SSD или NVMe SSD (с конденсаторами, write iops >= 25000):
|
||||||
|
|
||||||
|
- ~1000 iops на запись при QD=1, в зависимости от частоты CPU и настроек может быть от 300 до, в самом идеальном случае, ~2500 iops.
|
||||||
|
- Максимум до ~10000-20000 iops на запись при QD=128 на 1 OSD.
|
||||||
|
- На чтение показатели примерно в 2-2.5 раза лучше: QD=1 ~2000 iops (максимум до ~4000), QD=128 ~20000, максимум до 50000.
|
||||||
|
- Естественно, показатель QD=128 не может быть больше, чем показатель самого диска :). Но так как хорошие SSD в параллельном режиме обычно быстрые — этого не замечаешь.
|
||||||
|
- Создав несколько OSD на одном диске, можно умножить число QD=128 iops на число OSD (пока диск позволяет). Естественно, ценой аналогичного увеличения жора CPU.
|
||||||
|
- Скорость линейного чтения/записи примерно равна скорости линейного чтения/записи самого диска.
|
||||||
|
- Кардинальной разницы по iops между SATA SSD и даже NVMe, если у обоих есть конденсаторы — нет. Это не отменяет того, что NVMe лучше, но на случайном доступе это заметить трудно.
|
||||||
|
- На актуальных SSD чтение QD=1 часто бывает медленнее записи QD=1, так как писать можно в быстрый кэш, а читать можно только из реальной памяти. Разница бывает примерно такая: на чтение при QD=1 8000 iops, а на запись 40000 iops.
|
||||||
|
|
||||||
|
Итоговые показатели:
|
||||||
|
|
||||||
|
- Линейное чтение из кластера = Число OSD * MB/s одного OSD
|
||||||
|
- Линейная запись в реплицированный пул = Число OSD / Репликация * MB/s одного OSD
|
||||||
|
- Линейная запись в EC-пул = Число OSD / (K+M) * K * MB/s одного OSD
|
||||||
|
- С iops всё сложнее, так как репликация вносит нелинейный эффект в масштабирование. Но, условно говоря:
|
||||||
|
- iops QD=1 — усредняются по всем OSD, а iops QD=128 — суммируются
|
||||||
|
- При этом на 1 RBD клиента можно получить лишь до ~30000 iops на чтение и ~15000 iops на запись
|
||||||
|
- Естественно, если что-то упирается в сеть — соответствующая цифра обрезается показателем сети
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Картина маслом «Тормозящий кэш»
|
||||||
|
|
||||||
|
### O_SYNC vs fsync vs hdparm -W 0
|
||||||
|
|
||||||
|
У SATA и SCSI дисков есть два способа сброса кэша: команда FLUSH CACHE и флаг FUA (Force Unit Access) на команде записи. Первый — это явный сброс кэша, второй — это указание записать операцию на диск, минуя кэш. Точнее, у SCSI оно есть, а с SATA ситуация точно не ясна: в спецификации NCQ бит FUA есть, но по факту FUA большинством дисков вроде как не поддерживается и, соответственно, эмулируется ядром/контроллером (если контроллер не кривой).
|
||||||
|
|
||||||
|
По всей видимости, fsync() отправляет диску команду FLUSH CACHE, а открытие файла с O_SYNC устанавливает бит FUA на все команды записи.
|
||||||
|
|
||||||
|
Есть ли разница? Обычно нет. Но на некоторых контроллерах и/или с некоторыми настройками различия по неустановленным причинам встречаются. И тогда fio -sync=1 и fio -fsync=1 начинают давать разные результаты — возможно, даже на порядки разные результаты.
|
||||||
|
|
||||||
|
Кроме того, у дисков есть команда отключения кэша. Когда он отключен, запросы сброса (fsync) Linux диску не отправляет. Казалось бы, такой режим тоже должен быть эквивалентен выполнению fsync и/или O_SYNC после каждой команды. Но и это не всегда так! На SSD с конденсаторами (то есть серверных моделях с Advanced Power Loss Protection) при отключении кэша iops-ы случайной записи часто вырастают на порядок (например, с 5000 до 40000). Но не всегда, так как это, опять-таки, зависит от контроллера.
|
||||||
|
|
||||||
|
Почему? По-видимому, потому, что команда FLUSH CACHE трактуется диском как «сбрось все кэши» (включая энергонезависимый), а отключение кэша — как «отключи энергозависимый кэш» (а энергонезависимый можешь оставить включенным). Соответственно, запись со сбросом кэша становится медленнее, чем просто отключённый кэш.
|
||||||
|
|
||||||
|
А что с NVMe? В NVMe разнообразие чуть меньше — возможность отключить кэш в спецификации не предусмотрена вообще, но точно так же есть команды FLUSH CACHE и бит FUA. При этом по личным наблюдениям FUA часто игнорируется то ли диском, то ли Linux-ом, и fio -sync=1 выдаёт с NVMe такие же результаты, как и без sync вообще. -fsync=1 при этом ведёт себя как надо и приземляет производительность туда, где ей самое место (на десктопных NVMe — до тех же 1000—2000 iops).
|
||||||
|
|
||||||
|
P.S: Bluestore использует fsync. Filestore использует O_SYNC.
|
||||||
|
|
||||||
|
### Серверные SSD
|
||||||
|
|
||||||
|
Disabling cache is not a joke!
|
||||||
|
|
||||||
|
fio -ioengine=libaio -name=test -filename=/dev/sdb -(sync|fsync)=1 -direct=1 -bs=(4k|4M) -iodepth=(1|32|128) -rw=(write|randwrite)
|
||||||
|
|
||||||
|
**Micron 5100 Eco 960GB**
|
||||||
|
|
||||||
|
**Запись**
|
||||||
|
|
||||||
|
|sync или fsync|bs|iodepth|rw|hdparm -W 1|hdparm -W 0|
|
||||||
|
|---|---|---|---|---|---|
|
||||||
|
|sync|4k|1|write|612 iops|22200 iops|
|
||||||
|
|sync|4k|1|randwrite|612 iops|22200 iops|
|
||||||
|
|sync|4k|32|randwrite|6430 iops|59100 iops|
|
||||||
|
|sync|4k|128|randwrite|6503 iops|59100 iops|
|
||||||
|
|sync|4M|32|write|469 MB/s|485 MB/s|
|
||||||
|
|fsync|4k|1|write|659 iops|25100 iops|
|
||||||
|
|fsync|4k|1|randwrite|671 iops|25100 iops|
|
||||||
|
|fsync|4k|32|randwrite|695 iops|59100 iops|
|
||||||
|
|fsync|4k|128|randwrite|701 iops|59100 iops|
|
||||||
|
|fsync|4M|32|write|384 MB/s|486 MB/s|
|
||||||
|
|
||||||
|
**Чтение**
|
||||||
|
|
||||||
|
|bs|iodepth|rw|результат|
|
||||||
|
|---|---|---|---|
|
||||||
|
|4k|1|randread|6000 iops|
|
||||||
|
|4k|4|randread|15900 iops|
|
||||||
|
|4k|8|randread|18500 iops|
|
||||||
|
|4k|16|randread|24800 iops|
|
||||||
|
|4k|32|randread|37400 iops|
|
||||||
|
|4M|1|read|460 MB/s|
|
||||||
|
|4M|16|read|514 MB/s|
|
||||||
|
|
||||||
|
Результаты по чтению не отличаются на hdparm -W 0 и 1.
|
||||||
|
|
||||||
|
**Seagate Nytro 1351 XA3840LE10063**
|
||||||
|
|
||||||
|
Диск заполнен почти полностью, на 90-100 %.
|
||||||
|
|
||||||
|
**Запись**
|
||||||
|
|
||||||
|
|sync или fsync|bs|iodepth|rw|hdparm -W 1|hdparm -W 0|
|
||||||
|
|---|---|---|---|---|---|
|
||||||
|
|sync|4k|1|randwrite|18700 iops|18700 iops|
|
||||||
|
|sync|4k|4|randwrite|49400 iops|54700 iops|
|
||||||
|
|sync|4k|32|randwrite|51800 iops|65700 iops|
|
||||||
|
|sync|4M|32|write|516 MB/s|516 MB/s|
|
||||||
|
|fsync=1|4k|1|randwrite|288 iops|18100 iops|
|
||||||
|
|fsync=1|4k|4|randwrite|288 iops|52800 iops|
|
||||||
|
|fsync=4|4k|4|randwrite|1124 iops|53500 iops|
|
||||||
|
|fsync=1|4k|32|randwrite|288 iops|65700 iops|
|
||||||
|
|fsync=32|4k|32|randwrite|7802 iops|65700 iops|
|
||||||
|
|fsync=1|4M|32|write|336 MB/s|516 MB/s|
|
||||||
|
|
||||||
|
**Чтение**
|
||||||
|
|
||||||
|
|bs|iodepth|rw|результат|
|
||||||
|
|---|---|---|---|
|
||||||
|
|4k|1|randread|8600 iops|
|
||||||
|
|4k|4|randread|21900 iops|
|
||||||
|
|4k|8|randread|30500 iops|
|
||||||
|
|4k|16|randread|39200 iops|
|
||||||
|
|4k|32|randread|50000 iops|
|
||||||
|
|4M|1|read|508 MB/s|
|
||||||
|
|4M|16|read|536 MB/s|
|
||||||
|
|
||||||
|
Если не хотите 288 иопс — отключайте кэш.
|
||||||
|
|
||||||
|
### Ceph HDD+SSD
|
||||||
|
|
||||||
|
Дано: 3 компа с 4x 7200rpm SATA HDD, с 1 SSD (десктопным) под систему и ceph-mon и с 1 SSD (старым, но серверным, 25000 iops) под журналы. Не самая быстрая 10-гигабитная сеть — флуд пингом средний RTT (задержка) 0.098ms. Развёрнут Ceph + OpenNebula с KVM. Диски под Ceph отформатированы в Bluestore утилитой ceph-volume (то есть используется LVM). Диски виртуалок лежат в обычном реплицированном ceph pool с size=3.
|
||||||
|
|
||||||
|
Создаём Debian-виртуалку (настройки диска kvm по умолчанию — bus=virtio, cache=none), ставим fio, запускаем в ней тест на задержку транзакционной случайной записи: fio -ioengine=libaio -size=10G -sync=1 -direct=1 -name=test -bs=4k -iodepth=1 -rw=randwrite -runtime=60 -filename=./testfile (или можно не случайной, тогда rw=write, но результат идентичный).
|
||||||
|
|
||||||
|
1. Настройки по умолчанию — все кэши дисков включены (везде hdparm -W 1, в /sys/block/*/queue/write_cache везде write back) — Ж О П А, iops=59, avg lat = 16.88ms
|
||||||
|
2. Отключаю кэш записи SSD с журналами: hdparm -W 0 /dev/sdb — остаётся Ж О П А, iops=58, avg lat = 16.99ms
|
||||||
|
3. Всем LVM-девайсам отключаю кэш записи: for i in /sys/block/dm-*; do echo write through > $i/queue/write_cache; done` — А Ф И Г Е Т Ь, iops=584, avg lat = 1.7ms
|
||||||
|
4. Обратно включаю кэш SSDшке с журналами: hdparm -W 1 /dev/sdb — остаётся iops=582, avg lat = 1.7ms
|
||||||
|
5. Откручиваю все отключения кэшей LVM: for i in /sys/block/dm-*; do echo write back > $i/queue/write_cache; done — обратно жопа, 57 iops, avg lat = 17.2ms
|
||||||
|
6. Опять отключаю кэш журнальным LVM-девайсам: for i in `ls /dev/ceph-journals/lvol*`; do j=readlink $i; echo write through > /sys/block/${j##../}/queue/write_cache; done — никакого улучшения, всё та же жопа (но с ними это точно безопасно, так как они с конденсаторами :))
|
||||||
|
7. Отключаю кэш HDD LVM-разделам (for i in `ls /dev/ceph-*/osd-block*`; do j=readlink $i; echo write through > /sys/block/${j##../}/queue/write_cache; done) — бинго, iops=603, avg lat = 1.65ms
|
||||||
|
8. Ага. Простите. Обнаруживаю, что просто писать куда-то write through небезопасно без hdparm -W 0 /dev/sd*, так как [https://www.kernel.org/doc/Documentation/block/queue-sysfs.txt](https://www.kernel.org/doc/Documentation/block/queue-sysfs.txt) - Writing to this file can change the kernels view of the device, but it doesn’t alter the device state. ок, добавляю for i in /dev/sd?; do hdparm -W 0 $i; done (отключаю все кэши) — результат похуже, iops=405, avg lat = 2.47ms — но это всё равно лучше, чем изначальная жопа.
|
||||||
|
|
||||||
|
Виртуалку, в которой тестировал — даже не перезапускал между тестами.
|
||||||
|
|
||||||
|
 Мораль: отключайте кэш записи всем дискам!
|
||||||
|
|
||||||
|
Частичная разгадка:
|
||||||
|
|
||||||
|
1. ~~В жёстких дисках HGST есть Media Cache~~ (энергонезависимый кэш случайной записи прямо на пластинах) — во-первых, там не HGST, во-вторых, в HGST медиакэш включён всегда и не зависит от hdparm -W 0.
|
||||||
|
2. В жёстких дисках Seagate Enterprise Capacity ST8000NM0055 (коих из общего числа 3) есть встроенный SSD-кэш. И вот он, видимо, действительно включается только при hdparm -W 0.
|
||||||
|
3. Блюстор блокирует запись в журнал записью на HDD. Когда включен спец.кэш, HDD начинает рандомно писать сильно быстрее, и блокировки при сбросе уходят. Действует кэш, естественно, временно — когда он кончится, производительность случайной записи опять упадёт. Однако плюс в том, что в Ceph-е этого, скорее всего, не произойдёт, так как скорость случайной записи ограничивается, собственно, самим Ceph-ом и распределяется по всем дискам кластера :).
|
||||||
|
4. Однако, для обычных дисков без SSD-кэша отключение кэша тоже даёт выигрыш… есть гипотеза, что из-за того же тормоза с bluefs (проверю).
|
||||||
|
|
||||||
|
Более свежие тесты бенчилкой ceph-gobench на том же самом стенде. Версия Ceph Mimic 13.2.2, Bluestore, журналы на SSD.
|
||||||
|
|
||||||
|
osd.1 и osd.3 без выноса журналов на SSD оба показывали 75-80 iops вне зависимости от отключения кэша.
|
||||||
|
|
||||||
|
В таблице показаны однопоточные IOPS с глубиной очереди Q=1 без репликации.
|
||||||
|
|
||||||
|
|Номер OSD|Патч + кэш|Кэш выкл|Кэш вкл|Модель диска|Номер модели|
|
||||||
|
|---|---|---|---|---|---|
|
||||||
|
|osd.0|365|308|226|Seagate Constellation ES.2|ST32000645NS|
|
||||||
|
|osd.1|322|325|234|Hitachi Ultrastar 7K3000|HUA723020ALA640|
|
||||||
|
|osd.2|1278|1392|230|Seagate Enterprise Capacity|ST8000NM0055|
|
||||||
|
|osd.4|198|244|140|Hitachi Ultrastar A7K2000|HUA722020ALA330|
|
||||||
|
|osd.5|251|185|154|Hitachi Ultrastar A7K2000|HUA722020ALA330|
|
||||||
|
|osd.7|1351|1129|253|Seagate Enterprise Capacity|ST8000NM0055|
|
||||||
|
|osd.9|399|315|184|Hitachi Ultrastar 7K3000|HUA723020ALA640|
|
||||||
|
|osd.13|226|212|142|Hitachi Ultrastar A7K2000|HUA722020ALA330|
|
||||||
|
|osd.3|393|386|241|Hitachi Ultrastar 7K3000|HUA723020ALA640|
|
||||||
|
|osd.8|340|323|156|Hitachi Ultrastar A7K2000|HUA722020ALA330|
|
||||||
|
|osd.10|1461|1319|273|Seagate Enterprise Capacity|ST8000NM0055|
|
||||||
|
|osd.14|302|229|135|Hitachi Ultrastar A7K2000|HUA722020ALA330|
|
||||||
|
|
||||||
|
#### Примечания
|
||||||
|
|
||||||
|
Toshiba MG07ACA14TE тоже замечены в подобном поведении, см. обсуждение в списке рассылки: [https://www.spinics.net/lists/ceph-users/msg60753.html](https://www.spinics.net/lists/ceph-users/msg60753.html)
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Почему вообще Bluestore такой медленный?
|
||||||
|
|
||||||
|
 Третья редакция hatespeech’а.
|
||||||
|
|
||||||
|
Вкратце ситуация такова: После того, как хранилище Ceph переписали с упоротой архитектуры с хранением объектов в ФС XFS и дополнительным журналом, в которой, по идее, был дикий оверхед — быстрее (в смысле random write iops) оно практически не стало. **Логичный ответ на вопрос «какого х#ра» такой: то ли XFS на самом деле написана очень хорошо, то ли Bluestore на самом деле написан очень плохо.** Сразу скажу: оба ответа верны. :-)
|
||||||
|
|
||||||
|
Все мы держим в уме, что 1x 7200rpm HDD может выдать примерно 100—120 iops. Дальше нам говорят — ну, там типа журналирование. Ну ок, как мы рассуждаем — ну, типа, есть журнал, есть диск. Значит типа вроде как синхронно записало в журнал, потом асинхронно постепенно перенесло на диск. Значит, берём 100, умножаем на число дисков в кластере, делим на фактор репликации (3), делим на 1.5-2 (данные+журнал), мы же держим в уме, что наверняка там всё асинхронно и оптимизировано… Получаем, скажем, 100 * 9 дисков / 1.5-2 / 3 = 150—200 iops. Запускаем fio iodepth=128 на собранном кластере — ОЙ, 30 iops. Как так?
|
||||||
|
|
||||||
|
Отчаиваемся и по советам знатоков прикручиваем туда SSD под wal+db. И думаем: ну, теперь у нас быстрая SSD с конденсаторами под журналом, латенси записи 50 микросекунд, значит должно быть много иопсов — ну, в устоявшемся режиме хотя бы 300 (9 * 100 / 3). Тестируем. В 1 поток получаем ну… 60 иопс. Во много — где-то 200. Опять плохо.
|
||||||
|
|
||||||
|
Смысл в том, что собственной реализации журнала у блюстора нет, есть очередь отложенной записи, живущая прямо в RocksDB. RocksDB — это LSM keyvalue база, по сути база-журнал. В принципе, это достаточно разумно, так как всё равно нужно журналировать изменения метаданных, которые там держит блюстор. Когда очередь отложенной записи засунута туда же, изменение можно коммитить одной транзакцией (соответственно, одним fsync-ом).
|
||||||
|
|
||||||
|
И в этой схеме есть одно большое отличие от filestore — оно заключается в том, что в filestore журнал работал как буфер для временного повышения нагрузки на запись. Пока в журнале было место, случайная запись была очень быстрой, а журналы обычно делали размеров в несколько гигабайт. В bluestore же «очередь отложенной записи» очень маленькая и сбрасывается через каждые 64 запроса. То есть, bluestore не пишет быстрее, чем в среднем может медленное устройство (HDD).
|
||||||
|
|
||||||
|
Плюс к этому на практике (при просмотре strace) оказывается, что fsync-ов на каждую операцию записи делается не 1, а 2. Второй fsync — это лишняя транзакция записи в журнал BlueFS, сводящаяся к обновлению размера лог-файла RocksDB. Это нафиг не нужно, так как в опциях RocksDB в цефе по умолчанию стоит wal_recovery_mode=kTolerateCorruptedTailRecords и recycle_log_number=4, но это так, потому что без этого у них из-за другого бага корраптятся данные при падении OSD. Что на самом деле исправляется легко, я им даже отправил фикс — [https://tracker.ceph.com/issues/38559](https://tracker.ceph.com/issues/38559) [https://github.com/ceph/ceph/pull/26909](https://github.com/ceph/ceph/pull/26909) - и они даже вроде как обещают его влить. С фиксом на HDD ускорение случайной записи при глубине очереди 1 — двукратное (с 33 % до 66 % возможностей самого HDD, обычно как раз с 33 до 66 иопс). При глубине очереди 128 — почти нулевое.
|
||||||
|
|
||||||
|
ОК, ладно. В конце концов мы решаем — гулять так гулять и собираем кластер на серверных SSD (или вообще NVMe). Думаем — ну теперь-то?!… Бенчим в 1 поток. 300 иопс. Охреневаем окончательно и идём гуглить эту статью :)
|
||||||
|
|
||||||
|
Здесь смысл в том, что в голове у всех сидит мысль «а, ну да, оно медленное, потому что слишком много пишет на диск — диск же относительно медленный, а софт быстрый». А вот хрен. :) оказывается, Ceph довольно сложно разогнать до latency < 1 ms, и виной тому не диски, а сам Ceph. То есть да, Ceph при записи мелкими блоками порождает WA (Write Amplification) 3..5 на каждой OSD — это легко посчитать через тот же strace. Но на хороших SSD это практически не занимает времени, одна операция 4кб записи занимает условно 20 микросекунд. Проблема именно в С++ коде Ceph.
|
||||||
|
|
||||||
|
Причём даже не до конца понятно, что конкретно там тормозит — такое ощущение, что всё целиком. Выявить какие-то «горячие точки» при профилировании трудно, просто при записи выполняется много всякой C++ной мелочи, которая суммарно отъедает достаточно много времени. Одно горячее место — вычисление цифровых подписей пакетов (включено по умолчанию, можно отключить), другое — сериализация/десериализация (код обрабатывает каждое поле пакета, чуть ли не каждый байт, отдельным вызовом функции). Дальше идут уже malloc-и, которых тоже происходят тонны. Причём всё это происходит в несколько потоков. На это ещё навёрнута какая-то странная смесь буферизованного и прямого I/O.
|
||||||
|
|
||||||
|
RocksDB не виновата — её я пробовал бенчить, она быстрая, ~8000 транзакций в секунду на NVMe в 1 поток она даёт и даже масштабируется до ~120000 tps в 256 потоков. А Ceph OSD даже с максимальным параллелизмом на той же NVMe даёт только 10-20 тысяч iops.
|
||||||
|
|
||||||
|
Сеть тоже не виновата — её я пробовал бенчить с помощью nbd (network block device). При прямом доступе диск выдаёт 50000 iops, при пробросе диска с одного сервера на другой через nbd — 8000 iops. То есть, добавленная latency сети — примерно 0.1ms. Это не много.
|
||||||
|
|
||||||
|
И даже Bluestore не совсем виноват. На NVMe Bluestore с некоторыми тюнами всё-таки осиливает завершить запись примерно за 0.3мс. И в то же время код самого Ceph сжирает ещё 0.4мс.
|
||||||
|
|
||||||
|
По сути, нужно было бы добиться ситуации, в которой Ceph бы отъедал 0.1ms и Bluestore ещё 0.1ms. Сеть съест ещё 0.1ms и тогда на хорошей NVMe получится latency ~ 0.33ms, что в 1 поток соответствует 3000 операциям записи в секунду. До локальной SSD это всё равно не дотянуло бы, но, тем не менее, было бы уже очень-очень неплохо. Тогда, скажем, можно будет бороться за CPU: поставив самолётные CPU по 20000$ каждый, настроив ядро и снизив время Ceph+Bluestore ещё в 2 раза, вы получите уже 0.23ms = ~4350 iops. А допилив поддержку Infiniband, может, получите и все 6000 iops. Пока же код не оптимизирован… всё это — мёртвому припарки.
|
||||||
|
|
||||||
|
Авторы сейчас пытаются пилить новую реализацию OSD на асинхронном фреймворке Seastar (Crimson OSD), так что у нас есть теоретические шансы увидеть Ceph, который будет в несколько раз быстрее. Хотя, конечно, там вопрос далеко не только в многопоточности и блокировках — по идее, много съедает именно программная логика. Но так как её они фактически тоже частично переписывают с нуля — она тоже может улучшиться.
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
DPDK и SPDK
|
||||||
|
|
||||||
|
- DPDK = Data Plane Developer Kit, быстрая библиотека от Intel для работы с (в основном) сетевыми устройствами в userspace, без задействования драйверов ядра
|
||||||
|
- SPDK = Storage Performance Developer Kit, основанная на DPDK библиотека для работы с NVMe SSD, тоже в пространстве пользователя. Ещё есть форк libnvme — SPDK, отвязанный от DPDK
|
||||||
|
- DPDK включается через ms_type=async+dpdk
|
||||||
|
- SPDK включается для NVMe-шек передачей в качестве пути девайса spdk:<серийный номер pcie устройства> и ручным созданием OSD по инструкции Manual Deployment
|
||||||
|
- Это в теории — на практике (проверялся Mimic 13.2.x) НИ ХРЕНА не работает, ни DPDK, ни SPDK
|
||||||
|
- С DPDK Ceph «из коробки» даже не собирается — это в общем-то довольно легко исправить, но даже когда добиваешься сборки и запуска — OSD падают после обработки ~50 пакетов
|
||||||
|
- С SPDK Ceph собирается и даже собран по умолчанию — но оно опять-таки не работает — вскоре после запуска OSD просто виснет в пространстве
|
||||||
|
- Code is there, так что, вероятно, всё это можно исправить, если подебажить подольше
|
||||||
|
- Есть сообщения, что SPDK всё-таки работает из коробки, просто не даёт никакого выигрыша производительности. Но мне пока завести его не удалось
|
||||||
|
- Однако в силу неоптимальной реализации самого Ceph ни от DPDK, ни от RDMA ожидать ускорения не приходится. Задержка Ceph в 10-100 раз выше сетевой задержки, так что, уменьшая сетевую задержку, добиться практически нечего. Один чувак даже проводил эксперимент — отрезал код AsyncMessenger-а от всего остального цефа и пробовал бенчить его отдельно: [https://www.spinics.net/lists/ceph-devel/msg43555.html](https://www.spinics.net/lists/ceph-devel/msg43555.html) — и получил всего лишь ~80000 iops.
|
||||||
|
- В перспективе SPDK будет на хрен не нужен, так как в ядро приняли штуку под названием io_uring: [https://lore.kernel.org/linux-block/20190116175003.17880-1-axboe@kernel.dk/](https://lore.kernel.org/linux-block/20190116175003.17880-1-axboe@kernel.dk/) - с ней обычный код прокачивает через Optane-ы практически столько же iops, сколько и SPDK, при заметно меньшем объёме геморроя на поддержку работы с SPDK/DPDK
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
RAID WRITE HOLE
|
||||||
|
|
||||||
|
В RAID-е есть один интересный момент: при отказе диска и одновременном отключении питания RAID 5 может кораптить данные.
|
||||||
|
|
||||||
|
Суть такая: допустим, есть три диска в рейд5. Есть какая-то пара блоков данных A и B. Соответственно на дисках хранятся: A, B, A xor B.
|
||||||
|
|
||||||
|
Теперь представим, что мы пишем в блок B данные B2. Для этого нам надо обновить данные на двух дисках: B -> B2, A+B -> A+B2. Теперь представим, что один из них успел записать, а второй не успел. Тут вырубилось питание и одновременно сдох диск A (или диск сдох от умирания питания, или контроллер повис и ядро в панику упало...). Что мы имеем на дисках?
|
||||||
|
|
||||||
|
?, B2, A+B либо ?, B, A+B2.
|
||||||
|
|
||||||
|
Теперь при попытке восстановить A мы получим A+B+B2 => опа! Покорраптились данные, которые даже не записывались!
|
||||||
|
|
||||||
|
Из-за этого raid всегда делает полный resync после нештатного вырубания питания. И, собственно, такая же потеря данных возможна при отказе диска до завершения resync. mdadm RAID5 в таких ситуациях (когда одновременно потерян диск и массив помечен как грязный) просто отказывается стартовать.
|
||||||
|
|
||||||
|
И именно чтоб этого избежать, в цефе сделано полное журналирование всех данных на уровне отдельных дисков (т.е. OSD). Потому что других способов борьбы с этой проблемой НЕТ, а при работе по сети отказы гораздо более вероятны, чем при работе RAID-массива на локальных дисках. Даже write intent bitmap может только сказать вам, потеряли вы какие-то данные или нет, но не может помочь их восстановить, если они потеряны.
|
||||||
|
|
||||||
|
Так что Ceph надёжнее RAID-а. :) медленнее (на SSD). Но надёжнее и не требует resync-а.
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Краткий экскурс в устройство SSD и флеш-памяти
|
||||||
|
|
||||||
|
Особенность NAND флеш-памяти заключается в том, что пишется она мелкими блоками, а стирается большими. Актуальное соотношение для Micron 3D NAND — страница (page) 16 КБ, блок стирания (block) — 16 или 24 МБ (1024 или 1536 страниц, MLC/TLC соответственно). Случайное чтение страницы быстрое. Запись тоже, но писать можно только в предварительно стёртую область — а стирание медленное, да ещё и число стираний каждого блока ограничено — после нескольких тысяч (типичное значение для MLC) блок физически выходит из строя. В более дешёвых и плотных (MLC, TLC, QLC — 2-4 бита на ячейку) чипах лимит стираний меньше, в более дорогих и менее плотных (SLC, один бит на ячейку) — больше. Соответственно, при «тупом» подходе — если при записи каждого блока его просто стирать и перезаписывать — случайная запись во флеш-память, во-первых, будет очень медленной, а во-вторых, она будет быстро выводить её из строя.
|
||||||
|
|
||||||
|
Но почему тогда SSD быстрые? А потому, что внутри SSD на самом деле есть очень мощный и умный контроллер (1-2 гигагерца, типично 4 ядра или больше, примерно как процессоры мобильников), и на нём выполняется нечто, называемое Flash Translation Layer — прошивка, которая переназначает каждый мелкий логический сектор в произвольное место диска. FTL всё время поддерживает некоторое количество свободных стёртых блоков и направляет каждую мелкую случайную запись в новое место диска, в заранее стёртую область. Поэтому запись быстрая. Одновременно FTL делает дефрагментацию свободного места и Wear Leveling (распределение износа), направляя запись и перемещая данные так, чтобы все блоки диска стирались примерно одинаковое количество раз. Кроме того, во всех SSD некоторый % реального места зарезервирован под Wear Leveling и не виден пользователю («overprovision»), а в хороших серверных SSD этот процент весьма большой — например, в Micron 5100 Max это +60 % ёмкости (в Micron 5100 Eco — всего лишь +7.5 %, 1.92 ТБ SSD содержит 10 чипов NAND по 1.5 терабита и 2 по 768 гигабит).
|
||||||
|
|
||||||
|
Именно из наличия FTL вытекает и проблема с энергонезависимостью и «power loss protection»-ом. Карты отображения секторов — это метаданные, которые при сбросе кэша тоже нужно сбрасывать в постоянную память, и именно этот сброс и вносит торможение в работу настольных SSD с fsync.
|
||||||
|
|
||||||
|
Кстати, из размера страницы 16 КБ следует, что когда вы используете десктопную SSD под мелкую транзакционную перезапись, вы ещё и сильно снижаете срок её жизни, так как при перезаписи по 4 КБ с sync-ами write amplification составляет не менее 16 КБ / 4 КБ = 4. _Примечание: в современных SSD распространена такая вещь, как SLC Cache — использование части той же самой флеш-памяти в SLC-режиме для первых X гигабайт записи. При SLC-записи размер той же страницы, вероятно, уменьшается в 3 раза, так как вместо 3 бит в каждой ячейке хранится только 1. С другой стороны, это всё равно та же страница, которая номинально вмещает 16 КБ, так что как тут считать WA, не совсем ясно._
|
||||||
|
|
||||||
|
Дополнение: когда я попытался кого-то в списке рассылки полечить на тему, что «все SSD делают fsync», мне в ответ кинули статью: [https://www.usenix.org/system/files/conference/fast13/fast13-final80.pdf](https://www.usenix.org/system/files/conference/fast13/fast13-final80.pdf). В общем, суть статьи в том, что в 2013 году нормой было то, что SSD вообще не сбрасывали метаданные на диск при fsync, и при отключении питания это приводило к разным весёлым вещам вплоть до (!!!) полного отказа SSD.
|
||||||
|
|
||||||
|
Есть экземпляры старых SSD без конденсаторов (OCZ Vector/Vertex), которые при этом выдают большие iops на запись с fsync. Как это возможно? Неизвестно, но есть предположение, что суть как раз в небезопасности записи. Принцип работы флеш-памяти за последние годы вроде как не менялся — в SSD как раньше был FTL, так и сейчас FTL. Как достигнуть быстрой записи, если постоянно сбрасывать на диск карты трансляции — хз… наверное, если только сделать некое подобие лог-структурированной ФС внутри — писать всё время вперемешку метаданные и данные. Но при этом, по идее, при старте всё это «добро» придётся сканировать и старт/монтирование станет долгим. А в SSD долгого монтирования вроде как нет.
|
||||||
|
|
||||||
|
Ну и, собственно, «power loss protection», видимо, бывает простой, а бывает advanced. Простой означает просто «мы корректно делаем fsync и не сдохнем при отключении питания», а advanced означает наличие конденсаторов и быструю безопасную запись с fsync. Сейчас, в 2018—2019 годах, «обычный» PLP, похоже, всё-таки стал нормой и при отключении питания большая часть SSD терять данные и умирать уже не должна.
|
||||||
|
|
||||||
|
### Бонус: USB-флешки
|
||||||
|
|
||||||
|
А почему тогда USB-флешки такие медленные? Случайная запись на флешку 512-байтными (или 4 Кб) блоками обычно идёт со скоростью 2-3 iops. А флеш-память там примерно та же, что в SSD — ну, более дешёвые и мелкие чипы с меньшими размерами страницы и блока (часто 4 КБ страница и 4 МБ блок), но принцип тот же и разница в скорости не на порядки. Ответ кроется в том, что на флешках тоже есть FTL (и даже Wear Leveling), но по сравнению с SSD-шным он маленький и тупой. У него слабый процессор и мало памяти. Из-за малого объёма RAM контроллеру флешки, в отличие от контроллера SSD, негде хранить полную таблицу сопоставления виртуальных и реальных секторов — поэтому отображаются не сектора, а крупные блоки где-то по мегабайту или больше, и при записи есть лимит на количество «открытых» блоков. Как это происходит:
|
||||||
|
|
||||||
|
- Допустим, вы пишете в сектор X.
|
||||||
|
- Контроллер отображает блок, которому принадлежит этот сектор, на реальный блок, и «открывает» его — выделяет пустой блок, запоминает, что он «дочерний» для открытого и записывает туда один изменённый вами сектор.
|
||||||
|
- Таким макаром можно открыть максимум N разных блоков; число N обычно очень маленькое — от 3 до 6.
|
||||||
|
- Дальше если вы пишете следующий сектор из уже открытого блока — он просто записывается в его дочерний блок (что быстро).
|
||||||
|
- Если же следующий записываемый сектор принадлежит другому блоку — какой-то из открытых блоков приходится закрывать и «сливать» содержимое дочернего блока с оригинальным.
|
||||||
|
|
||||||
|
Для копирования больших файлов на флешку, отформатированную в любую из стандартных файловых систем, двух блоков достаточно: в один открытый блок пишутся данные, во второй — метаданные записываемого файла. Запись последовательная, всё быстро. А вот при случайной записи вы перестаёте попадать в уже «открытые» блоки и каждая операция записи превращается в полное стирание. Тут-то и начинаются тормоза…
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Пример теста от Micron
|
||||||
|
|
||||||
|
Пример самолётного сетапа от Micron с процами по полляма (2x Xeon Platinum 8168), 2x100-гбит сетью (точнее 2x2x100, так как 2 карты по 2 порта) и 10x топовыми NVMe (с конденсаторами, ага) в каждом узле, 4 узла, репликация 2x: [https://www.micron.com/resource-details/30c00464-e089-479c-8469-5ecb02cfe06f](https://www.micron.com/resource-details/30c00464-e089-479c-8469-5ecb02cfe06f)
|
||||||
|
|
||||||
|
Всего 367011 iops на запись в пике на весь кластер, при 100 % загрузке CPU. Казалось бы, довольно много, но если поделить 367000/40 osd — получится 9175 иопс на 1 osd. С учётом репликации на диски нагрузка двойная, выходит, 18350 иопс. Ок, журналы тоже удваивают нагрузку, итого — 36700 iops на запись смог выжать ceph из одной NVMe… которая сама по спеке может 260000 иопс в одиночку. Вот такой вот overhead.
|
||||||
|
|
||||||
|
Данных по задержкам в 1 поток нет (а было бы интересно узнать).
|
||||||
|
|
||||||
|
Примечание: PDF-ка по ссылке обновлена, новый результат с теми же тюнами, что ниже, составил 479882 iops на запись и 2277453 iops на чтение. Старая [тут](https://yourcmc.ru/wiki/images/c/c0/Micron_9200_ceph_3.0_reference_architecture.pdf "Micron 9200 ceph 3.0 reference architecture.pdf"). Что и подтверждает, что разница между Micron 9200 и 9300 для Ceph незаметна.
|
||||||
|
|
||||||
|
### Апдейт
|
||||||
|
|
||||||
|
[https://www.micron.com/-/media/client/global/documents/products/other-documents/micron_9300_and_red_hat_ceph_reference_architecture.pdf](https://www.micron.com/-/media/client/global/documents/products/other-documents/micron_9300_and_red_hat_ceph_reference_architecture.pdf)
|
||||||
|
|
||||||
|
NVMe обновились до Micron 9300 (максимальной ёмкости 12.8 ТБ). iops-ов такие диски дают даже не 260 тыс., а 310 тыс. Всё остальное осталось прежним. Итого 100 клиентами на запись сняли 477029 iops. Однако надо понимать, что каждому клиенту при этом досталось лишь 4770 iops. 10 клиентами сняли 294000 iops — то есть на 1 клиента 29400 иопс, что всё-таки поприличней.
|
||||||
|
|
||||||
|
Почему стало лучше? Предположительно, благодаря тюнингу. По сравнению с прошлым тестом они:
|
||||||
|
|
||||||
|
- отключили чексуммы мессенджера (ms_crc_data=false) и чексуммы блюстора (bluestore_csum_type=none)
|
||||||
|
- затюнили rocksdb: bluestore_rocksdb_options = compression=kNoCompression,max_write_buffer_number=64,min_write_buffer_number_to_merge=32,recycle_log_file_num=64,compaction_style=kCompactionStyleLevel,
|
||||||
|
write_buffer_size=4MB,target_file_size_base=4MB,max_background_compactions=64,level0_file_num_compaction_trigger=64,level0_slowdown_writes_trigger=128,
|
||||||
|
level0_stop_writes_trigger=256,max_bytes_for_level_base=6GB,compaction_threads=32,flusher_threads=8,compaction_readahead_size=2MB
|
||||||
|
- 64x32x4 MB memtable (number x merge x size) вместо стандартных 4x1x256 MB. Скорее всего, это и сыграло основную роль. Эффект не совсем очевиден, но, вероятно, это снижает нагрузку на CPU, потому что поиск в 64 маленьких memtable быстрее, чем поиск в 1 (или 4) больших.
|
||||||
|
- сильно изменён max_bytes_for_level_base — с 256 мб он поднят до 6 гб!
|
||||||
|
- добавлены потоки compaction-а.
|
||||||
|
- выдали 14 гб RAM каждому OSD
|
||||||
|
- osd_max_pg_log_entries=osd_min_pg_log_entries=osd_pg_log_dups_tracked=osd_pg_log_trim_min = 10 (хз, по-моему, ничего не даёт)
|
||||||
|
|
||||||
|
Также надо отметить, что:
|
||||||
|
|
||||||
|
- cephx у них уже был отключён. В этот раз зачем-то добавили и отключение подписей — видимо, читали мою статью. Но это нафиг не надо, при отключенном cephx подписи можно уже не отключать.
|
||||||
|
- debug objecter = 0/0 и вообще отключенные дебаги у них тоже уже были
|
||||||
|
- с prefer_deferred_size и min_alloc_size они, видимо, не игрались
|
||||||
|
- обновлённые диски не играют никакой роли гарантированно. 260000 или 310000 iops — для цефа никакой разницы нет.
|
||||||
|
|
||||||
|
### Бонус: висян (vSAN)
|
||||||
|
|
||||||
|
[Micron Accelerated All-Flash SATA vSAN 6.7 Solution](https://media-www.micron.com/-/media/client/global/documents/products/other-documents/micron_vsan_6,-d-,7_on_x86_smc_reference_architecture.pdf)
|
||||||
|
|
||||||
|
Конфигурация серверов:
|
||||||
|
|
||||||
|
- 384 GB RAM 2667 MHz
|
||||||
|
- 2X Micron 5100 MAX 960 GB (randread: 93k iops, randwrite: 74k iops)
|
||||||
|
- 8X Micron 5200 ECO 3.84TB (randread: 95k iops, randwrite: 17k iops)
|
||||||
|
- 2x Xeon Gold 6142 (16c 2.6GHz)
|
||||||
|
- Mellanox ConnectX-4 Lx
|
||||||
|
- Connected to 2x Mellanox SN2410 25GbE switches
|
||||||
|
|
||||||
|
«Соответствует конфигурации VMWare AF-6, по заявлениям дающей от 50K iops чтения на каждый сервер»
|
||||||
|
|
||||||
|
- 2 реплики (аналог size=2 в цефе)
|
||||||
|
- 4 сервера
|
||||||
|
- 4 ВМ на каждом сервере
|
||||||
|
- 8 диска на каждую ВМ
|
||||||
|
- 4 потока на каждый диск
|
||||||
|
|
||||||
|
Суммарный параллелизм ввода/вывода: 512
|
||||||
|
|
||||||
|
100%/70%/50%/30%/0% write
|
||||||
|
|
||||||
|
- «Baseline» (данные умещаются в кэш): 121k/178k/249k/314k/486k iops
|
||||||
|
- «Capacity» (не умещаются): 51k/66k/90k/134k/363k
|
||||||
|
- Задержка равна 1000*512/IOPS миллисекунд во всех тестах (1000мс * параллелизм / iops)
|
||||||
|
- **Нет тестов задержки с низким параллелизмом**
|
||||||
|
- **Нет тестов линейного чтения/записи**
|
||||||
|
|
||||||
|
Заключение:
|
||||||
|
|
||||||
|
- ~3800 iops на запись в пересчёте на каждый диск данных
|
||||||
|
- ~1600 iops на запись в пересчёте на диск, если данные не влезают в кэш
|
||||||
|
- ~15000 iops на чтение в пересчёте на каждый диск данных
|
||||||
|
- ~11400 iops на чтение в пересчёте на диск, если данные не влезают в кэш
|
||||||
|
- Итого: при параллельной нагрузке в данном тесте vSAN смотрится хуже, чем Ceph
|
||||||
|
- С другой стороны, vSAN гиперконвергентный, а Ceph, в идеале, нет — или тормозит сильнее, чем мог бы
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Модели
|
||||||
|
|
||||||
|
- Micron 5100/5200, 9300. Возможно также 5300, 7300
|
||||||
|
- HGST SN260
|
||||||
|
- Intel P4500
|
||||||
|
|
||||||
|
[https://docs.google.com/spreadsheets/d/1E9-eXjzsKboiCCX-0u0r5fAjjufLKayaut_FOPxYZjc](https://docs.google.com/spreadsheets/d/1E9-eXjzsKboiCCX-0u0r5fAjjufLKayaut_FOPxYZjc)
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Резюме
|
||||||
|
|
||||||
|
Резюмируя вышесказанное, для random write iops:
|
||||||
|
|
||||||
|
- Использовать только SSD с конденсаторами. NVMe это тоже касается. Подсказка: 99 % desktop SSD и NVMe конденсаторов не имеют.
|
||||||
|
- …и надо отключать этим SSD кэш (hdparm -W 0), если они SATA!
|
||||||
|
- В случае HDD — полезны HDD со встроенным SSD-кэшем. Например, почти все большие Seagate EXOS таковы, хоть на них это часто и не заявлено.
|
||||||
|
- …и им тоже бывает полезно отключить кэш (hdparm -W 0). Только проверьте, что это улучшает iops-ы, а не ухудшает.
|
||||||
|
- SMR HDD не использовать под Ceph никогда.
|
||||||
|
- Отключить powersave: cpupower frequency-set -g performance, cpupower idle-set -D 0
|
||||||
|
- Отключить электронные подписи:
|
||||||
|
cephx_require_signatures = false
|
||||||
|
cephx_cluster_require_signatures = false
|
||||||
|
cephx_sign_messages = false
|
||||||
|
(и монтировать rbd map / cephfs ядерным драйвером с опциями -o nocephx_require_signatures,nocephx_sign_messages)
|
||||||
|
- min_alloc_size=16384 (так и было по умолчанию, в последних версиях поменяли на 4096 и я рекомендовал 4096, а похоже, что зря)
|
||||||
|
- Актуально для версий до Nautilus включительно — [global] debug objecter = 0/0 (там большой тормоз на клиентской стороне)
|
||||||
|
- В QEMU юзать virtio
|
||||||
|
- Если у вас All-flash кластер и вам критичны либо iops-ы случайной _синхронной_ записи (fsync/O_SYNC, например в случае СУБД), либо суммарные iops-ы _параллельной_ случайной записи, то нужно отключить rbd cache (в qemu опция cache=none). Если не критичны или у вас HDD, лучше поставить cache=writeback.
|
||||||
|
- Чтобы мог работать cache=unsafe, поставить [global] rbd cache writethrough until flush = false
|
||||||
|
- ~~Для HDD-only или Bad-SSD-Only и версий до Nautilus включительно — снять ручник [https://github.com/ceph/ceph/pull/26909](https://github.com/ceph/ceph/pull/26909)~~ - уже влит
|
||||||
|
- Внутри ВМ: mount -o lazytime
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Примечание
|
||||||
|
|
||||||
|
Написанное в статье актуально для версий Ceph, доступных на момент последней правки (см. «История» вверху страницы). Конкретно — 12-15 luminous-octopus. Различия между версиями минимальны, всё пока что актуально. Если вдруг в будущем что-то пофиксят и всё вдруг станет чудесно быстрым — сам побегу обновляться первым и поправлю статью :).
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
См. также
|
||||||
|
|
||||||
|
- [https://www.ixsystems.com/community/resources/list-of-known-smr-drives.141/](https://www.ixsystems.com/community/resources/list-of-known-smr-drives.141/) - список SMR дисков (вероятно, не полный)
|
||||||
|
- [http://vasilisc.com/bluestore-ceph-2017](http://vasilisc.com/bluestore-ceph-2017) - кое-что про bluestore, местами не совсем верно, но тем не менее
|
||||||
|
- [https://amarao-san.livejournal.com/3437997.html](https://amarao-san.livejournal.com/3437997.html) - «IOPS не существует» — сказ о latency
|
||||||
|
|
||||||
|
_Прим.вред — iops существуют, но с обязательным указанием режима тестирования и параллелизма_
|
||||||
|
|
||||||
|
- [https://yourcmc.ru/afr-calc/](https://yourcmc.ru/afr-calc/) - мой калькулятор вероятности потери данных в кластере Ceph в зависимости от размера кластера и схемы отказоустойчивости
|
||||||
|
|
||||||
|
##
|
||||||
|
|
||||||
|
Советы лучших собаководов
|
||||||
|
|
||||||
|
Офлайн балансер:
|
||||||
|
|
||||||
|
ceph osd getmap -o om; osdmaptool om --upmap upmap.sh --upmap-deviation 0; bash upmap.sh; rm -f upmap.sh om
|
||||||
|
|
||||||
|
[Читать на другом языке](https://yourcmc.ru/wiki/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:MobileLanguages/%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph)
|
||||||
|
|
||||||
|
[Последняя правка сделана 2 года назад](https://yourcmc.ru/wiki/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:History/%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph) участником [VitaliyFilippov](https://yourcmc.ru/wiki/Special:UserProfile/VitaliyFilippov)
|
||||||
|
|
||||||
|
- ## YourcmcWiki
|
||||||
|
|
||||||
|
|
||||||
|
- Мобильный
|
||||||
|
- [Стационарный](https://yourcmc.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B8%D0%B7%D0%B2%D0%BE%D0%B4%D0%B8%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D1%8C_Ceph&mobileaction=toggle_view_desktop)
|
||||||
|
- Содержимое доступно в соответствии с [CC-BY-SA](http://creativecommons.org/licenses/by-sa/3.0/), если не указано иное.
|
||||||
|
|
||||||
|
- [Конфиденциальность](https://yourcmc.ru/wiki/YourcmcWiki:%D0%9F%D0%BE%D0%BB%D0%B8%D1%82%D0%B8%D0%BA%D0%B0_%D0%BA%D0%BE%D0%BD%D1%84%D0%B8%D0%B4%D0%B5%D0%BD%D1%86%D0%B8%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D1%81%D1%82%D0%B8 "YourcmcWiki:Политика конфиденциальности")
|
||||||
@@ -0,0 +1,37 @@
|
|||||||
|
Для работы с корневым разделом требуется установить утилиту, так как мы не можем его отмонтировать.
|
||||||
|
|
||||||
|
```
|
||||||
|
apt install cloud-guest-utils
|
||||||
|
```
|
||||||
|
|
||||||
|
Далее увеличиваем раздел при помощи данной утилиты.
|
||||||
|
|
||||||
|
```
|
||||||
|
growpart /dev/sda 2 (номер раздела)
|
||||||
|
```
|
||||||
|
Раздел увеличился, но файловая система об этом не знает. Требуется изменить файловую систему для отображения нового пространства.
|
||||||
|
Посмотреть файловую систему:
|
||||||
|
```
|
||||||
|
df -T
|
||||||
|
```
|
||||||
|
**ext2/ext3/ext4:**
|
||||||
|
```
|
||||||
|
resize2fs /dev/vg_centos/lv_root
|
||||||
|
```
|
||||||
|
**XFS:**
|
||||||
|
```
|
||||||
|
xfs_growfs /dev/sda2
|
||||||
|
```
|
||||||
|
**Reiserfs:**
|
||||||
|
```
|
||||||
|
resize_reiserfs /dev/sdb
|
||||||
|
```
|
||||||
|
|
||||||
|
Если раздел был отмонтирован, монтируем его, например:
|
||||||
|
```
|
||||||
|
mount /dev/sda2 /mnt
|
||||||
|
```
|
||||||
|
Проверяем что все применилось
|
||||||
|
```
|
||||||
|
df -h
|
||||||
|
```
|
||||||
@@ -0,0 +1,13 @@
|
|||||||
|
```
|
||||||
|
[fiotest]
|
||||||
|
rw=randwrite
|
||||||
|
name=fiotest
|
||||||
|
blocksize=4k
|
||||||
|
filename=/mnt/pve/test/write
|
||||||
|
size=100g
|
||||||
|
ioengine=libaio
|
||||||
|
iodepth=1
|
||||||
|
numjobs=1
|
||||||
|
runtime=60
|
||||||
|
direct=1
|
||||||
|
```
|
||||||
@@ -0,0 +1,13 @@
|
|||||||
|
```
|
||||||
|
[fiotest]
|
||||||
|
rw=write
|
||||||
|
name=fiotest
|
||||||
|
blocksize=4k
|
||||||
|
filename=/mnt/pve/test/write
|
||||||
|
size=100g
|
||||||
|
ioengine=libaio
|
||||||
|
iodepth=1
|
||||||
|
numjobs=1
|
||||||
|
runtime=60
|
||||||
|
direct=1
|
||||||
|
```
|
||||||
@@ -0,0 +1,13 @@
|
|||||||
|
```
|
||||||
|
[fiotest]
|
||||||
|
rw=write
|
||||||
|
name=fiotest
|
||||||
|
blocksize=8k
|
||||||
|
filename=/mnt/pve/test/write
|
||||||
|
size=100g
|
||||||
|
ioengine=libaio
|
||||||
|
iodepth=128
|
||||||
|
numjobs=1
|
||||||
|
runtime=60
|
||||||
|
direct=1
|
||||||
|
```
|
||||||
@@ -0,0 +1,5 @@
|
|||||||
|
#tool #mail
|
||||||
|
https://mxtoolbox.com/SuperTool.aspx#
|
||||||
|
|
||||||
|
Сайт для проверки почтового сервера в публичных списках
|
||||||
|
Так же проверяет днс записи
|
||||||
@@ -0,0 +1 @@
|
|||||||
|
Тест -> Поменять местами жилы на флюке -> F2
|
||||||
Reference in New Issue
Block a user