21 моделей против одного роутера: кто расколол конфиг быстрее пинга
Боль: живёшь с одним роутером — а в нём мост из костылей, маршруты-призраки и правила firewall, которые давно смотрят в никуда. Сколько глаз нужно, чтобы увидеть всё сразу?
Решение: дал всем одинаковый экзамен. Один и тот же реальный конфиг MikroTik (14.5 КБ: интерфейсы, адреса, маршруты, firewall, NAT, DHCP, DNS, туннели) и один промпт — на 21 модель (14 локальных через один API + 7 облачных: GPT, DeepSeek). Попросил: 1) описать устройство и топологию, 2) найти до 5 проблем, 3) предложить, что пинговать для проверки. Потом сверил ответы с живыми пингами с самого роутера.
Результат — как в жизни: кто-то гений, кто-то галлюцинирует, а трое молчат, пока им не дашь больше токенов.
🏆 Лучшие находки (совпали с реальностью)
DHCP-клиент на WAN-порту рядом с PPPoE — если провайдер вдруг выдаст адрес, дефолт-маршрут (distance 1) перебьёт PPPoE и сломает NAT. Нашёл только GPT-5. Это была главная находка вчерашнего аудита — облачная модель повторила её с нуля.
Множественные подсети в одном bridge — три разные /24 на одном мосту. Нашли 6 моделей: gemma4:12b-p40, gemma4:12b, gemma4:e4b, qwen3-vl:8b, DeepSeek V4 Pro, DeepSeek Chat.
Мёртвый маршрут до лаборатории — маршрут на тестовую /24 через несуществующий шлюз. Вспомнил qwen3-coder:latest — и предложил именно его пинговать.
Маршруты «сам в себя» через адрес в туннельной подсети — 12 мёртвых маршрутов, которые мы чистили вчера. Нашли: qwen3-vl:8b-p40, DeepSeek Chat, GPT-5.
check-gateway=none на куче маршрутов — роутер не проверяет шлюзы, мёртвые маршруты висят вечно. Заметил qwen2.5:14b.
Несуществующий address-list wan-mgmt — на него ссылается firewall. Нашёл DeepSeek V4 Pro.
💀 Кто облажался
Три локальные thinking-модели вернули пустой ответ (qwen3:30b, qwen3-vl:8b, deepseek-r1:14b) — не потому что сломаны: весь лимит токенов ушёл в скрытые размышления, а финальный ответ не влез. С maxtokens=16000 все три заговорили. Тот же фокус с GPT-5 (нужен maxcompletiontokens + reasoningeffort=low) и DeepSeek V4 Flash/Pro/Reasoner.
deepseek-coder:6.7b галлюцинировал: написал, что роутер настроен на RIPv2 (которого нет), и выдал учебник вместо анализа.
qwen2.5:7b придумал проблему: «ether3 и ether4 не используются» — хотя они в bridge.
llama3.1:8b-instruct-q4KM упал с 500 — не пережил конфиг.
✅ Сверка с реальностью
Модели предложили пинговать: публичный DNS, WAN у меня дома, WAN в офисе, шлюзы LAN, адреса туннелей. Я пропинговал всё с роутера: – Интернет, дом, офис, LAN — ✅ отвечают – Два адреса в туннельной сети — ❌ 100% loss
Совпало с подозрениями моделей: именно туннельные адреса они помечали проблемными.
🥇 Итоговый пьедестал
1) GPT-5 — самая глубокая (нашла то, что другие не увидели)
2) DeepSeek V4 Pro — сильный анализ, 16K reasoning
3) gemma3:latest — лучшая локальная, 4.2K разбора бесплатно
💰 Сколько это стоило
Весь эксперимент — ~$0.23: 148K токенов промпта + 70K вывода, 30 запросов.
- GPT-5 — $0.14
- DeepSeek V4 Pro — $0.05
- GPT-4o — $0.02
- DeepSeek Reasoner/Flash, Chat, GPT-4o mini — ~$0.01
- Локальные 14 моделей — $0.00 (квота)
Локальные не берут денег, но сожгли 91K токенов дневной квоты одним прогоном. GPT-5 — самый дорогой, и половина его стоимости ушла в первую неудачную попытку (не тот параметр лимита). Урок: дешевле сначала прочитать документацию, чем платить за ошибку 😄
Мораль
Разные модели — разные глаза. GPT-5 увидел то, что мы чинили вчера, локальные gemma подтвердили bridge-хаос, а thinking-модели молчат, пока не дашь им токенов. Ни одна не нашла всё, но вместе покрыли почти все реальные проблемы.
И главное: пустой ответ модели — это не всегда «модель сломана», часто это «не хватило лимита на размышления». Прежде чем списывать — подними max_tokens.
Технические детали (для поста/комментариев)
- Локальные (14): gemma4:12b-p40, qwen3-vl:8b-p40, gemma4:12b, qwen3-vl:8b, gemma4:e4b, gemma3:latest, qwen3-coder:latest, qwen3:30b, qwen2.5:14b, qwen2.5:14b-instruct, qwen2.5:7b, deepseek-r1:14b, deepseek-coder:6.7b, llama3.1:8b
- Облачные (7): GPT-5, GPT-4o, GPT-4o mini, DeepSeek V4 Flash, V4 Pro, Reasoner, Chat (V3)
- Конфиг: 14.5KB, все ключевые секции
- Пустые при малом лимите: qwen3:30b, qwen3-vl:8b, deepseek-r1:14b, DS V4 Flash/Pro/Reasoner, GPT-5 → все ожили с maxtokens≥16000 (gpt-5: maxcompletiontokens + reasoningeffort=low)
- Время: ~30 минут на весь прогон
- Живые пинги: публичный DNS ✅, WAN дома ✅, WAN офиса ✅, LAN ✅, два адреса в туннеле ❌
💰 Стоимость эксперимента
Всего: ~$0.23 (148K токенов промпт + 70K completion, 30 попыток)
| Модель/группа | Промпт | Вывод | Попытки | Стоимость |
|---|---|---|---|---|
| GPT-5 | 9,898 | 12,875 | 2 | $0.1411 |
| DeepSeek V4 Pro | 10,386 | 10,103 | 2 | $0.0532 |
| GPT-4o | 4,950 | 867 | 1 | $0.0210 |
| DeepSeek Reasoner | 10,544 | 7,905 | 2 | $0.0063 |
| DeepSeek V4 Flash | 10,544 | 10,489 | 2 | $0.0044 |
| DeepSeek Chat (V3) | 5,193 | 1,597 | 1 | $0.0021 |
| GPT-4o mini | 4,950 | 827 | 1 | $0.0012 |
| Локальные (14) | 91,489 | 25,692 | 16 | $0.00 (квота) |
Нюансы: локальные жгут дневную квоту токенов (91K промпт за прогон), но не деньги. GPT-5 самый дорогой ($0.14), из них первая неудачная попытка сожгла ~$0.10 впустую. Весь эксперимент дешевле кофе.
📊 Метрики поста: см. фактуру (токены/модели/проверки живьём) — если не знаешь, напиши ~Xk токенов, 2 модели (gpt-4o-mini + gpt-5 редактура)