21 моделей против одного роутера: кто расколол конфиг быстрее пинга

Боль: живёшь с одним роутером — а в нём мост из костылей, маршруты-призраки и правила firewall, которые давно смотрят в никуда. Сколько глаз нужно, чтобы увидеть всё сразу?

Решение: дал всем одинаковый экзамен. Один и тот же реальный конфиг MikroTik (14.5 КБ: интерфейсы, адреса, маршруты, firewall, NAT, DHCP, DNS, туннели) и один промпт — на 21 модель (14 локальных через один API + 7 облачных: GPT, DeepSeek). Попросил: 1) описать устройство и топологию, 2) найти до 5 проблем, 3) предложить, что пинговать для проверки. Потом сверил ответы с живыми пингами с самого роутера.

Результат — как в жизни: кто-то гений, кто-то галлюцинирует, а трое молчат, пока им не дашь больше токенов.

🏆 Лучшие находки (совпали с реальностью)

💀 Кто облажался

✅ Сверка с реальностью

Модели предложили пинговать: публичный DNS, WAN у меня дома, WAN в офисе, шлюзы LAN, адреса туннелей. Я пропинговал всё с роутера: – Интернет, дом, офис, LAN — ✅ отвечают – Два адреса в туннельной сети — ❌ 100% loss

Совпало с подозрениями моделей: именно туннельные адреса они помечали проблемными.

🥇 Итоговый пьедестал

1) GPT-5 — самая глубокая (нашла то, что другие не увидели)
2) DeepSeek V4 Pro — сильный анализ, 16K reasoning
3) gemma3:latest — лучшая локальная, 4.2K разбора бесплатно

💰 Сколько это стоило

Весь эксперимент — ~$0.23: 148K токенов промпта + 70K вывода, 30 запросов.

Локальные не берут денег, но сожгли 91K токенов дневной квоты одним прогоном. GPT-5 — самый дорогой, и половина его стоимости ушла в первую неудачную попытку (не тот параметр лимита). Урок: дешевле сначала прочитать документацию, чем платить за ошибку 😄

Мораль

Разные модели — разные глаза. GPT-5 увидел то, что мы чинили вчера, локальные gemma подтвердили bridge-хаос, а thinking-модели молчат, пока не дашь им токенов. Ни одна не нашла всё, но вместе покрыли почти все реальные проблемы.

И главное: пустой ответ модели — это не всегда «модель сломана», часто это «не хватило лимита на размышления». Прежде чем списывать — подними max_tokens.


Технические детали (для поста/комментариев)

💰 Стоимость эксперимента

Всего: ~$0.23 (148K токенов промпт + 70K completion, 30 попыток)

Модель/группа Промпт Вывод Попытки Стоимость
GPT-5 9,898 12,875 2 $0.1411
DeepSeek V4 Pro 10,386 10,103 2 $0.0532
GPT-4o 4,950 867 1 $0.0210
DeepSeek Reasoner 10,544 7,905 2 $0.0063
DeepSeek V4 Flash 10,544 10,489 2 $0.0044
DeepSeek Chat (V3) 5,193 1,597 1 $0.0021
GPT-4o mini 4,950 827 1 $0.0012
Локальные (14) 91,489 25,692 16 $0.00 (квота)

Нюансы: локальные жгут дневную квоту токенов (91K промпт за прогон), но не деньги. GPT-5 самый дорогой ($0.14), из них первая неудачная попытка сожгла ~$0.10 впустую. Весь эксперимент дешевле кофе.

📊 Метрики поста: см. фактуру (токены/модели/проверки живьём) — если не знаешь, напиши ~Xk токенов, 2 модели (gpt-4o-mini + gpt-5 редактура)

#openclaw #network