в чате рядом человек посчитал: за неделю на максимальной подписке за 170$ он сжёг примерно столько же, сколько на 5 кодексах по 100$. ему ответили: некорректное сравнение, токены разные, там модель, кэш и вообще
и правы оба. просто мерить нечем
смотри, как это выглядит со стороны того, кто платит
есть тариф за 20$, сколько там токенов, неизвестно. есть за 100$ и за 200$, на них написано x5 и x20
x5 от чего? от неизвестного
множитель есть, базы нет. как «в пять раз больше!» на упаковке, где не указаны граммы. и держать его ровным никто не обещал: бесплатный недельный лимит я сжёг где-то за час, тариф за 30$ прожил часа два-три, а до потолка самого дорогого третью неделю добраться не могу
считать токены? умные люди уже посчитали, сколько подписка реально отдаёт, только это не обещание провайдера, а замер одного человека за одну неделю
сравнить по API-ценам? почти вся моя работа идёт через подписку, где цифры взяты вообще из другого места. считаю не то, что покупаю
а потом выходит новая модель и говорит: нам на ту же задачу нужно в 4 раза меньше токенов, и стоим мы в 3 раза дешевле. и шкала опять поехала
в общем я перестал сравнивать вход и меряю выход, максимально тупо:
🔹 время на задачу. одно и то же кодекс делал полчаса, а грок 2-3 минуты. да, я реально сижу с секундомером: 3m17s против 2m33s 😁 🔹 сделал или не сделал, с короткой пометкой почему 🔹 хватило лимита на день и на неделю или нет, на уровне да/нет по каждому тиру
из этого собирается цена тарифа, его примерная ёмкость (сколько работы влезает, пока не упрёшься) и примерная окупаемость (сколько дел я на эти деньги закрыл)
точность так себе, но с этим уже можно работать. вышла новая классная(?) модель, видно, стоит ли ради неё переезжать. смотришь на два тарифа, видно, комбинировать их или взять один потолще
и тут выяснилось, что у самого дешёвого тарифа есть отдельная польза: это уже не урезанная версия, а типа прибор. берёшь минимальный, гоняешь на нём свои задачи, получаешь базу, с которой уже можно сравнивать всё остальное
так я и переехал с клода на кодекс, потом обратно, потом на грок, по пути перещупав почти всё, что выходило, от кими и глм до локально-маргинальных штук
кто-то скажет «ну это не бенчмарк, это все неточно и примерно и вообще не аргумент». ну да, это мера про меня, а не про их х20