Проблема: часть промптов не срабатывают в моделях не потому, что это слабые промпты, а, наоборот, потому что они максимально «набиты» смыслами и логикой. Они сложны для ИИ, и справится не каждая модель.
Или стилистически по какому-то промпту где-то пишет хуже, где-то лучше. В какой-то модели придерживается запретов, в какой-то – не всегда.
Словом, дорабатывать промпт «под все модели» не вариант, и нам просто нужно выбрать те нейросети, где он будет оптимально работать.
Решение: взять в арбитры Claude. Объективно – сегодня это самая умная модель (Sonnet и Opus линейки) для подобной работы. Впрочем, на крайний случай подойдут и модели вроде Gemini , DeepSeek, Qwen, если первая недоступна.
А дальше просто:
Шаг 1. Загружаем арбитру наш промпт в диалог и пишем что-то вроде:
«Дальше я дам в нескольких шагах несколько примеров работ от разных ИИ по этому промпту, изучи, у какого из вариантов оптимальный потенциал и качество выполнения по этому промпту. И скажи – почему. Сначала даешь общие оценки, не сравнивая, когда запрошу отчет, ты его дашь и обоснуешь с с разных сторон без предвзятости и лести. Учитывай, что даже у победителя могут быть огрехи и ошибки в работе, наша цель выявить ПОТЕНЦИАЛЬНО самую мощную генерацию»
Шаг 2. Загружаем варианты (давая им названия типа – «это вариант А»), на каждый ИИ что-то отвечает. В конце – просим выбрать победителя с обоснованием.
Шаг 3. А вот тут самое интересное: если недочеты есть даже у победителя, мы просим у ИИ предложить улучшения для промпта, которые бы сделали его сильнее и убрали эти недочеты.
Не факт, что предложит оптимально и сразу уберется все. Здесь лотерея, очень многое зависит и от самого промпта и вашего личного мастерства (может дать 3 толковых идеи, а 1 – ерунду, и нужно уметь понять, что это ерунда), но в целом работает толково. Особенно если Claude.
Логичный вопрос – А разве сразу не видно, какая модель лучше справилась?
Не всегда, особенно если промпт действительно сложный. Или же долго вычитывать и сверять. Все же ИИ оценивает по разным параметрам и часто находит то, что вы упустили.
Для самых ортодоксальных мазохистов – можно сделать так в одной модели дважды с разными генерациями. Или же в 2 разных моделях, например, Claude и DeepSeek, а затем сравнить. Вариантов масса.
