ИИ-технолог Флагман NP идет набор
ИИ-технолог
Промптинг•5 месяцев

Как выбрать лучшую модель для промпта? Вариант с ИИ-арбитром

Как выбрать лучшую ИИ для генерации

Проблема: часть промптов не срабатывают в моделях не потому, что это слабые промпты, а, наоборот, потому что они максимально «набиты» смыслами и логикой. Они сложны для ИИ, и справится не каждая модель.

Или стилистически по какому-то промпту где-то пишет хуже, где-то лучше. В какой-то модели придерживается запретов, в какой-то – не всегда. 

Словом, дорабатывать промпт «под все модели» не вариант, и нам просто нужно выбрать те нейросети, где он будет оптимально работать.

Решение: взять в арбитры Claude. Объективно – сегодня это самая умная модель (Sonnet и Opus линейки) для подобной работы. Впрочем, на крайний случай подойдут и модели вроде Gemini , DeepSeek, Qwen, если первая недоступна.

А дальше просто:

Шаг 1. Загружаем арбитру наш промпт в диалог и пишем что-то вроде: 

«Дальше я дам в нескольких шагах несколько примеров работ от разных ИИ по этому промпту, изучи, у какого из вариантов оптимальный потенциал и качество выполнения по этому промпту. И скажи – почему. Сначала даешь общие оценки, не сравнивая, когда запрошу отчет, ты его дашь и обоснуешь с с разных сторон без предвзятости и лести. Учитывай, что даже у победителя могут быть огрехи и ошибки в работе, наша цель выявить ПОТЕНЦИАЛЬНО самую мощную генерацию»

Шаг 2. Загружаем варианты (давая им названия типа – «это вариант А»), на каждый ИИ что-то отвечает. В конце – просим выбрать победителя с обоснованием.

Шаг 3. А вот тут самое интересное: если недочеты есть даже у победителя,  мы просим у ИИ предложить улучшения для промпта, которые бы сделали его сильнее и убрали эти недочеты.

Не факт, что предложит оптимально и сразу уберется все. Здесь лотерея, очень многое зависит и от самого промпта и вашего личного мастерства (может дать 3 толковых идеи, а 1 – ерунду, и нужно уметь понять, что это ерунда), но в целом работает толково. Особенно если Claude.

Логичный вопрос – А разве сразу не видно, какая модель лучше справилась?

Не всегда, особенно если промпт действительно сложный. Или же долго вычитывать и сверять. Все же ИИ оценивает по разным параметрам и часто находит то, что вы упустили.

Для самых ортодоксальных мазохистов – можно сделать так в одной модели дважды с разными генерациями. Или же в 2 разных моделях, например, Claude и DeepSeek, а затем сравнить. Вариантов масса.
 

Предыдущая статья

Как вернуть диалог в нормальное русло после галлюцинаций?

Следующая статья

"Болезнь хомяка" в работе с ИИ (и как с этим бороться)

Начать дискуссию

Оставить комментарий