Сделать хороший Code Side-by-Side силами краудсорсинга довольно сложно: сессия оценивается не целиком, вместо полного кода — ошмётки, иногда из совершенно незнакомой оценивающим области. Сегодня разберём статью о новой платформе, которая должна решить эту проблему.
В отличие от популярной Chatbot Arena, BigCodeArena позволяет исполнять код, сгенерированный LLM, и взаимодействовать с ним и его результатами. Авторы отмечают: зачастую системы оценки слишком сосредоточены на том, чтобы код был корректным, но закрывают глаза на другие его аспекты. Например, во многих областях код рисует визуал, и этот визуал должен быть приятным.
Для этого:
• Оценивают сессию целиком с самой первой реплики — весь диалог с LLM часто бывает похож на вайб-кодинг.
• Самое главное — настроили execution sandbox, чтобы оценивающие могли увидеть результаты выполнения кода.
• Добавили возможность редактировать и запускать оцениваемый код, чтобы тестить его устойчивость.
За полгода на BigCodeArena разметили 14 тысяч сырых диалогов с LLM. 4,7 тысячи диалогов, где было больше одной реплики и происходило исполнение кода, собрали в отдельный датасет. Там всё по-честному: кроме выбора, кто лучше ответил, авторы попросили пользователей платформы оценивать корректность, эффективность, читаемость, удобство поддержки и UI/UX-кода. Собранные диалоги помогли объективно оценить, какие из моделей лучше работает ассистентами в разных областях и отдельно сравнить их как оценщиков кода.
Оценщиков кода в дальнейшем используют для того, чтобы масштабировать ту самую тяжёлую краудсорсинговую разметку. Из исследования видно, что добавление исполнения кода в контекст позволяет оценщикам точнее сравнивать два диалога-сессии.
В рейтинге моделей, лучше всего справляющихся с оценкой кода, нет ничего неожиданного: победили сильнейшие. Их никак не файнтьюнили, всё работает на обычных промптах.
Платформа BigCodeArena доступна на GitHub, датасет — на HuggingFace.
Разбор подготовил
Душный NLP