Temper 1.5B это Qwen2.5-Coder-1.5B-Instruct, дообученная на тех же 10 тысячах примеров на Rust, что и Temper 0.5B. Каждый пример написала DeepSeek-V4-Flash, после чего его проверили компилятор и тесты. Обучения с подкреплением на этом шаге не было, оно войдёт в Temper 2.
На стандартном бенчмарке HumanEval-Rust модель с первой попытки решает 50,5% задач. Это больше, чем у вдвое большей Qwen2.5-Coder-3B, и недалеко от моделей на 7B и 9B.
Рис. 1. Процент решённых с первой попытки задач HumanEval-Rust (pass@1, %, 156 задач) в зависимости от размера модели. Шкала параметров логарифмическая. Настройки взяты из BigCode Models Leaderboard: дополнение кода без чат-шаблона, температура 0.2, top_p 0.95 и 50 ответов на задачу. Модели Qwen и StarCoder2 взяты в базовых версиях.
Другие Rust-модели
Среди открытых моделей, которые другие авторы дообучили на Rust, Temper 1.5B уступает только моделям на 7B и 14B.
Рис. 2. Процент решённых с первой попытки задач HumanEval-Rust (pass@1, %) у моделей, дообученных на Rust. Задача подаётся сообщением в чат-шаблоне модели. У Mellum-4b-sft-rust чат-шаблона нет.
Рис. 2. Процент решённых с первой попытки задач HumanEval-Rust (pass@1, %) у моделей, дообученных на Rust. Модель продолжает код без чат-шаблона, как на Рис. 1.
Ограничения
С десяти попыток Temper 1.5B решает 67,0% задач, что почти совпадает с результатом Qwen2.5-Coder-3B (67,4%). Ограничения у модели те же, что у Temper 0.5B. Её учили только на задачах по Rust с просьбами на английском и без режима fill-in-the-middle, к тому же в данных мало задач на асинхронный код и веб-фреймворки.