The Latest AIs, every day
AIs with the most favorites on Toolify
AIs with the highest website traffic (monthly visits)
AI Tools by Apps
Discover the Discord of AI
AI Tools by browser extensions
GPTs from GPT Store
Discover The Best Model For AI
Top AI lists by month and monthly visits.
Top AI lists by category and monthly visits.
Top AI lists by region and monthly visits.
Top AI lists by source and monthly visits.
Top AI lists by revenue and real traffic.

Millésime 2026 4B
est un modèle de langue de 4 milliards de paramètres, spécialisé pour le
français
, construit à partir de
Qwen/Qwen3-4B-Instruct-2507
.
Il obtient le meilleur score FR-MT-Bench de son panel d'évaluation , devant des modèles de 8B et 9B paramètres, et se place en tête des modèles 4B sur la moyenne des benchmarks français agrégés.
Le projet Millésime repose sur trois principes :
| Modèle de base |
Qwen/Qwen3-4B-Instruct-2507
|
| Paramètres | ~4 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Langue cible | Français |
| Licence | Apache 2.0 |
| Mode de génération | Sans chaîne de pensée ( non-thinking ) |
Le modèle est le fruit d'un pipeline en trois phases :
| Phase | Méthode | Données |
|---|---|---|
| 1 | Fine-tuning supervisé ( SFT ) |
borekboissy/Millesime-2026-SFT
|
| 2 | Optimisation par préférences ( DPO ) |
borekboissy/Millesime-2026-comparIA-DPO
|
| 3 | Fusion de modèles (TIES) | Fusion des deux modèles issus des phases 1 et 2 |
Phase 1 — SFT. L'objectif était d'injecter un maximum de culture générale française : plus de 38 000 exemples répartis sur 14 catégories et 280 sous-catégories (histoire et culture, langue française, droit et administration, sciences, philosophie, raisonnement, écriture et style…), générés synthétiquement puis fact-checkés.
Phase 2 — DPO. Alignement sur des préférences humaines réelles issues de l'arène publique Compar:IA du ministère de la Culture, filtrées pour ne conserver que des paires exploitables (préférence nette, tour unique, français, modèles à licence permissive, ratio de longueur maîtrisé).
Phase 3 — Fusion TIES. Les deux modèles issus des phases 1 et 2 sont fusionnés par la méthode TIES , qui combine leurs apports respectifs — connaissances françaises d'un côté, alignement sur les préférences de l'autre — en limitant les interférences entre les deux jeux de deltas de poids.
L'évaluation FR-MT-Bench a été réalisée avec GPT-5.6-Sol comme juge LLM . Pour limiter le risque de biais ou d'instabilité du juge, chaque modèle a été évalué deux fois, via deux fournisseurs d'API distincts (OpenAI et OpenRouter). Les deux classements sont strictement identiques, ce qui conforte la robustesse du résultat.
| Modèle | Juge via OpenAI | Juge via OpenRouter |
|---|---|---|
| Millésime 2026 4B | 6.463 | 6.475 |
| Chocolatine-2.1-4B | 6.306 | 6.363 |
| Qwen3-4B-Instruct-2507 (modèle de base) | 6.256 | 6.288 |
| Ministral-3-8B-Instruct-2512 | 6.056 | 6.113 |
| gemma-3-4b-it | 6.044 | 6.106 |
| Qwen3.5-9B | 5.938 | 5.906 |
| Phi-4-mini-instruct | 5.363 | 5.375 |
| Qwen3.5-4B | 4.756 | 4.806 |
| Lucie-7B-Instruct-v1.1 | 3.781 | 3.769 |
Millésime 2026 4B arrive premier du panel sur les deux évaluations, devant des modèles de 8B et 9B paramètres, et gagne environ +0.20 point sur son modèle de base.
Évaluations menées avec Lighteval (IFEval-fr, GPQA-fr) et lm-evaluation-harness (French Bench, Global-MMLU-fr).
| Modèle | IFEval-fr | GPQA-fr | ARC-C | BoolQA | Grammaire | HellaSwag | XWinograd | Global-MMLU-fr | Moyenne |
|---|---|---|---|---|---|---|---|---|---|
| Ministral-3-8B-Instruct-2512 (8B) | 44.7 | 42.6 | 56.7 | 93.3 | 79.0 | 70.4 | 73.5 | 71.2 | 68.60 |
| Qwen3.5-9B (9B) | 25.7 | 27.9 | 51.9 | 50.0 | 72.3 | 69.2 | 77.1 | 73.8 | 63.31 |
| Millésime 2026 4B | 69.1 | 27.4 | 48.3 | 90.4 | 73.1 | 58.3 | 67.5 | 65.0 | 63.09 |
| Qwen3.5-4B | 66.7 | 20.3 | 45.9 | 50.0 | 73.9 | 62.6 | 74.7 | 70.0 | 62.78 |
| Chocolatine-2.1-4B | 68.6 | 23.9 | 48.0 | 88.8 | 71.4 | 58.1 | 66.3 | 64.5 | 61.84 |
| Qwen3-4B-Instruct-2507 (modèle de base) | 68.2 | 24.4 | 47.2 | 87.6 | 71.4 | 56.8 | 67.5 | 63.0 | 60.86 |
| Phi-4-mini-instruct | 37.9 | 31.0 | 48.8 | 88.8 | 69.7 | 58.9 | 77.1 | 59.8 | 59.46 |
| gemma-3-4b-it | 61.9 | 28.9 | 50.9 | 50.0 | 71.4 | 63.4 | 77.1 | 57.8 | 57.36 |
| Lucie-7B-Instruct-v1.1 (7B) | 21.3 | 21.8 | 43.6 | 54.5 | 82.4 | 53.5 | 67.5 | 48.5 | 48.31 |
La colonne « Moyenne » est une moyenne simple, non pondérée, de l'ensemble des métriques disponibles (y compris le détail par domaine de Global-MMLU-fr). Elle est indicative et ne doit pas être lue comme un score composite normalisé.
Lecture des résultats. Millésime 2026 4B est le meilleur modèle 4B du panel et devance également Lucie-7B. Il obtient le meilleur score IFEval-fr de tout le panel (69.1) , soit une nette avance sur le suivi d'instructions en français. Il reste devancé sur la moyenne globale par Ministral-3-8B (8B) et, très marginalement, par Qwen3.5-9B (9B) — deux modèles deux fois plus gros — principalement sur les tâches de connaissance pure (GPQA-fr, Global-MMLU-fr).
Tous les modèles ont été évalués avec la chaîne de pensée désactivée ( non-thinking ). Plusieurs benchmarks imposent une limite de tokens en sortie que les modèles à raisonnement explicite consommaient parfois intégralement dans leur chaîne de réflexion, sans produire de réponse finale exploitable. Désactiver le raisonnement garantit une comparaison équitable entre tous les modèles du panel.
L'empreinte de chaque phase d'entraînement a été mesurée avec la librairie Python
CodeCarbon
. Les relevés bruts sont disponibles dans le répertoire
emissions/
de ce dépôt (
phase1.csv
,
phase2.csv
,
phase3.csv
).
| Phase | Durée | Énergie consommée | Émissions |
|---|---|---|---|
| Phase 1 — SFT | 55.9 min | 1.716 kWh | 634 g CO₂eq |
| Phase 2 — DPO | 62.2 min | 1.732 kWh | 640 g CO₂eq |
| Phase 3 — Fusion TIES | 1.1 min | 0.019 kWh | 7 g CO₂eq |
| Total | 1 h 59 | 3.47 kWh | 1.28 kg CO₂eq |
Matériel utilisé : 4 × NVIDIA B200, Intel Xeon Platinum 8559C (192 cœurs), 1996 Go de RAM — instance cloud localisée aux États-Unis.
À titre de comparaison, l'entraînement complet de ce modèle représente une empreinte de l'ordre de celle d'une dizaine de kilomètres parcourus en voiture thermique. La fusion TIES (phase 3), en particulier, est quasi gratuite en énergie : elle ne nécessite aucun entraînement, seulement une combinaison arithmétique des poids.
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "borekboissy/Millesime-2026-4b"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
)
messages = [
{"role": "user", "content": "Explique-moi l'origine de l'expression « tomber dans les pommes »."},
]
inputs = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.8)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))
Le modèle fonctionne en mode non-thinking : il répond directement, sans chaîne de raisonnement explicite.
Ce modèle est une première itération, et plusieurs limites sont identifiées et assumées :
Millesime-2026-SFT
produit des réponses de longueur comparable qu'il s'agisse d'une question simple ou d'une question complexe. Le modèle a hérité de ce biais et peut se montrer inutilement verbeux sur des questions triviales. La refonte de ce dataset est le chantier prioritaire de la prochaine itération.
Ces axes alimenteront un futur « Millésime 2027 » .
Ce modèle est distribué sous licence
Apache 2.0
, en cohérence avec la licence du modèle de base
Qwen3-4B-Instruct-2507
.
Les données de préférence utilisées en phase 2 sont dérivées du dataset Compar:IA Arena du ministère de la Culture (Etalab 2.0 / CC-BY-4.0), que nous remercions pour la mise à disposition de ce corpus de préférences francophones.
@misc{boissy2026millesime4b,
author = {Boissy, Borek},
title = {Millésime 2026 4B: A French-Specialized Small Language Model},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/borekboissy/Millesime-2026-4b}}
}
Borek Boissy
Millesime-2026-4b huggingface.co is an AI model on huggingface.co that provides Millesime-2026-4b's model effect (), which can be used instantly with this borekboissy Millesime-2026-4b model. huggingface.co supports a free trial of the Millesime-2026-4b model, and also provides paid use of the Millesime-2026-4b. Support call Millesime-2026-4b model through api, including Node.js, Python, http.
Millesime-2026-4b huggingface.co is an online trial and call api platform, which integrates Millesime-2026-4b's modeling effects, including api services, and provides a free online trial of Millesime-2026-4b, you can try Millesime-2026-4b online for free by clicking the link below.
Millesime-2026-4b is an open source model from GitHub that offers a free installation service, and any user can find Millesime-2026-4b on GitHub to install. At the same time, huggingface.co provides the effect of Millesime-2026-4b install, users can directly use Millesime-2026-4b installed effect in huggingface.co for debugging and trial. It also supports api for free installation.
