borekboissy / Millesime-2026-4b

huggingface.co
Total runs: 155
24-hour runs: -1
7-day runs: -211
30-day runs: -603
Model's Last Updated: August 27 2026
text-generation

Introduction of Millesime-2026-4b

Model Details of Millesime-2026-4b

Millésime 2026

Millésime 2026 — 4B

Millésime 2026 4B est un modèle de langue de 4 milliards de paramètres, spécialisé pour le français , construit à partir de Qwen/Qwen3-4B-Instruct-2507 .

Il obtient le meilleur score FR-MT-Bench de son panel d'évaluation , devant des modèles de 8B et 9B paramètres, et se place en tête des modèles 4B sur la moyenne des benchmarks français agrégés.


Philosophie du projet Millésime

Le projet Millésime repose sur trois principes :

  1. L'excellence en langue française. Les modèles Millésime visent à surpasser les modèles de taille équivalente sur les principaux benchmarks francophones.
  2. Une gamme complète, avec un accent sur les petits modèles. Le projet vise plusieurs tailles (1.7B, 4B, 14B, 32B). Un effort particulier est porté sur les SLM ( Small Language Models ), qui représentent une part importante des téléchargements sur Hugging Face et répondent à un besoin réel de modèles légers, exécutables localement.
  3. Une chaîne de données propre. Les modèles Millésime ne sont entraînés que sur des données dont les conditions d'utilisation autorisent le fine-tuning . De nombreux projets s'appuient sur des corpus contenant des sorties de modèles dont les conditions d'utilisation interdisent explicitement cet usage ; les datasets du projet Millésime sont filtrés en amont pour écarter ces données.

Caractéristiques
Modèle de base Qwen/Qwen3-4B-Instruct-2507
Paramètres ~4 milliards
Fenêtre de contexte 262 144 tokens
Langue cible Français
Licence Apache 2.0
Mode de génération Sans chaîne de pensée ( non-thinking )

Pipeline d'entraînement

Le modèle est le fruit d'un pipeline en trois phases :

Phase Méthode Données
1 Fine-tuning supervisé ( SFT ) borekboissy/Millesime-2026-SFT
2 Optimisation par préférences ( DPO ) borekboissy/Millesime-2026-comparIA-DPO
3 Fusion de modèles (TIES) Fusion des deux modèles issus des phases 1 et 2

Phase 1 — SFT. L'objectif était d'injecter un maximum de culture générale française : plus de 38 000 exemples répartis sur 14 catégories et 280 sous-catégories (histoire et culture, langue française, droit et administration, sciences, philosophie, raisonnement, écriture et style…), générés synthétiquement puis fact-checkés.

Phase 2 — DPO. Alignement sur des préférences humaines réelles issues de l'arène publique Compar:IA du ministère de la Culture, filtrées pour ne conserver que des paires exploitables (préférence nette, tour unique, français, modèles à licence permissive, ratio de longueur maîtrisé).

Phase 3 — Fusion TIES. Les deux modèles issus des phases 1 et 2 sont fusionnés par la méthode TIES , qui combine leurs apports respectifs — connaissances françaises d'un côté, alignement sur les préférences de l'autre — en limitant les interférences entre les deux jeux de deltas de poids.


Résultats
FR-MT-Bench

L'évaluation FR-MT-Bench a été réalisée avec GPT-5.6-Sol comme juge LLM . Pour limiter le risque de biais ou d'instabilité du juge, chaque modèle a été évalué deux fois, via deux fournisseurs d'API distincts (OpenAI et OpenRouter). Les deux classements sont strictement identiques, ce qui conforte la robustesse du résultat.

Modèle Juge via OpenAI Juge via OpenRouter
Millésime 2026 4B 6.463 6.475
Chocolatine-2.1-4B 6.306 6.363
Qwen3-4B-Instruct-2507 (modèle de base) 6.256 6.288
Ministral-3-8B-Instruct-2512 6.056 6.113
gemma-3-4b-it 6.044 6.106
Qwen3.5-9B 5.938 5.906
Phi-4-mini-instruct 5.363 5.375
Qwen3.5-4B 4.756 4.806
Lucie-7B-Instruct-v1.1 3.781 3.769

Millésime 2026 4B arrive premier du panel sur les deux évaluations, devant des modèles de 8B et 9B paramètres, et gagne environ +0.20 point sur son modèle de base.

Benchmarks académiques

Évaluations menées avec Lighteval (IFEval-fr, GPQA-fr) et lm-evaluation-harness (French Bench, Global-MMLU-fr).

Modèle IFEval-fr GPQA-fr ARC-C BoolQA Grammaire HellaSwag XWinograd Global-MMLU-fr Moyenne
Ministral-3-8B-Instruct-2512 (8B) 44.7 42.6 56.7 93.3 79.0 70.4 73.5 71.2 68.60
Qwen3.5-9B (9B) 25.7 27.9 51.9 50.0 72.3 69.2 77.1 73.8 63.31
Millésime 2026 4B 69.1 27.4 48.3 90.4 73.1 58.3 67.5 65.0 63.09
Qwen3.5-4B 66.7 20.3 45.9 50.0 73.9 62.6 74.7 70.0 62.78
Chocolatine-2.1-4B 68.6 23.9 48.0 88.8 71.4 58.1 66.3 64.5 61.84
Qwen3-4B-Instruct-2507 (modèle de base) 68.2 24.4 47.2 87.6 71.4 56.8 67.5 63.0 60.86
Phi-4-mini-instruct 37.9 31.0 48.8 88.8 69.7 58.9 77.1 59.8 59.46
gemma-3-4b-it 61.9 28.9 50.9 50.0 71.4 63.4 77.1 57.8 57.36
Lucie-7B-Instruct-v1.1 (7B) 21.3 21.8 43.6 54.5 82.4 53.5 67.5 48.5 48.31

La colonne « Moyenne » est une moyenne simple, non pondérée, de l'ensemble des métriques disponibles (y compris le détail par domaine de Global-MMLU-fr). Elle est indicative et ne doit pas être lue comme un score composite normalisé.

Lecture des résultats. Millésime 2026 4B est le meilleur modèle 4B du panel et devance également Lucie-7B. Il obtient le meilleur score IFEval-fr de tout le panel (69.1) , soit une nette avance sur le suivi d'instructions en français. Il reste devancé sur la moyenne globale par Ministral-3-8B (8B) et, très marginalement, par Qwen3.5-9B (9B) — deux modèles deux fois plus gros — principalement sur les tâches de connaissance pure (GPQA-fr, Global-MMLU-fr).

Protocole d'évaluation

Tous les modèles ont été évalués avec la chaîne de pensée désactivée ( non-thinking ). Plusieurs benchmarks imposent une limite de tokens en sortie que les modèles à raisonnement explicite consommaient parfois intégralement dans leur chaîne de réflexion, sans produire de réponse finale exploitable. Désactiver le raisonnement garantit une comparaison équitable entre tous les modèles du panel.


Empreinte carbone

L'empreinte de chaque phase d'entraînement a été mesurée avec la librairie Python CodeCarbon . Les relevés bruts sont disponibles dans le répertoire emissions/ de ce dépôt ( phase1.csv , phase2.csv , phase3.csv ).

Phase Durée Énergie consommée Émissions
Phase 1 — SFT 55.9 min 1.716 kWh 634 g CO₂eq
Phase 2 — DPO 62.2 min 1.732 kWh 640 g CO₂eq
Phase 3 — Fusion TIES 1.1 min 0.019 kWh 7 g CO₂eq
Total 1 h 59 3.47 kWh 1.28 kg CO₂eq

Matériel utilisé : 4 × NVIDIA B200, Intel Xeon Platinum 8559C (192 cœurs), 1996 Go de RAM — instance cloud localisée aux États-Unis.

À titre de comparaison, l'entraînement complet de ce modèle représente une empreinte de l'ordre de celle d'une dizaine de kilomètres parcourus en voiture thermique. La fusion TIES (phase 3), en particulier, est quasi gratuite en énergie : elle ne nécessite aucun entraînement, seulement une combinaison arithmétique des poids.


Utilisation
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "borekboissy/Millesime-2026-4b"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
)

messages = [
    {"role": "user", "content": "Explique-moi l'origine de l'expression « tomber dans les pommes »."},
]

inputs = tokenizer.apply_chat_template(
    messages,
    add_generation_prompt=True,
    return_tensors="pt",
).to(model.device)

outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.8)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))

Le modèle fonctionne en mode non-thinking : il répond directement, sans chaîne de raisonnement explicite.


Limitations et axes d'amélioration

Ce modèle est une première itération, et plusieurs limites sont identifiées et assumées :

  • Biais de longueur du dataset SFT. Le corpus Millesime-2026-SFT produit des réponses de longueur comparable qu'il s'agisse d'une question simple ou d'une question complexe. Le modèle a hérité de ce biais et peut se montrer inutilement verbeux sur des questions triviales. La refonte de ce dataset est le chantier prioritaire de la prochaine itération.
  • Absence de raisonnement explicite. Les corpus d'entraînement ne contiennent aucune trace de chaîne de pensée ( thinking ) ; le modèle n'est pas conçu pour ce mode de fonctionnement.
  • Absence de données de tool calling . Les corpus ne contiennent pas d'exemples d'appel d'outils ; les capacités natives du modèle de base sur ce point n'ont pas été renforcées et pourraient avoir été partiellement diluées par le fine-tuning.
  • Connaissances pures. Sur les benchmarks de connaissance encyclopédique (GPQA-fr, Global-MMLU-fr), le modèle reste en retrait par rapport à des modèles deux fois plus gros — une limite structurelle liée à sa taille.
  • Modèle de base. Tous les modèles « Millésime 2026 » reposent sur la famille Qwen3. Les itérations futures pourront s'appuyer sur des générations de modèles de base plus récentes.

Ces axes alimenteront un futur « Millésime 2027 » .


Licence et attributions

Ce modèle est distribué sous licence Apache 2.0 , en cohérence avec la licence du modèle de base Qwen3-4B-Instruct-2507 .

Les données de préférence utilisées en phase 2 sont dérivées du dataset Compar:IA Arena du ministère de la Culture (Etalab 2.0 / CC-BY-4.0), que nous remercions pour la mise à disposition de ce corpus de préférences francophones.


Citation
@misc{boissy2026millesime4b,
  author       = {Boissy, Borek},
  title        = {Millésime 2026 4B: A French-Specialized Small Language Model},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/borekboissy/Millesime-2026-4b}}
}

Auteur / Contact

Borek Boissy

Runs of borekboissy Millesime-2026-4b on huggingface.co

155
Total runs
-1
24-hour runs
-30
3-day runs
-211
7-day runs
-603
30-day runs

More Information About Millesime-2026-4b huggingface.co Model

More Millesime-2026-4b license Visit here:

https://choosealicense.com/licenses/apache-2.0

Millesime-2026-4b huggingface.co

Millesime-2026-4b huggingface.co is an AI model on huggingface.co that provides Millesime-2026-4b's model effect (), which can be used instantly with this borekboissy Millesime-2026-4b model. huggingface.co supports a free trial of the Millesime-2026-4b model, and also provides paid use of the Millesime-2026-4b. Support call Millesime-2026-4b model through api, including Node.js, Python, http.

Millesime-2026-4b huggingface.co Url

https://huggingface.co/borekboissy/Millesime-2026-4b

borekboissy Millesime-2026-4b online free

Millesime-2026-4b huggingface.co is an online trial and call api platform, which integrates Millesime-2026-4b's modeling effects, including api services, and provides a free online trial of Millesime-2026-4b, you can try Millesime-2026-4b online for free by clicking the link below.

borekboissy Millesime-2026-4b online free url in huggingface.co:

https://huggingface.co/borekboissy/Millesime-2026-4b

Millesime-2026-4b install

Millesime-2026-4b is an open source model from GitHub that offers a free installation service, and any user can find Millesime-2026-4b on GitHub to install. At the same time, huggingface.co provides the effect of Millesime-2026-4b install, users can directly use Millesime-2026-4b installed effect in huggingface.co for debugging and trial. It also supports api for free installation.

Millesime-2026-4b install url in huggingface.co:

https://huggingface.co/borekboissy/Millesime-2026-4b

Url of Millesime-2026-4b

Millesime-2026-4b huggingface.co Url

Provider of Millesime-2026-4b huggingface.co

borekboissy
ORGANIZATIONS

Other API from borekboissy