LINAGORA AI
Communs numériques

Luciole : des modèles de langue ouverts, en trois tailles

Luciole n'est pas un produit que nous vous louons, c'est un commun numérique. Les poids sont publiés sous licence Apache 2.0, en 1, 8 et 23 milliards de paramètres, pour couvrir des besoins qui n'ont rien à voir entre eux. Les modèles sont développés par LINAGORA et le consortium OpenLLM France, avec le soutien de BPI France dans le cadre de France 2030.

https://huggingface.co/OpenLLM-France

Pourquoi Luciole compte

Des poids que personne ne peut vous retirer
Licence Apache 2.0 sur les trois tailles. Vous téléchargez, vous auditez, vous réentraînez, vous redistribuez. Aucune autorisation à demander
Un commun numérique européen
Développée par LINAGORA et le consortium OpenLLM France, avec le soutien de BPI France dans le cadre de France 2030. Le modèle appartient à la communauté qui le maintient
Une chaîne ouverte de bout en bout
Modèles de base et modèles instruits, versions quantifiées, méthode d'entraînement documentée. Ce qui rend la conformité AI Act démontrable plutôt que déclarative
Un socle francophone
Les modèles de base ont été entraînés avec une part importante de données françaises, environ trente pour cent, ce qui est rare dans un modèle ouvert de cette taille
Une limite documentée
Les versions instruites 1.1 ont été post-entraînées presque entièrement sur des données anglaises. Nous le disons parce que c'est écrit sur les fiches modèles, et parce qu'un commun se juge sur ce qu'il documente
Intégrée à nos autres briques
Luciole s'articule nativement avec Open-RAG pour l'interrogation de corpus, avec LinTO pour la voix, et se sert en service managé souverain si vous ne voulez pas l'exploiter vous-même

Trois tailles, trois usages

La bonne taille n'est pas la plus grande, c'est la plus petite qui tienne vos exigences. Les trois modèles partagent la même licence et la même fenêtre de contexte.

Luciole-1B-Instruct-1.1
Paramètres
1 milliard
Fenêtre de contexte
16 384 tokens
Licence
Apache 2.0

Pour quoi faire

Le plus léger. Des versions quantifiées au format GGUF permettent de le faire tourner sur une machine modeste, avec Ollama par exemple. Sa taille limite ce qu'il peut mémoriser : à réserver aux tâches cadrées, adossées à une base documentaire.

Luciole-8B-Instruct-1.1
Paramètres
8 milliards
Fenêtre de contexte
16 384 tokens
Licence
Apache 2.0

Pour quoi faire

L'équilibre. Suivi d'instructions sur des tâches variées : mathématiques, sciences, code, conversation, interrogation de corpus et traduction. C'est la taille par défaut d'un assistant interne servi sur une infrastructure raisonnable.

Luciole-23B-Instruct-1.1
Paramètres
23 milliards
Fenêtre de contexte
16 384 tokens
Licence
Apache 2.0

Pour quoi faire

Le plus capable. Post-entraîné en trois phases, dont une avec traces de raisonnement, puis aligné par optimisation directe des préférences. Pour le raisonnement long et la synthèse difficile.

Les modèles de base, publiés eux aussi, acceptent jusqu'à 131 000 tokens de contexte. Les versions instruites ont été entraînées sur des séquences de 16 384 tokens.

Cette brique peut être opérée par nous

Vous pouvez la déployer vous-même, elle est ouverte. Vous pouvez aussi nous la confier : nous l'exploitons à façon, sur des plateformes qui ne relèvent ni du Cloud Act ni d'aucune autre loi d'extraterritorialité.

Découvrir nos services managés

Faire tourner Luciole chez vous, ou nous la confier