YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

🏷️ NuTag — Named Entity Recognition Model

NuTag est un modèle de reconnaissance d'entités nommées (NER) basé sur NuNER-BERT-v1.0, développé par NuMind, quantifié au format GGUF pour une exécution locale légère et efficace.


📋 Informations générales

Attribut Détail
Nom NuTag
Architecture BERT (Bidirectional Encoder Representations from Transformers)
Tâche Token Classification / Named Entity Recognition (NER)
Langue Anglais 🇬🇧
Format GGUF (llama.cpp compatible)
Licence Voir dépôt original NuMind

🎯 À quoi sert NuTag ?

NuTag analyse un texte brut et identifie automatiquement les entités nommées qu'il contient. Il ne génère pas de texte — il étiquette les éléments importants.

Entités détectées

Étiquette Type Exemple
PER Personne Elon Musk, Marie Curie
ORG Organisation Tesla, ONU, Google
LOC Lieu géographique Paris, Maroc, Sahara
DATE Date / Période 12 janvier 2024, en 2003
MONEY Montant financier 6,5 millions de dollars
MISC Divers iPhone 15, COVID-19

💡 Exemple d'utilisation

Texte en entrée :

Elon Musk a fondé Tesla à Palo Alto en 2003 avec un investissement de 6,5M$.

Sortie NuTag :

[
  { "entity": "PER",   "word": "Elon Musk",  "score": 0.998 },
  { "entity": "ORG",   "word": "Tesla",      "score": 0.995 },
  { "entity": "LOC",   "word": "Palo Alto",  "score": 0.991 },
  { "entity": "DATE",  "word": "2003",       "score": 0.987 },
  { "entity": "MONEY", "word": "6,5M$",      "score": 0.976 }
]

🚀 Installation & Usage

Option 1 — HuggingFace Transformers (Python)

pip install transformers torch
from transformers import pipeline

ner = pipeline(
    task="ner",
    model="numind/NuNER-BERT-v1.0",
    aggregation_strategy="simple"
)

texte = "Elon Musk a fondé Tesla à Palo Alto en 2003 avec 6,5M$ d'investissement."
resultats = ner(texte)

for entite in resultats:
    print(f"[{entite['entity_group']}] {entite['word']} (score: {entite['score']:.3f})")

Option 3 — LM Studio (interface graphique)

  1. Ouvrir LM Studio
  2. Rechercher ApyHTML19/NuTag

🛠️ Cas d'usage

Domaine Application
📰 Presse & Médias Extraction automatique de personnes, lieux, événements
⚖️ Juridique Identification de parties, dates, montants dans des contrats
🏥 Santé Extraction de médicaments, pathologies, patients
🔐 Cybersécurité Détection d'IPs, domaines, CVE dans des logs
📦 E-commerce Reconnaissance de produits, marques, prix
🔍 Moteur de recherche Indexation sémantique de contenus

⚙️ Caractéristiques techniques

  • Architecture : BERT encoder-only (non génératif)
  • Méthode d'entraînement : Fine-tuning supervisé sur corpus NER multidomaine
  • Tokenisation : WordPiece (vocabulaire BERT)
  • Format GGUF : Quantisation statique par mradermacher
  • Compatible : llama.cpp, LM Studio, Ollama, Jan

⚠️ Limitations

  • Modèle entraîné principalement sur des textes en anglais
  • Ne génère pas de texte — uniquement classification de tokens
  • Les quantisations basses (Q2, Q3) peuvent réduire la précision sur des entités rares
  • Les entités composées (ex: New York City) peuvent être fragmentées selon la tokenisation

🔗 Liens utiles


Downloads last month
-
GGUF
Model size
0.1B params
Architecture
bert
Hardware compatibility
Log In to add your hardware

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support