Présentation et objectifs
Ollaya est une plateforme open‑source qui permet d’exécuter localement des modèles de décision, c’est‑à‑dire des réseaux capables de fournir une réponse calibrée à une question à choix, un score ou un oui/non en un seul passage avant. Le serveur démarre par défaut sur 127.0.0.1, fonctionne avec ONNX Runtime sur CPU ou sur GPU NVIDIA, et ne facture aucun token ni aucune utilisation, ce qui élimine les coûts récurrents des API cloud. La confidentialité est garantie : les tickets, e‑mails ou messages restent sur la machine où ils sont traités.
Architecture, compatibilité TypeSafe et déploiement
Ollaya expose les points d’accès /v1/systemone et /v1/models avec les mêmes schémas de requête et de réponse que l’API TypeSafe. Ainsi, le SDK Python TypeSafe 0.7.1 fonctionne sans modification en pointant simplement les variables d’environnement :
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local
export TYPESAFE_DEFAULT_MODEL=layaUne requête curl typique montre la structure JSON attendue et la réponse contenant le choix et la confiance :
curl http://localhost:11435/v1/systemone -d '{
"model":"laya",
"state":"Can I get an invoice for last month?",
"questions":{
"intent":{
"type":"choice",
"instructions":"What does the customer want?",
"criteria":{
"invoice":"Needs an invoice or receipt",
"refund":"Wants money back",
"other":"Anything else"
}
}
}
}'
Response
{
"model":"laya:en",
"answers":{
"intent":{
"type":"choice",
"choice":"invoice",
"confidence":0.9547,
"probabilities":{"invoice":0.9698,"refund":0.0172,"other":0.013}
}
},
"usage":{"input_tokens":43,"output_tokens":0}
}Le même binaire ollaya sert de client CLI, d’application de bureau (macOS, Windows, Linux) et d’image Docker (amd64 et arm64). Les installateurs détectent la présence d’un driver NVIDIA R580+ et chargent automatiquement les bibliothèques CUDA 13 ; en l’absence de GPU compatible, le modèle s’exécute sur le CPU.
Modèles disponibles et performances mesurées
Le catalogue comprend : laya (322 M / 421 M paramètres, le plus rapide), decider (0.75 B / 1.9 B, le plus précis), nli (396 M / 435 M), gliclass (439 M), qwen3guard (0.6 B) et von (395 M, contexte 8 k tokens). Sur un RTX 4090, une requête de cinq questions à laya se termine en 8‑10 ms (FP16), tandis que decider :2b atteint 190 ms. Le même flux via l’API hébergée TypeSafe montre un temps médian de 236‑276 ms, incluant la latence réseau. Ces mesures proviennent de benchmarks publics (AbdelStark/jev‑benchmarks, nibzard/decision‑model‑benchmark) et sont présentées comme des ordres de grandeur comparatifs.
Confidentialité, calibration et modèle d’usage
Chaque modèle embarque une calibration probabiliste propre, permettant d’appliquer des seuils de décision directement sur le champ confidence. Un Modelfile peut être ré‑entraîné sur des données labellisées pour affiner cette calibration. Les réponses incluent également un champ probability et, le cas échéant, des métriques de risque (ex. : 0.15 destructive, 0.53 on_task) comme illustré dans l’exemple CLI : ollaya run decider --preset agent '{"request":"Fix the typo in README.md","command":"git push --force origin main"}'. Cette transparence sur les scores facilite l’intégration dans des pipelines automatisés où la perte de travail local ou les actions destructrices doivent être limitées.