NovAI — Indonesian Language Model Development
NovAI (novai-base-102m) adalah model bahasa dasar (foundation language model) yang dibangun dan dilatih dari inisialisasi bobot acak (from scratch) menggunakan korpus Bahasa Indonesia terkurasi ~2 miliar token di atas komputasi GPU NVIDIA A100. KaryaVirtual berfungsi sebagai official project home untuk dokumentasi teknis, artefak model, dan reproduktibilitas riset.
SYSTEM CARD & SPECIFICATIONS
Model Architecture & Hyperparameters
NovAI-Base-102M menerapkan arsitektur Decoder-only Transformer modern dengan Rotary Position Embedding (RoPE), aktivasi SwiGLU, RMSNorm pre-normalization, dan tokenisasi Byte-Pair Encoding (BPE) khusus Bahasa Indonesia.
| Hyperparameter | Specification | Design Rationale / Architectural Details |
|---|---|---|
| Architecture | Autoregressive Decoder-only Transformer | Standard causal language modeling with FlashAttention-2 compatibility |
| Layers ($N_{layers}$) | 12 Transformer Blocks | Optimal depth-to-width ratio for sub-150M parameter footprint |
| Hidden Dimension ($d_{model}$) | 768 | Standard base embedding representation dimension |
| Attention Heads ($N_{heads}$) | 12 Heads ($d_{head} = 64$) | Multi-Head Self-Attention with scaled dot-product attention |
| Intermediate Dim ($d_{ff}$) | 3,072 | SwiGLU feed-forward gating network (GLU expansion factor 4.0) |
| Positional Embeddings | RoPE (Rotary Position Embeddings) | Relative position encoding preserving rotational token geometry |
| Normalization | RMSNorm ($\epsilon = 1e-5$) | Pre-layer normalization for stable gradient flow during cold start |
| Context Length ($L_{max}$) | 2,048 Tokens | Sufficient context window for multi-paragraph document generation |
| Tokenizer & Vocab Size | Byte-level BPE · 32,000 Vocab | Trained on Indonesian Wikipedia, news, formal law, and conversational text |
| Precision & Optimizer | Mixed Precision FP16 / AdamW | $\beta_1=0.9, \beta_2=0.95, \text{weight\_decay}=0.1$, Cosine learning rate schedule |
VERIFICATION & TELEMETRY
Live Real-Time Inference (Uncut)
Rekaman pengujian inferensi real-time berdurasi 1:35 menit tanpa simulasi dan tanpa perantara API eksternal. Menunjukkan kelancaran autoregressive token generation dan penataan sintaks Bahasa Indonesia secara native.
- ✓ Zero External API Calls: Seluruh inferensi berjalan di memory instance lokal tanpa routing ke OpenAI, Anthropic, atau provider luar.
- ✓ Native Indonesian Tokenizer: Rasio kompresi karakter-per-token jauh lebih efisien untuk Bahasa Indonesia dibandingkan tokenizer GPT-4/Llama.
- ✓ Reproducible Weights: Bobot model dipublikasikan secara terbuka di Hugging Face Hub (format PyTorch / Safetensors).
- ✓ Autonomous Corpus Pipeline: Pipeline pembersihan teks, deduplikasi MinHash, filtering kualitas, dan tokenisasi dijalankan mandiri.
DEVELOPER QUICKSTART
Inference & Fine-Tuning Snippets
Gunakan model secara langsung melalui pustaka transformers di Python atau muat bobot safetensors untuk kebutuhan downstream task / fine-tuning Bahasa Indonesia.
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
# 1. Load Indonesian NovAI Foundation Model
model_id = "karyavirtual/novai-base-102m"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.float16 if torch.cuda.is_available() else torch.float32,
device_map="auto"
)
# 2. Prompting in Bahasa Indonesia
prompt = "Kecerdasan buatan dan model bahasa di Indonesia berkembang pesat karena"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
# 3. Autoregressive Text Generation
with torch.no_grad():
outputs = model.generate(
**inputs,
max_new_tokens=64,
temperature=0.7,
top_p=0.9,
repetition_penalty=1.15,
pad_token_id=tokenizer.eos_token_id
)
result = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(result)
from transformers import pipeline
# Initialize text-generation pipeline
generator = pipeline(
"text-generation",
model="karyavirtual/novai-base-102m",
tokenizer="karyavirtual/novai-base-102m",
torch_dtype="auto",
device_map="auto"
)
output = generator(
"Indonesia memiliki potensi besar dalam teknologi AI karena",
max_new_tokens=50,
temperature=0.75,
top_k=40,
repetition_penalty=1.12
)
print(output[0]['generated_text'])
# Clone the official repository
git clone https://github.com/novrian6/novai.git
cd novai
# Create virtual environment & install requirements
python -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
# Run model inference or evaluation scripts
python -m evaluation.run_benchmarks --model_id karyavirtual/novai-base-102m
💡 Engineering Insight & Sovereign AI Trajectory
"Dibandingkan dengan model raksasa dunia (seperti DeepSeek-V3 dengan 671 miliar parameter atau GPT-4), model mini 102.6M parameter ini tentu memiliki batasan dalam cakupan penalaran dan keluasan pengetahuan ensiklopedis. Namun, proyek ini membuktikan satu hal fundamental: secara kapabilitas teknis murni, talenta Indonesia memiliki kapasitas untuk merancang tokenizer, mengarsiteki Transformer, dan melatih Foundation Model secara mandiri dari step nol."
NovAI dirilis dengan lisensi open source untuk mendukung riset lanjutan, eksperimen fine-tuning korpus spesifik (Legal Indonesia, Healthcare, Keuangan Syariah, Bahasa Daerah), serta pembuktian kedaulatan teknologi AI di Indonesia.
CITATION / BIBTEX
@misc{novai2026base102m,
title={NovAI-Base-102M: Pretraining an Indonesian Language Model from Scratch},
author={Novriansyah, Nova},
year={2026},
publisher={KaryaVirtual},
howpublished={\url{https://karyavirtual.com/novai}},
note={Official Project Home & Technical System Card}
}