SOVEREIGN AI RESEARCH & DEVELOPMENT OPEN WEIGHTS · APACHE 2.0

NovAI — Indonesian Language Model Development

102.6M parameters · ~2B Indonesian tokens · Pretrained from newly initialized weights

NovAI (novai-base-102m) adalah model bahasa dasar (foundation language model) yang dibangun dan dilatih dari inisialisasi bobot acak (from scratch) menggunakan korpus Bahasa Indonesia terkurasi ~2 miliar token di atas komputasi GPU NVIDIA A100. KaryaVirtual berfungsi sebagai official project home untuk dokumentasi teknis, artefak model, dan reproduktibilitas riset.

SYSTEM CARD & SPECIFICATIONS

Model Architecture & Hyperparameters

NovAI-Base-102M menerapkan arsitektur Decoder-only Transformer modern dengan Rotary Position Embedding (RoPE), aktivasi SwiGLU, RMSNorm pre-normalization, dan tokenisasi Byte-Pair Encoding (BPE) khusus Bahasa Indonesia.

TOTAL PARAMETERS
102,563,328
~85.2M non-embedding params
TRAINING CORPUS
~2.0 Billion
Indonesian tokens (curated)
COMPUTE HARDWARE
NVIDIA A100
80GB VRAM Tensor Core
TRAINING PARADIGM
Zero Wrapper
Pretrained from Step 0
Hyperparameter Specification Design Rationale / Architectural Details
Architecture Autoregressive Decoder-only Transformer Standard causal language modeling with FlashAttention-2 compatibility
Layers ($N_{layers}$) 12 Transformer Blocks Optimal depth-to-width ratio for sub-150M parameter footprint
Hidden Dimension ($d_{model}$) 768 Standard base embedding representation dimension
Attention Heads ($N_{heads}$) 12 Heads ($d_{head} = 64$) Multi-Head Self-Attention with scaled dot-product attention
Intermediate Dim ($d_{ff}$) 3,072 SwiGLU feed-forward gating network (GLU expansion factor 4.0)
Positional Embeddings RoPE (Rotary Position Embeddings) Relative position encoding preserving rotational token geometry
Normalization RMSNorm ($\epsilon = 1e-5$) Pre-layer normalization for stable gradient flow during cold start
Context Length ($L_{max}$) 2,048 Tokens Sufficient context window for multi-paragraph document generation
Tokenizer & Vocab Size Byte-level BPE · 32,000 Vocab Trained on Indonesian Wikipedia, news, formal law, and conversational text
Precision & Optimizer Mixed Precision FP16 / AdamW $\beta_1=0.9, \beta_2=0.95, \text{weight\_decay}=0.1$, Cosine learning rate schedule

VERIFICATION & TELEMETRY

Live Real-Time Inference (Uncut)

Rekaman pengujian inferensi real-time berdurasi 1:35 menit tanpa simulasi dan tanpa perantara API eksternal. Menunjukkan kelancaran autoregressive token generation dan penataan sintaks Bahasa Indonesia secara native.

LIVE_INFERENCE_DEMO // REAL-TIME RECORDING
● 1:35 UNCUT
EVIDENCE & AUDIT TRAIL
  • Zero External API Calls: Seluruh inferensi berjalan di memory instance lokal tanpa routing ke OpenAI, Anthropic, atau provider luar.
  • Native Indonesian Tokenizer: Rasio kompresi karakter-per-token jauh lebih efisien untuk Bahasa Indonesia dibandingkan tokenizer GPT-4/Llama.
  • Reproducible Weights: Bobot model dipublikasikan secara terbuka di Hugging Face Hub (format PyTorch / Safetensors).
  • Autonomous Corpus Pipeline: Pipeline pembersihan teks, deduplikasi MinHash, filtering kualitas, dan tokenisasi dijalankan mandiri.

DEVELOPER QUICKSTART

Inference & Fine-Tuning Snippets

Gunakan model secara langsung melalui pustaka transformers di Python atau muat bobot safetensors untuk kebutuhan downstream task / fine-tuning Bahasa Indonesia.

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

# 1. Load Indonesian NovAI Foundation Model
model_id = "karyavirtual/novai-base-102m"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype=torch.float16 if torch.cuda.is_available() else torch.float32,
    device_map="auto"
)

# 2. Prompting in Bahasa Indonesia
prompt = "Kecerdasan buatan dan model bahasa di Indonesia berkembang pesat karena"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)

# 3. Autoregressive Text Generation
with torch.no_grad():
    outputs = model.generate(
        **inputs,
        max_new_tokens=64,
        temperature=0.7,
        top_p=0.9,
        repetition_penalty=1.15,
        pad_token_id=tokenizer.eos_token_id
    )

result = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(result)
from transformers import pipeline

# Initialize text-generation pipeline
generator = pipeline(
    "text-generation",
    model="karyavirtual/novai-base-102m",
    tokenizer="karyavirtual/novai-base-102m",
    torch_dtype="auto",
    device_map="auto"
)

output = generator(
    "Indonesia memiliki potensi besar dalam teknologi AI karena",
    max_new_tokens=50,
    temperature=0.75,
    top_k=40,
    repetition_penalty=1.12
)
print(output[0]['generated_text'])
# Clone the official repository
git clone https://github.com/novrian6/novai.git
cd novai

# Create virtual environment & install requirements
python -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt

# Run model inference or evaluation scripts
python -m evaluation.run_benchmarks --model_id karyavirtual/novai-base-102m

💡 Engineering Insight & Sovereign AI Trajectory

"Dibandingkan dengan model raksasa dunia (seperti DeepSeek-V3 dengan 671 miliar parameter atau GPT-4), model mini 102.6M parameter ini tentu memiliki batasan dalam cakupan penalaran dan keluasan pengetahuan ensiklopedis. Namun, proyek ini membuktikan satu hal fundamental: secara kapabilitas teknis murni, talenta Indonesia memiliki kapasitas untuk merancang tokenizer, mengarsiteki Transformer, dan melatih Foundation Model secara mandiri dari step nol."

Tantangan sebenarnya bukan lagi "apakah kita mampu secara teknis?", melainkan seberapa besar komitmen infrastruktur komputasi, penyusunan korpus berdaulat, dan ekosistem riset kolaboratif yang siap kita bangun ke depannya.

NovAI dirilis dengan lisensi open source untuk mendukung riset lanjutan, eksperimen fine-tuning korpus spesifik (Legal Indonesia, Healthcare, Keuangan Syariah, Bahasa Daerah), serta pembuktian kedaulatan teknologi AI di Indonesia.

NN

Nova Novriansyah, MSc, MBA, CCISO, CEH

Founder & AI Architect — KaryaVirtual · Alumni Startup Y Combinator (YC S21) · Google Certified ML Engineer

CITATION / BIBTEX

Cite this project in academic research / technical papers:
@misc{novai2026base102m,
  title={NovAI-Base-102M: Pretraining an Indonesian Language Model from Scratch},
  author={Novriansyah, Nova},
  year={2026},
  publisher={KaryaVirtual},
  howpublished={\url{https://karyavirtual.com/novai}},
  note={Official Project Home & Technical System Card}
}