OraCore.dev
資源庫新聞比較排行學習
資源庫新聞比較排行學習
← 術語表

Quantization

技術

定義

降低模型權重的數值精度,例如從 32-bit float 降到 4-bit integer,以縮小模型並加速 inference,同時盡量維持準確度。這是本機部署大型模型的重要技術。

相關術語

QLoRA (Quantized LoRA)

結合 4-bit quantization 與 LoRA fine-tuning 的方法,讓 65B 以上參數模型也能在單張消費級 GPU 上 fine-tune。由 Tim Dettmers 等人在 2023 年提出,讓大型模型微調更普及。

Distillation

訓練較小的 student model 去模仿較大的 teacher model。這能產生更輕量的模型,以較低運算成本保留多數能力,常見於 DeepSeek-R1-Zero 與許多生產模型。

Inference

使用已訓練好的模型產生預測或輸出的過程,與更新權重的 training 相對。生產環境最在意 inference 的速度、成本與延遲。

全部術語

AgentAttention MechanismChain-of-ThoughtContext WindowDiffusion ModelDistillationDPO (Direct Preference Optimization)EmbeddingFew-shot PromptingFine-tuningFunction CallingGAN (Generative Adversarial Network)GRPO (Group Relative Policy Optimization)HallucinationInferenceLLM (Large Language Model)LoRA (Low-Rank Adaptation)MCP (Model Context Protocol)MultimodalPrompt EngineeringQLoRA (Quantized LoRA)QuantizationRAG (Retrieval-Augmented Generation)RLHF (Reinforcement Learning from Human Feedback)TemperatureTokenizerTool UseTop-p (Nucleus Sampling)TransformerVector DatabaseZero-shot Prompting

內容

  • 新聞
  • AI 趨勢總覽
  • LLM 模型比較 2026
  • AI 排行與熱門榜單

分類

  • 模型發布
  • AI Agent
  • 技術研究
  • 區塊鏈

工具

  • AI 術語表
  • LLM API 費用計算機
  • AI 發展時間軸 2024–2026
  • 開發者提示詞庫

關於

  • 編輯團隊
  • OG 預覽
  • RSS Feed

© 2026 OraCore.dev

v4.40.3·—