xiaoping`S学习笔记

大模型优化
汇集模型量化、剪枝、蒸馏等核心技术,让大模型跑得更快、更省、更稳
行业信息

大模型推理效率和成本优化手段与GPU利用率优化手段

大模型提高推理效率和成本优化 仅面向应用层: 优化大模型推理的效率和成本是一个系统工程,涉及模型、硬件、软件和策略等多个层面: 一、模型架构与权重层面优化(最根本的优化,也可能会影响效果) 这类优化旨在让模型本身变得“更轻、更快”。 模型量化 做法:将模型权重和激活值从高精度(如FP32)转换为低精度(如FP16、BF16、INT8,甚至INT4)。 效果: 显存占用减半及以上:FP16比FP32小一半,INT8再小一半。 计算速度提升:现代硬件(如GPU的Tensor Cores、CPU的AI指令集)对低精度计算…

2025年9月7日 779点热度 0人点赞 阅读全文
最新文档分类
  • AI-study
  • Aigc-agent
  • B端产品
  • 产品工具篇
  • 产品生命周期
  • 好好学习
  • 技术积累
  • 日常攻略
  • 行业信息
  • 随笔记录
最新 热点 随机
最新 热点 随机
LLM 模型多维度路由调度 AgentScope 源码架构分析报告 Agent协作:A2A (Agent-to-Agent) 协议详解 Agent协作:Agent与用户交互A2UI (Agent-to-User Interface) 协议详解 ‌Harness工程:Hermes-Agent 源码与架构分析报告 ‌Harness 工程:火山引擎 ArkClaw 架构与运行机制研究
AgentScope 源码架构分析报告Agent协作:Agent与用户交互A2UI (Agent-to-User Interface) 协议详解‌Harness工程:Hermes-Agent 源码与架构分析报告Agent协作:A2A (Agent-to-Agent) 协议详解LLM 模型多维度路由调度
马化腾是如何看待腾讯的 ToB 业务呢? 林彪教我怎样当师长 管理课程日常学习纪要 下一代图像压缩格式科普---HEIF 与AVIF格式 职业规划:非线性增长 全栈产品经理全栈产品经理具备更高级的能力体系
标签聚合
AI框架 AI技术对比 技术架构 智能体交互 AI模型 大模型智能体 模型训练方法 智能体分级 多模态交互 GPU部署 智能决策 大模型应用

COPYRIGHT © 2026 75live.com. ALL RIGHTS RESERVED.

Theme Kratos Made By Seaton Jiang