xiaoping`S学习笔记

模型推理
汇集大模型推理部署的实战指南与性能优化技巧,从基础概念到生产级落地,助你掌握LLM规模化推理的核心技术。
AI-study

LLM 模型多维度路由调度

智能摘要 本文全面梳理 LLM 模型路由系统的技术原理与工业实践。核心探讨五大技术路线:规则路由、分类器路由、级联推理、强化学习路由与生成式路由,每一条均有 FrugalGPT、RouteLLM 等顶会论文论证。详细对比火山引擎 Auto Mode 与 OpenRouter 两种代表性的跨模型/跨供应商路由方案,给出分层路由 + 质量-成本联合优化的最佳实践架构。 — 此摘要由AI生成仅供参考。 LLM 模型路由系统深度调研:原理、论文与工业实践 一、概述 随着大语言模型(LLM)的数量和种类爆发式增长,如何自动选…

2026年7月12日 282点热度 0人点赞 阅读全文
AI-study

小白学AI第一节:深入浅出模型推理的重要的概念(PD)第一节

如何在保证低延迟、高吞吐的同时,高效利用GPU资源,避免算力浪费?HuggingFace 推出的 Text Generation Inference(TGI),正是为解决这一痛点而生的开源解决方案。本文基于 HuggingFace 官方博客《LLM Inference at Scale with TGI》,拆解 TGI 的核心原理、架构设计、关键优化技术,并补充实战配置与调优技巧,帮你快速掌握 LLM 规模化推理的落地方法 一、背景说明:LLM 规模化推理的痛点与 TGI 的定位 随着 LLM 在聊天机器人、RAG…

2026年2月14日 653点热度 0人点赞 阅读全文
最新文档分类
  • AI-study
  • Aigc-agent
  • B端产品
  • 产品工具篇
  • 产品生命周期
  • 好好学习
  • 技术积累
  • 日常攻略
  • 行业信息
  • 随笔记录
最新 热点 随机
最新 热点 随机
如何准确的找到工具:万级 Skill 路由生产级方案 SKILL.md 撰写最佳实践 MCP 协议研究:AI 上下文集成的架构与实践指南 LLM 模型多维度路由调度 AgentScope 源码架构分析报告 Agent协作:A2A (Agent-to-Agent) 协议详解
SKILL.md 撰写最佳实践如何准确的找到工具:万级 Skill 路由生产级方案
nginx缓存设置proxy_cache-缓存规则 m3u8文件分析 目标管理:自学课程 面试后端产品经理应该考察的问题 社会为什么内卷 AI比我们快
标签聚合
模型训练方法 技术架构 智能体交互 AI框架 大模型智能体 GPU部署 智能决策 AI技术对比 大模型应用 智能体分级 AI模型 多模态交互

COPYRIGHT © 2026 75live.com. ALL RIGHTS RESERVED.

Theme Kratos Made By Seaton Jiang