↓
zzszmyf
笔记
分类
标签
研究笔记
2024
LoRA 微调全流程实战——用 12 条数据、4 秒钟,把 Gemma 2B 训成特朗普
·
·
研究笔记
研究笔记
LLM
Fine-Tuning
《KIMI K2.5: VISUAL AGENTIC INTELLIGENCE》阅读笔记
·
·
研究笔记
研究笔记
Reinforcement Learning
LLM
高维几何与集中不等式详解
·
·
研究笔记
研究笔记
Math Theory
Drifting Model vs Diffusion:复杂指令理解能力对比
·
·
研究笔记
研究笔记
Diffusion Model
百花齐放的 Diffusion-RL:技术路线综述
·
·
研究笔记
研究笔记
Reinforcement Learning
Diffusion Model
Claude Code Agent Teams 运行机制深度分析
·
·
研究笔记
研究笔记
Reinforcement Learning
Agent Tools
从各家技术文章看26年Agentic RL Infra优化方向
·
·
研究笔记
研究笔记
Reinforcement Learning
AI Infra
Math Theory
←
1
2
↑