随笔 - 383  文章 - 0  评论 - 0  阅读 - 35557 

1. torch.no_grad

(1) 用法

with torch.no_grad():
  具体操作

(2) 说明
上例的“具体操作”中均不更新梯度,这样可以节约计算时间和内存。一般用于验证或者测试阶段。

2. param.requires_grad

(1) 用法

p.requires_grad=False

(2) 说明
一般用于将某一层设置为不自动更新梯度,以避免训练模型时对该层调参。

3. model.eval

(1) 用法

model.eval()
具体操作

(2) 说明
模型支持train模式和eval模式,在使用模型之前调用model.eval(),进入eval评估模型,它将改变forward,如禁止dropout,并用统计数据做batch norm。因此,有时train模式和eval模式模型计算的结果不同。

posted on   xieyan0811  阅读(149)  评论(0编辑  收藏  举报
编辑推荐:
· 开发者必知的日志记录最佳实践
· SQL Server 2025 AI相关能力初探
· Linux系列:如何用 C#调用 C方法造成内存泄露
· AI与.NET技术实操系列(二):开始使用ML.NET
· 记一次.NET内存居高不下排查解决与启示
阅读排行:
· 阿里最新开源QwQ-32B,效果媲美deepseek-r1满血版,部署成本又又又降低了!
· 开源Multi-agent AI智能体框架aevatar.ai,欢迎大家贡献代码
· Manus重磅发布:全球首款通用AI代理技术深度解析与实战指南
· 被坑几百块钱后,我竟然真的恢复了删除的微信聊天记录!
· AI技术革命,工作效率10个最佳AI工具
点击右上角即可分享
微信分享提示