Italian Journal of Animal Science·9月12日 · 周六论文智慧农业 / 农业物联网阅读 0

Deep reinforcement learning for simulated autonomous heat stress mitigation in dairy cattle

Jan Saro · Jaromír Ducháček · Jana Mazancová 等 5 人

论文解读
65接近精选线
速览

用深度强化学习在仿真中为奶牛个体化热应激缓解做决策支持。

方法

基于MmCows多模态传感器数据,训练四种DQN变体模拟降温决策。

发现

Double DQN奖励最高但策略几乎不干预,与无动作基线无显著差异。

机会点

可引入安全约束与奖励权重敏感性分析,开展田间验证的自主降温系统研究。

影响力8
信息增量18
专业深度17
信源权威13
时效性9

仿真验证的深度强化学习个体化降温决策研究,方法新颖但结论为阴性、未做田间验证,属细分领域前沿探索,可作为智慧畜牧主题聚合素材。

原文摘要

热应激显著制约奶牛的生产性能与福利,损害产奶量和繁殖力。然而,尽管热应激检测与预测技术取得了进展,传统的缓解策略仍依赖于固定阈值,忽视了动物个体差异和累积热负荷。在这项基于仿真的概念验证研究中,我们评估了深度强化学习(DRL)用于个体化热应激决策支持的可行性。利用MmCows数据集的多模态传感器数据,我们开发了一个深度Q网络(DQN)框架用于模拟降温决策。降温干预未在动物身上进行实验性施加;其预期效果通过计算建模为动作特定的有效热负荷降低及相应的能量代价。我们在10头荷斯坦奶牛为期14天的真实传感器数据上训练并评估了四种DQN变体,即标准DQN、双深度Q网络(Double DQN)、竞争深度Q网络(Duelling DQN)和带优先经验回放的双竞争深度Q网络。环境纳入的核心体温(CBT)、温湿度指数(THI)、行为指标和产奶量。Double DQN智能体获得了最高的数值奖励(18.26 ± 3.89),但其学习策略在几乎所有评估案例中均选择不进行干预,其奖励与不采取行动基线(17.66 ± 5.10;Welch t检验,p = 0.510)无显著差异。这一模式在五个独立随机种子下均得到重现,所有智能体均收敛于低干预或不干预策略。中等热应激条件和奖励函数设计倾向于低能量策略。这些发现表明,DRL是精准畜牧业中测试以动物为中心的控制策略的一个有前景的框架,并可通过对照试验和奖励权重敏感性分析开发具有安全约束的田间验证自主降温系统。