思考还是行动:机器人如何决定何时调用LLM以及花费多少计算量
所提出的RARRL方法通过强化学习,教会机器人自适应地选择推理时机、推理格式和计算预算。在ALFRED上的实验表明,与固定策略相比,该方法在降低延迟的同时,提升了成功率和鲁棒性。

189 材料
所提出的RARRL方法通过强化学习,教会机器人自适应地选择推理时机、推理格式和计算预算。在ALFRED上的实验表明,与固定策略相比,该方法在降低延迟的同时,提升了成功率和鲁棒性。

新方法使LLM代理不仅能够根据任务调整沟通结构,还能在对话过程中动态重构结构并积累经验。在九个基准测试中,ST-EVO相比此前方法实现了5%至25%的精度提升。

研究人员提出了一种结合物理约束与真实驾驶数据的方法:Transformer模型首先预测车辆之间的相互影响,随后规划器生成类人化的驾驶操作。测试中,该方法相比强化学习显著减少了轨迹预测误差和碰撞次数。

在新研究中提出了ADN-Agent架构,其中大型语言模型充当调度员角色,用于管理配电网时的一组专业模型。系统自行确定请求含义,将其分解为多个阶段,选择所需工具并通过统一接口接入,同时为简化文本子任务,采用自动化微调紧凑型LLM的方法。

该科学研究提出了一种名为Align-LoRA的简单微调方案,它基于任务间共享特征的协同对齐,而非依赖模型中的独立分支。这种方法不仅加速了推理过程,还支持权重合并,同时其效果优于复杂的多任务配置。

DeepMind与Fenris Creations正在准备一款独立的EVE Online自主版本,神经网络将在此版本中于不断变化的游戏经济环境中运作。该实验将检验模型能否保持知识、运用长期记忆并制定长达数周的计划,而无法重新开始对局。

研究人员推出了一款通用医学语言模型,基于20,000份真实临床记录训练而成。在MedBench-Hard基准测试中,其表现优于GPT-4o的中文水平,并在英文场景下与GPT-4相当。

该框架无需针对每项单独任务训练模型:复杂请求可分解为可解释的模块,由时空模型和LLM执行。这种方法能提供可验证的数值结果及其解释,降低幻觉风险,且在测试中明显优于常规LLM基线。

Anthropic拨款500万美元给独立团队:他们将研究模型如何影响用户的情绪状态,并公开发布其评估方法。该项目还提供模型访问权限和技术支持,研究人员的申请截止日期为9月21日。
