才发现,有专门测 LLM 根据视觉做任务的: https://robocurve.org
比如,让独眼的 Astra 操纵机械臂:
把东西放到碗里: https://openai.robocurve.org/gpt-6-astra/runs/videos/rig-1_6b47f3c6.mp4
把圆盘放到凹槽里: https://openai.robocurve.org/gpt-6-astra/runs/videos/rig-4_edd32a0a.mp4
这里是所有的 20 次实验,包括 Astra 和 Fable ,有视频,也有 AI 的思考输出:
https://openai.robocurve.org/gpt-6-astra/
虽然有很多次失败,但我看了下视频,大概是因为 LLM 都是靠单个视频帧来调整动作,“无法看准”。
比如,让独眼的 Astra 操纵机械臂:
把东西放到碗里: https://openai.robocurve.org/gpt-6-astra/runs/videos/rig-1_6b47f3c6.mp4
把圆盘放到凹槽里: https://openai.robocurve.org/gpt-6-astra/runs/videos/rig-4_edd32a0a.mp4
这里是所有的 20 次实验,包括 Astra 和 Fable ,有视频,也有 AI 的思考输出:
https://openai.robocurve.org/gpt-6-astra/
虽然有很多次失败,但我看了下视频,大概是因为 LLM 都是靠单个视频帧来调整动作,“无法看准”。