专家:人工智能推理越来越便宜,但你的代理为什么越来越贵?
随着代理进行推理、重新规划、其他代理并在后台持续工作,我们预测,到2028年,每个工作流的推理成本将增长五倍以上。
好消息是,大型语言模型(LLM)代币成本正在下降。难题在于人工智能工作负载的总体成本正在上升。研究预测,虽然到2030年令牌成本将下降95%,但代理工作流的推理成本将在未来两年内增加五倍以上。这是因为随着LLM变得越来越复杂,人工智能应用程序构建者正在使用更多且通常更昂贵的代币。这就是所说的“推理悖论”
换句话说,创新速度正在超过成本曲线。市场被一种象征性的通货紧缩幻觉所占据。买家危险地认为,随着人工智能提供商改善象征性经济,这些节省将反映在他们的路线图中。但是,简单地说,“他们不会。”
分析人士指出,毫无疑问,人工智能提供了巨大的价值,而且在许多日常任务中往往比人们更好、更快。代理还可以更快地识别孤立系统中的模式。例如,客户成功代理将响应时间缩短了99%。但随着人工智能的发展,代币使用量增加,代币价值可变。可以推理的高级AI代理在单个任务上的成本已经比基本的AI聊天机器人高出150倍。
一个简单的聊天机器人必须阅读和解释请求,并快速提供“概率上合理”的答案,但随着代理变得越来越复杂,当出现问题时,它们必须思考、质疑和适应,并且它们越来越多地在后台连续运行,而且通常是隐形的。他们需要能够验证他们的结果的准确性,而不一定需要有人参与。所有这些都需要更多的资源,随着越来越多的自主代理触发和相互呼叫,代币消费呈指数级增长。他们指出,这会在用户得到结果之前产生“巨大的推理税”。
训练具有高级推理能力的中型代理模型的硬件成本是训练简单、大小相似的聊天机器人的2.5倍。此外,代理推理成本是聊天机器人的5倍,代理需要比聊天机器人多5倍到30倍的令牌来处理同等任务。现在考虑一下,当运行数百个每小时可以执行数十或数百个任务的代理时,成本将如何飙升。随着代理将许多问题分解为几个小任务、调用高阶模型并需要多模态数据,成本继续飙升。
