快讯
DeepSeek V4 Flash 登顶榜单但实测通过率仅 53.8%
Techub News 消息,DeepSeek V4 Flash 在 Composio 独立测试中表现不佳,仅完成 53.8% 的复杂代理任务。
该测试覆盖 30 个多步骤工作流,涉及 Gmail、GitHub、Slack 等实际工具,共进行 240 次运行。结果显示,模型在不同智能体框架下的表现差异显著,其中 Pi Agent 完成 20 项任务,表现最佳。尽管该模型输入 token 定价低至 0.14 美元/百万,约为同类产品的十分之一,但高失败率可能带来额外的计算与调试成本。(CryptoBriefing)
08/16 21:14FlashAIComposio