BEYOND BENCHMARKS
聪明,只是其中一面。
同一个模型,写代码、写故事、陪你梳理问题,体验可能完全不同。BoringLLMs 汇集用户在具体场景下的体验,帮助你找到适合自己的模型。
模型:六个维度,按体验选填
理解与配合
听不听得懂要求,能不能按你的约束来。
表达与风格
是否清楚、自然,风格是否合适。
可靠程度
事实和逻辑是否可靠,不确定时是否坦诚。
沟通体验
交流是否顺畅,能否理解反馈并调整。
任务完成
能否把实际任务做好,结果能否直接使用。
性价比
结合付费、等待时间和使用限制,是否值得。
公司:产品与服务的六个维度
公司点评适用于个人产品、开发者 API、团队服务与售后客服。每个账号可以分别点评一个模型及其公司;两者分数独立计算,互不累加。
服务稳定性
是否经常遇到故障、排队或无法使用。
收费清晰度
价格、用量、续费与取消规则是否清楚。
信息透明度
产品变更、使用限制与故障通知是否清楚及时。
隐私控制体验
自己用过的数据管理、导出、删除与隐私设置是否好用;不是隐私合规认证。
客服与售后
遇到问题能否联系到客服,处理是否有效。
性价比
结合套餐、额度与服务体验,是否值得付费。
分数如何计算
- 整体评分为已发布点评的整体体验分的算术平均,每条权重相同。六项维度独立计算,不合成为整体分。
- 每个账号对每个模型、每家公司各有一条点评,可以更新。没有点评时不显示分数;少于 5 条时标为“样本较少”,不进入对应的评分排序列表。
- 筛选场景后,模型或公司列表的分数与数量仅统计该场景。详情页顶部显示所有场景的整体分,下方维度分按所选场景统计。
- 默认按点评数量排列,同数按名称排列。新站没有真实点评,因此不会预填评分、虚构用户或购买好评。
- 未体验的维度请留空,留空不算零分。“有帮助”票数不会影响模型或公司评分。
真实体验,也有局限
这些评分来自自愿参与者,可能受到样本量、使用入口、版本、价格和个人偏好的影响。本站不核验每次使用凭证,不代表随机抽样、专业测评或模型能力认证。请同时阅读具体点评与官方说明。
先审核,再公开
新增或修改的点评进入待审核状态,通过后才公开并计分。我们依据是否相关、具体、重复、涉及隐私或广告等规则审核,不因分数高低删评。未通过的原因会显示在“我的点评”中,用户可以修改再提交。举报不会自动删除内容。