← All posts 掌声留给我,骂声转给AI

Gemini 3 非官方展示(二):AI 评审靠谱吗?我看了排名发现自己没进前 50…

我看了排名发现自己没进前 50…

在等待最终结果的同时,也许你看了我之前关于 Gemini 3 非官方展示帖子,发现自己的排名没有你期望的那么高。

原始发布源: https://www.kaggle.com/competitions/gemini-3/discussion/668733

于是你在想:这个 AI 打分到底靠不靠谱?

我做了一系列实验来验证。


关键发现

你可能好奇这是怎么运作的?这是示意图

之前,每个应用单独打分 → 排名。

现在我把 4,000 对应用两两对决:如果「赢家」和原始排名不一致,就算一次翻转。

(是的,我还验证了先展示 A 还是先展示 B 是否有影响。下一集揭晓!)

分数差距小的时候,AI 评审不可靠。

分数差距 翻转率 结论
< 1 分 20-35% 🔴 基本等于抛硬币
1-2 分 15-20% 🟡 不太稳
> 2 分 < 8% 🟢 靠谱

所以如果你不在顶尖梯队:可能只是噪音,不是实力问题。


8 个 AI 评审意见一致吗?

是的——相关系数达到 0.70-0.88。不是完美双胞胎,但绝对是亲兄弟。

  • 👀 眼尖的读者可能会注意到: Gemini 3 Pro 的数据看起来有点…孤单?我的 API 预算在我收集到足够样本之前就喊「没钱了」(打分很耗资源,因为它得「读」所有源代码)。

  • 但这就是你可以出力的地方! 我在 aistudio 上做了一个快捷的 1 分钟评估应用——只需拖入你的项目(或粘贴你的 AI Studio 链接),让 Gemini 3 来评审。

  • 如果你愿意, 可以下载 json 并在这里提个 PR,我们可以一起把它做得更好(我在想办法),或者在评论区留言。


如何正确使用这个排行榜

✅ 大致了解自己所处的位置 ❌ 用它来衡量你作为 vibe coder 的价值
✅ 发现自己的薄弱环节 ❌ 预测官方结果
✅ 发现值得学习的优秀项目 ❌ 像我一样为此失眠
✅ 选择层级时试试「随机」按钮


我还在做每个应用的个性化总结——你哪里做得好,哪里可以改进,以及启发你下一个项目的想法。

有什么特别想要的? 在下面留言告诉我什么对你最有帮助!


更多数据(持续更新): topvibecoder.com/kaggle-gemini-3

Comments

Select any text to comment on a specific part. Existing inline comments appear as small numbered bubbles. Powered by GitHub Discussions.