Gemini 3 非官方展示(二):AI 评审靠谱吗?我看了排名发现自己没进前 50…
我看了排名发现自己没进前 50…
在等待最终结果的同时,也许你看了我之前关于 Gemini 3 非官方展示 的帖子,发现自己的排名没有你期望的那么高。
原始发布源: https://www.kaggle.com/competitions/gemini-3/discussion/668733
于是你在想:这个 AI 打分到底靠不靠谱?
我做了一系列实验来验证。
关键发现

你可能好奇这是怎么运作的?这是示意图
之前,每个应用单独打分 → 排名。
现在我把 4,000 对应用两两对决:如果「赢家」和原始排名不一致,就算一次翻转。
(是的,我还验证了先展示 A 还是先展示 B 是否有影响。下一集揭晓!)
分数差距小的时候,AI 评审不可靠。
| 分数差距 | 翻转率 | 结论 |
|---|---|---|
| < 1 分 | 20-35% | 🔴 基本等于抛硬币 |
| 1-2 分 | 15-20% | 🟡 不太稳 |
| > 2 分 | < 8% | 🟢 靠谱 |
所以如果你不在顶尖梯队:可能只是噪音,不是实力问题。
8 个 AI 评审意见一致吗?

是的——相关系数达到 0.70-0.88。不是完美双胞胎,但绝对是亲兄弟。
-
👀 眼尖的读者可能会注意到: Gemini 3 Pro 的数据看起来有点…孤单?我的 API 预算在我收集到足够样本之前就喊「没钱了」(打分很耗资源,因为它得「读」所有源代码)。
-
但这就是你可以出力的地方! 我在 aistudio 上做了一个快捷的 1 分钟评估应用——只需拖入你的项目(或粘贴你的 AI Studio 链接),让 Gemini 3 来评审。
-
如果你愿意, 可以下载 json 并在这里提个 PR,我们可以一起把它做得更好(我在想办法),或者在评论区留言。
如何正确使用这个排行榜
| ✅ 大致了解自己所处的位置 | ❌ 用它来衡量你作为 vibe coder 的价值 |
|---|---|
| ✅ 发现自己的薄弱环节 | ❌ 预测官方结果 |
| ✅ 发现值得学习的优秀项目 | ❌ 像我一样为此失眠 |
| ✅ 选择层级时试试「随机」按钮 |

我还在做每个应用的个性化总结——你哪里做得好,哪里可以改进,以及启发你下一个项目的想法。
有什么特别想要的? 在下面留言告诉我什么对你最有帮助!
更多数据(持续更新): topvibecoder.com/kaggle-gemini-3

Comments
Select any text to comment on a specific part. Existing inline comments appear as small numbered bubbles. Powered by GitHub Discussions.