全部报告
每期测试重点有所不同。报告可查看测评结论和所有产出作品素材。
第 02 期
正文写作暗黑西游双盲评分
2026.08.10
同一章纲写正文·仙侠题材
仙侠题材,暗黑西游元素,主角穿越成龟丞相最不受宠的十三子。
大纲、章纲、人物设定完全一致,10 个模型各独立生成 3 篇正文第一章,真人评委双盲评分。含总榜、五维拆解、稳定性、成本分析与 AI 感解析,所有测试正文和章纲均可查阅。
10参评模型
30匿名作品
117有效评分
6评分维度
第 01 期
全流程清末国术编辑盲评
2026.07.07
从 Plan 开始的写作全流程测评
国术题材,清末国术,主角穿越成闰土,一路练拳。同一条提示词、同一套补充条件,18 个模型各跑三轮:Plan 引导 → 策划文件 → 章纲 → 第一章正文。把「写作能力」拆成引导互动、结构设计、执行遵从、正文创作四维分别打分,再叠上耗时与成本。四种能力彼此独立,没有全能冠军。
18参评模型
54运行轮次
53有效首章
4能力维度
我们怎么测
控制测试输入,机器自动采集,真人双盲参评,科学数据清洗。
1
统一输入
不同写作场景的测试,均保证有统一的输入,每个模型可独立生成多次结果,互不干扰。
2
真人盲评
写作效果无法完全依赖模型评分,真人对正文的评价更具参考价值。真人评分时不知道模型信息。
3
清洗后统计
科学剔除异常值,判别力不足的样本整批排除,再进行数据统计。样本量和数据口径完全透明。
点菜
下一期想看什么测评?
想看测评什么品类,什么模型,或什么写作场景,快告诉我们吧。