Can current general-purpose frontier LLMs reliably interpret aging-related biological data? 1. 先交代 model roster 和 evaluation setting:frontier models + fine-tuned L-LLMs + base models;主文最终比较 26 个模型。 2. 解释 aggregate ranking 的思路:先在 task 内排名,再在 domain 内平均,最后 equal-domain aggregation,避免某个 task-rich domain 主导总分。 3. Figure 2:先看总体——没有单一 frontier model 在所有 domain 都稳定占优;不同模型在不同 biodata domain 上表现差异明显。 4. Figure 3/4/5:按 task type 看细节——pairwise/binary、multiclass、regression 各自有什么特点;重点抓 2–3 个代表性例子,不要逐图逐条念。 5. 突出“clinical 相对容易、raw molecular measurements 更难”的总体趋势。 6. 加入 classical ML baseline:本文并不是在证明 LLM 全面替代 ML;固定 feature 的 supervised task 上传统 ML 常常仍然很强。 7. 讲 benchmark sensitivity:例如 GTEx pairwise → ternary 后性能下降;说明问题格式会改变测得的能力。 8. 用一句结论收束:general-purpose LLM 有一定能力,但 raw omics 与 task formulation 暴露出明显的不稳定性。