浅谈Claude Skills,Github已经5.2k Star了 公众号: 刘聪NLP 发布时间: 1970-01-01 08:33:45 原文链接:
浅谈Claude Skills,Github已经5.2k Star了
浅谈Claude Skills,Github已经5.2k Star了 公众号: 刘聪NLP 发布时间: 1970-01-01 08:33:45 原文链接:
继续阅读
这篇综述把 reasoning LLM 的 test-time scaling 拆成单轨迹延长多候选投票或验证以及未完成状态搜索等不同推理制度,强调它们在统计结构算力记账和失败模式上不可互换;作者提出统一符号和报告清单,用于减少评测与复现实验中的口径混乱
Skill Self-Play (Skill-SP) 是一个共同进化框架,解决了LLM自我进化中任务多样性与验证可靠性之间的根本矛盾它将Agent技能作为中间层:每个技能在特定场景下提供可验证执行,而动态路由保持开放式任务多样性系统包含提议者求解者和动态技能控制器在工具使用和推理基准上,对强模型持续提升上限,对初始对齐不良的模型实现显著逆转
Dario Amodei明确Anthropic从未主张禁止开放权重模型,认为不含危险能力的开放权重模型是公共产品Anthropic支持三项措施:(1)限制向中国出售先进芯片并打击走私;(2)打击工业级蒸馏操作;(3)对所有足够强大的模型实施强制安全测试Amodei警告,禁止美国企业使用中国开源模型的保护主义禁令无法解决他最关心的两大安全风险,而在生物安全领域,一旦模型足够强大,攻击者可能占据结构性优势
Kimi K3 报告介绍 2.8T 参数 MoE(104B activated)原生视觉与 1M token 上下文;架构侧强调 Kimi Delta AttentionAttention Residuals 与 Stable LatentMoE,相对 K2 约 2.5 scaling efficiency后训练覆盖 general/agentic/coding 与多档 reasoning effort评测称在长程 codingagentic知识推理与视觉上达到开源前沿,但仍落后 Claude Fable 5 与 GPT-5.6 Sol 等最强闭源全文释放权重,便于作为 Agent 能力上沿与评测对照基线