推出 MentalHealthBench
MentalHealthBench 是一个由专家指导的基准,专注于现实心理健康对话场景,评估 AI 响应的帮助性与安全性。
MentalHealthBench 是一个由专家指导的基准,专注于现实心理健康对话场景,评估 AI 响应的帮助性与安全性。
TypeSafe AI 发布决策模型 Jev,只接收文本输入、返回是/否、选项与评分的置信度浮点数,输出免费且输入定价低于 GPT-5 Nano。Simon Willison 实测认为它适合分类、意图判定与搜索重排,但黑盒输出让偏见与错误难以定位。他已为 LLM CLI 发布 llm-typesafe 插件,社区也出现 Kev 等开放权重复刻项目与 JevBench 基准。