2026 中国电信研究院 AITMark 奖项出炉,华为小艺获 AI 手机智能体综合评分第一
IT之家 8 月 26 日消息,华为官方今日宣布,2026 中国电信研究院 AITMark 奖项出炉, 小艺获 AI 手机智能体综合评分第一 。 同时, 华为 Pura X Max 获旗舰手机场景智能评测综合评分第一 ,影像、办公等场景智能评分均第一。 IT之家附中国电信终端研究测试中心本次测试排名…
IT之家 8 月 26 日消息,华为官方今日宣布,2026 中国电信研究院 AITMark 奖项出炉, 小艺获 AI 手机智能体综合评分第一 。 同时, 华为 Pura X Max 获旗舰手机场景智能评测综合评分第一 ,影像、办公等场景智能评分均第一。 IT之家附中国电信终端研究测试中心本次测试排名…
用论文算法给PR打分,提交前就能预判合并风险,省时省力。
Creation-time PR risk triage GitHub Action, based on Minh et al. MSR '26 (arXiv:2601.00753) Comments URL: https://news.ycombinator.com/item?id=4939113…
用LLM给候选方案打分,为DeepSeek补上验证环节,安装即用。
Article URL: https://github.com/uson1x/dsh-plugin-llm-verifier Comments URL: https://news.ycombinator.com/item?id=49366057 Points: 1 # Comments: 0
想开车更安全?沃尔沃“安全教练”应用结合真实事故数据,实时分析驾驶行为并打分,帮你降低事故风险。
IT之家 8 月 15 日消息,据外媒 Carscoops 今天(15 日)报道,沃尔沃将推出全新的“安全教练”应用,开始把更多精力放到事故发生之前,希望通过软件 提前降低事故风险 ,而不是只依靠车辆本身。 “安全教练”提供车机、手机应用,会结合真实事故数据和沃尔沃自身的安全研究,在驾驶过程中 分析…
一个公开的开发者图谱,用 GitHub 活跃度为每位开发者打出 0-100 分,可交互探索技术、地域与人才分布。
There are millions of public signals across GitHub such as repositories, commits, contributions, languages, organizations, locations, we wanted to tur…
想知道AI眼中的你?一键查看ChatGPT对品牌的描述,还能直接动手修正评分。
Article URL: https://pallix.in Comments URL: https://news.ycombinator.com/item?id=49226289 Points: 1 # Comments: 0
宝可梦开发商新作《轮回之兽》IGN仅6分,口碑平平,国区248元,值不值得入手看这里。
IT之家 8 月 4 日消息,宝可梦开发商 GAME FREAK inc. 的全新动作角色扮演游戏《轮回之兽(Beast of Reincarnation)》 于今天正式发售 ,国区定价 248 元起,本作全球媒体评测现已解禁。 截至IT之家发稿,本作在 Metacritic 上 PS5 版均分 7…
提出三值不确定性评分方法,模型驱动下消除LLM生成需求的逻辑不一致与结构问题。
arXiv:2607.26220v1 Announce Type: cross Abstract: Context: Large Language Models (LLMs) offer natural-language flexibility for automated requirements …
IT之家 7 月 26 日消息,电影《群星闪耀时》官方今晚宣布, 决定调整《群星闪耀时》的上映计划 。原定的路演及其他线下活动将全部取消,同时会积极妥善处理后续退票事宜。 电影《群星闪耀时》是一部以中国航天事业为背景的科幻电影,承载着对几代航天人的敬意。这部电影里有跨越时空的守望,有深空中的探索与抉…
从“看似合理”到“银行级可靠”,CM-LRS框架用七大维度量化评估大模型输出,为资本市场的AI应用提供可信标尺。
arXiv:2607.21340v1 Announce Type: new Abstract: In capital-markets workflows the question is rarely whether a large language model can produce a fluen…
OpenClaw官方安卓客户端评分仅1.9,青小蛙亲测吐槽配对过程繁琐,连接网关步骤复杂。
OpenClaw 前不久推出了官方安卓客户端,在 Play 应用商店上获得了 1.9 分的低分 😂 OpenClaw 安卓客户端的问题 当前的 OpenClaw 安卓客户端,需要与现有的 OpenClaw 网关配对,实现聊天、语音、审批和等功能。 不过在配对过程中,青小蛙也感受到了为什么评分是1.9
自动为每次PR评估生产风险并阻止高风险合并,让代码审查更安心
Article URL: https://github.com/Blast-radar/blastradar-action Comments URL: https://news.ycombinator.com/item?id=49001779 Points: 1 # Comments: 0
IT之家 7 月 21 日消息,任天堂旗下《斯普拉遁》衍生作《斯普拉遁:涂击队(Splatoon Raiders)》将于 7 月 23 日(后天)发售,独占 Switch 2 平台,目前本作全球媒体评分已解禁,游戏在 Metacritic 上评分 80 分(51 家媒体)。 IGN 给予这款游戏 9…
用自蒸馏技术增强基于评分标准的强化学习,提升训练效果和泛化能力。
arXiv:2607.18082v1 Announce Type: cross Abstract: Rubric-based RL has recently shown promise in improving LLMs on open-ended tasks. A widely recognize…
国产Kimi K3首次跻身AI大模型综合榜前十,同时登顶前端开发榜,表现亮眼
IT之家 7 月 20 日消息,Arena( arena.ai )平台发布了 2026-29 期大模型排行榜,统计周期为 2026 年 7 月 13 日 ~2026 年 7 月 19 日。 本周榜单迎来大规模新模型集中入榜, 其中最受关注的是国产模型 kimi-k3 的突出表现 :它不仅首次杀入综合…
研究揭示LLM自动评分中存在的第一语言偏见,基于LoRA微调的开源模型在托福作文跨提示评估中的表现实验。
arXiv:2607.14605v1 Announce Type: new Abstract: This study examines the cross-prompt generalization and first-language (L1) scoring effects of a LoRA-…
一键追踪2400+AI基准测试,快速查看模型能力排名与评分。
We’re launching BenchmarkList: one place to track AI benchmarks, models, and capabilities. It’s surprisingly hard to get a complete picture of what AI…
研究揭示LLM评估者没有参考答案时评分偏高,需警惕开源模型自评偏差
arXiv:2607.12885v1 Announce Type: new Abstract: LLM judges are increasingly being used to evaluate open-ended model responses, often in no-reference s…
数据科学家亲测10款AI编码模型,5个任务评分+定价数据,帮你选最值工具。
I Ran 10 AI Coding Models Through 5 Tasks: A Data Scientist's Take I'll be honest — I went into this expecting a clear winner. I came out with a scatt…
代码榜榜首易主,Claude新模型登顶,Anthropic包揽前五名,AI模型竞争白热化。
IT之家 7 月 13 日消息,Arena( arena.ai )平台发布了最新一期 AI 大模型周榜,本期覆盖 2026 年 7 月 6 日 ~2026 年 7 月 12 日。 本周核心变化为代码榜榜首易主, claude-opus-4-7-thinking 从第二升至第一 ,原榜首 claude…