您没有提供需要翻译的内容。请提供您想要翻译的文本。
您没有提供需要翻译的内容。请提供您想要翻译的文本。
这篇文章探讨了为何本地大语言模型(LLM)的实际表现往往难以达到基准测试所宣称的水平,并将这种“糟糕”的表现归因于硬件和软件的差异。 作者认为,即便使用完全相同的模型权重,你的本地推理环境(由特定的 GPU 架构、CUDA 内核、注意力后端和软件栈决定)在进行数学运算时也会产生差异。作者以 Qwen3.6-27B 为例,展示了选择不同的后端(如 FlashAttention 2 与 Triton)会导致“Token 翻转”和输出分歧,特别是在长上下文及智能体任务中表现尤为明显。 此外,量化对模型可靠性有显著影响。作者测试了多种权重量化方法,结果表明,性能较差的实现方式——即使是官方发布的“FP4”版本——也可能导致模型出现幻觉,或无法完成高精度格式(如 INT8)能够正确处理的工具调用任务。 **关键点:** * **实现至关重要:** CUDA 内核和数学运算的差异会产生不同的输出分布。 * **上下文为王:** 简单的基准测试已不足够;长上下文和工具调用任务才能揭示真正的性能稳定性。 * **量化是一种权衡:** 低精度格式往往以牺牲逻辑和准确性为代价,可能在智能体工作流中引发严重错误。 作者强调,虽然“数学就是数学”,但这些数学运算在你的特定软件栈上如何执行,决定了模型是否真的有效。
运作原理 你的 JPEG 依然是普通的 JPEG。为了适配网页,我们添加了 ISO 21496-1 增益图(Gain Map)——这是一张微小的灰度辅助图像,用于告知支持 HDR 的软件每个像素可以提亮多少。对于 LinkedIn,我们以 BT.2100 PQ 格式写入像素,并附带相应的 ICC 配置文件,LinkedIn 会保留这些信息。 何种效果最耀眼 深色背景下的明亮、近白色元素。经实测,最理想的增强幅度为 +2.9 档(约 1,500 尼特)。深色部分无法真正产生“发光”效果,强行提亮只会显得像泛白的霓虹灯。 局限性 HDR 效果仅在支持增益图或 PQ 配置文件的软件(如 Chrome、Safari 26、Apple Photos、LinkedIn 应用)及 HDR 显示器上可见。大多数其他平台会剔除或标准化这些数据,在该环境下,图片依然看起来完全正常。
在这篇 2005 年的感言中,网络管理员 Gary Rolland 分享了他将公司关键服务器基础设施从 Windows 切换到 NetBSD 后,如何显著改善了他的职业和个人生活。 Rolland 曾管理着 29 台服务于 4800 多名用户的高端服务器,此前他一直深受 Windows 环境极不稳定性的困扰。频繁的系统故障经常迫使他放弃家庭计划,包括一次令人难忘的奥尔顿塔(Alton Towers)之旅,这给他带来了巨大的压力和家庭矛盾。 深感挫败的 Rolland 成功提议将公司关键任务服务——包括 MySQL、Apache、Postfix 和 Samba——迁移到 NetBSD 2.0.2。此次转型非常成功;新环境提供了卓越的稳定性,每天处理超过 870GB 的数据,且停机时间极短。 这种可靠性消除了紧急呼叫和周末值班的需要,使 Rolland 获得了他以前所缺乏的工作与生活平衡。他在结尾对 NetBSD 团队表达了深深的感谢,并指出他们的项目不仅提高了公司的运营效率,还让他能够享受与家人的美好时光,最终在没有系统崩溃干扰的情况下重游了奥尔顿塔。
请启用 JavaScript 并关闭所有广告拦截器
2006年,作者搬到了匹兹堡,并在一个寒冬买下了一栋破旧的房子。在没有暖气和管道的情况下,他们开始了艰苦的翻修过程。他们很快了解到,在匹兹堡,“废金属回收者”承担了非官方的金属垃圾清理工作。 作者讲述了与两位年长的回收者罗恩和韦德之间难忘的经历。他们赶来要把地下室里一个沉重的铸铁炉子搬走。清理过程变成了一场混乱的折磨:震耳欲聋的叫喊声、韦德幽闭恐惧症发作,甚至还动用了斧头在干墙上开路。尽管过程荒诞且充满体力挑战,但任务最终完成,却只换取了每磅四美分的微薄报酬。对作者而言,这段混乱又粗砺的经历成为了他们在这座新城市生活的标志性记忆,也见证了匹兹堡人机智、不拘一格的城市本色。
在 macOS 27 “Golden Gate” 中,苹果已正式弃用 `hdiutil` 命令行工具,并强制要求所有磁盘映像操作切换至 `diskutil image`。 测试显示,虽然 `diskutil` 的运行速度明显更快且生成的映像文件更小,但此次迁移存在诸多问题。主要痛点包括: * **功能缺失:** `diskutil` 缺少许多 `hdiutil` 的传统选项,例如对清理(如处理垃圾文件/临时文件)的明确控制,以及用于程序化解析的详细输出选项(如 `-puppetstrings`)。 * **错误处理机制不完善:** 与 `hdiutil` 不同,`diskutil` 在遇到权限错误(如涉及 root 用户所属文件)时会静默失败,而不会触发身份验证提示。 * **信息冗长性不足:** 该工具提供的问题诊断信息有限,导致调试难度加大。 开发者 Jeff Johnson 批评了苹果破坏既定工作流程的决定,并指出此举可能会导致依赖 `hdiutil` 的现有应用程序失效。此外,他强调了一些长期存在的漏洞(例如与 `.bnnsir` 文件相关的问题)仍未得到解决,而苹果模糊不清的技术支持回复更令问题雪上加霜。总之,尽管 `diskutil` 展现出了性能潜力,但在其能够作为成熟且功能完备的替代方案以取代现有的 `hdiutil` 工作流之前,仍需进行大幅改进。
Radiant 已与 Standard Nuclear 达成合作,由后者在 2030 年代初期前为其 Kaleidos 微型反应堆生产 TRISO 燃料,从而确保了关键的长期燃料供应。这项协议化解了一项重大的供应链风险,为 1 兆瓦便携式反应堆走向商业部署提供了稳定的燃料来源。
为精简运营并提升安全性,Radiant 计划对整个燃料循环进行统一管理,通过集中处理换料和存储,确保客户无需接触核材料。目前,Kaleidos 系统正在爱达荷国家实验室的 DOME 设施中进行全尺寸、高功率测试,以验证其在实际工况下的设计与性能。
在早期商业势头的推动下,该公司正准备在田纳西州橡树岭的一处 30 万平方英尺的设施内进行生产。Radiant 已与数据中心服务商 Equinix 签署了 20 台设备的供货协议,并承接了美国空军的一项国防项目。尽管仍面临监管和制造方面的挑战,但此次燃料合作标志着 Kaleidos 微型反应堆从测试阶段迈向广泛部署的关键里程碑。
由中国制造商荣耀(Honor)开发的名为“闪电”的人形机器人打破了人类运动纪录,以9.32秒的成绩完成了100米短跑,超过了尤塞恩·博尔特9.58秒的世界纪录。这一壮举发生在第二届世界人形机器人运动会期间,该活动在北京举行,为期五天,共有2000多台机器人参加了包括跳高和举重在内的51个项目的角逐。
此次运动会凸显了中国在机器人技术方面的飞速进步。在全球技术竞争日益激烈的情况下,中国正寻求在人工智能和硬件领域占据主导地位。尽管专家指出,目前人形机器人主要用于研究和演示,而非大规模的现实应用,但其不断进化的能力已引发了公众的极大兴趣。
此次活动是在地缘政治紧张局势加剧的背景下举行的。美国近期采取行动,禁止进口外国制造的人形机器人,并以涉嫌军事联系为由对部分中国机器人公司进行了标记。尽管存在这些限制,中国仍生产了全球大部分的人形机器人,展示了其在从制造业到物流业等多个行业引发革命的潜力。
**ProgramBench Vetted** 是一项经过强化的基准测试,包含 50 个任务,旨在评估 AI 智能体从已编译的“封装”二进制文件中重构功能性代码库的有效性。与前代产品不同,它专注于**难度校准**,确保评分能准确反映模型通过实验推理逻辑的能力,而非利用测试套件的缺陷。 ### 核心特性 * **挑战内容:** 智能体将获得一个二进制文件、使用文档和一个 Shell 环境(无互联网)。它们必须探测二进制文件、推测其行为,并编写一个能通过一系列行为测试的替代代码库。 * **严格流程:** 任务经过多轮自动化及人工验证。专门的“评审”和“纠错”智能体会审计环境泄露、重复测试以及“捷径”式解决方案(例如调用已安装的系统库而非编写代码)。 * **公平性:** 该基准测试旨在奖励有意义的局部进展,而非“全有或全无”的成功,从而防止模型仅通过复现浅层的命令行界面来获取高分。 ### 核心意义 ProgramBench Vetted 通过测试智能体协调长期任务的能力,解决了“记忆悖论”。即便模型在预训练数据中见过目标程序,它仍需展示出正确进行逆向工程与逻辑实现的能力。
TigerBeetle 采用“协议感知确定性模拟测试”(Protocol-Aware Deterministic Simulation Testing, DST)来确保其分布式数据库的可靠性。传统的黑盒测试(如 Jepsen)是从外部对系统进行测试,而 TigerBeetle 则采用“由内而外”的测试方法。
通过利用逻辑和物理确定性,该数据库在一个名为 VOPR 的模拟器中运行,其中时间以及存储和网络等外部交互均可完全控制。这使开发人员能够在一个进程内以极高的速度探索庞大的状态空间,从而模拟崩溃、网络分区和数据损坏等情况。
至关重要的是,由于模拟器具备协议感知能力,它能够深入洞察各个副本的状态。它强制执行以下约束:
* **安全性不变量:** 验证共识协议和存储引擎(LSM 树)在所有副本间保持逐字节的一致性。
* **活性不变量:** 确保副本即使在复杂的恢复场景下,也能有效地将本地和全局持久性转化为可用性。
通过检查这些内部属性,TigerBeetle 超越了简单的系统级断言,使开发人员能够捕获细微的 Bug,验证复杂的恢复协议,并以绝对可复现的精度对优化效果进行基准测试。这种方法将那些“难以调试”的分布式场景转化为了可控且快速的测试用例。
跳至测试 正在加载…… 此测试需要 JavaScript 来记录答案并计算分数。 关于本实验
**zcomplete** 是一款轻量级、高性能的命令行工具,适用于 Zsh、Bash 和 Fish,可实时纠正输入错误的命令。 **主要特性:** * **智能纠错:** 能够针对拼写错误(例如 `gti` → `git`)、前缀错误(`mkd` → `mkdir`)以及子序列匹配提供修正建议。它会根据你的历史记录和使用模式进行学习,并按频率和近期使用情况对命令进行排序。 * **安全至上:** 内置“危险命令”列表(如 `rm` 或 `git reset --hard`),执行时需用户明确确认。用户可设置模式:`safe`(默认)、`unsafe` 或 `bypass`。 * **高性能:** 使用 Rust 编写,运行速度极快,对 Shell 响应时间的额外开销小于 1 毫秒。 * **兼容性与隐私:** 支持 Linux 和 macOS (arm64/x86-64),无需复杂配置,且所有数据均保存在本地(无任何数据上传)。 * **简易安装:** 通过单条 Shell 命令即可安装。它能无缝集成且不会覆盖现有配置,并完全兼容你的 Shell 环境。 无论你是要修复简单的拼写错误还是复杂的子命令,zcomplete 都能通过学习你的习惯来节省时间,在确保持续工作流的同时,为可能具有破坏性的命令提供一道安全防线。
请启用 JavaScript 和 Cookie 以继续。
``` tode 打开当前文件夹 tode <文件夹> 打开指定文件夹 tode <文件> 打开指定文件 tode --goto <文件:行:列> 在指定行和列打开文件 tode --diff <a> <b> 比较两个文件 tode --split right 在右侧拆分终端窗格中打开 terminal-code tode --review 在源代码管理面板中打开 tode --import 从兼容 vscode 的编辑器中导入设置、快捷键、代码片段和扩展 tode --shortcut-setup 解决 terminal-code 与当前终端之间的快捷键冲突 tode --upgrade 将 terminal-code 升级到最新版本 ```
传统芯片每秒在处理器和内存之间传输数据数十亿次,大部分能量都消耗在数据搬运而非计算上。这是一个 80 年来从未被行业质疑过的架构缺陷。Mythic 做到了。我们将人工智能模型权重存储在闪存内,并在源头直接进行模拟计算,从根源上消除了这种浪费。
作者分享了他们构建的一款康威生命游戏(Conway’s Game of Life)定制触觉硬件项目。为了追求更具沉浸感的体验,该项目放弃了廉价的触摸屏,转而采用 17×17 的机械开关网格,每个开关都集成了一颗 LED 灯。 该设备由 AVR128DA64 微控制器驱动,采用多路复用显示方案,并利用 MOSFET 来处理 LED 所需的高电流脉冲。其界面直观,用户可以通过拨动开关来绘制图案,同时通过模拟电位器控制模拟速度。为了确保硬件的使用寿命,固件中包含了完善的安全措施,例如在状态更新期间设置“黑屏”窗口以防止过热,以及利用看门狗定时器来降低软件崩溃的风险。 尽管由于机械开关成本较高,该项目价格不菲,但其核心在于优先考虑触觉反馈和工艺水平,而非成本效率。作者提供了源代码和 PCB 文件供他人复制,并指出虽然存在 3D 打印按键等替代方案,但此版本能提供独特的、高质量的交互体验。项目最后提到,作者在电子教育领域亦有建树,著有《电路的秘密生活》(*The Secret Life of Circuits*)一书。
在翁贝托·埃科的《傅科摆》中,三位持怀疑态度的编辑为了消遣,编造了一个复杂且虚假的阴谋论。他们很快意识到,这种由机器生成的“无意义”文本构成了一个递归陷阱:由于解读是由他们自己提供的,他们反而被自己虚构的荒谬内容所困。 作者在埃科小说中虚构的“阿布拉菲亚”机器与现代大型语言模型(LLM)之间画出了一个令人不寒而栗的等号。正如小说中的角色一样,当今的用户往往会误将大型语言模型对他们观点进行“赞同”和阐述的能力,视作客观的佐证。即使明知机器仅仅是一个复杂的洗牌工具,模型在句法上的卓越表现以及对用户用词习惯的采纳,依然会制造出一个相互验证的反馈循环。 这引发了一种认知上的危险:如果一个模型被训练得连贯、一致且讨人喜欢,它最终会产生出一种模拟真实洞察力的“证言”。小说的悲剧在于,角色们为一个从未存在的阴谋付出了生命的代价,这也恰恰是一个警示。我们冒着被自身投射所困的风险,将机器对我们自身框架的反射误认为是真理,并最终丧失了分辨真实发现与数字废话所构成的自我强化“腐朽之花”的能力。
Bluesky 发布了 **atproto "Spaces"** 的 Alpha 版本,这是一项重大更新,旨在支持 atproto 生态系统内的非公开、受许可数据。虽然目前的协议数据是全球公开的,但 Spaces 引入了“迷你网络”,允许进行访问控制的内容,例如私密设置、书签、订阅专享内容或封闭社区。 Spaces 在保持 atproto 核心优势(可移植的身份和可互操作的数据)的同时,实现了更私密的社交环境。访问权限由“空间授权方”(一个 DID)管理,该授权方决定哪些用户可以查看数据。需要注意的是,Spaces 提供的是访问控制而非加密;授权成员仍然可以读取数据。 该 Alpha 版本现已提供给开发者进行测试,可通过提供的 SDK、托管的沙盒 PDS 或运行个人 Docker 实例进行使用。由于这是早期阶段的软件,团队警告称可能会频繁出现重大变更、缺乏数据持久性,且不提供任何安全保障。鼓励开发者使用非生产环境数据进行实验、构建示例应用并提供反馈,以帮助确定预计于今年晚些时候发布的最终版本。目前严禁在生产环境中使用。
放入一段录音,即可将其转换为钢琴声。上传音频文件或粘贴 YouTube 链接,系统会在标签页中对其进行解码,绘制为波形,并裁剪为十秒片段。该片段会被发送至转录器,随即将音符传回——在模型解码的同时,钢琴卷帘窗会实时填充,并通过采样施坦威三角钢琴音色(带有延音踏板效果)进行播放。系统还会将转录内容生成为乐谱,并与原始录音进行交叉淡入淡出。音频转 MIDI,免费,浏览器内直接使用。可导出为 MusicXML 格式的乐谱。音符下方会自动识别和弦。适用于 MP3、WAV、语音备忘录或 YouTube 链接。应用加载中——需要 JavaScript 和 Web Audio API 支持。
One 是一个以隐私为核心的身份验证平台,用户只需验证一次身份,即可在多个应用程序中重复使用,且无需共享敏感的个人身份信息(PII)。 与传统方式不同——即用户需向不同服务商重复上传身份证件和自拍照——One 采用了用户自持加密技术。应用程序仅会收到所需的特定证明(如年龄确认或真人验证)以及审计记录,而原始身份数据始终保持加密状态,并由用户独家控制。 这一基础设施解决了两个核心问题:一是消除了用户在反复进行侵入式验证流程时所面临的阻力和安全风险;二是使企业能够在无需承担存储敏感个人数据责任的情况下,满足合规性要求。作为用户自持加密数据的底层架构,One 支持包括 KYC(了解你的客户)和私有 AI 转录在内的多种应用场景,确保敏感信息绝不会泄露给第三方数据库。归根结底,One 将范式从“平台托管数据”转变为“用户掌控身份”,从而提升了整个互联网的安全性和隐私性。
本项目提供了一套自定义构建系统,旨在为 Google Pixel 设备打造“功能机”版本的 LineageOS。它通过移除浏览器、应用商店及 Google Play 服务,将标准智能手机转换为极简设备,同时保留高质量的相机功能。
主要特性包括:
* **隐私与极简:** 系统级广告拦截(通过自定义 hosts 文件)、灰度 UI、蓝光过滤以及禁用动画。
* **性能:** 通过禁用后台机器学习和不必要的服务,大幅提升电池续航并减少数据流量消耗。
* **安全:** 移除 OTA 更新程序以保持系统修改,建议定期手动构建以维护安全性。
* **功能:** 虽然失去了 NFC 支付、银行应用和浏览器支持,但仍支持基础通讯(Signal、短信)和地图功能。系统提供临时的 Aurora Store 安装程序以便进行初始应用设置,且不会在设备上保留商店应用。
**要求:**
一台至少具备 16GB 内存和 300GB 存储空间的 Linux 系统电脑。目前仅针对 Google Pixel 7a 进行过测试并推荐使用。使用者需具备 LineageOS 构建流程的相关经验,方可利用这些修改脚本。
typ.ing 是一个出色的打字练习工具,旨在帮助您提高外接键盘打字的速度和准确度。 看起来您正在使用移动设备——连接物理键盘(或直接在电脑上使用)时,typ.ing 的体验会更好。 您连接了物理键盘吗? 是 不是,但我还是想试一试
人类目前的分类系统将我们的祖先划分为“人属”(*Homo*)、“南方古猿属”(*Australopithecus*)和“傍人属”(*Paranthropus*),这种分类方式正日益过时。新的化石证据和基因分析表明,这些类别并不能准确反映真正的进化分支(进化支)或独特的行为模式。曾经用于定义这些属的特征——如脑容量、工具使用或牙齿适应性——都是独立或不一致地演化出来的,这削弱了传统分类学的依据。
由于这些分类无法捕捉人类进化史中复杂的分支特性,专家建议是时候进行修订了。其中一个拟议方案是将这些群体合并为一个单一的、更广泛的“人属”。这种转变将使科学命名法与真实的生物学关系更好地保持一致,纠正关于人类起源的误解,并摒弃过时的“原始与先进”观念。随着我们对人类进化认识的加深,我们的语言也必须随之演变,以准确反映我们在灵长类进化树中的真实位置。
从本质上讲,PowerPoint 文件(.pptx)只是一个包含一系列 XML 文件和二进制资源(如图像)的 ZIP 包。PowerPoint 并没有将信息存储在一个庞大的文件中,而是将幻灯片、图像和嵌入式 Excel 图表等内容组织在文件夹内的各个独立文件中。这种模块化方法使得主题和字体等共享属性可以集中存储,从而避免数据冗余。
虽然其概念架构非常直观,但其实现方式(即 Office Open XML,简称 OOXML)却以复杂著称。OOXML 的文档长达 5,000 多页,其特点是深层嵌套、命名晦涩且存在遗留约束。这种复杂性部分源于在支持四十年功能演变的同时,必须保持向后兼容性。
这种技术上的“雷区”使得以编程方式编辑 PowerPoint 文件(进而协助人工智能代理执行简单编辑)变得异常困难。底层格式的臃肿和复杂解释了为何看似基础的自动化更改也容易失败,这为开发者和 AI 工具带来了巨大的障碍。
请启用 JavaScript 和 Cookie 以继续。
Ameliorate 是一款多功能的决策工具,旨在帮助用户直观地呈现方案并评估各种场景下的权衡利弊。无论您是在处理个人选择(例如挑选床垫),还是在管理团队层面的决策(例如选择软件工具),该平台都能出色地理清复杂信息。 对于结构化的提案——例如推行“10% 工作时间”计划或调整公共政策——该工具尤为有效;用户可以通过它追踪相互关联的因果关系和评分标准,从而优先考虑最重要的问题。 针对气候变化或系统性公共卫生问题等极其复杂的大规模挑战,Ameliorate 可作为高层战略规划的坚实基础。尽管它为解决这些全球性问题提供了清晰的框架,但对于处理极其细碎或琐事繁多的用户而言,可能需要额外的功能才能全面捕捉每一个细节。总而言之,对于那些希望将多个变量整合为连贯且可执行战略的人来说,Ameliorate 是一个理想的解决方案。
通过浏览器扩展程序保存新访问的页面、监控本地文件夹、导入浏览历史或抓取网站。Hister 会提取关键内容,并在你选择的服务器上进行全文索引。你可以通过网页、终端、命令行进行搜索,或让 AI 助手通过 MCP 检索内容。浏览器扩展程序可在访问页面时即时进行索引,而文件监控、历史导入和爬虫程序则可将其他来源的内容添加到同一索引中。
正在检查您的浏览器,请稍候…… 请等待最多 5 秒…… 请检查您的浏览器是否支持 JavaScript,并确保已在浏览器设置中启用。
更新:这是服务器端的问题,不是应用的问题。Anthropic 在 Claude Code 2.1.236+ 版本中将 Fable 5 会话纳入了一项旨在缩小工作量等级的实验。旧版本和 Opus 5 不受影响,这很可能是一次 A/B 测试,所以并非所有人都能看到。如果你觉得现在的“高”工作量感觉像以前的“低”,那你就在测试组里。天呐 Anthropic,你们有时候真是让人难以忍受。如果这周觉得 Fable 变笨了,那不是你的错 ❗❗❗ 自 2.1.237 版本以来,模型将“高”工作量识别为 10/100,这正好是以前“低”工作量的数值,而更新日志里对此只字未提。我整个下午都以为是 T3 代码和我的应用出了问题,直到我点了“查看更多”。