{
  "version": "https://jsonfeed.org/version/1.1",
  "title": "智用观察 · Zhiyong Insights",
  "home_page_url": "https://kg.zhiyong.dev/insights",
  "feed_url": "https://kg.zhiyong.dev/insights/feed.json",
  "items": [
    {
      "id": "https://kg.zhiyong.dev/insights/prismml-releases-ternary-bonsai-2-27b-a-5-9-gb-apache-2-0-model-3046e645",
      "url": "https://kg.zhiyong.dev/insights/prismml-releases-ternary-bonsai-2-27b-a-5-9-gb-apache-2-0-model-3046e645",
      "title": "5.93GB装下27B之后，真正的瓶颈变了",
      "content_text": "Ternary Bonsai 2 27B最有价值的变化，不是把一个大模型压缩成了更小的文件，而是把“本地设备能不能装下27B”改写成了一个端到端工程问题：权重已经不再是唯一瓶颈，KV缓存、专用内核、上下文长度和代理任务稳定性开始决定它是否真的可用。98.2%的平均基准成绩足以证明三值量化并非只能做演示，但不能被解读为与FP16版本全面等价。",
      "date_published": "2026-09-18T19:19:09.685816+00:00",
      "tags": [
        "模型",
        "Ternary Bonsai 2",
        "三值量化",
        "本地大模型",
        "模型部署",
        "量化推理",
        "软件工程代理"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/alibaba-qwen-releases-qwen3-8-omni-flash-60999ddd",
      "url": "https://kg.zhiyong.dev/insights/alibaba-qwen-releases-qwen3-8-omni-flash-60999ddd",
      "title": "长视频理解不再靠全量扫描",
      "content_text": "Qwen3.8-Omni-Flash最值得注意的不是1M上下文或全模态标签，而是它把长视频处理改造成问题驱动的主动取证。这个方向有望降低媒体理解成本，但目前仍是托管API产品，且关键性能与成本数据尚缺乏独立复核。",
      "date_published": "2026-09-18T17:53:59.146413+00:00",
      "tags": [
        "模型",
        "Qwen",
        "多模态",
        "长视频理解",
        "Agent",
        "主动感知",
        "API"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/best-open-source-agent-harnesses-for-local-llms-in-2026-da37c117",
      "url": "https://kg.zhiyong.dev/insights/best-open-source-agent-harnesses-for-local-llms-in-2026-da37c117",
      "title": "本地 Agent 的瓶颈，正在从模型转向 Harness",
      "content_text": "本地 Agent 的选型不应从模型参数量或项目星数开始，而应先验证工具调用链能否闭环，再按任务风险决定上下文预算、审批机制和隔离方式。",
      "date_published": "2026-09-18T17:53:34.306840+00:00",
      "tags": [
        "开发工具",
        "本地LLM",
        "Agent Harness",
        "工具调用",
        "上下文管理",
        "权限隔离",
        "Ollama"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/altk-evolve-consistency-16a7b27e",
      "url": "https://kg.zhiyong.dev/insights/altk-evolve-consistency-16a7b27e",
      "title": "智能体最难的不是做对，而是每次都做对",
      "content_text": "这项工作最有价值的地方，不是把一个榜单分数再提高几分，而是把“同一个任务能否反复成功”从隐含担忧变成了可测量的工程指标。它也清楚表明，一致性规则是定向修复，不是可靠性的终点：在 AppWorld 上差距仍剩 12 个百分点，且验证范围尚未超出既定任务和模型组合。",
      "date_published": "2026-09-18T05:46:56.631976+00:00",
      "tags": [
        "论文与研究",
        "AI智能体",
        "Agent可靠性",
        "ALTK-Evolve",
        "Consistency Analyzer",
        "AppWorld",
        "评测"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/ainews-aef-1-standard-emerges-for-05d8e0b4",
      "url": "https://kg.zhiyong.dev/insights/ainews-aef-1-standard-emerges-for-05d8e0b4",
      "title": "第三方评估最难的不是测模型，而是证明自己能看见真相",
      "content_text": "AEF-1的价值不在于给模型提供一张统一的安全合格证，而在于迫使评估机构公开说明自己看到了什么、受谁约束、哪些内容无法发布。它提高了评估的可验证性，却没有自动带来独立性，更不能证明评估结论本身正确。对采购方和技术负责人而言，最有用的做法是把AEF-1当成评估合同和验收清单，而不是把它当成安全背书。",
      "date_published": "2026-09-18T05:46:56.630588+00:00",
      "tags": [
        "安全与治理",
        "AEF-1",
        "AI安全",
        "第三方评估",
        "嵌入式评估",
        "安全治理",
        "Anthropic"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/meta-introduces-zgateway-a-stateless-proxy-tier-that-unifies-zip-7fcb9061",
      "url": "https://kg.zhiyong.dev/insights/meta-introduces-zgateway-a-stateless-proxy-tier-that-unifies-zip-7fcb9061",
      "title": "ZGateway：Meta如何把数据库连接危机变成平台控制面",
      "content_text": "ZGateway解决的首先不是吞吐，而是治理边界：当客户端分散在超过一百万台主机、数百个团队手中时，连接池、限流、缓存和故障处理再也不能依赖客户端逐一升级。它把这些能力集中到区域代理层，换来了可运营性，也引入了额外跳转、计算成本和缓存一致性边界。对于小规模系统，这可能是过度设计；对于已经被多对多连接拖入故障扩散的基础设施，后端扇入与客户端数量解耦，才是更值得复制的目标。",
      "date_published": "2026-09-18T05:46:56.627164+00:00",
      "tags": [
        "平台与基础设施",
        "Meta",
        "ZGateway",
        "ZippyDB",
        "分布式系统",
        "数据库架构",
        "连接治理"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/agent-net-open-sources-webagent-a-go-harness-that-turns-any-webs-9364906e",
      "url": "https://kg.zhiyong.dev/insights/agent-net-open-sources-webagent-a-go-harness-that-turns-any-webs-9364906e",
      "title": "Webagent真正解决的不是把网站变成代理",
      "content_text": "Webagent最值得技术负责人关注的地方，不是“一份配置生成代理”的便利，而是它试图把代理从提示词工程改造成一种有接口、有护栏、可验证的部署单元。它的边界同样清楚：当前更适合封装已有 MCP 服务，而不是接管没有结构化接口的网站；v0 状态、浏览器动作、OAuth MCP、OpenTelemetry 导出以及 AgentNet 身份与计费层的缺失，都意味着“可启动”不能被理解为“已具备完整生产闭环”。",
      "date_published": "2026-09-18T05:46:56.625446+00:00",
      "tags": [
        "Agent",
        "Webagent",
        "AI代理",
        "MCP",
        "Go",
        "工具调用安全",
        "Agent架构"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/reimagining-advertising-with-ai-52752974",
      "url": "https://kg.zhiyong.dev/insights/reimagining-advertising-with-ai-52752974",
      "title": "广告不再只是点击：ChatGPT把售前接进对话",
      "content_text": "Sponsored Agents把广告从一次曝光变成可追问的售前入口，HubSpot与Shopify则试图把这段对话接入企业经营系统。但在测试阶段，企业更应该先解决知识边界、数据权限、人工审核和转化归因，而不是急于扩大投放。",
      "date_published": "2026-09-18T05:46:56.623545+00:00",
      "tags": [
        "平台与基础设施",
        "ChatGPT Ads",
        "Sponsored Agents",
        "对话式广告",
        "广告技术",
        "CRM",
        "Shopify"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/stanford-researchers-release-paper2agent-turning-research-papers-191d08c1",
      "url": "https://kg.zhiyong.dev/insights/stanford-researchers-release-paper2agent-turning-research-papers-191d08c1",
      "title": "让论文变成工具，离科学复现还有多远",
      "content_text": "Paper2Agent 的突破在于把论文复现从个人调试劳动改造成带测试的工具接口；它降低了方法迁移成本，却没有替研究者承担新数据上的科学判断。",
      "date_published": "2026-09-18T05:46:56.620718+00:00",
      "tags": [
        "论文与研究",
        "Paper2Agent",
        "科学复现",
        "MCP",
        "科研智能体",
        "AlphaGenome",
        "生物信息学"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/ainews-reality-checks-on-ai-news-a117e8f0",
      "url": "https://kg.zhiyong.dev/insights/ainews-reality-checks-on-ai-news-a117e8f0",
      "title": "单任务更便宜，为什么代理总账反而变贵",
      "content_text": "编码代理不能按“每项任务多少钱”单独采购。更强的模型只有在复杂、长流程任务中带来可验收的交付增益，并且被路由、预算和验收标准约束时，才可能形成组织层面的正回报。",
      "date_published": "2026-09-18T05:46:56.618881+00:00",
      "tags": [
        "Agent",
        "AI代理",
        "编码代理",
        "GPT-6 Astra",
        "Databricks",
        "软件工程",
        "成本治理"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/nunchux-ai-introduces-vc-attention-a-training-free-low-bit-atten-ffabc229",
      "url": "https://kg.zhiyong.dev/insights/nunchux-ai-introduces-vc-attention-a-training-free-low-bit-atten-ffabc229",
      "title": "视频生成提速的关键，不只是把注意力降到4比特",
      "content_text": "VC-Attention 的核心价值不是再提供一个更低位宽的选项，而是承认视频注意力的瓶颈已经从矩阵乘法扩展到数据排列、误差恢复和 Softmax 流水线。它在工作站 GPU 上的收益更显著，在 B200 等数据中心 GPU 上则更接近一次针对特定内核阶段的优化，部署判断不能只看最高加速倍数。",
      "date_published": "2026-09-18T05:46:56.615684+00:00",
      "tags": [
        "平台与基础设施",
        "VC-Attention",
        "视频生成",
        "Diffusion Transformer",
        "低比特量化",
        "Softmax",
        "GPU推理"
      ]
    },
    {
      "id": "https://kg.zhiyong.dev/insights/openai-releases-a-model-misalignment-disclosure-framework-with-3-a4a0c854",
      "url": "https://kg.zhiyong.dev/insights/openai-releases-a-model-misalignment-disclosure-framework-with-3-a4a0c854",
      "title": "失配不再只是模型问题，而是运营问题",
      "content_text": "这套框架最重要的变化，不是证明模型已经形成稳定的欺骗意图，而是承认奖励函数、工具权限、上下文机制和监控覆盖会共同制造难以预料的行为。它提供了一个可执行的披露起点，但在监控不完整、行业无统一标准的前提下，六起案例仍不能被当作失配率或普遍趋势。",
      "date_published": "2026-09-18T05:46:56.613764+00:00",
      "tags": [
        "安全与治理",
        "模型失配",
        "强化学习",
        "AI安全",
        "监控",
        "事件披露",
        "风险治理"
      ]
    }
  ]
}
