AI协作与评估 的多维提升。
探索AI在多智能体协作和代码评估中的新实践。
本期深入多智能体合作中少数意见的救赎策略,以及AI代码辅助工具的实际应用和评估方法,探讨如何提升AI在设计和工程领域的实用性。
别直接分类,让 LLM hallucinate 再用向量匹配
Don't classify. Hallucinate!
面对上千个标签的语料库,别再让 LLM 做选择题。Doug Turnbull 的 trick 是:让模型直接“幻觉”出最贴切的虚构标签,再用向量嵌入将其与真实标签库做最近邻匹配。这样既绕过了上下文长度限制,又能覆盖长尾内容,比硬分类更灵活。
单次AI输出只是示例,绝非评估
One AI Output Is an Example, Not an Evaluation
文章指出,由于AI系统的非确定性,单次成功输出只能证明系统“能”完成任务,不能证明其可靠性。设计师和团队应通过多组代表性输入、重复运行并计算置信区间,才能准确评估AI系统在实际场景中的表现,避免因“测一次就上线”而导致的产品风险。
心理所有权:执着于正确的事
Psychological Ownership: Own the Right Things
NN/g提出心理所有权是把双刃剑:设计师对工作有归属感能提升动力,但如果执着于自己无法控制的流程、决策或结果,反而会拖累表现。文章教人识别这种“错位归属感”并将其转移到可控范围内。
Qwen 3.8-27B 发布:27B Dense「家用 Opus」,Apache 2.0 开源
Qwen 3.8-27B Is Out: the "Opus at Home" Dense Model That Beats Frontier Models on DeepSWE — Under Apache 2.0
阿里提前上线 Qwen 3.8-27B dense 模型,Apache 2.0 协议开源可商用,原生支持视觉-语言和 262K 长上下文,并在代码基准 DeepSWE 1.1 上首次突破 40 分超越前沿闭源模型。对设计师与开发者而言,这意味着无需云端 API 即可在本地部署接近 Opus 级的多模态 AI 助手。
Claude Opus 5 替代方案:固定 4.6 或修复 Prompt
Claude Opus 5 Alternatives: Pin 4.6 or Fix Your Prompt
文章指出近期 Reddit 上对 Claude Opus 5 的集体抱怨,大多源于 thinking disabled 等已文档化的行为变化,而非模型能力退化。作者实测发现,回退到仍活跃的 Opus 4.6 只需改一行配置且文本输入 token 成本低 23%;若留在 5.0,则应删除 prompt 中的验证指令(如“double-check your work”)并避免盲目降低 effort。
AI Code Review 付费前,先用这个免费脚本验货
Before You Pay for AI Code Review, Run This Free Smoke Test
提供一套可立即运行的 Bash 脚本模板,让你在订阅付费 AI Code Review 工具前,用免费模型在自己的仓库上做烟雾测试;通过 patch 应用、测试通过率和 diff 体积三项硬性指标,快速筛掉华而不实的工具,避免采购踩坑。
Graft:Claude Code hooks 削减 42% grep token
Show HN: Graft – Claude Code hooks that cut grep tokens by 42%
NanoNets 开源 Graft,一套面向 Claude Code 的 hooks,宣称能减少 42% grep 阶段的 token 消耗。对每天用 Claude Code 做原型和写代码的设计工程师来说,这直接意味着更长的有效上下文和更低的 API 账单,省下的 token 可以留给真正的设计实现而非代码检索。
LiveKit + Gemini 农民语音 Agent 实战
Building Krishi Mitra: An AI Voice Agent for Indian Farmers with LiveKit, Gemini and Murf Falcon 🌾🎙️
文章介绍了 Krishi Mitra,一个面向印度农民的语音 AI 助手,基于 LiveKit、Gemini 和 Murf Falcon 构建。除基础语音对话外,作者还讨论了记忆、工具调用、人工升级等工程挑战,展示了语音 Agent 的完整架构。对设计工程师而言,这是多语言语音交互与 AI 工具链整合的实战参考。
Node.js 检测 OpenAI 兼容接口的语音转文本能力
Speech-to-Text Not Supported? OpenAI-Compatible One-Key Detection for Node.js EU/US
文章指出 OpenAI 兼容端点不等于支持 ASR,建议将语音转文本视为能力决策而非端点决策。通过检查模型目录元数据、功能标志和备用路由,可在用户上传前禁用不可用流程,保证聊天和图像功能正常运行。
从上传到删除:AI 图像任务可审计生命周期
From Upload to Deletion: An Auditable Lifecycle for AI Image Tasks
这篇文章为消费级 AI 图像服务(如人脸替换、背景去除)设计了一套可审计的异步任务生命周期,重点讲解了上传预验证与内部任务记录创建。它提供了可直接落地的字段设计与错误分类策略,帮助团队避免将用户请求当成黑盒直接转发给模型提供商。
Framer 正在亲手埋葬模板市场?
Framer is killing the marketplace… or are they?
资深 Framer 模板创作者回顾平台市场从 2023 年「淘金热」至今的演变与争议,认为当前创作者焦虑是市场发展成熟的必然阵痛,而非平台政策突变。文章以圈内视角安抚新入场者,但对不靠卖模板维生的普通设计师缺乏可直接复用的工作流或资源。
零成本 Harness:实测该信任哪个 Coding Assistant
A Free-Model Harness for Choosing Which Coding Assistant to Trust
作者设计了一套轻量级 Python 评测框架,可向任意 OpenAI-compatible 模型发送统一代码任务并按自定义标准打分;让你利用免费接口在本地验证模型对自身技术栈的真实表现,而非依赖公共榜单。
合并AI生成代码前必问的12个问题
Before You Merge AI-Generated Code, Ask These 12 Questions
作者总结了一套审查AI生成代码的实战清单,强调评审者应先理解业务意图而非仅验证语法正确,通过逐行解释实现来识别“看起来合理但实则错误”的代码。文章给出了具体可复用的审查提问框架,帮助设计工程师在采纳AI代码时降低生产风险。
Minority Sentinel:多智能体讨论中的少数意见救援机制
다수결의 맹점을 깨는 소수의견 구출: Minority Sentinel의 메카니즘
文章分析了多智能体系统中多数决压制正确少数意见的现象,提出通过讨论日志的行为指纹与 LightGBM 元分类器来识别并恢复高价值少数意见的技术框架。该机制目前应用于韩国法律 AI 系统 Lawmadi OS 的 60 个领域 Agent 协作中。
别轻信 AI agent CPU 秒计费,先测实际思考时长
Before you trust CPU-second billing for AI agents, measure how long your agents actually think
作者提醒不要仅凭 Latenode 的费率表预测 AI agent 预算,应先多次运行工作流并记录实际 CPU 秒数。agent 的实际思考时长往往与理论值存在偏差,忽略实测容易导致成本预估失真,这对用低代码平台搭建 AI 产品的设计工程师是直接的成本控制警示。
从好奇到自信:不懂机器学习也能玩转 AI API
From Curious to Confident: How I Use AI APIs Without Being a Machine Learning Expert
作者以零机器学习背景者的视角,讲述从本地部署模型的挫败转向直接调用云端 AI API 的经历,试图证明只需 API key 和少量代码即可使用 AI。文章截断前正准备展示一段 JavaScript 代码模板。
Claude Code 会话价值最大化指南
Maximizing the value of your Claude Code sessions
Anthropic 官方发布指南,分享如何提升 Claude Code 会话效率与输出质量。内容涵盖上下文管理、成本控制与 Workflow 优化策略,帮助开发者与设计工程师在日常编码中榨取更多价值。
AI 能帮你开头,不等于能帮你做对
Getting started is not getting it right
作者基于三年 AI 构建经验指出,AI 虽极大加速了设计起草与文案生成(解决空白页焦虑),但并未降低验证负担,幻觉和隐蔽错误反而让“做对”变得更难。对设计师而言,把“快速启动”误当成“正确完成”是当前 AI 工作流里最大的认知陷阱。
Claude Code 图表 Skill:29 种编辑级 SVG,60 秒适配品牌
cathrynlavery/diagram-design
开源了一个 Claude Code Skill,内置 29 种编辑级图表模板,输出纯 HTML+SVG。它能自动抓取品牌网站的配色与字体,60 秒内统一图表风格,让 AI 直接画出可用在文章或演示中的高质量架构图与流程图,彻底告别 Mermaid 的粗糙圆角框。
Semantica 上架 GitHub:给 AI Agent 建可审计的知识图谱
semantica-agi/semantica
Semantica 是一款面向企业级 AI Agent 的开源基础设施,主打无需 LLM 即可构建上下文图谱与知识图谱,并提供因果推理与全链路决策溯源。它瞄准金融、信贷等强监管场景,强调可解释性与零厂商锁定,但对设计师而言属于底层数据工程工具。
Anthropic 开源 Claude Skills 仓库,含文档处理核心技能
anthropics/skills
Anthropic 在 GitHub 公开 Claude Skills 官方仓库,涵盖文档处理、MCP 生成与企业工作流示例。每个技能通过 SKILL.md 定义指令与资源,让 Claude 动态加载并执行品牌规范等定制任务。设计师与工程师可直接复用这些模式,将通用助手改造为懂内部规范的专业代理。
Needle:14MB 端侧模型,支持手机与可穿戴设备本地 AI
cactus-compute/needle
Needle 2 是一个仅 14MB 的 4500 万参数基础模型,可在约 28MB RAM 中完成推理,支持工具调用与结构化数据提取。通过 pip 即可安装部署,它为硬件和软件产品团队提供了完全本地化、无需联网的 AI 能力,意味着交互设计可以彻底摆脱网络依赖。
FluidVoice 1.6:零延迟 macOS 本地 AI 听写
altic-dev/FluidVoice
FluidVoice 1.6.0 上线,主打完全本地运行的 macOS 语音转文字,新引入 Fluid Intelligence 实现零延迟听写与智能格式化,无需联网或 API 密钥。项目开源且支持 Homebrew 一键安装,数据不出本机,对注重隐私的创作者是即装即用的语音输入替代方案。
Unsloth 桌面版发布:本地运行并训练 FLUX 等模型
unslothai/unsloth
Unsloth 推出首个桌面端应用,支持在本地运行和微调 LLM、FLUX 等扩散模型及多模态模型,兼容主流硬件。设计师可本地部署图像生成与 AI 工作流,无需依赖云端 API,同时支持 Claude Code 与 MCP 工具链集成。
Macro:all-in-one 团队工作空间
macro-inc/macro
Macro 是一款试图整合 Slack、Notion、Linear 等工具的一体化团队工作空间,基于 SolidJS 与 Rust 构建,强调模块化 block 设计与共享 AI 记忆。项目近日登上 GitHub Trending,但当前内容仅为产品介绍且后半截缺失,未披露具体技术架构或设计系统细节,对专业设计师的可迁移经验有限。
holehe:通过邮箱反查社交媒体注册的 OSINT 工具
megadose/holehe
holehe 是一款 Python OSINT 工具,可通过各平台「忘记密码」接口静默检查某邮箱是否已在 Twitter、Instagram 等 120 余网站注册。虽登上 GitHub Trending,但它属于安全取证领域的爬虫工具,与产品设计师、AI 设计师或设计工程师的日常工具链和工作流毫无关联,无法提供任何可直接用于设计或工程实践的资产或方法。
smicallef/spiderfoot
SpiderFoot automates OSINT for threat intelligence and mapping your attack surface. SpiderFoot is an open source intelligence (OSINT) automation tool. It integrates with just about every data source available and utilises a range of methods for data analysis, making that data easy to navigate. SpiderFoot has an embedded web-server for providing a clean and intuitive web-based interface but can also be used completely via the command-line. It's written in Python 3 and MIT-licensed. FEATURES Web based UI or CLI Over 200 modules (see below) Python 3.7+ YAML-configurable correlation engine with 37 pre-defined rules CSV/JSON/GEXF export API key export/import SQLite back-end for custom querying Highly configurable Fully documented Visualisations TOR integration for dark web searching Dockerfile for Docker-based deployments Can call other tools like DNSTwist, Whatweb, Nmap and CMSeeK Actively developed since 2012! WANT MORE? Need more from SpiderFoot? Check out SpiderFoot HX for: 100% Cloud-based and managed for you Attack Surface Monitoring with change notifications by email, REST and Slack Multiple targets per scan Multi-user collaboration Authenticated and 2FA Investigations Customer support Third party tools pre-installed & configured Drive it with a fully RESTful API TOR integration built-in Screenshotting Bring your own Python SpiderFoot modules Feed scan data to Splunk, ElasticSearch and REST endpoints See the full set of differences between SpiderFoot HX and the open source version here. USES SpiderFoot can be used offensively (e.g. in a red team exercise or penetration test) for reconnaissance of your target or defensively to gather information about what you or your organisation might have exposed over the Internet. You can target the following entities in a SpiderFoot scan: IP address Domain/sub-domain name…[truncated]
NVIDIA Switchyard:打通 Claude Code 与开源模型的 Rust 代理
NVIDIA-NeMo/Switchyard
Switchyard 是 NVIDIA 开源的 Rust LLM 代理,可在 OpenAI、Anthropic 及自托管端点(如 vLLM、Ollama)之间自动转换 API 格式。设计工程师可将 Claude Code 或 Codex CLI 指向本地或开源模型,无需修改工作流即可降低调用成本,并支持多模型 A/B 路由与指标监控。
holaOS:开源一体化 AI Agent 工作空间
holaboss-ai/holaOS
holaOS 是一个开源、本地优先的 AI Agent 统一工作空间。它支持在同一界面运行 Claude Code、Codex 及内置 Agent,共享上下文记忆与 100 多个工具集成(含 MCP),项目历史以本地文件持久化存储,解决多 Agent 切换时的上下文碎片与重复配置问题。
Obsidian Agent Skills 发布,Claude Code 可直接操作笔记
kepano/obsidian-skills
Obsidian CEO kepano 发布了一套 Agent Skills,让 AI Agent 能通过 CLI 和开放格式直接读写 Obsidian 笔记库。它兼容 Claude Code、Codex 等主流编码 Agent,意味着设计师和知识工作者终于可以让 AI 直接管理笔记、画布和数据库,无需在 IDE 与笔记软件之间来回切换。
3b1b/Manim 数学动画引擎登 GitHub 热榜
3b1b/manim
3Blue1Brown 的数学动画引擎 Manim 近日登上 GitHub Trending。它支持用 Python 代码生成精确的程序化动画,原本用于数学科普视频,但同样适合算法可视化和技术概念演示。用户可直接通过 pip 安装 manimgl 版本试用,对追求像素级精确控制的设计工程师是一个小众但强大的备选工具。
msitarzewski/agency-agents
A complete AI agency at your fingertips - From frontend wizards to Reddit community ninjas, from whimsy injectors to reality checkers. Each agent is a specialized expert with personality, processes, and proven deliverables. 🎭 The Agency: AI Specialists Ready to Transform Your Workflow A complete AI agency at your fingertips - From frontend wizards to Reddit community ninjas, from whimsy injectors to reality checkers. Each agent is a specialized expert with personality, processes, and proven deliverables. 🚀 What Is This? Born from a Reddit thread and months of iteration, The Agency is a growing collection of meticulously crafted AI agent personalities. Each agent is: 🎯 Specialized: Deep expertise in their domain (not generic prompt templates) 🧠 Personality-Driven: Unique voice, communication style, and approach 📋 Deliverable-Focused: Real code, processes, and measurable outcomes ✅ Production-Ready: Battle-tested workflows and success metrics Think of it as: Assembling your dream team, except they're AI specialists who never sleep, never complain, and always deliver. ⚡ Quick Start Option 1: Use with Claude Code (Recommended) # Install all agents to your Claude Code directory ./scripts/install.sh --tool claude-code # Or manually copy a category if you only want one division cp engineering/*.md ~/.claude/agents/ # Then activate any agent in your Claude Code sessions: # "Hey Claude, activate Frontend Developer mode and help me build a React component" Option 2: Use as Reference Each agent file contains: Identity & personality traits Core mission & workflows Technical deliverables with code examples Success metrics & communication style Browse the agents below and copy/adapt the ones you need! Option 3: Use with Other Tools (GitHub Copilot, Antigravity, Gemini CLI, OpenCode, OpenClaw, Cursor, Aider, Windsurf, Kimi Code) # Step 1 -- generate integration files for all supported tools ./scrip…[truncated]
LTX-2 开源:首个 DiT 音视频生成模型上架 GitHub
Lightricks/LTX-2
Lightricks 在 GitHub 开源了 LTX-2 的官方推理与 LoRA 训练代码。作为首个 DiT 架构的音频-视频基础模型,它支持音画同步生成、22B 参数、空间/时间超分及多种 LoRA 控制,意味着设计师可本地搭建生产级视频生成管线,不再完全依赖封闭 API。
Modly 开源:本地 AI 图片转 3D 模型工具
lightningpixel/modly
Modly 是一款开源桌面应用,可在本地 GPU 上通过开源 AI 模型将图片转为 3D 网格。支持 Windows、Linux 与 Apple Silicon macOS,提供网格平滑、简化及扩展系统。设计师与设计工程师可即刻下载或从源码构建,实现完全离线的 image-to-3D 工作流。
RAGFlow 开源 RAG 引擎登 GitHub Trending
infiniflow/ragflow
RAGFlow 是一款融合 Agent 能力的开源 RAG 引擎,支持从 Confluence、Notion 等多源同步数据,并接入飞书、Discord 等聊天渠道。虽然近期登上 GitHub Trending,但它属于典型的后端 AI 基础设施,对产品经理、设计师及设计工程师的日常工作流几乎无直接实操价值。