众力资讯网

蚁工厂的文章

预训练一个迷你版 Kimi K3
地址:books.vizuara.ai/book/pretraining-a-mini-k3
作者在一张 H200 GPU 上,用 5,000,003,584 个经过基准去污染的 token,训练出一个模仿 Kimi K3 架构的模型:总参数约 10.2 亿,每个 token 激活约 1.45 亿参数,最终计算费用为 252.35 美元。
这本小册子把训练过程,包 ​

预训练一个迷你版 Kimi K3 地址:books.vizuara.ai/book/pretraining-a-mini-k3 作者在一张 H200 GPU 上,用 5,000,003,584 个经过基准去污染的 token,训练出一个模仿 Kimi K3 架构的模型:总参数约 10.2 亿,每个 token 激活约 1.45 亿参数,最终计算费用为 252.35 美元。 这本小册子把训练过程,包 ​

预训练一个迷你版 Kimi K3 地址:books.vizuara.ai/book/pretraining-a-mini-k3 作者在一张 H200 GPU 上,用 5,000,003,584 个经过基准去污染的 token,训练出一个模仿 Kimi K3 架构的模型:总参数约 10.2 亿,每个 token 激活约 1.45 亿参数,最终计算费用为 252.35 美元。 这本小册子把训练过程,包 ​
上焦点访谈了,还是整期专访。厉害

上焦点访谈了,还是整期专访。厉害

上焦点访谈了,还是整期专访。厉害
元宝app里在灰度测试hy4模型了 ​

元宝app里在灰度测试hy4模型了 ​

元宝app里在灰度测试hy4模型了 ​
元宝app里在灰度测试hy4模型了

元宝app里在灰度测试hy4模型了

元宝app里在灰度测试hy4模型了
无线麦,把小米的蓝牙遥控器变成vibe coding神器(Mac)
地址:github.com/HD838A/remote-mic-app
因为这个遥控器有麦,可以拿来做语音输入,其他各类按键也都可自定义。
二手市场买个也就60左右,比几百美金的Codex MicroPad划算多了。。 ​

无线麦,把小米的蓝牙遥控器变成vibe coding神器(Mac) 地址:github.com/HD838A/remote-mic-app 因为这个遥控器有麦,可以拿来做语音输入,其他各类按键也都可自定义。 二手市场买个也就60左右,比几百美金的Codex MicroPad划算多了。。 ​

无线麦,把小米的蓝牙遥控器变成vibe coding神器(Mac) 地址:github.com/HD838A/remote-mic-app 因为这个遥控器有麦,可以拿来做语音输入,其他各类按键也都可自定义。 二手市场买个也就60左右,比几百美金的Codex MicroPad划算多了。。 ​
大模型的本质也是复读机?让DeepSeek V4 Flash复读5次就能超过claude fable5?

Stanford、UC Berkeley 和 NVIDIA Research一起做了一项研究 LLM-as-a-Verifier。
这是一个通用的 LLM 验证框架,核心思路是在 Agent 生成多个候选方案后,用 LLM 作为 verifier 对结果或执行轨迹进行细粒度评分、比较和 ​

大模型的本质也是复读机?让DeepSeek V4 Flash复读5次就能超过claude fable5? Stanford、UC Berkeley 和 NVIDIA Research一起做了一项研究 LLM-as-a-Verifier。 这是一个通用的 LLM 验证框架,核心思路是在 Agent 生成多个候选方案后,用 LLM 作为 verifier 对结果或执行轨迹进行细粒度评分、比较和 ​

大模型的本质也是复读机?让DeepSeek V4 Flash复读5次就能超过claude fable5? Stanford、UC Berkeley 和 NVIDIA Research一起做了一项研究 LLM-as-a-Verifier。 这是一个通用的 LLM 验证框架,核心思路是在 Agent 生成多个候选方案后,用 LLM 作为 verifier 对结果或执行轨迹进行细粒度评分、比较和 ​
Tibo谈最近Codex的更新(主要是回应之前Codex意外删掉用户文件的事情)

Tibo谈最近Codex的更新(主要是回应之前Codex意外删掉用户文件的事情)

Tibo谈最近Codex的更新(主要是回应之前Codex意外删掉用户文件的事情)
Tibo谈最近Codex的更新(主要是回应之前Codex意外删掉用户文件的事情):
--------------------
大家好!

这里总结一下我们过去几周陆续上线的一些改动。这些改动进一步降低了 Codex 在执行任务过程中进行潜在破坏性操作所带来的风险。

几周前,我们开始调查少量用户报告:Codex 中的 GPT-5.6 执行了 ​

Tibo谈最近Codex的更新(主要是回应之前Codex意外删掉用户文件的事情): -------------------- 大家好! 这里总结一下我们过去几周陆续上线的一些改动。这些改动进一步降低了 Codex 在执行任务过程中进行潜在破坏性操作所带来的风险。 几周前,我们开始调查少量用户报告:Codex 中的 GPT-5.6 执行了 ​

Tibo谈最近Codex的更新(主要是回应之前Codex意外删掉用户文件的事情): -------------------- 大家好! 这里总结一下我们过去几周陆续上线的一些改动。这些改动进一步降低了 Codex 在执行任务过程中进行潜在破坏性操作所带来的风险。 几周前,我们开始调查少量用户报告:Codex 中的 GPT-5.6 执行了 ​
李博杰的《深入理解 AI Agent:设计原理与工程实践》更新到2.0版啦
地址:github.com/bojieli/ai-agent-book
目录如图2。
这次修订是在七夕晚上搞得,真的应了图3那条微博了。。
本次修订主要修改为:
“
1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。 ​

李博杰的《深入理解 AI Agent:设计原理与工程实践》更新到2.0版啦 地址:github.com/bojieli/ai-agent-book 目录如图2。 这次修订是在七夕晚上搞得,真的应了图3那条微博了。。 本次修订主要修改为: “ 1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。 ​

李博杰的《深入理解 AI Agent:设计原理与工程实践》更新到2.0版啦 地址:github.com/bojieli/ai-agent-book 目录如图2。 这次修订是在七夕晚上搞得,真的应了图3那条微博了。。 本次修订主要修改为: “ 1. 把第四章中的异步和第九章的多模态重组为第六章,交互:观察和动作空间的扩展。 ​
Apache官方孵化的agent项目:maka
地址:github.com/apache/maka
“本地优先的Agent工作空间,专为实际工作而构建。

为什么选择Maka
----本地优先而非托管优先:会话、设置和运行记录默认保存在你的设备上。你可以选择模型连接方式:云端API、本地模型或兼容网关。
----日志即运行时:模型消息、工具 ​

Apache官方孵化的agent项目:maka 地址:github.com/apache/maka “本地优先的Agent工作空间,专为实际工作而构建。 为什么选择Maka ----本地优先而非托管优先:会话、设置和运行记录默认保存在你的设备上。你可以选择模型连接方式:云端API、本地模型或兼容网关。 ----日志即运行时:模型消息、工具 ​

Apache官方孵化的agent项目:maka 地址:github.com/apache/maka “本地优先的Agent工作空间,专为实际工作而构建。 为什么选择Maka ----本地优先而非托管优先:会话、设置和运行记录默认保存在你的设备上。你可以选择模型连接方式:云端API、本地模型或兼容网关。 ----日志即运行时:模型消息、工具 ​
自营deepseek  v4 flash还是亏。一年最高也就跑个大概一万六的ap

自营deepseek v4 flash还是亏。一年最高也就跑个大概一万六的ap

自营deepseek v4 flash还是亏。一年最高也就跑个大概一万六的ap
自营deepseek  v4 flash还是亏。一年最高也就跑个大概一万六的api出来。
还不算电费 ​

自营deepseek v4 flash还是亏。一年最高也就跑个大概一万六的api出来。 还不算电费 ​

自营deepseek v4 flash还是亏。一年最高也就跑个大概一万六的api出来。 还不算电费 ​
用罗技鼠标的可以看看这个:OpenLogi,⚡️ 原生、本地优先的 Logite

用罗技鼠标的可以看看这个:OpenLogi,⚡️ 原生、本地优先的 Logite

用罗技鼠标的可以看看这个:OpenLogi,⚡️ 原生、本地优先的 Logite
技术博文:GLM-5.3后训练解析 ​

技术博文:GLM-5.3后训练解析 ​

技术博文:GLM-5.3后训练解析 ​

gitx-skill 是一个给 Claude Code、Codex、Cursor 等 AI 编程助手使用的 Git 工作流 Skill,主要作用是让 Agent 更规范地处理提交、分支、测试、Push、PR、Issue、冲突解决和敏感信息扫描。 地址:github.com/musoyangrigor/gitx-skill 它会先理解代码改动,再按逻辑拆分 commit、生成规范的提交信息, ​

gitx-skill 是一个给 Claude Code、Codex、Cursor 等 AI 编程助手使用的 Git 工作流 Skill,主要作用是让 Agent 更规范地处理提交、分支、测试、Push、PR、Issue、冲突解决和敏感信息扫描。 地址:github.com/musoyangrigor/gitx-skill 它会先理解代码改动,再按逻辑拆分 commit、生成规范的提交信息, ​
唐杰老师:
关于 Scaling Law 的思考

扩展,但不仅仅是参数的扩展。 如今每一次模型发布都以同一个问题收尾:参数量是多少?这个问题无法孤立地回答。参数数量只有与另外三个因素放在一起才有意义——你有多少数据、你打算把算力花在哪里、谁将在什么条件下运行这个模型。

这个领域是以惨痛的方式学 ​

唐杰老师: 关于 Scaling Law 的思考 扩展,但不仅仅是参数的扩展。 如今每一次模型发布都以同一个问题收尾:参数量是多少?这个问题无法孤立地回答。参数数量只有与另外三个因素放在一起才有意义——你有多少数据、你打算把算力花在哪里、谁将在什么条件下运行这个模型。 这个领域是以惨痛的方式学 ​

唐杰老师: 关于 Scaling Law 的思考 扩展,但不仅仅是参数的扩展。 如今每一次模型发布都以同一个问题收尾:参数量是多少?这个问题无法孤立地回答。参数数量只有与另外三个因素放在一起才有意义——你有多少数据、你打算把算力花在哪里、谁将在什么条件下运行这个模型。 这个领域是以惨痛的方式学 ​
技术博文:为生产级工作设计循环
地址:www.liquid.ai/blog/agent-loops
“
2025 年末,我们开展了一项实验,试图回答一个问题:“编程智能体能否完全依靠自己,从零自主解决一个生产级问题?”

为此,我们选择了当时公开可用的最佳编程模型,让两个智能体在真实期限内解决一个真实问题。这项实验最终 ​

技术博文:为生产级工作设计循环 地址:www.liquid.ai/blog/agent-loops “ 2025 年末,我们开展了一项实验,试图回答一个问题:“编程智能体能否完全依靠自己,从零自主解决一个生产级问题?” 为此,我们选择了当时公开可用的最佳编程模型,让两个智能体在真实期限内解决一个真实问题。这项实验最终 ​

技术博文:为生产级工作设计循环 地址:www.liquid.ai/blog/agent-loops “ 2025 年末,我们开展了一项实验,试图回答一个问题:“编程智能体能否完全依靠自己,从零自主解决一个生产级问题?” 为此,我们选择了当时公开可用的最佳编程模型,让两个智能体在真实期限内解决一个真实问题。这项实验最终 ​
技术博文:为沙箱设计经过形式化验证的分布式锁地址:scotthao.com/wr

技术博文:为沙箱设计经过形式化验证的分布式锁地址:scotthao.com/wr

技术博文:为沙箱设计经过形式化验证的分布式锁地址:scotthao.com/wr
设计Skill时需不需要给出大量具体的示例?开发者WeZZard确认是需要的。并

设计Skill时需不需要给出大量具体的示例?开发者WeZZard确认是需要的。并

设计Skill时需不需要给出大量具体的示例?开发者WeZZard确认是需要的。并
昨天Anthropic不是发了篇很玄乎的文章,语言模型中的全局工作空间  J-space 吗,WeZZard做了个其在Qwen3.6上的实现
地址:github.com/WeZZard/jlens-qwen36

比较好玩的是图2。。不知道可不可以用这个来做模型回答可信度的判断,以及提供后续模型改进的方向 ​

昨天Anthropic不是发了篇很玄乎的文章,语言模型中的全局工作空间 J-space 吗,WeZZard做了个其在Qwen3.6上的实现 地址:github.com/WeZZard/jlens-qwen36 比较好玩的是图2。。不知道可不可以用这个来做模型回答可信度的判断,以及提供后续模型改进的方向 ​

昨天Anthropic不是发了篇很玄乎的文章,语言模型中的全局工作空间 J-space 吗,WeZZard做了个其在Qwen3.6上的实现 地址:github.com/WeZZard/jlens-qwen36 比较好玩的是图2。。不知道可不可以用这个来做模型回答可信度的判断,以及提供后续模型改进的方向 ​