AI 学习社区

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 9|回复: 0

实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug

[复制链接]

34

主题

0

回帖

63

积分

管理员

积分
63
发表于 前天 04:27 | 显示全部楼层 |阅读模式






最新消息,参数293B的讯飞星火X2.5上线了……

(伸出邪恶小手.jpg)

此前讯飞开源了星火X2.5的两款端侧模型,一个4B和一个1.7B。

模型参数都不大,但都能在端侧原生跑100万Token上下文。

模型一开源,社区玩开了。

有人搞量化,有人往Mac、T4和WebGPU上搬,还有狠人直接把它接进Agent工作流,让它连续调用工具。

一顿操作猛如虎,硬生生把4B模型送上了Hugging Face现趋势榜第一。

所以现在问题来了,小的都这么猛了,大的能把活干到什么份上?

MoE大模型,参数293B-A30B,重点提升代码、智能体能力,覆盖200余种语言……反正翻完模型简介,期待值是给我拉满了。

再赶上API限时五折,不说了,咱这就开测。

星火X2.5现已上线讯飞开放平台。

API原生支持Anthropic、Responses协议,开发者可快速将其接入OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent等第三方Harness框架。

这里我也是直接调的API,接入Codex后原地开跑。

三道关卡已经备好:

从创意落地到复杂任务处理,再到整站设计,咱们一起来看看它能接住多少招。

第一关,咱先考考它能不能把一句创意,变成真正能上手玩的东西。

这不正好快中秋了吗,咱正好借星火X2.5,给大家搞点指尖上的浪漫。

我把金桂、星辰、圆月、阖家团圆这些元素统统写进了Prompt,并让AI以“中秋祈福”为主题,直接生成一个3D粒子手势交互网页。

效果有多惊艳?咱直接上手体验:

一握一放之间,桂花凝聚成月,祝福散作成星。

整个过程超级丝滑,让我不禁想起了小时候玩的“报数抱团”游戏:喊到几,就几个人抱成一团。

只不过这次,听口令的是一群亮晶晶的“赛博小精灵”。

手势刚起,它们就忙着集合、变换队形,并把祝福拼成我想要的模样。

玩着玩着,我的思路也突然打开了:

除了中秋,或许朋友生日、周年纪念日也都能照着这个思路,为他们做一份专属的赛博惊喜?

话说,会有人花钱找我定制吗?大胆伸出发财的小手(doge)。

不过光看可不够,这么灵的“赛博花活”,当然得拉上亲朋好友一起疯玩。

我还顺手整了个《月宫快递》小游戏,规则非常滴简单粗暴:

谁抢的月饼多,谁就先飞上月球,当一回“广寒宫首席快递员”(嘿嘿,卷死他们)。

小伙伴们直接玩嗨了!

一个个操控着自己的太空小兔,蹦蹦跳跳地闯过层层天阶,把月饼一块块收入囊中,争当朋友圈里第一个晒出登月战绩的中秋赢家……

从指尖聚散的粒子祝福,到全员上瘾的月宫抢单,这一套组合拳下来,中秋氛围直接拉满。

不过能玩只说明它接得住创意、做得出东西,能不能真干活:

还得看它做得对不对。

是骡子是马,还得把星火X2.5拉进真实办公场景遛遛。

这不,老黄前几天刚发了英伟达的Q2财报。

好巧不巧,还正好赶在周三凌晨四点大家都睡了的时候发。

这个点谁有功夫生啃61页硬核财报啊,第二天还要赶早八上班呢。

我的要求很明确:

请把关键数据摘出来做成图,再读出数字背后的行业机会和风险。

因为AI不光要把账算明白,还得从账里读出门道,才算真正帮我们减负。

结果,半小时早会开完,9份图表+1份投研风险简报,就直接交到了我手上。

要素太多,咱就简单挑三个重点看吧:营收利润变化图表、Future commitments表、投研简报。

以FY2027 Q1为例,营收、利润、净利润均一一对应,数值准确无误。

未来承诺的结构,也一目了然。

这样一圈跑下来,实感看财报的压力确实小了不少,以后不用再自己从头啃起,AI就能把情况给我讲清楚。

61页财报,终于有了省力的打开方式。

接下来我把两篇分别来自Nature和Science的论文、一篇新闻报道以及20份DeepSeek生成的模拟问卷数据,统统丢给了星火X2.5,让它自行完成研究:

经常使用AI的科研人员,工作效率更高还是更低?

并让它给我输出一份论文实证部分的初稿,需配上必要的图片。

没想到,AI这回给我上了一课。

我没说数据来源是真是假,它倒是一眼看穿,还无情地补了一刀,大意是:

你给研究结论的时候可得悠着点。

我不听我不听,让咱们忽略这个提醒继续看成果:

星火X2.5在消化完我提供的资料并完成多轮交叉校验后,给出了一个肯定的结论:

综合来看,现有证据一致支持“经常使用AI的科研人员在产出数量与目评效率上更高”这一方向性结论,问卷、两篇文献与新间报道相互印证。

并贴心地配上了“不同AI使用频率的科研人员的产出数量对比图”、“AI日均使用次数与工作效率的散点关系图”,以及“问卷描述统计与相关系数表”来佐证自己的观点。

最后,星火X2.5还给我找了点茬,指出我的研究存在着问卷样本少、未实现控制变量等问题:

得,到底是不忘初心。

好吧,我承认你说的对,你眼光很准,算你过关了…

不过嘛,被它补了一刀,那我可不得把场子找回来?

转头测薯片电商数据题时,我暗戳戳给它挖了个坑——Excel表?不存在的!

我把一堆数据截图塞进了Word里,还故意算错了一堆营收数值但不告诉它,让它自己琢磨去:

没想到它不光没被难住,反倒把我搓出来的电商数据集的统计bug,给扒了个底朝天?!

6,这波我服了。

后面我让它把这份txt分析报告直接渲成了可视化PDF。

效果嘛…不得不服,确实能打。

顺带提一嘴,你们写Prompt的时候可以直接喊星火X2.5生成,省得自己来回折腾。(我忘了TT)

最后,我们决定给原创奇幻动作游戏《堕神余烬》搭个官网。

世界观Prompt大致包含以下核心信息——

请为原创奇幻动作游戏《堕神余烬》(Ashes of the Fallen God)设计并生成一个可直接上线的沉浸式官方网站。

游戏背景:诸神陨落后,世界被撕裂成漂浮的破碎之地。幸存的凡人不得不穿越破碎神殿、哥特地下城和被神骸污染的荒野,在怪物与失控神力之间求生,并逐步揭开诸神陨落的真相。

网站目标:第一眼就让玩家感受到黑暗、宏大、危险而神秘的世界观,产生探索剧情和立即游玩的欲望。目标用户既包括奇幻动作游戏玩家,也包括希望用AI快速制作官网的独立游戏开发者和产品经理。

结果呢?设定没跑偏,哥特地下城的压迫感拉满,导航栏、首页海报这些官网标配也一应俱全。

更惊喜的是,它还专门做了闯关地图&Boss专题板块,把地图及敌人设定和“失控神力·神骸污染”的底层世界观焊在一起,而不是干巴巴地罗列关卡和怪物。

玩法介绍、跳转入口等上线必备的合规组件也基本配齐了。

看来,以后没有设计师和前端团队的独游开发者和小团队,靠星火X2.5搭配文生图工具,也能自己鼓捣出能上线的炫酷官网了。

三道关卡跑完,表面看玩法五花八门,但扒到最后,考的其实是同一道题:

AI能不能从问答、写代码,一路走到交付?

还真不是我们故意把题出难了。

你顺着今年AI圈的热闹往回看,会发现大家早就在偷偷换考卷。

年初OpenClaw一把蹿红,全网围观AI自己调工具、替人办事。

紧接着,OpenAI和Anthropic这些前沿玩家又开始猛聊Harness Engineering,琢磨着怎么给Agent搭好工位、定好流程,让它一口气干上几个小时也别掉链子。

发现没?光会聊天,已经不太够看了。

能把事情接过去,一路干到底,才是真本事!!

把星火大模型这两年的更新日志翻一遍,也能看出同样的变化。

X1先攻深度推理,X2-Flash加码代码和智能体,X2-VL补上多模态理解。

到了X2.5,代码和智能体更是直接被摆在了最前面。

先让模型会想,再让它会看、会动手,最后把活交出来,星火就这样把这些能力一块块补齐。

再往下扒一层,印象中相比其他国产模型,星火身上还有个很鲜明的标签:

全国产算力。

这个标签要讲透,得先分清两件经常被混在一起的事。

把已经训练好的模型搬到国产芯片上运行,这属于推理适配,解决的是模型当下能不能跑起来。

讯飞走得更深一些,从模型训练、强化学习、持续迭代到推理部署,整条链路都落在国产算力平台上。

一个是中途做适配,另一个是从平台原生长出来。

这个标签放在今天,含金量又不一样了。

Agent不是一锤子买卖,模型要不断更新,工具和任务也一直在变。

只做推理适配,你永远解决的只是当下遇到的问题,打通训推全链路……

查看原文

(本文转载自量子位,仅作资讯分享)
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

网站介绍
AI 学习社区(subo.qd.je)—— 一个专注 AI 学习、技术交流与资讯分享的社区平台。欢迎每一位 AI 爱好者!
快捷访问
我的帖子
我的收藏
我的好友
我的关注
附加功能
任务大厅
勋章中心
每日签到
排行榜
关于我们
举报
手机版
站点统计
注册账号

AI 学习社区

GMT+8, 2026-9-13 18:08 , Processed in 0.028248 second(s), 18 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表