据站长之家 11 月 21 日报道,美国圣塔菲研究所的研究显示,GPT-4 在图形推理任务上的准确率仅为 33%,而多模态版本 GPT-4v 的表现更差,只有 25%。通过使用 ConceptARC 数据集,作者对 451 名人类受试者进行了图形推理任务测试,结果显示人类的平均正确率为 91%,远高于 GPT-4。
但是研究者招募受试者的方式和 GPT-4 的输入方式引发了质疑,包括入门测试不足以筛选高质量受试者,样本的随机性受到争议,以及图像转换为数字矩阵可能改变概念等。
GPT-4的图形推理能力,竟然连人类的一半都不到?美国圣塔菲研究所的一项研究显示,GPT-4做图形推理题的准确率仅有33%。而具有多模态能力的GPT-4v表现更糟糕,只能做对25%的题目。这项实验结果发表后,迅速在YC上引发了广泛热议。赞同这项结果的网友表示,GPT确实不擅长抽象图形处理,“位置”“旋转”等概念理解起来更加困难。
GPT-4
量子位 2023-11-20
AI新智界 2024-01-06
谷歌联合多所高校的一项最新研究,让大模型开始拥有了人类的“心智”。具体来说,研究人员发现,现在的大模型,已经具备了在对话中推测人类“在想啥”的能力。那么,有了FaR的大模型,究竟拥有什么样的“心智”呢?
谷歌GPT-4
量子位 2023-10-14
GPT-4准确率飙升64%,还当起了“老板” 【新智元导读】大模型幻觉问题还有另一种解法?斯坦福联手OpenAI研究人员提出「元提示」新方法,能够让大模型成为全能「指挥家」,汇聚不同专家模型精华
GPT-4斯坦福OpenAI
新智元 2024-01-29
ChatGPT
IT之家 2024-01-04
快科技12月27日消息,今日有网友曝光了问界M8实车的路试视频。从视频中来看,问界M8的尾部造型,与“大哥”问界M9一脉相承,均使用了贯穿式尾灯,尾灯造型也一致。结合此前曝
2024-12-27
万亿“宁王”,正式公布赴港上市计划。12月26,宁德时代召开第四届董事会第一次会议,逐项审议通过《关于公司发行H股股票并在香港联合交易所有限公司上市方案的议案》(下称:议案)
快科技12月27日消息,今天七彩虹宣布,旗下Z890系列主板迎来最新的0x114微码更新,为酷睿Ultra 200S系列处理器提供全新功能和性能提升。其中,iGame Z890 VULCAN X/W、iGame Z890 FLOW,iGame
快科技12月27日消息,据“天瑞磁悬浮”官微发文,天瑞重工自主研发的国内首台磁悬浮离心式地源热泵机组,在山东省潍坊市某住宅小区成功开机运行,标志着城市供暖进入绿色新纪元。据
快科技12月27日消息,鸿蒙智行首款百万级豪华轿车尊界S800已经申报,将提供纯电和增程两种动力类型,均分为双电机和三电机。其中增程版将配备一台来自东安动力提供的1.5T增程器,这引发了非常
“如果有一天,安卓用不了了,Windows用不了了,怎么办?”今日,央视联合华为发布鸿蒙系统纪录片,回顾了鸿蒙的诞生之路,并称“中国人一定要有自己的操作系统。”2
快科技12月27日消息,据媒体报道,近期,极越欠款3700万的供应商星塘文化负责人李红星发视频疑似在线讨债。在视频中,李红星表示,极越欠我的3700万,1000多万是抵押的房子,2000多万是借的。
快科技12月27日消息,在昨日举办的华为智慧办公生态峰会上,佳能和华为正式签署了合作备忘录。双方宣布共建原生鸿蒙(HarmonyOS NEXT)生态,完成驱动、APP及云打印等领域的鸿蒙适配,合力打造
今日,由易烊千玺主演的电影《小小的我》全国正式上映。在豆瓣早期评价中,观众们给予了不错的评价。不少观众被易烊千玺饰演的“脑瘫”主角刘春和所感动,也对他年纪轻轻就有勇
12月26日,重庆江北国际机场新建第四跑道正式启用,成为中西部地区第一个、上海浦东/北京大兴机场之后全国第三个拥有4条跑道且同时运行的机场。东航C919执飞的MU5428航班(重庆—上海虹桥
Copyright © 2026 aigcdaily.cn 北京智识时代科技有限公司 版权所有 京ICP备2023006237号-1