Article(id=1212342497687245497, tenantId=1146029695717560320, journalId=1146031591421210625, issueId=1212342494176604450, articleNumber=null, orderNo=18, doi=10.3981/j.issn.1000-7857.2025.10.00077, pmid=null, cstr=null, oa=null, hot=null, price=null, onlineType=0, articleFormat=0, articleType=null, articleTypeStr=research-article, receivedDate=1757520000000, receivedDateStr=2025-09-11, revisedDate=1760716800000, revisedDateStr=2025-10-18, acceptedDate=null, acceptedDateStr=null, onlineDate=1766974575682, onlineDateStr=2025-12-29, pubDate=1761580800000, pubDateStr=2025-10-28, doiRegisterDate=null, doiRegisterDateStr=null, onlineIssueDate=1764950400000, onlineIssueDateStr=2025-12-06, onlineJustAcceptDate=null, onlineJustAcceptDateStr=null, onlineFirstDate=null, onlineFirstDateStr=null, sourceXml=null, magXml=null, createTime=1766974575682, creator=13701087609, updateTime=1774080196466, updator=sys-migrate, issue=Issue{id=1212342494176604450, tenantId=1146029695717560320, journalId=1146031591421210625, year='2025', volume='43', issue='20', pageStart='1', pageEnd='140', issueExtLink='null', onlineDate='null', pubDate='1761580800000', pubDateStr='2025-10-28', beforeIssueId=null, nextIssueId=null, price=null, status=1, issueComplete=1, articleOrder=1, issueType=-1, specialIssue=null, createTime=1766974574846, creator='13701087609', updateTime=1774330588720, updator='13041195026', preIssue=null, nextIssue=null, articleTotal=null, ext={EN=IssueExt(id=1243195852664189609, tenantId=1146029695717560320, journalId=1146031591421210625, issueId=1212342494176604450, language=EN, specialIssueTitle=, coverIllustrator=null, specialIssueEditor=, specialIssueAbout=), CN=IssueExt(id=1243195852668383914, tenantId=1146029695717560320, journalId=1146031591421210625, issueId=1212342494176604450, language=CN, specialIssueTitle=, coverIllustrator=null, specialIssueEditor=, specialIssueAbout=)}, issueFiles=null, downloadFileDto=null}, startPage=48, endPage=61, ext={EN=ArticleExt(id=1212342498001818309, articleId=1212342497687245497, tenantId=1146029695717560320, journalId=1146031591421210625, language=EN, title=Agent evolution under the VLA architecture: From mechanistic construction to application expansion, columnId=1150494642224591153, journalTitle=Science & Technology Review, columnName=Exclusive, runingTitle=null, highlight=null, articleAbstract=
Embodied intelligence represents a new stage in the evolution of artificial intelligence, marking a transition from "perception−cognition" to an integrated paradigm of "perception−cognition−action." The Vision−Language−Action (VLA) model provides a critical technological pathway for enabling autonomous agent operation in the real world by unifying visual perception, language understanding, and action generation. This paper systematically reviews the development trajectory and representative achievements of VLA technologies, and summarizes their architectural paradigm, which includes multi−modal perception, semantic fusion mechanisms, reinforcement and imitation learning, world models, and hierarchical action output. By considering application scenarios such as autonomous driving, human–computer interaction, and industrial equipment, we further analyze the core challenges faced by VLA development, including the scarcity of data resources, limited generalization and transferability, insufficient interpretability, and increasing computational demands, and we outline the future development trends.
, authors=null, authorsList=Hui ZHANG, Dongjin XIE, Shutong LIANG, Mingxuan LI, Xiaofeng JIA, Yonglin TIAN, Siji MA, Haoran LI, Yidong LI, authorCompany=null, correspAuthors=Xiaofeng JIA, authorNote=null, correspAuthorsNote=null, copyrightStatement=
All rights reserved. Unauthorized reproduction is prohibited., copyrightOwner=null, extLink=null, articleAbsUrl=null, sourceXml=null, magXml=null, pdfUrl=null, pdf=null, pdfFileSize=null, pdfExtLink=null, richHtmlUrl=null, mobilePdfUrl=null, reviewReport=null, pdfFirstPage=null, abstractGraph=null, abstractGraphContent=null, abstractVideo=null, citation=null, cebUrl=null, magXmlContent=null, mapNumber=null, fund=null), CN=ArticleExt(id=1212342498953925380, articleId=1212342497687245497, tenantId=1146029695717560320, journalId=1146031591421210625, language=CN, title=VLA架构下的智能体演化:从机理建构到应用拓展, columnId=1150494642375586098, journalTitle=科技导报, columnName=特色专题, runingTitle=null, highlight=null, articleAbstract=
具身智能作为人工智能发展的新阶段,正在实现从“感知−认知”到“感知−认知−行动”一体化的跃迁。视觉−语言−动作(vision−language−action,VLA)模型通过统一视觉感知、语言理解与动作生成,为智能体在真实世界中的自主操作提供了关键技术路径。系统梳理了VLA技术的发展脉络与典型成果,总结了其架构范式,包括多模态感知输入、语义融合机制、强化与模仿学习、世界模型和多层次动作输出。结合自动驾驶、人机交互和工业装备等应用场景,进一步分析了VLA发展面临的核心挑战,包括数据资源匮乏、泛化与迁移能力不足、可解释性与算力压力等,并展望了未来趋势。
, authors=
, authorsList=张慧, 谢东锦, 梁姝彤, 李明轩, 贾晓丰, 田永林, 马思吉, 李浩然, 李浥东, authorCompany=null, correspAuthors=贾晓丰, authorNote=null, correspAuthorsNote=
, copyrightStatement=
版权所有,未经授权,不得转载。, copyrightOwner=《科技导报》编辑部, extLink=null, articleAbsUrl=null, sourceXml=dnioarQni7gx0H+HqNF8JQ==, magXml=dnioarQni7gx0H+HqNF8JQ==, pdfUrl=null, pdf=XGpYx/Lf1SjwKJGkiqL7mg==, pdfFileSize=1608859, pdfExtLink=null, richHtmlUrl=null, mobilePdfUrl=null, reviewReport=null, pdfFirstPage=null, abstractGraph=cOPN5NtxjSLsLOPkgt8/Pg==, abstractGraphContent=null, abstractVideo=null, citation=null, cebUrl=null, magXmlContent=zWL4u4jcr3YIHSvHRZ6LAA==, mapNumber=null, fund=null)}, authors=[Author(id=1242145650247282818, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=0, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=huizhang1@bjtu.edu.cn, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145650331168900, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650247282818, language=EN, stringName=Hui ZHANG, firstName=Hui, middleName=null, lastName=ZHANG, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145650402472069, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650247282818, language=CN, stringName=张慧, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1北京交通大学计算机科学与技术学院,北京 100044, bio={"content":"
张慧,副教授,研究方向为多智能体协同、具身智能等,电子信箱:huizhang1@bjtu.edu.cn
"}, bioImg=null, bioContent=
张慧,副教授,研究方向为多智能体协同、具身智能等,电子信箱:huizhang1@bjtu.edu.cn
, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145649827852402, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=1, ext=[AuthorCompanyExt(id=1242145649836241011, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China), AuthorCompanyExt(id=1242145649848823924, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1北京交通大学计算机科学与技术学院,北京 100044)])]), Author(id=1242145650469580935, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=1, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145650574438537, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650469580935, language=EN, stringName=Dongjin XIE, firstName=Dongjin, middleName=null, lastName=XIE, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
2, address=
2School of Software, Xinjiang University, Urumqi 830046, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145650637353098, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650469580935, language=CN, stringName=谢东锦, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
2, address=
2新疆大学软件学院,乌鲁木齐 830046, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145649920127093, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=2, ext=[AuthorCompanyExt(id=1242145649928515702, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649920127093, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
2School of Software, Xinjiang University, Urumqi 830046, China), AuthorCompanyExt(id=1242145649936904311, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649920127093, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
2新疆大学软件学院,乌鲁木齐 830046)])]), Author(id=1242145650704461964, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=2, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145650779959438, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650704461964, language=EN, stringName=Shutong LIANG, firstName=Shutong, middleName=null, lastName=LIANG, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145650851262607, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650704461964, language=CN, stringName=梁姝彤, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1北京交通大学计算机科学与技术学院,北京 100044, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145649827852402, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=1, ext=[AuthorCompanyExt(id=1242145649836241011, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China), AuthorCompanyExt(id=1242145649848823924, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1北京交通大学计算机科学与技术学院,北京 100044)])]), Author(id=1242145650918371473, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=3, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145650989674643, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650918371473, language=EN, stringName=Mingxuan LI, firstName=Mingxuan, middleName=null, lastName=LI, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145651094532245, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145650918371473, language=CN, stringName=李明轩, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1北京交通大学计算机科学与技术学院,北京 100044, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145649827852402, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=1, ext=[AuthorCompanyExt(id=1242145649836241011, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China), AuthorCompanyExt(id=1242145649848823924, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1北京交通大学计算机科学与技术学院,北京 100044)])]), Author(id=1242145651224555672, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=4, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=jiaxf@jxj.beijing.gov.cn, emailSecond=null, emailThird=null, correspondingAuthor=1, authorType=1, ext={EN=AuthorExt(id=1242145651316830363, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145651224555672, language=EN, stringName=Xiaofeng JIA, firstName=Xiaofeng, middleName=null, lastName=JIA, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
3, *, address=
3Beijing Big Data Centre, Beijing 101117, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145651379744924, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145651224555672, language=CN, stringName=贾晓丰, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
3, *, address=
3北京市大数据中心,北京 101117, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145649991430264, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=3, ext=[AuthorCompanyExt(id=1242145650004013177, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649991430264, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
3Beijing Big Data Centre, Beijing 101117, China), AuthorCompanyExt(id=1242145650012401786, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649991430264, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
3北京市大数据中心,北京 101117)])]), Author(id=1242145652851945636, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=5, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145652940026024, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145652851945636, language=EN, stringName=Yonglin TIAN, firstName=Yonglin, middleName=null, lastName=TIAN, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
4, address=
4Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145652998746280, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145652851945636, language=CN, stringName=田永林, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
4, address=
4中国科学院自动化研究所,北京 100190, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145650079510651, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=4, ext=[AuthorCompanyExt(id=1242145650087899260, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650079510651, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
4Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China), AuthorCompanyExt(id=1242145650100482173, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650079510651, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
4中国科学院自动化研究所,北京 100190)])]), Author(id=1242145653061660842, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=6, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145653221044398, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145653061660842, language=EN, stringName=Siji MA, firstName=Siji, middleName=null, lastName=MA, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
5, address=
5Faculty of Innovation Engineering, Macau University of Science and Technology, Macau 999078, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145653279764654, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145653061660842, language=CN, stringName=马思吉, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
5, address=
5澳门科技大学创新工程学院,澳门 999078, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145650163396734, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=5, ext=[AuthorCompanyExt(id=1242145650171785343, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650163396734, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
5Faculty of Innovation Engineering, Macau University of Science and Technology, Macau 999078, China), AuthorCompanyExt(id=1242145650180173952, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650163396734, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
5澳门科技大学创新工程学院,澳门 999078)])]), Author(id=1242145653338484912, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=7, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145653413982386, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145653338484912, language=EN, stringName=Haoran LI, firstName=Haoran, middleName=null, lastName=LI, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
4, address=
4Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145653556588723, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145653338484912, language=CN, stringName=李浩然, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
4, address=
4中国科学院自动化研究所,北京 100190, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145650079510651, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=4, ext=[AuthorCompanyExt(id=1242145650087899260, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650079510651, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
4Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China), AuthorCompanyExt(id=1242145650100482173, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650079510651, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
4中国科学院自动化研究所,北京 100190)])]), Author(id=1242145653619503285, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, orderNo=8, firstName=null, middleName=null, lastName=null, nameCn=null, orcid=null, stid=null, country=null, authorPic=null, dead=0, email=null, emailSecond=null, emailThird=null, correspondingAuthor=0, authorType=1, ext={EN=AuthorExt(id=1242145653711777975, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145653619503285, language=EN, stringName=Yidong LI, firstName=Yidong, middleName=null, lastName=LI, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null), CN=AuthorExt(id=1242145653766303928, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, authorId=1242145653619503285, language=CN, stringName=李浥东, firstName=null, middleName=null, lastName=null, prefix=null, suffix=null, authorComment=null, nameInitials=null, affiliation=null, department=null, xref=
1, address=
1北京交通大学计算机科学与技术学院,北京 100044, bio=null, bioImg=null, bioContent=null, aboutCorrespAuthor=null)}, companyList=[AuthorCompany(id=1242145649827852402, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=1, ext=[AuthorCompanyExt(id=1242145649836241011, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China), AuthorCompanyExt(id=1242145649848823924, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1北京交通大学计算机科学与技术学院,北京 100044)])])], keywords=[Keyword(id=1242145653875355833, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=EN, orderNo=1, keyword=vision−language−action model), Keyword(id=1242145653938270394, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=EN, orderNo=2, keyword=multi−modal learning), Keyword(id=1242145653996990651, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=EN, orderNo=3, keyword=embodied intelligence), Keyword(id=1242145654076682428, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=EN, orderNo=4, keyword=large language model), Keyword(id=1242145654152179901, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=CN, orderNo=1, keyword=视觉−语言−动作模型), Keyword(id=1242145654227677374, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=CN, orderNo=2, keyword=多模态学习), Keyword(id=1242145654290591935, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=CN, orderNo=3, keyword=具身智能), Keyword(id=1242145654366089408, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=CN, orderNo=4, keyword=大语言模型)], refs=[Reference(id=1242145655041372364, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=1991, volume=47, issue=1/2/3, pageStart=139, pageEnd=159, url=null, language=null, rfNumber=[1], rfOrder=0, authorNames=Brooks R A, journalName=Artificial Intelligence, refType=null, unstructuredReference=
Brooks R A. Intelligence without representation[J].
Artificial Intelligence,
1991,
47(1/2/3): 139-159., articleTitle=Intelligence without representation, refAbstract=null), Reference(id=1242145655112675534, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[2], rfOrder=1, authorNames=null, journalName=null, refType=null, unstructuredReference=Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]//International Conference on Machine Learning. Oxford: PMLR, 2021: 8748−8763., articleTitle=null, refAbstract=null), Reference(id=1242145655183978705, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[3], rfOrder=2, authorNames=null, journalName=null, refType=null, unstructuredReference=Alayrac J B, Donahue J, Luc P, et al. Flamingo: A visual language model for few−shot learning[C]//Conference on Neural Information Processing Systems. New Orleans, Louisiana, US: Curran Associates, Inc., 2022: 23716−23736., articleTitle=null, refAbstract=null), Reference(id=1242145655263670483, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[4], rfOrder=3, authorNames=null, journalName=null, refType=null, unstructuredReference=Radford A, Narasimhan K, Salimans T, et al. Improving language understanding by generative pre-training[J/OL]. OpenAI, [2025−09−18].
https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf., articleTitle=null, refAbstract=null), Reference(id=1242145655343362261, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[5], rfOrder=4, authorNames=null, journalName=null, refType=null, unstructuredReference=Zitkovich B, Yu T, Xu S, et al. RT−2: Vision−language−action models transfer web knowledge to robotic control[C]//Conference on Robot Learning. Atlanta: PMLR, 2023: 2165−2183., articleTitle=null, refAbstract=null), Reference(id=1242145655414665430, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[6], rfOrder=5, authorNames=null, journalName=null, refType=null, unstructuredReference=Ghosh D, Walke H R, Pertsch K, et al. Octo: An open−source generalist robot policy[C]//Proceedings of Robotics: Science and Systems XX. Robotics: Science and Systems Foundation, 2024: 1−10., articleTitle=null, refAbstract=null), Reference(id=1242145655515328728, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[7], rfOrder=6, authorNames=null, journalName=null, refType=null, unstructuredReference=Sima C H, Renz K, Chitta K, et al. DriveLM: Driving withGraph visual question answering[C]//European Conference on Computer Vision. Cham: Springer Nature Switzerland, 2025: 256−274., articleTitle=null, refAbstract=null), Reference(id=1242145655628574938, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[8], rfOrder=7, authorNames=null, journalName=null, refType=null, unstructuredReference=Tian X, Gu J, Li B, et al. DriveVLM: The convergence of autonomous driving and large vision−language models[J]. arXiv preprint, 2024, arXiv: 2402.12289., articleTitle=null, refAbstract=null), Reference(id=1242145655695683803, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[9], rfOrder=8, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhang J, Wang K, Wang S, et al. Uni−NaVid: A video−based vision−language−action model for unifying embodied navigation tasks[J]. arXiv preprint, 2024, arXiv: 2412.06224., articleTitle=null, refAbstract=null), Reference(id=1242145655758598364, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[10], rfOrder=9, authorNames=null, journalName=null, refType=null, unstructuredReference=Shridhar M, Manuelli L, Fox D. CLIPort: What and where pathways for robotic manipulation[C]//Conference on Robot Learning. Auckland: PMLR, 2022: 894−906., articleTitle=null, refAbstract=null), Reference(id=1242145655859261662, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[11], rfOrder=10, authorNames=null, journalName=null, refType=null, unstructuredReference=Reed S, Zolna K, Parisotto E, et al. A generalist agent[J]. arXiv preprint, 2022, arXiv: 2205.06175., articleTitle=null, refAbstract=null), Reference(id=1242145657348239587, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[12], rfOrder=11, authorNames=null, journalName=null, refType=null, unstructuredReference=Brohan A, Brown N, Carbajal J, et al. RT−1: Robotics transformer for real−world control at scale[C]//Proceedings of Robotics: Science and Systems XIX. Robotics: Science and Systems Foundation, 2023: 1−18., articleTitle=null, refAbstract=null), Reference(id=1242145657436319976, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2023, volume=202, issue=null, pageStart=14975, pageEnd=15022, url=null, language=null, rfNumber=[13], rfOrder=12, authorNames=Jiang Y, Gupta A, Zhang Z, journalName=Conference on Machine Learning, refType=null, unstructuredReference=
Jiang Y,
Gupta A,
Zhang Z,
et al. VIMA: General robot manipulation with multimodal prompts[J].
Conference on Machine Learning,
2023,
202: 14975-15022., articleTitle=VIMA: General robot manipulation with multimodal prompts, refAbstract=null), Reference(id=1242145657536983277, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2023, volume=null, issue=229, pageStart=1461, pageEnd=1476, url=null, language=null, rfNumber=[14], rfOrder=13, authorNames=Huang W, Wang C, Zhang R, journalName=Proceedings of Machine Learning Research, refType=null, unstructuredReference=
Huang W,
Wang C,
Zhang R,
et al. VoxPoser: Composable 3D value maps for robotic manipulation with language models[J].
Proceedings of Machine Learning Research,
2023(229): 1461-1476., articleTitle=VoxPoser: Composable 3D value maps for robotic manipulation with language models, refAbstract=null), Reference(id=1242145657646035183, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[15], rfOrder=14, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhang B, Zhang Y, Ji J, et al. SafeVLA: Towards safety alignment of vision−language−action model via constrained learning[J]. arXiv preprint, 2025, arXiv: 2503.03480., articleTitle=null, refAbstract=null), Reference(id=1242145657759281394, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[16], rfOrder=15, authorNames=null, journalName=null, refType=null, unstructuredReference=Ding P, Ma J, Tong X, et al. Humanoid−VLA: Towards universal humanoid control with visual integration[J]. arXiv preprint, 2025, arXiv: 2502.14795., articleTitle=null, refAbstract=null), Reference(id=1242145657851556087, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[17], rfOrder=16, authorNames=null, journalName=null, refType=null, unstructuredReference=Huang H, Liu F C, Fu L T, et al. Early fusion helps vision language action models generalize better[J/OL]. arXiv, [2025−09−18].
https://arxiv.org/abs/2410.15310., articleTitle=null, refAbstract=null), Reference(id=1242145657960607994, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[18], rfOrder=17, authorNames=null, journalName=null, refType=null, unstructuredReference=Bjorck J, Castañeda F, Cherniadev N, et al. GR00T N1: An open foundation model for generalist humanoid robots[J]. arXiv preprint, 2025, arXiv: 2503.14734., articleTitle=null, refAbstract=null), Reference(id=1242145658027716860, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[19], rfOrder=18, authorNames=null, journalName=null, refType=null, unstructuredReference=Black K, Brown N, Driess D, et al. π
0: A vision−language−action flow model for general robot control[J]. arXiv preprint, 2024, arXiv: 2410.24164., articleTitle=null, refAbstract=null), Reference(id=1242145658128380158, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[20], rfOrder=19, authorNames=null, journalName=null, refType=null, unstructuredReference=Chen Z, Wang J, Wang W, et al. Fast: Faster arbitrarily−shaped text detector with minimalist kernel representation[J]. arXiv preprint, 2021, arXiv: 2111.02394., articleTitle=null, refAbstract=null), Reference(id=1242145658195489024, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2022, volume=62, issue=1, pageStart=1, pageEnd=62, url=null, language=null, rfNumber=[21], rfOrder=20, authorNames=LeCun Y, journalName=Open Review, refType=null, unstructuredReference=
LeCun Y. A path towards autonomous machine intelligence version 0[J].
Open Review,
2022,
62(1): 1-62., articleTitle=A path towards autonomous machine intelligence version 0, refAbstract=null), Reference(id=1242145658262597890, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2023, volume=49, issue=3, pageStart=614, pageEnd=634, url=null, language=null, rfNumber=[22], rfOrder=21, authorNames=杨静, 王晓, 王雨桐, journalName=自动化学报, refType=null, unstructuredReference=杨静, 王晓, 王雨桐,
等. 平行智能与CPSS: 三十年发展的回顾与展望[J].
自动化学报,
2023,
49(3): 614-634., articleTitle=平行智能与CPSS: 三十年发展的回顾与展望, refAbstract=null), Reference(id=1242145658346483972, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2024, volume=57, issue=9, pageStart=255, pageEnd=null, url=null, language=null, rfNumber=[23], rfOrder=22, authorNames=Wang X X, Yang J, Liu Y H, journalName=Artificial Intelligence Review, refType=null, unstructuredReference=
Wang X X,
Yang J,
Liu Y H,
et al. Parallel intelligence in three decades: A historical review and future perspective on ACP and cyber−physical−social systems[J].
Artificial Intelligence Review,
2024,
57(9): 255., articleTitle=Parallel intelligence in three decades: A historical review and future perspective on ACP and cyber−physical−social systems, refAbstract=null), Reference(id=1242145658426175750, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2025, volume=7, issue=3, pageStart=290, pageEnd=303, url=null, language=null, rfNumber=[24], rfOrder=23, authorNames=李柏, 郝金第, 孙跃硕, journalName=智能科学与技术学报, refType=null, unstructuredReference=李柏, 郝金第, 孙跃硕,
等. 平行智能范式视角下的视觉−语言−动作模型发展现状与展望[J].
智能科学与技术学报,
2025,
7(3): 290-303., articleTitle=平行智能范式视角下的视觉−语言−动作模型发展现状与展望, refAbstract=null), Reference(id=1242145658493284616, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2025, volume=51, issue=9, pageStart=1922, pageEnd=1950, url=null, language=null, rfNumber=[25], rfOrder=24, authorNames=张慧, 梁姝彤, 李明轩, journalName=自动化学报, refType=null, unstructuredReference=张慧, 梁姝彤, 李明轩,
等. 视觉—语言—动作模型综述: 从前史到前沿[J].
自动化学报,
2025,
51(9): 1922-1950., articleTitle=视觉—语言—动作模型综述: 从前史到前沿, refAbstract=null), Reference(id=1242145658556199179, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[26], rfOrder=25, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhai X H, Mustafa B, Kolesnikov A, et al. Sigmoid loss for language image pre−training[C]//Proceedings of IEEE/CVF International Conference on Computer Vision(ICCV). New York: IEEE, 2023: 11975−11986., articleTitle=null, refAbstract=null), Reference(id=1242145658627502351, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[27], rfOrder=26, authorNames=null, journalName=null, refType=null, unstructuredReference=Ahn M, Brohan A, Brown N, et al. Do as i can, not as i say: Grounding language in robotic affordances[J]. arXiv preprint, 2022, arXiv: 2204.01691., articleTitle=null, refAbstract=null), Reference(id=1242145658690416913, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[28], rfOrder=27, authorNames=null, journalName=null, refType=null, unstructuredReference=Li Q, Liang Y, Wang Z, et al. CogACT: A foundational vision−language−action model for synergizing cognition and action in robotic manipulation[J]. arXiv preprint, 2024, arXiv: 2411.19650., articleTitle=null, refAbstract=null), Reference(id=1242145658749137171, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[29], rfOrder=28, authorNames=null, journalName=null, refType=null, unstructuredReference=Liu S, Wu L, Li B, et al. RDT−1B: A diffusion foundation model for bimanual manipulation[J]. arXiv preprint, 2024, arXiv: 2410.07864., articleTitle=null, refAbstract=null), Reference(id=1242145658807857429, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[30], rfOrder=29, authorNames=null, journalName=null, refType=null, unstructuredReference=Oquab M, Darcet T, Moutakanni T, et al. DINOv2: Learning robust visual features without supervision[J]. arXiv preprint, 2023, arXiv: 2304.07193., articleTitle=null, refAbstract=null), Reference(id=1242145658870771990, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[31], rfOrder=30, authorNames=null, journalName=null, refType=null, unstructuredReference=Kim M J, Pertsch K, Karamcheti S, et al. OpenVLA: An open−source vision−language−action model[J]. arXiv preprint, 2024, arXiv: 2406.09246., articleTitle=null, refAbstract=null), Reference(id=1242145658950463768, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[32], rfOrder=31, authorNames=null, journalName=null, refType=null, unstructuredReference=Huang S, Chang H, Liu Y, et al. A3VLM: Actionable articulation−aware vision language model[J]. arXiv preprint, 2024, arXiv: 2406.07549., articleTitle=null, refAbstract=null), Reference(id=1242145659034349850, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[33], rfOrder=32, authorNames=null, journalName=null, refType=null, unstructuredReference=Liu J, Chen H, An P, et al. HybridVLA: Collaborative diffusion and autoregression in a unified vision−language−action model[J]. arXiv preprint, 2025, arXiv: 2503.10631., articleTitle=null, refAbstract=null), Reference(id=1242145659097264412, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[34], rfOrder=33, authorNames=null, journalName=null, refType=null, unstructuredReference=Bhat S F, Birkl R, Wofk D, et al. ZoeDepth: Zero−shot transfer by combining relative and metric depth[J]. arXiv preprint, 2023, arXiv: 2302.12288., articleTitle=null, refAbstract=null), Reference(id=1242145659168567582, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[35], rfOrder=34, authorNames=null, journalName=null, refType=null, unstructuredReference=Cheng H K, Schwing A G. XMem: Long−term video object segmentation withanAtkinson−shiffrin memory model[C]//Computer Vision−ECCV 2022. Cham: Springer Nature Switzerland, 2022: 640−658., articleTitle=null, refAbstract=null), Reference(id=1242145659239870752, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[36], rfOrder=35, authorNames=null, journalName=null, refType=null, unstructuredReference=Kirillov A, Mintun E, Ravi N, et al. Segment anything[C]//Proceedings of IEEE/CVF International Conference on Computer Vision (ICCV). New York: IEEE, 2023: 4015−4026., articleTitle=null, refAbstract=null), Reference(id=1242145659298591010, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[37], rfOrder=36, authorNames=null, journalName=null, refType=null, unstructuredReference=Ravi N, Gabeur V, Hu Y T, et al. SAM 2: Segment anything in images and videos[J]. arXiv preprint, 2024, arXiv: 2408.00714., articleTitle=null, refAbstract=null), Reference(id=1242145659374088484, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[38], rfOrder=37, authorNames=null, journalName=null, refType=null, unstructuredReference=Touvron H, Lavril T, Izacard G, et al. LLaMA: Open and efficient foundation language models[J]. arXiv preprint, 2023, arXiv: 2302.13971., articleTitle=null, refAbstract=null), Reference(id=1242145659437003046, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[39], rfOrder=38, authorNames=null, journalName=null, refType=null, unstructuredReference=Achiam J, Adler S, Agarwal S, et al. GPT−4 Technical Report[J]. arXiv preprint, 2023, arXiv: 2303.08774., articleTitle=null, refAbstract=null), Reference(id=1242145659495723303, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2023, volume=24, issue=240, pageStart=1, pageEnd=113, url=null, language=null, rfNumber=[40], rfOrder=39, authorNames=Chowdhery A, Narang S R, Devlin J, journalName=Journal of Machine Learning Research, refType=null, unstructuredReference=
Chowdhery A,
Narang S R,
Devlin J,
et al. PaLM: Scaling language modeling with pathways[J].
Journal of Machine Learning Research,
2023,
24(240): 1-113., articleTitle=PaLM: Scaling language modeling with pathways, refAbstract=null), Reference(id=1242145659554443561, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[41], rfOrder=40, authorNames=null, journalName=null, refType=null, unstructuredReference=Shridhar M, Manuelli L, Fox D. Perceiver−Actor: A multi−task transformer for robotic manipulation[C]//Conference on Robot Learning. Atlanta: PMLR, 2023: 785−799., articleTitle=null, refAbstract=null), Reference(id=1242145659617358123, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[42], rfOrder=41, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhao T Z, Kumar V, Levine S, et al. Learning fine−grained bimanual manipulation with low−cost hardware[J]. arXiv preprint, 2023, arXiv: 2304.13705., articleTitle=null, refAbstract=null), Reference(id=1242145659692855596, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[43], rfOrder=42, authorNames=null, journalName=null, refType=null, unstructuredReference=Li M Y, Wang Z H, He K C, et al. JARVIS−VLA: Post−training large−scale vision language models to play visual games with keyboards and mouse[J]. arXiv preprint, 2025, arXiv: 2503.16365., articleTitle=null, refAbstract=null), Reference(id=1242145659751575853, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2020, volume=21, issue=140, pageStart=1, pageEnd=67, url=null, language=null, rfNumber=[44], rfOrder=43, authorNames=Raffel C, Shazeer N, Roberts A, journalName=Journal of Machine Learning Research, refType=null, unstructuredReference=
Raffel C,
Shazeer N,
Roberts A,
et al. Exploring the limits of transfer learning with a unified text−to−text transformer[J].
Journal of Machine Learning Research,
2020,
21(140): 1-67., articleTitle=Exploring the limits of transfer learning with a unified text−to−text transformer, refAbstract=null), Reference(id=1242145659827073327, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2024, volume=25, issue=70, pageStart=1, pageEnd=53, url=null, language=null, rfNumber=[45], rfOrder=44, authorNames=Chung H W, Hou L, Longpre S, journalName=Journal of Machine Learning Research, refType=null, unstructuredReference=
Chung H W,
Hou L,
Longpre S,
et al. Scaling instruction−finetuned language models[J].
Journal of Machine Learning Research,
2024,
25(70): 1-53., articleTitle=Scaling instruction−finetuned language models, refAbstract=null), Reference(id=1242145659889987889, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[46], rfOrder=45, authorNames=null, journalName=null, refType=null, unstructuredReference=Bai J, Bai S, Chu Y, et al. Qwen technical report[J]. arXiv preprint, 2023, arXiv: 2309.16609., articleTitle=null, refAbstract=null), Reference(id=1242145659948708148, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[47], rfOrder=46, authorNames=null, journalName=null, refType=null, unstructuredReference=Li J, Li D, Savarese S, et al. BLIP−2: Bootstrapping language−image pre−training with frozen image encoders and large language models[C]//International Conference on Machine Learning. Honolulu: PMLR, 2023: 19730−19742., articleTitle=null, refAbstract=null), Reference(id=1242145660028399928, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[48], rfOrder=47, authorNames=null, journalName=null, refType=null, unstructuredReference=Bharadhwaj H, Vakil J, Sharma M, et al. RoboAgent: Generalization and efficiency in robot manipulation
via semantic augmentations and action chunking[C]//Proceedings of IEEE International Conference on Robotics and Automation (ICRA). New York: IEEE, 2024: 4788−4795., articleTitle=null, refAbstract=null), Reference(id=1242145660099703098, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[49], rfOrder=48, authorNames=null, journalName=null, refType=null, unstructuredReference=Li S L, Wang J, Dai R, et al. RoboNurse−VLA: Robotic scrub nurse system based on vision−language−action model[J]. arXiv preprint, 2024, arXiv: 2409.19590., articleTitle=null, refAbstract=null), Reference(id=1242145660166811964, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[50], rfOrder=49, authorNames=null, journalName=null, refType=null, unstructuredReference=Gu J Y, Kirmani S, Wohlhart P, et al. RT−trajectory: Robotic task generalization
via hindsight trajectory sketches[J]. arXiv preprint, 2023, arXiv: 2311.01977., articleTitle=null, refAbstract=null), Reference(id=1242145660225532222, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2025, volume=44, issue=10/11, pageStart=1684, pageEnd=1704, url=null, language=null, rfNumber=[51], rfOrder=50, authorNames=Chi C, Xu Z J, Feng S Y, journalName=The International Journal of Robotics Research, refType=null, unstructuredReference=
Chi C,
Xu Z J,
Feng S Y,
et al. Diffusion policy: Visuomotor policy learning
via action diffusion[J].
The International Journal of Robotics Research,
2025,
44(10/11): 1684-1704., articleTitle=Diffusion policy: Visuomotor policy learning
via action diffusion, refAbstract=null), Reference(id=1242145660288446784, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[52], rfOrder=51, authorNames=null, journalName=null, refType=null, unstructuredReference=Intelligence P, Black K, Brown N, et al. π
0.5: A vision−language−action model with open−world generalization[J]. arXiv preprint, 2025, arXiv: 2504.16054., articleTitle=null, refAbstract=null), Reference(id=1242145660351361346, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[53], rfOrder=52, authorNames=null, journalName=null, refType=null, unstructuredReference=Shukor M, Aubakirova D, Capuano F, et al. SmolVLA: A vision−language−action model for affordable and efficient robotics[J]. arXiv preprint, 2025, arXiv: 2506.01844., articleTitle=null, refAbstract=null), Reference(id=1242145661819367751, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[54], rfOrder=53, authorNames=null, journalName=null, refType=null, unstructuredReference=Driess D, Springenberg J T, Ichter B, et al. Knowledge insulating vision−language−action models: Train fast, run fast, generalize better[J]. arXiv preprint, 2025, arXiv: 2505.23705., articleTitle=null, refAbstract=null), Reference(id=1242145661899059530, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[55], rfOrder=54, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhao H, Song W X, Wang D L, et al. MoRE: Unlocking scalability in reinforcement learning for quadruped vision−language−action models[J]. arXiv preprint, 2025, arXiv: 2503.08007., articleTitle=null, refAbstract=null), Reference(id=1242145661957779789, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[56], rfOrder=55, authorNames=null, journalName=null, refType=null, unstructuredReference=Chen Y H, Tian S, Liu S G, et al. ConRFT: A reinforced fine−tuning method for VLA models
via consistency policy[J]. arXiv preprint, 2025, arXiv: 2502.05450., articleTitle=null, refAbstract=null), Reference(id=1242145662041665871, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[57], rfOrder=56, authorNames=null, journalName=null, refType=null, unstructuredReference=Xu K, Zhao S, Zhou Z, et al. A joint modeling of vision−language−action for target−oriented grasping in clutter[J]. arXiv preprint, 2023, arXiv: 2302.12610., articleTitle=null, refAbstract=null), Reference(id=1242145662121357649, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[58], rfOrder=57, authorNames=null, journalName=null, refType=null, unstructuredReference=Cheng A C, Ji Y, Yang Z, et al. NaVILA: Legged robot vision−language−action model for navigation[J]. arXiv preprint, 2024, arXiv: 2412.04453., articleTitle=null, refAbstract=null), Reference(id=1242145662201049426, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[59], rfOrder=58, authorNames=null, journalName=null, refType=null, unstructuredReference=Guo Y, Zhang J, Chen X, et al. Improving vision−language−action model with online reinforcement learning[J]. arXiv preprint, 2025, arXiv: 2501.16664., articleTitle=null, refAbstract=null), Reference(id=1242145662268158292, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[60], rfOrder=59, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhai S, Zhang Q, Zhang T, et al. A vision−language−action−critic model for robotic real−world reinforcement learning[J]. arXiv preprint, 2025, arXiv: 2509.15937., articleTitle=null, refAbstract=null), Reference(id=1242145662343655765, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[61], rfOrder=60, authorNames=null, journalName=null, refType=null, unstructuredReference=Kang G C, Kim J, Shim K, et al. CLIP−RT: Learning Language−Conditioned Robotic Policies from Natural Language Supervision[J]. arXiv preprint, 2024, arXiv: 2411.00508., articleTitle=null, refAbstract=null), Reference(id=1242145662431736151, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[62], rfOrder=61, authorNames=null, journalName=null, refType=null, unstructuredReference=Jiang A, Gao Y, Wang Y, et al. IRL−VLA: Training an vision−language−action policy via reward world model[J]. arXiv preprint, 2025, arXiv: 2508.06571., articleTitle=null, refAbstract=null), Reference(id=1242145662486262105, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[63], rfOrder=62, authorNames=null, journalName=null, refType=null, unstructuredReference=Huang C P, Wu Y H, Chen M H, et al. ThinkAct: Vision−language−action reasoning via reinforced visual latent planning[J]. arXiv preprint, 2025, arXiv: 2507.16815., articleTitle=null, refAbstract=null), Reference(id=1242145662549176667, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[64], rfOrder=63, authorNames=null, journalName=null, refType=null, unstructuredReference=Chen Z X, Huo J, Chen Y T, et al. RoboHorizon: An LLM−assisted multi−view world model for long−horizon robotic manipulation[J]. arXiv preprint, 2025, arXiv: 2501.06605., articleTitle=null, refAbstract=null), Reference(id=1242145662628868448, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[65], rfOrder=64, authorNames=null, journalName=null, refType=null, unstructuredReference=Wu Y, Tian R, Swamy G, et al. From foresight to forethought: VLm−in−the−loop policy steering via latent alignment[J]. arXiv preprint, 2025, arXiv: 2502.01828., articleTitle=null, refAbstract=null), Reference(id=1242145662695977317, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[66], rfOrder=65, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhen H, Qiu X, Chen P, et al. 3D−VLA: A 3D vision−language−action generative world model[J]. arXiv preprint, 2024, arXiv: 2403.09631., articleTitle=null, refAbstract=null), Reference(id=1242145662767280490, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[67], rfOrder=66, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhang W Y, Liu H S, Qi Z K, et al. DreamVLA: A vision−language−action model dreamed with comprehensive world knowledge[J]. arXiv preprint, 2025, arXiv: 2507.04447., articleTitle=null, refAbstract=null), Reference(id=1242145662846972267, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[68], rfOrder=67, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhong Z, Yan H, Li J, et al. FlowVLA: Thinking in motion with a visual chain of thought[J]. arXiv preprint, 2025, arXiv: 2508.18269., articleTitle=null, refAbstract=null), Reference(id=1242145662905692527, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[69], rfOrder=68, authorNames=null, journalName=null, refType=null, unstructuredReference=Szot A, Clegg A, Undersander E, et al. Habitat 2.0: Training home assistants to rearrange their habitat[C]//Conference on Neural Information Processing Systems. New York: Curran Associates, Inc. , 2021, 34: 251−266., articleTitle=null, refAbstract=null), Reference(id=1242145662960218482, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[70], rfOrder=69, authorNames=null, journalName=null, refType=null, unstructuredReference=Tao S, Xiang F, Shukla A, et al. ManiSkill3: GPU parallelized robotics simulation and rendering for generalizable embodied AI[J]. arXiv preprint, 2024, arXiv: 2410.00425., articleTitle=null, refAbstract=null), Reference(id=1242145663023133045, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[71], rfOrder=70, authorNames=null, journalName=null, refType=null, unstructuredReference=Li C S, Xia F, Martín−Martín R, et al. iGibson 2.0: Object−centric simulation for robot learning of everyday household tasks[J]. arXiv preprint, 2021, arXiv: 2108.03272., articleTitle=null, refAbstract=null), Reference(id=1242145663090241912, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[72], rfOrder=71, authorNames=null, journalName=null, refType=null, unstructuredReference=Li C, Zhang R, Wong J, et al. BEHAVIOR−1K: A human−centered, embodied ai benchmark with 1, 000 everyday activities and realistic simulation[J]. arXiv preprint, 2024, arXiv: 2403.09227., articleTitle=null, refAbstract=null), Reference(id=1242145663161545083, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2024, volume=16, issue=12, pageStart=457, pageEnd=null, url=null, language=null, rfNumber=[73], rfOrder=72, authorNames=Bray N, Boeding M, Hempel M, journalName=Future Internet, refType=null, unstructuredReference=
Bray N,
Boeding M,
Hempel M,
et al. A latency composition analysis for telerobotic performance insights across various network scenarios[J].
Future Internet,
2024,
16(12): 457., articleTitle=A latency composition analysis for telerobotic performance insights across various network scenarios, refAbstract=null), Reference(id=1242145663232848255, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2024, volume=24, issue=12, pageStart=3957, pageEnd=null, url=null, language=null, rfNumber=[74], rfOrder=73, authorNames=Kamtam S B, Lu Q, Bouali F, journalName=Sensors, refType=null, unstructuredReference=
Kamtam S B,
Lu Q,
Bouali F,
et al. Network latency in teleoperation of connected and autonomous vehicles: A review of trends, challenges, and mitigation strategies[J].
Sensors,
2024,
24(12): 3957., articleTitle=Network latency in teleoperation of connected and autonomous vehicles: A review of trends, challenges, and mitigation strategies, refAbstract=null), Reference(id=1242145663295762818, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[75], rfOrder=74, authorNames=null, journalName=null, refType=null, unstructuredReference=Shridhar M, Thomason J, Gordon D, et al. ALFRED: A benchmark for interpreting grounded instructions for everyday tasks[C]//Proceedings of IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE, 2020: 10740−10749., articleTitle=null, refAbstract=null), Reference(id=1242145663388037510, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2022, volume=36, issue=2, pageStart=2017, pageEnd=2025, url=null, language=null, rfNumber=[76], rfOrder=75, authorNames=Padmakumar A, Thomason J, Shrivastava A, journalName=Proceedings of the AAAI Conference on Artificial Intelligence, refType=null, unstructuredReference=
Padmakumar A,
Thomason J,
Shrivastava A,
et al. TEACh: Task−driven embodied agents that chat[J].
Proceedings of the AAAI Conference on Artificial Intelligence,
2022,
36(2): 2017-2025., articleTitle=TEACh: Task−driven embodied agents that chat, refAbstract=null), Reference(id=1242145663446757770, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[77], rfOrder=76, authorNames=null, journalName=null, refType=null, unstructuredReference=Vezhnevets A S, Osindero S, Schaul T, et al. FeUdal networks for hierarchical reinforcement learning[C]//International Conference on Machine Learning. Oxford: PMLR, 2017: 3540−3549., articleTitle=null, refAbstract=null), Reference(id=1242145663513866637, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2020, volume=5, issue=2, pageStart=3019, pageEnd=3026, url=null, language=null, rfNumber=[78], rfOrder=77, authorNames=James S, Ma Z C, Arrojo D R, journalName=IEEE Robotics and Automation Letters, refType=null, unstructuredReference=
James S,
Ma Z C,
Arrojo D R,
et al. RLBench: The robot learning benchmark & learning environment[J].
IEEE Robotics and Automation Letters,
2020,
5(2): 3019-3026., articleTitle=RLBench: The robot learning benchmark & learning environment, refAbstract=null), Reference(id=1242145663585169808, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[79], rfOrder=78, authorNames=null, journalName=null, refType=null, unstructuredReference=Anderson P, Chang A, Chaplot D S, et al. On evaluation of embodied navigation agents[J]. arXiv preprint, 2018, arXiv: 1807.06757., articleTitle=null, refAbstract=null), Reference(id=1242145663643890068, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[80], rfOrder=79, authorNames=null, journalName=null, refType=null, unstructuredReference=Ray A, Achiam J, Amodei D. Benchmarking safe exploration in deep reinforcement learning[J]. arXiv preprint, 2019, arXiv: 1910.01708., articleTitle=null, refAbstract=null), Reference(id=1242145663702610327, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[81], rfOrder=80, authorNames=null, journalName=null, refType=null, unstructuredReference=Peng X B, Andrychowicz M, Zaremba W, et al. Sim−to−real transfer of robotic control with dynamics randomization[C]//Proceedings of IEEE International Conference on Robotics and Automation (ICRA). New York: IEEE, 2018: 3803−3810., articleTitle=null, refAbstract=null), Reference(id=1242145663765524890, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[82], rfOrder=81, authorNames=null, journalName=null, refType=null, unstructuredReference=Tobin J, Fong R, Ray A, et al. Domain randomization for transferring deep neural networks from simulation to the real world[C]//Proceedings of IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). New York: IEEE, 2017: 23−30., articleTitle=null, refAbstract=null), Reference(id=1242145663824245151, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[83], rfOrder=82, authorNames=null, journalName=null, refType=null, unstructuredReference=Dosovitskiy A, Ros G, Codevilla F, et al. CARLA: An open urban driving simulator[C]//Conference on Robot Learning. Mountain View: PMLR, 2017: 1−16., articleTitle=null, refAbstract=null), Reference(id=1242145663929102754, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[84], rfOrder=83, authorNames=null, journalName=null, refType=null, unstructuredReference=Kumar A, Fu Z, Pathak D, et al. RMA: Rapid Motor adaptation for legged robots[J]. arXiv preprint, 2021, arXiv: 2107.04034., articleTitle=null, refAbstract=null), Reference(id=1242145664004600229, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[85], rfOrder=84, authorNames=null, journalName=null, refType=null, unstructuredReference=Henderson P, Islam R, Bachman P, et al. Deep reinforcement learning that matters[C]//AAAI Conference on Artificial Intelligence. New Orleans: AAAI Press, 2018., articleTitle=null, refAbstract=null), Reference(id=1242145664071709098, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[86], rfOrder=85, authorNames=null, journalName=null, refType=null, unstructuredReference=Sharma P, Mohan L, Pinto L, et al. Multiple interactions made easy (MIME): Large scale demonstrations data for imitation[C]//Conference on Robot Learning. Zürich: PMLR, 2018: 906−915., articleTitle=null, refAbstract=null), Reference(id=1242145664155595181, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[87], rfOrder=86, authorNames=null, journalName=null, refType=null, unstructuredReference=Jang E, Irpan A, Khansari M, et al. BC−Z: Zero−shot task generalization with robotic imitation learning[C]//Conference on Robot Learning. Auckland: PMLR, 2022: 991−1002., articleTitle=null, refAbstract=null), Reference(id=1242145664243675568, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[88], rfOrder=87, authorNames=null, journalName=null, refType=null, unstructuredReference=Dasari S, Ebert F, Tian S, et al. RoboNet: Large−scale multi−robot learning[J]. arXiv preprint, 2019, arXiv: 1910.11215., articleTitle=null, refAbstract=null), Reference(id=1242145664298201522, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[89], rfOrder=88, authorNames=null, journalName=null, refType=null, unstructuredReference=Kalashnikov D, Varley J, Chebotar Y, et al. MT−Opt: Continuous multi−task robotic reinforcement learning at scale[J]. arXiv preprint, 2021, arXiv: 2104.08212., articleTitle=null, refAbstract=null), Reference(id=1242145664365310389, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[90], rfOrder=89, authorNames=null, journalName=null, refType=null, unstructuredReference=Fang H S, Fang H J, Tang Z Y, et al. RH20T: A comprehensive robotic dataset for learning diverse skills in one−shot[J]. arXiv preprint, 2023, arXiv: 2307.00595., articleTitle=null, refAbstract=null), Reference(id=1242145664428224951, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[91], rfOrder=90, authorNames=null, journalName=null, refType=null, unstructuredReference=Khazatsky A, Pertsch K, Nair S, et al. DROID: A large−scale in−the−wild robot manipulation dataset[J]. arXiv preprint, 2024, arXiv: 2403.12945., articleTitle=null, refAbstract=null), Reference(id=1242145664486945208, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[92], rfOrder=91, authorNames=null, journalName=null, refType=null, unstructuredReference=Vuong Q, Levine S, Walke H R, et al. Open X−embodiment: Robotic learning datasets and rt−x models[C]//Conference on Neural Information Processing Systems. New York: Curran Associates, Inc., 2023., articleTitle=null, refAbstract=null), Reference(id=1242145664554054076, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[93], rfOrder=92, authorNames=null, journalName=null, refType=null, unstructuredReference=Nasiriany S, Maddukuri A, Zhang L, et al. RoboCasa: Large−scale simulation of everyday tasks for generalist robots[J]. arXiv preprint, 2024, arXiv: 2406.02523., articleTitle=null, refAbstract=null), Reference(id=1242145664658911680, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[94], rfOrder=93, authorNames=null, journalName=null, refType=null, unstructuredReference=Deng S L, Yan M, Wei S L, et al. GraspVLA: A grasping foundation model pre−trained on billion−scale synthetic action data[J]. arXiv preprint, 2025, arXiv: 2505.03233., articleTitle=null, refAbstract=null), Reference(id=1242145664717631938, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[95], rfOrder=94, authorNames=null, journalName=null, refType=null, unstructuredReference=Chen T, Chen Z, Chen B, et al. Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation[J]. arXiv preprint, 2025, arXiv: 2506.18088., articleTitle=null, refAbstract=null), Reference(id=1242145664784740805, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[96], rfOrder=95, authorNames=null, journalName=null, refType=null, unstructuredReference=Jiang Z Y, Xie Y Q, Lin K, et al. DexMimicGen: Automated data generation for bimanual dexterous manipulation
via imitation learning[C]//Proceedings of IEEE International Conference on Robotics and Automation (ICRA). New York: IEEE, 2025: 16923−16930., articleTitle=null, refAbstract=null), Reference(id=1242145666248552905, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[97], rfOrder=96, authorNames=null, journalName=null, refType=null, unstructuredReference=Duan J, Yuan W, Pumacay W, et al. Manipulate−anything: Automating real−world robots using vision−language models[J]. arXiv preprint, 2024, arXiv: 2406.18915., articleTitle=null, refAbstract=null), Reference(id=1242145666328244683, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[98], rfOrder=97, authorNames=null, journalName=null, refType=null, unstructuredReference=Xiao T, Chan H, Sermanet P, et al. Robotic skill acquisition
via instruction augmentation with vision−language models[J]. arXiv preprint, 2022, arXiv: 2211.11736., articleTitle=null, refAbstract=null), Reference(id=1242145666382770637, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[99], rfOrder=98, authorNames=null, journalName=null, refType=null, unstructuredReference=Ahn M, Dwibedi D, Finn C, et al. AutoRT: Embodied foundation models for large scale orchestration of robotic agents[J]. arXiv preprint, 2024, arXiv: 2401.12963., articleTitle=null, refAbstract=null), Reference(id=1242145666449879503, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[100], rfOrder=99, authorNames=null, journalName=null, refType=null, unstructuredReference=Cui C, Ma Y S, Cao X, et al. Drive as you speak: Enabling human−like interaction with large language models in autonomous vehicles[C]//Proceedings of IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW). New York: IEEE, 2024: 902−909., articleTitle=null, refAbstract=null), Reference(id=1242145666516988370, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[101], rfOrder=100, authorNames=null, journalName=null, refType=null, unstructuredReference=Cui C, Yang Z C, Zhou Y P, et al. Personalized autonomous driving with large language models: Field experiments[C]//Proceedings of IEEE 27th International Conference on Intelligent Transportation Systems (ITSC). New York: IEEE, 2024: 20−27., articleTitle=null, refAbstract=null), Reference(id=1242145666592485845, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=2024, volume=9, issue=10, pageStart=8186, pageEnd=8193, url=null, language=null, rfNumber=[102], rfOrder=101, authorNames=Xu Z H, Zhang Y J, Xie E Z, journalName=IEEE Robotics and Automation Letters, refType=null, unstructuredReference=
Xu Z H,
Zhang Y J,
Xie E Z,
et al. DriveGPT4: Interpretable end−to−end autonomous driving
via large language model[J].
IEEE Robotics and Automation Letters,
2024,
9(10): 8186-8193., articleTitle=DriveGPT4: Interpretable end−to−end autonomous driving
via large language model, refAbstract=null), Reference(id=1242145666651206104, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[103], rfOrder=102, authorNames=null, journalName=null, refType=null, unstructuredReference=Xu Z H, Bai Y, Zhang Y J, et al. DriveGPT4−V2: Harnessing large language model capabilities for enhanced closed−loop autonomous driving[C]//Proceedings of IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). New York: IEEE, 2025: 17261−17270., articleTitle=null, refAbstract=null), Reference(id=1242145666714120667, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[104], rfOrder=103, authorNames=null, journalName=null, refType=null, unstructuredReference=Fu H, Zhang D, Zhao Z, et al. ORION: A holistic end−to−end autonomous driving framework by vision−language instructed action generation[J]. arXiv preprint, 2025, arXiv: 2503.19755., articleTitle=null, refAbstract=null), Reference(id=1242145666781229533, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[105], rfOrder=104, authorNames=null, journalName=null, refType=null, unstructuredReference=Sohn A, Nagabandi A, Florensa C, et al. Introducing RFM-1: Giving robots human-like reasoning capabilities[EB/OL]. (2024−03−11)[2025−09−11].
https://covariant.ai/insights/introducing-rfm-1-giving-robots-human-like-reasoning-capabilities., articleTitle=null, refAbstract=null), Reference(id=1242145666839949792, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[106], rfOrder=105, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhou S, Xu F F, Zhu H, et al. WebArena: A realistic web environment for building autonomous agents[J]. arXiv preprint, 2023, arXiv: 2307.13854., articleTitle=null, refAbstract=null), Reference(id=1242145666919641571, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[107], rfOrder=106, authorNames=null, journalName=null, refType=null, unstructuredReference=Koh J Y, Lo R, Jang L, et al. VisualWebArena: Evaluating multimodal agents on realistic visual web tasks[J]. arXiv preprint, 2024, arXiv: 2401.13649., articleTitle=null, refAbstract=null), Reference(id=1242145666986750437, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[108], rfOrder=107, authorNames=null, journalName=null, refType=null, unstructuredReference=Deng X, Gu Y, Zheng B, et al. Mind2Web: Towards a generalist agent for the web[C]//Conference on Neural Information Processing Systems. New York: Curran Associates, Inc. , 2023, 36: 28091−28114., articleTitle=null, refAbstract=null), Reference(id=1242145667045470696, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[109], rfOrder=108, authorNames=null, journalName=null, refType=null, unstructuredReference=Chezelles D, Le Sellier T, Shayegan S O, et al. The browsergym ecosystem for web agent research[J]. arXiv preprint, 2024, arXiv: 2412.05467., articleTitle=null, refAbstract=null), Reference(id=1242145667108385259, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[110], rfOrder=109, authorNames=null, journalName=null, refType=null, unstructuredReference=Baechler G, Sunkara S, Wang M, et al. ScreenAI: A vision−language model for UI and infographics understanding[J]. arXiv preprint, 2024, arXiv: 2402.04615., articleTitle=null, refAbstract=null), Reference(id=1242145667175494126, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[111], rfOrder=110, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhang C, Yang Z, Liu J X, et al. AppAgent: Multimodal agents as smartphone users[C]//Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems. New York: ACM, 2025: 1−20., articleTitle=null, refAbstract=null), Reference(id=1242145667246797297, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[112], rfOrder=111, authorNames=null, journalName=null, refType=null, unstructuredReference=Lin K Q, Li L, Gao D, et al. ShowUI: One Vision−Language−Action Model for GUI Visual Agent[C]//Proceedings of the Computer Vision and Pattern Recognition Conference. Nashville: IEEE, 2025: 19498−19508., articleTitle=null, refAbstract=null), Reference(id=1242145667326489075, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[113], rfOrder=112, authorNames=null, journalName=null, refType=null, unstructuredReference=Yang R, Chen H, Zhang J, et al. EmbodiedBench: Comprehensive benchmarking multi−modal large language models for vision−driven embodied agents[J]. arXiv preprint, 2025, arXiv: 2502.09560., articleTitle=null, refAbstract=null), Reference(id=1242145667393597942, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[114], rfOrder=113, authorNames=null, journalName=null, refType=null, unstructuredReference=Jin P, Huang D, Li C, et al. RealBench: Benchmarking verilog generation models with real−world ip designs[J]. arXiv preprint, 2025, arXiv: 2507.16200., articleTitle=null, refAbstract=null), Reference(id=1242145667469095417, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, doi=null, pmid=null, pmcid=null, year=null, volume=null, issue=null, pageStart=null, pageEnd=null, url=null, language=null, rfNumber=[115], rfOrder=114, authorNames=null, journalName=null, refType=null, unstructuredReference=Zhang S, Xu Z, Liu P, et al. VLABench: A large−scale benchmark for language−conditioned robotics manipulation with long−horizon reasoning tasks[C]// International Conference on Computer Vision. Honolulu, Hawaii, 2025: 11142−11152., articleTitle=null, refAbstract=null)], funds=[Fund(id=1242145654823268553, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, awardId=62203040, language=CN, fundingSource=国家自然科学基金青年项目(62203040), fundOrder=null, country=null), Fund(id=1242145654881988810, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, awardId=62436010, language=CN, fundingSource=国家自然科学基金重点项目(62436010), fundOrder=null, country=null)], companyList=[AuthorCompany(id=1242145649827852402, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=1, ext=[AuthorCompanyExt(id=1242145649836241011, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China), AuthorCompanyExt(id=1242145649848823924, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649827852402, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
1北京交通大学计算机科学与技术学院,北京 100044)]), AuthorCompany(id=1242145649920127093, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=2, ext=[AuthorCompanyExt(id=1242145649928515702, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649920127093, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
2School of Software, Xinjiang University, Urumqi 830046, China), AuthorCompanyExt(id=1242145649936904311, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649920127093, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
2新疆大学软件学院,乌鲁木齐 830046)]), AuthorCompany(id=1242145649991430264, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=3, ext=[AuthorCompanyExt(id=1242145650004013177, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649991430264, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
3Beijing Big Data Centre, Beijing 101117, China), AuthorCompanyExt(id=1242145650012401786, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145649991430264, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
3北京市大数据中心,北京 101117)]), AuthorCompany(id=1242145650079510651, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=4, ext=[AuthorCompanyExt(id=1242145650087899260, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650079510651, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
4Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China), AuthorCompanyExt(id=1242145650100482173, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650079510651, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
4中国科学院自动化研究所,北京 100190)]), AuthorCompany(id=1242145650163396734, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, xref=5, ext=[AuthorCompanyExt(id=1242145650171785343, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650163396734, language=EN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
5Faculty of Innovation Engineering, Macau University of Science and Technology, Macau 999078, China), AuthorCompanyExt(id=1242145650180173952, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, companyId=1242145650163396734, language=CN, country=null, province=null, city=null, postcode=null, companyName=null, departmentName=null, remark=
5澳门科技大学创新工程学院,澳门 999078)])], figs=[ArticleFig(id=1242145654504501441, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=EN, label=null, caption=null, figureFileSmall=TL2C3l0HduxarITscL0g9Q==, figureFileBig=LCP1a9tIPLaf+BBDXu24lw==, tableContent=null), ArticleFig(id=1242145654559027395, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=CN, label=图1, caption=
VLA的架构范式, figureFileSmall=TL2C3l0HduxarITscL0g9Q==, figureFileBig=LCP1a9tIPLaf+BBDXu24lw==, tableContent=null), ArticleFig(id=1242145654638719174, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=EN, label=null, caption=null, figureFileSmall=x4Jh2kVZZw6fAaYr4VGViQ==, figureFileBig=iDK9Snlx/ju6wbvu77dehg==, tableContent=null), ArticleFig(id=1242145654697439432, tenantId=1146029695717560320, journalId=1146031591421210625, articleId=1212342497687245497, language=CN, label=图2, caption=
VLA核心组件与学习优化机制, figureFileSmall=x4Jh2kVZZw6fAaYr4VGViQ==, figureFileBig=iDK9Snlx/ju6wbvu77dehg==, tableContent=null)], attaches=null, journal=Journal(id=1125356956822126595, delFlag=0, nameCn=科技导报, nameEn=Science & Technology Review, nameHistory1=null, nameHistory2=null, issn=1000-7857, eissn=, cn=11-1421/N, coden=null, periodic=3, language=CN, oaType=0, ccby=null, superviseOffice=null, ownerOffice=null, pubOffice=null, editorOffice=null, officeType=null, aims=null, clcCode=null, officeProv=null, officeCity=null, officeAddr=null, officeZip=null, officeEmail=null, officePhone=null, editDirector=null, officeDirector=null, officeDirectorPhone=null, officeStaffNum=null, officeEmpNum=null, coverPicUrl=wfghvu3bhh/dKxuZ+ucVHA==, journalPrice=null, startedYear=null, abbrevIsoEn=Sci Technol Rev, journalRemark=null, publicationField=null, createdTime=null, updatedTime=1784015846012, createdBy=null, updatedBy=13041195026, firstLetterCn=K, firstLetterEn=K, subjectCode=Natural Sciences, subjectName=自然科学, subjectCodeEn=Natural Sciences, subjectNameEn=null, picCn=wfghvu3bhh/dKxuZ+ucVHA==, picEn=yjSfclmpNm7ihn9NbTZ69g==, jcr=null, cjcr=null, exts=[JournalExt(id=1283818766098219763, language=CN, name=科技导报, nameHistory1=null, nameHistory2=null, managedBy=中国科学技术协会, sponsoredBy=中国科学技术协会, publishedBy=科技导报社, editorOffice=, officeProv=null, officeCity=null, officeAddr=, officeZip=, editDirector=, officeDirector=null, officePhone=null, coverPicUrl=null, journalRemark=, submitArticleUrl=null, websiteUrl=http://www.kjdb.org/CN/home, createdTime=1784015846037, updatedTime=1784015846037, createdBy=13041195026, updatedBy=13041195026, submissionGuidelinesUrl=http://www.kjdb.org/CN/column/column7.shtml, submissionAuthorUrl=https://kjdbauthor.cast.org.cn/webm, submissionEditorUrl=https://kjdbeditor.cast.org.cn/webm/, submissionReviewUrl=https://kjdbauthor.cast.org.cn/webm, submissionCeEditorUrl=https://kjdbeditor.cast.org.cn/webm/, submissionAeEditorUrl=https://kjdbeditor.cast.org.cn/webm/, option={"copyright":""}), JournalExt(id=1283818766144357108, language=EN, name=Science & Technology Review, nameHistory1=null, nameHistory2=null, managedBy=, sponsoredBy=, publishedBy=, editorOffice=, officeProv=null, officeCity=null, officeAddr=, officeZip=, editDirector=, officeDirector=null, officePhone=null, coverPicUrl=null, journalRemark=, submitArticleUrl=null, websiteUrl=http://www.kjdb.org/EN/home, createdTime=1784015846048, updatedTime=1784015846048, createdBy=13041195026, updatedBy=13041195026, submissionGuidelinesUrl=http://www.kjdb.org/EN/column/column7.shtml, submissionAuthorUrl=https://kjdbauthor.manuscriptcloud.com/login, submissionEditorUrl=https://kjdbeditor.manuscriptcloud.com/login, submissionReviewUrl=https://kjdbauthor.manuscriptcloud.com/login, submissionCeEditorUrl=https://kjdbeditor.manuscriptcloud.com/login, submissionAeEditorUrl=https://kjdbeditor.manuscriptcloud.com/login, option={"copyright":""})], databaseList=null, tenantJournalId=1146031591421210625, websiteList=[Website(id=1146104741081231361, webName=null, webTitle=null, webDomain=null, webCopyrigh=null, webIpcNo=null, seoTitle=null, seoKeywords=null, seoDescription=null, tenantJournalId=null, journalId=1146031591421210625, journalNameCn=null, journalNameEn=null, grayFlag=null, tenantId=1146029695717560320, platformId=null, journalGroupId=null, journalGroupNameCn=null, journalGroupNameEn=null, type=1, domain=https://castjournals.cast.org.cn/joweb/kjdb/CN, language=CN, createTime=1751182263881, createBy=18614031015, updateTime=1751778001962, updateBy=18614031015, name=科技导报, tplId=1146099689490845704, title=科技导报, delFlag=0, indexPage=/home, props=[WebsiteProps(id=1148021146403992296, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146104741081231361, code=articleTextType, value=kx, createTime=1751639170504, updateTime=1751639170504, creator=18614031015, updator=18614031015), WebsiteProps(id=1148021146378826469, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146104741081231361, code=banner, value=null, createTime=1751639170498, updateTime=1751639170498, creator=18614031015, updator=18614031015), WebsiteProps(id=1148021146366243556, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146104741081231361, code=logo, value=https://castjournals.cast.org.cn/joweb/kjdb/CN/file/pic?fileId=9GHSf7eGlIPH0Tv/OOdstA==, createTime=1751639170495, updateTime=1751639170495, creator=18614031015, updator=18614031015), WebsiteProps(id=1148021146395603687, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146104741081231361, code=picServerUrl, value=https://castjournals.cast.org.cn/joweb/kjdb/CN/file/pic, createTime=1751639170502, updateTime=1751639170502, creator=18614031015, updator=18614031015), WebsiteProps(id=1148021146387215078, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146104741081231361, code=staticResourcePath, value=https://castjournals.cast.org.cn/joweb/cast_kjdb_cn_619/, createTime=1751639170500, updateTime=1751639170500, creator=18614031015, updator=18614031015)]), Website(id=1146105254833139715, webName=null, webTitle=null, webDomain=null, webCopyrigh=null, webIpcNo=null, seoTitle=null, seoKeywords=null, seoDescription=null, tenantJournalId=null, journalId=1146031591421210625, journalNameCn=null, journalNameEn=null, grayFlag=null, tenantId=1146029695717560320, platformId=null, journalGroupId=null, journalGroupNameCn=null, journalGroupNameEn=null, type=1, domain=https://castjournals.cast.org.cn/joweb/kjdb/EN, language=EN, createTime=1751182386363, createBy=18614031015, updateTime=1753500121937, updateBy=18614031015, name=科技导报, tplId=1146101810881728533, title=Science & Technology Review, delFlag=0, indexPage=/home, props=[WebsiteProps(id=1155838567709528217, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146105254833139715, code=articleTextType, value=kx, createTime=1753502988984, updateTime=1753502988984, creator=18614031015, updator=18614031015), WebsiteProps(id=1155838567692750998, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146105254833139715, code=banner, value=null, createTime=1753502988980, updateTime=1753502988980, creator=18614031015, updator=18614031015), WebsiteProps(id=1155838567688556693, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146105254833139715, code=logo, value=https://castjournals.cast.org.cn/joweb/kjdb/EN/file/pic?fileId=9GHSf7eGlIPH0Tv/OOdstA==, createTime=1753502988979, updateTime=1753502988979, creator=18614031015, updator=18614031015), WebsiteProps(id=1155838567705333912, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146105254833139715, code=picServerUrl, value=https://castjournals.cast.org.cn/joweb/kjdb/EN/file/pic, createTime=1753502988983, updateTime=1753502988983, creator=18614031015, updator=18614031015), WebsiteProps(id=1155838567701139607, tenantId=1146029695717560320, journalId=null, journalGroupId=null, siteId=1146105254833139715, code=staticResourcePath, value=https://castjournals.cast.org.cn/joweb/cast_kjdb_en_623/, createTime=1753502988982, updateTime=1753502988982, creator=18614031015, updator=18614031015)])], journalTitle=科技导报, weixinUrl=null, journalUrl=null, iacademicId=null, status=1, seqNo=null, journalTitleEn=Science & Technology Review, journalPhotoCn=wfghvu3bhh/dKxuZ+ucVHA==, journalPhotoEn=yjSfclmpNm7ihn9NbTZ69g==, journalFirstLetter=K, journalRecommend=null, journalNew=null, journalCollection=1, jcrJf=null, cjcrJf=0.91, jcrJfStr=null, cjcrJfStr=null, submissionFirstDecision=null, sciSubjectClassification=null, casSubjectClassification=null, citeScore=null, totalCitationFrequency=null, icpCode=null, psCode=null, advertisingLicenseCode=null, copyrightInformation=null, country=null, option=, provinceCode=null, provinceName=null, collectFlag=false, interPubPlatform=, interPubPlatformUrl=null), detailUrlCn=https://castjournals.cast.org.cn/joweb/kjdb/CN/10.3981/j.issn.1000-7857.2025.10.00077, detailUrlEn=https://castjournals.cast.org.cn/joweb/kjdb/EN/10.3981/j.issn.1000-7857.2025.10.00077, pdfUrlCn=https://castjournals.cast.org.cn/joweb/kjdb/CN/PDF/10.3981/j.issn.1000-7857.2025.10.00077, pdfUrlEn=https://castjournals.cast.org.cn/joweb/kjdb/EN/PDF/10.3981/j.issn.1000-7857.2025.10.00077, aliStartDate=null, aliEndDate=null, collectionFlag=false, citedCount=null, citedUrl=null, previewStatus=0, delFlag=0, hasFullText=1, orderTime=1761580800000, fullTextJson=null, articleText=null, reference=null)