{"as_of":"2026-08-19T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f474a562ed2baa91f43a90a2addc6f469b8c62448ede90203d4e290a3fdc643","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:06:38.499008Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-24T01:25:54.580634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:52738ca6d195caa4dd18dc35d2dde4af2022beddd01388db970ee56bfaefd0cd","observation_id":"e22b3f59-15d9-4265-8545-7ebfc909ed16","resolution":{"observed_at":"2026-05-16T02:56:42.009453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-17T06:15:32.510873Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-05-11T10:47:44.152066Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2309.07864"},"observation_digest":"sha256:d1afa9e2c03a94c60e715e85544e6add841f1b0bb01d3dc3f37692511dd20208","observation_id":"f4bdaa72-505a-480a-96eb-0578164cde0f","resolution":{"observed_at":"2026-05-11T10:47:47.811843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-11T17:23:24.255829Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2310.08864"},"observation_digest":"sha256:9de0d3fc75fad373d7147614558de0154fab3fe9abdde5e83215a7d6d59eb7ac","observation_id":"fb89be34-c3d6-4b79-979b-9854cd441244","resolution":{"observed_at":"2026-05-11T17:23:24.360032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:9bdb12734cd16a37c0435f4b1b4fe489d9ec18aa3cfe5e842a1d22a605220aa5","observation_id":"6d22969d-fb1d-4bad-9f85-4875ad9ebaa3","resolution":{"observed_at":"2026-05-13T22:46:10.072892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:0b97dab7cdf3b13ebe9e4beb4ef68eea04c5eb06750f31c921124c164cb9a510","observation_id":"e7427b10-da64-4515-bb17-faef5e9396a3","resolution":{"observed_at":"2026-05-16T16:35:38.024396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:9613fc22a6af3b03fbaffa8e455ce9868612cae5ed4b16adf31f499547d83d72","observation_id":"b32a5873-1895-4450-af0d-22abda013faf","resolution":{"observed_at":"2026-05-24T01:25:54.583569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-07T14:18:06.337735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19554","last_updated":"2025-05-26T06:17:21Z","snapshot_observed_at":"2026-08-18T04:13:32.517263Z","submitted_at":"2025-05-26T06:17:21Z","title":"Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:18:06.337735Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2505.19554"},"observation_digest":"sha256:a9ad859febe3321533987fcea9c6236702569ef32ac5e86b42055fe5dd6a3be8","observation_id":"bcef1a3b-470f-4f3b-b800-448028075787","resolution":{"observed_at":"2026-08-07T14:18:06.337735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-07T13:22:23.750410Z","title":"EmbodiedGPT: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-17T13:07:25.361824Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.750410Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3d47cf483b8fe2bdd963620fb21d051f023c0820c89fadc608d04c487f6bd27f","observation_id":"a379916d-3750-496e-bd5e-d1b9bb0b6812","resolution":{"observed_at":"2026-08-07T13:22:23.750410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-15T19:06:38.499008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17811","last_updated":"2025-07-07T02:08:10Z","snapshot_observed_at":"2026-08-15T18:58:27.173451Z","submitted_at":"2025-06-21T20:56:17Z","title":"RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:38.499008Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2506.17811"},"observation_digest":"sha256:015d21e14a4e8b3273a5cffe2f60679edee787236420c8d0e60e368dd51b671c","observation_id":"7b35c8ee-390c-4f4a-9fa7-3ffb0547b308","resolution":{"observed_at":"2026-08-15T19:06:38.499008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-15T16:11:00.908527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-18T08:35:17.666926Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.908527Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:1c2ffa59bb22544c2d68ecc4b6d608c09a16fce6434da9622c52da87ed0f7dbe","observation_id":"36e3c82d-b90b-4dab-a148-3541925de2a7","resolution":{"observed_at":"2026-08-15T16:11:00.908527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-08-04T23:51:46.943276Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:07e449261f89ccd1967cfb7e1f82ac6b6b272d6805976fcfcd6370260c1ba2d4","observation_id":"b922f013-e444-4eac-bea0-709163224b4c","resolution":{"observed_at":"2026-05-10T23:10:53.736351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2605.02939","last_updated":"2026-05-01T07:57:49Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-01T07:57:49Z","title":"From Static Analysis to Audience Dissemination: A Training-Free Multimodal Controversy Detection Multi-Agent Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T20:26:09.112189Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2605.02939"},"observation_digest":"sha256:52a1fa88fbcd21f49194299eafee9c1c57a09a758572390bcfd6b6ab7e580622","observation_id":"c188561e-1a89-4e68-a47d-d5946e36366c","resolution":{"observed_at":"2026-05-11T15:16:06.736427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-01T16:35:14.298657Z","title":"EmbodiedGPT: Vision-language pre-training via embodied chain of thought,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17951","last_updated":"2026-07-20T13:52:24Z","snapshot_observed_at":"2026-08-16T20:34:36.045515Z","submitted_at":"2026-07-20T13:52:24Z","title":"RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:35:14.298657Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2607.17951"},"observation_digest":"sha256:ca7165705546564383bd21c43b48ebfc95fafc6bd7ccd1c7417356b31dc5ff6d","observation_id":"52b4e99e-4ad0-4d0f-8ed1-e360a9b950f0","resolution":{"observed_at":"2026-08-01T16:35:14.298657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-07-31T06:18:55.914327Z","title":"EmbodiedGPT: vision-language pre-training via embodied chain of thought","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-08-08T15:15:40Z","snapshot_observed_at":"2026-08-16T11:31:42.282108Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation: A Survey","version":1},"reference_index":258,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.914327Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:64149aa583292c3a56f5638206b30cf0146a7e5272eaa1c23bf2891520c9134f","observation_id":"51fa3e4b-0791-4803-8bc9-8570789a1135","resolution":{"observed_at":"2026-07-31T06:18:55.914327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.15021/citation-record","integrity":"/paper/2305.15021/integrity","json":"/paper/2305.15021/citation-record.json","paper":"/paper/2305.15021"},"outbound":[],"paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2305.15021."}