{"as_of":"2026-08-10T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ac9db638177f7c1baa6927db43755bd0b27db2151f7306b793be8d6bb9ff2b1","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:33:08.828828Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:32:20.329963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:07:29.924092Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":"2507.10548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-07-03T01:07:29.924092Z","title":"arXiv preprint arXiv:2507.10548 , year =","venue":null,"work_id":"b35b46e8-38a5-47b2-bf84-2f31cba2bfbe","year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-06T23:31:01.339828Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:59:48.877783Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:0138d4f046cecc4b2d6857560ede97fa57fd7406153194145a34104f04626061","observation_id":"c3db1d34-85d5-429c-b3e7-b45a573fc056","resolution":{"observed_at":"2026-05-11T05:41:00.514331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-08-04T05:32:20.329963Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-06T23:31:01.339828Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:32:20.329963Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:54ce6e8db2241c4593c2d079b108628a69b0f0ab8c9d3833324e7d6ab52b2f05","observation_id":"474d3147-b2e0-437d-8fad-eb5aaee82149","resolution":{"observed_at":"2026-08-04T05:32:20.329963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":"2507.10548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-07-03T01:07:29.924092Z","title":"arXiv preprint arXiv:2507.10548 , year =","venue":null,"work_id":"b35b46e8-38a5-47b2-bf84-2f31cba2bfbe","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:9b80c5778b9ff65783048d207eb90043216e048b2345d537b5ee2dd1f312535e","observation_id":"19b519cc-1444-42b3-acc1-86ea87d95944","resolution":{"observed_at":"2026-07-01T20:56:13.540119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"cited_work":{"arxiv_id":"2507.10548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10548","snapshot_observed_at":"2026-07-03T01:07:29.924092Z","title":"arXiv preprint arXiv:2507.10548 , year =","venue":null,"work_id":"b35b46e8-38a5-47b2-bf84-2f31cba2bfbe","year":2025},"citing_paper":{"arxiv_id":"2606.09826","last_updated":"2026-06-08T17:59:43Z","snapshot_observed_at":"2026-08-02T20:00:31.322130Z","submitted_at":"2026-06-08T17:59:43Z","title":"OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T16:50:36.194650Z"},"links":{"cited_paper":"/paper/2507.10548","citing_paper":"/paper/2606.09826"},"observation_digest":"sha256:8b5224a316777b80f70c3d93513f61a8bfd8aa9e2d248f2c3167b02fc548b825","observation_id":"24ed8e0d-ec1d-4daa-8fb1-3892450e43e9","resolution":{"observed_at":"2026-07-03T01:07:29.926146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10548/citation-record","integrity":"/paper/2507.10548/integrity","json":"/paper/2507.10548/citation-record.json","paper":"/paper/2507.10548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T17:33:08.619857Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.619857Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:d734c9ab5cc1979c99e93f6846f085bb306760ba82f2daedc21b71d40dbb5702","observation_id":"46378b16-f397-4ab3-af37-14895ebb95c7","resolution":{"observed_at":"2026-08-06T17:33:08.619857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.711275Z","title":"Introducing claude 3.5 sonnet","venue":null,"work_id":"f2fb1ab3-54b2-4476-bea9-4094a566bd9a","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.627506Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:ca43112d4d6283e524d66bcb54cb53b5e98b12ccaebb2dafac4b264c6531d19e","observation_id":"da50ed54-716a-43b1-84b1-89724a63c72c","resolution":{"observed_at":"2026-08-06T17:33:09.717874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T17:33:08.637710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.637710Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:120cd364c93627c37c64be74232a899383eb2b19ae7defb75e89fa1cf6a44e58","observation_id":"08f766b1-8b0c-43f2-9aaf-16718cfafb80","resolution":{"observed_at":"2026-08-06T17:33:08.637710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.692802Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":"d392918d-97cc-4fd0-9133-883c8851fb50","year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.643260Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:db15ef4bfdef86f7069d2ad09f134e23fb70dc4dc4e41d171c8ce35c4359f710","observation_id":"6f3e9aa1-f052-4e18-a8fc-e104a9d2d931","resolution":{"observed_at":"2026-08-06T17:33:09.699255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T17:33:08.649485Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.649485Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:ac4481e0e983100fb295a16d9d913e72a2c3cdfbf2b60a3d58dbda4877c75ce3","observation_id":"1a6cdeb1-03f9-4203-8b30-d80f04486d72","resolution":{"observed_at":"2026-08-06T17:33:08.649485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-06T17:33:08.655006Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.655006Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:ba5cb473f7be902acb56428c6a660ca89acdfa5b520a8af5bf07001514a89ced","observation_id":"53487227-9737-4886-840e-e4ac9e077dd8","resolution":{"observed_at":"2026-08-06T17:33:08.655006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T17:33:08.670517Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.670517Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:073f1204af1b243fdf5b50f59d860d7e920443eb584ca89e22eeef357e33251d","observation_id":"2490e63c-60e4-40c7-9cf1-618ada301320","resolution":{"observed_at":"2026-08-06T17:33:08.670517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T17:33:08.677166Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.677166Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:dd6e67c69226030afc73e8d42e5ed7af3a8c3e5e305d0a6eae117ddbc86d4878","observation_id":"094a421a-22cf-4e02-b0fe-cf79646217cc","resolution":{"observed_at":"2026-08-06T17:33:08.677166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.684941Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.684941Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:f842a7d7b628df7e3ed5269bb756554c4d656eebac66a6bd6db718133a3f16fb","observation_id":"4c3c8838-b714-4254-b62d-227dd0a104d6","resolution":{"observed_at":"2026-08-06T17:33:08.684941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T17:33:08.689995Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.689995Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:35dbba2f1762b7bd5a544e554704f1ab0b0de819fc53b724b22727f017aaf0f0","observation_id":"e82c6838-a2e7-47e0-88be-9dee59a8149b","resolution":{"observed_at":"2026-08-06T17:33:08.689995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13082","last_updated":"2025-07-28T08:53:04Z","snapshot_observed_at":"2026-08-07T16:58:12.982109Z","submitted_at":"2025-03-17T11:41:16Z","title":"Free-form language-based robotic reasoning and grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13082","snapshot_observed_at":"2026-08-06T17:33:08.696039Z","title":"Free-form language-based robotic reasoning and grasping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.696039Z"},"links":{"cited_paper":"/paper/2503.13082","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:e597e9c20520299d09fb31ed55e21931400c37e134d768857e29f76d6e58f163","observation_id":"91906397-6dcc-4f16-bb65-8ea49e0ed4ba","resolution":{"observed_at":"2026-08-06T17:33:08.696039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T17:33:08.701584Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.701584Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:4a332c054e7731e555d257c33df9aa37d3ab6ccf3551f957a7bfa088c55301e4","observation_id":"bd0eb5d5-fa32-4fef-acba-dafcc8801ab9","resolution":{"observed_at":"2026-08-06T17:33:08.701584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08367","last_updated":"2025-06-03T02:30:05Z","snapshot_observed_at":"2026-08-09T00:13:59.399628Z","submitted_at":"2023-10-12T14:38:25Z","title":"MCU: An Evaluation Framework for Open-Ended Game Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08367","snapshot_observed_at":"2026-08-06T17:33:08.707380Z","title":"Mcu: A task-centric framework for open-ended agent evaluation in minecraft","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.707380Z"},"links":{"cited_paper":"/paper/2310.08367","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:7ec6dab1344bce7f52421636ba10d6f8129b7e5f97d6ce2cf428bedc9bc9222c","observation_id":"f2ff3adc-6c33-4008-898d-9b9af75e831c","resolution":{"observed_at":"2026-08-06T17:33:08.707380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09664","last_updated":"2026-04-07T05:36:18Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T02:24:46Z","title":"CodeMind: Evaluating Large Language Models for Code Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09664","snapshot_observed_at":"2026-08-06T17:33:08.713873Z","title":"Codemind: A framework to challenge large language models for code reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.713873Z"},"links":{"cited_paper":"/paper/2402.09664","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:093db2915066997189a739d223282c7000bbd7de2ed234149efd2a5a32d020ce","observation_id":"4c76849e-1478-4b32-8272-ddeb2595deba","resolution":{"observed_at":"2026-08-06T17:33:08.713873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:33:08.720758Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.720758Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:bbce914f982022910cd1c713264c28ec3eab83e18edd20e8a7a085b09a442a44","observation_id":"087496d3-0f16-40a0-920f-b389606af598","resolution":{"observed_at":"2026-08-06T17:33:08.720758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.660941Z","title":null,"venue":null,"work_id":"d0425057-4039-42f1-a300-94135ff6f693","year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.726086Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:65d74c37789a0611df3a2d1f93073b6ad6af17991de05aecc9535e38dd6a99cd","observation_id":"7cda116f-b036-4a7e-92b8-9e636e3b0912","resolution":{"observed_at":"2026-08-06T17:33:09.667450Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.642526Z","title":"Teach: Task-driven embodied agents that chat","venue":null,"work_id":"5917e270-34b5-4681-ba96-7c4ed72dfac9","year":2017},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.731150Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:9decfda2536f7beed47f6c973ae1f893293d9b23127f8fc98ce2a9b73ec9bc66","observation_id":"677f655c-3df9-43eb-95cf-d29a5f213f31","resolution":{"observed_at":"2026-08-06T17:33:09.648047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-06T17:33:08.735989Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.735989Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:8c9df7979ef48884cc6fd3c9741a61e66af66f372286d5067cb6178a0daaa00e","observation_id":"bf5f9643-57a1-4e93-898d-b11a2a285470","resolution":{"observed_at":"2026-08-06T17:33:08.735989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.623875Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"a2368c2e-989c-49df-9ced-16413452b4a2","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.741506Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:64d4de6d58c4866e1ee5c8945c28989d0826b1a8a720761e9d7bde8faf642d2f","observation_id":"094279c3-9360-43c0-9977-a81b1e53d74c","resolution":{"observed_at":"2026-08-06T17:33:09.629626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T17:33:08.748938Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.748938Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:8812f49f5d8d101adf2d6a1f566b941217ab939bded4e66dfdff30d94feeedc2","observation_id":"f6848359-ef85-4a32-9839-d0dcb3ead83b","resolution":{"observed_at":"2026-08-06T17:33:08.748938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.601630Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"f03c39cd-f477-49a7-9a3a-df84bd9552a0","year":2020},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.754934Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:6c25e772c0a38688c4e29c916596db0c267c9cca92695becda26be385ba3fccf","observation_id":"c661d797-3816-4a7b-9ca9-3bd6b5c11a7b","resolution":{"observed_at":"2026-08-06T17:33:09.607559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:33:08.760810Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.760810Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:ff1275f57cd39b5a4da0c7d05445aecda86a29b63633192e231004c69588c2b0","observation_id":"ca15523a-4bf6-4c3c-8134-d322834766c3","resolution":{"observed_at":"2026-08-06T17:33:08.760810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.583011Z","title":"Habitat challenge 2023","venue":null,"work_id":"e816cdd2-f4b8-4ce8-b9e3-238c9bee9043","year":2023},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.766159Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:34276102e8a5cb1011465293597721b5d52c710482b8ec2b0cf11a971fb53561","observation_id":"9d8ac26e-27cf-462e-9cec-ee4f1fb597ee","resolution":{"observed_at":"2026-08-06T17:33:09.588977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:33:08.771790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.771790Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:2096be6340aade24ff1a827b9a5b454d64e48feed5280bc46046be55c3ec69ee","observation_id":"96f37c6a-cd14-46bd-919b-34510e23d11c","resolution":{"observed_at":"2026-08-06T17:33:08.771790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.560924Z","title":"V-irl: Grounding virtual intelligence in real life","venue":null,"work_id":"231dbafb-e443-421c-853b-de48851c0812","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.778067Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:f35b96249dda84f3c98b9e36a369e269111e94107b649d34efdf8951811e9617","observation_id":"539dda9d-1f4f-42f0-aaed-a2e5fa5f5267","resolution":{"observed_at":"2026-08-06T17:33:09.569380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.782886Z","title":"Octopus: Embodied vision-language programmer from environmental feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.782886Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:8e05e39c71f75ab544f3f829ae300c3fb9287cba1eaa2cd0caca53d57eec14a5","observation_id":"a7cf1ac0-7938-4e9b-a0da-4b34cb6824db","resolution":{"observed_at":"2026-08-06T17:33:08.782886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.789147Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.789147Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:162196d61dc262b6d879477eb7edfa832f948cabd2fefdc1b9ba8f0d092b085b","observation_id":"f6fbc88c-a4a0-4c99-a35c-8e055d535bca","resolution":{"observed_at":"2026-08-06T17:33:08.789147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:08.794973Z","title":"Spatial mental modeling from limited views","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.794973Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:0a9a202e8b41a7b57abc65cc878d7fd3c2a879050f6fdab3ce7918048d224b2c","observation_id":"ee284598-612a-4ba5-a613-3814787e3471","resolution":{"observed_at":"2026-08-06T17:33:08.794973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02794","last_updated":"2024-06-05T01:40:36Z","snapshot_observed_at":"2026-08-07T22:53:14.214309Z","submitted_at":"2024-05-05T02:22:11Z","title":"Octopi: Object Property Reasoning with Large Tactile-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02794","snapshot_observed_at":"2026-08-06T17:33:08.800658Z","title":"Octopi: Object property reasoning with large tactile-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.800658Z"},"links":{"cited_paper":"/paper/2405.02794","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:353ad43ebece671e5492583e9aa5706860e7f300c94903adde4871dc557f46b5","observation_id":"35972a38-b13f-4d22-9832-cab5a2861fb6","resolution":{"observed_at":"2026-08-06T17:33:08.800658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:33:09.497857Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":"9150fad1-5fb7-41e0-96f0-b5464f72313b","year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.808668Z"},"links":{"citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:714077a46cb94b758272f17c1c4495714b3adcfa81de7d9cba0ff5342a284ee9","observation_id":"c6bd36ee-51bd-4d8c-86b7-3ba64fdee896","resolution":{"observed_at":"2026-08-06T17:33:09.506348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20977","last_updated":"2025-08-12T11:56:32Z","snapshot_observed_at":"2026-07-06T20:14:40.579474Z","submitted_at":"2024-12-30T14:31:01Z","title":"UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20977","snapshot_observed_at":"2026-08-06T17:33:08.814006Z","title":"Unrealzoo: Enriching photo-realistic virtual worlds for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.814006Z"},"links":{"cited_paper":"/paper/2412.20977","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:5a350b028bd9a6fefcff842e1e9fb18254e428d9604fe3e15147a195bbd4e003","observation_id":"3135e1a6-66ae-4159-8e5c-e6b8cdab12e4","resolution":{"observed_at":"2026-08-06T17:33:08.814006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T17:33:08.828828Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:33:08.828828Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.10548"},"observation_digest":"sha256:d116060ab375ac99af9427db009e238abb4d2925c7aacc472f3193b4b99d8513","observation_id":"41e6173d-34ad-4678-9757-4994dabd0c72","resolution":{"observed_at":"2026-08-06T17:33:08.828828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10548","last_updated":"2025-07-14T17:59:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:48:18.895671Z","submitted_at":"2025-07-14T17:59:46Z","title":"EmbRACE-3K: Embodied Reasoning and Action in Complex Environments"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":23,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2507.10548."}