{"as_of":"2026-08-15T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:523e2256265b3e8130aff7eb1ec8f6b5f330fa4ee1a1da4edb3bd9b964da702a","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:54:10.639156Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:36:21.457436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:36:21.667275Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20726","snapshot_observed_at":"2026-08-02T04:39:12.440926Z","title":"ManiTaskGen: A comprehensive task generator for benchmarking and improving vision-language agents on embodied decision-making.arXiv preprint arXiv:2505.20726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-15T02:09:03.281673Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.440926Z"},"links":{"cited_paper":"/paper/2505.20726","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:d4e35379a3e6a9791d5459d36b809a14fa86f63a0983578fa86f2097dc8de433","observation_id":"62e2116f-9236-46de-9cc1-b77ce111f607","resolution":{"observed_at":"2026-08-02T04:39:12.440926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"cited_work":{"arxiv_id":"2505.20726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20726","snapshot_observed_at":"2026-08-12T00:36:21.667275Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","venue":"cs.RO","work_id":"10f6efd7-a7b9-4dbd-8e99-a4bb14fa6470","year":2025},"citing_paper":{"arxiv_id":"2608.08036","last_updated":"2026-08-08T09:45:01Z","snapshot_observed_at":"2026-08-15T11:28:35.948439Z","submitted_at":"2026-08-08T09:45:01Z","title":"Compiling and Benchmarking Task-State Horizons for Embodied Agents","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:36:21.457436Z"},"links":{"cited_paper":"/paper/2505.20726","citing_paper":"/paper/2608.08036"},"observation_digest":"sha256:09ae16d7c0ebc7c4a6d998ed49c1decaad3581ab56f4ba6e157cf364621329f3","observation_id":"7b68a88f-8926-40c1-8f47-cbfa9a74a8f3","resolution":{"observed_at":"2026-08-12T00:36:21.671674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20726/citation-record","integrity":"/paper/2505.20726/integrity","json":"/paper/2505.20726/citation-record.json","paper":"/paper/2505.20726"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08442","last_updated":"2024-12-11T15:06:25Z","snapshot_observed_at":"2026-08-14T20:43:53.624539Z","submitted_at":"2024-12-11T15:06:25Z","title":"From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08442","snapshot_observed_at":"2026-08-07T13:53:54.825537Z","title":"From multimodal llms to generalist embodied agents: Methods and lessons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:54.825537Z"},"links":{"cited_paper":"/paper/2412.08442","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:0c91ffd93b84138996fc019a858461a63a21e81a436495d9ee7eb841c818d8e5","observation_id":"a672600d-eea8-4f3d-a679-ce150f1dfb45","resolution":{"observed_at":"2026-08-07T13:53:54.825537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T13:53:54.957407Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:54.957407Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:0fc4558afad65206610c755bd4e88c1548df792c6058ba03936c9aad7c55d288","observation_id":"1a0a896e-7dc2-4001-a7ac-35e96e09321f","resolution":{"observed_at":"2026-08-07T13:53:54.957407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:55.061063Z","title":"Rearrangement: A Challenge for Embodied AI","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.061063Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:e9255acd0b0ca581c300e6d8a931619ed6f6fa8d627500136321f88ce5d12cb4","observation_id":"2bce66b4-e12c-4561-96fb-633b72938e40","resolution":{"observed_at":"2026-08-07T13:53:55.061063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T13:53:55.137137Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.137137Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:15e0675f0c123ae9449ec5d7b275634d66fe0526ddc226b80545b2febc37eb66","observation_id":"15921749-94dc-40da-880f-362e189737d1","resolution":{"observed_at":"2026-08-07T13:53:55.137137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T13:53:55.233055Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.233055Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:f3aa4ce997905951bc331c641a4a61cfc6929e4a11c319f4f25d412153d1a242","observation_id":"bba39573-5795-4d24-8a53-c3c84d3a8ba0","resolution":{"observed_at":"2026-08-07T13:53:55.233055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:55.328013Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.328013Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:66cb3c551f0beee048a5a6e7a9f0b47158df7d5f4ad1d551e8d2449097c9ff89","observation_id":"5f10fd22-c294-4a2a-88ce-f1e5cf49199f","resolution":{"observed_at":"2026-08-07T13:53:55.328013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:55.428981Z","title":"Large language models as gen- eralizable policies for embodied tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.428981Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:786c3a8c76460ebfeed4443c840944bbd385289e54c237aafc9ba4b749ca27b7","observation_id":"09681592-73b2-42d2-b461-4ec0bcecad87","resolution":{"observed_at":"2026-08-07T13:53:55.428981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:55.547151Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.547151Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:2ba441159cc3657e9a17e774baf5801b6b37198ce8b5ae4b4fc9acf6395c6f3d","observation_id":"2e61dc64-8296-43f2-8a98-8aa3e3fab4a4","resolution":{"observed_at":"2026-08-07T13:53:55.547151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T13:53:55.659073Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.659073Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:28cece8bd73deb781b851f4463ebabf04b8f33a0a2704e6da335312c65ea808d","observation_id":"84fa2242-9b03-4602-95ac-7cedd8676442","resolution":{"observed_at":"2026-08-07T13:53:55.659073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:53:55.744626Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.744626Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:75e5fd4531d51379b52a66561189ba753bc6afd8c92d7d3a4e82cbe7ca594a3b","observation_id":"c8d01f6a-31c6-4a0a-a29e-ca21030d8ab8","resolution":{"observed_at":"2026-08-07T13:53:55.744626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:55.818724Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.818724Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:9cc150b2210c9e64f3a73ec2133c66f21caf74e4fb9d69e663af70433392008f","observation_id":"03a7cf90-24c6-465b-b207-a1ac23c24956","resolution":{"observed_at":"2026-08-07T13:53:55.818724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:55.891849Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.891849Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:5db89ebbb606188bbd6445e29e2025446c307d56bfb1ad85628e2b9a45770ff3","observation_id":"d8505a54-c944-4812-b1ab-56058bdd0763","resolution":{"observed_at":"2026-08-07T13:53:55.891849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02778","last_updated":"2022-09-06T19:02:08Z","snapshot_observed_at":"2026-08-13T14:32:03.661539Z","submitted_at":"2022-09-06T19:02:08Z","title":"Multi-skill Mobile Manipulation for Object Rearrangement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02778","snapshot_observed_at":"2026-08-07T13:53:55.986927Z","title":"Multi-skill mobile manipula- tion for object rearrangement","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.986927Z"},"links":{"cited_paper":"/paper/2209.02778","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:e0966adec305da985211a97a09320db3b7b92b59176d39ac644b194c9b0aee53","observation_id":"cd42b183-0e0d-4c4f-807a-e76342afb5fd","resolution":{"observed_at":"2026-08-07T13:53:55.986927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T13:53:56.087735Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.087735Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:4ace5475f2cb13c531ffbd6621da7a3e1c5bf7d367a56d8c030aaa5736e4713a","observation_id":"9c452002-c1d8-4c61-81e2-0d5069078971","resolution":{"observed_at":"2026-08-07T13:53:56.087735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T13:53:56.192260Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.192260Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:75bee9180629a46f2e312573f3cefb7201229d59d34b3e43c79dea0507232e6d","observation_id":"cdf95c37-3141-4763-9c69-7a7712077c8f","resolution":{"observed_at":"2026-08-07T13:53:56.192260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06678","last_updated":"2025-05-29T04:19:21Z","snapshot_observed_at":"2026-08-12T22:27:28.419328Z","submitted_at":"2024-10-09T08:38:21Z","title":"M3Bench: Benchmarking Whole-body Motion Generation for Mobile Manipulation in 3D Scenes","version":3},"cited_work":{"arxiv_id":"2410.06678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06678","snapshot_observed_at":"2026-08-07T13:54:11.604940Z","title":"M3Bench: Benchmarking Whole-body Motion Generation for Mobile Manipulation in 3D Scenes","venue":"cs.RO","work_id":"f8888511-da43-4b7e-ac51-aef2ff29c419","year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.263491Z"},"links":{"cited_paper":"/paper/2410.06678","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:c0979173fb3fd73204a88223ccae35af07c8c9cb75bd38fcef65cc2599e9130d","observation_id":"a31e1bfd-41f2-48ea-a237-abce7c0f9499","resolution":{"observed_at":"2026-08-07T13:54:11.656017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:56.353324Z","title":"Embodied agent interface: Benchmarking llms for embodied decision making","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.353324Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:3b862838c807048f20bb7f8017dbba0227382b2de038738e9003e9202cc650aa","observation_id":"fefe6b08-2850-4476-8406-fcf0e1e875a4","resolution":{"observed_at":"2026-08-07T13:53:56.353324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06327","last_updated":"2024-08-12T17:44:17Z","snapshot_observed_at":"2026-08-12T23:04:46.951157Z","submitted_at":"2024-08-12T17:44:17Z","title":"VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06327","snapshot_observed_at":"2026-08-07T13:53:56.447497Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.447497Z"},"links":{"cited_paper":"/paper/2408.06327","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1f0509b6499947bc53f1d611c147a79a146d803b6efd2c0ba27053a97f75e9db","observation_id":"9a2f7942-6d4d-4a4a-8a23-45cfbbc8e047","resolution":{"observed_at":"2026-08-07T13:53:56.447497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08178","last_updated":"2024-02-13T02:28:57Z","snapshot_observed_at":"2026-08-15T03:04:36.036030Z","submitted_at":"2024-02-13T02:28:57Z","title":"LoTa-Bench: Benchmarking Language-oriented Task Planners for Embodied Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08178","snapshot_observed_at":"2026-08-07T13:53:56.545921Z","title":"Lota- bench: Benchmarking language-oriented task planners for embodied agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.545921Z"},"links":{"cited_paper":"/paper/2402.08178","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:ba68ced9268241e2181915a9b093468b3f8d1e2da8ea72b62656e7c8ee77d65f","observation_id":"a852e5a6-9764-4616-a394-990e93212934","resolution":{"observed_at":"2026-08-07T13:53:56.545921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:56.725406Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.725406Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:3879920535273cb5d07d42fc8398a938a430b0af44167395311d0545e1b42232","observation_id":"9c824d0b-2e4d-43c7-b157-8e79aefbaee2","resolution":{"observed_at":"2026-08-07T13:53:56.725406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11858","last_updated":"2025-04-11T04:26:42Z","snapshot_observed_at":"2026-08-10T22:27:13.074345Z","submitted_at":"2025-01-21T03:22:10Z","title":"EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11858","snapshot_observed_at":"2026-08-07T13:53:56.823209Z","title":"Embodiedeval: Evaluate multimodal llms as embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.823209Z"},"links":{"cited_paper":"/paper/2501.11858","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:86d344e27c340292856eef438a07ab49e89bfc3d3a7d881decf6e6a94ff9e1e0","observation_id":"19189071-c053-470b-8c64-f823e3ed0860","resolution":{"observed_at":"2026-08-07T13:53:56.823209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:56.922046Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:56.922046Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:21bbd5ce5485ee2a813ec28a97cfc335aeceb9f70be8a9ffa855acfe294e7d44","observation_id":"6b626a01-d55b-48c7-93c5-59eb075399df","resolution":{"observed_at":"2026-08-07T13:53:56.922046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.005818Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.005818Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:2943acf04ef31a25295ac5d5d2bb6fc0c42099a68ff42080d8661809207608ea","observation_id":"15c6aa96-a5b1-4838-a960-763c259df222","resolution":{"observed_at":"2026-08-07T13:53:57.005818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.095946Z","title":"Sun rgb-d: A rgb-d scene understand- ing benchmark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.095946Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:79161092a8f2c899a2b393e7e162b9684e31005b22af4985c3c56de2735f535d","observation_id":"80dae249-2d41-4925-af64-4a7145de8b2d","resolution":{"observed_at":"2026-08-07T13:53:57.095946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.168766Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.168766Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:a055c220001cfd1b4f36989753da88f2ea3e4e83768723a429c1494789e5b990","observation_id":"cde03339-dc71-4810-ba10-3274b15fde30","resolution":{"observed_at":"2026-08-07T13:53:57.168766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.240312Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.240312Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:d23b6b80e56685d2d8373e8a140fa4bb697d7612a835963beca0d5f241fa71a1","observation_id":"589b5135-de90-4db7-8927-50b5f19f43a7","resolution":{"observed_at":"2026-08-07T13:53:57.240312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00764","last_updated":"2025-02-06T09:17:39Z","snapshot_observed_at":"2026-08-15T14:11:01.436818Z","submitted_at":"2024-08-01T17:59:46Z","title":"AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00764","snapshot_observed_at":"2026-08-07T13:53:57.326324Z","title":"Agentgen: Enhancing planning abilities for large language model based agent via environment and task generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.326324Z"},"links":{"cited_paper":"/paper/2408.00764","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:6d6eeed0a4d874caafaedc42d8885b7237c5623aff06a63cf7b6aa1edd9d49b4","observation_id":"87457872-452d-4681-a83a-e7d9e985fc23","resolution":{"observed_at":"2026-08-07T13:53:57.326324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01824","last_updated":"2023-12-27T20:49:35Z","snapshot_observed_at":"2026-08-15T13:24:42.790674Z","submitted_at":"2023-10-03T06:41:18Z","title":"Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01824","snapshot_observed_at":"2026-08-07T13:53:57.380409Z","title":"Mini-behavior: A procedurally generated benchmark for long-horizon decision- making in embodied ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.380409Z"},"links":{"cited_paper":"/paper/2310.01824","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:a912255ad4a30ca5af317a591e047873880e524f28901ea7adc6e3f1e09dbc7f","observation_id":"26a37aa7-7d09-465c-99a3-a8bb426f167b","resolution":{"observed_at":"2026-08-07T13:53:57.380409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.458580Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.458580Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:48dfe30ec1e0ca03cbfcc7c9ff594e969b82ccef5e6ce6c15c23af53cb0395e3","observation_id":"20ed65eb-b100-49cb-a67f-ed491cfd3b57","resolution":{"observed_at":"2026-08-07T13:53:57.458580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-07T13:53:57.551508Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.551508Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:cef0556235176d225cb31322029ead845f3f90402cbb94fdf291c05f7cfad07c","observation_id":"d8cb284d-c321-4eff-9481-1f696a007576","resolution":{"observed_at":"2026-08-07T13:53:57.551508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00350","last_updated":"2021-03-18T08:53:32Z","snapshot_observed_at":"2026-08-07T13:51:31.536024Z","submitted_at":"2020-07-01T09:38:51Z","title":"Adaptive Procedural Task Generation for Hard-Exploration Problems","version":3},"cited_work":{"arxiv_id":"2007.00350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.00350","snapshot_observed_at":"2026-08-07T13:54:11.351639Z","title":"Adaptive Procedural Task Generation for Hard-Exploration Problems","venue":"cs.LG","work_id":"f66c885f-6b27-40bb-83be-c132d6ff3582","year":2020},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.649094Z"},"links":{"cited_paper":"/paper/2007.00350","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:5851463db303fdeb709f94a6e8dc8730493cca23acb20c58a10b1dd5564fd99f","observation_id":"eb3a3191-31d9-40eb-979f-18817f69b652","resolution":{"observed_at":"2026-08-07T13:54:11.407001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01361","last_updated":"2024-01-21T21:01:12Z","snapshot_observed_at":"2026-08-13T05:59:07.910600Z","submitted_at":"2023-10-02T17:23:48Z","title":"GenSim: Generating Robotic Simulation Tasks via Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01361","snapshot_observed_at":"2026-08-07T13:53:57.740352Z","title":"Gensim: Generating robotic simulation tasks via large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.740352Z"},"links":{"cited_paper":"/paper/2310.01361","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:dcae630a7d993a297e0e17b96abeb3820427b15c3716ea573da492ac9c389d76","observation_id":"60942058-9243-4d47-908c-449eb87b0c8a","resolution":{"observed_at":"2026-08-07T13:53:57.740352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.835282Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.835282Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:18451f2032b134c535a8aa599fc0d49ce612d31761e8979f302c5da611fef08f","observation_id":"9cbbf7f5-23a6-4329-86b8-4accebf656b3","resolution":{"observed_at":"2026-08-07T13:53:57.835282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:57.932255Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.932255Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:06250e1043d2c9d190d79a2ac69c8d9e53a8fb95954955333a186cb28cffcac7","observation_id":"491d1c65-0b12-4e12-b7e2-732400a61c2d","resolution":{"observed_at":"2026-08-07T13:53:57.932255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:19.481293Z","title":"Habitat rearrangement challenge 2022","venue":null,"work_id":"edc3cb49-de2f-4d5c-8762-feea4268a5fe","year":2022},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.002577Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1e00e5dc8007fd61d0456f0f6088eb0c15f4a03e03b3a2c60840f291f27db271","observation_id":"8e9a6e81-93f2-4cbf-b8d8-6067f5312c51","resolution":{"observed_at":"2026-08-07T13:54:19.573015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-08-13T18:37:12.431619Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-07T13:53:58.124688Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.124688Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:0902e02effd968ae6520f00f3da8d2be3a67b9dc6830e17a0c8b24f1b8c762ae","observation_id":"65561e2a-1be2-4230-8bd2-485387ff7555","resolution":{"observed_at":"2026-08-07T13:53:58.124688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-08-15T10:11:58.661690Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-07T13:53:58.184489Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.184489Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:8896dc62c1c01d702556317e4875c31165a2514929440a8f4e0826d39d49c49d","observation_id":"860b9867-74b1-4221-abff-77adbc88d483","resolution":{"observed_at":"2026-08-07T13:53:58.184489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05313","last_updated":"2025-08-01T21:13:36Z","snapshot_observed_at":"2026-08-13T22:07:16.486188Z","submitted_at":"2024-11-28T19:31:50Z","title":"{\\lambda}: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05313","snapshot_observed_at":"2026-08-07T13:53:58.275583Z","title":"λ: A benchmark for data-efficiency in long-horizon indoor mobile manipulation robotics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.275583Z"},"links":{"cited_paper":"/paper/2412.05313","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:f23ba6fc9144a17b7cf0ecf27c09fb2d6590c9135593bf8ceccc24ecd1a0cad0","observation_id":"a28e3a21-dbaa-4511-bd18-61b1703b31b5","resolution":{"observed_at":"2026-08-07T13:53:58.275583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:53:58.405553Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.405553Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:b2a179415bd438230450e7ca569206aff40382bc0579025dbdbc26d30114b2f6","observation_id":"022070a7-067d-4dba-85cd-84da8c35bcd0","resolution":{"observed_at":"2026-08-07T13:53:58.405553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:53:58.489673Z","title":"Dai, and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.489673Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:71be0e79228ffa059fab380296ba0d55cc447919d677ad61e46cb34a7bfe996a","observation_id":"157df454-c573-47a6-8b78-4a8671dc9d89","resolution":{"observed_at":"2026-08-07T13:53:58.489673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:19.339630Z","title":"About claude models","venue":null,"work_id":"704bab05-2e58-4432-bdfb-c3ba94434402","year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.621363Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:8427bfc578981893b61d1b0f425307f99ff8bcd187b2def69e259552f395321a","observation_id":"2bba0d62-520d-49ed-a488-3294bd16f4fa","resolution":{"observed_at":"2026-08-07T13:54:19.408060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:58.722494Z","title":"Sapien: A simulated part-based interactive environ- ment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.722494Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1d8a692dab2154443faf1ac893b966fe5fc008a624731f2d038aba655406d35b","observation_id":"b1723ad4-33a5-4287-b4c8-dbe1d937df6d","resolution":{"observed_at":"2026-08-07T13:53:58.722494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:53:58.811914Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.811914Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:70c3d3e2f35de27eea912c631f188b0dad94f568a338fe68182dfbd84d1625b2","observation_id":"31cfd8f5-151f-467f-84ef-371c1cbc174a","resolution":{"observed_at":"2026-08-07T13:53:58.811914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-07T13:53:58.927954Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:58.927954Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:4752ff447dd8814edd0377f8e212870fcacef685b446b8fd620bf47dac0a1694","observation_id":"98e7bdec-d034-4e89-b96f-203611b907ca","resolution":{"observed_at":"2026-08-07T13:53:58.927954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:59.022673Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.022673Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:947f5bbfb23932438ca77fd848bee7a0fa24a403ebfc26ed3193890ebd20cc06","observation_id":"d0e6ad65-1dd7-4515-8481-bc19822d0031","resolution":{"observed_at":"2026-08-07T13:53:59.022673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:19.153909Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning","venue":null,"work_id":"49111211-d36d-4795-a81e-599d7d39e2dc","year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.119195Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:3f989d985522c372a9e1419e7739189bcbfaf38c94b21869171eba42c7ca98ba","observation_id":"08a4195a-2f23-4da7-8006-6e5654bf458c","resolution":{"observed_at":"2026-08-07T13:54:19.239608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:59.194279Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.194279Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:14a9701fc8f8517cf1d0ad8c4c0ce3eed01a6200f61048c10c1272fe7c68c065","observation_id":"08b3811a-e0fc-4c3e-961b-604bfd8aff1b","resolution":{"observed_at":"2026-08-07T13:53:59.194279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-15T11:05:27.808334Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-07T13:53:59.280411Z","title":"Au- tonomous evaluation and refinement of digital agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.280411Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:adec50d2a6546f1b34d3200b019ac0db40365296e846392dd27713754487190d","observation_id":"69e68284-c532-4ca1-8d46-b976065c6844","resolution":{"observed_at":"2026-08-07T13:53:59.280411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-13T04:40:53.870336Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T13:53:59.379335Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.379335Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:8eebcefe58ba12feba184171b0bd3efe28f68078f60a128ad4e5f7e0b90d3074","observation_id":"d478c978-2271-4eef-acb5-47450fea440c","resolution":{"observed_at":"2026-08-07T13:53:59.379335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:59.449785Z","title":"Grounding multimodal llms to embodied agents that ask for help with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.449785Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:3baef80213f08a4092149a865c41c04605aad699408a26325a075c54c030bda3","observation_id":"b0817a52-26e0-459f-93af-865c92ee0d83","resolution":{"observed_at":"2026-08-07T13:53:59.449785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-13T04:25:31.366043Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-07T13:53:59.540056Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.540056Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:ebc896d5c0137e2b6146df51a79ff9b0588adba487e3daa5ceb9c3ddc14fe9da","observation_id":"507ccd29-01c6-4931-9078-8b810bcaa289","resolution":{"observed_at":"2026-08-07T13:53:59.540056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:19.002177Z","title":"Grounding multimodal large language models in actions","venue":null,"work_id":"285fcd95-e7b1-42ce-8365-ca339fc8293e","year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.614383Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:885d27daa4105ce44063d8ff8d571ef21c62e7c26c22d188a644e21f95be65ef","observation_id":"739da9cf-ded9-4927-93c8-05911f78a8c3","resolution":{"observed_at":"2026-08-07T13:54:19.060631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-13T04:03:34.485741Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-07T13:53:59.697480Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.697480Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:ec9c8a78694e6c66255daad0748fa982a5c6b7aa6b506c647869bae0f517b00c","observation_id":"e8dd4e21-f13b-468b-b1b5-90ce35bf3098","resolution":{"observed_at":"2026-08-07T13:53:59.697480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-13T05:45:19.606713Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-07T13:53:59.798027Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.798027Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:71f852c06866dc04ab09041048a4adbd9854a4a89fd17ba9944287019cba9f25","observation_id":"c3f27528-3245-4652-bff7-d2160513b6c1","resolution":{"observed_at":"2026-08-07T13:53:59.798027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-15T10:46:42.452851Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T13:53:59.863345Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.863345Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:ebc9a08e0306b8ec8cdaebcaf660e384cd92e94933c817d79658384167a7394a","observation_id":"cc9773c0-28d8-4aa8-9f2b-d683421c85af","resolution":{"observed_at":"2026-08-07T13:53:59.863345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03181","last_updated":"2025-05-06T04:51:57Z","snapshot_observed_at":"2026-08-12T16:34:42.038755Z","submitted_at":"2025-05-06T04:51:57Z","title":"VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making","version":1},"cited_work":{"arxiv_id":"2505.03181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03181","snapshot_observed_at":"2026-08-07T13:54:10.870000Z","title":"VLM Q-Learning: Aligning Vision-Language Models for Interactive Decision-Making","venue":"cs.LG","work_id":"7bf01313-65c0-4a83-9192-69c9ef96511d","year":2025},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.934887Z"},"links":{"cited_paper":"/paper/2505.03181","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:08f6a703a4c2cf9258585ded7ae96e9b72de2db0c98338748ccc1f5dd3187fe7","observation_id":"3cfe34e8-1326-4792-b080-df0193139256","resolution":{"observed_at":"2026-08-07T13:54:10.983636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:00.020348Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.020348Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:78ad6a8bda3a5497ad4bb9a5044fdf8738b23ed28b446b00e5971fc9c638736c","observation_id":"9837c052-b1f1-4fb9-a027-bd72f5b4a1be","resolution":{"observed_at":"2026-08-07T13:54:00.020348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:18.853440Z","title":"Grounding large language models in interactive environments with online reinforcement learning","venue":null,"work_id":"fe6d7362-e95c-4f99-8041-786dff96a732","year":2023},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.341575Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:f7a8f6c81fbe0e67d0056ffa6a1460481fa1670f437a65f429176663d328375f","observation_id":"aaa36dec-fb2f-4a78-b795-9f6d5efe4387","resolution":{"observed_at":"2026-08-07T13:54:18.904679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:18.675647Z","title":"Amazon mechanical turk","venue":null,"work_id":"5ec04496-e609-4ce9-94cf-064cd06ec99c","year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.415231Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1ce39b322a59f978dd117dc68984b6260dc5a8fa2960e5f6238e039f798def32","observation_id":"97f0bd1b-2be7-4665-bbc7-87b794e22a3a","resolution":{"observed_at":"2026-08-07T13:54:18.764475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:18.557765Z","title":"center\" region. For the surrounding eight regions, we designate their directions based on the surface’s heading: the direction aligned with the heading is labeled","venue":null,"work_id":"21683bb3-4b37-4bec-959e-50f897400ba2","year":2017},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.501803Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:38bf2389fdaf708d0f3fa7f48285942e70f7a485956f2f91d2f66ba4f25ef5fb","observation_id":"17e23274-fe3a-44e7-9c82-fd81388d39ad","resolution":{"observed_at":"2026-08-07T13:54:18.618071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:18.345025Z","title":null,"venue":null,"work_id":"1283e418-07fa-411a-8d2f-43cc93d77a9d","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.614772Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1b6225706403fb2a38ad8d3713428f2680c48a5ab6cc373599aa77e00dd8d5d0","observation_id":"fa5d6184-56d2-4c9a-98bb-686c0cf15a7d","resolution":{"observed_at":"2026-08-07T13:54:18.421170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:18.176115Z","title":null,"venue":null,"work_id":"c06529b6-61cc-4f54-8a22-231b34306c5f","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.709463Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:e8d9b7fd3860f41ce6f15c608c795314effe20d8cf1a3eb6bfe414d3615c0e31","observation_id":"bfb85de4-ccee-40dd-973b-7b0456d5cd73","resolution":{"observed_at":"2026-08-07T13:54:18.276703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:18.044331Z","title":null,"venue":null,"work_id":"f6f754b7-1306-44dc-bddf-b283aa5ac666","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.837553Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:2e4979e5f72fb138dbeabf167e8046eb2c6fe6649cab9f7d45969ed65bd9c3ec","observation_id":"dd4dc1dd-4ff8-4f29-b379-85e0078a52b9","resolution":{"observed_at":"2026-08-07T13:54:18.127181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:17.876909Z","title":"Feasible","venue":null,"work_id":"cd3f09e7-03d0-492e-98d0-b680cfd01cfd","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.916794Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:d4cd1eb4d33ca19969db3bd51a5cd04e553d5ffd43ab9c0e9070081110e91f94","observation_id":"63d23804-baa1-48c3-a0ee-babf8dd229f7","resolution":{"observed_at":"2026-08-07T13:54:17.962332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:17.723857Z","title":null,"venue":null,"work_id":"030d03bf-c1e6-45cd-9c58-d5fb0d1f9d9d","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:00.997321Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:39aa50ac1adfdfc0dcdb6d21df8c641f66ebf3834f9102bc3fe0e144d8852ff5","observation_id":"56623e55-9369-4f8b-accb-fe24a4275571","resolution":{"observed_at":"2026-08-07T13:54:17.791018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:17.549250Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"440c432f-6434-4a46-a053-01b1a46a29f4","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:01.084572Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:36f4901dedc1f8c0c188afa75de113891351d2a5520d7ac5460ea16298707bcf","observation_id":"caa15747-9161-4e46-9752-15250857f940","resolution":{"observed_at":"2026-08-07T13:54:17.651016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:16.379044Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"b3a52cb1-f944-41d4-96f9-a10715e2b1f7","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:01.745645Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:605547456f868beb92658b0d8fece04c9fadd8d966f0bb834eb97a6a90ee54c9","observation_id":"76a29f80-09f8-458f-a15f-0d45c2f7eb10","resolution":{"observed_at":"2026-08-07T13:54:16.486413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:16.183295Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"487fffb8-b80b-491d-87f1-e0e223fccdf5","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:02.163867Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:cec8a0cdf1aa55319b79299e886ac23f806a9b72419b33ba5557f657d88ee3c0","observation_id":"3dbe886e-a1d0-4a99-ab0f-03b037400551","resolution":{"observed_at":"2026-08-07T13:54:16.289911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:15.936805Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"795f06b5-7762-4207-8092-9bed5218712f","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:02.521528Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:033111932abec8a94f51da6d49e27d3fc5505f2325e25aff49a53f52d816af14","observation_id":"4ede6929-eb16-406b-a8e7-a0ab6766d809","resolution":{"observed_at":"2026-08-07T13:54:16.066562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:15.725823Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"a6ccb01e-356c-4320-ab3d-b53196cc46ca","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:02.955476Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:48d73b39743a9514b8a34a051d06fd0ed1a9bf04a272e059fcfbb181556b2940","observation_id":"cb745ab7-32d5-4804-8ffc-bec17e621db8","resolution":{"observed_at":"2026-08-07T13:54:15.819053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:15.517997Z","title":"Specifically, for the task asking you put object to empty platforms, try combining adjacent receptacles may be very useful","venue":null,"work_id":"97d5c577-0d1a-46a0-8438-d1efd5f9edf9","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:03.173448Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:9f9bfc67da309095380640b14e1ee9dc607cd3524da1c9f1c70e57470eac1fee","observation_id":"bb20f84f-0ff2-45db-9f6c-3acd49494a80","resolution":{"observed_at":"2026-08-07T13:54:15.624389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:15.291527Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"49d106f6-81ad-4e59-8b17-9bc3f084b4a0","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:03.392298Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:036ee89219a8fe91a2031ae6dcdf41bb6009a3a75b1ffd6e1a5f4a154c1232a6","observation_id":"f6e1e9f0-d471-4676-99fa-b272fa9438e3","resolution":{"observed_at":"2026-08-07T13:54:15.431290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:15.074402Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"e405f458-e91c-453c-b158-352ec6688c93","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:03.786523Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1c04084bc1f338411211d36a3b7d4303f753ec834d94bba4eca69f53785cce66","observation_id":"c5c672cc-6e64-4da0-84a7-4cd28d662672","resolution":{"observed_at":"2026-08-07T13:54:15.184493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:14.918805Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"2b3f4d66-0d6e-47e5-b48d-7a88d9372e96","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:04.211528Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:8c248bc13f6dc108f98440b12ea86d749725dbaca5c1486fd1ee6d0553c36d7c","observation_id":"da61c604-ee1d-4f79-b563-07b1714ac0da","resolution":{"observed_at":"2026-08-07T13:54:15.007876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:14.671508Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"9afeefe3-7339-4761-8752-03437b2710aa","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:04.629175Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:c2f01a31ff5cf7f28177ce74bd17f99db0c757f0df8df4921071d38e59f670c8","observation_id":"fba5372f-70b9-4ad6-a192-4c4d43f0e07f","resolution":{"observed_at":"2026-08-07T13:54:14.764957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:14.499357Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"c508a0b2-3093-4d12-939b-8ce1fd7210c4","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:05.152138Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:d5282d8324255ed42ba444846685897fc3d951a8693ca0562c558f51879dc9e7","observation_id":"aa90358d-d8ee-4b60-ade0-f37056f8815a","resolution":{"observed_at":"2026-08-07T13:54:14.589581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:14.327712Z","title":"This is important because the receptacles may not be intuitive","venue":null,"work_id":"8d2b4b01-206a-4060-9087-2be462c24fe9","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:05.467669Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:6e7fac7539b65f2614184055d9ef59b9f02daed02f6d001a5e6d0433e771f98b","observation_id":"0cbccca1-3d35-4a1f-acd1-2a7aecbb5df7","resolution":{"observed_at":"2026-08-07T13:54:14.421053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:14.098332Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"66cfed92-146b-4be6-b071-945ccfbf2dbc","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:05.580311Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:8da4fef1d8400ec16e6d1904a25638b60ec6227e95e1ddfc2b0b50569958c72c","observation_id":"f7fbb0c8-4d20-4986-a7f9-e411d2e87971","resolution":{"observed_at":"2026-08-07T13:54:14.201698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:13.812632Z","title":"show_receptacle","venue":null,"work_id":"a1691de7-3f13-457f-8c69-386e53cecd8c","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:05.985117Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:6d8dbb5f39cbd9827c4681fcd3fd99f98c6b9e22341f1b776ad9c4ef5a903824","observation_id":"12af8a4e-7f72-4ffb-9cc5-6baf120c27a2","resolution":{"observed_at":"2026-08-07T13:54:13.919640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:13.596641Z","title":"show_receptacle","venue":null,"work_id":"07e09e2f-9ad9-4b27-96f2-1f01990003c3","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:06.393888Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:68c1c21fb0d6884f152807b95982f612d4ff32ac7a47668cd1fbd3208002c190","observation_id":"ead19c69-2f99-4516-a993-f5b52ddd15b4","resolution":{"observed_at":"2026-08-07T13:54:13.697302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:13.438805Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"87236cfd-48cd-471c-9806-25db3a979df8","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:06.638527Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:65b25529d32fadd59b63cff747077dc800208f1f9c32f43a219485e422567d88","observation_id":"7a66cf5d-d623-4805-b8fe-4835337b3ccc","resolution":{"observed_at":"2026-08-07T13:54:13.517228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:13.269824Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"c2ad726e-ac7b-43e4-a8c2-ba881db8e0a8","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:06.755301Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:4cf38821e1cb4728fc06d0b8cb5d45b73c205b57a0968a871c99b2ed2d7a5efb","observation_id":"9f298546-1cb7-4b93-9abc-c22bebdfecbe","resolution":{"observed_at":"2026-08-07T13:54:13.336685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:17.403288Z","title":null,"venue":null,"work_id":"34ec509f-ce8f-48b5-b6be-11b61ac3a6ab","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:06.851144Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:26b56ef353816ab37abc2aa7b7873a96f9e800125df2c86ce456cf181c3cd05b","observation_id":"e43a41f9-68d3-4081-a995-b1111a8aabc4","resolution":{"observed_at":"2026-08-07T13:54:17.472081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:17.237288Z","title":"If the platform has no objects, a 3x3 grid will be marked on the platform to help you place objects","venue":null,"work_id":"669a3b13-0feb-4b4d-aa5e-961462ff8b75","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:06.945591Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:6bee40c11d3b6be66c5f78c3872a907b30e990fa7cb7bd383690129c9b446e37","observation_id":"eec26299-e387-427c-b8b7-1a9b33773c66","resolution":{"observed_at":"2026-08-07T13:54:17.316512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:17.065567Z","title":"show_receptable_of_object_x_of_current_platform","venue":null,"work_id":"4efe15da-1979-492e-9610-6c086d425a64","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:07.075792Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:7ce85bdffcbd74a36ca265a64b0c19a03c2c26494ae1631c0981f579d95761ea","observation_id":"b476bee6-c400-453d-be23-6de13f74f7eb","resolution":{"observed_at":"2026-08-07T13:54:17.135743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:13.109906Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"6b35e441-2afd-4f1c-b573-ddb62a76fac0","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:07.659565Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:1d88c8e061d60da35946bb3787556c920f1e48ae7ab6640e549f0f5c8cd21f0f","observation_id":"8dfe0851-fa84-4ce0-b662-4b3df8ab90e7","resolution":{"observed_at":"2026-08-07T13:54:13.194035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:16.567322Z","title":"This is important because the receptacles may not be intuitive","venue":null,"work_id":"a9d0a668-d08d-4c9b-94f5-2fb0e6f926c3","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:08.078388Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:747b6846d751d3412203fb195e544f3302c774d043358d5958b3c457c8367aa2","observation_id":"66eefccd-e5da-4293-8e24-044ce22ff8f5","resolution":{"observed_at":"2026-08-07T13:54:16.660557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:12.942255Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"e81a4de6-cf2c-4260-bd98-7aafceb703e7","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:08.206444Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:40c78ad8e42389dd37d30fb2b7bfdf59e875fa9067aecd3971188a99c34099ae","observation_id":"5da1660c-31f1-466e-9a6d-ece6b36564c0","resolution":{"observed_at":"2026-08-07T13:54:13.014392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:12.569512Z","title":"front,\" with the remaining regions proceeding counterclockwise as","venue":null,"work_id":"bfac0e05-94b5-454d-a4e3-a3726f76e564","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:08.812446Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:125b1f48c5294bb59ad22f9d449dc3d19c3c667b8d420b08943b903dad6355a3","observation_id":"a54dc73d-f3d1-4427-ac0e-21d48fce2c89","resolution":{"observed_at":"2026-08-07T13:54:12.632092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:12.423851Z","title":"Specifically, for the task asking you put object to empty platforms, try combining adjacent receptacles may be very useful","venue":null,"work_id":"ca325085-259e-49a1-b876-a9e38528963c","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:09.077039Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:cbb493d815069474561e994022d888034d62fd0c9c127865f4d76cf2d6924dc2","observation_id":"b5b23e3f-e249-41a7-81d3-809e929a45e9","resolution":{"observed_at":"2026-08-07T13:54:12.491374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:12.253008Z","title":"show_receptacles","venue":null,"work_id":"9f70bc4b-4b73-432d-94b5-c8a3e7ee17d1","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:09.396524Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:25eb72bc2160cffd06645891b622c4f7a6341bfb37d7e9be5dcd12db778cd5d9","observation_id":"68d9d04a-736e-43af-bb73-40c35be53013","resolution":{"observed_at":"2026-08-07T13:54:12.355455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:12.050964Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"02bc1b9a-52fb-4096-8052-c78a26ed6e40","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:10.097488Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:08fa801cf053aba341f429dddf8c881a22e7c4b39173a874bd184dd69909b3dd","observation_id":"1d4bb4c1-eb42-43b2-895a-96a2038cdf3f","resolution":{"observed_at":"2026-08-07T13:54:12.132558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:16.926158Z","title":null,"venue":null,"work_id":"57475b88-9612-404d-b176-8e041b87f2b3","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:10.216972Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:071c337a63374e00f509466bd370239eea7f694a00e8be4cc01a9de391c900d1","observation_id":"0b37ff0c-3379-4de1-ab10-80215710c272","resolution":{"observed_at":"2026-08-07T13:54:16.981330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:16.735984Z","title":"Specifically, for the task asking you put object to empty platforms, try combining adjacent receptacles may be very useful","venue":null,"work_id":"41ba7e71-bb01-4ace-b820-1f4e373e9664","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:10.327005Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:df832193371eee883c05ea7d052e36df5a9f8df913e794f8819621976b4b0c58","observation_id":"51d0f704-bee8-46a3-97cf-f6242392fab8","resolution":{"observed_at":"2026-08-07T13:54:16.837465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:12.726721Z","title":"This is important because the regions may not be intuitive","venue":null,"work_id":"3f0411a8-d42b-4b76-a8c5-3906b3cc4ad7","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:10.473014Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:03c0388a0a5266575f9004bcf671495b2d3ab7ffd178a3fbdd3b11328a0c3980","observation_id":"539127ba-b0df-447d-be4f-332f0db22ebe","resolution":{"observed_at":"2026-08-07T13:54:12.851308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:54:11.884378Z","title":"You will only receive the same hint informing you your invalid action","venue":null,"work_id":"dfe77439-2d11-496b-ad71-681c9c38f069","year":null},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:10.639156Z"},"links":{"citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:fba783d16779d4c5d52adcc31f4cbfc3b16f49059c6eb1ae04ef29a0db756850","observation_id":"36847eec-c898-443d-a95f-98b92e2b42ac","resolution":{"observed_at":"2026-08-07T13:54:11.932375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T13:46:37.552722Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 2 inbound Pith citation observations for arXiv:2505.20726."}