{"as_of":"2026-08-10T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05aa07e90f15d2456db27de67f2e413772f9c11a93344e09d462e1c32fb0174c","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:54.732094Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:49:47.113836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:16:14.446824Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-08-06T10:49:47.113836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-07T03:56:49.161093Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T10:49:47.113836Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2507.23478"},"observation_digest":"sha256:8d55da5ba73757f19579b0523ef37d44a8314979003556b9dab134049be1dc19","observation_id":"a03740dc-991f-46e0-b652-48ad2b8c165e","resolution":{"observed_at":"2026-08-06T10:49:47.113836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2506.17545 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-06T19:04:15.122942Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:f590e6824f05b7950bd2ce0f4d4151b52676810de6e1ad61486d008b67d2c5ab","observation_id":"dc1d0c90-7740-4d73-9f6f-43a60c62986c","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-01T03:43:05.117795Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:6154cdf3c8cebac3cd195cff0e66f4c578137d031ef96145628577493287aecf","observation_id":"b6c9fc21-e333-4f3e-a41d-595aa2598a86","resolution":{"observed_at":"2026-05-13T21:08:17.348876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:5cd53b5dcdeea353fe3604f7f408b1f12ad1772e9970e5c8abb2a4b4e2844244","observation_id":"f454b41e-fca4-4ae5-8299-3dba8be8881e","resolution":{"observed_at":"2026-05-20T05:28:04.506945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2606.01215","last_updated":"2026-06-29T08:50:50Z","snapshot_observed_at":"2026-08-06T11:12:11.961385Z","submitted_at":"2026-05-31T13:04:31Z","title":"Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:14:48.328093Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2606.01215"},"observation_digest":"sha256:a9f1db8f28edee9012ff94d4b23aa51a6d3dbe5c0d76ee42874cf323eb3321aa","observation_id":"8b7f3447-d5a3-469b-a3dd-700edaba72ba","resolution":{"observed_at":"2026-07-01T21:16:14.448373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2606.01215","last_updated":"2026-06-29T08:50:50Z","snapshot_observed_at":"2026-08-06T11:12:11.961385Z","submitted_at":"2026-05-31T13:04:31Z","title":"Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T11:26:47.680406Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2606.01215"},"observation_digest":"sha256:fe80d57a4de26b7ae9de283e388f2a48a2a289531db55373b8a57d353aff5a85","observation_id":"5e2d5bd9-7531-4e87-b024-96a063370336","resolution":{"observed_at":"2026-06-30T11:34:38.162717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17545/citation-record","integrity":"/paper/2506.17545/integrity","json":"/paper/2506.17545/citation-record.json","paper":"/paper/2506.17545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:01.474742Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"e20378c7-8011-4449-83e3-e3ec2d7527cb","year":2020},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.085085Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d23696e7718844aee6e3fe890fcc04ab6ca26ddb09fa890a86af13cab10801af","observation_id":"ed8e7168-1445-4b8f-b31a-47ef08ff9f0a","resolution":{"observed_at":"2026-08-06T23:35:01.552537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.187260Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.187260Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:b60a8a553c57ee24e96d69bd004782511b243710c1c72563db6bcf2a3ddba60c","observation_id":"9226bca7-4524-49b8-8091-469a56ba4367","resolution":{"observed_at":"2026-08-06T23:34:50.187260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:34:50.293925Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.293925Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:7d96e01ae515cb301757d86339290873f88ec99a49ef37a465a8f5075d992bae","observation_id":"4ad1c548-4f4c-4ed3-a81e-26e7e230146d","resolution":{"observed_at":"2026-08-06T23:34:50.293925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-06T23:34:50.424528Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.424528Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:bc195d4a148ea84161cd0cce818cdbb84a1955c1ca12886ce03690fc0ef86d29","observation_id":"3061aad6-af57-490d-8a9f-02616bb75303","resolution":{"observed_at":"2026-08-06T23:34:50.424528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.502146Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.502146Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:262ff8e3c6911835e8c7b45761caad293c32120e01e0d06859cd8cfa8d6449d0","observation_id":"a866976b-438a-45c9-a23b-79a47a285988","resolution":{"observed_at":"2026-08-06T23:34:50.502146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.590561Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.590561Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:2a53102ac2510d9cc7a533b479d9398e385128ec3470699db59d30b662208611","observation_id":"8886deb5-0959-48ae-b47a-f5854c681229","resolution":{"observed_at":"2026-08-06T23:34:50.590561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.674777Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.674777Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:81c7b2ab3c423dad0c5ac03eb1017f12274d17d261cc9d01497f8688f5c5d6c1","observation_id":"962879af-d356-4703-98e2-e3a1c2052ec4","resolution":{"observed_at":"2026-08-06T23:34:50.674777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:01.084976Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"e92b4e80-04d0-434a-be02-219d6de8656f","year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.786284Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:c3c2c37e5963e05ca4e8b5daecb1d108aa664a63ea9f399835e48389ff9abd88","observation_id":"279ff78f-65b3-41ff-b81e-d483adeb9d9a","resolution":{"observed_at":"2026-08-06T23:35:01.194834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.823293Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"4fdeef04-852a-41e7-aa48-f305f72adb60","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.864776Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d1add49c5b48050ba989ea4e0275e4cc2b98999ee6c01ff61f7045cb642be87b","observation_id":"d0ab54f3-d442-4292-b066-44c289b2dfec","resolution":{"observed_at":"2026-08-06T23:35:00.957226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.571857Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"47e4ca97-c2d1-4c49-9d29-073c71f74b2b","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.009696Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3506a206e5b6bd931bbd3e2cbaf4c839df57b9e154ec3e7069c7fcba0878857f","observation_id":"285d4ae2-ca5a-45aa-8e85-414c5362e4b1","resolution":{"observed_at":"2026-08-06T23:35:00.706023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.266297Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"fed008e0-f15e-4311-b54d-51fcbfef89bf","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.112310Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:7c3037aa924d2cf12b911392a8084e621711e56aa3f7a2c2c6eda0db636174a8","observation_id":"28a4d20a-9564-41cb-88a2-23ecabea99b9","resolution":{"observed_at":"2026-08-06T23:35:00.402504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.109368Z","title":"Functionality understanding and segmentation in 3d scenes","venue":null,"work_id":"171d5b8f-872a-4c63-ab41-ec8a0e7e5c7c","year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.198878Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d5409b2d4a5eb061303fb6e7cbd591613ad031eed9b78614bb9e1eac665ba6a3","observation_id":"28484630-a5d9-4b57-a6a9-8d67a508401c","resolution":{"observed_at":"2026-08-06T23:35:00.222262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.811335Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"eea17bb8-99eb-40dd-bbe1-9ecc22c89de4","year":2017},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.302373Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:0cd9cf343a63a0a202bb7d21e2133527929d8b063845852e2855e95cbf6453d5","observation_id":"7e5f8c23-6c1c-48b2-b91e-11f77dea73ad","resolution":{"observed_at":"2026-08-06T23:34:59.955079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.544741Z","title":"Scenefun3d: fine-grained functionality and affordance understanding in 3d scenes","venue":null,"work_id":"9dc03280-083b-439a-831e-18bb40ee427a","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.373750Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:07e8d225feafa69144f901bcbda88bacc71bae8d28e397659bec75ac2d40f11d","observation_id":"b253733e-2e3f-400e-8a32-56f2b7b5b772","resolution":{"observed_at":"2026-08-06T23:34:59.666719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T23:34:51.432004Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.432004Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:fb6b2bab3cf020afe0e242bff30d2eb1cdf10865e38ef922c940f2b8f5ce5281","observation_id":"7acd6dc5-915f-4e15-b313-13cd14a70da8","resolution":{"observed_at":"2026-08-06T23:34:51.432004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T23:34:51.467823Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.467823Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:c49a547876114233d86cc6cc0e1ac2fea110043dd433f48c2c384e2622512e3f","observation_id":"d14b9ef8-5e7f-4d64-b888-4815955d8d59","resolution":{"observed_at":"2026-08-06T23:34:51.467823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:51.538593Z","title":"The ecological approach to visual perception: classic edition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.538593Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:fd4f4cc5695ecbea171b529806b3bf35aceba1c72f6c7b7b20f72c66097972bf","observation_id":"7f54d23d-d774-4890-8f84-618e83889bcc","resolution":{"observed_at":"2026-08-06T23:34:51.538593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:34:51.580536Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.580536Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:a90d31ce4047d5a0963b857b2db9f6f468a7328447e2d5217dc29fb709bdf52f","observation_id":"f0353bd0-68cd-4d0e-b8aa-ee09a817f793","resolution":{"observed_at":"2026-08-06T23:34:51.580536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.311345Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding","venue":null,"work_id":"9218a869-3ab7-41f9-bde4-932b33879015","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.630120Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:a8097d664b1c2e952ae2b42e94f23d3dd2dfe956cebc89fc019aaacda6bc2c56","observation_id":"005ced98-3c95-48b2-9856-325d9f985566","resolution":{"observed_at":"2026-08-06T23:34:59.393195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-08T23:14:57.166208Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T23:34:51.681819Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.681819Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:02a0a143f52ce1e0b89dcd5c676b122fc629202c77652b240673b842a0143fef","observation_id":"b9d52e38-0094-444f-aa1f-65c4f97ce632","resolution":{"observed_at":"2026-08-06T23:34:51.681819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.077241Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"69cee262-33d1-47fa-9404-72e6b275dbcc","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.737382Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3119f1027ef7a61f9ec24138c955944cbe3c116709a42fd21eddbd992f5f31bc","observation_id":"14668d63-bd0c-49fa-be77-36c52ef52330","resolution":{"observed_at":"2026-08-06T23:34:59.186224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T23:34:51.827382Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.827382Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:747ee1db5ed7df34e62702c645adf4ac08b8fe5b9a304a83e055f09acc5f35aa","observation_id":"8c1c1e4c-3e24-4bd9-b9eb-e8941c7b684e","resolution":{"observed_at":"2026-08-06T23:34:51.827382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:58.801544Z","title":"Text-guided graph neural networks for referring 3d instance segmentation","venue":null,"work_id":"217c2d03-b316-4ff8-b9be-2125a5224565","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.886696Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:8aa89c8d322468314752a914c5bad0b2e4dd4c67b5ae7f0eaf4823ae6492c327","observation_id":"353c30ed-8014-4f78-8788-fbacb505715b","resolution":{"observed_at":"2026-08-06T23:34:58.944257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:58.610090Z","title":"Multi-view transformer for 3d visual grounding","venue":null,"work_id":"0958f335-af80-4b83-8abf-87e5340584da","year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.957621Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:9f11378eefc64ae2c9cd79aa34d19d50445208c3a4a011077ae677682bd48309","observation_id":"fbc57c2c-1005-4aa4-8900-2cdb4a8f0385","resolution":{"observed_at":"2026-08-06T23:34:58.705701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T23:34:52.047794Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.047794Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:2e8f5b9214d5bba54782f0473d9112cdf01383d6de14fb9ed2d5d74af26d9afc","observation_id":"1e59bc04-336c-47d1-8f1d-34864794b21f","resolution":{"observed_at":"2026-08-06T23:34:52.047794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:58.321676Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":"adea0142-2228-495c-9bbc-6bf7e4fceff1","year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.121287Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:0effb3f055c9e4d170cc84d829d521bac962a5dec40ce110c04e870494703fec","observation_id":"4c7ebe5b-73ec-46c8-b30a-254cba943b27","resolution":{"observed_at":"2026-08-06T23:34:58.471374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:52.196735Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.196735Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:824ed0899ec9f116630a540feec6bcb9b503d3cdb4870c99f3001817268ce4b4","observation_id":"8b4f9729-5c84-4207-bc3a-ddc83b247789","resolution":{"observed_at":"2026-08-06T23:34:52.196735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T23:34:52.248369Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.248369Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:689fe528533d05ba53cff98f21c3f49a676a3b9b33633fc3969fa04c82e023dc","observation_id":"5ff9199b-effe-478f-8564-e0160dc4a7d3","resolution":{"observed_at":"2026-08-06T23:34:52.248369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-02T23:47:39.393363Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-06T23:34:52.340466Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.340466Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:6759231222717c1cd57568cf2e0ab779818f1ab79273774807f1a438b6dc3613","observation_id":"e234c58c-8045-4310-aedb-429afb0f45c3","resolution":{"observed_at":"2026-08-06T23:34:52.340466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:52.404835Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.404835Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:725980f81716f0debfef73d1012401a06577cb4f0250949604db83031b4f1f90","observation_id":"5228ce6a-ba5c-47d6-9e27-6a5406917599","resolution":{"observed_at":"2026-08-06T23:34:52.404835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:57.910449Z","title":"Introducing openai o1","venue":null,"work_id":"e421fcef-fa1a-4c89-91cd-8ba9b4ac1a9d","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.525748Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:fcf53adcbc4a0fd4aaa3e0981f911f857058bc167a258dec840a51d01f21f380","observation_id":"7ecf0d1f-e033-4411-999d-0edd71d31830","resolution":{"observed_at":"2026-08-06T23:34:58.064915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:57.469850Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"4870a051-6372-4d6c-9738-8ed00178f126","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.613220Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:7b229bdd28d69221b8094ed5ea22a66e377df45096ccd74655f89cca85a865a4","observation_id":"1ce32298-8785-4299-8788-d676de5a47d2","resolution":{"observed_at":"2026-08-06T23:34:57.587518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:57.239259Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"49567f79-1473-4285-bab7-9d9006723e3a","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.768733Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:0133e2b41c27bdb3e87847a687ff6a37550ac017ecac6bb0f32101ed3e93d0cc","observation_id":"e405d8fc-4ca3-4d86-bc3f-00c087ee3ed9","resolution":{"observed_at":"2026-08-06T23:34:57.324756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T23:34:53.004776Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.004776Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:b0f4a83c05f3b73abe521269504c28c19dba20c40b0680274e3b9a3d3ad4d907","observation_id":"69fe2126-b29c-4af0-95a6-dd0306ff9b4e","resolution":{"observed_at":"2026-08-06T23:34:53.004776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:53.075943Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.075943Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:1df5347d3de7cb6ab2a79a2b118315f3ad8e4d5ccfda8590cf65599ff9780d73","observation_id":"c3fa0c00-fe7f-4026-abb8-a8b4ab348688","resolution":{"observed_at":"2026-08-06T23:34:53.075943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:34:53.147630Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.147630Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:23bf16173c0279a66d96a5b4b95876bd83dccc8f3df92cd4a6e3da81a6f17fa1","observation_id":"82a2a810-cd69-4659-bd7e-d28eb2c4c698","resolution":{"observed_at":"2026-08-06T23:34:53.147630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.959515Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":"7e9fad54-4e67-4938-b9d9-8ae324a18f99","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.210278Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:4f5342647a7a9714cab27a8866a27d9f8930b5624713972500107d1309e1ba3c","observation_id":"4bd2fa6a-d9fb-41b5-a809-f01b28e6e8d0","resolution":{"observed_at":"2026-08-06T23:34:57.078831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:34:53.304750Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.304750Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:4dde0b354ff132ec7f160d7f97b938ad68ccbcd26db7eee6a92b055fa783b9c5","observation_id":"45df17a8-1db0-49b3-bf58-476513600938","resolution":{"observed_at":"2026-08-06T23:34:53.304750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.804771Z","title":"Chatgpt for robotics: Design principles and model abilities","venue":null,"work_id":"57f5f256-187f-412d-8fb8-a22fd0f96a4f","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.418030Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:1c6c95c24f8968613cf0a70a7af8dc93b86582a381fe98499adf3e8db6d359d0","observation_id":"b2563195-10da-4789-9fb6-4383212f9d6a","resolution":{"observed_at":"2026-08-06T23:34:56.868146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T23:34:53.529692Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.529692Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d1b265931a300d81ec3c45ba5716f53de84c8bbc03cde326c76ba946ea1c11e5","observation_id":"67ca3aea-21d9-42f0-82e8-0d874e7f886f","resolution":{"observed_at":"2026-08-06T23:34:53.529692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T23:34:53.624919Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.624919Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:da84b6cadd4697edf215f7604466f989899879314cc9aa4369b520159146c0c0","observation_id":"78530adf-24b4-4652-b6b5-b232e77c5410","resolution":{"observed_at":"2026-08-06T23:34:53.624919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.560619Z","title":"Distilling coarse-to-fine semantic matching knowledge for weakly supervised 3d visual grounding","venue":null,"work_id":"43e83614-fa11-4bc7-8bad-b24b58cd124b","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.702757Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:6599773ec5c6ff295d79603d003da95acbea28090f02250f5859be3a77868ec5","observation_id":"6bf266ad-34ce-4b37-a064-63a11da1e28c","resolution":{"observed_at":"2026-08-06T23:34:56.650264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.273796Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":"26857b56-d32d-4d14-a70e-c6a9ceb5262d","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.845949Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:30418aa5d41ab59cbfbafb2f3dc3096d9990d95d86707b847bef1641ac3628d0","observation_id":"f3770be4-4d4c-46c4-ab61-fa2d0697575d","resolution":{"observed_at":"2026-08-06T23:34:56.416286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.009373Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":"fdbd78f1-4b6e-43bb-9045-b2b6e15ab166","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.974587Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3f1432c2666e9b004416a0fe37de2c2dc4c00e72ffaac978e1fb199a5bd2c794","observation_id":"05da5af7-46a8-4a2d-af28-13db6388021c","resolution":{"observed_at":"2026-08-06T23:34:56.111190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:54.128620Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.128620Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:00986ac0d5e5a243e33b1bc45a8d0b1be9b7a7397d504c5120f3b14b4e6a6ede","observation_id":"7a2cf311-ede6-42a4-a5a4-ce6053d4b62d","resolution":{"observed_at":"2026-08-06T23:34:54.128620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.885257Z","title":"Empowering large language models with 3d situation awareness","venue":null,"work_id":"31352916-44ef-4bee-b0c4-4f7c1a74fd2f","year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.272841Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:1c78b075a58f5588ca1d4599a46e920dcc52585588c00bbb9370178b040ee587","observation_id":"1a39f9cf-49bf-44fc-bc8c-6d39f64c550d","resolution":{"observed_at":"2026-08-06T23:34:55.935976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.703463Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"34bc4b2d-abaa-44fc-ae24-08c19db97857","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.384753Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d3153a90c1b67a32d1147887a9a4841d8ec8237fc7a4cb05b09d4dbdf16a2167","observation_id":"494884c1-1a1c-49cf-a2f6-49713e22119b","resolution":{"observed_at":"2026-08-06T23:34:55.760801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-06T09:32:33.122628Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-06T23:34:54.466311Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.466311Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d36e3749ccc2d5c7e76bc75b28f625caf9aa840ee930fb3bd715fcf8e1073aeb","observation_id":"3df51210-40c0-4bee-ae88-a9c4dfca88e0","resolution":{"observed_at":"2026-08-06T23:34:54.466311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-07T09:42:09.287521Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-06T23:34:54.555746Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.555746Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:049ba80f926f3c40ebb2d9e8a88225a2b4d8cd81cf421a4e25c6820c1022bbe9","observation_id":"ca3eb5f5-d067-4075-b7e1-c7514176b17b","resolution":{"observed_at":"2026-08-06T23:34:54.555746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.511421Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"4ef84d5b-3261-40a9-8123-96536510a93a","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.649230Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:399e05808b5961c060dded9d93b29d00c0eba0dc5b0e6a2e45b6edc78f83a1e5","observation_id":"64d34c28-84ba-4862-84ad-17a14bb5ecd8","resolution":{"observed_at":"2026-08-06T23:34:55.621691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.330323Z","title":"[EVENT]\" in the video, determine the precise time period of the occurrence of the object. Provide the start and end times (in seconds, precise to one decimal place) in the format","venue":null,"work_id":"7ed241ba-2a7a-4080-b212-5dd71c0d8e7a","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.732094Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:8fe8e120f37b7a4f1ffc7cece38ba411230450e28fafb2be8d1709f4ccef7ea0","observation_id":"ad927a9d-0c9f-4e92-80ff-8f16ffaec360","resolution":{"observed_at":"2026-08-06T23:34:55.426439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:16:42.176171Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 6 inbound Pith citation observations for arXiv:2506.17545."}