{"as_of":"2026-08-09T13:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15696fadc29b0996a9359937c7c370a17d4f43d7835a4ddbc9314425ea6e52f5","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:03.566081Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09334/citation-record","integrity":"/paper/2507.09334/integrity","json":"/paper/2507.09334/citation-record.json","paper":"/paper/2507.09334"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:02:58.124609Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.124609Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ff34d13573b90ef44c776f1678e4a6f7468e6e3a1f2895c15df647a394a3b263","observation_id":"f48ccb24-04c1-4af9-ab85-115adccb60b5","resolution":{"observed_at":"2026-08-06T18:02:58.124609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:02:58.157375Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.157375Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f89d8d104645471e00d6158aea394f2b56389e6df3ca207d23c489433991db4a","observation_id":"c97d3428-4d4b-4ca9-bfc9-53a764938a49","resolution":{"observed_at":"2026-08-06T18:02:58.157375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.223606Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.223606Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2b2570290e0e6b9a162f56df0676a227c6d9aba211b54051627b712fa1547262","observation_id":"451f4ec4-0adb-4693-b0e8-cf0c196b7a00","resolution":{"observed_at":"2026-08-06T18:02:58.223606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-06T18:02:58.302019Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.302019Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a7df2f1f508fccbfbdcf2347eb13bba0cb43d862680b0fff0bf0c849150c23b8","observation_id":"5ed70302-e3d8-48dd-b8b9-60d04bc948aa","resolution":{"observed_at":"2026-08-06T18:02:58.302019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.364155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.364155Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:d00ba6808789f1857ae966172cee55d6c55e4ea86629e7c18054d9d8e6ddb14a","observation_id":"3b25b53c-588f-4af3-9966-29ef4776d0ad","resolution":{"observed_at":"2026-08-06T18:02:58.364155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.422074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.422074Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bdfe0305275bf7e2719fd48159ef122fe8a151ad2137333f463a89d2fec49e69","observation_id":"e4cbb8fe-1c56-4b2f-8079-d6820a086803","resolution":{"observed_at":"2026-08-06T18:02:58.422074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.504730Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.504730Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2def9132c395304b3f6378d69b3ee74e003260f0defc6c19a9b4da5a13ef73eb","observation_id":"772f2383-4452-4096-8cc5-fa90cab7567e","resolution":{"observed_at":"2026-08-06T18:02:58.504730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20092","last_updated":"2024-11-17T17:05:03Z","snapshot_observed_at":"2026-08-08T00:42:54.303187Z","submitted_at":"2024-06-28T17:57:14Z","title":"Efficient Large Multi-modal Models via Visual Context Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20092","snapshot_observed_at":"2026-08-06T18:02:58.561451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.561451Z"},"links":{"cited_paper":"/paper/2406.20092","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:9647810110a0598fcc116595096b4e067ed288803a0f95c9611cdd8b5170e5f2","observation_id":"0e65442a-8ef8-44e2-86c1-fa56cf9150ee","resolution":{"observed_at":"2026-08-06T18:02:58.561451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.638753Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.638753Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b62a1f9b27062a48280bda8dd0ce26aa2c4de3cebe122d4f42925c0f85e374ab","observation_id":"b05cc5d5-aee2-4d4d-885f-6acb86921161","resolution":{"observed_at":"2026-08-06T18:02:58.638753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.697380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.697380Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:08519108d981114b2be3c4ecbbb0ca3955dfa224813c66c0a0049a66681067a2","observation_id":"015c0e41-aed1-4605-bda8-030c0e18aaa1","resolution":{"observed_at":"2026-08-06T18:02:58.697380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.759815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.759815Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:67be67eaa48e3acee3d5e6637ff41030771e9ec31a1e135626010ef59efffd33","observation_id":"07554a33-1893-4957-9184-ecb0773e65cf","resolution":{"observed_at":"2026-08-06T18:02:58.759815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.817271Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.817271Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b0d6be02833cc7c52aa62834e97dff9cdeaae69640bb676bfa967bff01a972e3","observation_id":"3c7f5ec5-5aab-427a-bf75-90febf63009d","resolution":{"observed_at":"2026-08-06T18:02:58.817271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T18:02:58.856085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.856085Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a266eee6bf00f10d4d031132b57256163203440119a70b7fbcaefc496ed1d331","observation_id":"428ab502-aaaf-46c8-9e4d-2c368183afa6","resolution":{"observed_at":"2026-08-06T18:02:58.856085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.914716Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.914716Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:da5bf87ea5d55452f94ac2ea64d00273be2411138bc5f88579f7e26d7de43305","observation_id":"58363efd-d264-40bf-8056-4fe131cdcc46","resolution":{"observed_at":"2026-08-06T18:02:58.914716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:58.972389Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:58.972389Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c4b56dbf427ef784ce6089dee8fb8871f42c34564dab86c1c09e4e2641b5d7f3","observation_id":"7854f2f5-0054-4eab-884b-f903fa972108","resolution":{"observed_at":"2026-08-06T18:02:58.972389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.036403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.036403Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:232a094d867237d1a5e77d9483f0e3ed3cc5fd0e29119a6fd55782405f4957e2","observation_id":"b81c9a9c-0bd5-4dd9-aa3b-85195db93ebe","resolution":{"observed_at":"2026-08-06T18:02:59.036403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-06T18:02:59.100588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.100588Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:dcb05c822dec19d19dbfdcd21455ba0b911189556e3bbfc0c351e437bd79e388","observation_id":"fa1e8111-6433-4fed-b898-564526b8756d","resolution":{"observed_at":"2026-08-06T18:02:59.100588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T18:02:59.151702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.151702Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:44f4cbe8957100fa5f677349273d2fbaf977a8e900f8535c5d4d475d733da466","observation_id":"fc7c0d4e-de84-4322-8dfb-1d57500b0b96","resolution":{"observed_at":"2026-08-06T18:02:59.151702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.210209Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.210209Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:80d4f6784d43ea5431a32c2b9a6f58a707ed182d2bdbce3d7ad345132b74e24e","observation_id":"c344f0a6-47bd-4900-b813-e89346807cdc","resolution":{"observed_at":"2026-08-06T18:02:59.210209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.260129Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.260129Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c0da9707db0f5d1191fb6735a73778af7aeef11ddfc614daaa670935f86d7724","observation_id":"9261afb5-5d0a-4769-93d5-a5c5a9b0cb68","resolution":{"observed_at":"2026-08-06T18:02:59.260129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T18:02:59.310302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.310302Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:7e5b965f42fb78d4207bf1f77e3abe0fc35eee33e110f164b19b2bb5880e8006","observation_id":"68ae865f-2237-4e64-b034-6bb324ef0489","resolution":{"observed_at":"2026-08-06T18:02:59.310302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-08T23:14:57.166208Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T18:02:59.359288Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.359288Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:aaf818349283be059343db7a70a55c4ef9349706603a6154f1b9dcabe6b47da1","observation_id":"18c0dbd6-b05f-4c15-a4df-c38a6f616566","resolution":{"observed_at":"2026-08-06T18:02:59.359288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-08T23:15:31.134799Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-06T18:02:59.427373Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.427373Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:492efdd17e618504caa656fd03466398f730cfc580b3bbe6c8f1fee18b57e5d6","observation_id":"11b29fae-b0ba-4098-9893-4791cfeeef98","resolution":{"observed_at":"2026-08-06T18:02:59.427373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.538187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.538187Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c556520aea77299de519e7987a4f787148f4f47467fe09242b79d7aa19ddbb7c","observation_id":"dac39ce8-5bc7-49d5-bca1-aad175bc498d","resolution":{"observed_at":"2026-08-06T18:02:59.538187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.785935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.785935Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:87454ca65bddd55b3aacf6e43ba34b231ca183ab20fc3582a752581d4e42587a","observation_id":"12dbf14c-b7ad-45d6-a642-dda8bf02b171","resolution":{"observed_at":"2026-08-06T18:02:59.785935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.896886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.896886Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:1b367c4f0353f6cac10b002c51f4253edd5915c8b0b84ca9874cf68428ec4d88","observation_id":"d3b9fa8c-0657-4b68-ac8d-f777b35998c1","resolution":{"observed_at":"2026-08-06T18:02:59.896886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.330637Z","title":null,"venue":null,"work_id":"3269ccf5-15fa-412a-99c5-56d5a9377339","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.961573Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:308bdcade33747bc9e10412c69f6e777808e935632e4afdf312ffed531467afe","observation_id":"ee98cb67-0a3a-478b-9812-a7ad333c6f60","resolution":{"observed_at":"2026-08-06T18:03:04.333211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.981076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.981076Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:44b5fed00883c71789238cac2d0bb020d76aa2c2718dc1377b729343500b0d53","observation_id":"3eb360f5-3190-4106-8bdc-1133acb30210","resolution":{"observed_at":"2026-08-06T18:02:59.981076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.317588Z","title":null,"venue":null,"work_id":"1bc33e25-7d24-4007-b1f2-419d2df25a82","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.100464Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6188b641d0221c6e28cd8b1348c69a22e8973891d1b4adec5bbb8ca23f6f86b8","observation_id":"d929c75e-a43d-4e5b-a955-1e35386283a2","resolution":{"observed_at":"2026-08-06T18:03:04.320759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-07T17:07:05.445620Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T18:03:00.188535Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.188535Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f6201562d1c846cc01869136e17a394ca4d4b1e5a7c683bfb7fc104fcd58e5f3","observation_id":"14f17569-c587-46af-bf64-25ab994e7398","resolution":{"observed_at":"2026-08-06T18:03:00.188535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T18:03:00.275263Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.275263Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f9dba261bac5c414fdf5e9828fcfaf5661737d87c670be5416ddbb1e7c2e2da9","observation_id":"6d6927c8-a06d-4f62-82f4-2feec4d9382f","resolution":{"observed_at":"2026-08-06T18:03:00.275263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.309277Z","title":null,"venue":null,"work_id":"4f40ccda-d7d6-499e-a508-13bba8152c4b","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.390648Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e8ff8584c71d1b240177da85640e66966662e38a557efcfcfb799f80aa015438","observation_id":"31965077-7e67-48fe-aaa2-ced25d9f7d75","resolution":{"observed_at":"2026-08-06T18:03:04.312278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:00.515248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.515248Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2864befef9122b1f9d81753658df1e7a8d5f20461c71f24c055bd10af791652e","observation_id":"e7bd4f78-18c4-45ac-8ee2-59ab9ed91133","resolution":{"observed_at":"2026-08-06T18:03:00.515248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.296641Z","title":null,"venue":null,"work_id":"549da7f8-0efd-486c-92ff-bbff1a7a4128","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.648257Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4224195916db3cea26cc36a18f31e479cc3f12fc0c00a63e926e5b7e93260cef","observation_id":"943b7901-d968-4229-9a6e-ea74284ac571","resolution":{"observed_at":"2026-08-06T18:03:04.299584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02268","last_updated":"2025-01-04T12:14:42Z","snapshot_observed_at":"2026-07-06T20:16:31.769559Z","submitted_at":"2025-01-04T12:14:42Z","title":"What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02268","snapshot_observed_at":"2026-08-06T18:03:00.712937Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.712937Z"},"links":{"cited_paper":"/paper/2501.02268","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bd89ab83f6f919cb3919058bfe5896100058d9908929c9dfc5761ef900d2b9e1","observation_id":"4d279c18-dd29-4371-a6dd-b9afe731d86f","resolution":{"observed_at":"2026-08-06T18:03:00.712937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.288519Z","title":null,"venue":null,"work_id":"6aec8cc4-658e-4709-bacf-be78e6b4f70c","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.796668Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f0a3357782fea46afbb4f0962b41f14e994625720aad7ba4c84dd3b6b21a4014","observation_id":"263f6650-c2bf-406b-bdf2-e5da196521b9","resolution":{"observed_at":"2026-08-06T18:03:04.291211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00255","last_updated":"2025-02-20T18:06:19Z","snapshot_observed_at":"2026-08-06T16:07:39.342941Z","submitted_at":"2024-09-30T21:55:38Z","title":"Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00255","snapshot_observed_at":"2026-08-06T18:03:00.870564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.870564Z"},"links":{"cited_paper":"/paper/2410.00255","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:def853c7398298659ab8d88804ab72d98f826a9e2733cb71c97544be93b88b9e","observation_id":"a944f717-4782-49d0-8b83-340b38a70338","resolution":{"observed_at":"2026-08-06T18:03:00.870564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:00.965145Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:00.965145Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:75b3bf7e5548418c19216007516d5a3ae13fbd5aa7edd4edbdff08e3a8bdcbac","observation_id":"7346c2f8-6b98-4f16-8a59-a2848d296f0d","resolution":{"observed_at":"2026-08-06T18:03:00.965145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-08-06T18:03:01.186306Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.186306Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f83b2d5771cb0560c55615ff4dc6d7ee470f35e76073702a230fc51833ffa05b","observation_id":"58936284-d05d-4d50-9943-35cc6971894e","resolution":{"observed_at":"2026-08-06T18:03:01.186306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T18:03:01.298449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.298449Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:766238932cb174fcc9e4a048a2e246ad102c0e2f35c65c4d0592f1ed38b1e09a","observation_id":"0c424190-ddff-486c-a6ef-16aaf8b4e4ef","resolution":{"observed_at":"2026-08-06T18:03:01.298449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:01.384970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.384970Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2215a1a74ed44e8147fc40ea7269cf39ce3545504c0fbea024e340a369898991","observation_id":"7d46be39-c1eb-43b0-a664-74208764c257","resolution":{"observed_at":"2026-08-06T18:03:01.384970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T18:03:01.459589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.459589Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:62a05c7485909befc21c5b824bbf77e04fa464d6e9d40dc73e418cae8ec4af59","observation_id":"ba871690-ba73-4293-b9cb-ef2c964ae505","resolution":{"observed_at":"2026-08-06T18:03:01.459589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05803","last_updated":"2025-01-25T15:59:57Z","snapshot_observed_at":"2026-07-06T18:12:05.439027Z","submitted_at":"2024-05-09T14:38:53Z","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05803","snapshot_observed_at":"2026-08-06T18:03:01.514560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.514560Z"},"links":{"cited_paper":"/paper/2405.05803","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b3d796baff985fd8a9fbd9db72171d3b16853734b2b833f456ef31513fdd7bcd","observation_id":"8b21d098-658d-4f82-8300-bd55089c689f","resolution":{"observed_at":"2026-08-06T18:03:01.514560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.265973Z","title":null,"venue":null,"work_id":"198b3476-b4da-480b-8b31-bc2ba7003555","year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.598313Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:244c4360be473fd80d022b99fcec2ff214fb271e0c0c7963a6b3ae6dc84ef2ba","observation_id":"d5ab953b-5a41-4c58-abc4-31cbd716dbe0","resolution":{"observed_at":"2026-08-06T18:03:04.268643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05785","last_updated":"2024-07-22T03:21:27Z","snapshot_observed_at":"2026-08-05T03:56:22.669895Z","submitted_at":"2024-06-09T13:52:12Z","title":"A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05785","snapshot_observed_at":"2026-08-06T18:03:01.736901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.736901Z"},"links":{"cited_paper":"/paper/2406.05785","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ab92ecc00431fbbcec2ef9e3f2e43bc0b730fd9725cd68ab0b71897b22d555fe","observation_id":"4209fa98-41a5-4b90-8146-f2305a0afdd0","resolution":{"observed_at":"2026-08-06T18:03:01.736901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07403","last_updated":"2024-07-12T03:58:05Z","snapshot_observed_at":"2026-08-07T09:29:22.417640Z","submitted_at":"2024-07-10T06:57:58Z","title":"A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07403","snapshot_observed_at":"2026-08-06T18:03:01.862985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.862985Z"},"links":{"cited_paper":"/paper/2407.07403","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5383dfe696c09eb88b3d23f0dbcc3e61d5aa5ab298dd437220bd76eb0b520924","observation_id":"63d6651f-e8da-4f2f-b415-e3cce06f15ba","resolution":{"observed_at":"2026-08-06T18:03:01.862985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.257785Z","title":null,"venue":null,"work_id":"a9eb3c5d-4dd4-46df-87cc-9ad7f8b52376","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.958274Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:17b4787c54b68a2fedd0bb47f26ee9e7c94f6d9bee287d9f9fc042627e68aa80","observation_id":"aaad7d22-b811-41a8-bde0-57f758a96a4a","resolution":{"observed_at":"2026-08-06T18:03:04.260407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:02.096446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.096446Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:cdd4d5545bb05178e9815b9eea88384a7a0f65ae2b1795b9abda4bd181b9b164","observation_id":"c4dfc515-b507-46d5-bb4a-5c2bee356090","resolution":{"observed_at":"2026-08-06T18:03:02.096446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:03:02.177529Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.177529Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:76920ff3935ba211b7f4f0f48bcd4a12ad19d3f81fa5ee020b7536458961cd04","observation_id":"8e495855-3c2f-4e86-871d-c49d21bf92f7","resolution":{"observed_at":"2026-08-06T18:03:02.177529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T18:03:02.275383Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.275383Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4ceadc0edbe3edbfcfb16fcdd54c3b193d08a77ebc466ed70d039d3e46a02d30","observation_id":"c05b8ad3-7462-4d43-a348-e4e2897b91a0","resolution":{"observed_at":"2026-08-06T18:03:02.275383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.244560Z","title":null,"venue":null,"work_id":"2cb088ea-2873-49d3-b3eb-8fb339cc5883","year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.387663Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:1cdf8591af7e92cb2dd00c235096d0bf5a9cecfaf117ca40a098165615c940ed","observation_id":"cc8d66a7-de7c-48f2-ab20-092c5b8e0252","resolution":{"observed_at":"2026-08-06T18:03:04.247401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04334","last_updated":"2024-06-06T17:59:34Z","snapshot_observed_at":"2026-08-01T08:01:34.798822Z","submitted_at":"2024-06-06T17:59:34Z","title":"DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04334","snapshot_observed_at":"2026-08-06T18:03:02.529236Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.529236Z"},"links":{"cited_paper":"/paper/2406.04334","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:3d8036409ce84d3a578b09bc2d5d8cd0b1d8091aea906e72856980f5dcc8d9c1","observation_id":"c6747194-ffa5-4fad-a468-8e298098a2ef","resolution":{"observed_at":"2026-08-06T18:03:02.529236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T18:03:02.638809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.638809Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b65871daecf4817d89672f82c9e5cdc6b263d5361ebe6ee81b6f06ebbe3aa0ca","observation_id":"b4fb18f8-b5c6-409b-bd09-a7820b23a8e8","resolution":{"observed_at":"2026-08-06T18:03:02.638809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:02.775854Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.775854Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2bb759edb7a938360974b205a17c4a3b6edffb2cc4923e100aeeb927c49763e1","observation_id":"aa459827-2401-489d-9602-c3cc74856acb","resolution":{"observed_at":"2026-08-06T18:03:02.775854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.230981Z","title":null,"venue":null,"work_id":"eaaeb1cb-07f4-4486-b9f0-1c440a139822","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.909116Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:8515baa3b2aa5f7c66e80d9598bd3404f4bc6899d2b3c88e1ee26df42c17d05f","observation_id":"f00de20a-bd16-44f9-a5d5-e95b21d78b99","resolution":{"observed_at":"2026-08-06T18:03:04.234376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.223052Z","title":null,"venue":null,"work_id":"d10736ec-2551-4f3e-aa01-0e6ab419db69","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.982828Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:779036c8ad4a8ab90b8b4efd137131a8b7680f8d9ee114e9905e08d965aa66f1","observation_id":"beb01344-99fc-4f67-8d51-9643a7b40d2b","resolution":{"observed_at":"2026-08-06T18:03:04.225873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.159380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.159380Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:21e3cc8411f2df094cb137e20cb26ea80ec591c84d2154a4f416afd824da735f","observation_id":"10c1911f-5be5-43f9-a8e1-23036f06c7d8","resolution":{"observed_at":"2026-08-06T18:03:03.159380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.419032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.419032Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:7df85e5fcf71ab23af985dbf5b66c2f446eea8d91f06a1e2e3d7b82727161247","observation_id":"85fc4b70-9b34-4241-9f9d-26410c2934b0","resolution":{"observed_at":"2026-08-06T18:03:03.419032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.193413Z","title":null,"venue":null,"work_id":"0274b822-926e-4b32-86db-8e102b4ac431","year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.476300Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f422cb8e0645b9ba73ac6e2000f862f4cfee078347745c57246d982bb1469dd8","observation_id":"d3d5e37a-1175-423d-9e07-11cfb0186ccc","resolution":{"observed_at":"2026-08-06T18:03:04.196313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.479044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.479044Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:f75ede22977b831115ef781b0b6aefb6628d3da3c88cf46b35d1cd826b3e7892","observation_id":"1d2efe2b-79bc-4dd7-8171-3abf4037646f","resolution":{"observed_at":"2026-08-06T18:03:03.479044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17455","last_updated":"2024-06-13T19:15:53Z","snapshot_observed_at":"2026-08-07T17:52:12.274898Z","submitted_at":"2023-05-27T12:07:21Z","title":"CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17455","snapshot_observed_at":"2026-08-06T18:03:03.482002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.482002Z"},"links":{"cited_paper":"/paper/2305.17455","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a9d7480c947bad0009b46a77cf5472068c4732921ea2d26a43c16fbb7a36260a","observation_id":"826bb000-010a-4fe9-af72-5ff6515c331f","resolution":{"observed_at":"2026-08-06T18:03:03.482002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.204410Z","title":"Advances in neural information processing systems 34 (2021), 13937–13949","venue":null,"work_id":"c04df3ab-15ce-4bdb-8c7b-11f63a308797","year":2021},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.473632Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:fd891b3a82d130e7540b72fb99f57580b4edf0311071aded0af5e815d92597f6","observation_id":"f625af16-3a32-43a3-b587-62a26cd8d262","resolution":{"observed_at":"2026-08-06T18:03:04.207795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:03:03.488481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.488481Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:3caf5b26acb3bdf190eaea53b20bfc3343bf304d5f60be0fd023f391e072390a","observation_id":"8e66426c-04bb-4b6e-ba8d-17fa51174131","resolution":{"observed_at":"2026-08-06T18:03:03.488481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.491561Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.491561Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5d732bbc0a9adb7e00089ca649c2f7425624f4868801a06a750b104d557336be","observation_id":"fd9a1140-07e0-493f-9aba-660ef3bda262","resolution":{"observed_at":"2026-08-06T18:03:03.491561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.494966Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.494966Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:2416213c88e91f2d8e8457fb8348e58a604f488e6ab3de2bd1172c9ce8f89331","observation_id":"8cd510ac-b256-40bb-8011-9c7fe44dc19e","resolution":{"observed_at":"2026-08-06T18:03:03.494966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.485061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.485061Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c1605aaa016de6bbff0fae682ae7f8410afe598c04225e5f6d46556a0515cd0e","observation_id":"a7e98b14-bf4d-4ba0-b598-48ecc44be977","resolution":{"observed_at":"2026-08-06T18:03:03.485061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.160802Z","title":null,"venue":null,"work_id":"ff3f8693-d145-4bd9-859e-cc5a69a2004c","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.500422Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:036f2bf5eabba64d6187cfc8077697a778096b12293c008ba0cee7981effae4d","observation_id":"12439054-5c02-4e68-95df-1195896b9604","resolution":{"observed_at":"2026-08-06T18:03:04.163793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.506443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.506443Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e8ba2f27f6e40d48ead19b9f88f5b286bea18fc5d21fd07b93f45054ab551801","observation_id":"31a64dc9-6dae-47d2-8735-d4d256d72e78","resolution":{"observed_at":"2026-08-06T18:03:03.506443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.509381Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.509381Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:18b849db7c52bb878574004af519bd8b14eae5d9676ffe9cee91a26c7409f01e","observation_id":"1c0768b6-6793-4731-a6e9-a2dbe0c99a8a","resolution":{"observed_at":"2026-08-06T18:03:03.509381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.169000Z","title":null,"venue":null,"work_id":"5268a00e-3f9b-4c00-9b52-3f5620140b12","year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.497751Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:215f555e334b4fcee5f3f4319b729d366f006381cffe7ad8680904fafc40d944","observation_id":"6db3fe3b-5dfe-4b00-85e9-0b3513d74123","resolution":{"observed_at":"2026-08-06T18:03:04.171716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.132421Z","title":null,"venue":null,"work_id":"af87b5ae-616a-4160-a376-f831faa3fca0","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.517025Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c7373c0f9304d64e768631cda639492076e350f222fc5bdf9d6d98e9faea3607","observation_id":"b402ff32-e7ce-435a-9dfc-b27fa2980217","resolution":{"observed_at":"2026-08-06T18:03:04.135222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-09T00:24:49.492041Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-06T18:03:03.503424Z","title":"arXiv preprint arXiv:2412.05819 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.503424Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5d52e0723f36506bcf4e64c3a2a3a8d2c7d012d6e6f0474c28d38a01dcfcb202","observation_id":"bf08dcb9-4566-433e-b52b-f72d9f749cab","resolution":{"observed_at":"2026-08-06T18:03:03.503424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T18:03:03.521866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.521866Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c2a756c959d8c8d7613430578f6dd22af1c78781b545e48a530b01bd63017a0e","observation_id":"710f3385-21c6-4bd4-b355-9f7a54843c1a","resolution":{"observed_at":"2026-08-06T18:03:03.521866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-07-06T19:16:01.172484Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-06T18:03:03.524477Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.524477Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:01a3482a8e0c251a11bd6c836cf86b73925205887754509331f1d588f51cced2","observation_id":"9d18b4bf-9bd0-4340-9b6c-470f3b9efc82","resolution":{"observed_at":"2026-08-06T18:03:03.524477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.140867Z","title":"In Findings of the Association for Computational Linguistics: NAACL","venue":null,"work_id":"53411cf4-67ee-40f7-8087-859806f4c03f","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.511790Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5d6465c3a288ee297042d5fdce17f72c0c56f94127042cc33545287996eb2bbb","observation_id":"093a4a1a-8679-4475-b912-ffb8858f64e3","resolution":{"observed_at":"2026-08-06T18:03:04.144483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-08T07:19:32.263241Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-06T18:03:03.514224Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.514224Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:a08b267d445a3d0fa8b764b44c70746830d3207c594de9a73305620577012e58","observation_id":"787ddb93-6028-4bca-8479-89bbd6852216","resolution":{"observed_at":"2026-08-06T18:03:03.514224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-03T09:36:51.057026Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18450","snapshot_observed_at":"2026-08-06T18:03:03.534576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.534576Z"},"links":{"cited_paper":"/paper/2412.18450","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:0299c2f90f5c82ac8a22ca79b2bba848d1ca5bea2818e8cbaa9d8f5aefb96a5f","observation_id":"1643fde7-2768-4b46-bc1c-8a6a60bbdb1c","resolution":{"observed_at":"2026-08-06T18:03:03.534576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.123959Z","title":null,"venue":null,"work_id":"5f887f9f-f8be-4c7b-84cc-9036ee639d62","year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.519321Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ac78e2cc7d3003da5626faa48907e1f10bca605ec4fc709157e42b6514dfed22","observation_id":"69cbbbb6-fb80-4d49-9b2c-da94686edd61","resolution":{"observed_at":"2026-08-06T18:03:04.126834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.094164Z","title":null,"venue":null,"work_id":"adf6d239-9f68-46b9-a0f4-2def9f076985","year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.542291Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:24c3be516700fef5af9eaf2d26311247447c0aaefffee9ef8c5ecd95775b433d","observation_id":"4583d938-0a81-440b-aa6e-02f54282bb68","resolution":{"observed_at":"2026-08-06T18:03:04.097685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-08-08T00:43:47.244767Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00556","snapshot_observed_at":"2026-08-06T18:03:03.544777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.544777Z"},"links":{"cited_paper":"/paper/2412.00556","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:9d08d8038f4d7a2407c272583c187c5de65e4c9004a4f19d9871dec2342d2f4c","observation_id":"35ef04ae-baf7-481c-b4bf-7ee6ea162144","resolution":{"observed_at":"2026-08-06T18:03:03.544777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.116345Z","title":null,"venue":null,"work_id":"7e01f30f-cc2a-4bb0-897e-738217c3a0bd","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.527088Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:0fa4e8e5c72cfc1e063ed34326ab902deb2d1bf7efacd95079dc2bf48e159f2d","observation_id":"c5403498-287f-4bc9-8c20-0ef179aba5b5","resolution":{"observed_at":"2026-08-06T18:03:04.118907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T18:03:03.529576Z","title":"arXiv preprint arXiv:2406.12275 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.529576Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6419d336ac6e0bb04474059ba761f9a7c1de588599ab68c5a767264f49752025","observation_id":"84c13542-3f1b-49c4-b010-e4b1694cf24c","resolution":{"observed_at":"2026-08-06T18:03:03.529576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.108440Z","title":null,"venue":null,"work_id":"8d9419ee-f2b3-4b22-9fd9-f4e1d49852d5","year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.532227Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:efc8a24751b48d505c7c0c075241f4b7614df7241bc7a39f660ab492c9248bd4","observation_id":"3b558d08-a2d2-449c-80fc-1505b8cbf49d","resolution":{"observed_at":"2026-08-06T18:03:04.111097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-06T18:03:03.555597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.555597Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:e6bc44d553171c5b29cc8dec1ecce8c669df026769db2cdf60db214d1a08c481","observation_id":"b344fd13-b7d1-46a2-af72-80b526c10748","resolution":{"observed_at":"2026-08-06T18:03:03.555597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:03.537492Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.537492Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:c26b18ae28da31aa8c76607324e76db9fc35ee2e99b82c7d83d6e34de3e671fb","observation_id":"ebf472a7-2538-4504-9b01-4bad846c8f82","resolution":{"observed_at":"2026-08-06T18:03:03.537492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T18:03:03.539721Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.539721Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:888fdac735afa8e4a8733b196d11cd210565c307c5582ec986a3020b5ade5bc8","observation_id":"098af109-893c-4b64-a642-5475658e6011","resolution":{"observed_at":"2026-08-06T18:03:03.539721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:04.083316Z","title":null,"venue":null,"work_id":"eac57beb-7b59-4ddd-9caf-d672afc978f8","year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.563680Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:301a5067976000bfa8b3b90bf8bfe23bd24429c5ac41fdba32ca0abcda8059cd","observation_id":"688744cc-7d1a-49a3-a462-de351c6c7125","resolution":{"observed_at":"2026-08-06T18:03:04.088401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-06T18:03:03.547382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.547382Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bf8be8396afc8af346a4f59959c23a1cc38dcede1b52fbc3b1b5218a7b661621","observation_id":"bded14ac-604b-402d-8a64-1dfa3143d598","resolution":{"observed_at":"2026-08-06T18:03:03.547382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03456","last_updated":"2024-10-09T01:01:34Z","snapshot_observed_at":"2026-08-08T23:31:28.405233Z","submitted_at":"2024-10-04T14:14:28Z","title":"Dynamic Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03456","snapshot_observed_at":"2026-08-06T18:03:03.550076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.550076Z"},"links":{"cited_paper":"/paper/2410.03456","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:abc568afc030f14c76475e887daed50a79c577904b6e813d1632cf8c41d3e3f1","observation_id":"87499f39-b287-4cd0-b263-0a6eadf54e95","resolution":{"observed_at":"2026-08-06T18:03:03.550076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11808","last_updated":"2024-10-16T14:18:53Z","snapshot_observed_at":"2026-08-04T09:09:13.669644Z","submitted_at":"2024-03-18T14:05:52Z","title":"Dynamic Tuning Towards Parameter and Inference Efficiency for ViT Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11808","snapshot_observed_at":"2026-08-06T18:03:03.553163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.553163Z"},"links":{"cited_paper":"/paper/2403.11808","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:8dcb89055a9473f2b1b2425dd94658604f9e27cdc313967029b5d6ee49c8d3c2","observation_id":"6a42d758-339c-4ce3-842c-429e342f8015","resolution":{"observed_at":"2026-08-06T18:03:03.553163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-07T09:42:09.287521Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-06T18:03:03.558444Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.558444Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:5e0bf937c6311796bf970cebe6b938e1ddf593e2e725af6ad34611564ef44be2","observation_id":"5276eb9e-4006-4c13-852f-11657fbe3d35","resolution":{"observed_at":"2026-08-06T18:03:03.558444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:03:03.561057Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.561057Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:11421d044c200a52d025dc919140722da1068000ca7c6ca17be6824a39af0787","observation_id":"88aba4f5-63ef-40eb-bcbc-6f0cab7a4d4c","resolution":{"observed_at":"2026-08-06T18:03:03.561057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20105","last_updated":"2024-12-28T10:17:29Z","snapshot_observed_at":"2026-08-08T12:33:57.610458Z","submitted_at":"2024-12-28T10:17:29Z","title":"ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20105","snapshot_observed_at":"2026-08-06T18:03:03.566081Z","title":"arXiv preprint arXiv:2412.20105 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.566081Z"},"links":{"cited_paper":"/paper/2412.20105","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:ce38002c0372aaaeead1be7a4b167428c0445251b159d8c9b9a0e7673173ff8e","observation_id":"b6237571-f163-467e-89ff-16f506e8ad34","resolution":{"observed_at":"2026-08-06T18:03:03.566081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:59.680523Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence 44, 11 (2021), 7436–7456","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:59.680523Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:91ae29fb77f07b1a8c0c21f3943b000b630ffc803691828d63b05066e8b85ecb","observation_id":"ae7110bb-e2d5-42b2-8559-7285a281dae2","resolution":{"observed_at":"2026-08-06T18:02:59.680523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:01.029960Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.029960Z"},"links":{"citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6d8657b824c104d50c80ab5d031a3e27c47c38c4dc08f95164a1734a99e26af3","observation_id":"65fb1d5d-d32b-4f50-9781-e7455cb29b16","resolution":{"observed_at":"2026-08-06T18:03:01.029960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-06T18:03:03.297222Z","title":"arXiv preprint arXiv:2501.01428 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.297222Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:0e060d69780ce6506da56d704741768c332fa8ec337fb91cd93b23a06dcf8dcb","observation_id":"79870942-2f3b-4997-919b-9adaf1f622a7","resolution":{"observed_at":"2026-08-06T18:03:03.297222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2507.09334."}