{"as_of":"2026-08-17T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f0e7d385b6e69c1dad47832302943759fb1e6e6f241c1902099c035c46d4f9e","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:40:11.801366Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:50:44.000451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T23:50:44.314610Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"cited_work":{"arxiv_id":"2411.18042","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18042","snapshot_observed_at":"2026-08-15T23:50:44.314610Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","venue":"cs.CV","work_id":"61c5b646-5432-4e8d-923b-74b8ac091cbc","year":2024},"citing_paper":{"arxiv_id":"2505.03581","last_updated":"2025-05-06T14:41:42Z","snapshot_observed_at":"2026-08-17T21:08:32.071515Z","submitted_at":"2025-05-06T14:41:42Z","title":"DyGEnc: Encoding a Sequence of Textual Scene Graphs to Reason and Answer Questions in Dynamic Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:50:44.000451Z"},"links":{"cited_paper":"/paper/2411.18042","citing_paper":"/paper/2505.03581"},"observation_digest":"sha256:2fa6c60f201e033374a21c024cec7ad2ca9df6172554d2bd3dc81eead39fe5a6","observation_id":"1b858b1f-bfeb-47f1-b0bd-5e31f8284cb9","resolution":{"observed_at":"2026-08-15T23:50:44.318336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18042/citation-record","integrity":"/paper/2411.18042/integrity","json":"/paper/2411.18042/citation-record.json","paper":"/paper/2411.18042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.388492Z","title":"Hypergraph convolution and hypergraph attention","venue":null,"work_id":"1906623e-7a5a-4124-b093-a35b3e2c81d8","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.625565Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:935b1f5548601776a0739759516ae59323d2d07e5553b8c6614156926a8d0d31","observation_id":"47065bf6-c82b-4a38-83cb-0cb97e130433","resolution":{"observed_at":"2026-08-12T11:40:12.392037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.377632Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"e4cec180-e843-4e7f-bd36-3d99901b30a0","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.629550Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:dd2496a4483e226d41ad4838194346a750eeb774a2769aea7acbb1ffb088870d","observation_id":"3fffe994-affe-4e0b-b88f-7f3aeef8e442","resolution":{"observed_at":"2026-08-12T11:40:12.381702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.365623Z","title":"More knowledge, less bias: Unbiasing scene graph generation with explicit ontological adjustment","venue":null,"work_id":"688af6c1-b52c-497d-9ac9-7f38d2f11cdb","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.633239Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:b4a7438be7ee10ce0039122de76c55bfc60733ff73759f3ecf89deedeb6607ad","observation_id":"e57cda53-1446-4962-940d-9e02f05f2b2b","resolution":{"observed_at":"2026-08-12T11:40:12.369568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.354743Z","title":"Spatial-temporal transformer for dynamic scene graph generation","venue":null,"work_id":"3107ab42-df88-4f7c-883e-edc923929ee3","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.636717Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:07125b0f78e2df4e83d2a53cf2496f172000749fc6db02f0e466fbe3d08021f1","observation_id":"e2cc69d3-f843-4699-b747-efe145e9f620","resolution":{"observed_at":"2026-08-12T11:40:12.358675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.343884Z","title":"Ackermann, M","venue":null,"work_id":"d519abcd-d471-4b5c-9b41-b531e0ff39cf","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.640397Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a42d09d1e27591a1674cb8f04eaeb00a070e35a0b112516e07641142b5a22c75","observation_id":"2a51eb02-5c8e-44c1-822c-5f419c2817ab","resolution":{"observed_at":"2026-08-12T11:40:12.347723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.333047Z","title":"Reltr: Relation transformer for scene graph generation","venue":null,"work_id":"697bcde3-75ca-43db-a0c7-0320882608c5","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.643538Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:27afa1a38f790bd4a14b30cc7be8d42440d56bc71320fdb99998bd59609f1eca","observation_id":"3ce94ce0-09b0-488d-a642-7b18dc786a08","resolution":{"observed_at":"2026-08-12T11:40:12.336791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.322561Z","title":"Hierarchical memory learning for fine-grained scene graph generation","venue":null,"work_id":"0d6f1a80-81a1-4868-8998-beb01c9317d9","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.647193Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:52480af483a126d47295050848dd1d9db104765abb386ce122a62e93c205c181","observation_id":"eae8c831-eb9e-4575-be7d-726f47a1e5f8","resolution":{"observed_at":"2026-08-12T11:40:12.326254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.650339Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.650339Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:fdba820596136c862101490647e39418a15fed6e012b72fb02b0f26d3e699372","observation_id":"cb1589d1-b33d-4b17-a07c-1044dafb324e","resolution":{"observed_at":"2026-08-12T11:40:11.650339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.306007Z","title":"Scenegenie: Scene graph guided diffusion models for image synthesis","venue":null,"work_id":"bf803158-a543-4a7c-b4ce-c87b5c543d59","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.653625Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:39f652b5869f5e09e7d0d47a7c97c08520707fa2be5d188460013167abddaafb","observation_id":"624edd82-801d-4d26-9f0a-eebc06b1ba41","resolution":{"observed_at":"2026-08-12T11:40:12.309576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.656639Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.656639Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:687cdb7aa4e32dc35193d7c728dd9f0daf0e09db71de5386055003baa795a770","observation_id":"c02c7e11-a034-4c46-a231-70cf92943165","resolution":{"observed_at":"2026-08-12T11:40:11.656639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.289098Z","title":"Exploiting long-term de- pendencies for generating dynamic scene graphs","venue":null,"work_id":"2453bf8a-e2b7-4372-80ad-f3381fcd20f8","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.659791Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:44ef32c8874c89e71ffae721502a82916ba0fe2b27137eb07f0db326151506e4","observation_id":"a1d631bd-6223-43e4-b95d-70028c99abf9","resolution":{"observed_at":"2026-08-12T11:40:12.292900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.279161Z","title":"Hgnn+: General hypergraph neural networks","venue":null,"work_id":"7f1854dc-a70f-49d1-b378-622beedd8ace","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.662934Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:07f450b7ccb0826fde769f7fc5f07bfb25a03acc1628b2705a0c16cd60be44d2","observation_id":"e3c3b222-8cc9-4a68-b00a-4a108bac65f7","resolution":{"observed_at":"2026-08-12T11:40:12.282557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.269499Z","title":"Dsgg: Dense relation transformer for an end-to-end scene graph generation","venue":null,"work_id":"a0c6cfeb-0512-4b9c-80f6-defb7712df42","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.666336Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:1b4315b6f7c4fd949871fc0823c080cbfb432df4f3e9f52cc80a1b5de5e2c7e3","observation_id":"abb515da-5988-445a-9e06-a141f4cdf504","resolution":{"observed_at":"2026-08-12T11:40:12.273196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.259682Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"4579ea53-5f21-4226-bfae-50a58c8b922e","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.669390Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:90572d2345d034548dce706edd9ef8cfd707bb255b6fc7162dfbdb55e30a6978","observation_id":"3a282eb0-6309-40d6-b19c-0668cc00aebc","resolution":{"observed_at":"2026-08-12T11:40:12.263214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.250118Z","title":"To- wards open-vocabulary scene graph generation with prompt- based finetuning","venue":null,"work_id":"0ed17e13-dabf-4166-b0ee-816da88ca879","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.672533Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:4fc5eeb30050aa56559ad6b8d06d02ea33bc95aa917dcf2666f7045a347e9e5a","observation_id":"35f44b0c-252b-41e2-91aa-b900a58ab44e","resolution":{"observed_at":"2026-08-12T11:40:12.253635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.239783Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"e48c1465-f13f-4d59-a026-56d8f6299eee","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.675641Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:0c7cffbcef48272e1d9e020ac181a8935827cf05db67ebbc0322611c416f8fda","observation_id":"fce694f8-487c-4612-8ebe-41fdc8973608","resolution":{"observed_at":"2026-08-12T11:40:12.243528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.229647Z","title":"Egtr: Extracting graph from transformer for scene graph generation","venue":null,"work_id":"4902edb3-5dfb-4964-ad78-63fd665d77ec","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.678539Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:087be52f37731a3f4e201d17342e414f6f628fa759c2a6e62f7dfaedc6be53a5","observation_id":"dd832ab9-00e4-405c-89a0-d5c5ff3fa723","resolution":{"observed_at":"2026-08-12T11:40:12.233211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.219303Z","title":"Action genome: Actions as compositions of spatio- temporal scene graphs","venue":null,"work_id":"fefdf31c-9966-421a-b6ec-2506081256be","year":2020},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.681543Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:359052071ee377703a289d95c5654aae9a18b6738a79d59dfd6eaf1cb595fc4a","observation_id":"dbb05071-bc4c-4093-88b6-3401cf45f503","resolution":{"observed_at":"2026-08-12T11:40:12.223103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T11:40:11.684649Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.684649Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:e0f5c4fd4b53db55827f492adf900e02452914ab6d918a888eed454992a03d3e","observation_id":"1a81f79c-35ab-4c20-9abe-4c77757cc8fe","resolution":{"observed_at":"2026-08-12T11:40:11.684649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.208613Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"0527ac90-a9c3-4fea-bbfb-f8db1f64b73c","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.687984Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a6b8794d26e6909932361a3d627840753802f50cd8393cff33ed6fa808ce13af","observation_id":"69bff302-d15e-4f3a-a07b-8902f6468fe0","resolution":{"observed_at":"2026-08-12T11:40:12.212339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.198252Z","title":"Fast contextual scene graph generation with unbiased context aug- mentation","venue":null,"work_id":"a8acd595-7035-41ef-b51e-c8f64d734236","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.691172Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:f5b94459794488f93ac797c5d887e0f228ea68548574cf25aadd9ef4a7b205e3","observation_id":"af617414-a1fa-4627-9ede-42e9f586d84f","resolution":{"observed_at":"2026-08-12T11:40:12.201942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.186738Z","title":"Hypergraph attention networks for multimodal learning","venue":null,"work_id":"64ed6d37-71f0-443d-9e09-1a062607a007","year":2020},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.694326Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:ed1eac74a296fe427e2fa72e7ddcf71a6c0270905bf5d5f038ba09fd4fbd8320","observation_id":"e0a53f0f-6f68-4fdb-9fce-b20b3af2ddce","resolution":{"observed_at":"2026-08-12T11:40:12.191231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.175630Z","title":"Llm4sgg: Large language models for weakly supervised scene graph generation","venue":null,"work_id":"9b9afd04-d3ca-4b21-be37-a63f89476854","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.697499Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:2d22d181508575170b59a38f137570b6fb1e6492af52da1b2f32bef52fa69ea9","observation_id":"be49426a-84ad-495c-b1e9-a4722b4eaf12","resolution":{"observed_at":"2026-08-12T11:40:12.179420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.164208Z","title":"Meltr: Meta loss transformer for learning to fine-tune video foundation models","venue":null,"work_id":"561e8d57-b779-46f2-a7c9-d5b902c69c70","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.700453Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:8f55874ecf0d39356f7bf6803b68a2f901f36941f656fccdab0274624004b18e","observation_id":"ed214bf8-3954-4a29-8a1d-78e67a529f69","resolution":{"observed_at":"2026-08-12T11:40:12.167980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.152940Z","title":"Is-ggt: Iter- ative scene graph generation with generative transformers","venue":null,"work_id":"d8ebc2be-2e67-4afd-bc0b-6d22aaeb71be","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.703973Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:53eb362b777f3e7a61316f7b150dfefc1e6923f1fb09cc7724bf8a801b07dd1f","observation_id":"122f1242-8c7f-46a9-b262-f5d27a22d05a","resolution":{"observed_at":"2026-08-12T11:40:12.156650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.141876Z","title":"Sgtr: End-to- end scene graph generation with transformer","venue":null,"work_id":"5a13bcb9-db69-4e34-b330-3923e3676891","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.706987Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:6a54d58681dfd889940e7ab44712645d350b406f92a91f058e4f2c33060e36d0","observation_id":"14d346c6-e123-4ec5-a6ad-dccb7e176c8e","resolution":{"observed_at":"2026-08-12T11:40:12.145820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.130023Z","title":"From pixels to graphs: Open-vocabulary scene graph generation with vision-language models","venue":null,"work_id":"87069da0-3024-4f00-9a00-4f80dab9b5d6","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.709978Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:02727489b694a148fb222246dc45d0abcb3c9f4c8ce2086ed1058041f9d89cc8","observation_id":"678fdedf-9106-4dcc-bb01-31ad0f8c83ad","resolution":{"observed_at":"2026-08-12T11:40:12.134126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.117551Z","title":"Multi-hyperedge hypergraph for group activity recog- nition","venue":null,"work_id":"59e97aa5-99df-4b98-95a0-1f92cec51953","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.713154Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:7ba5affa0e90161bdb59a391f69f693f7044fbafc3fa9f64241778df0a32eba2","observation_id":"c653be38-eeb2-413e-9ae3-b5fc4bf7e91f","resolution":{"observed_at":"2026-08-12T11:40:12.121622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.716455Z","title":"Llama-vid: An im- age is worth 2 tokens in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.716455Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a839e9bf3b975e5cddadb771a5e61de8a100b0c170a211b5ac7269a4b415ee2f","observation_id":"3dd7730f-4d50-4014-b593-ade9d5efe097","resolution":{"observed_at":"2026-08-12T11:40:11.716455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T11:40:11.719560Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.719560Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:04418bdefe4bc52deb2b4be82b18fa2cd286cc8604290803ecaf118cce73aab0","observation_id":"e9a5e21d-2e42-4b47-b768-946cb4341916","resolution":{"observed_at":"2026-08-12T11:40:11.719560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.723112Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.723112Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:ffbf5efa870f56550fc3aa5b2ea65134971a18c78187051a735db7b69a56a4d7","observation_id":"c6ffef97-4752-4e00-aeba-5952917530bc","resolution":{"observed_at":"2026-08-12T11:40:11.723112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.093039Z","title":"Video-ChatGPT: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"08795676-c9be-405f-b0ac-378b16faf28b","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.726132Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a2a69e7768a640fcebed95a8b5b6ae967c787151cf58c2f041ab1f1cb5766108","observation_id":"88ef27fa-b2d3-4130-b70a-3b1999f51b22","resolution":{"observed_at":"2026-08-12T11:40:12.096830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.729141Z","title":"Unbiased scene graph generation in videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.729141Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:d6169b3a37e022f83e0b73c08a68a8768d8a1afcd783e45aa99292e41e762ac1","observation_id":"c2b6801f-8bbe-4f0c-b60e-832c028e9862","resolution":{"observed_at":"2026-08-12T11:40:11.729141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.075209Z","title":"Hig: Hier- archical interlacement graph approach to scene graph genera- tion in video understanding","venue":null,"work_id":"3e77478c-abfd-4bd7-bc10-4092001842b6","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.732293Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:23aafad7a37092a6cda3d18470dcfefa741e01ecca7d36b7e6bc1f2ccdf9a519","observation_id":"e71a3228-b3b2-4a8a-aa8b-b1d050f1bdf9","resolution":{"observed_at":"2026-08-12T11:40:12.079157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.064822Z","title":"CYCLO: Cyclic graph transformer approach to multi-object relationship modeling in aerial videos","venue":null,"work_id":"cbf7eaa7-dde2-41a5-9254-aed81628a4eb","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.735700Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:7054157aa6d7b5ab39501070c701381693ae2db40877d3acbee9b5b19b784136","observation_id":"6dc50a18-e6fe-471f-bd90-5d1782f195ab","resolution":{"observed_at":"2026-08-12T11:40:12.068554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.054476Z","title":"Towards scene graph anticipation","venue":null,"work_id":"67c0fc1e-2a92-48f5-877b-35298848a0da","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.738760Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:3afcbeea73bc4378489b54d3d4495f868abac6c77af1ea95bd7cc0e5bd1212f7","observation_id":"632c9d99-f2d7-4fd6-826e-b8b36c51dcb5","resolution":{"observed_at":"2026-08-12T11:40:12.058213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.742043Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.742043Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:c93a7e66d866db2a389858d7e280fa20e4b623bfdaaa3451e8f6496d67bc3539","observation_id":"e6aa5901-1745-4fa5-adce-ec8adc53a763","resolution":{"observed_at":"2026-08-12T11:40:11.742043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.037598Z","title":"End-to-end generative pretraining for mul- timodal video captioning","venue":null,"work_id":"ce2ab344-d097-4ec4-8820-674894f825d1","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.745174Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:4cb4d0b6d25bb6a4ff2e34141c55539a7a3232a8adc203607d9d5c1bc74dc3f3","observation_id":"a4b17a51-1bd6-499c-aa56-5f99904911c1","resolution":{"observed_at":"2026-08-12T11:40:12.041092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.027178Z","title":"Video visual relation detection via iterative inference","venue":null,"work_id":"9a8c9470-8925-4bdc-8e7d-0b37ecbee8a9","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.748488Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:1d7a6ef1fb755586f7a45cc9ebd044555d0e61ed0477ea3a0ecd3204700f0c89","observation_id":"04acd1ce-0c51-4757-b1f8-f9aedbac0671","resolution":{"observed_at":"2026-08-12T11:40:12.031049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.017268Z","title":"Accurate and fast compressed video captioning","venue":null,"work_id":"6afd9e81-b889-46a2-9a01-aaa0ad4ac2b9","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.751749Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:0d6c695e6ac5ef7cf94dfa315a48dbe5e9a7168bb345cc70179ac9ac8b852669","observation_id":"9d8f892a-9069-4d49-8684-7cbfe8e12d83","resolution":{"observed_at":"2026-08-12T11:40:12.020659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:12.007000Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"c881e399-15f9-4ef8-a82a-8f52414cdd42","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.755047Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:5cfddb60b751cf9009796a7211ecaaeebaddf45e21c4bf1b5d7c1fb5df131cee","observation_id":"d58efe02-a84b-40a5-b2f8-2be33f1eb6e5","resolution":{"observed_at":"2026-08-12T11:40:12.010721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.996722Z","title":"Target adaptive context aggregation for video scene graph generation","venue":null,"work_id":"a52563aa-e0e7-41dc-853b-7269ed96c940","year":2021},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.758254Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:356560e89007e89352bae132d900edb75cd0d833601995933ba9f058473701e2","observation_id":"46e1f0bf-d5b5-464a-90e9-448b0d6fa014","resolution":{"observed_at":"2026-08-12T11:40:12.000180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.985220Z","title":"Graph (graph): A nested graph-based framework for early accident anticipation","venue":null,"work_id":"cb7e4ceb-da28-4fb5-800c-8825c4fe2ac5","year":null},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.761527Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:bd038631b7409b5572299e9a26feb457dd3ea628077049a6fda27aa93c5bd469","observation_id":"f155b570-1bb0-4e87-87c8-fc5eac1d0210","resolution":{"observed_at":"2026-08-12T11:40:11.989815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.974857Z","title":"Learn- ing situation hyper-graphs for video question answering","venue":null,"work_id":"236376d8-ed44-4f1b-92e4-aaf23eb13cef","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.764843Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:674824811da89d436d818c0bb4f938a9078fa8a2c32b1656e4320161a1cc89f3","observation_id":"c263d043-ef2f-4707-9e70-cc2bf9417461","resolution":{"observed_at":"2026-08-12T11:40:11.978542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.964398Z","title":"Memory-and-anticipation transformer for online action understanding","venue":null,"work_id":"03af728f-56f9-439c-a213-8bbe914ea0c8","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.768319Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:cc1fd2330ba72ab932ff5568ff000601774f0b4999951b7886c3e42ce4945a17","observation_id":"7d11a638-a48c-4f40-87c3-ffe7d109c8cd","resolution":{"observed_at":"2026-08-12T11:40:11.967979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.954099Z","title":"Multi-object event graph repre- sentation learning for video question answering","venue":null,"work_id":"c43ce409-b862-408f-af79-16569f85e7d8","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.771576Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:9db934bfba7883b8a852be0c5f60db2a2b7b8f5f8580d496cf04b9f56d5dfd25","observation_id":"00d9865b-6361-4fb8-a353-973ec02d85f1","resolution":{"observed_at":"2026-08-12T11:40:11.957733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.943932Z","title":"Sportshhi: A dataset for human-human interaction detection in sports videos","venue":null,"work_id":"b9e32162-dd73-4dbf-80e8-3c44bc8ae738","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.774727Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:8461daf530799459834be65929ed8c89e59dfa8216a2d417c1b738d71e01ec0b","observation_id":"57976c3d-6af9-4e07-a3a9-d08a700d8591","resolution":{"observed_at":"2026-08-12T11:40:11.947740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.933219Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"c693ddf4-9daa-4a12-9451-27f54e450024","year":2017},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.777987Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:a4545d9f47a301eb11fb6e2f65862c9c2f3e00cfc65fe6ea1018ddb467bca83f","observation_id":"c78aff94-a7f9-433b-bc76-f0b170dc9cf1","resolution":{"observed_at":"2026-08-12T11:40:11.937103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.922279Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"febc5545-ac55-4a9f-9a5f-8dfaebc51c6f","year":2016},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.781122Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:af1cb0827c4d31e095703b3c24a69b4c255676292e74c2e0356a1e081e3fb3bb","observation_id":"7df030ff-5c41-4ee2-853d-b5466221abbc","resolution":{"observed_at":"2026-08-12T11:40:11.925868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06530","last_updated":"2022-05-13T09:28:13Z","snapshot_observed_at":"2026-08-16T17:00:34.820780Z","submitted_at":"2022-05-13T09:28:13Z","title":"Modeling Semantic Composition with Syntactic Hypergraph for Video Question Answering","version":1},"cited_work":{"arxiv_id":"2205.06530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.06530","snapshot_observed_at":"2026-08-12T11:40:11.847386Z","title":"Modeling Semantic Composition with Syntactic Hypergraph for Video Question Answering","venue":"cs.CV","work_id":"c2947f76-debb-417f-92b2-870b350de4e8","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.784273Z"},"links":{"cited_paper":"/paper/2205.06530","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:3546eda71719a60335417b75b26c3701344cfcf3e3cfecaef3e9d723966502fb","observation_id":"dd1b7835-bca9-40df-affc-aefa92f06ec2","resolution":{"observed_at":"2026-08-12T11:40:11.851397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.911377Z","title":"Panoptic scene graph gen- eration","venue":null,"work_id":"f2c22d01-1357-42ee-a25a-cdbf2226e7dc","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.787854Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:2193f20c44a913d2fe19514a61c2460c634a9ee8b40bb0ad8a730984c85da8db","observation_id":"94a755fd-e3eb-4251-a8da-e815d2573e0b","resolution":{"observed_at":"2026-08-12T11:40:11.915015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.900977Z","title":"Panoptic video scene graph generation","venue":null,"work_id":"fba0ca2f-83fe-4ef5-9266-b00fc3a00fdd","year":2023},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.791005Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:212a037eeec41ea72b9e3c88c4cecd1c7ac6450099c2e890f3ff036a99d4f1c3","observation_id":"f8d8afc5-4a8d-44ef-bfa8-e264f5a645e9","resolution":{"observed_at":"2026-08-12T11:40:11.904504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.890217Z","title":"Com- monscenes: Generating commonsense 3d indoor scenes with scene graphs","venue":null,"work_id":"afa2b506-c78f-41eb-87ed-053da291b881","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.794627Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:f59104b8cc8d0fcc485daadc958c965d85e6a0435cc614f28468761a2ae31d62","observation_id":"d433d7f4-a8b1-45cd-ba43-38688d6b0d7e","resolution":{"observed_at":"2026-08-12T11:40:11.894101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12547","last_updated":"2022-08-26T10:00:11Z","snapshot_observed_at":"2026-08-16T16:36:42.470562Z","submitted_at":"2022-08-26T10:00:11Z","title":"Deep Hypergraph Structure Learning","version":1},"cited_work":{"arxiv_id":"2208.12547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.12547","snapshot_observed_at":"2026-08-12T11:40:11.831246Z","title":"Deep Hypergraph Structure Learning","venue":"cs.LG","work_id":"5280597b-d835-4054-ad61-3cf3371d74f5","year":2022},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.797897Z"},"links":{"cited_paper":"/paper/2208.12547","citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:310db0e8f2befbc7198e0584a5e57d10e2e571d5f85e5229f40047091a25b0e3","observation_id":"0296fca6-0715-471a-82e8-c6feebf07dc0","resolution":{"observed_at":"2026-08-12T11:40:11.836662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:40:11.879214Z","title":"Dynamical attention hypergraph convolutional network for group activity recognition","venue":null,"work_id":"aff4be1e-2eee-4d99-83e7-5e9d67991f7a","year":2024},"citing_paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:40:11.801366Z"},"links":{"citing_paper":"/paper/2411.18042"},"observation_digest":"sha256:fce13d6a932ed8b7da7470e1397132a56d9f05220b214de79c4b495e0b5cf6d7","observation_id":"90307944-824b-4c20-ab2b-c6dfddcb7f3e","resolution":{"observed_at":"2026-08-12T11:40:11.883196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18042","last_updated":"2025-03-31T08:16:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T07:06:08.115739Z","submitted_at":"2024-11-27T04:24:39Z","title":"HyperGLM: HyperGraph for Video Scene Graph Generation and Anticipation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2411.18042."}