{"as_of":"2026-08-09T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:843ff2fc0ff27e6ad464cb9028c7ac4dabe994966d838d11848399e78a3f484b","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:43:50.327893Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:34:31.365887Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:41:04.755362Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"cited_work":{"arxiv_id":"2507.04815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04815","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From vision to language through graph of events in space and time: An explainable self-supervised approach","venue":null,"work_id":"d971d6dd-5159-44a1-a696-ff442f57d4ec","year":2025},"citing_paper":{"arxiv_id":"2604.10383","last_updated":"2026-07-29T23:04:35Z","snapshot_observed_at":"2026-08-02T23:16:52.425747Z","submitted_at":"2026-04-11T23:51:13Z","title":"Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:22:45.975771Z"},"links":{"cited_paper":"/paper/2507.04815","citing_paper":"/paper/2604.10383"},"observation_digest":"sha256:cb225d14eeb775fce0c8b0af11963107961f1613d540d4da600798304ead8af7","observation_id":"b5430fa6-5b4d-4d42-b6d0-9958aeec0546","resolution":{"observed_at":"2026-05-11T10:41:04.758870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04815","snapshot_observed_at":"2026-07-15T11:37:24.415703Z","title":"From vision to language through graph of events in space and time: An explainable self-supervised approach.arXiv preprint arXiv:2507.04815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10383","last_updated":"2026-07-29T23:04:35Z","snapshot_observed_at":"2026-08-02T23:16:52.425747Z","submitted_at":"2026-04-11T23:51:13Z","title":"Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T11:37:24.415703Z"},"links":{"cited_paper":"/paper/2507.04815","citing_paper":"/paper/2604.10383"},"observation_digest":"sha256:eea8632729465d9cbfdb65a5581b1323812e0eb138c3ffd0b12ae736157b1c0b","observation_id":"766e827c-eb50-4422-a0f6-06048c9576a7","resolution":{"observed_at":"2026-07-15T11:37:24.415703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04815","snapshot_observed_at":"2026-08-02T16:34:31.365887Z","title":"From vision to language through graph of events in space and time: An explainable self-supervised approach.arXiv preprint arXiv:2507.04815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10383","last_updated":"2026-07-29T23:04:35Z","snapshot_observed_at":"2026-08-02T23:16:52.425747Z","submitted_at":"2026-04-11T23:51:13Z","title":"Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T16:34:31.365887Z"},"links":{"cited_paper":"/paper/2507.04815","citing_paper":"/paper/2604.10383"},"observation_digest":"sha256:f1970317b13dccee4c27518d3a0d66c2b39898b2ab12b20a914bc486d2f0e588","observation_id":"d7ae7c42-b211-49bb-9966-a861f7052d92","resolution":{"observed_at":"2026-08-02T16:34:31.365887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04815/citation-record","integrity":"/paper/2507.04815/integrity","json":"/paper/2507.04815/citation-record.json","paper":"/paper/2507.04815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.161814Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"c71134dc-23aa-4da7-bf0f-90ebfa15c8b4","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.627049Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:190ac545e2f1c20ce3c40f6941e513ff8b254c49bef3dfec30ea5f1ca96983f2","observation_id":"1fa9a75a-99e6-4fb1-89ca-f6e67a28bce8","resolution":{"observed_at":"2026-08-06T19:44:04.263890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.885015Z","title":"In: Proceedings of the 26th ACM International Conference on Multimedia, pp","venue":null,"work_id":"89b61ad5-8f9c-4ae0-8242-6063f4ebaf95","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.701404Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:baaaf9c77eb0e9fec098cb5b67d1f3958c2112378e385d26c2b8ee02087adff1","observation_id":"8539a0fb-eb46-4179-a388-390e3c395d95","resolution":{"observed_at":"2026-08-06T19:44:04.044736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.749784Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"5f824aab-a69a-4a9f-a91d-2a2bad376ce7","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.790967Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:c5c1a15d083a22327013067f8d2ad8042ad9fcac9854621131291e7e16d01465","observation_id":"b23457b4-9d9f-4577-8006-b5b97c9e2758","resolution":{"observed_at":"2026-08-06T19:44:03.840793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04632","last_updated":"2021-08-18T21:55:27Z","snapshot_observed_at":"2026-08-01T20:01:49.108442Z","submitted_at":"2021-06-08T18:34:21Z","title":"VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04632","snapshot_observed_at":"2026-08-06T19:43:42.892853Z","title":"arXiv preprint 22 Fig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.892853Z"},"links":{"cited_paper":"/paper/2106.04632","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:04351d421d2742762f3ba1ecd09dd9ddbe775882ae5eb83d7de391f1d1d1c1fc","observation_id":"b7cd5ae3-72ce-4467-8188-336581dd4010","resolution":{"observed_at":"2026-08-06T19:43:42.892853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.453747Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"2cabd733-55e4-45aa-b7b2-706eaecc0635","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:42.984997Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:3c3dd1d100bb69a187e5d02936b65f6e8eec1de4efa241a023bf8cbd2c09e414","observation_id":"e74ebffd-a7d6-4bb9-bcaa-a1805ab60085","resolution":{"observed_at":"2026-08-06T19:44:03.616138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-06T19:43:43.140301Z","title":"arXiv preprint arXiv:2304.08345 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.140301Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:e917a545409e6abf09e8dd61fb8e5e53f6bb0d47e7c0972be9b905b2a696ba97","observation_id":"df335657-6a11-42a5-8171-dcba49c06131","resolution":{"observed_at":"2026-08-06T19:43:43.140301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.208165Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion, pp","venue":null,"work_id":"15ef4b87-ff19-4404-8f22-ae5ab307e52e","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.223699Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:20cf5069612a109364c28e5ab3dec699a6ffb07bfec1b65a5c5a9fc2a297157b","observation_id":"493b607d-e524-4d06-bf7a-67919f8f7577","resolution":{"observed_at":"2026-08-06T19:44:03.328701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06718","last_updated":"2023-07-11T18:13:14Z","snapshot_observed_at":"2026-08-05T05:31:21.900215Z","submitted_at":"2023-04-13T17:59:40Z","title":"Segment Everything Everywhere All at Once","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06718","snapshot_observed_at":"2026-08-06T19:43:43.308601Z","title":"arXiv preprint arXiv:2304.06718 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.308601Z"},"links":{"cited_paper":"/paper/2304.06718","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:6efc63b395b4be77a027d74567580d416c255a7e05648ce746ff180f410c08bd","observation_id":"2c663d35-f275-4fdf-89a6-cb6c53056acc","resolution":{"observed_at":"2026-08-06T19:43:43.308601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.936103Z","title":null,"venue":null,"work_id":"573ac345-28e9-48a2-a602-0f943030759b","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.415020Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:70d3af719dd96dd537a30abbafec7d90c720b95ad78c4b9682835854b526038c","observation_id":"ef4de4d1-c6d0-4a90-bffe-e5e71a98e5cd","resolution":{"observed_at":"2026-08-06T19:44:03.046763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.577042Z","title":"Advances in neural information processing systems 35, 10078–10093 (2022)","venue":null,"work_id":"f777c149-11c9-4447-9112-89dd6c4f697b","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.539742Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:dcfbc49b453c86bcd130da92ad567f500b527f5144d5b10170f5dc1bd327f306","observation_id":"574f771d-55f9-4995-a47f-2836a7ca541c","resolution":{"observed_at":"2026-08-06T19:44:02.750499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.294539Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"91e759e1-77e7-4357-a6f8-7377dc4acdc4","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.654720Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a3a3f921d03da62ef3e60c8168ade7919156ca414b771c7fa819023a0f0582d4","observation_id":"b0c30342-5a7e-4f0d-a193-009229a85309","resolution":{"observed_at":"2026-08-06T19:44:02.441353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.041690Z","title":"Advances in neural information processing systems 33, 1877–1901 (2020)","venue":null,"work_id":"6c711711-7272-4516-af76-7bbfa50fbc0c","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.781771Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8e837e2e84e1157f7035c6e25b5ccbd28996db8a752be50c4fa62f623ee91c9f","observation_id":"08782b0a-2ec1-44b0-b100-ad058d72a77e","resolution":{"observed_at":"2026-08-06T19:44:02.115109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.791319Z","title":": Learn- ing transferable visual models from natural language supervision","venue":null,"work_id":"ce4159bd-c6f4-4bf7-8652-7b5a586a2a5d","year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.886348Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8b66b69524bff5d77bdee5fb8e6c3c0904c42ad1c9c1f361f4a76d8e210eb479","observation_id":"d226b2fe-2e4f-482e-8cf0-10b83c622053","resolution":{"observed_at":"2026-08-06T19:44:01.871538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.574232Z","title":"In: International Conference on Machine Learning, pp","venue":null,"work_id":"7de55c84-d219-45e7-a628-6b5d96da1044","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:43.991707Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:3c8cf72172662b85057de9499e550b1bee0b9b6288d8b53bda44ede02c68ea4a","observation_id":"f238a35d-d400-42a5-bd41-6ded51bfa965","resolution":{"observed_at":"2026-08-06T19:44:01.685561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.243587Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"803cb3c5-d3a0-4c4e-b22e-16fa0f800df8","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.118903Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:bc283b81f5b649c69225c2c71b88c8eafabbd90e1d5ff76f8aa93ce1f71d8013","observation_id":"005f5ca8-ddea-43ad-8883-f2e102977320","resolution":{"observed_at":"2026-08-06T19:44:01.398110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.893284Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"0a237a88-6237-4d98-9a65-20d14b783066","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.219721Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:06bf571dfb1602db4722b84d2841f91eacaddc34a8bb4db993b14e7962878a0a","observation_id":"952851fa-6487-44db-80cf-b65712cc81f7","resolution":{"observed_at":"2026-08-06T19:44:01.027770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.603833Z","title":"In: Pro- ceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"65cd4ca2-b515-4af8-9ed6-dee092ffd91d","year":2015},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.308470Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:4e64a392a4ace0061db06eb109440d566d0a3dca373f48631d58b1f3a5be407c","observation_id":"c748b63e-bff3-4dd2-a5cd-56b52d5151aa","resolution":{"observed_at":"2026-08-06T19:44:00.719692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:44.376396Z","title":"In: Proceedings of the IEEE Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.376396Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:07835c8305c12e5ae417e7210fcb10dcb1f6c5be6b8bb66974e5800aec2800cd","observation_id":"164779cc-e234-4f09-9550-337908abaf66","resolution":{"observed_at":"2026-08-06T19:43:44.376396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.287815Z","title":"6546–6555 (2018)","venue":null,"work_id":"8c1960f9-2324-4d27-af4e-050c80de1749","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.491943Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a4952b7e213fd744225e5454840e27f63c99f0b0b60ca58cf0e31f10a101f357","observation_id":"053cb222-c0de-4d56-9cd8-9417ced78883","resolution":{"observed_at":"2026-08-06T19:44:00.407694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.019670Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"ceb26752-59ee-46de-9f78-797689846a7f","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.591735Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:564393ae714ecf3a324389a5a9a6ae8eebbbcc40d90b8f085d3a5105aee2196c","observation_id":"0c867289-ccf4-4ee2-a2c4-8d486c2c5d8f","resolution":{"observed_at":"2026-08-06T19:44:00.105912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T19:43:44.660951Z","title":"arXiv preprint arXiv:2303.15389 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.660951Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8eefff7f2ee2ac0c73b665a31a2cd14b46b0d353373058a6c055db47e810e34e","observation_id":"f7ed1e8e-5e92-42c4-b6e7-10cbdaaa4533","resolution":{"observed_at":"2026-08-06T19:43:44.660951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:43:44.740246Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.740246Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:86eb1931060448240de17a4be5c86b46b9468d628ecca6aa6c517e7b3a95af70","observation_id":"f64877b2-09dc-4b53-9bec-ebb8c02fdbec","resolution":{"observed_at":"2026-08-06T19:43:44.740246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.812085Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"f8091bc3-5b50-470b-b5e5-81787dc15b5c","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.844929Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:4b6841907f49f8d8ada84a3fbd07d9ad05bd28db3d8621224dcad39385916de3","observation_id":"b0e312d6-e3a9-4a65-8f6a-fda4861fe027","resolution":{"observed_at":"2026-08-06T19:43:59.930135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.597611Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d00e3bac-afd3-4c5b-a66a-00fd07ecbdcc","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:44.964614Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:c4772c5b1023d55330b4c8de8fabed098a2ce1f0332aedbd54047ac2f1b48d75","observation_id":"69b51ce8-0fba-48c1-b7e2-392403a6cc75","resolution":{"observed_at":"2026-08-06T19:43:59.665358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09085","last_updated":"2023-06-15T12:29:42Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:29:42Z","title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","version":1},"cited_work":{"arxiv_id":"2306.09085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09085","snapshot_observed_at":"2026-08-06T19:43:51.422269Z","title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","venue":"cs.CV","work_id":"cbc9a29e-b7de-4170-b9dd-1304ca1434de","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.039106Z"},"links":{"cited_paper":"/paper/2306.09085","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:7a5a789cdccbd97278871191d271e4272fe071762adaffddc6f1065b7fd964ff","observation_id":"91c3c52e-0afb-462d-b91c-37c160df3cce","resolution":{"observed_at":"2026-08-06T19:43:51.566919Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.325244Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"14403ea5-2391-4293-b4ea-6528bdc47950","year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.134139Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:13e1fb4eeb232eafa237f3b0f9be149a4cd7a81f8bc03dba569c7d02feb14564","observation_id":"cd1561ca-9ce1-4676-a48d-f4b8b57e7fec","resolution":{"observed_at":"2026-08-06T19:43:59.503727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.059577Z","title":"Advances in Neural Information Processing Systems 35, 23716–23736 (2022)","venue":null,"work_id":"e6f6077c-bf7e-4c20-9e91-2faf8b094eeb","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.230070Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:0e0359de875424422e7b1ae5fe0d2dd246c67924f3dfaff0edd77be88dcd9a43","observation_id":"09e175c9-88f6-4d3e-9a56-dbed310dda35","resolution":{"observed_at":"2026-08-06T19:43:59.133441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T19:43:45.349914Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.349914Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8e128f28523d573f6e09528cc09ccd86515dbc04cad8f215d40641dd4ae4d629","observation_id":"8c065b3a-771b-4689-aae5-c083f0391f89","resolution":{"observed_at":"2026-08-06T19:43:45.349914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T19:43:45.479599Z","title":"arXiv preprint arXiv:2205.01917 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.479599Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:cefbf139c6ff80180ca2a69bca0d3d63be386162c85a838b2b0361d66df276d4","observation_id":"326f65b8-3d4c-4206-8655-5f52984e7b99","resolution":{"observed_at":"2026-08-06T19:43:45.479599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.840350Z","title":"Advances in Neural Information Processing Systems 36, 72842– 72866 (2023)","venue":null,"work_id":"ed1b4791-4852-4a70-8df5-016a2247edff","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.591082Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:fc15de017ac69109419c10146d86d2e8a97cb7381b3be8f845d335c1bcbe854d","observation_id":"39b66d8a-2c88-4719-91e9-b93c82b74da2","resolution":{"observed_at":"2026-08-06T19:43:58.965686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.634818Z","title":null,"venue":null,"work_id":"8d74cf24-a0d0-4ddd-8ad3-eb049f6551c6","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.694879Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8004080ccbe478d81c450d99497e0ce87e011709150b5672d434d9658fea7348","observation_id":"79e90ac1-c58c-4383-b0a6-d7f39d536a1a","resolution":{"observed_at":"2026-08-06T19:43:58.736133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-06T19:43:45.831936Z","title":"arXiv preprint arXiv:2205.14100 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.831936Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:731ff7887cfe8d73b9555b0abc763dac5e415e48afff83b91766415cbc34831e","observation_id":"79df5818-bf96-48a1-85c8-a80f3d5bff61","resolution":{"observed_at":"2026-08-06T19:43:45.831936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00402","last_updated":"2023-02-01T12:40:03Z","snapshot_observed_at":"2026-07-06T14:47:00.945435Z","submitted_at":"2023-02-01T12:40:03Z","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00402","snapshot_observed_at":"2026-08-06T19:43:45.905581Z","title":"ArXiv abs/2302.00402 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.905581Z"},"links":{"cited_paper":"/paper/2302.00402","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:31b8589223dd5f3590f0abf0b0e0f89b2cd7e1130c1d03fb8f1475b72b3b6386","observation_id":"6bcc3a59-7798-482f-bb50-55d9122a0480","resolution":{"observed_at":"2026-08-06T19:43:45.905581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.436190Z","title":": Language models with image descriptors are strong few-shot video- language learners","venue":null,"work_id":"2f4f4803-fe83-4fc7-86c9-95454a2c3200","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.005251Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:841f251ea4727e3a61096fb81b1f202d2f25ac76d2c8c6c4ca0bc563f5edfab7","observation_id":"7fbf2189-8f93-429f-b8c3-87d30b617c87","resolution":{"observed_at":"2026-08-06T19:43:58.519486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.196751Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence, vol","venue":null,"work_id":"a9886332-3a44-433f-a8a1-56983a553a21","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.139693Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:6164dab82fb5cc07bb4ffd404335c4ffb071cd08e368dc8b8005a8a9d58ccf97","observation_id":"cdff4814-320a-4128-a79e-bf808c85e6c9","resolution":{"observed_at":"2026-08-06T19:43:58.297557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.910708Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion, pp","venue":null,"work_id":"fbbfd18b-2ded-488a-9513-a9e771bcb8a8","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.216585Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:2a248890dc31a734de91d932ffbdf57592ab1af6987edaa92337e460f814caa6","observation_id":"326ceda1-04fa-44f1-b724-1db351891881","resolution":{"observed_at":"2026-08-06T19:43:58.008523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.638035Z","title":"Journal of Visual Communication and Image Representation 58, 477–485 (2019)","venue":null,"work_id":"ed22c612-5ced-4ddc-a935-037377fac643","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.344634Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:d9ccf499d521597e93f5c7aa1f179f29e6e675abe3971640c4f192a2ad340b46","observation_id":"973ddbdf-480c-4777-b3f6-7aeeb9445d8e","resolution":{"observed_at":"2026-08-06T19:43:57.768655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.320578Z","title":"In: Proceed- ings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"00f56dc9-64ba-4d9b-a5e4-b80538fd8e07","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.457612Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:52b101500545440587d19365a9d3304df14476b0ed06cf356900fd16d5a8ecd4","observation_id":"63f28794-3516-4510-82c5-7364a9b62adf","resolution":{"observed_at":"2026-08-06T19:43:57.456857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.123810Z","title":"Advances in Neural Information Processing Systems 32 (2019)","venue":null,"work_id":"bc44b917-e2bb-4f75-b7fd-4bde774e4c65","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.552856Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:d8927aa31106a92c7bda1e920309650189515e55259b293bdc11a2d1211f7ebb","observation_id":"10cc3374-4b02-41e4-bcd1-86042729c6b4","resolution":{"observed_at":"2026-08-06T19:43:57.175403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.993136Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d0e494a9-5959-4aaf-a64c-ac2440618658","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.641843Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:92f380085d1bfc81070b314fa60d0cfa3125ed3596b88f89c702951351f606d7","observation_id":"b2dc91a8-777a-4f95-82ea-055c0ccbad2d","resolution":{"observed_at":"2026-08-06T19:43:57.063970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05715","last_updated":"2019-02-15T07:59:11Z","snapshot_observed_at":"2026-07-06T07:33:17.307254Z","submitted_at":"2019-02-15T07:59:11Z","title":"Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention","version":1},"cited_work":{"arxiv_id":"1902.05715","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.05715","snapshot_observed_at":"2026-08-06T19:43:51.161218Z","title":"Generating Natural Language Explanations for Visual Question Answering using Scene Graphs and Visual Attention","venue":"cs.CL","work_id":"732ea047-1dc3-49c1-8e00-cc6c41f8ef90","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.764914Z"},"links":{"cited_paper":"/paper/1902.05715","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:0ed2e7d6fe791069bfe6ee842b2800b9057600994064273df4bb2ab53c1605e6","observation_id":"77343e28-a934-4e8d-a322-bdc540c39a91","resolution":{"observed_at":"2026-08-06T19:43:51.259049Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12133","last_updated":"2019-07-28T19:59:20Z","snapshot_observed_at":"2026-08-07T03:02:36.099330Z","submitted_at":"2019-07-28T19:59:20Z","title":"An Empirical Study on Leveraging Scene Graphs for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12133","snapshot_observed_at":"2026-08-06T19:43:46.904929Z","title":"arXiv preprint arXiv:1907.12133 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:46.904929Z"},"links":{"cited_paper":"/paper/1907.12133","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:4d2207ff81e3ec5927fc5627005ed5675e279f30c22cb7b6d6c44ac8a0a71240","observation_id":"cbe080c1-0b84-49d5-af1e-991ec154c613","resolution":{"observed_at":"2026-08-06T19:43:46.904929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.863177Z","title":"In: ACM International Conference on Multi- media, Mountain View, CA USA (2017)","venue":null,"work_id":"1fd21afb-7289-4d0b-a6e1-e60c8d9dd39b","year":2017},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.022684Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:6ff14acc909979675fd2dc5a382cdeb8a0cadcb7f0dcab5fc91479daee01c0da","observation_id":"9b014c3f-bf96-42c4-ba79-a12503dea213","resolution":{"observed_at":"2026-08-06T19:43:56.925916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.718048Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"96b75ee2-cc48-44cf-850a-96c998850c1d","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.095390Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a760617fe8274ce6b59ea634286f535c1c5d5e1d21e85e2e1efe9423aadf46ec","observation_id":"a8f57952-6d30-462e-92c3-bbf70250bf8c","resolution":{"observed_at":"2026-08-06T19:43:56.774882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.602502Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"8cad1762-9c34-4b96-8f55-02d902df1756","year":2022},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.182477Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:e54e6c0edca0db59b500a740ad88b48fd63b69e0ef8ced7bafc62c65773dd03b","observation_id":"fcd33370-82c6-4173-96e4-9490959efb86","resolution":{"observed_at":"2026-08-06T19:43:56.646010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.460024Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"07fdb973-8a1b-4fbd-9aae-a7e06dd969a9","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.302546Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ec6a8504c7841d01ed96b075aeb5200e8befd0e3e327adc26032ff6638018bdd","observation_id":"7aadcdc8-382d-4ae5-9efd-19371f9c2707","resolution":{"observed_at":"2026-08-06T19:43:56.520054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.325091Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"a414945c-8359-47b2-b1b7-afb61e3542bb","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.388617Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:c23d5e2f8fad167b431862bfc06a8d48797fc4c611d7ae5d9efe97045e84802c","observation_id":"2653a6ce-14a7-4f99-a271-a41d68f33d10","resolution":{"observed_at":"2026-08-06T19:43:56.393082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.166817Z","title":"In: 2016 IEEE Inter- national Conference on Image Processing (ICIP), pp","venue":null,"work_id":"76265a90-b698-4e0b-b86c-5f5da0b30e95","year":2016},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.463777Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:6a60b187067390f42bf46af1ee9712fb8df490d53c5e28e751cc302eeadab156","observation_id":"40261c1b-1a26-45fc-845c-c705bc6d84b9","resolution":{"observed_at":"2026-08-06T19:43:56.251625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.033817Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp","venue":null,"work_id":"d2f65f51-0be5-4a15-a446-23eb59634f9b","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.566942Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b2965921f363418b263f974e916b44c5b590b35a989e8b916299dc62562e9ff4","observation_id":"89767e79-28c5-4874-b3f5-b18492f7640a","resolution":{"observed_at":"2026-08-06T19:43:56.085260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.880704Z","title":"In: Computer Vision–ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XXI 16, pp","venue":null,"work_id":"73ab1110-b788-403b-a37c-e2dffb1d8e3c","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.630114Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:4a51233875dbc042337557cd78726a693abad9ab73cdc3d251636a7855b669c6","observation_id":"6f232d7b-050a-44c1-a654-af8d5b6da088","resolution":{"observed_at":"2026-08-06T19:43:55.956237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.713309Z","title":"Machine Vision and Applica- tions 35(4), 64 (2024)","venue":null,"work_id":"a4cc66d8-8989-4880-9cf1-7fa33a4b5338","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.674346Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ac04661c1fc8da915058588a1659f0d5d8209154a5651a33d939cb7fbbf7ce72","observation_id":"8ec1a218-0515-42fd-bc3b-0b6bb46f8634","resolution":{"observed_at":"2026-08-06T19:43:55.772715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-06T19:43:47.754159Z","title":"arXiv preprint arXiv:1804.02767 (2018) 26","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.754159Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:df2e9109b2066926de869366032fb90697680863b5948b75c5b41e4a166a265b","observation_id":"c93a3f9b-633e-4e70-b546-fbf55a762acc","resolution":{"observed_at":"2026-08-06T19:43:47.754159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.540554Z","title":"In: Proceed- ings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"193b13af-716d-4ab1-a7af-561b884be5de","year":2017},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.837739Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:faa95580ac8153ed0d2ea875413742607b08831ba7d46a1de1bc726fb77ea0d3","observation_id":"6f446b92-430a-4764-8275-8a82122d5d8d","resolution":{"observed_at":"2026-08-06T19:43:55.628813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.425346Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"52bca1f3-2ccb-475c-89cf-eb2f6cec1d6d","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.887903Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8c75d7c74ab857716afec681b7100bfa06e7e583b1b55cec91d6b3ef6f9f4532","observation_id":"453f8aee-53c6-4605-82bf-2f9de8baf4c0","resolution":{"observed_at":"2026-08-06T19:43:55.481004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06499","last_updated":"2025-02-15T10:01:13Z","snapshot_observed_at":"2026-07-06T18:28:20.634381Z","submitted_at":"2024-06-10T17:34:24Z","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","version":3},"cited_work":{"arxiv_id":"2406.06499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06499","snapshot_observed_at":"2026-08-06T19:43:50.882851Z","title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","venue":"cs.CV","work_id":"9d26397a-9c6b-4994-b01a-82b14f866961","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:47.969927Z"},"links":{"cited_paper":"/paper/2406.06499","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:45d3b72e89d049ee0fbd9772ac35be373af6c3bf7fdab1488871eafaa91e7ba3","observation_id":"5691f0ba-0c7e-4345-9377-3d6c585d1c3f","resolution":{"observed_at":"2026-08-06T19:43:50.977208Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.211405Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"63a8d501-ddf8-46b1-9aeb-8eae0b09fea0","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.014249Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:4f9670ae9187cfd68378ae65fec93085c1c760cfcd32a7a64283fc4791b4ec67","observation_id":"80bdef0a-3f68-492e-b010-d0e1fa522e7d","resolution":{"observed_at":"2026-08-06T19:43:55.339932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.963772Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"1d65bdb0-509f-46d1-8379-c0a478d06853","year":2017},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.097221Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:91bff3687bc43401e4c3712ed7044c4dad1c24368edc93df144f507c4f6ca74d","observation_id":"038a0c90-875c-47cb-bc97-83dd52da5949","resolution":{"observed_at":"2026-08-06T19:43:55.104767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00214","last_updated":"2020-05-20T17:40:28Z","snapshot_observed_at":"2026-08-09T00:23:40.293592Z","submitted_at":"2020-05-01T04:17:14Z","title":"The AVA-Kinetics Localized Human Actions Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00214","snapshot_observed_at":"2026-08-06T19:43:48.160980Z","title":"arXiv preprint arXiv:2005.00214 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.160980Z"},"links":{"cited_paper":"/paper/2005.00214","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:58bb30a05a585b45de588bfc77993a70dbd66a78955491426f184f2e4857d681","observation_id":"db8411f1-fb83-4b46-b0ce-257ad16ea095","resolution":{"observed_at":"2026-08-06T19:43:48.160980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:48.244244Z","title":"https://github.com/ultralytics/ ultralytics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.244244Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:7910be6d905c04d3dd33c0e08ce9200dc20d3cb617f39bed28b10147e8afa33f","observation_id":"b7e1f305-047e-4c62-8f46-5f061b49b2a7","resolution":{"observed_at":"2026-08-06T19:43:48.244244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.698300Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","venue":null,"work_id":"99d9e7ec-6c83-4c59-9621-fa45bff9678b","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.301829Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:8e1aba46424b53695ba63d84abe06832170b40652450df79be7bea73a950b2ad","observation_id":"19dd9691-502e-49f5-8405-3cbfe6edea71","resolution":{"observed_at":"2026-08-06T19:43:54.850124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.491891Z","title":"In: Proceedings of the 28th International Conference on Com- putational Linguistics, pp","venue":null,"work_id":"35769896-648f-435b-829c-810195398628","year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.382890Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:094e31f24c865bb8bcc3e443ddf3b0dd199c8d15a54f786538e51f7c9726aebe","observation_id":"4693b514-d069-406a-803d-3bc1ec387a5f","resolution":{"observed_at":"2026-08-06T19:43:54.578188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.269830Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"07cf9c91-78be-47e8-8d2e-35b40a074b8c","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.466250Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:27a7ca7eceed35c1a7a0a351d57b35a318ceca5bdcd548c4a4f13c1b13c985b3","observation_id":"54edf606-9d47-4b76-8b0c-66353a2b287d","resolution":{"observed_at":"2026-08-06T19:43:54.363739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:54.044580Z","title":"In: Proceed- ings of the IEEE/CVF International Con- ference on Computer Vision, pp","venue":null,"work_id":"268d3ed6-bb63-45aa-ba3b-7d4d51256eb1","year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.551932Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b261ef7099322e05eea759d754578f5227e5dd8a35b481689849e50bd33382d6","observation_id":"2a728679-d587-4325-b0b1-502465c4a7b3","resolution":{"observed_at":"2026-08-06T19:43:54.142534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.801906Z","title":"In: Proceed- ings of the 2019 on International Conference on Multimedia Retrieval, pp","venue":null,"work_id":"ce8a29db-7682-4ba0-b9e7-7a693ad23c19","year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.712989Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:2657c5488de915a8c10063dbc0eebc8dac185c54999bb26add6ba08e96f13cf5","observation_id":"42806005-c685-48b9-8898-3ff795bfff7e","resolution":{"observed_at":"2026-08-06T19:43:53.926419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.532798Z","title":"In: Proceedings of the 40th Annual Meeting of the Associa- tion for Computational Linguistics, pp","venue":null,"work_id":"c51d0064-6fda-434e-b54f-1f85a192668b","year":null},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.822838Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:2641c7daece79a96f1bcf05fcc9f5e724c8335a473e66a4c598867ec466a7bd7","observation_id":"fe06685c-de07-45a3-a386-f516f439cc3b","resolution":{"observed_at":"2026-08-06T19:43:53.634674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.247799Z","title":"In: Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation And/or Summa- rization, pp","venue":null,"work_id":"e0969741-011a-4f6e-a17b-05b82781bc76","year":2005},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.976303Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:5c560b9066232168b9ca27a00dc62d8844b341c30a882186ce1cbbbe95c6a24e","observation_id":"78a43c8e-a2c3-4cf0-9691-2a47199b4c22","resolution":{"observed_at":"2026-08-06T19:43:53.375874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:53.016868Z","title":"In: Text Summarization Branches Out, pp","venue":null,"work_id":"1c680ca1-5b0e-4be6-ade9-7d25c6c3f692","year":2004},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.082972Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:c2eb9ca06fe0b93e255a34e490d818fecd388f2af0a782b8b2fb571994379c70","observation_id":"b3a1dbf5-bc27-4f14-83bc-e935ad8978dd","resolution":{"observed_at":"2026-08-06T19:43:53.102668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.746425Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"7dcd1614-d76c-4501-9903-654e0b75b86b","year":2015},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.226727Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:12325cd5a87e4a7257a4235458797aca0bc38258049a9c3f68efb396c55a93aa","observation_id":"9059824c-4b4d-410f-9790-0760d4b8f8f0","resolution":{"observed_at":"2026-08-06T19:43:52.876223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.516112Z","title":"In: Computer Vision–ECCV 2016: 14th European Confer- ence, Amsterdam, The Netherlands, October 11-14, 2016, Proceedings, Part V 14, pp","venue":null,"work_id":"3794b191-3038-417c-bd16-7c88195410bf","year":2016},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.365407Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:34439db828b11171bd339399c04aa57026c2b70a2bc91ce9d3760274c104b098","observation_id":"d7e0c47f-786d-484e-849f-7ab5e77c2da2","resolution":{"observed_at":"2026-08-06T19:43:52.636631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T19:43:49.463035Z","title":"arXiv preprint arXiv:1904.09675 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.463035Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:5315ac83deebfcd21482a3f894e5f6f443397dba9209c9684d177c2ff04fceba","observation_id":"5c994fc8-5390-4d14-88e8-a05c17eb4176","resolution":{"observed_at":"2026-08-06T19:43:49.463035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:49.598751Z","title":"In: Proceedings of the 58th Annual Meeting of the Association for Computational Lin- guistics, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.598751Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:7ff243b070f95ccf986c8c075661fdf42ead29cc0d573342e89760a89e007572","observation_id":"5d9ff554-ed79-4775-a727-f157a1ee5c15","resolution":{"observed_at":"2026-08-06T19:43:49.598751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-06T19:43:49.721329Z","title":"arXiv preprint arXiv:2404.18796 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.721329Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:ce5c94849f1f97284b33d8d88cba20508f1587e174c2f16793c9cb7dcd7304d0","observation_id":"3af6cbeb-d4fb-4ed4-816f-05b4b1143bfa","resolution":{"observed_at":"2026-08-06T19:43:49.721329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T19:43:49.808196Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.808196Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:51ef8ad0701471ef31edf40e7cbeb1e38d3b2269cc5b8658beb23d5b56bf950a","observation_id":"2df423b3-7005-4902-8d8e-43da4aa1b0dc","resolution":{"observed_at":"2026-08-06T19:43:49.808196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:43:49.953878Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.953878Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:dac5a80943bde6e9d4fba231ba2f2c4f69421ee16d7da7b8bc066006b8eb4712","observation_id":"31fbf53a-80ec-4e9d-a145-85ca1ae462de","resolution":{"observed_at":"2026-08-06T19:43:49.953878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.303877Z","title":"Computational Linguistics 44(3), 393–401 (2018)","venue":null,"work_id":"249e029e-4cbd-4d31-a6cf-c429c9fcabb2","year":2018},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.082730Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:e289d21355b9d51919b0a95686fd6ac73598dabcd9f028c4c2d425cb819fc776","observation_id":"96daa34f-2e40-4509-8edb-9fbd0eb0cab9","resolution":{"observed_at":"2026-08-06T19:43:52.404183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.041428Z","title":"Computational Linguistics 35(4), 529–558 (2009)","venue":null,"work_id":"c8aebb2b-23e2-4aa2-acff-45eb9b4f89bc","year":2009},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.185014Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:5dc4da7ba2b1bee0128711ad42fa6937a41c9146a1d03b9967207ca895dd1538","observation_id":"57dad3fb-4027-42dd-b334-9bce34d581b6","resolution":{"observed_at":"2026-08-06T19:43:52.172079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09169","last_updated":"2024-08-17T11:13:10Z","snapshot_observed_at":"2026-07-06T19:01:54.329469Z","submitted_at":"2024-08-17T11:13:10Z","title":"Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices","version":1},"cited_work":{"arxiv_id":"2408.09169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09169","snapshot_observed_at":"2026-08-06T19:43:50.466829Z","title":"Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices","venue":"cs.CL","work_id":"b41f04f2-d09f-4a2c-9f32-2aab594d4bf4","year":2024},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.245368Z"},"links":{"cited_paper":"/paper/2408.09169","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:a0e9fd146d993df6868dc2053e128782fd2a5fd030a4366263d2ccebeedd739c","observation_id":"fa70dbcd-3eda-407b-83ac-58507ba8a6e0","resolution":{"observed_at":"2026-08-06T19:43:50.545471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:51.798457Z","title":"Advances in Neural Information Processing Systems 36, 53728– 53741 (2023) 28","venue":null,"work_id":"e4102e60-db69-4e76-aa89-988cee9c971a","year":2023},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.327893Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:b5d9730d328137e61d4a9cc00d401b429d9335ec0f7ed90faa0fbe63dec94622","observation_id":"0b6d68af-39da-4dda-92b6-42caa403fd8f","resolution":{"observed_at":"2026-08-06T19:43:51.894487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:48.886456Z","title":"https://doi.org/10.3115/1073083.1073135","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":318,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.886456Z"},"links":{"citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:dc10e75e7307f4bb807554cd8d35787b0603f41600d12833f90765188232e0a6","observation_id":"dacfa109-71fb-4b43-98f7-618bade59b84","resolution":{"observed_at":"2026-08-06T19:43:48.886456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:45:09.436329Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 3 inbound Pith citation observations for arXiv:2507.04815."}