{"as_of":"2026-08-23T05:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adb02cd7f7e09d5a1e0db60d8ce35d25e7066596976ccda15dfe8b3ffacc209c","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:10:14.602688Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:50:44.514251Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:36:26.722131Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"cited_work":{"arxiv_id":"2412.09276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09276","snapshot_observed_at":"2026-07-02T02:36:26.722131Z","title":"Text-video multi-grained integration for video moment montage.arXiv preprint arXiv:2412.09276, 2024","venue":null,"work_id":"8c1c989d-edc6-40b6-9aaa-f34442bd4169","year":2024},"citing_paper":{"arxiv_id":"2606.04098","last_updated":"2026-06-02T18:03:35Z","snapshot_observed_at":"2026-08-15T04:55:37.206713Z","submitted_at":"2026-06-02T18:03:35Z","title":"When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:50:44.514251Z"},"links":{"cited_paper":"/paper/2412.09276","citing_paper":"/paper/2606.04098"},"observation_digest":"sha256:c6051ede599445e4a16aa68c26019513f0b5bc4285ea64e22e50be829afb1e67","observation_id":"3e534fcb-23d3-4419-b70f-9ffa8eb0a041","resolution":{"observed_at":"2026-07-02T02:36:26.723854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09276/citation-record","integrity":"/paper/2412.09276/integrity","json":"/paper/2412.09276/citation-record.json","paper":"/paper/2412.09276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.275038Z","title":null,"venue":null,"work_id":"615d2169-7c5b-48c5-8992-ca062b1049af","year":1998},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.404407Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:1fb1fba06e8084ef4a9cf3c0cc562e1addcdfa08a8d670de228d17b1965323bf","observation_id":"35190cbd-666c-48c9-a21d-e31e1a0aa90c","resolution":{"observed_at":"2026-08-11T17:10:15.280463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.256901Z","title":null,"venue":null,"work_id":"ef1576bd-05ba-45fe-883b-0d57c3cee68f","year":2017},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.409952Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:d0650d5a7bbf17ba858c9cbd88f61d98e31a5e28f871542ffa01bcfa10cfb026","observation_id":"fa9430c3-ae4a-4556-9a39-3748cce65504","resolution":{"observed_at":"2026-08-11T17:10:15.262909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.236028Z","title":null,"venue":null,"work_id":"e7807f36-8390-47a9-8511-749cfc870e41","year":2021},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.415620Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:286ca9f425cc8019322064977e2fc76bb6909f0165f51e03aa1caaeb3e215427","observation_id":"b0ec4149-a693-4454-8a1c-0fbe8f1e5eaa","resolution":{"observed_at":"2026-08-11T17:10:15.241533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.218924Z","title":"Z.; Zhang, C.; and Zou, Y","venue":null,"work_id":"a30c97c7-62e2-4696-9cba-669cd3fef59b","year":2021},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.421289Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:010fa09f8108af45d432c40a77c645a600775f8ee09c01dd05c442f1ecdcfed3","observation_id":"b26c496e-a933-414c-9ca2-6bdc807e6ece","resolution":{"observed_at":"2026-08-11T17:10:15.224278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.202364Z","title":null,"venue":null,"work_id":"fb6d9dc6-1d90-4894-92d0-33e3dff178f0","year":2024},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.426962Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:ff2df9fc63d8b4be589658f8f6b05b0e7ca75a7cf27b29092a5a30694fa52d18","observation_id":"cada7120-c62c-4cd2-9a45-158c93c21e28","resolution":{"observed_at":"2026-08-11T17:10:15.207722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.185810Z","title":null,"venue":null,"work_id":"fc42242c-63ee-48e4-b0ea-57d8b1365a8a","year":1995},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.433443Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:676c855384b16cceb59b2ae2a3d4b19f4388d82baf07b10470a7ef4d0f01aa02","observation_id":"cee2893b-3f1f-4dff-b555-15acf86be16d","resolution":{"observed_at":"2026-08-11T17:10:15.191278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.168847Z","title":null,"venue":null,"work_id":"ddafb23e-b6ed-414d-8fd3-9df428dd99af","year":2017},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.439489Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:35716d4b0cae693dd1dd2b95b3e922d041adeaffae6db12f6dbf280e4eb9891d","observation_id":"9d2bb14e-16c0-4235-9100-2a872b1bcf73","resolution":{"observed_at":"2026-08-11T17:10:15.174191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.147237Z","title":"T.; Behrmann, N.; Gall, J.; Brox, T.; and Noroozi, M","venue":null,"work_id":"546e0371-03da-4d47-8f00-7c4f38e20a9f","year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.444463Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:b6e14eb93e8fde24e76e7e8e2baca8c4ad5f383dccdbd7058fe440d8c90075fa","observation_id":"8f506229-508a-4d26-a704-78c4eba3e43e","resolution":{"observed_at":"2026-08-11T17:10:15.154252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.126758Z","title":null,"venue":null,"work_id":"ef095579-4d6f-40c0-92f0-997b7757a2ef","year":2024},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.449961Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:7fdc97e0024982cdb8e1e279bb496b01f394149b395588b6e6752666cf28f948","observation_id":"5b4d0110-d872-4163-908f-e73f51ffec7a","resolution":{"observed_at":"2026-08-11T17:10:15.133398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.101357Z","title":null,"venue":null,"work_id":"8d5dcb77-1493-4fa8-895a-fe470e5b0c8d","year":2021},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.455266Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:e863ac3ee4006e4eb95a4e4436f4de0a1dbcc4ae1a7db12d3b39f007fdba5bc7","observation_id":"c70b321f-b22a-46bf-96d1-0aec935fc03e","resolution":{"observed_at":"2026-08-11T17:10:15.111731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.080986Z","title":null,"venue":null,"work_id":"5276e625-56a0-46b7-bf81-05c33fd83a2d","year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.460367Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:8a7556236eefa7363bf91bedb1aefb810dc49b6d2fdc1ac21c9d00c17a55bc58","observation_id":"f3a2b3b4-cb01-412a-a353-fd2c34419ea4","resolution":{"observed_at":"2026-08-11T17:10:15.086131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.062382Z","title":null,"venue":null,"work_id":"51069b64-cac2-428c-92f6-9ad8bac70748","year":2017},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.465353Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:9198b90a28c49801bef006203e79e36668f14be12908362ebae9d397438872ab","observation_id":"79ac7515-38fb-4a53-a472-5d8c78294df1","resolution":{"observed_at":"2026-08-11T17:10:15.068395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.470213Z","title":"L.; and Bansal, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.470213Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:776a7b3b5ed9c6197b8ebc21bfc351d0e24157d8ee19010adfcffcae0f0588ef","observation_id":"c9ec944f-0617-4ac9-aa2b-5316fc5095d5","resolution":{"observed_at":"2026-08-11T17:10:14.470213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.475175Z","title":"L.; and Bansal, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.475175Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:f409eb1071e2395bc18b308eb94f708188dfe7653b86f253f9426a8f24f34539","observation_id":"762fc08c-e5c6-4343-8c80-041ac4b5acca","resolution":{"observed_at":"2026-08-11T17:10:14.475175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:15.013774Z","title":null,"venue":null,"work_id":"626a631a-1f62-48b7-adb6-9ca067825653","year":2020},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.479803Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:73925af30296517ff4dd23fc0ff285cf33e375dc4c4465b9d3a19fae1915af16","observation_id":"b992528b-248d-46dd-b15d-8e07be7432cd","resolution":{"observed_at":"2026-08-11T17:10:15.020870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.485040Z","title":"H.; Zhang, P.; Zhang, H.; Yang, J.; Li, C.; Zhong, Y.; Wang, L.; Yuan, L.; Zhang, L.; Hwang, J.-N.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.485040Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:47c1f5dd93b9b8fe1b7bbee5d06109104d9dccbbba5ce6ba47933074f64ea203","observation_id":"7154555b-85f7-4196-abc3-65b4f024316e","resolution":{"observed_at":"2026-08-11T17:10:14.485040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.980550Z","title":null,"venue":null,"work_id":"0f61d7d3-736b-4fa5-9ef2-13593d065751","year":2024},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.490994Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:f00fa55e579e64bbb910c244f32041b79341c09b99684b67db8c0ba64f737b21","observation_id":"0ab29493-9400-4b6b-ae6c-ecd153ea26fb","resolution":{"observed_at":"2026-08-11T17:10:14.986397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.960661Z","title":null,"venue":null,"work_id":"b809383b-39c9-4213-9482-9455ff7895f1","year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.496484Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:fc8f99c0b89a3f154b76e53b8116d3df00553623123e8fbea497a5a2dff8e9e3","observation_id":"8f626c11-fce8-4260-a469-da29df90e2f9","resolution":{"observed_at":"2026-08-11T17:10:14.965755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T17:10:14.501305Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.501305Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:44d6aa7c277f37a778a045fd05e8bddc259404b7225f224db962aae461e640c5","observation_id":"08b5b9bc-130e-4f2d-8694-f2cc9bce8ab9","resolution":{"observed_at":"2026-08-11T17:10:14.501305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.507549Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.507549Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:103a58b9fc05efcfb15ef2209b21273299a62a79c473cef4027976c775cae458","observation_id":"fee2435f-7601-47c7-87b9-5e9c56e88207","resolution":{"observed_at":"2026-08-11T17:10:14.507549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.514162Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.514162Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:4ebf41bbf6ddc64a2f276de31e047e0771c0865f2d8f37273450ef01b590115b","observation_id":"881d1432-4ea8-467f-858c-9ff47a904c5a","resolution":{"observed_at":"2026-08-11T17:10:14.514162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-18T09:56:54.969662Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-08-11T17:10:14.519307Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.519307Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:edadef7c814ad74145f37ea15139a5ae46eda6c26ad59bc55e3598f76254fb7c","observation_id":"a359d361-dd01-48f4-8050-b1dc694e0a54","resolution":{"observed_at":"2026-08-11T17:10:14.519307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.914095Z","title":null,"venue":null,"work_id":"38fb2554-a06f-4a71-a8f2-9287ef8e6c2c","year":2023},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.525250Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:62c7faa1fe0c7abc2f721ae908e4cb282f1d55aca489f5200f6b6412e24b4ee7","observation_id":"f44a104c-2b54-4179-84a2-a4b203b96449","resolution":{"observed_at":"2026-08-11T17:10:14.919808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.895663Z","title":null,"venue":null,"work_id":"ac989d58-4996-47bc-99e1-074a9a1fd6b3","year":2016},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.530656Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:281fd0506e1bb271f8fadaee8f1d7b4aa20aaab65914ff43dd5b292594d67c19","observation_id":"4911adec-9fb0-42b6-a823-464b4a73057a","resolution":{"observed_at":"2026-08-11T17:10:14.901491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12763","last_updated":"2022-02-23T12:44:54Z","snapshot_observed_at":"2026-08-21T23:18:38.036268Z","submitted_at":"2019-07-30T07:31:02Z","title":"Finding Moments in Video Collections Using Natural Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12763","snapshot_observed_at":"2026-08-11T17:10:14.536135Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.536135Z"},"links":{"cited_paper":"/paper/1907.12763","citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:b95e1269cae3fba23c78d12373426d0c91cc4480520a399c1f750941c3bab9cb","observation_id":"5bb76f12-de89-44d9-b705-1d1f4722a4c8","resolution":{"observed_at":"2026-08-11T17:10:14.536135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.877259Z","title":null,"venue":null,"work_id":"1212258a-b35b-49d6-a4ad-7077cb673122","year":2019},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.541850Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:82332b675733c0c6af31de9f74622a2a9bf83bfbfe8b469ee3571aec3326a110","observation_id":"241f0280-f5da-464c-9c7c-cb4b37c19c70","resolution":{"observed_at":"2026-08-11T17:10:14.882113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.858636Z","title":"C.; and Lin, D","venue":null,"work_id":"078e7d81-d878-4e7c-86ba-be995268891d","year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.548469Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:629264f02deda03a2057aa306363f0b8aa27af2b34a3aeb0a9be0fba44423930","observation_id":"a05c0234-abf6-47e4-9aa6-a51aa287e6ad","resolution":{"observed_at":"2026-08-11T17:10:14.863672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-11T17:10:14.553825Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.553825Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:c4e68210d0d6596e3ab57daf99d0825a8686327b04c9275dbbc57254844173ae","observation_id":"4e6af795-fd8d-4a68-98da-5fce212198a5","resolution":{"observed_at":"2026-08-11T17:10:14.553825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.841742Z","title":null,"venue":null,"work_id":"35e2c27c-ca83-4a07-ab93-1afe0288e239","year":2023},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.559669Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:7583d2c43eaa4dd75b052da9b14afe662708d6b63043155b1eaa101f4c4036e6","observation_id":"682b357a-3df7-4100-96b2-52c2e25349ac","resolution":{"observed_at":"2026-08-11T17:10:14.847094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.821940Z","title":"W.; Yoon, E.; Kim, D.; Kim, J.; Yoon, H","venue":null,"work_id":"c2cd2cf1-2670-45b2-aca5-85bc99639f56","year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.564785Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:826f582064ce2581c6239760e6bab4ca42ad674a9ee6d7a003a71fdf37f6191f","observation_id":"2d1e51d6-744d-48e4-b756-5a2c2c21bed8","resolution":{"observed_at":"2026-08-11T17:10:14.828640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.803400Z","title":"W.; Yoon, E.; Kim, D.; Kim, J.; Yoon, H","venue":null,"work_id":"7208a0bf-cc44-4a0b-8f35-aba7525769bd","year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.570302Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:7a4b70861511331f76835bb9351592d07aa8a96d82502862d9aa4445f3f0a535","observation_id":"743723b1-27d2-4aeb-9e51-8d1b1ce845d3","resolution":{"observed_at":"2026-08-11T17:10:14.808534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.787060Z","title":"T.; and Goh, R","venue":null,"work_id":"eec70cab-4314-4a0e-abc4-d29523513145","year":2021},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.575105Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:5abf8ed9bb60f2950d7bca2f74a61605533729291845d6664e5cc6bbaf318cac","observation_id":"1d1bf6ab-bae1-431f-ae7f-7c3f7467d33e","resolution":{"observed_at":"2026-08-11T17:10:14.792249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.770457Z","title":null,"venue":null,"work_id":"912ddd8a-583e-4da2-96cf-8c29a368740d","year":2020},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.579891Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:721f5d719969f171be6b0995d6a6fe8fee233861d2f7874d7acd2245b2b57c1d","observation_id":"e6539623-52fd-4286-b651-26575cd4ff23","resolution":{"observed_at":"2026-08-11T17:10:14.775706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.753187Z","title":null,"venue":null,"work_id":"a0388883-b073-4e13-bd7d-582189f5d13b","year":2020},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.584674Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:9b6781db8c4e48a383afacdd5ff714b0bdaf8e960dc778ab5680e15473961b10","observation_id":"cba6130c-ad17-4a8b-9769-f0e28ecb7263","resolution":{"observed_at":"2026-08-11T17:10:14.758421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.734372Z","title":null,"venue":null,"work_id":"b82fffcc-337d-4d34-99bc-cc070d78253b","year":2023},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.589568Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:fc04b46698481625c58da5fc7094ebd49de6cd64b51dd0c66d1053105211bb55","observation_id":"4afa6559-b8aa-4e70-98d7-533e81f41c68","resolution":{"observed_at":"2026-08-11T17:10:14.740807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.594519Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.594519Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:237f41023ee14aae33cebff535eea40c500601df9fa1d6aa3dba0cae7a600e8d","observation_id":"b3d4b9d4-1331-42a4-bf14-1f856be5dcc3","resolution":{"observed_at":"2026-08-11T17:10:14.594519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:14.602688Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.602688Z"},"links":{"citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:cc0de4dfa9e864e595c49a6dbe21f0f899d5466d96266754d91f3d9cf2699987","observation_id":"d26714e5-c9e6-495d-a6da-c8c87f860760","resolution":{"observed_at":"2026-08-11T17:10:14.602688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2412.09276."}