{"as_of":"2026-08-19T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f776f86df609a878dd81c092831bc3d852c1d29b9328f1dcb067ad80cc31ee38","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:43:20.048571Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06557/citation-record","integrity":"/paper/2505.06557/integrity","json":"/paper/2505.06557/citation-record.json","paper":"/paper/2505.06557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.691889Z","title":"Video summarization with long short-term memory","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.691889Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:bf6d4b7ef5e29b6b0eb4e1ca0d1d8dd0f4ea710c0c78249e1d549b57b339ab17","observation_id":"2a9fdea8-0644-4bc1-8d2e-32e8503a0ac4","resolution":{"observed_at":"2026-08-15T22:43:19.691889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.696416Z","title":"Video summarization using fully convolutional sequence networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.696416Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:3744cf584626b5c2a93a393eaa516af8555dcc97dcbd2df0a92a93d3dc4ab527","observation_id":"c05ac608-05ea-4735-88f1-254b0cdf2558","resolution":{"observed_at":"2026-08-15T22:43:19.696416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.700550Z","title":"Egoexolearn: A dataset for bridging asynchronous ego-and exo-centric view of procedural activities in real world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.700550Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:9a533ed7c101e2c5d3ba05be6df8685e6157bb76fb3cd2b85b876214d3de88d5","observation_id":"4d120700-fc96-47ba-a985-5a256550041e","resolution":{"observed_at":"2026-08-15T22:43:19.700550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.704282Z","title":"Dual encoding for zero-example video retrieval","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.704282Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:fb7e23494b2be873736f8cd27e2aff77f81805e651bbc3ebc1c436caf53c405d","observation_id":"35846bb6-ba86-4488-8f19-9b54e29614c1","resolution":{"observed_at":"2026-08-15T22:43:19.704282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.708033Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.708033Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:db5e06b5eb89eecc97713ba80b17720788acca8134002e67b3296bfafc63354d","observation_id":"07ecbc59-1a0f-45a2-bad2-cb180c89f465","resolution":{"observed_at":"2026-08-15T22:43:19.708033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.711944Z","title":"T2vlad: global-local sequence alignment for text-video retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.711944Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:6f56e39b80512fc395f33ce614480ea8811f80ac1dc95b8e57d0ccc9b2ebdae1","observation_id":"33341392-df84-4359-8312-d7a377208b82","resolution":{"observed_at":"2026-08-15T22:43:19.711944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.716072Z","title":"Mutual context network for jointly estimating egocentric gaze and action","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.716072Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:af99c1048350f1f9d73d9e53aee8636fafde085a65eec14467d0b08d3cb9e60f","observation_id":"71d90c8f-530d-4724-a7b6-adff54b75829","resolution":{"observed_at":"2026-08-15T22:43:19.716072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09308","last_updated":"2020-01-25T13:07:43Z","snapshot_observed_at":"2026-08-18T17:56:13.570263Z","submitted_at":"2020-01-25T13:07:43Z","title":"Look Closer to Ground Better: Weakly-Supervised Temporal Grounding of Sentence in Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09308","snapshot_observed_at":"2026-08-15T22:43:19.719784Z","title":"Look closer to ground better: Weakly-supervised temporal grounding of sentence in video","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.719784Z"},"links":{"cited_paper":"/paper/2001.09308","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:877e349f197a8d7287ac3cd72a54726f16ee55498ec24b979b01b6d26e0780db","observation_id":"bc2c775f-3add-445a-9a74-13d5542488ba","resolution":{"observed_at":"2026-08-15T22:43:19.719784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.723875Z","title":"Predicting gaze in egocentric video by learning task-dependent attention transition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.723875Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:16fecf3cd442250b68f067e337001f07609e3439989853b1555628786848ca36","observation_id":"8a8ed187-fde2-4636-93ec-75ad04689dfa","resolution":{"observed_at":"2026-08-15T22:43:19.723875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.727528Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.727528Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:42d4182c5344c383e5282802ff5fca948f121788ca9ab7cb73883100b6069e9d","observation_id":"0e48ebce-c4a5-4922-b4e7-ed0e05a60e1e","resolution":{"observed_at":"2026-08-15T22:43:19.727528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.731293Z","title":"Boundary proposal network for two-stage natural language video localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.731293Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:234289b3734c9c853c288990c43780d5ce0860da3a4722ba486527936fb9b0ef","observation_id":"0ee991dc-6a84-40cc-8022-2b4dcde1d7ad","resolution":{"observed_at":"2026-08-15T22:43:19.731293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.735121Z","title":"Univtg: Towards unified video-language temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.735121Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:83c0fb9e5f509ccbbfde8363cbcd4ab8615e330039e223b945a523986c741c77","observation_id":"70d86978-1349-4460-b51a-dd6d13160a54","resolution":{"observed_at":"2026-08-15T22:43:19.735121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.738570Z","title":"Mac: Mining activity concepts for language-based temporal localization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.738570Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:582589c0006bb73281d9ebf59b96b1c7799a33f006692c72e5ff442b71be69c6","observation_id":"f6e61de2-ada2-48f6-911b-619bd954951b","resolution":{"observed_at":"2026-08-15T22:43:19.738570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.742337Z","title":"Learning 2d temporal adjacent networks for moment localization with natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.742337Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:41f008b265f1fef8b156a629d09be4880e44599d913d317a8a18d30a8ff8d6d4","observation_id":"2f25237b-3baa-4f9a-8529-a801c8f57767","resolution":{"observed_at":"2026-08-15T22:43:19.742337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.745590Z","title":"Progressive localization networks for language-based moment localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.745590Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:b528df21abc2c886eb867ffea8d6820b098b620bef83766a9fe0b48b0c7f0dfe","observation_id":"32ff957e-6821-40fd-97ee-f85ce53572c1","resolution":{"observed_at":"2026-08-15T22:43:19.745590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.749088Z","title":"Weakly supervised temporal sentence grounding with gaussian- based contrastive proposal learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.749088Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:1498fd605ea6c2def074696446bf2e43c2c7e8ed5f5717f321195d94d692d9c0","observation_id":"4ecf493a-3856-43b1-9086-2cb30f44e491","resolution":{"observed_at":"2026-08-15T22:43:19.749088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.752400Z","title":"Gaussian mixture proposals with pull-push learning scheme to capture diverse events for weakly supervised temporal video grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.752400Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:0f7c76b550174e0f2afe4e3795b596d35ff5ba405894a2d0fe0e2d41e60ef1db","observation_id":"b3bb69ad-c247-4516-9079-c7518e1d6d31","resolution":{"observed_at":"2026-08-15T22:43:19.752400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00239","last_updated":"2019-08-31T16:30:28Z","snapshot_observed_at":"2026-08-14T05:55:31.648306Z","submitted_at":"2019-08-31T16:30:28Z","title":"WSLLN: Weakly Supervised Natural Language Localization Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00239","snapshot_observed_at":"2026-08-15T22:43:19.755632Z","title":"Wslln: Weakly supervised natural language localization networks","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.755632Z"},"links":{"cited_paper":"/paper/1909.00239","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e62946ba23fc69bdc4b3cfaeaad112994fcc8be6d9bae0a3d6d46ce9b9c28711","observation_id":"5475a2b6-6672-4d9f-ad59-250d54cae501","resolution":{"observed_at":"2026-08-15T22:43:19.755632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.932724Z","title":"Cross-sentence temporal and semantic relations in video activity localisation","venue":null,"work_id":"ae8edba1-26cf-4f84-8fdf-c3d76eab965c","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.759892Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:07299a547a8c30f30057fed6bc7fd00e1b777b0243657df304447848736f58d7","observation_id":"cf592482-5e5c-40d2-b72e-f50be6c7ac10","resolution":{"observed_at":"2026-08-15T22:43:20.936629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.920831Z","title":"Logan: Latent graph co-attention network for weakly-supervised video moment IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY 12 retrieval","venue":null,"work_id":"e92ef359-5d97-4c3e-aa2a-78ef0ed3d122","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.763524Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:98c87755acd6eb4ac6dc00ade0eab2ab513abe1811c2652107faa591824c00ee","observation_id":"11e99359-6844-4444-9d07-df0780581741","resolution":{"observed_at":"2026-08-15T22:43:20.925135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.910207Z","title":"Weakly- supervised video moment retrieval via semantic completion network","venue":null,"work_id":"a230e749-6a61-494e-aa13-714b2ecb1292","year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.767051Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:9b1d38bc6d84fabe06ff6e5fddb6013cedeb5d45b40bac810c01020c1f025b38","observation_id":"887434f3-6da3-42a7-b3a3-9348de38bed7","resolution":{"observed_at":"2026-08-15T22:43:20.913868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07048","last_updated":"2020-03-16T07:01:01Z","snapshot_observed_at":"2026-08-17T14:30:07.275341Z","submitted_at":"2020-03-16T07:01:01Z","title":"Weakly-Supervised Multi-Level Attentional Reconstruction Network for Grounding Textual Queries in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07048","snapshot_observed_at":"2026-08-15T22:43:19.770387Z","title":"Weakly- supervised multi-level attentional reconstruction network for grounding textual queries in videos","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.770387Z"},"links":{"cited_paper":"/paper/2003.07048","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:6e22fac62ef9c26c91783d69f78686f88c9c6d23f0d2b6d699f7a5119c20a2ee","observation_id":"4a5f22f0-2612-4fe9-af5e-57c557b409d3","resolution":{"observed_at":"2026-08-15T22:43:19.770387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.899556Z","title":"Weakly supervised video moment localization with contrastive negative sample mining","venue":null,"work_id":"edbd51c6-00a2-4906-bd34-fdd621453688","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.774200Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:0d6a971ce40b1f0495c869d184bedf80f506cf3b113a39d0c56701993d6c39ac","observation_id":"ce00389e-6be6-43fc-b61e-c08e6de72593","resolution":{"observed_at":"2026-08-15T22:43:20.903298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.888507Z","title":"Localizing moments in video with natural language","venue":null,"work_id":"94b9aa2a-e2b2-43c6-8363-19cddc14321d","year":2017},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.777491Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:673bc5201320b50241069be7960f1907ee1a04e6ac28cb71155100a1f1ccde4f","observation_id":"b9e5f90f-3c82-404e-9ec0-b7055b55abd5","resolution":{"observed_at":"2026-08-15T22:43:20.892346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.877528Z","title":"Cross-modal video moment retrieval with spatial and language-temporal attention","venue":null,"work_id":"05a9a902-a07c-4a09-9072-03cd767ef0f3","year":2019},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.780984Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e0e15715babce278518b7b179eed1d2ecd0aa1a28920c3b8e42df8ec504fcfc0","observation_id":"6fa55ff5-edf3-44fe-838b-1e72b855d29e","resolution":{"observed_at":"2026-08-15T22:43:20.881502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.865819Z","title":"Temporally grounding natural sentence in video","venue":null,"work_id":"2843e8ce-92b5-47d0-aa9d-ffb8605e67a6","year":2018},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.784467Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:ddbfb8e2e464b37feb5b6a23a3537cc53aa91207e3c47c8d1e1d7bf931e83d45","observation_id":"bbeffb93-af23-4426-a607-bb3ea489681a","resolution":{"observed_at":"2026-08-15T22:43:20.869987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.854001Z","title":"Semantic conditioned dynamic modulation for temporal sentence grounding in videos","venue":null,"work_id":"a978227e-2489-4c4f-b53f-dbb40a3a9704","year":2019},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.788424Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e2dccaa97aa5a6564c8a2b7ff96d6c098d45f3ee0ce45a74f670b4889ec0f3a7","observation_id":"c9cfb7ea-2d00-4a4c-89ee-345c2ffb2432","resolution":{"observed_at":"2026-08-15T22:43:20.858137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.842891Z","title":"Multi-modal interaction graph convolutional network for temporal language localization in videos","venue":null,"work_id":"25cc8a26-d1c6-4cbd-ae74-a8e7a5b26b82","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.792428Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:c94281027a5fa25f05f4dd16c73913823db3a9671047259f5dc89e2a53937b85","observation_id":"344336e1-5ee5-4d92-a2a4-2a36a24c19c2","resolution":{"observed_at":"2026-08-15T22:43:20.846724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.831868Z","title":"Thinking inside uncertainty: Interest moment perception for diverse temporal grounding","venue":null,"work_id":"e7576d5c-ad81-4056-b68c-bbe3762784e1","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.795890Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:7114769875fd0e953ebfc2012c3655d8e24af99f7e9120389ec3a3d6c44e196f","observation_id":"03d9e6cc-e400-4ea9-adba-327af52a7bf4","resolution":{"observed_at":"2026-08-15T22:43:20.835789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.820735Z","title":"Camg: Context-aware moment graph network for multimodal temporal activity localization via language","venue":null,"work_id":"164c5870-db6c-4b7a-a579-6ed3fedbed13","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.799519Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:9c831fa62373cb4beaf69f63dcd189e81521430afaf1ea200f647dc2b83b33b5","observation_id":"e5d0b2ab-b697-44ef-91ed-a88f6f37a26b","resolution":{"observed_at":"2026-08-15T22:43:20.824946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.810220Z","title":"Video moment retrieval via comprehensive relation-aware network","venue":null,"work_id":"8b22ee2d-89e3-4381-aa60-864665830754","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.803192Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:398c6536a2be513c2497d44f07438e408b135def49e21bf3d0e502209275d273","observation_id":"d290e369-e395-4b38-9621-3fa7071497d7","resolution":{"observed_at":"2026-08-15T22:43:20.813899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.799480Z","title":"Video corpus moment retrieval via deformable multi granularity feature fusion and adversarial training","venue":null,"work_id":"42bf20a7-4a4c-49d4-b485-f8c93acf10d4","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.807376Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:dbbf92de24cd3f57a923ede52c558339f8051edc2c48233bf4281041b969b101","observation_id":"ebc3d1f6-cc3a-4b66-b52a-cfff9377cf98","resolution":{"observed_at":"2026-08-15T22:43:20.803189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.788974Z","title":"Collaborative debias strategy for temporal sentence grounding in video","venue":null,"work_id":"e750e5d7-f813-4c67-8125-403fdb8dd87c","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.811384Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:56c263873d06ef265feae8acc1fdf3eda2471403467014b77e6568a95478c645","observation_id":"4ce6beaa-8cf9-4b61-beb7-addf784d2155","resolution":{"observed_at":"2026-08-15T22:43:20.792693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.00325","last_updated":"2020-10-07T10:15:13Z","snapshot_observed_at":"2026-08-10T21:59:55.667529Z","submitted_at":"2020-09-01T10:07:23Z","title":"Uncovering Hidden Challenges in Query-Based Video Moment Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.00325","snapshot_observed_at":"2026-08-15T22:43:19.814983Z","title":"Uncovering hidden challenges in query-based video moment retrieval","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.814983Z"},"links":{"cited_paper":"/paper/2009.00325","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:2f04f4a4cc9c1329dadec567ec1f762dd59a793fbfa0a27797e3ee630dbc17e2","observation_id":"896f8d0b-3a49-434d-9160-48697c0d7100","resolution":{"observed_at":"2026-08-15T22:43:19.814983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.777931Z","title":"Cola: Weakly-supervised temporal action localization with snippet contrastive learning","venue":null,"work_id":"6b52b135-ccbf-4534-88a6-9701a962f98c","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.819016Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:91d0f198b2f2697a6805ca206f4b80c4fbfae89d736c391d2d2063ebda46a8f6","observation_id":"335ccf54-5aaf-45e7-a30a-b8d74f9a8989","resolution":{"observed_at":"2026-08-15T22:43:20.781717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.767250Z","title":"Exploring sub-action granularity for weakly supervised temporal action localization","venue":null,"work_id":"00377987-6199-4679-90dd-73b14bdf7154","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.822400Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:d2bc479f0a6d53c69df779d48a13f499f444f08056c7cf0d50f13c7a28cda692","observation_id":"219d6b14-5a4d-4ca5-a7fd-aed636c38a00","resolution":{"observed_at":"2026-08-15T22:43:20.771002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.756011Z","title":"Learning proposal-aware re-ranking for weakly- supervised temporal action localization","venue":null,"work_id":"8feb7742-dff3-4012-a0e0-c765f8e50d75","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.826341Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:81f0346c8105216fa5f1cd6ca2042006eec5f988d3cde214f708e0a049b72575","observation_id":"7e6eee0c-d984-44b8-b241-d284f89533a0","resolution":{"observed_at":"2026-08-15T22:43:20.759859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.744816Z","title":"Cross-video contextual knowledge exploration and exploitation for ambiguity reduction in weakly supervised temporal action localization","venue":null,"work_id":"0effd1fe-070d-47b3-97ee-26db32c04cb3","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.829861Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:b7c087302808bbf71a148fb1de6656e834db499a4117a16ea729ba8c3a3b9b9e","observation_id":"7de543a6-0d46-4872-aa8b-5709f3f809e6","resolution":{"observed_at":"2026-08-15T22:43:20.748692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.733408Z","title":"A snippets relation and hard-snippets mask network for weakly-supervised temporal action localization","venue":null,"work_id":"4206ee7f-d54d-475a-8d1e-9561db4f9475","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.833458Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:1b7bea36634bdad9f6c31d95b5ea54873b74d930fdf41188b4e7d39e5f27ca11","observation_id":"2b6a5e24-7010-41ae-b950-774ff40aa032","resolution":{"observed_at":"2026-08-15T22:43:20.737697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.721168Z","title":"Solve the puzzle of instance segmentation in videos: A weakly supervised framework with spatio-temporal collaboration","venue":null,"work_id":"6921fe0d-9e6a-4a48-ad6b-0ddb9d876e23","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.837009Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:20b5e18dd21b87a75acd0189ed83aba2ad487b690a7e39427a673850a47a2027","observation_id":"1cb512e6-a782-41c7-a0da-5e3f28c2c53c","resolution":{"observed_at":"2026-08-15T22:43:20.725294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.709785Z","title":"Weakly supervised video instance segmentation with scale adaptive generation regulation","venue":null,"work_id":"44a3b804-9f59-49dc-9904-89cd7a88e23b","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.840752Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:54db9199518f27fa19b8bb5ebd67ebeb807595fd11ad3e0de66d0c48e2fedb6f","observation_id":"3264f0a9-18fb-4ca2-8e1e-925f9c04857a","resolution":{"observed_at":"2026-08-15T22:43:20.713711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.698974Z","title":"Towards video anomaly detection in the real world: A binarization embedded weakly-supervised network","venue":null,"work_id":"63b2b11d-90d0-497d-8865-85d153daa387","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.844340Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:576c8c1ead10bca0a0872300f0025adaba69275c0bcae56f7498cb8b5afd9f44","observation_id":"eb918e2b-6e61-42fa-aa97-0db1e0b18c57","resolution":{"observed_at":"2026-08-15T22:43:20.702749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.687193Z","title":"Vadclip: Adapting vision-language models for weakly supervised video anomaly detection","venue":null,"work_id":"63709bcb-aebb-4dd7-b4ab-6342e37813b8","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.848230Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:8fb1aeb400d7dc019c102cfef60ab4d0aceadf95741ef49ee852589cab298d36","observation_id":"618b355a-8eaa-4bb6-b6ab-e7efbdf99f2f","resolution":{"observed_at":"2026-08-15T22:43:20.691956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.676448Z","title":"Batchnorm-based weakly supervised video anomaly detection","venue":null,"work_id":"679a94ca-25f8-4e71-89f7-36faa12924bc","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.851807Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:0d062af0908eba413266fc8cf71f04ac722fcb34e15904053e72eeec0ddedefe","observation_id":"24b2707b-175d-4009-baa5-a7e9fbd11bde","resolution":{"observed_at":"2026-08-15T22:43:20.680217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.855241Z","title":"Weakly supervised video moment retrieval from text queries","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.855241Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:a7f96dcdeee9ec310a35c54c8f8a5d94ed590820af7c49ccf89903f9855eac1a","observation_id":"15994ed0-25ca-4868-acd2-f4d5bf5daf42","resolution":{"observed_at":"2026-08-15T22:43:19.855241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.659069Z","title":"Vlanet: Video-language alignment network for weakly-supervised video moment retrieval","venue":null,"work_id":"dd240e1c-988d-4ec1-955f-edfe3814d24c","year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.858766Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:3d2e424144d039b9cfdad0682a453555efebd09a4e543ca02247caef722550af","observation_id":"3440bc77-641c-4965-9d3e-3c44bfa2f263","resolution":{"observed_at":"2026-08-15T22:43:20.662653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.648071Z","title":"Weakly supervised temporal sentence grounding with uncertainty-guided self-training","venue":null,"work_id":"32566e5e-71c0-4e82-8cf6-7bb1a200e9ff","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.862370Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:ee6cad3acaa179e7bd579e2ef2ca9375444d6abe4ae31f2ea0dd0fb54ccb9418","observation_id":"8a9781a7-b394-4fcc-9eb6-7bb26042e84d","resolution":{"observed_at":"2026-08-15T22:43:20.652170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.637338Z","title":"Unsupervised hard example mining from videos for improved object detection","venue":null,"work_id":"22c16d23-311c-42dc-bfae-be5c578619d9","year":2018},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.865706Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e337333221fee98cf78d0f617d90e1c40b4791b228b8cc27cad33fcff7e5c7b3","observation_id":"ffc53d2e-3bb1-421c-99b2-3d13087738f2","resolution":{"observed_at":"2026-08-15T22:43:20.641437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-18T17:53:57.208912Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-15T22:43:19.869228Z","title":"Contrastive learning with hard negative samples","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.869228Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e4ef937d3ff1e26e655c807ebac882fb9694feaa8e239da5e2d05f7149626143","observation_id":"89858af6-af6b-4750-be96-209ab2b3420e","resolution":{"observed_at":"2026-08-15T22:43:19.869228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.626305Z","title":"Video corpus moment retrieval with contrastive learning","venue":null,"work_id":"3e8316f8-faa3-47b9-8712-55db4d698725","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.873249Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:ef879955113e7551782c45c8f0a8239a717a03717a3f9a422ef8ff20a351369d","observation_id":"7a9c0299-9025-4c8a-8176-6320b97c8900","resolution":{"observed_at":"2026-08-15T22:43:20.630037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.615806Z","title":"Selective query-guided debiasing for video corpus moment retrieval","venue":null,"work_id":"f67b1f5e-230e-4b51-9834-e1543cd4bf42","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.877108Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:5acfc7a2fe51ab36d0f781965b54b86ed65b8a1babc9bae85e9376cb84e4e653","observation_id":"149d7d89-edf5-4191-8ae0-107deb44e623","resolution":{"observed_at":"2026-08-15T22:43:20.619524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.604612Z","title":"Counterfactual two-stage debiasing for video corpus moment retrieval","venue":null,"work_id":"04eca53a-3909-43e6-9e19-2448e07c1a52","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.881003Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:d9f23f81b35b31c9f4ef56c1de27e7294b4e8d7743cb1ee27482ee9ec3df36f7","observation_id":"5da81a9e-69c9-4376-a8d5-1eeb64f58e8f","resolution":{"observed_at":"2026-08-15T22:43:20.608778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.593168Z","title":"Curriculum multi-negative augmentation for debiased video grounding","venue":null,"work_id":"de60c8ea-bcb3-4e19-a87b-d52cc62502c2","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.884681Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:34af954aaa615544a467ba7b732e36c7b33770ba326fc74c452eadaedcda9999","observation_id":"fe083306-2953-4d21-bc54-b4cf8c68f876","resolution":{"observed_at":"2026-08-15T22:43:20.597175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.582253Z","title":"Bias-conflict sample synthesis and adversarial removal debias strategy for temporal sentence grounding in video","venue":null,"work_id":"00bb0132-a355-4047-b1d3-d9afe054157a","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.888249Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:3b9b8af38a8afc5db583933853eaee57043a2cd06b1f8aed9b9b8fff0cc3d365","observation_id":"f08840e4-c1d1-4857-8ee2-39d8d74310d0","resolution":{"observed_at":"2026-08-15T22:43:20.586147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.571318Z","title":"Learnable negative proposals using dual-signed cross-entropy loss for weakly supervised video moment localization","venue":null,"work_id":"962f9ff4-0d43-42d4-9704-96b636821b09","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.892238Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:7efcde1f0301369abca50249aaaf16306bc0b057f6a39d3f5a4d0b3af88e0bb2","observation_id":"e2c8e9d6-8405-4c3c-ac99-5bafd66f98f4","resolution":{"observed_at":"2026-08-15T22:43:20.575041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.560653Z","title":"Contextual similarity distillation for asymmetric image retrieval","venue":null,"work_id":"baa436fd-36fd-475c-b1fe-7d3310dbe1b2","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.896038Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:ff39a05b62b85a6c3a093046353f0e4e1864323d51eba7bc38494a47ecc7d4d0","observation_id":"970a30a0-baee-4f3d-b879-c5fb7fcbf4ef","resolution":{"observed_at":"2026-08-15T22:43:20.564459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.549613Z","title":"Ames: Asymmetric and memory-efficient similarity estimation for instance-level retrieval","venue":null,"work_id":"8ca7bef3-f1ed-4f59-a3d0-651ab17ff796","year":2025},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.899583Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:1cfd5d561f4fb05d0b70f18b819b4902e4311404516b32a5439cc300fff18521","observation_id":"eb33f60b-9589-4f2a-96dc-8228a97bc9e2","resolution":{"observed_at":"2026-08-15T22:43:20.553662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.537220Z","title":"D3still: Decoupled differential distillation for IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY 13 asymmetric image retrieval","venue":null,"work_id":"8e94e8d1-7764-482e-94c0-df23fb6e7dd8","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.903096Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:190b234ce72b15091fb4dbdaa2118a83ca79a5d9a5a2b970dde13e13eccc29b6","observation_id":"48b0ec08-019c-410a-b8e9-77499a9cf2b2","resolution":{"observed_at":"2026-08-15T22:43:20.541067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.525952Z","title":"Domain adaptation by constraining inter-domain variability of latent feature representation","venue":null,"work_id":"b5ebacf5-8c61-46d5-aa00-7e1865eb6869","year":2011},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.906898Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:968954f40db4794abdd364d4d3b4917a4595824b04355b38bbfbb8d27ddcfadc","observation_id":"4ac88705-f153-422e-bf6a-82bf7247e4e8","resolution":{"observed_at":"2026-08-15T22:43:20.529923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.514025Z","title":"Exploiting inter-sample affinity for knowability-aware universal domain adaptation","venue":null,"work_id":"96da7d3a-8e1c-4f0e-bc32-f152a4b95cc9","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.910733Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:064095725e9cf432d9670ace791b5f4bcffb4c4d19eeae5f038456699e0512b0","observation_id":"2878e0a0-7691-4098-9b04-b04e529d13e7","resolution":{"observed_at":"2026-08-15T22:43:20.518463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.502685Z","title":"Mining inter-video proposal relations for video object detection","venue":null,"work_id":"6a56fae5-f97b-49ee-9d0e-1a15008ed671","year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.914440Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:2f29b56928729ca976750cd759a18113b97f7c5774e6bc5052d4648a56e7d288","observation_id":"a840d690-32ec-43a0-bd48-9c6909e6b3b7","resolution":{"observed_at":"2026-08-15T22:43:20.506595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.490608Z","title":"Imc- det: Intra–inter modality contrastive learning for video object detection","venue":null,"work_id":"5d73da2b-9974-43f9-8895-582d7a2ea77d","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.918055Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:b356a3fab19b0bfd7ac20b024370816f40495ce39aedb17c6ae7a17d55c6ad54","observation_id":"bb8bf427-649d-430d-85f6-a1fc1e2e7fe2","resolution":{"observed_at":"2026-08-15T22:43:20.494911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.921774Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.921774Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:be463e846979019770c430cc97034ca8bfd228850133b4cc8e30e5e8fee4efcc","observation_id":"5a705531-fb85-41f1-a9c7-95b2b0d9a686","resolution":{"observed_at":"2026-08-15T22:43:19.921774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.925344Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.925344Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:c0233a69f81d5cb8895ca5ef49c7ad0f33514811e9527b3293f776055d789f90","observation_id":"34d91ec7-8161-433a-bc3e-7e5a1b606598","resolution":{"observed_at":"2026-08-15T22:43:19.925344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.464067Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"94b909ca-838e-4c65-bbf2-6684f13c942f","year":2014},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.928843Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:ca6071c3b19e9029bae678e27195bf367cae33d06cb7224a5ff0572f9464fc13","observation_id":"643042b8-3a5d-499b-849d-f1e13cc517bb","resolution":{"observed_at":"2026-08-15T22:43:20.468032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:19.932548Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.932548Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:96f2c87001c86af0a39a80302127e143ef198ac9c36eddab0a0cb9e13eb1a37d","observation_id":"325488be-9b22-4eb5-aba9-10356ae214d4","resolution":{"observed_at":"2026-08-15T22:43:19.932548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.445173Z","title":"Dense-captioning events in videos","venue":null,"work_id":"d5ed3e2c-88ad-444b-824e-26545ed9f069","year":2017},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.936257Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:8afc9a82327f42db51a4c8c92613fdafd49ee1f0bc1c1db7d0f5200979d81b1c","observation_id":"d6b2202e-7151-401d-83f8-781a14b6c0d1","resolution":{"observed_at":"2026-08-15T22:43:20.448977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.434283Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"0aa84ae7-59d0-49f2-a504-13b20943dd8a","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.940024Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:3eb99d42a9cc747008969d3927798fd519938c92ab9e1cd4f71f13f602bdfd86","observation_id":"4b5f6e7b-f8e4-4956-b22e-f48d609f706f","resolution":{"observed_at":"2026-08-15T22:43:20.438350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.423580Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"e4afe137-be7e-40bd-b2f0-bb9839d23591","year":2017},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.943546Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e9297f24089e72c43c579a3a992ce90b2ba96728758570599666688b62adf4d8","observation_id":"0304d4f1-a88a-4c41-b91f-667ca9014b85","resolution":{"observed_at":"2026-08-15T22:43:20.427536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.412589Z","title":"Revisiting the\" video\" in video-language understanding","venue":null,"work_id":"827fe959-590a-4aaf-a1f9-6f745ba9f406","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.947174Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:d49b1038705ab3d26bfa3f2e9fd26e118b2883537c4d0e30c8a10ffd6613044e","observation_id":"c3e7adf4-078f-4dd3-a472-f685746e80cf","resolution":{"observed_at":"2026-08-15T22:43:20.416645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.400906Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":"f8248d58-534a-4b3c-946d-2aecc5e97fac","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.950847Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:43e1efdd8946bf98a26941b2e149a0cf8ed3a1e04e67b1c5e087b217c8d2e21f","observation_id":"6b411558-8d9e-4ac8-9fb0-66be5580f1c4","resolution":{"observed_at":"2026-08-15T22:43:20.405017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.389538Z","title":"Weakly supervised temporal adjacent network for language grounding","venue":null,"work_id":"ce8642bb-fa19-47f5-9253-d4b683f1e44a","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.954466Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:61d595d20bd91ba9a239986e2ed32a7d73e4b6287c7b575ddf7c54fd5bb6cd30","observation_id":"b7bee19f-a9d6-4415-bcd6-9887b201c1bc","resolution":{"observed_at":"2026-08-15T22:43:20.393475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.378320Z","title":"Reinforcement learning for weakly supervised temporal grounding of natural language in untrimmed videos","venue":null,"work_id":"ccfaf775-366e-42d6-adcd-333b45d2d6f0","year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.958346Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:1b1e01c2d6d0629a7ea3e790f7d7f0f1f54f126c9b9d957f9b7c8ceedc35c064","observation_id":"96918027-900f-49c0-bf59-eb40fc637cd9","resolution":{"observed_at":"2026-08-15T22:43:20.382337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.366129Z","title":"Counterfactual contrastive learning for weakly-supervised vision-language grounding","venue":null,"work_id":"4c2ac08c-3b75-4067-be88-69cdb4ac94f4","year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.962187Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:baed766d7d5d5abad5347b1de654e42a67c1a640371f299cafe05bf9712e6e6b","observation_id":"d581b098-0427-451f-ac73-107b7df7c901","resolution":{"observed_at":"2026-08-15T22:43:20.369993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.354463Z","title":"Regularized two-branch proposal networks for weakly-supervised moment retrieval in videos","venue":null,"work_id":"39ed23f8-3322-42d5-b20c-ca0e6c9b1b4b","year":2020},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.966570Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:044ad2a004e5c1c753c644e332af16d953f1c24fb9626f3da6b1bb4218414545","observation_id":"54067aa4-07b7-4443-a898-8e85e1064ab5","resolution":{"observed_at":"2026-08-15T22:43:20.358746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.340983Z","title":"Visual co-occurrence alignment learning for weakly-supervised video moment retrieval","venue":null,"work_id":"78ff2d50-9888-4776-9f9f-5644c0b508c7","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.971211Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:d7897ff2b8114705c81b8770365503779413b487421a787339f0c5bad40f9d48","observation_id":"abe4be8a-3fa3-4bcb-855e-bc106c07f576","resolution":{"observed_at":"2026-08-15T22:43:20.345920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.329110Z","title":"Local correspondence network for weakly supervised temporal sentence grounding","venue":null,"work_id":"568e99b6-e6f9-4f23-a3bf-c5b1d5c00a52","year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.974812Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e76fe0efed543f35d856f414cf9df65fc2624fa2f36c2254da5bc457ad33145b","observation_id":"7935f0c9-5e6c-4147-95c0-963d1cfbb8a1","resolution":{"observed_at":"2026-08-15T22:43:20.333119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.315545Z","title":"Explore inter- contrast between videos via composition for weakly supervised temporal sentence grounding","venue":null,"work_id":"b13d3327-9437-4353-bead-0f154a3028c5","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.978468Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:84c029379bb16de74584be10d007c593f3ea43cccf2abb6e7bb34fae306723c6","observation_id":"ad9a5107-7ac0-4f5a-b405-d74d293f050b","resolution":{"observed_at":"2026-08-15T22:43:20.320700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.302239Z","title":"Dynamic contrastive learning with pseudo-samples intervention for weakly supervised joint video mr and hd","venue":null,"work_id":"7a4e9682-22bc-434e-9fef-fa71df308904","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.981898Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:e57093628e14a2f960363a90362a06b3d89ae177d3778d8ac3a049d7ca19ace5","observation_id":"ed3e6f22-0b46-490c-8477-eaed0677603e","resolution":{"observed_at":"2026-08-15T22:43:20.306332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.290691Z","title":"Counterfactual cross-modality reasoning for weakly supervised video moment localization","venue":null,"work_id":"a6816b72-f3f6-4bea-8979-820f674e3a9b","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.985503Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:b710ed73eb13f627d03f90eca10095e00e0f3561533d885e6194a5e96b592936","observation_id":"21b5e737-1f67-4cec-a1b8-42a8e461281b","resolution":{"observed_at":"2026-08-15T22:43:20.294687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.279220Z","title":"Scanet: Scene complexity aware network for weakly-supervised video moment retrieval","venue":null,"work_id":"801a80d1-1805-4df6-8cd2-fa85bc5db20f","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.988989Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:f8d994ccb74d345cc152a1ca1d3a304760cb60836fe3e38fddda46fe412aa8ba","observation_id":"d4e82e30-c6b2-4890-95ce-4f5cb67f8131","resolution":{"observed_at":"2026-08-15T22:43:20.283182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.267555Z","title":"Omnipotent distillation with llms for weakly- supervised natural language video localization: When divergence meets consistency","venue":null,"work_id":"bbd12a10-cc32-479e-903d-d24404faccc5","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.992618Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:ba8100be75e7d5c93ce7c1905a10011db56655cc298780bb419d437c1a7b3035","observation_id":"28fde601-d8f7-4fbc-a635-2f75245b1381","resolution":{"observed_at":"2026-08-15T22:43:20.271532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.256216Z","title":"Local-global multi-modal distillation for weakly-supervised temporal video grounding","venue":null,"work_id":"101f7b4f-c688-48b1-913e-b3f39ac2c969","year":2024},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:19.997464Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:56bf9ee14515f9bf24b6aa1486588b9ae872aeddf28f840f41c43e8970831ead","observation_id":"7908f722-4948-4fc5-80f2-eb6493d73e45","resolution":{"observed_at":"2026-08-15T22:43:20.260219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.001159Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.001159Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:56f66b9ce4a6fcee3d8e069fcfbf8b258bf87852c08c2667ce72ebb6c03e2f48","observation_id":"05623014-2435-4f94-93ee-da20808d0205","resolution":{"observed_at":"2026-08-15T22:43:20.001159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.004978Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.004978Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:7b78bb32e9668a7e00c7e589ae3f79f9879337f713d266b232b3c52327acb811","observation_id":"686ce1de-e499-49bb-974e-2da524ae188a","resolution":{"observed_at":"2026-08-15T22:43:20.004978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.008815Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.008815Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:9b4f6e826e6729ed7255abd03bc2ef573cffe7db750ee4fef908dbe23906c5c7","observation_id":"416b530e-22d5-46ff-87bf-9439998500ae","resolution":{"observed_at":"2026-08-15T22:43:20.008815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.012289Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.012289Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:fd29a0c3dbd0100c732615403bb73165b7adeeae0c16251528ac59fbd41a26e8","observation_id":"a4cfb65f-3895-4343-9edd-552fffb88ec2","resolution":{"observed_at":"2026-08-15T22:43:20.012289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.216494Z","title":"Video graph transformer for video question answering","venue":null,"work_id":"4bdb229d-351d-4671-8772-235fe6e260a2","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.015759Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:575f160dc6c29062e5e4ccdb9e1648356939620b92da6f6c4a85cb0c5122f518","observation_id":"b24a125d-84da-472d-90fb-ac47ef9235fd","resolution":{"observed_at":"2026-08-15T22:43:20.220452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.205007Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":"e9c381fb-2d2a-4758-9df1-6158ecb1c4a2","year":2014},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.019077Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:fbe50144729df5987b9d889d67041a3b6b6465d3d5043846f43428f1213e3cd3","observation_id":"ab7800b2-1a36-4d0e-b8ad-0f70589be518","resolution":{"observed_at":"2026-08-15T22:43:20.208954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T22:43:20.023267Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.023267Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:6174e31a4725854e70c0cc4dc914dd09a8f7dfbc81ddb053723a8e9fbfb8f8d3","observation_id":"a310cc85-523b-415a-8fe0-70d718011f08","resolution":{"observed_at":"2026-08-15T22:43:20.023267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.191571Z","title":"An empirical study of end-to-end video- language transformers with masked visual modeling","venue":null,"work_id":"52773cc0-556d-43be-a502-1ed49a54195b","year":2023},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.028863Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:dc1290ac10bfaa3595ece143e1399f436bcacb983ad8b0bb8be91e9bdc95f551","observation_id":"23f2386d-ec4e-4133-8838-d27ee202579c","resolution":{"observed_at":"2026-08-15T22:43:20.197067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.179888Z","title":"Video swin transformer","venue":null,"work_id":"925eac4d-7608-4e81-bb88-c3bf7df15bd4","year":2022},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.032674Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:8ced734ac0f8ad19608a66ac70db56e5a6a6369326f159962ed9e79535684d95","observation_id":"487f9db1-acfd-49e1-b854-d87899b7d05a","resolution":{"observed_at":"2026-08-15T22:43:20.183931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T22:43:20.036070Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.036070Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:d4992dcbfcfe60badc7e4e61e5ec5d922b5dfd38b14dc8b3dba86e510a286a47","observation_id":"46d8acbe-9cf4-415d-8536-cce0ddccb539","resolution":{"observed_at":"2026-08-15T22:43:20.036070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T22:43:20.039918Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.039918Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:457af5cf5f51a48194c84bfb58cdd0dc0f5dcbc06e3e6e9785c2a96fbbf02f2d","observation_id":"e1de9da1-8a41-4052-acd5-8b5cc605d58d","resolution":{"observed_at":"2026-08-15T22:43:20.039918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-08-16T13:36:21.119762Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-15T22:43:20.043878Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.043878Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:42f0860284579c274efb1577641c7cf5f772c51ae0290cd447720bfbc657c4d9","observation_id":"f3c689d7-8bc2-4a67-a0f7-7d6ec7e8cf44","resolution":{"observed_at":"2026-08-15T22:43:20.043878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:43:20.164931Z","title":"Visualizing data using t-sne","venue":null,"work_id":"d65ede74-f290-411f-8bff-efafc4678ec9","year":2008},"citing_paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T22:43:20.048571Z"},"links":{"citing_paper":"/paper/2505.06557"},"observation_digest":"sha256:def74e74dbd4ed620c176bb9224f6b7f4b5046287abd947fceb70afb438347b2","observation_id":"d2458d1d-7c91-42b1-bc92-2181972fac9a","resolution":{"observed_at":"2026-08-15T22:43:20.169778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.06557","last_updated":"2025-05-10T08:03:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T10:12:42.954645Z","submitted_at":"2025-05-10T08:03:00Z","title":"Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":63},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2505.06557."}