{"as_of":"2026-08-13T11:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:070a7899ebb62ecbafd135c8f7a248d5fb75928c386e673b09b0114d91d4b3a6","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:30:58.855512Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:31:30.702800Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T04:31:30.785644Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"cited_work":{"arxiv_id":"2508.03410","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03410","snapshot_observed_at":"2026-08-06T04:31:30.785644Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","venue":"cs.MM","work_id":"e52a12ae-887a-4ab2-88dc-5dccfe740bc7","year":2025},"citing_paper":{"arxiv_id":"2508.03409","last_updated":"2025-08-05T12:55:06Z","snapshot_observed_at":"2026-08-10T22:59:03.030909Z","submitted_at":"2025-08-05T12:55:06Z","title":"Cornelis Easton:The Milky Way as a spiral galaxy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:31:30.702800Z"},"links":{"cited_paper":"/paper/2508.03410","citing_paper":"/paper/2508.03409"},"observation_digest":"sha256:cb5b4e4dfd36c26c807b2bf0cd0786e8a2fe252df5f2d49add4b55a6df230d0e","observation_id":"bb072915-1027-4b07-bcb8-ca1f9d69bb33","resolution":{"observed_at":"2026-08-06T04:31:30.867218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.03410/citation-record","integrity":"/paper/2508.03410/integrity","json":"/paper/2508.03410/citation-record.json","paper":"/paper/2508.03410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:05.219804Z","title":"Self- supervised object-centric learning for videos","venue":null,"work_id":"777020a6-0401-4656-b216-4f39794bc414","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.315227Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:8a15baebb382e5fc1021a05b8114b14279a4178dab03baf70d3bbea4ed1805d6","observation_id":"853abf69-ed9e-4ba1-9e1c-aac611e0a97d","resolution":{"observed_at":"2026-08-06T04:31:05.285548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:05.023280Z","title":"Invariant slot attention: object discovery with slot- centric reference frames","venue":null,"work_id":"3b49c4a0-260f-4934-994b-13181c423145","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.385986Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:b7b09c9035f0bb728f51dc7902e442d8866f8bb6913218510f127527e4dbd148","observation_id":"afa7eafe-1c6b-495e-aa81-aad8e3b9446f","resolution":{"observed_at":"2026-08-06T04:31:05.128437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-08-13T08:44:00.110334Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-06T04:30:56.451793Z","title":"MONet: Unsupervised Scene Decomposition and Representation.arXiv preprint arXiv:1901.11390, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.451793Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:f1a57fc5a764746216db8be6bdd58ad2ceca9d7b9681121d27455b533ad0d1b7","observation_id":"788d4df3-a31c-4f4f-98b0-77e2e490960f","resolution":{"observed_at":"2026-08-06T04:30:56.451793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.841369Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"cc9e546d-3be4-4218-80a0-bac5a220600f","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.539206Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:c05c2851bcd259009d8ffdeff866aa220c1e4640667309148dd35b4515d9d7aa","observation_id":"e0b0dcf3-e677-4c6c-bdf3-e74073ec048f","resolution":{"observed_at":"2026-08-06T04:31:04.939414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.697785Z","title":"Sobolev training for neural networks","venue":null,"work_id":"19164433-452b-4bda-a975-70f6fcccda93","year":2017},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.608318Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:4a9a71b52cabcda62ae1bdb476f651e4dd86699c6a9b26d397eed8c0c7ccd2b1","observation_id":"a835b49b-c214-476c-becb-a1db42252975","resolution":{"observed_at":"2026-08-06T04:31:04.752038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:56.664516Z","title":"CTRL-O: Language-Controllable Object-Centric Visual Representation Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.664516Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:e61c27ec53b5af17e253bb5005789ae6202a381211f816ada98c871c8cb2ae7f","observation_id":"7ea62f96-40c5-4b5c-a6ae-7891b212fdbe","resolution":{"observed_at":"2026-08-06T04:30:56.664516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:56.725716Z","title":"SA Vi++: Towards end-to-end object-centric learning from real-world videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.725716Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:1b4436360162057dccd5d1457795aa5270e4f67655cc45215ca066ee75fa4d0f","observation_id":"f930be02-3da2-4fcc-92d6-29c250c9037a","resolution":{"observed_at":"2026-08-06T04:30:56.725716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:56.774375Z","title":"Adap- tive slot attention: Object discovery with dynamic slot num- ber","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.774375Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:7970bd9c36b8c6fa46872bf219af468f0ad39d72566b034b2d9ed30939237710","observation_id":"13164b92-a76f-4537-9434-634e112842e6","resolution":{"observed_at":"2026-08-06T04:30:56.774375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.506743Z","title":"MoVi: A large multi-purpose human motion and video dataset.PLoS One, 16(6):e0253157, 2021","venue":null,"work_id":"9fb6aecb-a533-474f-8893-21c5b5cdaf26","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.839087Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:241125c1dd247ce54253016674a879631a9449d8e96369b86612cd06b9ec53d7","observation_id":"d236eda9-cf8d-4093-ab34-4d7c9f54fc61","resolution":{"observed_at":"2026-08-06T04:31:04.582904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.318391Z","title":"Tagger: Deep un- supervised perceptual grouping","venue":null,"work_id":"200f0af7-fc57-4a3d-bfb2-ecfba85ee0a0","year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.896320Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:4cbabb2a3e8cc637a15e5ab0a0b755f9204902005a943e1c37277d79f82386a0","observation_id":"9bebab07-a7b3-4fab-b6e9-c7711aca7fd3","resolution":{"observed_at":"2026-08-06T04:31:04.421492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.132840Z","title":"Neural expectation maximization","venue":null,"work_id":"391f30fe-0b7a-4be9-96cf-0f2e501579de","year":2017},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.954368Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:ab1c3198f819c2981f7509fcbde35ac69d4d5e397f778f011ca88fd2ec1c6eb4","observation_id":"3dbd392c-dc5c-4cfe-87f1-d1009247cf78","resolution":{"observed_at":"2026-08-06T04:31:04.211712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.920034Z","title":"Multi-object representation learning with iterative variational inference","venue":null,"work_id":"190abdbf-cdae-403f-b131-b2b45482a755","year":2019},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.010076Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:6a0cff988b5dbe6dfa9c4972c60fed81d3232adf36ef75d8a45d67f0c969c0f1","observation_id":"5d1fec2e-4287-4024-bcb6-510d26a8e419","resolution":{"observed_at":"2026-08-06T04:31:04.031103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.693734Z","title":"MiniLLM: Knowledge Distillation of Large Language Mod- els","venue":null,"work_id":"af0086f7-6f83-4f89-95bd-c12f387cec40","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.073725Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:fc0efd7f33ac38624ca22b1f94af79f649666a0d60f449f7b98e8c710bd23e73","observation_id":"f8ef2d4b-b7b5-40ef-922d-7bb24ddd1f00","resolution":{"observed_at":"2026-08-06T04:31:03.799045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.483268Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":"c50966ac-5e21-4440-ae72-f96ce219c435","year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.122200Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:0d7f188f0e0a833c2b748ea1eef3f2f1945bdfae2474643865174ebded2dee97","observation_id":"5782148d-ac6e-4093-9c78-edd1cd0cfef9","resolution":{"observed_at":"2026-08-06T04:31:03.587311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T04:30:57.206596Z","title":"Distill- ing the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.206596Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:6132164312a0468be5f4160ba955f54f244dca7af6a45b62b2cc947ada646f81","observation_id":"00520d13-c187-4762-9a1a-6a8358dab990","resolution":{"observed_at":"2026-08-06T04:30:57.206596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.288083Z","title":"Multi-level feature distillation of joint teachers trained on distinct image datasets","venue":null,"work_id":"d45cee95-0a81-4be4-8d11-184a9a48020d","year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.274758Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:848a7f0d62cb70fffd216aff9c11ef2f04bf1036de4cc4edacba09310c4de6eb","observation_id":"bc62d036-bb5f-4dc8-bd36-387ca04eca9e","resolution":{"observed_at":"2026-08-06T04:31:03.365189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:57.347323Z","title":"Improving object- centric learning with query optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.347323Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:01b2500c9f43b078e3ae6fd83bf66b8830a045bf3927c5d22b1f20aacba3fa52","observation_id":"d71c245f-57bd-4c87-a2cc-7f44af9ecddb","resolution":{"observed_at":"2026-08-06T04:30:57.347323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.996373Z","title":"SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers","venue":null,"work_id":"69924117-5e63-4521-9941-df3daca93e26","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.389490Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:b511f3cda3dff653e2ef1287633d54ad23cac43efaf03a9714de06e0d700807a","observation_id":"00622ac3-50ac-4062-885f-51679a8509d7","resolution":{"observed_at":"2026-08-06T04:31:03.157503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.757828Z","title":"DIOD: Self-Distillation Meets Ob- ject Discovery","venue":null,"work_id":"afb476f6-fd20-4d17-be1b-27c1a2b1be28","year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.480626Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:7e15bc856ba19b8aebeb19f687fee90848fd6ca9c2bcbff65ffb2fe4aca3ee4c","observation_id":"4b2b0fd7-dc79-405d-a25a-498f0a23ad8a","resolution":{"observed_at":"2026-08-06T04:31:02.866586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.537236Z","title":"Elsayed, Aravindh Mahen- dran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jon- schkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"fe98a19c-7606-428e-9b1d-b6b5a7f57ce3","year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.547467Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:da919fccf684fb583753f3a98d0aa6514d91ae9a4a909bbced439974e1dc34c3","observation_id":"62c6b32d-722d-4918-a9fb-e5f478849866","resolution":{"observed_at":"2026-08-06T04:31:02.637383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.298672Z","title":"Object-centric cross- modal feature distillation for event-based object detection","venue":null,"work_id":"311805da-b4cc-42b4-98bc-a8f5f02cd2e6","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.618336Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:0a1747532965e53592eec2554f24a3fb6a410b3abc12ee6b29343f300b4d4ac6","observation_id":"8c313c9c-04d6-4ee1-82ae-ddb00b39d19e","resolution":{"observed_at":"2026-08-06T04:31:02.437533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.051642Z","title":"Hashimoto","venue":null,"work_id":"5859049d-84bd-4d3a-94c9-5bd9f59a07d5","year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.690861Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:72364072ff2567030f0d25b2cf294e91eff1856b472d3926b874375f87ccfbdc","observation_id":"21f4a567-791d-4453-ab7a-96d1ec00b5b7","resolution":{"observed_at":"2026-08-06T04:31:02.138735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.868859Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"c43168a2-d438-4d11-ac06-dd98cb3301da","year":2014},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.778202Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:67c3a42cf0759b2b1604e153180dde2057b25cbc9d6b4e94b39f4373fe56b76d","observation_id":"d0f3c9ce-1e28-420f-822d-f92e0ddfed7a","resolution":{"observed_at":"2026-08-06T04:31:01.961664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.674246Z","title":"Object- centric learning with slot attention","venue":null,"work_id":"b81b2923-cb10-482e-8852-b9615f93cec2","year":2020},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.874877Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:86b8ed7ef3ae77762690f2ca06fc925b4dae679aad6b72cfe464b6ddb5417a75","observation_id":"492b0791-372a-44d9-a45a-58deda931865","resolution":{"observed_at":"2026-08-06T04:31:01.761165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.453509Z","title":"Temporally consistent object-centric learning by contrasting slots","venue":null,"work_id":"4c050aa4-f1e7-48fa-bf66-42f9bcfbe1c4","year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.969711Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:bcc04a2fa203c7634edfffb988a072296151491937c32147ba944d14d02084c3","observation_id":"d13e6d06-ee1d-4dfd-866b-a4b6a6ad3d0e","resolution":{"observed_at":"2026-08-06T04:31:01.576513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.147369Z","title":"DINOv2: Learning robust visual features without supervi- sion.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"28633066-fe8d-48c1-b8dc-d5fc2d6993ab","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.071804Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:7255c587202d2220bae3cf36f68a911fff7a427f73cf87c65b95f293b7047788","observation_id":"01100cb7-ef8f-4908-ad72-21d653f1ccaf","resolution":{"observed_at":"2026-08-06T04:31:01.311964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:00.834343Z","title":"Perazzi, J","venue":null,"work_id":"26d19509-8870-44ac-95b4-f2e75ecc4640","year":2016},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.150727Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:e7fb89fdee24f7b77905dd48dc3960374cec53a02d3af5fbb18b2739ac78b659","observation_id":"998a1e18-719b-4f53-b3f6-dbb637f54a42","resolution":{"observed_at":"2026-08-06T04:31:01.016609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:00.516331Z","title":"Torr, and Song Bai","venue":null,"work_id":"ff0dedb2-4e6c-4114-a3d4-63b284e9239d","year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.223978Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:17ca45723257626cfed20314e3d36975c4a5ab721579d76b4f10559723de1aa5","observation_id":"f3dca698-d562-411f-996e-b2d9e1717786","resolution":{"observed_at":"2026-08-06T04:31:00.692495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-06T04:30:58.248095Z","title":"FitNets: Hints for Thin Deep Nets.arXiv preprint arXiv:1412.6550,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.248095Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:e81850c54f0dbaabb056e63745444807c365a645cffdf9d86bf042a0e15a8671","observation_id":"f2d0397d-f3bc-4e86-8f64-26d5d111339e","resolution":{"observed_at":"2026-08-06T04:30:58.248095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:00.205823Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":"24d684e4-51e2-42a9-a72b-fbfa346ae330","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.306675Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:a5e354b6e53cddeeb7608074be687030159040e6712ae9d4b7a37dcd761d0d25","observation_id":"c0adba32-53f7-49ed-83e2-d08b174b2882","resolution":{"observed_at":"2026-08-06T04:31:00.372198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.862704Z","title":"Simple unsu- pervised object-centric learning for complex and naturalis- tic videos","venue":null,"work_id":"d7fb13da-ecc7-4d91-9b50-5396f266a024","year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.384400Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:8ceb54b116a9611a67b4c5828d5feaefacaf57a94ca6155fae5403c1dec0cbbc","observation_id":"623dff23-c2ad-4960-95f6-3d55c66f6bb5","resolution":{"observed_at":"2026-08-06T04:31:00.032058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.684208Z","title":"Self-supervised video object segmentation by motion grouping","venue":null,"work_id":"17719e7a-cecc-4ece-bc98-6b39b79ec8f3","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.454779Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:a81ddaf006930d287cf4412f764371a46bf9c1fbeed9dbfa038ab44035611d02","observation_id":"4109caf7-3d09-4470-9f27-fc1938d7b9df","resolution":{"observed_at":"2026-08-06T04:30:59.789129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.542582Z","title":"The 3rd large-scale video object segmentation challenge - video in- stance segmentation track, 2021","venue":null,"work_id":"74540fb5-9bdf-4423-bad2-b960092b1aa9","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.585604Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:214d6d150108130fb30e26c3fe69b66b23bcd4c1c2ae51c17d7fe7f251bcf4d6","observation_id":"60a88745-0076-4b62-9070-000ae8c311de","resolution":{"observed_at":"2026-08-06T04:30:59.606311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.322076Z","title":"Object-centric learning for real-world videos by predict- ing temporal feature similarities","venue":null,"work_id":"6b7225d2-b41b-4d7b-83f7-fc4a2c755f6b","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.699996Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:a4fa53538505e355a054bf74ff393017ce2fec365089c84c9735cf2e4ca1ce08","observation_id":"92a05be0-e7c7-42ad-ac55-0297dd531122","resolution":{"observed_at":"2026-08-06T04:30:59.442514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.149869Z","title":"The SLOTMATCHstudent based on DINOv2 is compared with an equivalent architecture without distillation (no KD), as well as its corresponding teacher model","venue":null,"work_id":"49562ebc-d1aa-47e8-a15f-7bdba945d91e","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.777597Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:c89fbe02cd535903374d287a2695025d634285c61b5efbd05016acb52cf2302c","observation_id":"8855759e-aea4-430e-ab96-00dc24dfd321","resolution":{"observed_at":"2026-08-06T04:30:59.223002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:58.986875Z","title":"In preliminary experiments, we found the standard deviation for FG-ARI, and mBO across seeds to be within±0.06 and±0.29 on YTVIS, indicating stable convergence behavior","venue":null,"work_id":"2bacf346-add0-4daa-afad-0c772a3aad2d","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.855512Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:d6b1ca3c8f6077d06ce0804f5b87c1b4cfd1868ec1fd59b00cd03871570cb44a","observation_id":"fe00adde-0429-40ae-8600-88453e16f351","resolution":{"observed_at":"2026-08-06T04:30:59.064396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-13T11:43:07.639818Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2508.03410."}