{"as_of":"2026-08-13T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79c01ce3f63dee8ad288103ebb82458657f2e2d5d5d6536ad3687aeec0888fa4","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:25:09.031246Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10963/citation-record","integrity":"/paper/2507.10963/integrity","json":"/paper/2507.10963/citation-record.json","paper":"/paper/2507.10963"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.145765Z","title":null,"venue":null,"work_id":"937c1956-339c-44c1-acaf-483d9fb08865","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.234694Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:929470701215d77f4c005cf376f9fbe91ba1698ee53a6215eafcbc73a8a9a1da","observation_id":"a6b0050e-9fd3-4062-9854-7c5975913c66","resolution":{"observed_at":"2026-08-06T17:25:17.150413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.438288Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.438288Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e947bb9d897bb949d45e58ef07c6734d1038265408874c26d1f8a2dfe3ed3f7f","observation_id":"de70491a-86b1-4aa4-95e5-44e4645c97c3","resolution":{"observed_at":"2026-08-06T17:25:01.438288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.692791Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.692791Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:ea51148b2b065f80a67a7164c491005d3ab45faab2a2fc1c329aa5924a87adff","observation_id":"77ab3a9b-c324-4e71-9f5c-92b3ec3e8b21","resolution":{"observed_at":"2026-08-06T17:25:01.692791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.785844Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.785844Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a1db3d234195c5ff6b326c5c0a0dfe4976f60c91b84f069c745f4d36b7452345","observation_id":"7b7bfa68-3a44-49d4-80ff-37e4e993fc31","resolution":{"observed_at":"2026-08-06T17:25:01.785844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.866822Z","title":"Cai, Jonas Jongejan, and Jess Holbrook","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.866822Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:9f52b2bfdf0ad51ad1cccf79cb645d90112823fde56a4998587309f60f2e872d","observation_id":"db8bf02f-96e6-443e-98ce-60a321e659e9","resolution":{"observed_at":"2026-08-06T17:25:01.866822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:01.926484Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.926484Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:69d706c0fe1e3cf2a96d7357bbe42eb570b148a3d816f4efe20a4f9b89a73a5f","observation_id":"433c053b-819b-4013-8c67-cb5491bffa54","resolution":{"observed_at":"2026-08-06T17:25:01.926484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.063720Z","title":null,"venue":null,"work_id":"e92d771b-ac63-4ce3-9b31-929abbb83e53","year":2020},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.986252Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a9e30db0055487e83505089308a85620dedb3913b686c30242f71b6b6bec02a2","observation_id":"72930a05-4636-4a30-9ff0-d4c07340f92e","resolution":{"observed_at":"2026-08-06T17:25:17.069225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.071816Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.071816Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d7dfee06c56f5850949f270b8fab5d5aea2cd26dab909413e1c080a1e2b10ddb","observation_id":"411ba6c3-e696-40cc-b7bd-e46f7958601b","resolution":{"observed_at":"2026-08-06T17:25:02.071816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.172870Z","title":"Guillain, Hyeungshik Jung, Vivian M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.172870Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:af444bff6158f03b19b994f9f1ca27df5c19ee37dcb1fdba6d8f69783de318ce","observation_id":"96060456-9ba9-4aaf-973b-f04abb3307fc","resolution":{"observed_at":"2026-08-06T17:25:02.172870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.273487Z","title":"Corbin and Anselm Strauss","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.273487Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1ccf21a3eac290f94618118c7d0ebf8b931b0fd305efd5654f52f9862cabcd34","observation_id":"d9adcf12-8835-43ae-be36-d599ea0ce08e","resolution":{"observed_at":"2026-08-06T17:25:02.273487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07968","last_updated":"2024-05-29T21:06:18Z","snapshot_observed_at":"2026-08-13T05:51:03.010462Z","submitted_at":"2023-10-12T01:17:56Z","title":"Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation","version":4},"cited_work":{"arxiv_id":"2310.07968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07968","snapshot_observed_at":"2026-08-06T17:25:15.083817Z","title":"Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation","venue":"cs.RO","work_id":"622a3974-576a-40c2-b23c-ba4cfeb5d1c8","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.392546Z"},"links":{"cited_paper":"/paper/2310.07968","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:feaab931747354fd1d3fcc814fb083adcca880602347e3b538431e23c65f7599","observation_id":"f265e18b-bf87-4648-a967-c406052fc838","resolution":{"observed_at":"2026-08-06T17:25:15.125294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:02.474114Z","title":"2001.Where the Action Is: The Foundations of Embodied Interaction","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.474114Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:ed6babc1cad0c61a7ebcc32a8cc1a92e9daa835c2920ec63be626707351aba52","observation_id":"adf4666e-e628-42ff-9ac2-2194fff09faa","resolution":{"observed_at":"2026-08-06T17:25:02.474114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3107.2025","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:14.941780Z","title":"Hudson, Mahya Beheshti, Mau- rizio Porfiri, and John-Ross Rizzo","venue":null,"work_id":"02be1095-9363-4922-985a-dc80468e6f89","year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.553998Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e1caff9ff5f60e32a520354ee05f075b4321104033bdf301e5f6e60315fbac60","observation_id":"d7a9e337-62ca-421b-8d34-1466bc03bba6","resolution":{"observed_at":"2026-08-06T17:25:14.995385Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4324/9781315707228","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"2016.An Introduction to Audio Description: A practical guide","venue":null,"work_id":"a213aef0-d0f8-4f09-98c2-8802952dfce1","year":2016},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.643034Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:63602bde7d91f06dd67fff584028fee25db44253148c8d6271d9116089846f9e","observation_id":"16bbb278-e162-429e-9a84-0933326a65b5","resolution":{"observed_at":"2026-08-06T17:25:10.623645Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-12T09:36:58.123071Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05185","snapshot_observed_at":"2026-08-06T17:25:02.720820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.720820Z"},"links":{"cited_paper":"/paper/2412.05185","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:c606b9b3ac2be782840664c5850e9fef42a49529c0cbf4cc96f0d34f9e168c07","observation_id":"e555be81-c022-47df-b305-a1faed9b8205","resolution":{"observed_at":"2026-08-06T17:25:02.720820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.047254Z","title":null,"venue":null,"work_id":"2be7689c-498f-4ae9-a1e1-257f1567bdb1","year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.825936Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f8fa31f48a19b7c41c04987a592906b81d58403d74b6167a446d747ca051669e","observation_id":"e7015431-5506-4cb4-b0ee-5348ec2a0fd8","resolution":{"observed_at":"2026-08-06T17:25:17.052473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.028186Z","title":null,"venue":null,"work_id":"aa28f7fc-5f61-4089-be78-c0b82a2652de","year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.928330Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8797344d20e1659cee5dec8024a8778152ea7671a6f0fe31b53063b66a6dd90a","observation_id":"982b91ef-a6f0-422c-a7ee-360511134124","resolution":{"observed_at":"2026-08-06T17:25:17.032942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.009667Z","title":"Xu, and Jeffrey P","venue":null,"work_id":"5cac8e42-a1a3-4cba-a8d4-2116dc25e765","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:02.984922Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:375b8e7c2651039900ca672e6199c13dc126008080e55e99217a3e7097e6beba","observation_id":"e5196d14-f9cf-440e-9838-f85bc5d01032","resolution":{"observed_at":"2026-08-06T17:25:17.015053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.102194Z","title":"Haggard and Kenneth S","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.102194Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:90e5f7b9ec959277285e843c011593224454b56e106b63445266aadffb56d120","observation_id":"23947244-08a6-440b-a12e-edf658344f4d","resolution":{"observed_at":"2026-08-06T17:25:03.102194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.165907Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.165907Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:384e3bc0cbf25526164f7fb97db980a85d4a2ab5fbe554bfa0d8e9416b822a82","observation_id":"feca1b01-2bc4-49a1-929f-a91e08a8e73c","resolution":{"observed_at":"2026-08-06T17:25:03.165907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.302810Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.302810Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:3f976ed6b3261d5acb7f1b9a803756c8f55fb19060ecb6e2c875ddf2fd361151","observation_id":"3b5a63ad-864c-4b81-8b8c-39a07aea3c32","resolution":{"observed_at":"2026-08-06T17:25:03.302810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.364311Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.364311Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:30995cb19b9e54039445b069e4cb36d95dcabf54586d7eac5b14f4c49180eafe","observation_id":"927f06b0-77f2-4c90-92f6-409d2d0df68b","resolution":{"observed_at":"2026-08-06T17:25:03.364311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.227147Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.227147Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:be90e32f64c632c11cfc3520e64e1c71349ddb4339097acc638e583b8a370845","observation_id":"ffe24d73-7390-4a0b-a6b7-4caa7816d88f","resolution":{"observed_at":"2026-08-06T17:25:03.227147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.977907Z","title":null,"venue":null,"work_id":"8a7019a3-f8d1-415b-9833-59ce088b12d7","year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.540147Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0c8020071ce687474cfafc8592558f813cdb7b44f041460dfe75b58641c1a234","observation_id":"e8373e8b-e056-492f-80bb-90ce06ed378c","resolution":{"observed_at":"2026-08-06T17:25:16.983529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.588931Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.588931Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:4c14ff1ad71a87b01e2c84e40b9ee95a134170ca2e68d23adc69f11d359534bd","observation_id":"ff2871f6-7f00-4fec-b15e-1122070beb8f","resolution":{"observed_at":"2026-08-06T17:25:03.588931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.427471Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.427471Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:43c941a95f7ebad309e4aa549c6966c21de89b64ad41cd83b1540f320f7c8f5b","observation_id":"f9a4101e-8e74-4986-9ee7-c2f07e1872c1","resolution":{"observed_at":"2026-08-06T17:25:03.427471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.698551Z","title":"Tjahjadi, Jiho Kim, Junpu Yu, Minji Park, Jiawen Zhang, Jon E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.698551Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:98eaab65905b8438c113eab891a96e73508a18eee2a51af2b6c58dea63cc0887","observation_id":"ed465ae8-478b-4b34-ae02-f8ca1c8cfc61","resolution":{"observed_at":"2026-08-06T17:25:03.698551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.943920Z","title":"Berg, Mohit Bansal, and Jingjing Liu","venue":null,"work_id":"d38f5fed-ac6d-4ee8-9866-8d0b59709692","year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.795379Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:30f6692c6f72c7d109663446cce271c9b4c350ec71d92caae516e03902b82e32","observation_id":"027e5776-0c0d-430d-b898-9377c948aaf5","resolution":{"observed_at":"2026-08-06T17:25:16.949022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.926514Z","title":null,"venue":null,"work_id":"8cd562e3-6dfb-4387-9103-73a81debbb3d","year":2020},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.846500Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:92898ff2f8111c013065de5415192338e47c664348d986e71f648cf0afd66589","observation_id":"729aedb8-f521-455d-ac0e-8001b19d9add","resolution":{"observed_at":"2026-08-06T17:25:16.932242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.960702Z","title":null,"venue":null,"work_id":"df25f0f2-82e0-474e-85f5-e4f0053a893f","year":1995},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.642406Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d6c80de36f881537b241bdea3d96c278fb2c6f86382f372fb12ed0e6cba779b6","observation_id":"e740b209-f309-4bbe-b8db-ccbc810355a3","resolution":{"observed_at":"2026-08-06T17:25:16.965071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:03.949629Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.949629Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:4e6150a95c346f02529855733862c14c19c168d061f2b9477000df5abd2b7a0e","observation_id":"5347e02a-2d4e-470a-89ec-5416681c5183","resolution":{"observed_at":"2026-08-06T17:25:03.949629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.885146Z","title":"Kane, and Patrick Carrington","venue":null,"work_id":"abb16457-4c8c-4f81-90ad-239c3562c1ff","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.007218Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:b5981711ae8a49b3d3484fcd0d30511dfa6c33ea5ce7a5507ee8fb83b9190829","observation_id":"dfc18a3c-2e65-4f33-be76-4b3e22b92499","resolution":{"observed_at":"2026-08-06T17:25:16.891361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.907800Z","title":"i choose assistive devices that save my face","venue":null,"work_id":"94310b9c-22aa-4ced-9e09-70aed863479f","year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:03.896409Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1c46317663be6f335d1a0ee92196c3d3ac36b1860f8a843e6d57cc590e6e89d6","observation_id":"cbeb94d8-e756-4c71-8320-b883c1353ae6","resolution":{"observed_at":"2026-08-06T17:25:16.915015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.294694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.294694Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:30700879d6a803b82c050544d08db189a8bb0551d93e548d1d3fba409bc1fb1e","observation_id":"3a4a6e69-02dd-4251-977c-3ff36d67af62","resolution":{"observed_at":"2026-08-06T17:25:04.294694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03942","last_updated":"2025-07-05T08:00:38Z","snapshot_observed_at":"2026-08-09T04:44:06.322374Z","submitted_at":"2025-07-05T08:00:38Z","title":"More than One Step at a Time: Designing Procedural Feedback for Non-visual Makeup Routines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03942","snapshot_observed_at":"2026-08-06T17:25:04.349340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.349340Z"},"links":{"cited_paper":"/paper/2507.03942","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:cc2875b10e0c01fe3c2690880dc7bc410ec875e15663d8488cc6afd03d8f84e8","observation_id":"598fa32d-cd47-4b84-aeb2-9971d954c14e","resolution":{"observed_at":"2026-08-06T17:25:04.349340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.057213Z","title":"In Proceedings of the CHI Conference on Human Factors in Computing Systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.057213Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:06be8780b0307417b2b5b27b0d7c54c472b1c274ebac4bf4ceea73410d21ae5b","observation_id":"8f8a1601-840c-45b6-bc5e-8d61dda551cc","resolution":{"observed_at":"2026-08-06T17:25:04.057213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.865633Z","title":"It feels like taking a gamble","venue":null,"work_id":"f975a1ab-d22a-4dde-b3ff-5df315e403d3","year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.451376Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:fa47df0d3f3d334eb11063c1995013339bf94990a7c9c7c294974fb721df5479","observation_id":"f98a9c36-ebcf-486a-a481-17677a35cffd","resolution":{"observed_at":"2026-08-06T17:25:16.871687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03330","last_updated":"2025-07-04T06:30:50Z","snapshot_observed_at":"2026-08-10T07:36:33.564047Z","submitted_at":"2025-07-04T06:30:50Z","title":"Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking","version":1},"cited_work":{"arxiv_id":"2507.03330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.03330","snapshot_observed_at":"2026-08-06T17:25:13.613561Z","title":"Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking","venue":"cs.AI","work_id":"bf181e8b-a305-4fc4-9989-e18a389211ca","year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.213855Z"},"links":{"cited_paper":"/paper/2507.03330","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:292604dd672f8232f8bd5a3d29af74f1793d344bbaa27fb11ea6220dc4052a3c","observation_id":"ba4b7e09-eda2-43a9-b692-2d0037201558","resolution":{"observed_at":"2026-08-06T17:25:13.737568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.845205Z","title":null,"venue":null,"work_id":"89cfc3d6-c4f7-4d8f-a95a-a18cf14fb8b8","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.561922Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:91d204d930c8472a96ff3e3d70f5b4038a2d8d94df356caa0ddb89777b82f2e3","observation_id":"85ac2032-6fb8-415a-ae4f-78448f653171","resolution":{"observed_at":"2026-08-06T17:25:16.851823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.806182Z","title":null,"venue":null,"work_id":"4ddb1666-618a-4507-b770-4310daf84342","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.655239Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8ae4ef9e96bc768f82578ced02183ad951013bde0743e3eb6f231c5a310e8dde","observation_id":"0eaa74a7-3e5e-4509-b126-3199f7d39acf","resolution":{"observed_at":"2026-08-06T17:25:16.829987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.403757Z","title":"It Feels Like Taking a Gamble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.403757Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:7c4d273904d2b9f9162812e0cdf50be822481bea2eb2a4bcbd4427031cd33050","observation_id":"1567feda-4e0b-4e52-8991-1aee61fc0775","resolution":{"observed_at":"2026-08-06T17:25:04.403757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.936392Z","title":"Inescapable","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.936392Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:65adb2ff33369ce3563ebce3bedf53b1759eef4391f5f4158369ba7dece02216","observation_id":"888dcb43-aa18-49f2-b380-8895c7b1548e","resolution":{"observed_at":"2026-08-06T17:25:04.936392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.500141Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.500141Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:45dcb249fed7bf6a9b588bcc7c43dd1b3e8f078ebdd5f0b1c075b566bd5f9b90","observation_id":"2d81fd1a-64bf-40a2-9d03-012c837b3c18","resolution":{"observed_at":"2026-08-06T17:25:04.500141Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.512456Z","title":null,"venue":null,"work_id":"b784a5e7-6a06-4591-a8ca-b2381b86e3b0","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.105358Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2748bfccf6ccef19f7f0222963a37d080e51f75a598898dea88cc60e8f19339f","observation_id":"d7f6cf18-5138-454d-8331-b54ededb9acc","resolution":{"observed_at":"2026-08-06T17:25:16.562269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.347724Z","title":null,"venue":null,"work_id":"eba73741-7f60-471a-980f-2e94fcc03e8c","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.255123Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1fe3bd69db99ee6a0fd02f706605cd1903d39363ca70ca3f0658d8e346e000f9","observation_id":"8914fe52-d31c-41b5-92ba-28ca6ad9d010","resolution":{"observed_at":"2026-08-06T17:25:16.406536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.491797Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.491797Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:fdf432b53bb33b3c5a9fded9a72b7faf89b891630ec213909fe3b24f12c1a7d3","observation_id":"681c653d-166b-4c8d-b51c-eb9a05d93b0c","resolution":{"observed_at":"2026-08-06T17:25:05.491797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.633664Z","title":null,"venue":null,"work_id":"4bc09904-07dc-42a5-851c-142c5dd248b7","year":2017},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.859371Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:87ccbb580f4081bbf07f3c08b3fefcb2e4109ad37cf763731bd8fb6add260371","observation_id":"263517d7-c38e-46bf-8843-80ce33e2fd86","resolution":{"observed_at":"2026-08-06T17:25:16.693759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.728789Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.728789Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:607008433b834b96b0d7f3b0af94207a83f7e9cffaa0ef90bb8a360a627f2ca1","observation_id":"cc652760-b79c-4997-bcfc-a2a6640c4006","resolution":{"observed_at":"2026-08-06T17:25:05.728789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.018995Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.018995Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:9f2fb3af77b2cef6ce761789569ee498c1f449a9e5d6020d7b9e694174bae4f7","observation_id":"5ddc7403-8271-4a08-b0e5-bc6d197e666a","resolution":{"observed_at":"2026-08-06T17:25:05.018995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-023-37678-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Nature Communications","work_id":"d92dda64-13bb-495a-90be-7b762b6e2509","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.952157Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:6232d5a4fa1f20639d3ddbd6a40506f5cde9d4f793b5604ee524ee7521cdccc8","observation_id":"aa3c0595-bcab-41b8-9269-548e87814749","resolution":{"observed_at":"2026-08-06T17:25:10.376951Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12181","last_updated":"2024-09-23T14:39:07Z","snapshot_observed_at":"2026-08-12T22:42:15.966467Z","submitted_at":"2024-09-18T17:53:17Z","title":"A Controlled Study on Long Context Extension and Generalization in LLMs","version":2},"cited_work":{"arxiv_id":"2409.12181","doi":"10.48550/arxiv.2409.12181","metadata_source":"pith","pith_arxiv_id":"2409.12181","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A Controlled Study on Long Context Extension and Generalization in LLMs","venue":"cs.CL","work_id":"165e8595-e314-4e2a-9e00-a7171742bd92","year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.037118Z"},"links":{"cited_paper":"/paper/2409.12181","citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a4c78874b5f1075f0d3ae352a32cbf5eba806bd65af18268fc8741d8a2fbef34","observation_id":"1fa3f1f0-81d7-48a9-8575-3ba5755f627a","resolution":{"observed_at":"2026-08-06T17:25:10.228596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.91006","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:11.848063Z","title":"Lucas, Zack Arambula, Alexandra M","venue":null,"work_id":"64f048fd-4b06-447a-ae46-2f128b58b4c2","year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.147092Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e3a712db97616ae4e508838fca853d5df2b74b35109bc8f0eb58e421d2b3144f","observation_id":"0599d479-366d-4d85-899b-b64d5bf02d14","resolution":{"observed_at":"2026-08-06T17:25:11.958521Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.learninstruc.2011.03.004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Learning and Instruction","work_id":"16101118-f124-43d2-ba43-714dc0bab44c","year":2011},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.235275Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:4c5e38beac390b8ede26bbc028ac071170691ddad85d995c0547f85e52be2346","observation_id":"6ec9ed3c-aabf-49c1-b102-b8b0b4e2babb","resolution":{"observed_at":"2026-08-06T17:25:10.082133Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3329168","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"ACM Computing Surveys","work_id":"abd1adfe-ca3b-4200-a469-cb4294bd204f","year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.398489Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:bcec7346e54d47cf249bcf0402d194eaeae6b9ce2a972208aae23b55ea9c5f81","observation_id":"fde5cb8a-fa55-474a-afc4-8561a9da08d8","resolution":{"observed_at":"2026-08-06T17:25:09.928864Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.596393Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.596393Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2167f720374f09c05c65cbace6bbebc88d93f1e7b304905b6d21e4cbc4e07e33","observation_id":"82ca866f-3c14-439b-9d2d-ea8485db7478","resolution":{"observed_at":"2026-08-06T17:25:05.596393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.29734","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:11.418522Z","title":null,"venue":null,"work_id":"f7f9e4c4-f406-45c3-a1e1-bf763d96ffb5","year":2020},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.694553Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:b025eab85eb757a85afedbe1ef55e7e9f21e7a86b45910911fced232aa5658cc","observation_id":"33c7c8e5-c392-4bf2-8186-e2ec04d4009f","resolution":{"observed_at":"2026-08-06T17:25:11.486194Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.850000Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.850000Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:3fa92cf10b3e2ff70eef8c053c6a99e5f0d596d59f5e6ff9e8b674044a8edb49","observation_id":"c75cc50a-faef-4694-bb83-7b5b3fb4ac47","resolution":{"observed_at":"2026-08-06T17:25:05.850000Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.174683Z","title":null,"venue":null,"work_id":"de8a5e1c-d369-464d-a6b9-c49a826cfe2a","year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.879122Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:4d73baacffb5fb528e6ed58d3c15dd869de8d087e4a3effa8b787cb68c68eaec","observation_id":"cee7d160-a5a7-48b1-9331-6b163cbecd53","resolution":{"observed_at":"2026-08-06T17:25:16.259802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2979.30316","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:11.067029Z","title":null,"venue":null,"work_id":"0ee89f6c-db0d-42b5-84e3-01ae1d304a20","year":1999},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.983300Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:ce874e16bf994b8208a0265e07fcff3dfc57a45c15638377456d8511f22db8ed","observation_id":"d4bf26e6-5df6-4768-a365-160026443a35","resolution":{"observed_at":"2026-08-06T17:25:11.123905Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:07.151350Z","title":"Patil, Don Kurian Dennis, Chirag Pabbaraju, Nadeem Shaheer, Har- sha Vardhan Simhadri, Vivek Seshadri, Manik Varma, and Prateek Jain","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.151350Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:704a6fcb78c2ae2ddda529068488d828dd1c2789886a000ec8e6d44b334234f0","observation_id":"35f4b78a-1fde-4634-82cc-4c578a378644","resolution":{"observed_at":"2026-08-06T17:25:07.151350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:07.325418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.325418Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:c725f55a22ca71f9e47be0dab2de7dd359ab129c814109c6d6af95acd92762ba","observation_id":"29fa071b-5e49-429a-ba19-c8054de455ff","resolution":{"observed_at":"2026-08-06T17:25:07.325418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:07.466492Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.466492Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:40cd315418c0e1a5fff212e33037e5207750824e3399f7004dd5937066c1d818","observation_id":"68331d32-ae4b-4ebd-ba9d-9d1dc7399eaf","resolution":{"observed_at":"2026-08-06T17:25:07.466492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ics.2005.05.215","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"International Congress Series","work_id":"bd21b5e8-bf47-47c8-a200-bed4d5d1b5a7","year":2005},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.677508Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:3322216f17da88c994cfbec9e956218d635f79a7b9f95268a000065e58bbef5c","observation_id":"eade4315-725b-43ca-ae1d-85479ec5fd14","resolution":{"observed_at":"2026-08-06T17:25:09.496909Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:06.806117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:06.806117Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:4074d8b00bd184a9c985a56e52306dafc19b26b15ad9ea828d11502e9bdcce11","observation_id":"724ab721-c160-4367-b3ff-05f98248caa8","resolution":{"observed_at":"2026-08-06T17:25:06.806117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.068972Z","title":"Turkstra, Tanya Bhatia, Alexa Van Os, and Michael Beyeler","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.068972Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:3d00b99e15ed8adc56012be77382790a2f9b7c43daff832b8bc0e709988de2b3","observation_id":"4af177f4-8916-4058-97a8-4523f6854279","resolution":{"observed_at":"2026-08-06T17:25:08.068972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.224488Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.224488Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:a9eec54e9e879c3bcc0af5230f66b73d53803ca30a094bf5bd833c6f1116bc0a","observation_id":"c71e65ef-35ee-4f99-8aa3-6fe1c5c0c1b2","resolution":{"observed_at":"2026-08-06T17:25:08.224488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.313878Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.313878Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2c08e24a246b25561233e8dec8d9a8be510bced7de41db749dc163dfd39b850b","observation_id":"7caabff4-9c67-4175-ac42-4b2ea542a64d","resolution":{"observed_at":"2026-08-06T17:25:08.313878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.417926Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.417926Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:e4141e606e46bcb72b9947a9f19849c713b0a5fa3c366bc8a782e8cedef847e9","observation_id":"7384a1fc-b7a4-40b6-a422-ab0e195801fe","resolution":{"observed_at":"2026-08-06T17:25:08.417926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/h0074898","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Psychological Review","work_id":"6c199512-26b6-4efa-b283-590b7695c1ec","year":1901},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.560765Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0c3da4f2719e509790e57e00978971060d79e0dfa9b3336c850fa99e58e1e64b","observation_id":"d8cb5eba-eae3-45ff-af30-b74b3f055e5b","resolution":{"observed_at":"2026-08-06T17:25:09.244133Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7763/ijmlc.2012.v2.137","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"International Journal of Machine Learning and Computing","work_id":"ae56fb6d-64e6-40de-9bc6-4187fadb1a30","year":2012},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.580017Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:706d50fad874877412418b2903789f5c0131a9f7d3e202191ac290dbd5423328","observation_id":"b6763879-42d7-4f0f-8013-d09fd98bdb45","resolution":{"observed_at":"2026-08-06T17:25:09.715157Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:15.742133Z","title":null,"venue":null,"work_id":"64af5196-6ba8-4e49-9e46-e7d23c62cb65","year":2025},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.918757Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f6ef08ab8885530e5d84e725a37ef007276b40c016146aac33eb9ce80d4755b4","observation_id":"03b7b14a-672a-4ea4-bc80-64691c558ca0","resolution":{"observed_at":"2026-08-06T17:25:15.799885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:16.046010Z","title":null,"venue":null,"work_id":"b496524c-350d-4473-80b0-fa018634c103","year":2016},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:07.940720Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:8aeb2292b8927c22f5f3495ecf6b58b05accb04740caa30399c19e76e35cd55e","observation_id":"3e76c7e0-dd61-4cb9-bed8-095493400775","resolution":{"observed_at":"2026-08-06T17:25:16.088091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:08.654557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.654557Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0ba29837bd9baf6b2a0822640ab308839f4e407f55224766ccbf88201e8cc9a8","observation_id":"2db8a4ff-90ee-4a45-ab0b-18dd6f25f62b","resolution":{"observed_at":"2026-08-06T17:25:08.654557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:09.031246Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:09.031246Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:2ba088d606a111cedff03ba820666c5dd1cb5843a681de0a538003ac4d0d52c1","observation_id":"f3820112-fe35-4f82-a377-fd428b87aa7f","resolution":{"observed_at":"2026-08-06T17:25:09.031246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.086371Z","title":"In Proceedings of the 33rd Annual ACM Conference on Human Factors in Computing Systems","venue":null,"work_id":"592dbf5f-236c-435a-92f3-a70417b1f896","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.540262Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:62d4ca564de043fa3f1f74b435f0a92c4d559ab4201d8c809c834668f4b4c246","observation_id":"569105e0-0e86-457b-a4d4-0f71fa3c9f07","resolution":{"observed_at":"2026-08-06T17:25:17.092332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:17.128115Z","title":"ACM Computing Surveys (CSUR)52, 6 (2019), 1–37","venue":null,"work_id":"34858ad7-c61b-4716-8299-ff7e5e8ed2fa","year":2019},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:01.321914Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:1d85ea0f3b5468520ac0b6fb16463a3d139c5caa0049f513a05b81d7bee3af25","observation_id":"793f6b96-a73f-49f3-b398-ef4b2943cbcd","resolution":{"observed_at":"2026-08-06T17:25:17.133290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1300.33833","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:12.435401Z","title":"In Proceedings of the 17th International Web for All Conference","venue":null,"work_id":"8e91c189-e0fc-4a81-97fb-910da84965e6","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.402104Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:d76c0137467af28228e5d1bbe882ddc2a34833ddb84db56a9d14385f9f6471ba","observation_id":"a4d18bba-9da3-46b0-9102-ee19a871a9fd","resolution":{"observed_at":"2026-08-06T17:25:12.595782Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:15.877362Z","title":"1686–1697","venue":null,"work_id":"8da6e539-b9c2-4379-be15-96a9932dc2bf","year":null},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:08.803114Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:7805f0f8438b7bb985d9ec10369b91e84fbbe7998035469115956995ad6879b8","observation_id":"c93cb481-2d0f-479b-a331-4e59dc690beb","resolution":{"observed_at":"2026-08-06T17:25:15.923745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:04.749570Z","title":"In 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:04.749570Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:f40af5cafc766bb8437261eff94e77f8960537e3f5f9932e099287b25af27e76","observation_id":"66427e06-7ab7-41b5-afaf-499cf8363d8c","resolution":{"observed_at":"2026-08-06T17:25:04.749570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:05.193500Z","title":"InProceedings of the 2023 CHI Conference on Human Factors in Computing Systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:05.193500Z"},"links":{"citing_paper":"/paper/2507.10963"},"observation_digest":"sha256:0efbb1458f0c0b0801e51bbf310c5ea3444570adfd6154a6f623519dee5c44df","observation_id":"b366b69d-1c64-45ee-adf0-bc8a8c15bb02","resolution":{"observed_at":"2026-08-06T17:25:05.193500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10963","last_updated":"2025-07-15T03:58:28Z","latest_version":1,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-12T00:31:02.585503Z","submitted_at":"2025-07-15T03:58:28Z","title":"AROMA: Mixed-Initiative AI Assistance for Non-Visual Cooking by Grounding Multi-modal Information Between Reality and Videos"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":2,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":55,"verified_exact":10,"verified_fuzzy":8},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2507.10963."}